selenium如何处理iframe作用域问题

819次阅读

在使用python进行爬虫操作的过程中，一般为了防止爬虫，会使用iframe，但是由于iframe有限制，iframe是前端内嵌页面，访问域名与主网页不同，所以有时会得到不自己想要的数据。本文针对抓包工具定位没有定位到iframe中的小的html中提供解决方法。

以文本块生成xpath为/html/body/text()，根据xpath进行如下代码编写。

#!/user/bin/
# -*- coding:UTF-8 -*-
# Author:Master

from selenium import webdriver
import time

driver = webdriver.Chrome(executable_path="./chromedriver")
driver.get('https://www.runoob.com/try/runcode.php?filename=HelloWorld&type=python3')
time.sleep(2)
text = driver.find_element_by_xpath('/html/body').text
print(text)
time.sleep(5)
driver.quit()

得到结果

selenium如何处理iframe作用域问题

原因分析

当我们打开抓包工具定位到Hello, World!文本的时候会发现，该文本是在一个iframe中。这样的话我们xpath所定位到的内容则是大的html中的路径。我们需要的内容则是在iframe中的小的html中。

解决方法

通过分析发现，想要解决问题的实质就是改变作用域。通过switch_to.frame(‘id’)方法来改变作用域就可以了。

重新编写代码：

#!/user/bin/
# -*- coding:UTF-8 -*-
# Author:Master

from selenium import webdriver
import time

driver = webdriver.Chrome(executable_path="./chromedriver")
driver.get('https://www.runoob.com/try/runcode.php?filename=HelloWorld&type=python3')
time.sleep(2)
driver.switch_to.frame('iframeResult')
text = driver.find_element_by_xpath('/html/body').text
print(text)
time.sleep(5)
driver.quit()

运行结果

selenium如何处理iframe作用域问题

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

发表于：Python爬虫

2021-07-18

# selenium

复制链接

赏

selenium如何处理iframe作用域问题

相关文章：

HTTP代理设置详解：一步步配置指南

什么是Socks5代理IP及其优势

Socks5代理配置教程及注意事项

什么是代理服务器IP：如何选择合适的

国外代理服务器的优势及选择建议

如何找到可靠的免费代理服务器

在线代理服务器的使用与推荐

HTTP代理服务器的设置及应用实例

静态代理IP怎么填写：步骤与示例

海外静态IP的代理选择与配置