Selenium 模拟浏览器动态加载页面的实现方法

作者:mmc2015 时间:2023-06-04 11:06:54 

相信爬取大公司的数据时,常常会遇到页面信息动态加载的问题,

如果仅仅使用content = urllib2.urlopen(URL).read(),估计信息是获取不全的,这时候就需要模拟浏览器加载页面的过程,

selenium提供了方便的方法,我也是菜鸟,试了很多种方式,下面提供觉得最靠谱的(已经证明对于爬取新浪微博的topic、twitter under topic完全没问题)。

至于下面的browser变量是什么,看前面的几篇文章。

首先是请求对应的URL:


right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App)
print right_URL
try:
browser.get(right_URL)
print "loading more, sleep 3 seconds ... 0"
time.sleep(3) # NO need for this sleep, but we add ...
browser = selenuim_loading_more(browser, method_index=0)
except:
print "one exception happen ==> get_tweeter_under_topic 2 ..."
pass

然后模拟浏览器,加载更多(推荐使用method_index=0,已经证明比其他好用很多):


def selenuim_loading_more(browser, method_index=0):
 if method_index==0:
   browser.implicitly_wait(3) # 为了快速滑动,先设置超时时间为1秒
   # while True:
   for i in range(1, 4): # at most 3 times
     print "loading more, window.scrollTo bettom for the", i,"time ..."
     browser.execute_script("window.scrollTo(0,document.body.scrollHeight);")
     try:
       # 定位页面底部的换页tab
       browser.find_element_by_css_selector("div[class='W_pages']")
       break # 如果没抛出异常就说明找到了底部标志,跳出循环
     except NoSuchElementException:
       pass # 抛出异常说明没找到底部标志,继续向下滑动
   browser.implicitly_wait(4) # 将超时时间改回10秒
 elif method_index==1:
   browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
   print "loading more, sleep 4 seconds ... 1"
   time.sleep(4)
   browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
   print "loading more, sleep 3 seconds ... 2"
   time.sleep(2)
 elif method_index==2:
   load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more        
   ActionChains(browser).click(load_more_1).perform()
   print "loading more, sleep 4 seconds ... 1"
   time.sleep(4)
   load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more        
   ActionChains(browser).click(load_more_2).perform()
   print "loading more, sleep 3 seconds ... 2"
   time.sleep(2)
 elif method_index==3:
   print "loading more, sleep 4 seconds ... 1"
   element = WebDriverWait(browser, 4).until(
     EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
   )
   element.click()
   print "loading more, sleep 2 seconds ... 2"
   WebDriverWait(browser, 2).until(
     EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
   ).click()
 return browser

来源:https://blog.csdn.net/mmc2015/article/details/53366452

标签:Selenium,动态加载页面
0
投稿

猜你喜欢

  • 详解OpenCV-Python Bindings如何生成

    2021-03-26 17:33:52
  • Python使用django搭建web开发环境

    2021-02-21 06:37:32
  • Lost connection to MySQL server at 'reading authorization packet', system error: 0

    2024-01-20 19:06:26
  • PHP中文件读、写、删的操作(PHP中对文件和目录操作)

    2023-11-22 06:03:23
  • CSS执行顺序与优先权的问题

    2010-08-23 16:21:00
  • PHP实现表单处理方法详解

    2023-05-25 07:39:18
  • 微信小程序仿朋友圈发布动态功能

    2024-04-17 10:01:01
  • Mybatis出现ORA-00911: invalid character的解决办法

    2024-01-19 02:41:21
  • python递归函数求n的阶乘,优缺点及递归次数设置方式

    2022-12-08 16:17:08
  • 详细解读Python中的__init__()方法

    2023-03-25 17:10:27
  • python 将大文件切分为多个小文件的实例

    2021-05-23 23:32:02
  • JavaScript正则表达式的贪婪匹配和非贪婪匹配

    2024-04-30 09:53:01
  • python 使用xlsxwriter循环向excel中插入数据和图片的操作

    2023-01-30 15:08:47
  • mysql中datetime类型设置默认值方法

    2024-01-17 03:03:09
  • Python实现的对本地host127.0.0.1主机进行扫描端口功能示例

    2021-05-13 08:43:23
  • Orcas中C#语言的新特性:自动属性,对象初始化器,和集合初始化器

    2007-09-23 12:43:00
  • Python OpenCV 直方图的计算与显示的方法示例

    2022-10-15 07:36:24
  • Pyorch之numpy与torch之间相互转换方式

    2022-02-09 14:50:00
  • 使用OpenCV为图像加水印的教程

    2022-08-17 10:24:33
  • VS 2008的性能改进

    2007-10-07 21:42:00
  • asp之家 网络编程 m.aspxhome.com