python爬虫实现爬取同一个网站的多页数据的实例讲解

作者：宋宋大人时间：2021-04-11 13:52:09　

对于一个网站的图片、文字音视频等，如果我们一个个的下载，不仅浪费时间，而且很容易出错。Python爬虫帮助我们获取需要的数据，这个数据是可以快速批量的获取。本文小编带领大家通过python爬虫获取获取总页数并更改url的方法，实现爬取同一个网站的多页数据。

一、爬虫的目的

从网上获取对你有需要的数据

二、爬虫过程

1、获取url（网址）。

2、发出请求，获得响应。

3、提取数据。

4、保存数据。

三、爬虫功能

可以快速批量的获取想要的数据，不用手动的一个个下载(图片、文字音视频等)

四、使用python爬虫爬取同一网站多页数据

1、需要定位至该标签并获得总页数

def get_page_size(soup):
pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav')
pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a')
for i in pcxt1[:-1]:
link=i.get('href')
s=str(i)
page=re.sub('<a href="','',s)
page1=re.sub(link,'',page)
page2=re.sub('">','',page1)
page3=re.sub('</a>','',page2)
pagesize=int(page3)
print(pagesize)
return pagesize
Pass

2、更改url来访问网址，也就是进行主函数的编写

if __name__ == '__main__':
url="http://www.sheknows.com/baby-names/browse/a/"
soup=get_requests(url)
page=get_page_size(soup)
for i in range(1,page+1):
url1=url+"page/"+str(i)+"/"
soup1=get_requests(url1)
draw_base_list(soup1)

实例扩展：

import requests
from lxml import etree
import re

url="https://movie.douban.com/top250"
header = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.130 Safari/537.36"}

allMovieList=[]
flag = True
while flag:
html = requests.get(url, headers=header).text
list = etree.HTML(html)
lis = list.xpath('//ol[@class="grid_view"]/li')
for oneSelector in lis:
name = oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0]
score = oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0]
people = oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0]
people = re.findall("(.*?)人评价",people)[0]
oneMovieList = [name,score,people]
allMovieList.append(oneMovieList)
#获取下一页地址
try:
next_url = list.xpath('//span[@class="next"]/a/@href')[0]
if next_url:
url = "https://movie.douban.com/top250"+ next_url
except:
flag = False
print(allMovieList)

来源：https://www.py.cn/toutiao/23021.html

标签：python爬虫,多页数据

投稿

python爬虫实现爬取同一个网站的多页数据的实例讲解

一、爬虫的目的

二、爬虫过程

三、爬虫功能

四、使用python爬虫爬取同一网站多页数据

猜你喜欢

详解CentOS升级Python2.6到Python2.7并安装pip

python装饰器decorator介绍

Python实现名片管理系统

详解OpenCV中直方图,掩膜和直方图均衡化的实现

表单设计中的网页视觉体验

Python+Opencv实现表格边框线检测

python不同版本的_new_不同点总结

django的登录注册系统的示例代码

详解python里使用正则表达式的全匹配功能

Python基于socket实现TCP客户端和服务端

如何使用Python实现斐波那契数列

Python calendar模块详情

NumPy实现多维数组中的线性代数

Python PyInstaller安装和使用教程详解

canvas实现手机端用来上传用户头像的代码

用Python画圣诞树代码示例

Python中Proxypool库的安装与配置

PHP采集静态页面并把页面css,img,js保存的方法

python实现双色球随机选号

详解Python中的多线程编程