Python爬虫实战之爬取携程评论

作者:程序员启航 时间:2022-02-03 14:26:23 

一、分析数据源

这里的数据源是指html网页?还是Aajx异步。对于爬虫初学者来说,可能不知道怎么判断,这里辰哥也手把手过一遍。

提示:以下操作均不需要登录(当然登录也可以)

咱们先在浏览器里面搜索携程,然后在携程里面任意搜索一个景点:长隆野生动物世界,这里就以长隆野生动物世界为例,讲解如何去爬取携程评论数据。

 Python爬虫实战之爬取携程评论

页面下方则是评论数据

 Python爬虫实战之爬取携程评论

Python爬虫实战之爬取携程评论 Python爬虫实战之爬取携程评论

从上面两张图可以看出,点击评论下一页,浏览器的链接没有变化,说明数据是Ajax异步请求。因此我们就找到了数据是异步加载过来的,这时候需要去network里面是查看数据包

二、分析数据包

在network中找到下面这个数据包

 Python爬虫实战之爬取携程评论

查看Preview里面的内容(请求返回内容)

Python爬虫实战之爬取携程评论

可以看到数据已经请求到了,下面看一下数据是否是正确的(和网页内容一致)。

 Python爬虫实战之爬取携程评论

ok,没问题之后,下面开始编写Python程序去请求数据。

1.请求地址

Python爬虫实战之爬取携程评论

可以获取到请求链接和请求方式。

Python爬虫实战之爬取携程评论

这里请求不用添加请求头header也是可以的。其中postUrl是请求链接,data_1是请求参数。

2.请求参数

在network里可以看到请求参数

Python爬虫实战之爬取携程评论

在程序中的构建如下:

Python爬虫实战之爬取携程评论

其中需要关注的是arg中的pageIndex(页数),pageSize(每页条数)。

Python爬虫实战之爬取携程评论

最终结果如下:

Python爬虫实战之爬取携程评论

该景点的评论就可以成功爬取下来了。

三、采集全部评论

上面只是采集了第一页的评论数据,通过改变arg中的pageIndex(页数),就可以遍历爬取全部的评论。

Python爬虫实战之爬取携程评论

比如这个景点一共是300页。现在把循环给加上

最终的完整代码如下:

Python爬虫实战之爬取携程评论

来源:https://blog.csdn.net/aaahtml/article/details/117325495

标签:Python,爬取,携程评论
0
投稿

猜你喜欢

  • Python爬虫入门教程01之爬取豆瓣Top电影

    2023-05-22 16:45:00
  • 学习ASP.NET八天入门:第七天

    2007-08-07 13:52:00
  • PHP格式化显示时间date()函数代码

    2023-06-10 17:55:01
  • 实例详解Python的进程,线程和协程

    2023-08-22 23:32:33
  • MySQL启动连接的命令以及与PHP程序连接的基本语法

    2023-11-14 22:27:26
  • python PyQt5 爬虫实现代码

    2022-10-19 20:24:42
  • Python基于scrapy采集数据时使用代理服务器的方法

    2022-06-03 08:37:04
  • php获取当前时间的毫秒数的方法

    2023-06-28 06:43:37
  • python处理RSTP视频流过程解析

    2023-11-22 00:54:55
  • sql server海量数据库的查询优化及分页算法方案

    2010-07-02 21:17:00
  • 课程讲解 如何使用SQL Server校勘功能

    2009-01-13 13:27:00
  • Python进程的通信Queue、Pipe实例分析

    2021-11-22 13:50:44
  • python 调用有道api接口的方法

    2021-11-18 18:51:16
  • 详解Python 中的容器 collections

    2021-09-12 07:11:38
  • 利用Python的Django框架中的ORM建立查询API

    2023-11-15 10:06:03
  • IE中伪类:hover的使用及BUG

    2007-05-11 17:04:00
  • 推荐一篇不错的新手asp编程的基本法则

    2011-04-15 11:08:00
  • php将ppt转jpg图片的具体步骤代码

    2023-06-12 21:53:33
  •  分享Python 中的 7 种交叉验证方法

    2023-09-18 19:10:33
  • 如何实现论坛的树状记录表展开技术?

    2010-05-19 21:37:00
  • asp之家 网络编程 m.aspxhome.com