python 获取携程酒店 python爬取携程数据

转载

云端梦想家 2024-01-23 22:17:29

文章标签 python 获取携程酒店携程ajax 数据请求参数搜索 文章分类 Python 后端开发

一、分析数据源

这里的数据源是指html网页？还是Aajx异步。对于爬虫初学者来说，可能不知道怎么判断，这里辰哥也手把手过一遍。

提示：以下操作均不需要登录(当然登录也可以)

咱们先在浏览器里面搜索携程，然后在携程里面任意搜索一个景点：长隆野生动物世界，这里就以长隆野生动物世界为例，讲解如何去爬取携程评论数据。

python 获取携程酒店 python爬取携程数据_数据

页面下方则是评论数据

python 获取携程酒店 python爬取携程数据_搜索_02

python 获取携程酒店 python爬取携程数据_携程ajax_03

python 获取携程酒店 python爬取携程数据_携程ajax_04

从上面两张图可以看出，点击评论下一页，浏览器的链接没有变化，说明数据是Ajax异步请求。因此我们就找到了数据是异步加载过来的，这时候需要去network里面是查看数据包。

二、分析数据包

在network中找到下面这个数据包

python 获取携程酒店 python爬取携程数据_python 获取携程酒店_05

查看Preview里面的内容(请求返回内容)

python 获取携程酒店 python爬取携程数据_python 获取携程酒店_06

可以看到数据已经请求到了，下面看一下数据是否是正确的(和网页内容一致)。

python 获取携程酒店 python爬取携程数据_python 获取携程酒店_07

ok，没问题之后，下面开始编写Python程序去请求数据。

1.请求地址

python 获取携程酒店 python爬取携程数据_携程ajax_08

可以获取到请求链接和请求方式。

python 获取携程酒店 python爬取携程数据_数据_09

这里请求不用添加请求头header也是可以的。其中postUrl是请求链接，data_1是请求参数。

2.请求参数

在network里可以看到请求参数

python 获取携程酒店 python爬取携程数据_搜索_10

在程序中的构建如下：

python 获取携程酒店 python爬取携程数据_python 获取携程酒店_11

其中需要关注的是arg中的pageIndex(页数)，pageSize(每页条数)。

python 获取携程酒店 python爬取携程数据_搜索_12

最终结果如下：

python 获取携程酒店 python爬取携程数据_数据_13

该景点的评论就可以成功爬取下来了。

三、采集全部评论

上面只是采集了第一页的评论数据，通过改变arg中的pageIndex(页数)，就可以遍历爬取全部的评论。

python 获取携程酒店 python爬取携程数据_请求参数_14

比如这个景点一共是300页。现在把循环给加上

最终的完整代码如下：

python 获取携程酒店 python爬取携程数据_数据_15

到此这篇关于Python爬虫实战之爬取携程评论的文章就介绍到这了

本文章为转载内容，我们尊重原作者对文章享有的著作权。如有内容错误或侵权问题，欢迎原作者联系我们进行内容更正或删除文章。

上一篇：wps python函数 wps python函数图像

下一篇：Linux上结束全部的java程序 linux中如何结束进程

提问和评论都可以，用心的回复会被更多人看到评论

发布评论

相关文章

官方博客	全部文章	热门标签	班级博客
了解我们	网站地图	意见反馈

鸿蒙开发者社区	51CTO学堂
51CTO	软考资讯

python 获取携程酒店 python爬取携程数据

python 获取携程酒店 python爬取携程数据

51CTO博客