python多页爬取数据 webscraper多页爬取

转载

数据分析大师 2024-01-22 12:24:15

文章标签 python多页爬取数据爬虫运维数据百度 文章分类 Python 后端开发

爬取步骤

创建站点

打开百度热点，ctrl+shit+i进入检测工具,打开web scraper创建站点

python多页爬取数据 webscraper多页爬取_爬虫

进入创建站点页面站点名称和爬取地址点击创建站点即可

如果要爬取分页数据那就将参数写成范围的如:

想要爬取微博某博主关注列表的1-5页的粉丝信息,通过url的跳转发现微博关注列表和<number>数字有关

https://weibo.com/p/1003061752021340/follow?relate=fans&page=<number>

所以只要把<number>写成一个范围的即可

https://weibo.com/p/1006051234552257/follow?relate=fans&page=[1-5]

python多页爬取数据 webscraper多页爬取_数据_02

爬取数据

首先创建一个element的select

python多页爬取数据 webscraper多页爬取_python多页爬取数据_03

创建element信息

python多页爬取数据 webscraper多页爬取_python多页爬取数据_04

select选择最外层的盒子,确认无误后点击Done selecting!

python多页爬取数据 webscraper多页爬取_运维_05

然后回到web scraper控制台,查看信息无误后勾选multiple确认无误后,创建element的select

python多页爬取数据 webscraper多页爬取_爬虫_06

爬取自己想要的信息,点击进入hotList里面,然后继续创建select选择

python多页爬取数据 webscraper多页爬取_python多页爬取数据_07

填写具体的select信息,并继续通过select来进行选择需要的数据

python多页爬取数据 webscraper多页爬取_运维_08

这时候页面的范围会变为黄色,鼠标移动到自己需要的信息处会有绿框将信息圈出来

python多页爬取数据 webscraper多页爬取_python多页爬取数据_09

点击确认后会变为红色的,再次选择相同的会自动识别将同样标签下的包围起来,确认是自己需要的信息后直接Done selecting!

python多页爬取数据 webscraper多页爬取_数据_10

再次转到web scraper的控制台后,确认无误即可保存

python多页爬取数据 webscraper多页爬取_数据_11

运行脚本,进行采集

python多页爬取数据 webscraper多页爬取_爬虫_12

默认配置即可,想修改也可以的,我一般直接默认的

python多页爬取数据 webscraper多页爬取_python多页爬取数据_13

点击开始脚本后,会将采集的页面弹出,采集完成右下角会出现提示,采集过程中点击refresh可以查看采集的数据

python多页爬取数据 webscraper多页爬取_python多页爬取数据_14

采集的数据

python多页爬取数据 webscraper多页爬取_python多页爬取数据_15

导出数据

确认数据没有错误,是自己需要的即可,进行下载,以csv格式导出

python多页爬取数据 webscraper多页爬取_爬虫_16

点击Downolad now!即可下载

python多页爬取数据 webscraper多页爬取_数据_17

python多页爬取数据 webscraper多页爬取_数据_18

数据内容

python多页爬取数据 webscraper多页爬取_数据_19

到这里使用web scraper进行数据采集就结束了

本文章为转载内容，我们尊重原作者对文章享有的著作权。如有内容错误或侵权问题，欢迎原作者联系我们进行内容更正或删除文章。

上一篇：随机变量期望 python 随机变量期望的定义

下一篇：maven setting选择JAVA版本 maven的setting配置

提问和评论都可以，用心的回复会被更多人看到评论

发布评论

相关文章

官方博客	全部文章	热门标签	班级博客
了解我们	网站地图	意见反馈

鸿蒙开发者社区	51CTO学堂
51CTO	软考资讯