关于网络爬虫的一些基础知识

转载

wx5b6d79e9dddac 2021-07-13 14:21:57

什么是网络爬虫，百度百科是这么定义的

网络爬虫（又被称为网页蜘蛛，网络机器人，在FOAF社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。以下简称爬虫

爬虫作为一种自动化工具去代替人工操作，以此来节省成本和时间，爬虫不是乱爬，一个没有规则爬虫是没有存活的价值的，需要明确爬取的目标这样才能体现爬虫的价值，一般我们需要人为的设定一些规则，让爬虫按照这个规则去爬取。这里我从网络上找到了关于爬虫的几个分类

常见优秀网络爬虫有以下几种类型：

1.批量型网络爬虫：限制抓取的属性，包括抓取范围、特定目标、限制抓取时间、限制数据量以及限制抓取页面，总之明显的特征就是受限；
2.增量型网络爬虫（通用爬虫）：与前者相反，没有固定的限制，无休无止直到抓完所有数据。这种类型一般应用于搜索引擎的网站或程序；
3.垂直网络爬虫（聚焦爬虫）：简单的可以理解为一个无限细化的增量网络爬虫，可以细致的对诸如行业、内容、发布时间、页面大小等很多因素进行筛选。

以上内容来自:https://www.douban.com/note/608049857/

另外除了这些分类外还经常听到爬虫的搜索方式:

广度优先搜索

　　整个的广度优先爬虫过程就是从一系列的种子节点开始，把这些网页中的"子节点"(也就是超链接)提取出来，放入队列中依次进行抓取。被处理过的链接需要放入一张表(通常称为Visited表)中。每次新处理一个链接之前，需要查看这个链接是否已经存在于Visited表中。如果存在，证明链接已经处理过，跳过，不做处理，否则进行下一步处理。（这里也就是我们后面提到的爬虫URL管理模块）
关于该算法的优点，主要原因有三点：
重要的网页往往离种子比较近，我们在刷新闻网址的时候一般都是热门信息出现在比较显眼的位置，随着阅读的深入会发现，获取到的信息价值也大不如从前，
万维网的实际深度最多能达到17层，但到达某个网页总存在一条很短的路径。而广度优先遍历会以最快的速度到达这个网页。
广度优先有利于多爬虫的合作抓取，多爬虫合作通常先抓取站内链接，抓取的封闭性很强。

深度优先搜索

深度优先搜索是一种在开发爬虫早期使用较多的方法。它的目的是要达到被搜索结构的叶结点(即那些不包含任何超链的HTML文件) 。在一个HTML文件中，当一个超链被选择后，被链接的HTML文件将执行深度优先搜索，即在搜索其余的超链结果之前必须先完整地搜索单独的一条链。深度优先搜索沿着HTML文件上的超链走到不能再深入为止，然后返回到某一个HTML文件，再继续选择该HTML文件中的其他超链。当不再有其他超链可选择时，说明搜索已经结束。优点是能遍历一个Web 站点或深层嵌套的文档集合；缺点是因为Web结构相当深,，有可能造成一旦进去，再也出不来的情况发生，所以一般指定一个最大的深度。

最后说一下一个爬虫一般都有哪些模块

URL管理模块：维护已经爬取的URL集合和未爬取的URL集合，并提供获取新URL链接的接口

HTML下载模块：从URL管理器中获取未爬取的URL链接并下载HTML网页

HTML解析模块：从HTML下载器下载的网页内容解析出新的URL交给URL管理器，解析出有效数据给到数据存储器，常用lxml、xpath、re正则

数据存储模块：将HTML解析器解析出来的数据通过文件或数据库的形式存储起来

爬虫调度模块：负责统筹调度其他四个模块的协调工作