识别IP是否为蜘蛛有几种不同的方式,分别是:
一、查看UA
1、查看UA,如果UA都不对,可以直接判断非百度搜索的蜘蛛,目前百度对外公布过的UA是:
移动UA:Mozilla/5.0 (Linux;u;Android 4.2.2;zh-cn;) AppleWebKit/534.46 (KHTML,likeGecko) Version/5.1 Mobile Safari/10600.6.3 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)
PC UA:Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)
其中还包括新增渲染UA:
移动UA:Mozilla/5.0 (iPhone; CPU iPhone OS 9_1 likeMac OS X)AppleWebKit/601.1.46 (KHTML, like Gecko) Version/9.0 Mobile/13B143 Safari/601.1 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)
PC UA:Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)
二、反查IP
可以通过DNS反查IP的方式判断某只spider是否来自百度搜索引擎。根据平台不同验证方法不同,如linux/windows/os三种平台下的验证方法分别如下:
1.linux:
以*.baidu.com 或 *.baidu.jp 的结尾格式命名是百度的蜘蛛,非 *.baidu.com 或 *.baidu.jp 即为冒充。检索指令:host xx.xxx.xxx.xxx
2.win:
win系统下使用nslookup ip命令反解ip来 判断是否来自Baiduspider的抓取。 以*.baidu.com 或 *.baidu.jp 的结尾格式命名是百度的蜘蛛,非 *.baidu.com 或 *.baidu.jp 即为冒充。检索指令:nslookup xx.xx.xx.xx
3.mac
在mac os平台下,可以使用dig 命令反解ip来 判断是否来自Baiduspider的抓取。 以*.baidu.com 或 *.baidu.jp 的结尾格式命名是百度的蜘蛛,非 *.baidu.com 或 *.baidu.jp 即为冒充。检索指令:dig xx.xx.xx.xx
参考百度资源平台整理。