这篇文章我们将详细介绍如何识别爬虫 ip。
我们在网站运营的时候,经常有各种各样的爬虫来光顾,有好的爬虫,例如:搜索引擎爬虫、营销类的爬虫、屏幕快照类爬虫、监控类爬虫、信息流类爬虫、链接检查类爬虫、工具类爬虫、速度测试类爬虫、漏洞类爬虫。恶意的爬虫,例如:抓取类爬虫、伪造爬虫等。
我们将爬虫分为两类,但也不是绝对的,有一些搜索引擎爬虫在国内没什么问题,但是在国外由于过度抓取,而被列入黑名单。而被站长加入黑名单,所以最终还是要根据自己的实际情况。
如何识别爬虫ip
我们经常在检查日志的时候,看到 User-agent 是爬虫的,但是 IP 不确定是不是这个爬虫的 IP,这个时候,我们需要查询爬虫的IP地址,我们可以直接到爬虫识别这个网站上查询。
首先我们点击首页上的爬虫查询,之后输入ip地址,就可以看到是不是真实的爬虫,下面是示例:
例如,我们输入:116.179.32.100就是百度蜘蛛的 IP 地址,截图如下:
同时还可以通过查询的结果始于什么类别,是否遵守 robots.txt 协议等,有了这样一个工具,伪造爬虫也逃不过你的火眼金睛。
例如:下面是一个伪造百度蜘蛛的 IP 地址,通过查询结果如下:
通过上图可以看出不仅查询出了伪造百度蜘蛛,还可以看到最近活跃时间,可以为站长提供很好的参考作用。
通过上面的方法查询之后,基本就可以检查出来爬虫的IP是否正确,即使伪造的爬虫IP也可以被我们精准识别出来。
搜索引擎爬虫类目下面也整理出了各种各样爬虫的 User-agent,这样站长通过 User-agent + 爬虫 IP 识别的方式,就可以检测爬虫。
总结
这篇文章主要介绍了如何通过爬虫识别这个工具精准识别爬虫,同时也介绍了如何查找各类爬虫的 UA(User-agent),为我们的网站运营如虎添翼。
神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试