如何检测爬虫 IP

699次阅读
没有评论

这篇文章我们将详细介绍如何识别爬虫 ip。

我们在网站运营的时候,经常有各种各样的爬虫来光顾,有好的爬虫,例如:搜索引擎爬虫、营销类的爬虫、屏幕快照类爬虫、监控类爬虫、信息流类爬虫、链接检查类爬虫、工具类爬虫、速度测试类爬虫、漏洞类爬虫。恶意的爬虫,例如:抓取类爬虫、伪造爬虫等。

我们将爬虫分为两类,但也不是绝对的,有一些搜索引擎爬虫在国内没什么问题,但是在国外由于过度抓取,而被列入黑名单。而被站长加入黑名单,所以最终还是要根据自己的实际情况。

如何识别爬虫ip

我们经常在检查日志的时候,看到 User-agent 是爬虫的,但是 IP 不确定是不是这个爬虫的 IP,这个时候,我们需要查询爬虫的IP地址,我们可以直接到爬虫识别这个网站上查询。

首先我们点击首页上的爬虫查询,之后输入ip地址,就可以看到是不是真实的爬虫,下面是示例:

例如,我们输入:116.179.32.100就是百度蜘蛛的 IP 地址,截图如下:

如何检测爬虫

同时还可以通过查询的结果始于什么类别,是否遵守 robots.txt 协议等,有了这样一个工具,伪造爬虫也逃不过你的火眼金睛。

例如:下面是一个伪造百度蜘蛛的 IP 地址,通过查询结果如下:

如何检测爬虫

通过上图可以看出不仅查询出了伪造百度蜘蛛,还可以看到最近活跃时间,可以为站长提供很好的参考作用。

通过上面的方法查询之后,基本就可以检查出来爬虫的IP是否正确,即使伪造的爬虫IP也可以被我们精准识别出来。

搜索引擎爬虫类目下面也整理出了各种各样爬虫的 User-agent,这样站长通过 User-agent + 爬虫 IP 识别的方式,就可以检测爬虫。

总结

这篇文章主要介绍了如何通过爬虫识别这个工具精准识别爬虫,同时也介绍了如何查找各类爬虫的 UA(User-agent),为我们的网站运营如虎添翼。

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

相关文章:

版权声明:Python教程2022-10-27发表,共计730字。
新手QQ群:570568346,欢迎进群讨论 Python51学习