python为什么要反爬虫

408次阅读
没有评论

python为什么要反爬虫

马上到年底了,现在开始考虑买车票的问题已经不算早了,毕竟临到关头一票难求的现象大家都有所体会。在早些年的时候,会有黄牛排队的出现,现在已经少了很多。不过买票已经从线下转移到了线上,余票的监控用爬虫也是可以实现的。但是当票数供应紧张地时候,我们就需要一些反爬虫的措施了。本篇文章小编以我们平时购票的12306为例,讲讲为什么需要进行反爬虫的操作。

 

爬虫也分善恶。

像谷歌这样的搜索引擎爬虫,每隔几天对全网的网页扫一遍,供大家查阅,各个被扫的网站大都很开心。这种就被定义为「善意爬虫」。

但是,像抢票软件这样的爬虫,对着 12306 每秒钟恨不得撸几万次。铁总并不觉得很开心。这种就被定义为「恶意爬虫」。(注意,抢票的你觉得开心没用,被扫描的网站觉得不开心,它就是恶意的。)

 

给大家看一张图:

 

python为什么要反爬虫

 

这张图里显示的,就是各行各业被爬「叨扰」的比例。(注意,这张图显示是全世界)

你可能会问:为什么 12306不能大方地让爬虫随意爬呢?

那大家知道每年过年之前,12306 被点成什么样了吗?公开数据是这么说的:「最高峰时 1 天内页面浏览量达 813.4 亿次,1 小时最高点击量 59.3 亿次,平均每秒 164.8 万次。」这还是加上验证码防护之后的数据。可想而知被拦截在外面的爬虫还有多少。

况且这里还没有讨论,被抢票软件把票抢走,对我们父母那样的不会抢票的人来说,是不是公平呢?

所以我们在买票时多了验证码的步骤,这就是铁路对于爬虫的应对措施:

python为什么要反爬虫

看完小伙伴们就明白了,我们之前吐槽过一些不好点,又重复试验成功的验证码为什么要在购票软件中加入。这其实也是为了我们创造良好的购票环境作出了贡献。不得不说,有时候还是要采取一定的反爬虫措施的。

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

相关文章:

版权声明:wuyou2021-05-23发表,共计698字。
新手QQ群:570568346,欢迎进群讨论 Python51学习