python爬虫如何识别图片验证码

693次阅读

python爬虫如何识别图片验证码

爬虫真的像别人说的那么强大，可以获取很多信息，帮助或者参考别人的内容，补全自己吗？实际上确实是可以实现的，但是大家不了解的是，除了被动让爬虫去爬取，很多网站都可有主动防御技能，比如，现在跟大家说的图片验证问题，爬虫必须得去解决，不然没有办法可以进行下一步，解决操作如下所示：

1、先安装一个pytesseract

2、接着我们就打开一张图片，使用 pytesseract 识别。

python爬虫如何识别图片验证码

代码如下：

captcha = Image.open("captcha1.png")result = pytesseract.image_to_string(captcha)print(result)

输出结果：没有问题。

3、我们在试试其他图片，如下所示

python爬虫如何识别图片验证码

代码所示：

captcha = Image.open("claptcha2.png")result = pytesseract.image_to_string(captcha)print(result)

处理结果是有问题，也许是pytesseract没有办法处理噪点比较大的内容。

4、首先进行图片灰度处理

captcha = Image.open("captcha2.png")result = captcha.convert('L')result.show()

5、在进行二值化

def convert_img(img,threshold):    img = img.convert("L")  # 处理灰度    pixels = img.load()    for x in range(img.width):        for y in range(img.height):            if pixels[x, y] > threshold:                pixels[x, y] = 255            else:                pixels[x, y] = 0    return img

6、调用一下

convert_img(captcha,150）

7、之后再跟第一个图片处理方式一样，就可以解决了哦~

好啦，一般情况下，第一种方式，几行代码就可以处理完成，还有一些情况可以调用第二种方式。

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

发表于：Python爬虫

2021-05-24

复制链接

赏

python爬虫如何识别图片验证码

相关文章：

HTTP代理设置详解：一步步配置指南

什么是Socks5代理IP及其优势

Socks5代理配置教程及注意事项

什么是代理服务器IP：如何选择合适的

国外代理服务器的优势及选择建议

如何找到可靠的免费代理服务器

在线代理服务器的使用与推荐

HTTP代理服务器的设置及应用实例

静态代理IP怎么填写：步骤与示例

海外静态IP的代理选择与配置