python怎么解析网页

1,681次阅读

没有评论

python怎么解析网页

要理解python是如何解析网页的，首先要理解什么是解析器。

一、什么是网页解析器

1、网页解析器名词解释

首先让我们来了解下，什么是网页解析器，简单的说就是用来解析html网页的工具，准确的说：它是一个HTML网页信息提取工具，就是从html网页中解析提取出“我们需要的有价值的数据”或者“新的URL链接”的工具。

2、网页解析图解

python怎么解析网页

二、python网页解析器

1、常见的python网页

常见的python网页解析工具有：re正则匹配、python自带的html.parser模块、第三方库BeautifulSoup(重点学习)以及lxm库。

2、常见网页解析器分类

以上四种网页解析器，是两种不同类型的解析器：

（1）模糊匹配

re正则表达式即为字符串式的模糊匹配模式；

（2）结构化解析

BeatufiulSoup、html.parser与lxml为“结构化解析”模式，他们都以DOM树结构为标准，进行标签结构信息的提取。（）

python怎么解析网页

（3）结构化解析

我们在了解什么是结构化解析之前，需要先了解下什么是DOM树这个概念。

DOM树解释：即文档对象模型（Document Object Model），其树形标签结构，请见下图。

python怎么解析网页

而所谓结构化解析，就是网页解析器它会将下载的整个HTML文档当成一个Doucment对象，然后在利用其上下结构的标签形式，对这个对象进行上下级的标签进行遍历和信息提取操作。

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

发表于：Python基础教程

2020-01-02

复制链接

赏

python怎么解析网页

相关文章：

HTTP代理设置详解：一步步配置指南

什么是Socks5代理IP及其优势

Socks5代理配置教程及注意事项

什么是代理服务器IP：如何选择合适的

国外代理服务器的优势及选择建议

如何找到可靠的免费代理服务器

在线代理服务器的使用与推荐

HTTP代理服务器的设置及应用实例

静态代理IP怎么填写：步骤与示例

海外静态IP的代理选择与配置

HTTP代理服务器的设置及应用实例

海外静态IP的代理选择与配置

HTTP代理设置详解：一步步配置指南

静态代理IP怎么填写：步骤与示例

在线代理服务器的使用与推荐

国外代理服务器的优势及选择建议

如何找到可靠的免费代理服务器

Socks5代理配置教程及注意事项

动态与静态代理IP的区别解析

什么是代理服务器IP：如何选择合适的