Python爬虫之页面解析和数据处理 - Python基础教程

国外IP代理推荐：
IPIPGO|全球住宅代理IP（>>>点击注册免费测试<<<）
LoongProxy|全球静态代理IP（>>>点击注册免费测试<<<）
神龙海外|全球动态代理IP（>>>点击注册免费测试<<<）
国内IP代理推荐：
天启|企业级代理IP（>>>点击注册免费测试<<<）
神龙|纯净稳定代理IP（>>>点击注册免费测试<<<）
全民|优质代理IP（>>>点击注册免费测试<<<）

Python爬虫之页面解析和数据处理

1,549次阅读

页面解析和数据处理

爬虫一共就四个主要步骤：

1.明确目标 (要知道你准备在哪个范围或者网站去搜索)

2.爬 (将所有的网站的内容全部爬下来)

3.取 (去掉对我们没用处的数据)

4.处理数据（按照我们想要的方式存储和使用）

一般来讲对我们而言，需要抓取的是某个网站或者某个应用的内容，提取有用的价值。内容一般分为两部分，非结构化数据和结构化数据。

非结构化数据：先有数据，再有结构。

结构化数据：先有结构，再有数据。

1.非结构化的数据处理

1.文本、电话号码、邮箱地址  
　　　　-->正则表达式
2.HTML文件   
　　　　 -->正则表达式，XPath,CSS选择器

2.结构化的数据处理

1.JSON文件 
　　　　-->JSON Path
　　　　-->转化成python类型进行操作
2.XML文件
　　　　-->转化成python类型（xmltodict）
　　　　-->XPath
　　　　-->CSS选择器
　　　　-->正则表达式

相关推荐：

Python爬虫正则表达式如何使用

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

发表于：Python爬虫

2019-12-29

复制链接

赏

相关文章：

版权声明：由wuyou2019-12-29发表，共计426字。

新手QQ群：570568346，欢迎进群讨论

Python51学习

国外IP代理推荐：
IPIPGO|全球住宅代理IP（>>>点击注册免费测试<<<）
LoongProxy|全球静态代理IP（>>>点击注册免费测试<<<）
神龙海外|海外动态代理IP（>>>点击注册免费测试<<<）
国内IP代理推荐：
天启|企业级代理IP（>>>点击注册免费测试<<<）
神龙|纯净稳定代理IP（>>>点击注册免费测试<<<）
全民|国内代理IP（>>>点击注册免费测试<<<）

用node实现简单的爬虫案例

python爬虫开源项目如何登陆知乎

python爬虫第三方库有哪些

如何设计一款地震高岗一派溪山千古秀的反爬虫？

python怎么判断两个数字是否相等

python的不等于号是什么

天启|企业级代理IP免费测试>>>>>神龙|纯净稳定代理IP免费测试>>>>>IPIPGO|全球住宅代理IP免费测试>>>>>神龙海外|海外动态代理IP免费测试>>>>>LoongProxy|全球静态代理IP免费测试>>>>>全民|国内代理IP免费测试

评论（没有评论）

天启|企业级代理IP免费测试>>>>>神龙|纯净稳定代理IP免费测试>>>>>IPIPGO|全球住宅代理IP免费测试>>>>>神龙|国外动态代理IP免费测试>>>>>LoongProxy|全球静态代理IP免费测试>>>>>全民|国内代理IP免费测试