python怎么读xml

528次阅读

python怎么读xml

XML是可扩展标记语言（Extensible Markup Language）的缩写，其中标记是关键部分。用户可以创建内容，然后使用限定标记标记它，从而使每个单词、短语或块成为可识别、可分类的信息。

标记语言从早起的私有公司和政府制定形式逐渐演变成标准通用标记语言（Standard Generalized Markup Language，SGML）、超文本标记语言（Hypertext Markup Language，HTML），并且最终演变成XML。XML有以下几个特点：

·XML的设计宗旨是传输数据，而非显示数据

·XML的标签没有被预定义，用户需要自行定义标签

·XML被设计为具有自我描述性

·XML是W3C的推荐标准

Python对XML文件的解析

常见的XML编程接口有DOM和SAX，这两种接口处理XML文件的方式不同，使用场合也不同。DOM是由W3C官方提出的标准，它会把整个XML文件读入内存，并将该文件解析成树，我们可以通过访问树的节点的方式访问XML中的标签，但是这种方法占用内存大，解析慢，如果读入文件过大，尽量避免使用这种方法。SAX是事件驱动的，通过在解析XML的过程中触发一个个的事件并调用用户自定义的回调函数来处理XML文件，速度比较快，占用内存少，但是需要用户实现回调函数，因此Python标准库的官方文档中这样介绍SAX：SAX每次只允许你查看文档的一小部分，你无法通过当前获取的元素访问其他元素。Python中提供了很多包支持XML文件的解析，如xml.dom，xml.sax，xml.dom.minidom和xml.etree.ElementTree等。

xml.dom.minidom包

xml.dom.minidom是DOM API的极简化实现，比完整版的DOM要简单的多，而且这个包也小得多，下面以movie.xml文件为例进行操作。

<collection shelf="New Arrivals">
<movie title="Enemy Behind">
   <type>War, Thriller</type>
   <format>DVD</format>
   <year>2003</year>
   <rating>PG</rating>
   <stars>10</stars>
   <description>Talk about a US-Japan war</description>
</movie>
<movie title="Transformers">
   <type>Anime, Science Fiction</type>
   <format>DVD</format>
   <year>1989</year>
   <rating>R</rating>
   <stars>8</stars>
   <description>A schientific fiction</description>
</movie>
   <movie title="Trigun">
   <type>Anime, Action</type>
   <format>DVD</format>
   <episodes>4</episodes>
   <rating>PG</rating>
   <stars>10</stars>
   <description>Vash the Stampede!</description>
</movie>
<movie title="Ishtar">
   <type>Comedy</type>
   <format>VHS</format>
   <rating>PG</rating>
   <stars>2</stars>
   <description>Viewable boredom</description>
</movie>
</collection>

然后我们调用xml.dom.minidom.parse方法读入xml文件并解析成DOM树

#!/usr/bin/python
# -*- coding: UTF-8 -*-
 
from xml.dom.minidom import parse
import xml.dom.minidom
 
# 使用minidom解析器打开 XML 文档
DOMTree = xml.dom.minidom.parse("movies.xml")
collection = DOMTree.documentElement
if collection.hasAttribute("shelf"):
   print "Root element : %s" % collection.getAttribute("shelf")
 
# 在集合中获取所有电影
movies = collection.getElementsByTagName("movie")
 
# 打印每部电影的详细信息
for movie in movies:
   print "*****Movie*****"
   if movie.hasAttribute("title"):
      print "Title: %s" % movie.getAttribute("title")
 
   type = movie.getElementsByTagName('type')[0]
   print "Type: %s" % type.childNodes[0].data
   format = movie.getElementsByTagName('format')[0]
   print "Format: %s" % format.childNodes[0].data
   rating = movie.getElementsByTagName('rating')[0]
   print "Rating: %s" % rating.childNodes[0].data
   description = movie.getElementsByTagName('description')[0]
   print "Description: %s" % description.childNodes[0].data

以上程序执行结果如下：

Root element : New Arrivals
*****Movie*****
Title: Enemy Behind
Type: War, Thriller
Format: DVD
Rating: PG
Description: Talk about a US-Japan war
*****Movie*****
Title: Transformers
Type: Anime, Science Fiction
Format: DVD
Rating: R
Description: A schientific fiction
*****Movie*****
Title: Trigun
Type: Anime, Action
Format: DVD
Rating: PG
Description: Vash the Stampede!
*****Movie*****
Title: Ishtar
Type: Comedy
Format: VHS
Rating: PG
Description: Viewable boredom

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

发表于：Python基础教程

2021-06-22

复制链接

赏

python怎么读xml

相关文章：

HTTP代理设置详解：一步步配置指南

什么是Socks5代理IP及其优势

Socks5代理配置教程及注意事项

什么是代理服务器IP：如何选择合适的

国外代理服务器的优势及选择建议

如何找到可靠的免费代理服务器

在线代理服务器的使用与推荐

HTTP代理服务器的设置及应用实例

静态代理IP怎么填写：步骤与示例

海外静态IP的代理选择与配置

什么是代理服务器IP：如何选择合适的

国外代理服务器的优势及选择建议

海外静态IP的代理选择与配置

动态与静态代理IP的区别解析

HTTP代理服务器的设置及应用实例

什么是Socks5代理IP及其优势

在线代理服务器的使用与推荐

如何找到可靠的免费代理服务器

HTTP代理设置详解：一步步配置指南

静态代理IP怎么填写：步骤与示例