關於python讀取xml文章不少,但大多文章都是貼一個xml文件,而後再貼個處理文件的代碼。這樣並不利於初學者的學習,但願這篇文章能夠更通俗易懂的教如何使用python 來讀取xml 文件。node
什麼是xml?python
xml便可擴展標記語言,它能夠用來標記數據、定義數據類型,是一種容許用戶對本身的標記語言進行定義的源語言。dom
abc.xml學習
<?xml version="1.0" encoding="utf-8"?> <catalog> <maxid>4</maxid> <login username="pytest" passwd='123456'> <caption>Python</caption> <item id="4"> <caption>測試</caption> </item> </login> <item id="2"> <caption>Zope</caption> </item> </catalog>
Ok ,從結構上,它很像咱們常見的HTML超文本標記語言。但他們被設計的目的是不一樣的,超文本標記語言被設計用來顯示數據,其焦點是數據的外觀。它被設計用來傳輸和存儲數據,其焦點是數據的內容。測試
那麼它有以下特徵:spa
首先,它是有標籤對組成,<aa></aa>設計
標籤能夠有屬性:<aa id=’123’></aa>code
標籤對能夠嵌入數據:<aa>abc</aa>xml
標籤能夠嵌入子標籤(具備層級關係):htm
<aa>
<bb></bb>
</aa>
得到標籤屬性
那麼,下面來介紹如何用python來讀取這種類型的文件。
#coding=utf-8
import xml.dom.minidom #打開xml文檔
dom = xml.dom.minidom.parse('abc.xml') #獲得文檔元素對象
root = dom.documentElement print root.nodeName print root.nodeValue print root.nodeType print root.ELEMENT_NODE
mxl.dom.minidom 模塊被用來處理xml文件,因此要先引入。
xml.dom.minidom.parse() 用於打開一個xml文件,並將這個文件對象dom變量。
documentElement 用於獲得dom對象的文檔元素,並把得到的對象給root
每個結點都有它的nodeName,nodeValue,nodeType屬性。
nodeName爲結點名字。
nodeValue是結點的值,只對文本結點有效。
nodeType是結點的類型。catalog是ELEMENT_NODE類型
如今有如下幾種:
'ATTRIBUTE_NODE'
'CDATA_SECTION_NODE'
'COMMENT_NODE'
'DOCUMENT_FRAGMENT_NODE'
'DOCUMENT_NODE'
'DOCUMENT_TYPE_NODE'
'ELEMENT_NODE'
'ENTITY_NODE'
'ENTITY_REFERENCE_NODE'
'NOTATION_NODE'
'PROCESSING_INSTRUCTION_NODE'
'TEXT_NODE'
NodeTypes - 有名常數
http://www.w3school.com.cn/xmldom/dom_nodetype.asp
得到子標籤
如今要得到catalog的子標籤以的標籤name
<?xml version="1.0" encoding="utf-8"?> <catalog> <maxid>4</maxid> <login username="pytest" passwd='123456'> <caption>Python</caption> <item id="4"> <caption>測試</caption> </item> </login> <item id="2"> <caption>Zope</caption> </item> </catalog>
對於知道元素名字的子元素,可使用getElementsByTagName方法獲取:
#coding=utf-8
import xml.dom.minidom #打開xml文檔
dom = xml.dom.minidom.parse('abc.xml') #獲得文檔元素對象
root = dom.documentElement bb = root.getElementsByTagName('maxid') b= bb[0] print b.nodeName bb = root.getElementsByTagName('login') b= bb[0] print b.nodeName
如何區分相同標籤名字的標籤:
<?xml version="1.0" encoding="utf-8"?> <catalog> <maxid>4</maxid> <login username="pytest" passwd='123456'> <caption>Python</caption> <item id="4"> <caption>測試</caption> </item> </login> <item id="2"> <caption>Zope</caption> </item> </catalog>
<caption>和<item>標籤不止一個如何區分?
#coding=utf-8
import xml.dom.minidom #打開xml文檔
dom = xml.dom.minidom.parse('abc.xml') #獲得文檔元素對象
root = dom.documentElement bb = root.getElementsByTagName('caption') b= bb[2] print b.nodeName bb = root.getElementsByTagName('item') b= bb[1] print b.nodeName
root.getElementsByTagName('caption') 得到的是標籤爲caption 一組標籤,b[0]表示一組標籤中的第一個;b[2] ,表示這一組標籤中的第三個。
得到標籤屬性值
<?xml version="1.0" encoding="utf-8"?> <catalog> <maxid>4</maxid> <login username="pytest" passwd='123456'> <caption>Python</caption> <item id="4"> <caption>測試</caption> </item> </login> <item id="2"> <caption>Zope</caption> </item> </catalog>
<login>和<item>標籤是有屬性的,如何得到他們的屬性?
#coding=utf-8
import xml.dom.minidom #打開xml文檔
dom = xml.dom.minidom.parse('abc.xml') #獲得文檔元素對象
root = dom.documentElement itemlist = root.getElementsByTagName('login') item = itemlist[0] un=item.getAttribute("username") print un pd=item.getAttribute("passwd") print pd ii = root.getElementsByTagName('item') i1 = ii[0] i=i1.getAttribute("id") print i i2 = ii[1] i=i2.getAttribute("id") print i
getAttribute方法能夠得到元素的屬性所對應的值。
得到標籤對之間的數據
<?xml version="1.0" encoding="utf-8"?> <catalog> <maxid>4</maxid> <login username="pytest" passwd='123456'> <caption>Python</caption> <item id="4"> <caption>測試</caption> </item> </login> <item id="2"> <caption>Zope</caption> </item> </catalog>
<caption>標籤對之間是有數據的,如何得到這些數據?
得到標籤對之間的數據有多種方法,
方法一
#coding=utf-8 import xml.dom.minidom #打開xml文檔 dom = xml.dom.minidom.parse('abc.xml') #獲得文檔元素對象 root = dom.documentElement cc=dom.getElementsByTagName('caption') c1=cc[0] print c1.firstChild.data c2=cc[1] print c2.firstChild.data c3=cc[2] print c3.firstChild.data
firstChild 屬性返回被選節點的第一個子節點,.data表示獲取該節點人數據。
方法二
#coding=utf-8 from xml.etree import ElementTree as ET per=ET.parse('abc.xml') p=per.findall('./login/item') for oneper in p: for child in oneper.getchildren(): print child.tag,':',child.text p=per.findall('./item') for oneper in p: for child in oneper.getchildren(): print child.tag,':',child.text
方法二有點複雜,所引用模塊也與前面的不同,findall用於指定在哪一級標籤下開始遍歷。
getchildren方法按照文檔順序返回全部子標籤。並輸出標籤名(child.tag)和標籤的數據(child.text)
其實,方法二的做用不在於此,它核心功能是能夠遍歷某一級標籤下的全部子標籤。