一塊兒學爬蟲——使用Beautiful Soup爬取網頁

時間 2019-11-10

原文原文鏈接

要想學好爬蟲，必須把基礎打紮實，以前發佈了兩篇文章，分別是使用XPATH和requests爬取網頁，今天的文章是學習Beautiful Soup並經過一個例子來實現如何使用Beautiful Soup爬取網頁。css

什麼是Beautiful Souphtml

Beautiful Soup是一款高效的Python網頁解析分析工具，能夠用於解析HTL和XML文件並從中提取數據。
Beautiful Soup輸入文件的默認編碼是Unicode，輸出文件的編碼是UTF-8。
Beautiful Soup具備將輸入文件自動補全的功能，若是輸入的HTML文件的title標籤沒有閉合，則在輸出的文件中會自動補全，而且還能夠將格式混亂的輸入文件按照標準的縮進格式輸出。

Beautiful Soup要和其餘的解析器搭配使用，例如Python標準庫中的HTML解析器和其餘第三方的lxml解析器，因爲lxml解析器速度快、容錯能力強，所以通常和Beautiful Soup搭配使用。python

初始化Beautiful Soup對象的代碼：正則表達式

html = 
'''
<html><title>Hello Beautiful Soup</title><p>Hello</p></html>
'''
soup = BeautifulSoup(html,'lxml')

只需把第二個參數寫成"lxml"便可使用lxml解析器初始化Beautiful Soup對象。瀏覽器

Beautiful Soup提供了三種選擇器用去爬取節點中的數據，分別是節點選擇器、方法選擇器和CSS選擇器。下面分別介紹着三個選擇器的用法。app

節點選擇器：
HTML網頁有title、p、a、head、tr、td等節點。經過Beautiful Soup對象+"."+節點便可直接訪問到節點。
Beautiful Soup對象+"."+節點+"."+string便可提取到節點的文本信息。工具

用法	描述
soup.title	選擇第一個title節點
soup.title.string	提取第一個title節點的文本信息
soup.title.attrs	獲取第一個title節點的全部屬性，返回的結果的詞典。若是有class屬性，則class屬性返回的是list，class屬性之間以空格當作分隔符
soup.p.contents	獲取第一個p節點的全部直接子節點。該方法返回的是第一個p節點中包含的全部直接子字節點和文本，不包含孫節點，兩個節點之間的文本也當作是一個節點返回。返回的結果是列表
soup.p.children	返回第一個p節點的全部直接子節點，返回的結果是list_iterator對象
soup.p.descendants	獲取第一個p節點的全部子孫節點
soup.a.parent	獲取第一個a節點的父節點
soup.a.parents	獲取第一個a節點的全部祖先節點
soup.p.next_siblings	獲取第一個p節點的下一個兄弟節點
soup.p.previous_siblings	獲取第一個p節點的上一個兄弟節點

方法選擇器：
根據傳入的參數查找符合條件的節點。
下面是方法選擇器提供的方法：學習

方法	描述
find_all(name,attrs,recursive,text,**kwargs)	根據傳入參數查找全部符合條件的節點， name是節點名，attrs屬性值，text文本內容等。 text參數能夠是字符串，也能夠是正則表達式: soup.find_all(text=re.compile('test'))
find(name,attrs,recursive,text,**kwargs)	返回第一個符合條件的節點
find_parents()	返回全部祖先節點
find_parent()	返回父節點
find_next_siblings()	日後查找，全部兄弟節點
find_next_sibling()	日後查找，返回第一個兄弟節點
find_previous_siblings()	往前查找，返回全部兄弟節點
find_previous_sibling()	往前查找，返回第一個兄弟節點

在使用上面的方法時，若是參數中有Python的關鍵字，則須要在參數下面加一個下劃線，例以下面的代碼，class是Python的關鍵字，必須在class後加下劃線class_="title_class"：ui

from bs4 import BeautifulSoup

html = '''
<html>
    <body>
        <title id="title_id" class="title_class" name="title name">Test BeautifulSoup</title>
        <p>
            <a href = "./test_beautifulsoup.html">test beautifulsoup link<a>
            
        </p>
        <ul>
            <li class="animal">cat</li>
            <li class="animal">dog</li>
        </ul>
    </body>
</html>
'''

soup = BeautifulSoup(html,'lxml')
print(soup.find_all(name='title',class_='title_class'))

CSS選擇器：
BeautifulSoup還支持獲取css元素，例如ul、div、li等元素。CSS選擇器主要提供select()方法獲取符合條件的節點(Tag對象)，而後經過節點的get_text()方法和text屬性能夠獲取該節點的文本值。編碼

select方法還能夠根據css的樣式規則選擇相應的節點：

from bs4 import BeautifulSoup

html = '''
<html>
    <body>
        <title id="title_id" class="title_class" name="title name">Test BeautifulSoup</title>
        <p>
            <a href = "./test_beautifulsoup.html">test beautifulsoup link<a>
            
        </p>
        <ul class="animal" id="aninal_id">
            <li class="cat">cat</li>
            <li class="animal dog">dog</li>
        </ul>
        <ul class="fruit" id = "fruit_id">
            <li class="apple">apple</li>
            <li class="banana">banana</li>
        </ul>
    </body>
</html>
'''

soup = BeautifulSoup(html,'lxml')
print('獲取id爲title_的全部節點')
print(soup.select('#title_id'))
print('獲取class爲title_的全部節點')
print(soup.select('.title_class'))
print('獲取全部ul節點下面的全部li節點')
print(soup.select('ul li'))
print('獲取全部class爲fruit節點下的全部li節點')
print(soup.select('.fruit li'))
print('獲取全部class爲fruit節點下的第一個li節點的文本值')
print(soup.select('.fruit li')[0].string)
print('獲取全部class爲fruit節點下的第一個li節點的文本值')
print(soup.select('.fruit li')[0].get_text())
print('獲取全部class爲fruit節點下的第一個li節點的class屬性值，注意class屬性返回的是list列表，屬性之間用空格分隔')
print(soup.select('.fruit li')[0].attrs['class'])
print(soup.select('.animal li')[1].attrs['class'])
print('循環迭代全部ul下面的全部li節點的文本值')
for li in soup.select('ul li'):
    print(li.text)

下面使用Beautiful Soup爬取豆瓣音樂排行榜。
在瀏覽器中打開豆瓣音樂排行榜，打開瀏覽器，輸入網址：https://music.douban.com/chart，咱們要抓取的是每首歌曲的排名、歌曲名、演唱者、播放次數、上榜天數等數據。

下面分析怎麼經過beautiful soup抓取到咱們的數據。
經過開發者工具，咱們能夠看到全部歌曲是在class爲article的div中，而後每首個在class爲clearfix的li中。

所以首先使用css選擇器獲取到class爲article下面的全部li節點：

soup.select(".article li")

而後查看每首歌曲的html代碼：

紅色框部分是一首歌的html代碼。
歌曲排名在class爲「gree-num-box」的span節點中，由於span節點是<li class="clearfix">節點的子節點，獲取排名的代碼爲：li.span.text

綠色框中A節點中是歌曲的連接和圖片連接，獲取歌曲連接的代碼爲：li.a['href']

藍色框中是歌曲的名字、演唱者和播放次數，歌曲名是在class="icon-play"的H3節點中，所以可使用方法選擇器中的find()方法獲取到H3節點，而後獲取H3節點下面a節點中的文本信息就是歌曲的名字，代碼爲：li.find(class_="icon-play").a.text

獲取演唱者和播放次數的代碼爲：
li.find(class_="intro").p.text.strip()

獲取上榜天數的代碼爲：

li.find(class_="days").text.strip()

在豆瓣音樂排行榜的頁面一個現實20首歌曲，前面10首歌曲會有圖片，後面10首歌曲是沒有圖片的，所以後面10首歌曲將不獲取圖片的地址。

另外還有一點須要注意的是，後面10首歌曲的演唱者和播放次數是在class="icon-play"的p節點中：

而該節點中有a節點，要想獲取a節點外的信息，必須使用節點選擇器的contents方法：
li.find(class_="intro").p.contents[2].strip()
contents返回的是p節點的直接子節點，以列表的形式返回，這裏返回列表中有3個元素，分別是

後的字符串，a節點、演唱者/播次數。contents會將直接子節點之間的換行符也當作一個元素。

代碼整理後以下：

# coding:utf-8

from bs4 import BeautifulSoup
import requests
def parseHtml(url):
    headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0"}

    response = requests.get(url,headers=headers)
    soup = BeautifulSoup(response.text,'lxml')
    #使用css選擇器獲取class="article"的節點下面的全部li節點
    for index,li in enumerate(soup.select(".article li")):
        if(index <10):
            print('歌曲排名：' + li.span.text)
            print('歌曲連接：' + li.a['href'])
            print('歌曲名：' + li.find(class_="icon-play").a.text)#使用方法選擇器
            print('演唱者/播放次數：' + li.find(class_="intro").p.text.strip())
            print('上榜時間：'+li.find(class_="days").text.strip())
        else:
            print('歌曲排名：' + li.span.text)
            print('歌曲名：' + li.find(class_="icon-play").a.text)
            print('演唱者/播放次數：' + li.find(class_="intro").p.contents[2].strip())#方法選擇器和節點選擇器搭配使用
            print('上榜時間：' + li.find(class_="days").text.strip())
        print('—————————————————強力分隔符———————————————————')

def main():
    url = "https://music.douban.com/chart"
    parseHtml(url)

if __name__ == '__main__':
    main()

本文經過爬取豆瓣音樂排行榜的小項目學習瞭如何使用Beautiful Soup的節點選擇器、方法選擇器、CSS選擇器來爬取一個網頁。這三個選擇器能夠混合搭配使用。