Python 爬蟲入門(一)——爬取糗百

時間 2019-12-05

標籤 python 爬蟲入門欄目 Python 简体版

原文原文鏈接

爬取糗百內容

GitHub 代碼地址https://github.com/injetlee/Python/blob/master/qiubai_crawer.pyhtml

微信公衆號：【智能製造社區】，歡迎關注。python

本文目標

掌握爬蟲的基本概念
Requests 及 Beautiful Soup 兩個 Python 庫的基本使用
經過以上知識完成糗百段子抓取

爬蟲基本概念

爬蟲也稱網頁蜘蛛，主要用於抓取網頁上的特定信息。這在咱們須要獲取一些信息時很是有用，好比咱們能夠批量到美圖網站下載圖片，批量下載段子。省去手工操做的大量時間。爬蟲程序通常是經過模擬瀏覽器對相應URL發出請求，獲取數據，並經過正則等手段匹配出頁面中咱們所需的數據。git

在學習爬蟲以前，最好到 w3school 去了解一下 HTML 標籤的概念以及基本的 CSS 的概念。這會讓咱們更容易的理解如何獲取頁面中某個內容。github

Requests 庫基本介紹

Requests 是學習爬蟲的一大利器。是一個優雅簡單的 HTTP庫。官網介紹以下：正則表達式

Requests: HTTP for Humans

專門爲人類使用的 HTTP 庫。使用起來很是簡單明瞭。
咱們平時瀏覽網頁的步驟是輸入網址，打開。在 Requests 中是以下這樣的，咱們能夠在 Python 交互式解釋器中輸入如下代碼：瀏覽器

import requests
r = requests.get('https://www.qiushibaike.com/text/') # 打開網址，通常咱們會設置 請求頭，來更逼真的模擬瀏覽器，下文有介紹
r.text

我門看到下面一堆的代碼，其實就是網頁的源代碼(也能夠在瀏覽器上右鍵查看頁面源代碼)。經過這幾行代碼咱們就拿到了頁面的全部信息，剩下的就是從頁面中找到咱們所須要的信息。微信

Beautiful Soup 庫介紹

拿到網頁信息後，咱們要解析頁面，一般來講咱們有如下幾種方式來解析頁面，獲取咱們所需的信息。學習

正則表達式網站
- 適用於簡單數據的匹配，若是匹配內容較複雜，正則表達式寫起來會很繞，同時頁面內容稍微變化，正則就會失效
Lxmlui
- Lxml 是專門用來解析 XML 格式文件的庫，該模塊用 C 語言編寫，解析速度很快，和正則表達式速度差很少，可是提供了 XPath 和 CSS 選擇器等定位元素的方法
Beautiful Soup
- 這是一個 Python 實現的解析庫，相比較於前兩種來講，語法會更簡單明瞭一點，文檔也比較詳細。惟一的一點就是運行速度比前兩種方式慢幾倍，當數據量很是大時相差會更多。

本文做爲入門教程，就從 Beautiful Soup 入手，來學習一下匹配頁面所需元素的方法。
假若有如下 HTML 內容 example.html

<html>
<head>
    <meta charset="utf-8" />
    <meta http-equiv="X-UA-Compatible" content="IE=edge">
    <title>Page Title</title>
</head>
<body>
    <div class='main-page'>
        <ul class='menu-list'>
                <li>首頁</li>
                <li>新聞</li>
                <li>影視</li>
        </ul>
    </div>
</body>
</html>

咱們經過 Beautiful Soup 來解析這個 html. 首先咱們pip install beautifulsoup4安裝這個庫，並看一下簡單使用。

>>>from bs4 import BeautifulSoup
>>>soup = BeautifulSoup('example.html', 'html.parser') #加載咱們的html文件
>>>soup.find('div') # 找到 div 標籤
'<div class="main-page">
<ul class="menu-list">
<li>首頁</li>
<li>新聞</li>
<li>影視</li>
</ul>
</div>'

>>>soup.find_all('li') # 找到全部 li 標籤
'[<li>首頁</li>, <li>新聞</li>, <li>影視</li>]'

>>>for i in li:
    print(i.text)    #獲取每一個 li 標籤的內容
'
首頁
新聞
影視
'

詳細的操做能夠去看一下文檔，文檔很是詳細，例子也不少，簡單明瞭。

糗百爬蟲代碼

咱們先爬取純文本的內容 https://www.qiushibaike.com/t... 爬取這個連接下的內容。咱們把頁面結構截圖以下，咱們要獲取的信息，我用紅色的方框進行了標註。

圖一：

圖二：

import requests
from bs4 import BeautifulSoup


def download_page(url):
    headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:61.0) Gecko/20100101 Firefox/61.0"}
    r = requests.get(url, headers=headers)  # 增長headers, 模擬瀏覽器
    return r.text


def get_content(html, page):
    output = """第{}頁 做者：{} 性別：{} 年齡：{} 點贊：{} 評論：{}\n{}\n------------\n""" # 最終輸出格式
    soup = BeautifulSoup(html, 'html.parser')
    con = soup.find(id='content-left')  # 如圖一紅色方框
    con_list = con.find_all('div', class_="article")  # 找到文章列表
    for i in con_list:
        author = i.find('h2').string  # 獲取做者名字
        content = i.find('div', class_='content').find('span').get_text()  # 獲取內容
        stats = i.find('div', class_='stats')
        vote = stats.find('span', class_='stats-vote').find('i', class_='number').string
        comment = stats.find('span', class_='stats-comments').find('i', class_='number').string
        author_info = i.find('div', class_='articleGender')  # 獲取做者 年齡，性別
        if author_info is not None:  # 非匿名用戶
            class_list = author_info['class']
            if "womenIcon" in class_list:
                gender = '女'
            elif "manIcon" in class_list:
                gender = '男'
            else:
                gender = ''
            age = author_info.string   # 獲取年齡
        else:  # 匿名用戶
            gender = ''
            age = ''

        save_txt(output.format(page, author, gender, age, vote, comment, content))


def save_txt(*args):
    for i in args:
        with open('qiubai.txt', 'a', encoding='utf-8') as f:
            f.write(i)


def main():
    # 咱們點擊下面連接，在頁面下方能夠看到共有13頁，能夠構造以下 url，
    # 固然咱們最好是用 Beautiful Soup找到頁面底部有多少頁。
    for i in range(1, 14):
        url = 'https://qiushibaike.com/text/page/{}'.format(i)
        html = download_page(url)
        get_content(html, i)

if __name__ == '__main__':
    main()

運行代碼後，咱們會獲得 'qiubai.txt'文件，打開後以下所示

1. python爬蟲（二）爬取糗事百科
2. Python糗百爬蟲
3. 爬蟲--糗百
4. Python爬蟲實例：糗百
5. python糗事百科爬蟲
6. python3 爬蟲---爬取糗事百科
7. Python爬蟲——抓取糗百段子
8. Python爬蟲實戰一之爬取糗事百科段子
9. python 爬蟲第一例--糗事百科
10. 糗事百科爬蟲
更多相關文章...
• Memcached入門教程 - NoSQL教程
• SQLite - Python - SQLite教程
• YAML 入門教程
• Java Agent入門實戰（一）-Instrumentation介紹與使用

相關標籤/搜索

每日一句

每一个你不满意的现在，都有一个你没有努力的曾经。