Scrapy、Scrapy-redis組件

時間 2019-11-12

原文原文鏈接

Scrapy

Scrapy是一個爲了爬取網站數據，提取結構性數據而編寫的應用框架。其能夠應用在數據挖掘，信息處理或存儲歷史數據等一系列的程序中。
其最初是爲了頁面抓取 (更確切來講, 網絡抓取 )所設計的，也能夠應用在獲取API所返回的數據(例如 Amazon Associates Web Services ) 或者通用的網絡爬蟲。Scrapy用途普遍，能夠用於數據挖掘、監測和自動化測試。html

Scrapy 使用了 Twisted異步網絡庫來處理網絡通信。總體架構大體以下python

Scrapy主要包括瞭如下組件：react

引擎(Scrapy)
用來處理整個系統的數據流處理, 觸發事務(框架核心)
調度器(Scheduler)
用來接受引擎發過來的請求, 壓入隊列中, 並在引擎再次請求的時候返回. 能夠想像成一個URL（抓取網頁的網址或者說是連接）的優先隊列, 由它來決定下一個要抓取的網址是什麼, 同時去除重複的網址
下載器(Downloader)
用於下載網頁內容, 並將網頁內容返回給蜘蛛(Scrapy下載器是創建在twisted這個高效的異步模型上的)
爬蟲(Spiders)
爬蟲是主要幹活的, 用於從特定的網頁中提取本身須要的信息, 即所謂的實體(Item)。用戶也能夠從中提取出連接,讓Scrapy繼續抓取下一個頁面
項目管道(Pipeline)
負責處理爬蟲從網頁中抽取的實體，主要的功能是持久化實體、驗證明體的有效性、清除不須要的信息。當頁面被爬蟲解析後，將被髮送到項目管道，並通過幾個特定的次序處理數據。
下載器中間件(Downloader Middlewares)
位於Scrapy引擎和下載器之間的框架，主要是處理Scrapy引擎與下載器之間的請求及響應。
爬蟲中間件(Spider Middlewares)
介於Scrapy引擎和爬蟲之間的框架，主要工做是處理蜘蛛的響應輸入和請求輸出。
調度中間件(Scheduler Middewares)
介於Scrapy引擎和調度之間的中間件，從Scrapy引擎發送到調度的請求和響應。

Scrapy運行流程大概以下：web

引擎從調度器中取出一個連接(URL)用於接下來的抓取
引擎把URL封裝成一個請求(Request)傳給下載器
下載器把資源下載下來，並封裝成應答包(Response)
爬蟲解析Response
解析出實體（Item）,則交給實體管道進行進一步的處理
解析出的是連接（URL）,則把URL交給調度器等待抓取

1、安裝

 
          Linux 
         
          pip3 install scrapy 
         
          Windows 
         
          a. pip3 install wheel 
         
          b. 下載twisted http: 
          / 
          / 
          www.lfd.uci.edu 
          / 
          ~gohlke 
          / 
          pythonlibs 
          / 
          #twisted 
         
          c. 進入下載目錄，執行 pip3 install Twisted‑ 
          17.1 
          . 
          0 
          ‑cp35‑cp35m‑win_amd64.whl 
         
          d. pip3 install scrapy 
         
          e. 下載並安裝pywin32：https: 
          / 
          / 
          sourceforge.net 
          / 
          projects 
          / 
          pywin32 
          / 
          files 
          /

2、基本使用

1. 基本命令

 
          1. 
          scrapy startproject 項目名稱 
         
          - 
          在當前目錄中建立中建立一個項目文件（相似於Django） 
         
          2. 
          scrapy genspider [ 
          - 
          t template] <name> <domain> 
         
          - 
          建立爬蟲應用 
         
          如： 
         
          scrapy gensipider  
          - 
          t basic oldboy oldboy.com 
         
          scrapy gensipider  
          - 
          t xmlfeed autohome autohome.com.cn 
         
          PS: 
         
          查看全部命令：scrapy gensipider  
          - 
          l 
         
          查看模板命令：scrapy gensipider  
          - 
          d 模板名稱 
         
          3. 
          scrapy  
          list 
         
          - 
          展現爬蟲應用列表 
         
          4. 
          scrapy crawl 爬蟲應用名稱 
         
          - 
          運行單獨爬蟲應用

2.項目結構以及爬蟲應用簡介

 
          project_name 
          / 
         
          scrapy.cfg 
         
          project_name 
          / 
         
          __init__.py 
         
          items.py 
         
          pipelines.py 
         
          settings.py 
         
          spiders 
          / 
         
          __init__.py 
         
          爬蟲 
          1.py 
         
          爬蟲 
          2.py 
         
          爬蟲 
          3.py

文件說明：redis

scrapy.cfg 項目的主配置信息。（真正爬蟲相關的配置信息在settings.py文件中）
items.py 設置數據存儲模板，用於結構化數據，如：Django的Model
pipelines 數據處理行爲，如：通常結構化的數據持久化
settings.py 配置文件，如：遞歸的層數、併發數，延遲下載等
spiders 爬蟲目錄，如：建立文件，編寫爬蟲規則

注意：通常建立爬蟲文件時，以網站域名命名算法

import scrapy
 
class XiaoHuarSpider(scrapy.spiders.Spider):
    name = "xiaohuar"                            # 爬蟲名稱 *****
    allowed_domains = ["xiaohuar.com"]  # 容許的域名
    start_urls = [
        "http://www.xiaohuar.com/hua/",   # 其實URL
    ]
 
    def parse(self, response):
        # 訪問起始URL並獲取結果後的回調函數

爬蟲1.py

import sys,os
sys.stdout=io.TextIOWrapper(sys.stdout.buffer,encoding='gb18030')

關於windows編碼

3. 小試牛刀

 
          import 
          scrapy 
         
          from 
          scrapy.selector  
          import 
          HtmlXPathSelector 
         
          from 
          scrapy.http.request  
          import 
          Request 
         
          class 
          DigSpider(scrapy.Spider): 
         
          # 爬蟲應用的名稱，經過此名稱啓動爬蟲命令 
         
          name  
          = 
          "dig" 
         
          # 容許的域名 
         
          allowed_domains  
          = 
          [ 
          "chouti.com" 
          ] 
         
          # 起始URL 
         
          start_urls  
          = 
          [ 
         
          'http://dig.chouti.com/' 
          , 
         
          ] 
         
          has_request_set  
          = 
          {} 
         
          def 
          parse( 
          self 
          , response): 
         
          print 
          (response.url) 
         
          hxs  
          = 
          HtmlXPathSelector(response) 
         
          page_list  
          = 
          hxs.select( 
          '//div[@id="dig_lcpage"]//a[re:test(@href, "/all/hot/recent/\d+")]/@href' 
          ).extract() 
         
          for 
          page  
          in 
          page_list: 
         
          page_url  
          = 
          'http://dig.chouti.com%s' 
          % 
          page 
         
          key  
          = 
          self 
          .md5(page_url) 
         
          if 
          key  
          in 
          self 
          .has_request_set: 
         
          pass 
         
          else 
          : 
         
          self 
          .has_request_set[key]  
          = 
          page_url 
         
          obj  
          = 
          Request(url 
          = 
          page_url, method 
          = 
          'GET' 
          , callback 
          = 
          self 
          .parse) 
         
          yield 
          obj 
         
          @staticmethod 
         
          def 
          md5(val): 
         
          import 
          hashlib 
         
          ha  
          = 
          hashlib.md5() 
         
          ha.update(bytes(val, encoding 
          = 
          'utf-8' 
          )) 
         
          key  
          = 
          ha.hexdigest() 
         
          return 
          key

執行此爬蟲文件，則在終端進入項目目錄執行以下命令：json

1	`scrapy crawl dig` `-` `-` `nolog`

對於上述代碼重要之處在於：windows

Request是一個封裝用戶請求的類，在回調函數中yield該對象表示繼續訪問
HtmlXpathSelector用於結構化HTML代碼並提供選擇器功能

4. 選擇器

 
          #!/usr/bin/env python 
         
          # -*- coding:utf-8 -*- 
         
          from 
          scrapy.selector  
          import 
          Selector, HtmlXPathSelector 
         
          from 
          scrapy.http  
          import 
          HtmlResponse 
         
          html  
          = 
          """<!DOCTYPE html> 
         
          <html> 
         
          <head lang="en"> 
         
          <meta charset="UTF-8"> 
         
          <title></title> 
         
          </head> 
         
          <body> 
         
          <ul> 
         
          <li class="item-"><a id='i1' href="link.html">first item</a></li> 
         
          <li class="item-0"><a id='i2' href="llink.html">first item</a></li> 
         
          <li class="item-1"><a href="llink2.html">second item<span>vv</span></a></li> 
         
          </ul> 
         
          <div><a href="llink2.html">second item</a></div> 
         
          </body> 
         
          </html> 
         
          """ 
         
          response  
          = 
          HtmlResponse(url 
          = 
          'http://example.com' 
          , body 
          = 
          html,encoding 
          = 
          'utf-8' 
          ) 
         
          # hxs = HtmlXPathSelector(response) 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[2]') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[@id]') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[@id="i1"]') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[@href="link.html"][@id="i1"]') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[contains(@href, "link")]') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[starts-with(@href, "link")]') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[re:test(@id, "i\d+")]') 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[re:test(@id, "i\d+")]/text()').extract() 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//a[re:test(@id, "i\d+")]/@href').extract() 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('/html/body/ul/li/a/@href').extract() 
         
          # print(hxs) 
         
          # hxs = Selector(response=response).xpath('//body/ul/li/a/@href').extract_first() 
         
          # print(hxs) 
         
          # ul_list = Selector(response=response).xpath('//body/ul/li') 
         
          # for item in ul_list: 
         
          #     v = item.xpath('./a/span') 
         
          #     # 或 
         
          #     # v = item.xpath('a/span') 
         
          #     # 或 
         
          #     # v = item.xpath('*/a/span') 
         
          #     print(v)

# -*- coding: utf-8 -*-
import scrapy
from scrapy.selector import HtmlXPathSelector
from scrapy.http.request import Request
from scrapy.http.cookies import CookieJar
from scrapy import FormRequest


class ChouTiSpider(scrapy.Spider):
    # 爬蟲應用的名稱，經過此名稱啓動爬蟲命令
    name = "chouti"
    # 容許的域名
    allowed_domains = ["chouti.com"]

    cookie_dict = {}
    has_request_set = {}

    def start_requests(self):
        url = 'http://dig.chouti.com/'
        # return [Request(url=url, callback=self.login)]
        yield Request(url=url, callback=self.login)

    def login(self, response):
        cookie_jar = CookieJar()
        cookie_jar.extract_cookies(response, response.request)
        for k, v in cookie_jar._cookies.items():
            for i, j in v.items():
                for m, n in j.items():
                    self.cookie_dict[m] = n.value

        req = Request(
            url='http://dig.chouti.com/login',
            method='POST',
            headers={'Content-Type': 'application/x-www-form-urlencoded; charset=UTF-8'},
            body='phone=8615131255089&password=pppppppp&oneMonth=1',
            cookies=self.cookie_dict,
            callback=self.check_login
        )
        yield req

    def check_login(self, response):
        req = Request(
            url='http://dig.chouti.com/',
            method='GET',
            callback=self.show,
            cookies=self.cookie_dict,
            dont_filter=True
        )
        yield req

    def show(self, response):
        # print(response)
        hxs = HtmlXPathSelector(response)
        news_list = hxs.select('//div[@id="content-list"]/div[@class="item"]')
        for new in news_list:
            # temp = new.xpath('div/div[@class="part2"]/@share-linkid').extract()
            link_id = new.xpath('*/div[@class="part2"]/@share-linkid').extract_first()
            yield Request(
                url='http://dig.chouti.com/link/vote?linksId=%s' %(link_id,),
                method='POST',
                cookies=self.cookie_dict,
                callback=self.do_favor
            )

        page_list = hxs.select('//div[@id="dig_lcpage"]//a[re:test(@href, "/all/hot/recent/\d+")]/@href').extract()
        for page in page_list:

            page_url = 'http://dig.chouti.com%s' % page
            import hashlib
            hash = hashlib.md5()
            hash.update(bytes(page_url,encoding='utf-8'))
            key = hash.hexdigest()
            if key in self.has_request_set:
                pass
            else:
                self.has_request_set[key] = page_url
                yield Request(
                    url=page_url,
                    method='GET',
                    callback=self.show
                )

    def do_favor(self, response):
        print(response.text)

示例：自動登錄抽屜並點贊

注意：settings.py中設置DEPTH_LIMIT = 1來指定「遞歸」的層數。緩存

5. 格式化處理

上述實例只是簡單的處理，因此在parse方法中直接處理。若是對於想要獲取更多的數據處理，則能夠利用Scrapy的items將數據格式化，而後統一交由pipelines來處理。cookie

import scrapy
from scrapy.selector import HtmlXPathSelector
from scrapy.http.request import Request
from scrapy.http.cookies import CookieJar
from scrapy import FormRequest


class XiaoHuarSpider(scrapy.Spider):
    # 爬蟲應用的名稱，經過此名稱啓動爬蟲命令
    name = "xiaohuar"
    # 容許的域名
    allowed_domains = ["xiaohuar.com"]

    start_urls = [
        "http://www.xiaohuar.com/list-1-1.html",
    ]
    # custom_settings = {
    #     'ITEM_PIPELINES':{
    #         'spider1.pipelines.JsonPipeline': 100
    #     }
    # }
    has_request_set = {}

    def parse(self, response):
        # 分析頁面
        # 找到頁面中符合規則的內容（校花圖片），保存
        # 找到全部的a標籤，再訪問其餘a標籤，一層一層的搞下去

        hxs = HtmlXPathSelector(response)

        items = hxs.select('//div[@class="item_list infinite_scroll"]/div')
        for item in items:
            src = item.select('.//div[@class="img"]/a/img/@src').extract_first()
            name = item.select('.//div[@class="img"]/span/text()').extract_first()
            school = item.select('.//div[@class="img"]/div[@class="btns"]/a/text()').extract_first()
            url = "http://www.xiaohuar.com%s" % src
            from ..items import XiaoHuarItem
            obj = XiaoHuarItem(name=name, school=school, url=url)
            yield obj

        urls = hxs.select('//a[re:test(@href, "http://www.xiaohuar.com/list-1-\d+.html")]/@href')
        for url in urls:
            key = self.md5(url)
            if key in self.has_request_set:
                pass
            else:
                self.has_request_set[key] = url
                req = Request(url=url,method='GET',callback=self.parse)
                yield req

    @staticmethod
    def md5(val):
        import hashlib
        ha = hashlib.md5()
        ha.update(bytes(val, encoding='utf-8'))
        key = ha.hexdigest()
        return key

spiders/xiahuar.py

import scrapy


class XiaoHuarItem(scrapy.Item):
    name = scrapy.Field()
    school = scrapy.Field()
    url = scrapy.Field()

items

import json
import os
import requests


class JsonPipeline(object):
    def __init__(self):
        self.file = open('xiaohua.txt', 'w')

    def process_item(self, item, spider):
        v = json.dumps(dict(item), ensure_ascii=False)
        self.file.write(v)
        self.file.write('\n')
        self.file.flush()
        return item


class FilePipeline(object):
    def __init__(self):
        if not os.path.exists('imgs'):
            os.makedirs('imgs')

    def process_item(self, item, spider):
        response = requests.get(item['url'], stream=True)
        file_name = '%s_%s.jpg' % (item['name'], item['school'])
        with open(os.path.join('imgs', file_name), mode='wb') as f:
            f.write(response.content)
        return item

pipelines

ITEM_PIPELINES = {
   'spider1.pipelines.JsonPipeline': 100,
   'spider1.pipelines.FilePipeline': 300,
}
# 每行後面的整型值，肯定了他們運行的順序，item按數字從低到高的順序，經過pipeline，一般將這些數字定義在0-1000範圍內。

settings

對於pipeline能夠作更多，以下：

from scrapy.exceptions import DropItem

class CustomPipeline(object):
    def __init__(self,v):
        self.value = v

    def process_item(self, item, spider):
        # 操做並進行持久化

        # return表示會被後續的pipeline繼續處理
        return item

        # 表示將item丟棄，不會被後續pipeline處理
        # raise DropItem()


    @classmethod
    def from_crawler(cls, crawler):
        """
        初始化時候，用於建立pipeline對象
        :param crawler: 
        :return: 
        """
        val = crawler.settings.getint('MMMM')
        return cls(val)

    def open_spider(self,spider):
        """
        爬蟲開始執行時，調用
        :param spider: 
        :return: 
        """
        print('000000')

    def close_spider(self,spider):
        """
        爬蟲關閉時，被調用
        :param spider: 
        :return: 
        """
        print('111111')

自定義pipeline

6.中間件

class SpiderMiddleware(object):

    def process_spider_input(self,response, spider):
        """
        下載完成，執行，而後交給parse處理
        :param response: 
        :param spider: 
        :return: 
        """
        pass

    def process_spider_output(self,response, result, spider):
        """
        spider處理完成，返回時調用
        :param response:
        :param result:
        :param spider:
        :return: 必須返回包含 Request 或 Item 對象的可迭代對象(iterable)
        """
        return result

    def process_spider_exception(self,response, exception, spider):
        """
        異常調用
        :param response:
        :param exception:
        :param spider:
        :return: None,繼續交給後續中間件處理異常；含 Response 或 Item 的可迭代對象(iterable)，交給調度器或pipeline
        """
        return None


    def process_start_requests(self,start_requests, spider):
        """
        爬蟲啓動時調用
        :param start_requests:
        :param spider:
        :return: 包含 Request 對象的可迭代對象
        """
        return start_requests

爬蟲中間件

class DownMiddleware1(object):
    def process_request(self, request, spider):
        """
        請求須要被下載時，通過全部下載器中間件的process_request調用
        :param request: 
        :param spider: 
        :return:  
            None,繼續後續中間件去下載；
            Response對象，中止process_request的執行，開始執行process_response
            Request對象，中止中間件的執行，將Request從新調度器
            raise IgnoreRequest異常，中止process_request的執行，開始執行process_exception
        """
        pass



    def process_response(self, request, response, spider):
        """
        spider處理完成，返回時調用
        :param response:
        :param result:
        :param spider:
        :return: 
            Response 對象：轉交給其餘中間件process_response
            Request 對象：中止中間件，request會被從新調度下載
            raise IgnoreRequest 異常：調用Request.errback
        """
        print('response1')
        return response

    def process_exception(self, request, exception, spider):
        """
        當下載處理器(download handler)或 process_request() (下載中間件)拋出異常
        :param response:
        :param exception:
        :param spider:
        :return: 
            None：繼續交給後續中間件處理異常；
            Response對象：中止後續process_exception方法
            Request對象：中止中間件，request將會被從新調用下載
        """
        return None

下載器中間件

7. 自定製命令

在spiders同級建立任意目錄，如：commands

在其中建立 crawlall.py 文件（此處文件名就是自定義的命令）

    from scrapy.commands import ScrapyCommand
    from scrapy.utils.project import get_project_settings


    class Command(ScrapyCommand):

        requires_project = True

        def syntax(self):
            return '[options]'

        def short_desc(self):
            return 'Runs all of the spiders'

        def run(self, args, opts):
            spider_list = self.crawler_process.spiders.list()
            for name in spider_list:
                self.crawler_process.crawl(name, **opts.__dict__)
            self.crawler_process.start()

crawlall.py

在settings.py 中添加配置 COMMANDS_MODULE = '項目名稱.目錄名稱'
在項目目錄執行命令：scrapy crawlall

8. 自定義擴展

自定義擴展時，利用信號在指定位置註冊制定操做

from scrapy import signals


class MyExtension(object):
    def __init__(self, value):
        self.value = value

    @classmethod
    def from_crawler(cls, crawler):
        val = crawler.settings.getint('MMMM')
        ext = cls(val)

        crawler.signals.connect(ext.spider_opened, signal=signals.spider_opened)
        crawler.signals.connect(ext.spider_closed, signal=signals.spider_closed)

        return ext

    def spider_opened(self, spider):
        print('open')

    def spider_closed(self, spider):
        print('close')

View Code

9. 避免重複訪問

scrapy默認使用 scrapy.dupefilter.RFPDupeFilter 進行去重，相關配置有：

 
          DUPEFILTER_CLASS  
          = 
          'scrapy.dupefilter.RFPDupeFilter' 
         
 
          DUPEFILTER_DEBUG  
          = 
          False 
         
 
          JOBDIR  
          = 
          "保存範文記錄的日誌路徑，如：/root/"  
          # 最終路徑爲 /root/requests.seen 
         

class RepeatUrl:
    def __init__(self):
        self.visited_url = set()

    @classmethod
    def from_settings(cls, settings):
        """
        初始化時，調用
        :param settings: 
        :return: 
        """
        return cls()

    def request_seen(self, request):
        """
        檢測當前請求是否已經被訪問過
        :param request: 
        :return: True表示已經訪問過；False表示未訪問過
        """
        if request.url in self.visited_url:
            return True
        self.visited_url.add(request.url)
        return False

    def open(self):
        """
        開始爬去請求時，調用
        :return: 
        """
        print('open replication')

    def close(self, reason):
        """
        結束爬蟲爬取時，調用
        :param reason: 
        :return: 
        """
        print('close replication')

    def log(self, request, spider):
        """
        記錄日誌
        :param request: 
        :param spider: 
        :return: 
        """
        print('repeat', request.url)

自定義URL去重操做

10.其餘

# -*- coding: utf-8 -*-

# Scrapy settings for step8_king project
#
# For simplicity, this file contains only settings considered important or
# commonly used. You can find more settings consulting the documentation:
#
#     http://doc.scrapy.org/en/latest/topics/settings.html
#     http://scrapy.readthedocs.org/en/latest/topics/downloader-middleware.html
#     http://scrapy.readthedocs.org/en/latest/topics/spider-middleware.html

# 1. 爬蟲名稱
BOT_NAME = 'step8_king'

# 2. 爬蟲應用路徑
SPIDER_MODULES = ['step8_king.spiders']
NEWSPIDER_MODULE = 'step8_king.spiders'

# Crawl responsibly by identifying yourself (and your website) on the user-agent
# 3. 客戶端 user-agent請求頭
# USER_AGENT = 'step8_king (+http://www.yourdomain.com)'

# Obey robots.txt rules
# 4. 禁止爬蟲配置
# ROBOTSTXT_OBEY = False

# Configure maximum concurrent requests performed by Scrapy (default: 16)
# 5. 併發請求數
# CONCURRENT_REQUESTS = 4

# Configure a delay for requests for the same website (default: 0)
# See http://scrapy.readthedocs.org/en/latest/topics/settings.html#download-delay
# See also autothrottle settings and docs
# 6. 延遲下載秒數
# DOWNLOAD_DELAY = 2


# The download delay setting will honor only one of:
# 7. 單域名訪問併發數，而且延遲下次秒數也應用在每一個域名
# CONCURRENT_REQUESTS_PER_DOMAIN = 2
# 單IP訪問併發數，若是有值則忽略：CONCURRENT_REQUESTS_PER_DOMAIN，而且延遲下次秒數也應用在每一個IP
# CONCURRENT_REQUESTS_PER_IP = 3

# Disable cookies (enabled by default)
# 8. 是否支持cookie，cookiejar進行操做cookie
# COOKIES_ENABLED = True
# COOKIES_DEBUG = True

# Disable Telnet Console (enabled by default)
# 9. Telnet用於查看當前爬蟲的信息，操做爬蟲等...
#    使用telnet ip port ，而後經過命令操做
# TELNETCONSOLE_ENABLED = True
# TELNETCONSOLE_HOST = '127.0.0.1'
# TELNETCONSOLE_PORT = [6023,]


# 10. 默認請求頭
# Override the default request headers:
# DEFAULT_REQUEST_HEADERS = {
#     'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
#     'Accept-Language': 'en',
# }


# Configure item pipelines
# See http://scrapy.readthedocs.org/en/latest/topics/item-pipeline.html
# 11. 定義pipeline處理請求
# ITEM_PIPELINES = {
#    'step8_king.pipelines.JsonPipeline': 700,
#    'step8_king.pipelines.FilePipeline': 500,
# }



# 12. 自定義擴展，基於信號進行調用
# Enable or disable extensions
# See http://scrapy.readthedocs.org/en/latest/topics/extensions.html
# EXTENSIONS = {
#     # 'step8_king.extensions.MyExtension': 500,
# }


# 13. 爬蟲容許的最大深度，能夠經過meta查看當前深度；0表示無深度
# DEPTH_LIMIT = 3

# 14. 爬取時，0表示深度優先Lifo(默認)；1表示廣度優先FiFo

# 後進先出，深度優先
# DEPTH_PRIORITY = 0
# SCHEDULER_DISK_QUEUE = 'scrapy.squeue.PickleLifoDiskQueue'
# SCHEDULER_MEMORY_QUEUE = 'scrapy.squeue.LifoMemoryQueue'
# 先進先出，廣度優先

# DEPTH_PRIORITY = 1
# SCHEDULER_DISK_QUEUE = 'scrapy.squeue.PickleFifoDiskQueue'
# SCHEDULER_MEMORY_QUEUE = 'scrapy.squeue.FifoMemoryQueue'

# 15. 調度器隊列
# SCHEDULER = 'scrapy.core.scheduler.Scheduler'
# from scrapy.core.scheduler import Scheduler


# 16. 訪問URL去重
# DUPEFILTER_CLASS = 'step8_king.duplication.RepeatUrl'


# Enable and configure the AutoThrottle extension (disabled by default)
# See http://doc.scrapy.org/en/latest/topics/autothrottle.html

"""
17. 自動限速算法
    from scrapy.contrib.throttle import AutoThrottle
    自動限速設置
    1. 獲取最小延遲 DOWNLOAD_DELAY
    2. 獲取最大延遲 AUTOTHROTTLE_MAX_DELAY
    3. 設置初始下載延遲 AUTOTHROTTLE_START_DELAY
    4. 當請求下載完成後，獲取其"鏈接"時間 latency，即：請求鏈接到接受到響應頭之間的時間
    5. 用於計算的... AUTOTHROTTLE_TARGET_CONCURRENCY
    target_delay = latency / self.target_concurrency
    new_delay = (slot.delay + target_delay) / 2.0 # 表示上一次的延遲時間
    new_delay = max(target_delay, new_delay)
    new_delay = min(max(self.mindelay, new_delay), self.maxdelay)
    slot.delay = new_delay
"""

# 開始自動限速
# AUTOTHROTTLE_ENABLED = True
# The initial download delay
# 初始下載延遲
# AUTOTHROTTLE_START_DELAY = 5
# The maximum download delay to be set in case of high latencies
# 最大下載延遲
# AUTOTHROTTLE_MAX_DELAY = 10
# The average number of requests Scrapy should be sending in parallel to each remote server
# 平均每秒併發數
# AUTOTHROTTLE_TARGET_CONCURRENCY = 1.0

# Enable showing throttling stats for every response received:
# 是否顯示
# AUTOTHROTTLE_DEBUG = True

# Enable and configure HTTP caching (disabled by default)
# See http://scrapy.readthedocs.org/en/latest/topics/downloader-middleware.html#httpcache-middleware-settings


"""
18. 啓用緩存
    目的用於將已經發送的請求或相應緩存下來，以便之後使用
    
    from scrapy.downloadermiddlewares.httpcache import HttpCacheMiddleware
    from scrapy.extensions.httpcache import DummyPolicy
    from scrapy.extensions.httpcache import FilesystemCacheStorage
"""
# 是否啓用緩存策略
# HTTPCACHE_ENABLED = True

# 緩存策略：全部請求均緩存，下次在請求直接訪問原來的緩存便可
# HTTPCACHE_POLICY = "scrapy.extensions.httpcache.DummyPolicy"
# 緩存策略：根據Http響應頭：Cache-Control、Last-Modified 等進行緩存的策略
# HTTPCACHE_POLICY = "scrapy.extensions.httpcache.RFC2616Policy"

# 緩存超時時間
# HTTPCACHE_EXPIRATION_SECS = 0

# 緩存保存路徑
# HTTPCACHE_DIR = 'httpcache'

# 緩存忽略的Http狀態碼
# HTTPCACHE_IGNORE_HTTP_CODES = []

# 緩存存儲的插件
# HTTPCACHE_STORAGE = 'scrapy.extensions.httpcache.FilesystemCacheStorage'


"""
19. 代理，須要在環境變量中設置
    from scrapy.contrib.downloadermiddleware.httpproxy import HttpProxyMiddleware
    
    方式一：使用默認
        os.environ
        {
            http_proxy:http://root:woshiniba@192.168.11.11:9999/
            https_proxy:http://192.168.11.11:9999/
        }
    方式二：使用自定義下載中間件
    
    def to_bytes(text, encoding=None, errors='strict'):
        if isinstance(text, bytes):
            return text
        if not isinstance(text, six.string_types):
            raise TypeError('to_bytes must receive a unicode, str or bytes '
                            'object, got %s' % type(text).__name__)
        if encoding is None:
            encoding = 'utf-8'
        return text.encode(encoding, errors)
        
    class ProxyMiddleware(object):
        def process_request(self, request, spider):
            PROXIES = [
                {'ip_port': '111.11.228.75:80', 'user_pass': ''},
                {'ip_port': '120.198.243.22:80', 'user_pass': ''},
                {'ip_port': '111.8.60.9:8123', 'user_pass': ''},
                {'ip_port': '101.71.27.120:80', 'user_pass': ''},
                {'ip_port': '122.96.59.104:80', 'user_pass': ''},
                {'ip_port': '122.224.249.122:8088', 'user_pass': ''},
            ]
            proxy = random.choice(PROXIES)
            if proxy['user_pass'] is not None:
                request.meta['proxy'] = to_bytes（"http://%s" % proxy['ip_port']）
                encoded_user_pass = base64.encodestring(to_bytes(proxy['user_pass']))
                request.headers['Proxy-Authorization'] = to_bytes('Basic ' + encoded_user_pass)
                print "**************ProxyMiddleware have pass************" + proxy['ip_port']
            else:
                print "**************ProxyMiddleware no pass************" + proxy['ip_port']
                request.meta['proxy'] = to_bytes("http://%s" % proxy['ip_port'])
    
    DOWNLOADER_MIDDLEWARES = {
       'step8_king.middlewares.ProxyMiddleware': 500,
    }
    
"""

"""
20. Https訪問
    Https訪問時有兩種狀況：
    1. 要爬取網站使用的可信任證書(默認支持)
        DOWNLOADER_HTTPCLIENTFACTORY = "scrapy.core.downloader.webclient.ScrapyHTTPClientFactory"
        DOWNLOADER_CLIENTCONTEXTFACTORY = "scrapy.core.downloader.contextfactory.ScrapyClientContextFactory"
        
    2. 要爬取網站使用的自定義證書
        DOWNLOADER_HTTPCLIENTFACTORY = "scrapy.core.downloader.webclient.ScrapyHTTPClientFactory"
        DOWNLOADER_CLIENTCONTEXTFACTORY = "step8_king.https.MySSLFactory"
        
        # https.py
        from scrapy.core.downloader.contextfactory import ScrapyClientContextFactory
        from twisted.internet.ssl import (optionsForClientTLS, CertificateOptions, PrivateCertificate)
        
        class MySSLFactory(ScrapyClientContextFactory):
            def getCertificateOptions(self):
                from OpenSSL import crypto
                v1 = crypto.load_privatekey(crypto.FILETYPE_PEM, open('/Users/wupeiqi/client.key.unsecure', mode='r').read())
                v2 = crypto.load_certificate(crypto.FILETYPE_PEM, open('/Users/wupeiqi/client.pem', mode='r').read())
                return CertificateOptions(
                    privateKey=v1,  # pKey對象
                    certificate=v2,  # X509對象
                    verify=False,
                    method=getattr(self, 'method', getattr(self, '_ssl_method', None))
                )
    其餘：
        相關類
            scrapy.core.downloader.handlers.http.HttpDownloadHandler
            scrapy.core.downloader.webclient.ScrapyHTTPClientFactory
            scrapy.core.downloader.contextfactory.ScrapyClientContextFactory
        相關配置
            DOWNLOADER_HTTPCLIENTFACTORY
            DOWNLOADER_CLIENTCONTEXTFACTORY

"""



"""
21. 爬蟲中間件
    class SpiderMiddleware(object):

        def process_spider_input(self,response, spider):
            '''
            下載完成，執行，而後交給parse處理
            :param response: 
            :param spider: 
            :return: 
            '''
            pass
    
        def process_spider_output(self,response, result, spider):
            '''
            spider處理完成，返回時調用
            :param response:
            :param result:
            :param spider:
            :return: 必須返回包含 Request 或 Item 對象的可迭代對象(iterable)
            '''
            return result
    
        def process_spider_exception(self,response, exception, spider):
            '''
            異常調用
            :param response:
            :param exception:
            :param spider:
            :return: None,繼續交給後續中間件處理異常；含 Response 或 Item 的可迭代對象(iterable)，交給調度器或pipeline
            '''
            return None
    
    
        def process_start_requests(self,start_requests, spider):
            '''
            爬蟲啓動時調用
            :param start_requests:
            :param spider:
            :return: 包含 Request 對象的可迭代對象
            '''
            return start_requests
    
    內置爬蟲中間件：
        'scrapy.contrib.spidermiddleware.httperror.HttpErrorMiddleware': 50,
        'scrapy.contrib.spidermiddleware.offsite.OffsiteMiddleware': 500,
        'scrapy.contrib.spidermiddleware.referer.RefererMiddleware': 700,
        'scrapy.contrib.spidermiddleware.urllength.UrlLengthMiddleware': 800,
        'scrapy.contrib.spidermiddleware.depth.DepthMiddleware': 900,

"""
# from scrapy.contrib.spidermiddleware.referer import RefererMiddleware
# Enable or disable spider middlewares
# See http://scrapy.readthedocs.org/en/latest/topics/spider-middleware.html
SPIDER_MIDDLEWARES = {
   # 'step8_king.middlewares.SpiderMiddleware': 543,
}


"""
22. 下載中間件
    class DownMiddleware1(object):
        def process_request(self, request, spider):
            '''
            請求須要被下載時，通過全部下載器中間件的process_request調用
            :param request:
            :param spider:
            :return:
                None,繼續後續中間件去下載；
                Response對象，中止process_request的執行，開始執行process_response
                Request對象，中止中間件的執行，將Request從新調度器
                raise IgnoreRequest異常，中止process_request的執行，開始執行process_exception
            '''
            pass
    
    
    
        def process_response(self, request, response, spider):
            '''
            spider處理完成，返回時調用
            :param response:
            :param result:
            :param spider:
            :return:
                Response 對象：轉交給其餘中間件process_response
                Request 對象：中止中間件，request會被從新調度下載
                raise IgnoreRequest 異常：調用Request.errback
            '''
            print('response1')
            return response
    
        def process_exception(self, request, exception, spider):
            '''
            當下載處理器(download handler)或 process_request() (下載中間件)拋出異常
            :param response:
            :param exception:
            :param spider:
            :return:
                None：繼續交給後續中間件處理異常；
                Response對象：中止後續process_exception方法
                Request對象：中止中間件，request將會被從新調用下載
            '''
            return None

    
    默認下載中間件
    {
        'scrapy.contrib.downloadermiddleware.robotstxt.RobotsTxtMiddleware': 100,
        'scrapy.contrib.downloadermiddleware.httpauth.HttpAuthMiddleware': 300,
        'scrapy.contrib.downloadermiddleware.downloadtimeout.DownloadTimeoutMiddleware': 350,
        'scrapy.contrib.downloadermiddleware.useragent.UserAgentMiddleware': 400,
        'scrapy.contrib.downloadermiddleware.retry.RetryMiddleware': 500,
        'scrapy.contrib.downloadermiddleware.defaultheaders.DefaultHeadersMiddleware': 550,
        'scrapy.contrib.downloadermiddleware.redirect.MetaRefreshMiddleware': 580,
        'scrapy.contrib.downloadermiddleware.httpcompression.HttpCompressionMiddleware': 590,
        'scrapy.contrib.downloadermiddleware.redirect.RedirectMiddleware': 600,
        'scrapy.contrib.downloadermiddleware.cookies.CookiesMiddleware': 700,
        'scrapy.contrib.downloadermiddleware.httpproxy.HttpProxyMiddleware': 750,
        'scrapy.contrib.downloadermiddleware.chunked.ChunkedTransferMiddleware': 830,
        'scrapy.contrib.downloadermiddleware.stats.DownloaderStats': 850,
        'scrapy.contrib.downloadermiddleware.httpcache.HttpCacheMiddleware': 900,
    }

"""
# from scrapy.contrib.downloadermiddleware.httpauth import HttpAuthMiddleware
# Enable or disable downloader middlewares
# See http://scrapy.readthedocs.org/en/latest/topics/downloader-middleware.html
# DOWNLOADER_MIDDLEWARES = {
#    'step8_king.middlewares.DownMiddleware1': 100,
#    'step8_king.middlewares.DownMiddleware2': 500,
# }

settings

11.TinyScrapy

#!/usr/bin/env python
# -*- coding:utf-8 -*-
import types
from twisted.internet import defer
from twisted.web.client import getPage
from twisted.internet import reactor



class Request(object):
    def __init__(self, url, callback):
        self.url = url
        self.callback = callback
        self.priority = 0


class HttpResponse(object):
    def __init__(self, content, request):
        self.content = content
        self.request = request


class ChouTiSpider(object):

    def start_requests(self):
        url_list = ['http://www.cnblogs.com/', 'http://www.bing.com']
        for url in url_list:
            yield Request(url=url, callback=self.parse)

    def parse(self, response):
        print(response.request.url)
        # yield Request(url="http://www.baidu.com", callback=self.parse)




from queue import Queue
Q = Queue()


class CallLaterOnce(object):
    def __init__(self, func, *a, **kw):
        self._func = func
        self._a = a
        self._kw = kw
        self._call = None

    def schedule(self, delay=0):
        if self._call is None:
            self._call = reactor.callLater(delay, self)

    def cancel(self):
        if self._call:
            self._call.cancel()

    def __call__(self):
        self._call = None
        return self._func(*self._a, **self._kw)


class Engine(object):
    def __init__(self):
        self.nextcall = None
        self.crawlling = []
        self.max = 5
        self._closewait = None

    def get_response(self,content, request):
        response = HttpResponse(content, request)
        gen = request.callback(response)
        if isinstance(gen, types.GeneratorType):
            for req in gen:
                req.priority = request.priority + 1
                Q.put(req)


    def rm_crawlling(self,response,d):
        self.crawlling.remove(d)

    def _next_request(self,spider):
        if Q.qsize() == 0 and len(self.crawlling) == 0:
            self._closewait.callback(None)

        if len(self.crawlling) >= 5:
            return
        while len(self.crawlling) < 5:
            try:
                req = Q.get(block=False)
            except Exception as e:
                req = None
            if not req:
                return
            d = getPage(req.url.encode('utf-8'))
            self.crawlling.append(d)
            d.addCallback(self.get_response, req)
            d.addCallback(self.rm_crawlling,d)
            d.addCallback(lambda _: self.nextcall.schedule())


    @defer.inlineCallbacks
    def crawl(self):
        spider = ChouTiSpider()
        start_requests = iter(spider.start_requests())
        flag = True
        while flag:
            try:
                req = next(start_requests)
                Q.put(req)
            except StopIteration as e:
                flag = False

        self.nextcall = CallLaterOnce(self._next_request,spider)
        self.nextcall.schedule()

        self._closewait = defer.Deferred()
        yield self._closewait

    @defer.inlineCallbacks
    def pp(self):
        yield self.crawl()

_active = set()
obj = Engine()
d = obj.crawl()
_active.add(d)

li = defer.DeferredList(_active)
li.addBoth(lambda _,*a,**kw: reactor.stop())

reactor.run()

參考版

點擊下載

更多文檔參見：http://scrapy-chs.readthedocs.io/zh_CN/latest/index.html

scrapy-redis是一個基於redis的scrapy組件，經過它能夠快速實現簡單分佈式爬蟲程序，該組件本質上提供了三大功能：

scheduler - 調度器
dupefilter - URL去重規則（被調度器使用）
pipeline - 數據持久化

scrapy-redis組件

1. URL去重

 
          定義去重規則（被調度器調用並應用） 
         
          a. 內部會使用如下配置進行鏈接Redis 
         
          # REDIS_HOST = 'localhost'                            # 主機名 
         
          # REDIS_PORT = 6379                                   # 端口 
         
          # REDIS_URL = 'redis://user:pass@hostname:9001'       # 鏈接URL（優先於以上配置） 
         
          # REDIS_PARAMS  = {}                                  # Redis鏈接參數             默認：REDIS_PARAMS = {'socket_timeout': 30,'socket_connect_timeout': 30,'retry_on_timeout': True,'encoding': REDIS_ENCODING,}） 
         
          # REDIS_PARAMS['redis_cls'] = 'myproject.RedisClient' # 指定鏈接Redis的Python模塊  默認：redis.StrictRedis 
         
          # REDIS_ENCODING = "utf-8"                            # redis編碼類型             默認：'utf-8' 
         
          b. 去重規則經過redis的集合完成，集合的Key爲： 
         
          key  
          = 
          defaults.DUPEFILTER_KEY  
          % 
          { 
          'timestamp' 
          :  
          int 
          (time.time())} 
         
          默認配置： 
         
          DUPEFILTER_KEY  
          = 
          'dupefilter:%(timestamp)s' 
         
          c. 去重規則中將url轉換成惟一標示，而後在redis中檢查是否已經在集合中存在 
         
          from 
          scrapy.utils  
          import 
          request 
         
          from 
          scrapy.http  
          import 
          Request 
         
          req  
          = 
          Request(url 
          = 
          'http://www.cnblogs.com/wupeiqi.html' 
          ) 
         
          result  
          = 
          request.request_fingerprint(req) 
         
          print 
          (result)  
          # 8ea4fd67887449313ccc12e5b6b92510cc53675c  
         
          PS:  
         
          - 
          URL參數位置不一樣時，計算結果一致； 
         
          - 
          默認請求頭不在計算範圍，include_headers能夠設置指定請求頭 
         
          示例： 
         
          from 
          scrapy.utils  
          import 
          request 
         
          from 
          scrapy.http  
          import 
          Request 
         
          req  
          = 
          Request(url 
          = 
          'http://www.baidu.com?name=8&id=1' 
          ,callback 
          = 
          lambda 
          x: 
          print 
          (x),cookies 
          = 
          { 
          'k1' 
          : 
          'vvvvv' 
          }) 
         
          result  
          = 
          request.request_fingerprint(req,include_headers 
          = 
          [ 
          'cookies' 
          ,]) 
         
          print 
          (result) 
         
          req  
          = 
          Request(url 
          = 
          'http://www.baidu.com?id=1&name=8' 
          ,callback 
          = 
          lambda 
          x: 
          print 
          (x),cookies 
          = 
          { 
          'k1' 
          : 
          666 
          }) 
         
          result  
          = 
          request.request_fingerprint(req,include_headers 
          = 
          [ 
          'cookies' 
          ,]) 
         
          print 
          (result) 
         
          """ 
         
          # Ensure all spiders share same duplicates filter through redis. 
         
          # DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"

2. 調度器

 
          """ 
         
          調度器，調度器使用PriorityQueue（有序集合）、FifoQueue（列表）、LifoQueue（列表）進行保存請求，而且使用RFPDupeFilter對URL去重 
         
          a. 調度器 
         
          SCHEDULER_QUEUE_CLASS = 'scrapy_redis.queue.PriorityQueue'          # 默認使用優先級隊列（默認），其餘：PriorityQueue（有序集合），FifoQueue（列表）、LifoQueue（列表） 
         
          SCHEDULER_QUEUE_KEY = '%(spider)s:requests'                         # 調度器中請求存放在redis中的key 
         
          SCHEDULER_SERIALIZER = "scrapy_redis.picklecompat"                  # 對保存到redis中的數據進行序列化，默認使用pickle 
         
          SCHEDULER_PERSIST = True                                            # 是否在關閉時候保留原來的調度器和去重記錄，True=保留，False=清空 
         
          SCHEDULER_FLUSH_ON_START = True                                     # 是否在開始以前清空 調度器和去重記錄，True=清空，False=不清空 
         
          SCHEDULER_IDLE_BEFORE_CLOSE = 10                                    # 去調度器中獲取數據時，若是爲空，最多等待時間（最後沒數據，未獲取到）。 
         
          SCHEDULER_DUPEFILTER_KEY = '%(spider)s:dupefilter'                  # 去重規則，在redis中保存時對應的key 
         
          SCHEDULER_DUPEFILTER_CLASS = 'scrapy_redis.dupefilter.RFPDupeFilter'# 去重規則對應處理的類 
         
          """ 
         
          # Enables scheduling storing requests queue in redis. 
         
          SCHEDULER  
          = 
          "scrapy_redis.scheduler.Scheduler" 
         
          # Default requests serializer is pickle, but it can be changed to any module 
         
          # with loads and dumps functions. Note that pickle is not compatible between 
         
          # python versions. 
         
          # Caveat: In python 3.x, the serializer must return strings keys and support 
         
          # bytes as values. Because of this reason the json or msgpack module will not 
         
          # work by default. In python 2.x there is no such issue and you can use 
         
          # 'json' or 'msgpack' as serializers. 
         
          # SCHEDULER_SERIALIZER = "scrapy_redis.picklecompat" 
         
          # Don't cleanup redis queues, allows to pause/resume crawls. 
         
          # SCHEDULER_PERSIST = True 
         
          # Schedule requests using a priority queue. (default) 
         
          # SCHEDULER_QUEUE_CLASS = 'scrapy_redis.queue.PriorityQueue' 
         
          # Alternative queues. 
         
          # SCHEDULER_QUEUE_CLASS = 'scrapy_redis.queue.FifoQueue' 
         
          # SCHEDULER_QUEUE_CLASS = 'scrapy_redis.queue.LifoQueue' 
         
          # Max idle time to prevent the spider from being closed when distributed crawling. 
         
          # This only works if queue class is SpiderQueue or SpiderStack, 
         
          # and may also block the same time when your spider start at the first time (because the queue is empty). 
         
          # SCHEDULER_IDLE_BEFORE_CLOSE = 10

3. 數據持久化

 
          2. 
          定義持久化，爬蟲 
          yield 
          Item對象時執行RedisPipeline 
         
          a. 將item持久化到redis時，指定key和序列化函數 
         
          REDIS_ITEMS_KEY  
          = 
          '%(spider)s:items' 
         
          REDIS_ITEMS_SERIALIZER  
          = 
          'json.dumps' 
         
          b. 使用列表保存item數據

4. 起始URL相關

 
          """ 
         
          起始URL相關 
         
          a. 獲取起始URL時，去集合中獲取仍是去列表中獲取？True，集合；False，列表 
         
          REDIS_START_URLS_AS_SET = False    # 獲取起始URL時，若是爲True，則使用self.server.spop；若是爲False，則使用self.server.lpop 
         
          b. 編寫爬蟲時，起始URL從redis的Key中獲取 
         
          REDIS_START_URLS_KEY = '%(name)s:start_urls' 
         
          """ 
         
          # If True, it uses redis' ``spop`` operation. This could be useful if you 
         
          # want to avoid duplicates in your start urls list. In this cases, urls must 
         
          # be added via ``sadd`` command or you will get a type error from redis. 
         
          # REDIS_START_URLS_AS_SET = False 
         
          # Default start urls key for RedisSpider and RedisCrawlSpider. 
         
          # REDIS_START_URLS_KEY = '%(name)s:start_urls'

scrapy-redis示例

# DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"
#
#
# from scrapy_redis.scheduler import Scheduler
# from scrapy_redis.queue import PriorityQueue
# SCHEDULER = "scrapy_redis.scheduler.Scheduler"
# SCHEDULER_QUEUE_CLASS = 'scrapy_redis.queue.PriorityQueue'          # 默認使用優先級隊列（默認），其餘：PriorityQueue（有序集合），FifoQueue（列表）、LifoQueue（列表）
# SCHEDULER_QUEUE_KEY = '%(spider)s:requests'                         # 調度器中請求存放在redis中的key
# SCHEDULER_SERIALIZER = "scrapy_redis.picklecompat"                  # 對保存到redis中的數據進行序列化，默認使用pickle
# SCHEDULER_PERSIST = True                                            # 是否在關閉時候保留原來的調度器和去重記錄，True=保留，False=清空
# SCHEDULER_FLUSH_ON_START = False                                    # 是否在開始以前清空 調度器和去重記錄，True=清空，False=不清空
# SCHEDULER_IDLE_BEFORE_CLOSE = 10                                    # 去調度器中獲取數據時，若是爲空，最多等待時間（最後沒數據，未獲取到）。
# SCHEDULER_DUPEFILTER_KEY = '%(spider)s:dupefilter'                  # 去重規則，在redis中保存時對應的key
# SCHEDULER_DUPEFILTER_CLASS = 'scrapy_redis.dupefilter.RFPDupeFilter'# 去重規則對應處理的類
#
#
#
# REDIS_HOST = '10.211.55.13'                           # 主機名
# REDIS_PORT = 6379                                     # 端口
# # REDIS_URL = 'redis://user:pass@hostname:9001'       # 鏈接URL（優先於以上配置）
# # REDIS_PARAMS  = {}                                  # Redis鏈接參數             默認：REDIS_PARAMS = {'socket_timeout': 30,'socket_connect_timeout': 30,'retry_on_timeout': True,'encoding': REDIS_ENCODING,}）
# # REDIS_PARAMS['redis_cls'] = 'myproject.RedisClient' # 指定鏈接Redis的Python模塊  默認：redis.StrictRedis
# REDIS_ENCODING = "utf-8"                              # redis編碼類型             默認：'utf-8'

配置文件

import scrapy


class ChoutiSpider(scrapy.Spider):
    name = "chouti"
    allowed_domains = ["chouti.com"]
    start_urls = (
        'http://www.chouti.com/',
    )

    def parse(self, response):
        for i in range(0,10):
            yield