python爬蟲去重策略

python爬蟲去重策略 一、將訪問過的URL保存到數據庫中python 二、將訪問過的URL保存到set中,只須要o(1)的代價就能夠查詢URL數據庫        1000000000*2byte*50個字符/1024/1024/1024 = 9G python爬蟲 三、URL通過md5等方法哈希後保存到set中函數 四、用bitmap方法,將訪問過的URL經過hash函數映射到某一位spa
相關文章
相關標籤/搜索