利用簡單的正則表達式完成半自動爬蟲開發---爬取百度貼吧帖子下面的評論

1.首先選擇百度貼吧的某個帖子 2.查看頁面的源代碼,然後把源代碼保存下來。 3.根據源代碼找出規律,根據先抓大再抓小的原則,把每一層樓先抓出來,再抓出用戶名,樓層數,評論內容,評論時間 4.爬蟲代碼–思路【用正則表達式抓出每一層的信息,然後把字典存入列表,然後用csv模塊,把含有字典元素的列表寫入csv文件】(csv文件直接用excel打開在不同的操作系統有可能出現亂碼,但是用python打印出
相關文章
相關標籤/搜索