【爬蟲工具】下載博客轉成Markdown的形式

時間 2019-12-05

標籤爬蟲工具下載博客轉成 markdown 形式欄目 Markdown 简体版

原文原文鏈接

簡單的爬蟲工具

下載博客，並轉成Markdown的形式

爲何要寫這個工具

主要是爲了收集好的網上資源，每次看到一篇好的文章就像保存下來，可是保存網頁的可讀性太差了，若是轉換成Markdown的形式就很舒服。可是網頁中會有許多無聊的標籤干擾，因而寫個簡單的工具

使用的python庫

beautifulsoup4
requests
html2text

使用方法舉例

import html2md

url_list = [
        'http://blog.csdn.net/qq_37482544/article/details/63720726', # csdn
        'https://www.jianshu.com/p/b6220e99df2d', # jianshu
        'https://juejin.im/post/5a68437b6fb9a01ca47aabc6', # juejin
        'https://segmentfault.com/a/1190000011929414', # segmentfault
        'http://www.voidcn.com/article/p-giqfrkhb-bbr.html', # 其餘
        'https://www.cnblogs.com/zxqstrong/p/4789105.html'
    ]
for url in url_list:
    checkSite(url)