Anconda3使用gensim訓練中文維基百科語料庫

首先須要下載中文語料,下載地址爲:http://download.wikipedia.com/zhwiki/latest/zhwiki-latest-pages-articles.xml.bz2python 下載完中文語料後,須要將XML文件轉化爲TEXT文件,用python3.x版本可能會出現bytes與str的問題,筆者用如下代碼親測有效json # -*- coding:utf-8 -*-
相關文章
相關標籤/搜索