SCWS 是 Simple Chinese Word Segmentation 的首字母縮寫(即:簡易中文分詞系統)。php
這是一套基於詞頻詞典的機械式中文分詞引擎,它能將一整段的中文文本基本正確地切分紅詞。 詞是中文的最小語素單位,但在書寫時並不像英語會在詞之間用空格分開, 因此如何準確並快速分詞一直是中文分詞的攻關難點。git
SCWS 採用純 C 語言開發,不依賴任何外部庫函數,可直接使用動態連接庫嵌入應用程序, 支持的中文編碼包括 GBK、UTF-8 等。此外還提供了 PHP 擴展模塊, 可在 PHP 中快速而方便地使用分詞功能。github
分詞算法上並沒有太多創新成分,採用的是本身採集的詞頻詞典,並輔以必定的專有名稱,人名,地名, 數字年代等規則識別來達到基本分詞,經小範圍測試準確率在 90% ~ 95% 之間, 基本上能知足一些小型搜索引擎、關鍵字提取等場合運用。首次雛形版本發佈於 2005 年末。算法
版本 | 類型 | 平臺 | 性能 | 其它 |
---|---|---|---|---|
SCWS-1.1.x | C 代碼 | *Unix*/*PHP* | 準確: 95%, 召回: 91%, 速度: 1.2MB/sec PHP擴展分詞速度: 250KB/sec |
[下載] [文檔] [安裝說明] |
php_scws.dll(1) | PHP擴展庫 | Windows/PHP 4.4.x | 準確: 95%, 召回: 91%, 速度: 40KB/sec | [下載] [文檔] [安裝說明] |
php_scws.dll(2) | PHP擴展庫 | Windows/PHP 5.2.x | 準確: 95%, 召回: 91%, 速度: 40KB/sec | [下載] [文檔] [安裝說明] |
php_scws.dll(3) | PHP擴展庫 | Windows/PHP 5.3.x | 準確: 95%, 召回: 91%, 速度: 40KB/sec | [下載] [文檔] [安裝說明] |
php_scws.dll(4) | PHP擴展庫 | Windows/PHP 5.4.x | 準確: 95%, 召回: 91%, 速度: 40KB/sec | [下載] [文檔] [安裝說明] |
PSCWS23 | PHP源代碼 | 不限 (不支持UTF-8) | 準確: 93%, 召回: 89%, 速度: 960KB/min | [下載] [文檔] |
PSCWS4 | PHP源代碼 | 不限 | 準確: 95%, 召回: 91%, 速度: 160KB/min | [下載] [文檔] |