iconv 中文截斷問題的解決方法php
今天作了一個採集程序,原理很簡單,使用curl方法把對方頁面的html獲取分析,而後正則提取須要的數據並保存在數據庫。
html
因爲對方頁面是GB2312編碼,而本地使用的是UTF-8編碼。所以在採集後須要進行編碼轉換。
數據庫
使用了iconv方法進行編碼轉換
apache
[php] view plain copy 服務器
iconv — 字符串按要求的字符編碼來轉換 curl
string iconv ( string $in_charset , string $out_charset , string $str ) 編碼
將字符串 str 從 in_charset 轉換編碼到 out_charset 。 url
轉換的方法很簡單,直接使用iconv方法就能夠了
spa
[php] view plain copy .net
<?php
$content = iconv('GB2312', 'UTF-8', $content); // $content爲採集到的內容
?>
試驗了幾個頁面,都能正常採集。但在以後的採集中,有幾個頁面採集不完整。
一開始考慮是否正則有錯,檢查後排除此問題。通過排查,發現通過iconv轉碼後的內容比採集的內容少了一大段。
查看apache log,看到提示:Notice: iconv(): Detected an illegal character in input string。
翻查手冊,看到如下說明
若是你在 out_charset 後添加了字符串 //TRANSLIT,將啓用轉寫(transliteration)功能。這個意思是,當一個字符不能被目標字符集所表示時,它能夠經過一個或多個形似的字符來近似表達。
若是你添加了字符串 //IGNORE,不能以目標字符集表達的字符將被默默丟棄。 不然, str 從第一個無效字符開始截斷並致使一個 E_NOTICE 。
原來iconv遇到不能識別的內容,會從第一個不能識別的字符開始截斷,並生成一個E_NOTICE。所以後邊的內容被丟棄了。
而在輸出字符集後加上//IGNORE則只丟棄不能識別的內容,而不會截斷和丟棄後面的內容。
修改程序後一切正常
[php] view plain copy
<?php
$content = iconv('GB2312', 'UTF-8//IGNORE', $content); // $content爲採集到的內容
?>
Tips:使用iconv時,若是要使用UTF-8編碼的,請使用UTF-8而不要使用UTF8,由於UTF8有些服務器會有問題。