iconv 中文截斷問題的解決方法

時間 2019-11-24

標籤 iconv 中文截斷問題解決方法简体版

原文原文鏈接

iconv 中文截斷問題的解決方法php

今天作了一個採集程序，原理很簡單，使用curl方法把對方頁面的html獲取分析，而後正則提取須要的數據並保存在數據庫。
html

因爲對方頁面是GB2312編碼，而本地使用的是UTF-8編碼。所以在採集後須要進行編碼轉換。
數據庫

使用了iconv方法進行編碼轉換
apache

[php] view plain copy 服務器

轉換的方法很簡單，直接使用iconv方法就能夠了
spa

[php] view plain copy .net

試驗了幾個頁面，都能正常採集。但在以後的採集中，有幾個頁面採集不完整。

一開始考慮是否正則有錯，檢查後排除此問題。通過排查，發現通過iconv轉碼後的內容比採集的內容少了一大段。

查看apache log，看到提示：Notice: iconv(): Detected an illegal character in input string。

翻查手冊，看到如下說明

若是你在 out_charset 後添加了字符串 //TRANSLIT，將啓用轉寫（transliteration）功能。這個意思是，當一個字符不能被目標字符集所表示時，它能夠經過一個或多個形似的字符來近似表達。

若是你添加了字符串 //IGNORE，不能以目標字符集表達的字符將被默默丟棄。不然， str 從第一個無效字符開始截斷並致使一個 E_NOTICE 。

原來iconv遇到不能識別的內容，會從第一個不能識別的字符開始截斷，並生成一個E_NOTICE。所以後邊的內容被丟棄了。

而在輸出字符集後加上//IGNORE則只丟棄不能識別的內容，而不會截斷和丟棄後面的內容。

修改程序後一切正常

[php] view plain copy

Tips：使用iconv時,若是要使用UTF-8編碼的，請使用UTF-8而不要使用UTF8，由於UTF8有些服務器會有問題。

相關標籤/搜索

每日一句

每一个你不满意的现在，都有一个你没有努力的曾经。