php使用iconv中文截斷問題的解決方法
來源:易賢網(wǎng) 閱讀:638 次 日期:2015-02-13 10:47:11
溫馨提示:易賢網(wǎng)小編為您整理了“php使用iconv中文截斷問題的解決方法”,方便廣大網(wǎng)友查閱!

這篇文章主要介紹了php使用iconv中文截斷問題的解決方法,以實例形式較為詳細的分析了出現(xiàn)中文截斷問題的原因與具體解決方法,具有一定參考借鑒價值,需要的朋友可以參考下

本文實例講述了php使用iconv中文截斷問題的解決方法。分享給大家供大家參考。具體分析如下:

今天做了一個采集程序,原理很簡單,使用curl方法把對方頁面的html獲取分析,然后正則提取需要的數(shù)據(jù)并保存在數(shù)據(jù)庫。

由于對方頁面是GB2312編碼,而本地使用的是UTF-8編碼。因此在采集后需要進行編碼轉(zhuǎn)換。

使用了iconv方法進行編碼轉(zhuǎn)換

iconv — 字符串按要求的字符編碼來轉(zhuǎn)換

string iconv ( string $in_charset , string $out_charset , string $str )

將字符串 str 從 in_charset 轉(zhuǎn)換編碼到 out_charset 。

轉(zhuǎn)換的方法很簡單,直接使用iconv方法就可以了

<?php

$content = iconv('GB2312', 'UTF-8', $content); //$content為采集到的內(nèi)容

?>

試驗了幾個頁面,都能正常采集。但在之后的采集中,有幾個頁面采集不完整。

一開始考慮是否正則有錯,檢查后排除此問題。經(jīng)過排查,發(fā)現(xiàn)經(jīng)過iconv轉(zhuǎn)碼后的內(nèi)容比采集的內(nèi)容少了一大段。

查看apache log,看到提示:Notice: iconv(): Detected an illegal character in input string。

翻查手冊,看到以下說明

如果你在 out_charset 后添加了字符串 //TRANSLIT,將啟用轉(zhuǎn)寫(transliteration)功能。這個意思是,當一個字符不能被目標字符集所表示時,它可以通過一個或多個形似的字符來近似表達。

如果你添加了字符串 //IGNORE,不能以目標字符集表達的字符將被默默丟棄。 否則, str 從第一個無效字符開始截斷并導致一個 E_NOTICE 。

原來iconv遇到不能識別的內(nèi)容,會從第一個不能識別的字符開始截斷,并生成一個E_NOTICE。因此后邊的內(nèi)容被丟棄了。

而在輸出字符集后加上//IGNORE則只丟棄不能識別的內(nèi)容,而不會截斷和丟棄后面的內(nèi)容。

修改程序后一切正常

<?php

$content = iconv('GB2312','UTF-8//IGNORE',$content);//$content為采集到的內(nèi)容

?>

Tips:使用iconv時,如果要使用UTF-8編碼的,請使用UTF-8而不要使用UTF8,因為UTF8有些服務(wù)器會有問題。

希望本文所述對大家的php程序設(shè)計有所幫助。

更多信息請查看IT技術(shù)專欄

更多信息請查看網(wǎng)絡(luò)編程
易賢網(wǎng)手機網(wǎng)站地址:php使用iconv中文截斷問題的解決方法

2025國考·省考課程試聽報名

  • 報班類型
  • 姓名
  • 手機號
  • 驗證碼
關(guān)于我們 | 聯(lián)系我們 | 人才招聘 | 網(wǎng)站聲明 | 網(wǎng)站幫助 | 非正式的簡要咨詢 | 簡要咨詢須知 | 新媒體/短視頻平臺 | 手機站點 | 投訴建議
工業(yè)和信息化部備案號:滇ICP備2023014141號-1 云南省教育廳備案號:云教ICP備0901021 滇公網(wǎng)安備53010202001879號 人力資源服務(wù)許可證:(云)人服證字(2023)第0102001523號
聯(lián)系電話:0871-65099533/13759567129 獲取招聘考試信息及咨詢關(guān)注公眾號:hfpxwx
咨詢QQ:1093837350(9:00—18:00)版權(quán)所有:易賢網(wǎng)