<rt id="bn8ez"></rt>
<label id="bn8ez"></label>

  • <span id="bn8ez"></span>

    <label id="bn8ez"><meter id="bn8ez"></meter></label>

    隨筆 - 6  文章 - 129  trackbacks - 0
    <2025年5月>
    27282930123
    45678910
    11121314151617
    18192021222324
    25262728293031
    1234567

    常用鏈接

    留言簿(14)

    隨筆檔案(6)

    文章分類(467)

    文章檔案(423)

    相冊

    收藏夾(18)

    JAVA

    搜索

    •  

    積分與排名

    • 積分 - 825594
    • 排名 - 49

    最新評論

    閱讀排行榜

    評論排行榜

    幾種誤解,以及亂碼產(chǎn)生的原因和解決辦法
    3.1 容易產(chǎn)生的誤解
      對編碼的誤解
    誤解一 在將“字節(jié)串”轉(zhuǎn)化成“UNICODE 字符串”時,比如在讀取文本文件時,或者通過網(wǎng)絡(luò)傳輸文本時,容易將“字節(jié)串”簡單地作為單字節(jié)字符串,采用每“一個字節(jié)”就是“一個字符”的方法進(jìn)行轉(zhuǎn)化。

    而實(shí)際上,在非英文的環(huán)境中,應(yīng)該將“字節(jié)串”作為 ANSI 字符串,采用適當(dāng)?shù)木幋a來得到 UNICODE 字符串,有可能“多個字節(jié)”才能得到“一個字符”。

    通常,一直在英文環(huán)境下做開發(fā)的程序員們,容易有這種誤解。
    誤解二 在 DOS,Windows 98 等非 UNICODE 環(huán)境下,字符串都是以 ANSI 編碼的字節(jié)形式存在的。這種以字節(jié)形式存在的字符串,必須知道是哪種編碼才能被正確地使用。這使我們形成了一個慣性思維:“字符串的編碼”。

    當(dāng) UNICODE 被支持后,Java 中的 String 是以字符的“序號”來存儲的,不是以“某種編碼的字節(jié)”來存儲的,因此已經(jīng)不存在“字符串的編碼”這個概念了。只有在“字符串”與“字節(jié)串”轉(zhuǎn)化時,或者,將一個“字節(jié)串”當(dāng)成一個 ANSI 字符串時,才有編碼的概念。

    不少的人都有這個誤解。

    第一種誤解,往往是導(dǎo)致亂碼產(chǎn)生的原因。第二種誤解,往往導(dǎo)致本來容易糾正的亂碼問題變得更復(fù)雜。

    在這里,我們可以看到,其中所講的“誤解一”,即采用每“一個字節(jié)”就是“一個字符”的轉(zhuǎn)化方法,實(shí)際上也就等同于采用 iso-8859-1 進(jìn)行轉(zhuǎn)化。因此,我們常常使用 bytes = string.getBytes("iso-8859-1") 來進(jìn)行逆向操作,得到原始的“字節(jié)串”。然后再使用正確的 ANSI 編碼,比如 string = new String(bytes, "GB2312"),來得到正確的“UNICODE 字符串”。

    3.2 非 UNICODE 程序在不同語言環(huán)境間移植時的亂碼

    非 UNICODE 程序中的字符串,都是以某種 ANSI 編碼形式存在的。如果程序運(yùn)行時的語言環(huán)境與開發(fā)時的語言環(huán)境不同,將會導(dǎo)致 ANSI 字符串的顯示失敗。

    比如,在日文環(huán)境下開發(fā)的非 UNICODE 的日文程序界面,拿到中文環(huán)境下運(yùn)行時,界面上將顯示亂碼。如果這個日文程序界面改為采用 UNICODE 來記錄字符串,那么當(dāng)在中文環(huán)境下運(yùn)行時,界面上將可以顯示正常的日文。

    由于客觀原因,有時候我們必須在中文操作系統(tǒng)下運(yùn)行非 UNICODE 的日文軟件,這時我們可以采用一些工具,比如,南極星,AppLocale 等,暫時的模擬不同的語言環(huán)境。

    3.3 網(wǎng)頁提交字符串

    當(dāng)頁面中的表單提交字符串時,首先把字符串按照當(dāng)前頁面的編碼,轉(zhuǎn)化成字節(jié)串。然后再將每個字節(jié)轉(zhuǎn)化成 "%XX" 的格式提交到 Web 服務(wù)器。比如,一個編碼為 GB2312 的頁面,提交 "中" 這個字符串時,提交給服務(wù)器的內(nèi)容為 "%D6%D0"。

    在服務(wù)器端,Web 服務(wù)器把收到的 "%D6%D0" 轉(zhuǎn)化成 [0xD6, 0xD0] 兩個字節(jié),然后再根據(jù) GB2312 編碼規(guī)則得到 "中" 字。

    在 Tomcat 服務(wù)器中,request.getParameter() 得到亂碼時,常常是因?yàn)榍懊嫣岬降?#8220;誤解一”造成的。默認(rèn)情況下,當(dāng)提交 "%D6%D0" 給 Tomcat 服務(wù)器時,request.getParameter() 將返回 [0x00D6, 0x00D0] 兩個 UNICODE 字符,而不是返回一個 "中" 字符。因此,我們需要使用 bytes = string.getBytes("iso-8859-1") 得到原始的字節(jié)串,再用 string = new String(bytes, "GB2312") 重新得到正確的字符串 "中"。

    3.4 從數(shù)據(jù)庫讀取字符串

    通過數(shù)據(jù)庫客戶端(比如 ODBC 或 JDBC)從數(shù)據(jù)庫服務(wù)器中讀取字符串時,客戶端需要從服務(wù)器獲知所使用的 ANSI 編碼。當(dāng)數(shù)據(jù)庫服務(wù)器發(fā)送字節(jié)流給客戶端時,客戶端負(fù)責(zé)將字節(jié)流按照正確的編碼轉(zhuǎn)化成 UNICODE 字符串。

    如果從數(shù)據(jù)庫讀取字符串時得到亂碼,而數(shù)據(jù)庫中存放的數(shù)據(jù)又是正確的,那么往往還是因?yàn)榍懊嫣岬降?#8220;誤解一”造成的。解決的辦法還是通過 string = new String( string.getBytes("iso-8859-1"), "GB2312") 的方法,重新得到原始的字節(jié)串,再重新使用正確的編碼轉(zhuǎn)化成字符串。

    3.5 電子郵件中的字符串

    當(dāng)一段 Text 或者 HTML 通過電子郵件傳送時,發(fā)送的內(nèi)容首先通過一種指定的字符編碼轉(zhuǎn)化成“字節(jié)串”,然后再把“字節(jié)串”通過一種指定的傳輸編碼(Content-Transfer-Encoding)進(jìn)行轉(zhuǎn)化得到另一串“字節(jié)串”。比如,打開一封電子郵件源代碼,可以看到類似的內(nèi)容:

    Content-Type: text/plain;
            charset="gb2312"
    Content-Transfer-Encoding: base64

    sbG+qcrQuqO17cf4yee74bGjz9W7+b3wudzA7dbQ0MQNCg0KvPKzxqO6uqO17cnnsaPW0NDEDQoNCg==

    最常用的 Content-Transfer-Encoding 有 Base64 和 Quoted-Printable 兩種。在對二進(jìn)制文件或者中文文本進(jìn)行轉(zhuǎn)化時,Base64 得到的“字節(jié)串”比 Quoted-Printable 更短。在對英文文本進(jìn)行轉(zhuǎn)化時,Quoted-Printable 得到的“字節(jié)串”比 Base64 更短。

    郵件的標(biāo)題,用了一種更簡短的格式來標(biāo)注“字符編碼”和“傳輸編碼”。比如,標(biāo)題內(nèi)容為 "中",則在郵件源代碼中表示為:

    // 正確的標(biāo)題格式
    Subject: =?GB2312?B?1tA=?=

    其中,

    • 第一個“=?”與“?”中間的部分指定了字符編碼,在這個例子中指定的是 GB2312。
    • “?”與“?”中間的“B”代表 Base64。如果是“Q”則代表 Quoted-Printable。
    • 最后“?”與“?=”之間的部分,就是經(jīng)過 GB2312 轉(zhuǎn)化成字節(jié)串,再經(jīng)過 Base64 轉(zhuǎn)化后的標(biāo)題內(nèi)容。

    如果“傳輸編碼”改為 Quoted-Printable,同樣,如果標(biāo)題內(nèi)容為 "中":

    // 正確的標(biāo)題格式
    Subject: =?GB2312?Q?=D6=D0?=

    如果閱讀郵件時出現(xiàn)亂碼,一般是因?yàn)?#8220;字符編碼”或“傳輸編碼”指定有誤,或者是沒有指定。比如,有的發(fā)郵件組件在發(fā)送郵件時,標(biāo)題 "中":

    // 錯誤的標(biāo)題格式
    Subject: =?ISO-8859-1?Q?=D6=D0?=

    這樣的表示,實(shí)際上是明確指明了標(biāo)題為 [0x00D6, 0x00D0],即 "中",而不是 "中"。

    4. 幾種錯誤理解的糾正

    誤解:“ISO-8859-1 是國際編碼?”

    非也。iso-8859-1 只是單字節(jié)字符集中最簡單的一種,也就是“字節(jié)編號”與“UNICODE 字符編號”一致的那種編碼規(guī)則。當(dāng)我們要把一個“字節(jié)串”轉(zhuǎn)化成“字符串”,而又不知道它是哪一種 ANSI 編碼時,先暫時地把“每一個字節(jié)”作為“一個字符”進(jìn)行轉(zhuǎn)化,不會造成信息丟失。然后再使用 bytes = string.getBytes("iso-8859-1") 的方法可恢復(fù)到原始的字節(jié)串。

    誤解:“Java 中,怎樣知道某個字符串的內(nèi)碼?”

    Java 中,字符串類 java.lang.String 處理的是 UNICODE 字符串,不是 ANSI 字符串。我們只需要把字符串作為“抽象的符號的串”來看待。因此不存在字符串的內(nèi)碼的問題。



    posted on 2007-09-13 22:34 Ke 閱讀(1520) 評論(0)  編輯  收藏 所屬分類: encoding
    主站蜘蛛池模板: 亚洲日韩乱码中文无码蜜桃臀网站| 亚洲福利视频网址| 久久大香伊焦在人线免费| 亚洲激情视频网站| 免费a在线观看播放| 一级毛片aaaaaa免费看| 九九精品国产亚洲AV日韩| 精品亚洲综合在线第一区| 最近最新中文字幕完整版免费高清| 国产成人1024精品免费| 亚洲午夜精品一区二区公牛电影院 | 亚洲毛片在线免费观看| 在线观着免费观看国产黄| 国产99视频精品免费专区| 色欲色欲天天天www亚洲伊| 亚洲国产精品久久久久婷婷软件| 好吊妞788免费视频播放| 久久综合九色综合97免费下载 | 国产成人AV免费观看| 亚洲欧美成aⅴ人在线观看| 亚洲爆乳精品无码一区二区三区 | 84pao强力永久免费高清| 免费看一级一级人妻片| 亚洲六月丁香六月婷婷蜜芽| 国产亚洲美女精品久久久2020| 成全视频免费高清 | 女人被弄到高潮的免费视频| 韩日电影在线播放免费版| 亚洲欧洲av综合色无码| 久久久久亚洲AV无码观看 | 亚洲国产精品无码AAA片| 国产免费爽爽视频免费可以看| 国产高清免费视频| 日本免费中文视频| 九九热久久免费视频| 国产亚洲综合久久| 精品亚洲456在线播放| 亚洲国产美女精品久久| 亚洲国产成人私人影院| 精品亚洲一区二区三区在线观看 | 精品免费AV一区二区三区|