Python3學習之路~2.9 字符編碼與轉碼

時間 2020-05-31

標籤 python3 python 學習之路 2.9 字符編碼欄目 Python 简体版

原文原文鏈接

詳細文章:html

http://www.cnblogs.com/yuanchenqi/articles/5956943.htmlpython

http://www.diveintopython3.net/strings.htmlide

需知:網站

1.在python2默認編碼是ASCII, python3裏默認是unicode編碼

2.unicode 分爲 utf-32(佔4個字節),utf-16(佔兩個字節)，utf-8(佔1-4個字節)， so utf-16就是如今最經常使用的unicode版本，不過在文件裏存的仍是utf-8，由於utf8省空間spa

3.在py3中encode,在轉碼的同時還會把string 變成bytes類型，decode在解碼的同時還會把bytes變回string.net

上圖僅適用於py2code

先說python2htm

py2裏默認編碼是ascii
文件開頭那個編碼聲明是告訴解釋這個代碼的程序以什麼編碼格式把這段代碼讀入到內存，由於到了內存裏，這段代碼實際上是以bytes二進制格式存的，不過即便是2進制流，也能夠按不一樣的編碼格式轉成2進制流，你懂麼？
若是在文件頭聲明瞭#_*_coding:utf-8*_，就能夠寫中文了，不聲明的話，python在處理這段代碼時按ascii，顯然會出錯，加了這個聲明後，裏面的代碼就全是utf-8格式了
在有#_*_coding:utf-8*_的狀況下，你在聲明變量若是寫成name=u"大保健"，那這個字符就是unicode格式，不加這個u,那你聲明的字符串就是utf-8格式
utf-8 to gbk怎麼轉，utf8先decode成unicode,再encode成gbk

再說python3blog

py3裏默認文件編碼就是utf-8,因此能夠直接寫中文，也不須要文件頭聲明編碼了，乾的漂亮
你聲明的變量默認是unicode編碼，不是utf-8, 由於默認便是unicode了（不像在py2裏，你想直接聲明成unicode還得在變量前加個u）, 此時你想轉成gbk的話，直接your_str.encode("gbk")便可以
但py3裏，你在your_str.encode("gbk")時，感受好像還加了一個動做，就是就是encode的數據變成了bytes裏，我擦，這是怎麼個狀況，由於在py3裏，str and bytes作了明確的區分，你能夠理解爲bytes就是2進制流，你會說，我看到的不是010101這樣的2進制呀，那是由於python爲了讓你能對數據進行操做而在內存級別又幫你作了一層封裝，不然讓你直接看到一堆2進制，你能看出哪一個字符對應哪段2進制麼？什麼？本身換算，得了吧，你連超過2位數的數字加減運算都費勁，還仍是省省心吧。　　
那你說，在py2裏好像也有bytes呀，是的，不過py2裏的bytes只是對str作了個別名(python2裏的str就是bytes, py3裏的str是unicode)，沒有像py3同樣給你顯示的多出來一層封裝，但其實其內部仍是封裝了的。這麼講吧，不管是2仍是三，從硬盤到內存，數據格式都是 010101二進制到-->b'\xe4\xbd\xa0\xe5\xa5\xbd' bytes類型－－>按照指定編碼轉成你能看懂的文字

#-*-coding:utf-8-*-
import sys print(sys.getdefaultencoding()) #ascii
 msg = "你好" msg_gbk = msg.decode("utf-8").encode("gbk") msg_gbk_to_utf8 = msg_gbk.decode("gbk").encode("utf-8") print(msg) print(msg_gbk) print(msg_gbk_to_utf8)

in python2

import sys print(sys.getdefaultencoding()) #utf-8
msg="你好" msg_gbk = msg.encode("gbk") #默認就是Unicode，不用再decode
msg_gbk_to_unicode = msg_gbk.decode("gbk") msg_gbk_to_utf8 = msg_gbk.decode("gbk").encode("utf-8") print(msg) #你好
print(msg_gbk) #b'\xc4\xe3\xba\xc3'
print(msg_gbk_to_unicode) #你好
print(msg_gbk_to_utf8) #b'\xe4\xbd\xa0\xe5\xa5\xbd'