字符集(unicode)和编码(utf-8/gbk)

作者: 哓晓的故事 | 来源:发表于2019-01-28 22:18 被阅读0次

字符编码和字符集ASCII，Unicode，UTF-8，UTF-
python基础-13-史上最通俗易懂的编码讲解
unicode
Unicode与UTF-8之间的关联与差别
解决Windows下打开Rstudio 中文注释乱码的情况
编码
python 编码转换
搞定编码格式问题
编码简介
字符集(unicode)和编码(utf-8/gbk)

字符集(unicode)是一张码表，它规定了文字与数字的一一对应关系。与计算机的内部表示没有必然的联系。

字符集：unicode，ascii
编码：UTF-8，UTF-16，GBK
字符集来说要正确编码转码一个字符需要三个关键元素：字库表（character repertoire）、编码字符集（coded character set）、字符编码（character encoding form）

字库表决定了整个字符集能够展现表示的所有字符的范围

编码字符集，即用一个编码值code point来表示一个字符在字库中的位置

字符编码，将编码字符集和实际存储数值之间的转换关系

unicode就是上文中提到的编码字符集，而UTF-8就是字符编码，即unicode规则字库的一种实现形式.
如果直接存储字符集unicode，过于浪费空间（比如英文前缀基本都是0），这时候引入字符编码utf-8，针对字符集做一层转换优化

UTF-8

每次8个位传输数据
变长编码，根据不同的符号而变化字节长度。最小编码单位（code unit）为一个字节。一个字节的前1-3个bit为描述性部分，后面为实际序号部分
Unicode的编号从0000开始一直到10FFFF共分为17个Plane
UTF-8则只实现了第一个Plane，范围是\u0000-\uFFFF
使用3byte来表示汉字，使用1byte存储英文

Emoji就是一种在Unicode位于\u1F601-\u1F64F区段的字符，存入UTF-8数据库会报错，原因是超出UTF-8的解析范围。
解决方案1：升级MySQL到5.6或更高版本，并且将表字符集切换至utf8mb4
解决方案2：在入库时做Emoji字符替换成一段特殊的文字编码再入库

GBK

gbk使用双字节编码，2byte来表示汉字，2byte来表示英文

只有在存储信息中文占比多的时候会使用gbk存储，减少磁盘I/O，数据库cache，以及网络传输时间
为什么国内还有这么多使用 GBK 等编码的人？因为 UTF-8等编码体积比较大，占电脑空间比较多，如果面向的使用人群绝大部分都是中国人，用 GBK 等编码也可以。

乱码

编码和解码时用了不同或者不兼容的字符集，由于两个字符集的字库表不一样，同一个汉字在两个字符表的位置也不同，最终就会出现乱码

注意解码时一定要指定字符集，否则将会使用默认的字符集进行解码。如果使用了错误的字符集，则会出现乱码。

Java的默认字符集，可以在两个地方设定，一是执行java程序时使用-Dfile.encoding参数指定，例如-Dfile.encoding=UTF-8就指定默认字符集是UTF-8。二是在程序执行时使用Properties进行指定
默认字符集的优先级如下：
1.程序执行时使用Properties指定的字符集；
2.java命令的-Dfile.encoding参数指定的字符集；
3.操作系统默认的字符集；
4.JDK中默认的字符集，我跟踪了JDK1.8的源代码，发现其默认字符集指定为ISO-8859-1。