美文网首页
字符集(unicode)和编码(utf-8/gbk)

字符集(unicode)和编码(utf-8/gbk)

作者: 哓晓的故事 | 来源:发表于2019-01-28 22:18 被阅读0次

    字符集(unicode)是一张码表,它规定了文字与数字的一一对应关系。与计算机的内部表示没有必然的联系。

    字符集:unicode,ascii
    编码:UTF-8,UTF-16,GBK
    字符集来说要正确编码转码一个字符需要三个关键元素:字库表(character repertoire)、编码字符集(coded character set)、字符编码(character encoding form)

    1. 字库表决定了整个字符集能够展现表示的所有字符的范围
    2. 编码字符集,即用一个编码值code point来表示一个字符字库中位置
    3. 字符编码,将编码字符集和实际存储数值之间的转换关系

    unicode就是上文中提到的编码字符集,而UTF-8就是字符编码,即unicode规则字库的一种实现形式.
    如果直接存储字符集unicode,过于浪费空间(比如英文前缀基本都是0),这时候引入字符编码utf-8,针对字符集做一层转换优化

    UTF-8

    每次8个位传输数据
    变长编码,根据不同的符号变化字节长度最小编码单位(code unit)为一个字节。一个字节的前1-3个bit为描述性部分,后面为实际序号部分
    Unicode的编号从0000开始一直到10FFFF共分为17个Plane
    UTF-8则只实现了第一个Plane,范围是\u0000-\uFFFF
    使用3byte来表示汉字,使用1byte存储英文

    Emoji就是一种在Unicode位于\u1F601-\u1F64F区段的字符,存入UTF-8数据库会报错,原因是超出UTF-8的解析范围。
    解决方案1:升级MySQL到5.6或更高版本,并且将表字符集切换至utf8mb4
    解决方案2:在入库时做Emoji字符替换成一段特殊的文字编码再入库

    GBK

    gbk使用双字节编码2byte来表示汉字2byte来表示英文

    只有在存储信息中文占比多的时候会使用gbk存储,减少磁盘I/O,数据库cache,以及网络传输时间
    为什么国内还有这么多使用 GBK 等编码的人?因为 UTF-8等编码体积比较大占电脑空间比较多,如果面向的使用人群绝大部分都是中国人,用 GBK 等编码也可以。

    乱码

    编码和解码时用了不同或者不兼容字符集,由于两个字符集的字库表不一样,同一个汉字在两个字符表的位置也不同,最终就会出现乱码

    注意解码时一定要指定字符集,否则将会使用默认的字符集进行解码。如果使用了错误的字符集,则会出现乱码。

    1. Java的默认字符集,可以在两个地方设定,一是执行java程序时使用-Dfile.encoding参数指定,例如-Dfile.encoding=UTF-8就指定默认字符集是UTF-8。二是在程序执行时使用Properties进行指定
    2. 默认字符集的优先级如下:
      1.程序执行时使用Properties指定的字符集;
      2.java命令的-Dfile.encoding参数指定的字符集;
      3.操作系统默认的字符集;
      4.JDK中默认的字符集,我跟踪了JDK1.8的源代码,发现其默认字符集指定为ISO-8859-1。

    相关文章

      网友评论

          本文标题:字符集(unicode)和编码(utf-8/gbk)

          本文链接:https://www.haomeiwen.com/subject/lcghgxtx.html