字符集(unicode)是一张码表,它规定了文字与数字的一一对应关系。与计算机的内部表示没有必然的联系。
字符集:unicode,ascii
编码:UTF-8,UTF-16,GBK
字符集来说要正确编码转码一个字符需要三个关键元素:字库表
(character repertoire)、编码字符集
(coded character set)、字符编码
(character encoding form)
字库表
决定了整个字符集能够展现表示的所有字符的范围编码字符集
,即用一个编码值code point来表示一个字符在字库中的位置
字符编码
,将编码字符集和实际存储数值之间的转换关系
unicode
就是上文中提到的编码字符集,而UTF-8
就是字符编码,即unicode规则字库的一种实现形式.
如果直接存储字符集unicode
,过于浪费空间(比如英文前缀基本都是0),这时候引入字符编码utf-8
,针对字符集做一层转换优化
UTF-8
每次8个位
传输数据
变长编码
,根据不同的符号
而变化字节长度
。最小编码单位
(code unit)为一个字节。一个字节的前1-3个bit为描述性部分,后面为实际序号部分
Unicode的编号从0000
开始一直到10FFFF
共分为17个Plane
UTF-8则只实现了第一个Plane,范围是\u0000-\uFFFF
使用3byte来表示汉字
,使用1byte存储英文
Emoji就是一种在Unicode位于\u1F601-\u1F64F
区段的字符,存入UTF-8数据库会报错,原因是超出UTF-8的解析范围。
解决方案1:升级MySQL到5.6
或更高版本,并且将表字符集切换至utf8mb4
解决方案2:在入库时做Emoji字符替换成一段特殊的文字编码再入库
GBK
gbk
使用双字节编码,2byte来表示汉字
,2byte来表示英文
只有在存储信息中文占比多的时候会使用gbk存储,减少磁盘I/O,数据库cache,以及网络传输时间
为什么国内还有这么多使用 GBK 等编码的人?因为 UTF-8等编码体积比较大,占电脑空间比较多,如果面向的使用人群绝大部分都是中国人,用 GBK 等编码也可以。
乱码
编码和解码时用了不同或者不兼容的字符集
,由于两个字符集的字库表不一样,同一个汉字在两个字符表的位置也不同,最终就会出现乱码
注意解码时一定要指定字符集,否则将会使用默认的字符集进行解码。如果使用了错误的字符集,则会出现乱码。
- Java的默认字符集,可以在两个地方设定,一是执行java程序时使用-Dfile.encoding参数指定,例如-Dfile.encoding=UTF-8就指定默认字符集是UTF-8。二是在程序执行时使用Properties进行指定
- 默认字符集的优先级如下:
1.程序执行时使用Properties指定的字符集;
2.java命令的-Dfile.encoding参数指定的字符集;
3.操作系统默认的字符集;
4.JDK中默认的字符集,我跟踪了JDK1.8的源代码,发现其默认字符集指定为ISO-8859-1。