字符集(unicode)和编码(utf-8/gbk)

字符集(unicode)是一张码表,它规定了文字与数字的一一对应关系。与计算机的内部表示没有必然的联系。

字符集:unicode,ascii
编码:UTF-8,UTF-16,GBK
字符集来说要正确编码转码一个字符需要三个关键元素:字库表(character repertoire)、编码字符集(coded character set)、字符编码(character encoding form)

  1. 字库表决定了整个字符集能够展现表示的所有字符的范围
  2. 编码字符集,即用一个编码值code point来表示一个字符字库中位置
  3. 字符编码,将编码字符集和实际存储数值之间的转换关系

unicode就是上文中提到的编码字符集,而UTF-8就是字符编码,即unicode规则字库的一种实现形式.
如果直接存储字符集unicode,过于浪费空间(比如英文前缀基本都是0),这时候引入字符编码utf-8,针对字符集做一层转换优化

UTF-8

每次8个位传输数据
变长编码,根据不同的符号变化字节长度最小编码单位(code unit)为一个字节。一个字节的前1-3个bit为描述性部分,后面为实际序号部分
Unicode的编号从0000开始一直到10FFFF共分为17个Plane
UTF-8则只实现了第一个Plane,范围是\u0000-\uFFFF
使用3byte来表示汉字,使用1byte存储英文

Emoji就是一种在Unicode位于\u1F601-\u1F64F区段的字符,存入UTF-8数据库会报错,原因是超出UTF-8的解析范围。
解决方案1:升级MySQL到5.6或更高版本,并且将表字符集切换至utf8mb4
解决方案2:在入库时做Emoji字符替换成一段特殊的文字编码再入库

GBK

gbk使用双字节编码2byte来表示汉字2byte来表示英文

只有在存储信息中文占比多的时候会使用gbk存储,减少磁盘I/O,数据库cache,以及网络传输时间
为什么国内还有这么多使用 GBK 等编码的人?因为 UTF-8等编码体积比较大占电脑空间比较多,如果面向的使用人群绝大部分都是中国人,用 GBK 等编码也可以。

乱码

编码和解码时用了不同或者不兼容字符集,由于两个字符集的字库表不一样,同一个汉字在两个字符表的位置也不同,最终就会出现乱码

注意解码时一定要指定字符集,否则将会使用默认的字符集进行解码。如果使用了错误的字符集,则会出现乱码。

  1. Java的默认字符集,可以在两个地方设定,一是执行java程序时使用-Dfile.encoding参数指定,例如-Dfile.encoding=UTF-8就指定默认字符集是UTF-8。二是在程序执行时使用Properties进行指定
  2. 默认字符集的优先级如下:
    1.程序执行时使用Properties指定的字符集;
    2.java命令的-Dfile.encoding参数指定的字符集;
    3.操作系统默认的字符集;
    4.JDK中默认的字符集,我跟踪了JDK1.8的源代码,发现其默认字符集指定为ISO-8859-1。
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 211,817评论 6 492
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 90,329评论 3 385
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 157,354评论 0 348
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 56,498评论 1 284
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 65,600评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 49,829评论 1 290
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 38,979评论 3 408
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 37,722评论 0 266
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,189评论 1 303
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 36,519评论 2 327
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 38,654评论 1 340
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,329评论 4 330
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 39,940评论 3 313
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 30,762评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 31,993评论 1 266
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 46,382评论 2 360
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 43,543评论 2 349

推荐阅读更多精彩内容

  • 字符集和编码简介 在编程中常常可以见到各种字符集和编码,包括ASCII,MBCS,Unicode等字符集。确切的说...
    兰山小亭阅读 8,464评论 0 13
  • 原文在这里:各种字符集和编码详解 在软件的编码和实现中,我们可能会碰到个 一个比较头疼的问题--编码,不同字符间的...
    舌尖上的大胖阅读 1,787评论 0 2
  • 字符是用户可以读写的最小单位。计算机所能支持的字符组成的集合,就叫做字符集。字符集通常以二维表的形式存在。二维表的...
    刘惜有阅读 8,089评论 2 14
  • 曾经在网上看过一段话“旅行的意义,不是逃避,不是艳遇,不是放松心情,更不是炫耀,而是为了洗一洗身体和灵魂,给自...
    ff49b9f02ad8阅读 395评论 0 0
  • 期待已久,最萌的狭义西游记的演绎。我觉得这才是悟空和唐僧师徒关系的打开方式。 当江流儿手掌对着被冰封的大圣的手掌 ...
    贰囍阅读 358评论 0 1