编码知识深度讲解

从冷知识出发,理解汉字编码的核心原理。每个知识点都配有交互演示,点击“展开详情”从后端获取深度讲解。

① 中日韩“艺”字:编码相同,写法不同
藝
当前:中国大陆

核心概念:CJK 统一汉字

Unicode 将中国、日本、韩国、越南使用的汉字共用同一个编码,但字形由各地区的字体决定。也就是说,“艺”的编码只有一个(U+85DD),但中国大陆、日本、韩国可以显示各自习惯的写法。

💡 这就是 “编码统一,字形不同” 的核心思想——电脑先认“人”(编码),再换“衣服”(字体)。
② “豆腐块”□:编码存在,但没“照片”
□
当前:字体缺失 → 显示方块

核心概念:编码与字体的关系

“豆腐块”(□)不是编码不存在,而是当前系统/字体没有这个字的“照片”(字形数据)。

💡 编码 = 身份证号(计算机能查到这个人)
字体 = 证件照(计算机能画出这个人的样子)
有身份证号但没有证件照 → 显示为 □
③ 64画的“𪚥”:有身份证,没照片
𪚥
加载数据中...

核心概念:编码完备性 vs 实际支持

“𪚥”(zhé)早在 Unicode 扩展 B 区就有编码(U+2A6A5),但绝大多数系统字体没有包含它,所以日常无法显示。这反映了编码标准的完备性与实际字体覆盖之间的落差。

💡 编码标准已经收录了超过 10 万个汉字,但普通手机/电脑只覆盖 2-3 万个。安装 Noto CJK 或 花园明朝 等大字符集字体,可以“补上照片”。
④ 变体选择符:让同一个字“换装”
說
当前:标准体(U+8AAA)

核心概念:IVS(表意文字变体序列)

IVS 让同一个编码下的字可以显示不同的写法变体,而不需要分配新的编码。

💡 IVS 是古籍数字化、异体字处理的关键技术——同一个“身份证号”,不同的“证件照”。
⑤ “biáng”字:从“拼积木”到正式身份证
2010年前
动态组字(拼积木)临时显示
2017年
提交 Unicode 提案,进入 IRG 审核
2020年
正式分配码位 U+30EDD,收录于 Unicode 13.0

核心概念:编码收录流程

一个新汉字要进入 Unicode,需要经过提交提案 → IRG 审核 → 正式分配码位的流程,通常需要数年时间。

💡 动态组字是编码收录的“过渡方案”——先拼出来用着,等正式编码下来再换。
⑥ GB2312 的拼音排序:为了查表方便
阿 (ā) → 1-1
埃 (āi) → 1-2
挨 (āi) → 1-3
哎 (āi) → 1-4
唉 (āi) → 1-5
... 按拼音排序 ...
座 (zuò) → 1-3755

核心概念:编码表的设计逻辑

GB2312 的一级汉字(3755个)按拼音排序,二级汉字(3008个)按部首排序。

💡 编码表的排序方式反映了当时的使用场景——没有输入法,靠查表输入,排序越合理,查得越快。
⑦ Unicode 的“豪宅区”:扩展 B 到 J 区
BMP A B C D E F G H I J
BMP 区(20992字)→ 扩展 J 区(4298字),越往右越生僻

核心概念:Unicode 的分区结构

Unicode 将汉字按使用频率分配在不同区块:BMP 是常用字“市中心”,扩展 A-J 区是生僻字“郊区”。

💡 Unicode 17.0 已收录超过 10 万个 CJK 汉字,分布从 BMP 一直延伸到扩展 J 区。