中国大陆国家标准演进
图:汉字编码标准演进时间线(中国大陆与国际)
| 标准 | 年份 | 收字数 | 特点 |
|---|---|---|---|
| GB 2312-80 | 1980 | 6763 | 第一个简体汉字编码标准,分一级(按拼音)和二级(按部首) |
| GBK | 1995 | 21003 | 非国家标准,但被广泛使用,兼容 GB2312,支持繁体 |
| GB 18030-2000 | 2000 | 27533 | 正式扩展,与 Unicode 建立映射 |
| GB 18030-2022 | 2022 | 87887 | 现行强制标准,2023年8月实施,分为三个实现级别 |
GB 18030-2022 实现级别
- 级别1:约2.7万字,满足基础中文支持(常用字、部首、符号)。
- 级别2:增补《通用规范汉字表》全部8105字,覆盖现代汉语用字。
- 级别3:全部87887字,包括古籍、人名、地名、方言、科学用字。
强制性要求:在中国市场销售的软件和硬件产品须至少达到级别1,鼓励达到级别3。
台湾地区编码标准
台湾地区主要使用以下两种汉字编码标准:
| 标准 | 发布时间 | 收字数 | 特点 |
|---|---|---|---|
| BIG5 (大五码) | 1984 | 13053 | 由台湾五大厂商共同制定,是最流行的繁体中文编码,但未正式标准化。 |
| CNS 11643 | 1992 (第一版) | 48426 (目前) | 官方正式标准,全称为《中文標準交換碼》,共16个平面,支持繁体、异体、古字。 |
注意:BIG5 在民间应用广泛,但字符集小于 CNS 11643。CNS 11643 第1-7平面常用于政府信息化和古籍数字化。
两者都与 Unicode 有明确映射关系,可通过 Unicode 官方映射表 转换。
Unicode 标准发展
图:Unicode CJK 统一汉字扩展区块分布(BMP 至扩展 J 区)
- Unicode 1.0 (1991) – 初期版本
- Unicode 3.0 (1999) – 引入 CJK 扩展 A 区
- Unicode 5.2 (2009) – 引入 CJK 扩展 C 区
- Unicode 11.0 (2018) – 引入 CJK 扩展 E 区
- Unicode 17.0 (2025) – 新增 CJK 扩展 J 区(4298字),CJK 总数突破 10 万
CJK 统一汉字区块分布(部分):
| 区块名称 | 码位范围 | 字符数 |
|---|---|---|
| CJK Unified Ideographs | 4E00 – 9FFF | 20992 |
| CJK Extension A | 3400 – 4DBF | 6592 |
| CJK Extension B | 20000 – 2A6DF | 42711 |
| CJK Extension C | 2A700 – 2B73F | 4149 |
| CJK Extension D | 2B740 – 2B81F | 222 |
| CJK Extension E | 2B820 – 2CEAF | 5762 |
| CJK Extension F | 2CEB0 – 2EBEF | 7473 |
| CJK Extension G | 30000 – 3134F | 4939 |
| CJK Extension H | 31350 – 323AF | 4192 |
| CJK Extension I | 2EBF0 – 2EE5F | 622 |
| CJK Extension J | 323B0 – 3347F | 4298 |
编码标准码位覆盖对比
下方色块展示了不同编码标准在 Unicode BMP(基本多文种平面)码位空间中的覆盖范围。
GB2312 范围
GBK 扩展范围
GB18030 覆盖
Unicode BMP 全部
U+0000
U+4E00
汉字起始 U+9FFF
常用汉字结束 U+FFFF
汉字起始 U+9FFF
常用汉字结束 U+FFFF
💡 解读: GB2312 覆盖常用汉字区域(约36%-56%),GBK 在此基础上向两侧扩展,GB18030-2022 覆盖整个 BMP 和部分扩展区,Unicode 17.0 已收录超过 10 万个 CJK 汉字。