Unicode参考

小型Unicode文字的工作原理

一份关于字符、字形、不完整覆盖、无障碍、易混淆字符和安全复制的实用指南。

审核日期 2026年8月27日 · Unicode 17.0.0 · Registry 1.0.0

字符、字形、字体与CSS并不相同

字符是分配了码点的编码单位;字形是字体用来绘制该字符的形状。CSS的font-size只改变显示方式并保留原字符,而本生成器会改变字符本身。

当文字被复制、搜索、索引、读出或规范化时,这一区别非常重要。外观相似的输出可能带有语音学、数学或修饰符含义。

为什么不存在大小一致的小型字母表

类似小型大写的符号分布在IPA Extensions、Phonetic Extensions、Latin Extended等不同区块。上标和下标形式也不完整。它们是为特定语言学、数学或技术用途编码的,并非装饰字母表。

因此,本注册表会区分已审核的映射、可选的视觉近似和原样保留。找不到合适映射时,会保留整个字素簇。

重音符号、其他文字系统与表情符号

预组合重音字符、组合序列、中日韩文字、阿拉伯文字、希伯来文字及其他不支持的文字系统会保持完整。家庭表情、旗帜和肤色序列按字素簇分割,工具不会从中间切开一个可见符号。

保留原样并不代表兼容性得到保证:目标位置仍需具备支持原字符和转换后字符的字体与输入流程。

无障碍、搜索与易混淆字符

屏幕阅读器可能按技术名称或含义读出转换后的字符。搜索和内容审核工具也可能将其与普通字母区别处理。外观相似的字符还可能被用于冒充他人。

请用普通文字保留重要信息,避免在标识符中使用转换后的文字,并把纯文本源内容作为无障碍替代。

方法、来源与变更控制

Registry 1.0.0是本项目依据Unicode 17.0.0字符名称表和数据编制的注册表。每个条目都记录输出名称、区块、状态、语义警告、可逆性和来源。测试覆盖拉丁字母、数字、组合标记、多种文字系统、表情符号、不可见字符、长度限制、HTML的纯文字呈现和安全往返转换。

重要修正会改变注册表版本,并记录在项目变更日志中。复用的Unicode数据适用Unicode Data Files and Software License;具体映射取舍由本项目负责。

一手资料