Справочник Unicode
Как устроен малый текст Unicode
Практическое руководство о символах, глифах, неполном охвате, доступности, визуально схожих знаках и безопасном копировании.
Проверено 27 августа 2026 г. · Unicode 17.0.0 · Registry 1.0.0
Символы, глифы, шрифты и CSS — не одно и то же
Символ — это закодированная единица с назначенной кодовой точкой. Глиф — форма, которой шрифт изображает символ. Свойство CSS font-size меняет внешний вид, сохраняя исходный символ, а этот генератор заменяет сам символ.
Различие важно при копировании, поиске, индексировании, озвучивании и нормализации. Внешне похожий результат может иметь фонетическое, математическое или модифицирующее значение.
Почему единого малого алфавита не существует
Знаки, похожие на малые прописные, распределены между блоками IPA Extensions, Phonetic Extensions, Latin Extended и другими диапазонами. Наборы надстрочных и подстрочных форм также неполны. Эти символы закодированы для конкретных лингвистических, математических или технических задач, а не как декоративный алфавит.
Поэтому реестр различает проверенные сопоставления, необязательные визуальные приближения и сохранение без изменений. Если подходящего сопоставления нет, весь графемный кластер сохраняется.
Диакритика, другие письменности и эмодзи
Предварительно составленные символы с диакритикой, комбинируемые последовательности, CJK, арабское и еврейское письмо, а также другие неподдерживаемые письменности остаются целыми. Семейные эмодзи, флаги и последовательности с оттенками кожи сегментируются как графемные кластеры, поэтому видимый знак не разрезается.
Сохранение не гарантирует совместимость: в месте назначения всё равно нужны шрифт и система ввода, поддерживающие исходные и преобразованные символы.
Доступность, поиск и визуально схожие символы
Программы чтения с экрана могут произносить техническое название или смысл преобразованного символа. Поиск и модерация могут отличать его от обычной буквы. Внешне схожие символы также могут использоваться для выдачи себя за другого человека.
Сохраняйте важные сведения обычным текстом, избегайте преобразованных идентификаторов и используйте исходный обычный текст как доступную альтернативу.
Методика, происхождение и контроль изменений
Registry 1.0.0 — составленный проектом реестр на основе списков названий и данных Unicode 17.0.0. Для каждой записи указаны название результата, блок, статус, смысловое предупреждение, обратимость и источник. Тесты охватывают латинские алфавиты, цифры, комбинируемые знаки, разные письменности, эмодзи, невидимые символы, ограничения длины, буквальное отображение HTML и безопасное обратное преобразование.
Важные исправления меняют версию реестра и отмечаются в журнале изменений проекта. К повторно используемым данным Unicode применяется Unicode Data Files and Software License; за выбор сопоставлений отвечает этот проект.
Первичные источники
- Обзор версии Unicode 17.0.0 и база данных символов. Первичный источник
- Списки названий Unicode Phonetic Extensions и Superscripts and Subscripts. Первичный источник 1 Первичный источник 2
- Unicode Standard Annex #29 о границах графемных кластеров. Первичный источник
- Unicode Technical Standard #39 о визуально схожих символах и рисках подмены. Первичный источник
- Unicode Data Files and Software License. Первичный источник