Справочник Unicode

Как устроен малый текст Unicode

Практическое руководство о символах, глифах, неполном охвате, доступности, визуально схожих знаках и безопасном копировании.

Проверено 27 августа 2026 г. · Unicode 17.0.0 · Registry 1.0.0

Символы, глифы, шрифты и CSS — не одно и то же

Символ — это закодированная единица с назначенной кодовой точкой. Глиф — форма, которой шрифт изображает символ. Свойство CSS font-size меняет внешний вид, сохраняя исходный символ, а этот генератор заменяет сам символ.

Различие важно при копировании, поиске, индексировании, озвучивании и нормализации. Внешне похожий результат может иметь фонетическое, математическое или модифицирующее значение.

Почему единого малого алфавита не существует

Знаки, похожие на малые прописные, распределены между блоками IPA Extensions, Phonetic Extensions, Latin Extended и другими диапазонами. Наборы надстрочных и подстрочных форм также неполны. Эти символы закодированы для конкретных лингвистических, математических или технических задач, а не как декоративный алфавит.

Поэтому реестр различает проверенные сопоставления, необязательные визуальные приближения и сохранение без изменений. Если подходящего сопоставления нет, весь графемный кластер сохраняется.

Диакритика, другие письменности и эмодзи

Предварительно составленные символы с диакритикой, комбинируемые последовательности, CJK, арабское и еврейское письмо, а также другие неподдерживаемые письменности остаются целыми. Семейные эмодзи, флаги и последовательности с оттенками кожи сегментируются как графемные кластеры, поэтому видимый знак не разрезается.

Сохранение не гарантирует совместимость: в месте назначения всё равно нужны шрифт и система ввода, поддерживающие исходные и преобразованные символы.

Доступность, поиск и визуально схожие символы

Программы чтения с экрана могут произносить техническое название или смысл преобразованного символа. Поиск и модерация могут отличать его от обычной буквы. Внешне схожие символы также могут использоваться для выдачи себя за другого человека.

Сохраняйте важные сведения обычным текстом, избегайте преобразованных идентификаторов и используйте исходный обычный текст как доступную альтернативу.

Методика, происхождение и контроль изменений

Registry 1.0.0 — составленный проектом реестр на основе списков названий и данных Unicode 17.0.0. Для каждой записи указаны название результата, блок, статус, смысловое предупреждение, обратимость и источник. Тесты охватывают латинские алфавиты, цифры, комбинируемые знаки, разные письменности, эмодзи, невидимые символы, ограничения длины, буквальное отображение HTML и безопасное обратное преобразование.

Важные исправления меняют версию реестра и отмечаются в журнале изменений проекта. К повторно используемым данным Unicode применяется Unicode Data Files and Software License; за выбор сопоставлений отвечает этот проект.

Первичные источники