Referencia de Unicode
Cómo funciona el texto pequeño Unicode
Una guía práctica sobre caracteres, glifos, cobertura incompleta, accesibilidad, caracteres confundibles y copia segura.
Revisado 27 de agosto de 2026 · Unicode 17.0.0 · Registro 1.0.0
Caracteres, glifos, fuentes y CSS son cosas distintas
Un carácter es una unidad codificada con un punto de código asignado. Un glifo es la forma que emplea una fuente para dibujarlo. La propiedad font-size de CSS cambia la presentación, pero mantiene el carácter original; este generador cambia el propio carácter.
Esta distinción importa al copiar, buscar, indexar, pronunciar o normalizar el texto. Un resultado de aspecto similar puede tener un significado fonético, matemático o modificador.
Por qué no existe un alfabeto uniformemente pequeño
Los símbolos parecidos a versalitas se distribuyen por IPA Extensions, Phonetic Extensions, los bloques Latin Extended y otros intervalos. Las formas de superíndice y subíndice también están incompletas. Se codificaron para usos lingüísticos, matemáticos o técnicos concretos, no como alfabeto decorativo.
Por eso, este registro distingue entre correspondencias revisadas, aproximaciones visuales opcionales y caracteres que se conservan. Mantiene un grafema completo cuando no existe una correspondencia adecuada.
Acentos, otras escrituras y emoji
Los acentos precompuestos, las secuencias combinadas, los caracteres CJK, árabes y hebreos, y las escrituras no compatibles permanecen intactos. Los emoji familiares, las banderas y las secuencias con tonos de piel se segmentan como grafemas para que la herramienta no corte un símbolo visible.
Esta conservación no garantiza la compatibilidad: el destino sigue necesitando una fuente y un sistema de entrada que admitan tanto los caracteres originales como los transformados.
Accesibilidad, búsqueda y caracteres confundibles
Los lectores de pantalla pueden anunciar un carácter transformado por su nombre técnico o significado. Las herramientas de búsqueda y moderación pueden tratarlo de forma distinta a la letra normal. Los caracteres visualmente similares también pueden utilizarse para suplantar identidades.
Conserva la información esencial en texto normal, evita los identificadores transformados y utiliza el texto de origen como alternativa accesible.
Método, procedencia y control de cambios
El Registro 1.0.0 es una selección propia del proyecto basada en las listas de nombres y los datos de Unicode 17.0.0. Cada entrada registra el nombre de salida, el bloque, el estado, la advertencia semántica, la reversibilidad y la fuente. Las pruebas abarcan alfabetos latinos, cifras, marcas combinadas, varias escrituras, emoji, caracteres invisibles, límites, HTML literal y conversiones de ida y vuelta seguras.
Las correcciones importantes cambian la versión del registro y se anotan en el historial de cambios del proyecto. La Unicode Data Files and Software License se aplica a los datos Unicode reutilizados; las decisiones de correspondencia seleccionadas son responsabilidad del proyecto.
Referencias primarias
- Resumen de la versión Unicode 17.0.0 y base de datos de caracteres. Fuente primaria
- Listas de nombres Unicode Phonetic Extensions y Superscripts and Subscripts. Fuente primaria 1 Fuente primaria 2
- Unicode Standard Annex n.º 29 sobre los límites de los grafemas. Fuente primaria
- Unicode Technical Standard n.º 39 sobre caracteres confundibles y riesgos de suplantación. Fuente primaria
- Unicode Data Files and Software License. Fuente primaria