Referência Unicode
Como o texto pequeno Unicode funciona
Um guia prático sobre caracteres, glifos, cobertura incompleta, acessibilidade, caracteres confundíveis e cópia segura.
Revisado em 27 de agosto de 2026 · Unicode 17.0.0 · Registro 1.0.0
Caracteres, glifos, fontes e CSS são diferentes
Um caractere é uma unidade codificada com um ponto de código atribuído. Um glifo é a forma usada por uma fonte para desenhá-lo. A propriedade font-size do CSS muda a apresentação e mantém o caractere original; este gerador muda o próprio caractere.
Essa diferença importa quando o texto é copiado, pesquisado, indexado, pronunciado ou normalizado. Uma saída de aparência semelhante pode carregar um significado fonético, matemático ou modificador.
Por que não existe um alfabeto uniformemente pequeno
Símbolos parecidos com versaletes estão distribuídos por IPA Extensions, Phonetic Extensions, blocos Latin Extended e outros intervalos. As formas sobrescritas e subscritas também são incompletas. Elas foram codificadas para usos linguísticos, matemáticos ou técnicos específicos, não como um alfabeto decorativo.
Por isso, este registro diferencia mapeamentos revisados, aproximações visuais opcionais e caracteres preservados. Ele mantém um grafema inteiro quando não há um mapeamento adequado.
Acentos, outros sistemas de escrita e emojis
Acentos pré-compostos, sequências combinantes, CJK, árabe, hebraico e sistemas de escrita não compatíveis permanecem intactos. Emojis de família, bandeiras e sequências de tons de pele são segmentados como grafemas para que a ferramenta não corte um símbolo visível.
A preservação não garante compatibilidade: o destino ainda precisa de uma fonte e de um sistema de entrada compatíveis com os caracteres originais e transformados.
Acessibilidade, pesquisa e caracteres confundíveis
Leitores de tela podem anunciar um caractere transformado pelo nome técnico ou pelo significado. Ferramentas de pesquisa e moderação podem tratá-lo de forma diferente da letra comum. Caracteres visualmente semelhantes também podem ser usados para usurpação de identidade.
Mantenha informações essenciais em texto comum, evite identificadores transformados e use o texto de origem como alternativa acessível.
Método, origem e controle de alterações
O Registro 1.0.0 é uma seleção deste projeto baseada nas listas de nomes e nos dados do Unicode 17.0.0. Cada entrada registra o nome de saída, o bloco, o status, o alerta semântico, a reversibilidade e a fonte. Os testes abrangem alfabetos latinos, algarismos, marcas combinantes, diversos sistemas de escrita, emojis, caracteres invisíveis, limites, HTML literal e conversões de ida e volta seguras.
Correções importantes mudam a versão do registro e são anotadas no histórico de alterações do projeto. A Unicode Data Files and Software License se aplica aos dados Unicode reutilizados; as escolhas de mapeamento selecionadas permanecem sob a responsabilidade deste projeto.
Referências primárias
- Visão geral da versão Unicode 17.0.0 e banco de dados de caracteres. Fonte primária
- Listas de nomes Unicode Phonetic Extensions e Superscripts and Subscripts. Fonte primária 1 Fonte primária 2
- Unicode Standard Annex nº 29 sobre limites de grafemas. Fonte primária
- Unicode Technical Standard nº 39 sobre caracteres confundíveis e riscos de falsificação. Fonte primária
- Unicode Data Files and Software License. Fonte primária