Référence Unicode
Fonctionnement du petit texte Unicode
Un guide pratique des caractères, des glyphes, de la couverture incomplète, de l’accessibilité, des caractères visuellement similaires et des précautions de copie.
Révisé le 27 août 2026 · Unicode 17.0.0 · Registre 1.0.0
Caractères, glyphes, polices et CSS sont différents
Un caractère est une unité codée à laquelle un point de code est attribué. Un glyphe est la forme qu’une police utilise pour le dessiner. La propriété CSS font-size modifie la présentation tout en conservant le caractère d’origine ; ce générateur change le caractère lui-même.
Cette distinction compte lorsque le texte est copié, recherché, indexé, prononcé ou normalisé. Une sortie d’apparence similaire peut avoir un sens phonétique, mathématique ou modificatif.
Pourquoi il n’existe pas d’alphabet uniformément petit
Les symboles semblables à des petites capitales sont répartis entre les blocs IPA Extensions, Phonetic Extensions, Latin Extended et d’autres plages. Les formes en exposant et en indice sont elles aussi incomplètes. Elles ont été encodées pour des usages linguistiques, mathématiques ou techniques précis, et non comme alphabet décoratif.
Ce registre distingue donc les correspondances vérifiées, les approximations visuelles facultatives et les caractères transmis tels quels. Il conserve un graphème entier lorsqu’aucune correspondance appropriée n’existe.
Accents, autres écritures et émojis
Les accents précomposés, les séquences combinées, les caractères CJK, arabes, hébreux et les écritures non prises en charge restent intacts. Les émojis de famille, les drapeaux et les séquences avec teinte de peau sont segmentés en graphèmes afin que l’outil ne coupe pas un symbole visible.
Cette conservation ne garantit pas la compatibilité : la destination doit encore disposer d’une police et d’un système de saisie qui prennent en charge les caractères d’origine et transformés.
Accessibilité, recherche et caractères visuellement similaires
Un lecteur d’écran peut annoncer un caractère transformé par son nom technique ou son sens. Les outils de recherche et de modération peuvent le traiter différemment de la lettre ordinaire. Des caractères visuellement proches peuvent aussi servir à usurper une identité.
Conservez les informations essentielles en texte ordinaire, évitez les identifiants transformés et utilisez le texte source comme solution de remplacement accessible.
Méthode, provenance et gestion des changements
Le Registre 1.0.0 est une sélection propre au projet fondée sur les listes de noms et les données Unicode 17.0.0. Chaque entrée indique le nom de sortie, le bloc, l’état, l’avertissement sémantique, la réversibilité et la source. Les tests couvrent les alphabets latins, les chiffres, les signes combinatoires, plusieurs écritures, les émojis, les caractères invisibles, les limites, le HTML littéral et les allers-retours sûrs.
Toute correction importante modifie la version du registre et figure dans le journal des modifications du projet. La licence Unicode Data Files and Software s’applique aux données Unicode réutilisées ; les choix de correspondance restent sous la responsabilité du projet.
Références primaires
- Présentation de la version Unicode 17.0.0 et base de données des caractères. Source primaire
- Listes de noms Unicode Phonetic Extensions et Superscripts and Subscripts. Source primaire 1 Source primaire 2
- Unicode Standard Annex nº 29 sur les limites des graphèmes. Source primaire
- Unicode Technical Standard nº 39 sur les caractères visuellement similaires et les risques d’usurpation. Source primaire
- Unicode Data Files and Software License. Source primaire