Unicode-Nachschlagewerk
So funktioniert kleiner Unicode-Text
Ein praktischer Leitfaden zu Zeichen, Glyphen, unvollständiger Abdeckung, Barrierefreiheit, verwechselbaren Zeichen und sicherem Kopieren.
Geprüft am 27. August 2026 · Unicode 17.0.0 · Register 1.0.0
Zeichen, Glyphen, Schriften und CSS sind verschieden
Ein Zeichen ist eine codierte Einheit mit einem zugewiesenen Codepunkt. Eine Glyphe ist die Form, mit der eine Schrift es zeichnet. Die CSS-Eigenschaft font-size ändert die Darstellung, behält aber das ursprüngliche Zeichen bei; dieser Generator ändert das Zeichen selbst.
Dieser Unterschied ist beim Kopieren, Suchen, Indexieren, Aussprechen oder Normalisieren wichtig. Eine ähnlich aussehende Ausgabe kann eine phonetische, mathematische oder modifizierende Bedeutung haben.
Warum es kein einheitlich kleines Alphabet gibt
Kapitälchenähnliche Symbole sind über IPA Extensions, Phonetic Extensions, Latin-Extended-Blöcke und weitere Bereiche verteilt. Auch Hoch- und Tiefstellungen sind unvollständig. Sie wurden für bestimmte sprachliche, mathematische oder technische Zwecke codiert, nicht als dekoratives Alphabet.
Dieses Register unterscheidet daher geprüfte Zuordnungen, optionale visuelle Annäherungen und unveränderte Durchleitung. Es bewahrt einen vollständigen Graphemcluster, wenn keine geeignete Zuordnung vorhanden ist.
Akzente, andere Schriftsysteme und Emojis
Vorab zusammengesetzte Akzente, kombinierende Sequenzen, CJK, Arabisch, Hebräisch und nicht unterstützte Schriften bleiben intakt. Familien-Emojis, Flaggen und Hautfarben-Sequenzen werden als Graphemcluster segmentiert, damit das Werkzeug kein sichtbares Symbol zerteilt.
Die Bewahrung ist keine Kompatibilitätsgarantie: Das Ziel benötigt weiterhin eine Schrift und eine Eingabeverarbeitung, die ursprüngliche und umgewandelte Zeichen unterstützen.
Barrierefreiheit, Suche und verwechselbare Zeichen
Screenreader können ein umgewandeltes Zeichen mit seinem technischen Namen oder seiner Bedeutung ansagen. Such- und Moderationswerkzeuge können es anders behandeln als den normalen Buchstaben. Optisch ähnliche Zeichen lassen sich außerdem zur Identitätstäuschung missbrauchen.
Bewahre wesentliche Informationen als normalen Text auf, vermeide umgewandelte Kennungen und nutze den Ausgangstext als barrierefreie Alternative.
Methode, Herkunft und Änderungskontrolle
Register 1.0.0 ist eine projektspezifische Auswahl auf Grundlage der Namenslisten und Daten von Unicode 17.0.0. Jeder Eintrag erfasst Ausgabenamen, Block, Status, semantischen Hinweis, Umkehrbarkeit und Quellenangabe. Die Tests umfassen lateinische Alphabete, Ziffern, kombinierende Zeichen, mehrere Schriften, Emojis, unsichtbare Zeichen, Grenzwerte, wörtliches HTML und sichere Hin- und Rückwandlungen.
Wichtige Korrekturen ändern die Registerversion und werden im Änderungsprotokoll des Projekts vermerkt. Die Unicode Data Files and Software License gilt für wiederverwendete Unicode-Daten; die kuratierten Zuordnungsentscheidungen bleiben in der Verantwortung dieses Projekts.
Primärquellen
- Überblick über Unicode 17.0.0 und Zeichendatenbank. Primärquelle
- Unicode-Namenslisten Phonetic Extensions und Superscripts and Subscripts. Primärquelle 1 Primärquelle 2
- Unicode Standard Annex Nr. 29 zu Graphemclustergrenzen. Primärquelle
- Unicode Technical Standard Nr. 39 zu verwechselbaren Zeichen und Täuschungsrisiken. Primärquelle
- Unicode Data Files and Software License. Primärquelle