Unicode coderingsregels
Voer een korte tekst in om per teken het codepunt van Unicode, de decimale waarde, het bijbehorende vlak en de bytes van UTF-8 te bekijken, met behoud van een snelreferentie voor codepuntbereiken.
Hoe gebruikt u Unicode coderingsregels
De resultaten van Unicode en UTF-8 worden alleen in de huidige browser berekend; de tekst wordt niet geüpload of opgeslagen.
Korte tekst invoeren
Voer maximaal 64 Unicode scalaire waarden in; spaties, dubbele tekens en de oorspronkelijke volgorde blijven behouden.
Codepuntinformatie bekijken
Bekijk per teken de notatie met de letter U en een plusteken, het decimale codepunt, het Unicode-vlak en de bytes in hoofdletters volgens UTF-8.
Bereik controleren
Een query voor één teken synchroniseert het bijbehorende codepuntbereik; u kunt ook TSV kopiëren of de resultaten wissen.
Beperkingen en aandachtspunten
- De tool splitst op basis van Unicode scalaire waarden en voert geen normalisatie uit, zoals NFC en NFD; gecombineerde reeksen blijven als meerdere regels behouden.
- Surrogaten U+D800–U+DFFF zijn geen scalaire waarden van Unicode; losse surrogaten worden niet als geldige tekencodering behandeld.
- Codepunten en UTF-8 bytes kunnen niet aantonen dat een lettertype glyphs bevat en vervangen evenmin zoekopdrachten voor oudere coderingen zoals GBK en Big5.
Veelgestelde vragen
Waarom toont één Emoji slechts één regel, maar vier UTF-8 bytes?
Deze Emoji is een scalaire waarde uit een aanvullend vlak, Unicode, en UTF-8 geeft deze weer met een reeks van vier bytes.
Waarom kunnen tekens die hetzelfde lijken verschillende resultaten opleveren?
Voorgecomponeerde tekens en basistekens met combinatiemarkeringen kunnen vergelijkbare glyphs weergeven, maar bestaan uit verschillende reeksen scalaire waarden van Unicode; deze tool normaliseert niet automatisch.
In welke getalsbasis staan de cijfers na U+?
De notatie met U plus gebruikt hexadecimale waarden; de pagina geeft ook de decimale codepunten om kruiscontroles te vergemakkelijken.