GB18030 skrócona ściągawka z zasad kodowania
Wprowadź krótki tekst, wybierz WHATWG zgodny z Web GB18030, aby sprawdzić rzeczywiste bajty oraz typ jedno-, dwu- lub czterobajtowy, zachowując szybki przegląd zasad kodowania.
Jak korzystać z GB18030 szybkiego przeglądu zasad kodowania
Bajty GB18030 są obliczane w bieżącej przeglądarce przy użyciu lokalnych stałych indeksów i tabel zakresów; tekst nie jest przesyłany.
Wprowadź krótki tekst
Wprowadź maksymalnie 64 wartości skalarnych Unicode; narzędzie przetwarza znaki w ich pierwotnej kolejności.
Wyświetl typ bajtu
Wyświetlaj bajty szesnastkowe wielkimi literami znak po znaku, rozróżniając jednobajtowe ASCII, dwubajtowe indeksowane oraz czterobajtowe mapowania zakresów.
Weryfikacja reguł kodowania
Wyszukiwanie pojedynczego znaku jest powiązane z opisem reguł; można skopiować TSV lub wyczyścić dane, a nieobsługiwane elementy nie zostaną ukryte za znakiem zastępczym.
Ograniczenia i uwagi
- Wyszukiwanie korzysta ze stałych indeksów WHATWG i tabel zakresów GB18030 Encoding oraz uwzględnia aktualizacje zgodności z Webem GB18030-2022; nie jest kompletnym narzędziem do weryfikacji zgodności ze standardem.
- Dane wyjściowe przedstawiają wyłącznie bajty kodowania pojedynczej wartości skalarnej Unicode, bez pliku BOM, opakowania transmisyjnego ani stanu dekodowania.
- WHATWG wyraźnie wyklucza w algorytmie kodowania U+E5E5; zostanie wyświetlone jako „nieobsługiwane”. Narzędzie nie zastąpi oryginalnego znaku znakiem zapytania ani U+FFFD.
Często zadawane pytania
Dlaczego Emoji otrzymują wynik czterobajtowy?
GB18030 za pomocą algorytmu zakresu użycia generuje sekwencje czterobajtowe dla wielu skalarów Unicode, które nie są objęte indeksem dwubajtowym.
Dlaczego w przypadku niektórych znaków bajty GB18030 i GBK są takie same?
GB18030 dziedziczy wiele mapowań dwubajtowych, ale dodaje także zakresy czterobajtowe; taki sam wynik nie oznacza, że oba kodowania są całkowicie równoważne.
Czy za pomocą tego narzędzia można sprawdzić, czy plik jest zgodny z GB18030-2022?
Nie. Jest to wyszukiwanie kodowania znak po znaku; nie sprawdza pełnego strumienia bajtów, nieprawidłowych sekwencji, zadeklarowanych etykiet ani innych wymagań zgodności ze standardem.