Unicode aturan pengodean
Masukkan teks singkat untuk melihat titik kode Unicode, nilai desimal, bidangnya, dan byte UTF-8 per karakter, serta mempertahankan referensi cepat rentang titik kode.
Cara menggunakan aturan pengodean Unicode
Hasil Unicode dan UTF-8 hanya dihitung di browser saat ini, dan teks tidak akan diunggah atau disimpan.
Masukkan teks singkat
Masukkan hingga 64 nilai skalar Unicode; spasi, karakter duplikat, dan urutan asli akan dipertahankan.
Lihat informasi titik kode
Lihat notasi U+ per karakter, titik kode desimal, bidang Unicode dan byte UTF-8 heksadesimal huruf besar.
Periksa rentang
Pencarian satu karakter akan menautkan rentang titik kode terkait; Anda juga dapat menyalin TSV atau menghapus hasil.
Batasan dan catatan
- Alat ini membagi berdasarkan nilai skalar Unicode, tanpa melakukan normalisasi seperti NFC dan NFD; urutan gabungan akan dipertahankan sebagai beberapa baris.
- Item surrogate U+D800–U+DFFF bukan nilai skalar Unicode; item surrogate terisolasi tidak akan diperlakukan sebagai pengodean karakter yang valid.
- Titik kode dan byte UTF-8 tidak dapat memastikan bahwa font memiliki glif, dan juga tidak dapat menggantikan kueri encoding lama seperti GBK, Big5.
Pertanyaan umum
Mengapa satu Emoji hanya tampil dalam satu baris tetapi memiliki empat byte UTF-8?
Emoji ini adalah skalar Unicode dari bidang suplementer, dan UTF-8 merepresentasikannya dengan urutan empat byte.
Mengapa karakter yang tampak sama dapat menghasilkan hasil yang berbeda?
Karakter prekomposisi dan karakter dasar yang ditambah tanda kombinasi dapat menampilkan glif yang serupa, tetapi terdiri dari urutan skalar Unicode yang berbeda; alat ini tidak melakukan normalisasi otomatis.
Angka setelah U+ menggunakan basis bilangan apa?
Notasi U+ menggunakan heksadesimal; halaman ini juga menampilkan titik kode desimal untuk memudahkan pemeriksaan silang.