Unicode กฎการเข้ารหัส
ป้อนข้อความสั้น ๆ เพื่อดู Unicode จุดรหัส ค่าฐานสิบ ระนาบที่สังกัด และไบต์ UTF-8 ทีละอักขระ พร้อมคงตารางอ้างอิงช่วงจุดรหัสไว้
วิธีใช้กฎการเข้ารหัส Unicode
ผลลัพธ์ของ Unicode และ UTF-8 จะคำนวณภายในเบราว์เซอร์ปัจจุบันเท่านั้น และจะไม่อัปโหลดหรือบันทึกข้อความ
ป้อนข้อความสั้น ๆ
ป้อนค่าสเกลาร์ 64 ค่า Unicode ได้สูงสุด โดยจะคงช่องว่าง อักขระซ้ำ และลำดับเดิมไว้ทั้งหมด
ดูข้อมูลจุดรหัส
ดูสัญกรณ์ U+ จุดรหัสฐานสิบ Unicode ระนาบ และไบต์ UTF-8 ฐานสิบหกตัวพิมพ์ใหญ่ทีละอักขระ
ตรวจสอบช่วง
การค้นหาอักขระเดียวจะแสดงช่วงจุดรหัสที่เกี่ยวข้องด้วย และยังสามารถคัดลอก TSV หรือล้างผลลัพธ์ได้
ข้อจำกัดและข้อควรระวัง
- เครื่องมือจะแยกตามค่าสเกลาร์ Unicode โดยไม่ทำ NFC、NFD หรือการทำให้เป็นรูปแบบมาตรฐานอื่น ๆ ลำดับอักขระผสมจะคงไว้เป็นหลายบรรทัด
- คู่ตัวแทน U+D800–U+DFFF ไม่ใช่ค่าสเกลาร์ Unicode และคู่ตัวแทนเดี่ยวจะไม่ถูกถือเป็นการเข้ารหัสอักขระที่ถูกต้อง
- จุดรหัสและไบต์ UTF-8 ไม่ได้ยืนยันว่าแบบอักษรจะต้องมีรูปทรงอักขระ และไม่สามารถใช้แทนการค้นหาการเข้ารหัสแบบเก่า เช่น GBK และ Big5 ได้
คำถามที่พบบ่อย
ทำไม Emoji หนึ่งตัวที่แสดงเพียงหนึ่งบรรทัดจึงมีสี่ไบต์ UTF-8
อีโมจินี้เป็นสเกลาร์ Unicode บนระนาบเสริม และ UTF-8 ใช้ลำดับสี่ไบต์เพื่อแสดงอักขระนี้
เหตุใดอักขระที่ดูเหมือนกันจึงอาจให้ผลลัพธ์ต่างกัน
อักขระที่ประกอบไว้ล่วงหน้าและอักขระพื้นฐานที่มีเครื่องหมายประกอบอาจแสดงเป็นรูปทรงคล้ายกัน แต่ประกอบด้วยลำดับสเกลาร์ Unicode ที่แตกต่างกัน เครื่องมือนี้จะไม่ทำการทำให้เป็นรูปแบบมาตรฐานโดยอัตโนมัติ
ตัวเลขหลัง U+ เป็นเลขฐานอะไร
สัญกรณ์ U+ ใช้เลขฐานสิบหก และหน้านี้ยังแสดงจุดรหัสฐานสิบเพื่อให้ตรวจสอบเทียบกันได้