Unicode правила кодирования

Введите короткий текст, чтобы посимвольно просмотреть кодовые точки Unicode, десятичные значения, соответствующую плоскость и байты UTF-8, сохранив краткий справочник диапазонов кодовых точек.

Локальная обработка в браузере
Эта страница прошла проверку открытого каталога; после включения JavaScript можно использовать все функции.
Руководство по использованию

Как использовать правило кодирования Unicode

Результаты Unicode и UTF-8 вычисляются только в текущем браузере; текст не передаётся и не сохраняется.

  1. Введите короткий текст

    Введите не более 64 Unicode скалярных значений; пробелы, повторяющиеся символы и исходный порядок сохраняются.

  2. Просмотреть информацию о кодовой точке

    Для каждого символа просматривайте запись U+, десятичную кодовую точку, плоскость Unicode и байты UTF-8 в верхнем регистре шестнадцатеричной записи.

  3. Проверить диапазон

    Поиск отдельного символа связывается с соответствующим диапазоном кодовых точек; также можно скопировать TSV или очистить результат.

Ограничения и примечания

  • Инструмент разбивает текст по скалярным значениям Unicode и не выполняет нормализацию, такую как NFC, NFD; комбинируемые последовательности сохраняются в виде нескольких строк.
  • Суррогатные кодовые единицы U+D800–U+DFFF не являются скалярными значениями Unicode; изолированные суррогатные кодовые единицы не считаются кодировкой допустимых символов.
  • Кодовая точка и байты UTF-8 не означают, что шрифт обязательно содержит глиф, и не заменяют запросы старых кодировок, таких как GBK и Big5.

Часто задаваемые вопросы

Почему один Emoji отображается в одной строке, но содержит четыре байта UTF-8?

Этот Emoji является скалярным значением Unicode из дополнительной плоскости, а UTF-8 представляет его последовательностью из четырёх байт.

Почему визуально одинаковые символы могут давать разные результаты?

Составной символ и базовый символ с комбинируемым знаком могут выглядеть похоже, но состоят из разных скалярных последовательностей Unicode; этот инструмент не выполняет автоматическую нормализацию.

В какой системе счисления указано число после U+?

В обозначении U+ используется шестнадцатеричная система; на странице также приводится десятичное значение кодовой точки для удобной перекрёстной проверки.

Отзывы о страницеНашли проблему или есть предложения по улучшению?
Функция обратной связи доступна только в онлайн-версии

Пожалуйста, отправляйте заявку после включения JavaScript в онлайн-версии; локальные функции текущего инструмента или примера не будут затронуты.

Перейти к отзыву в онлайн-версии