Анализ частотности слов и символов в тексте

Локально подсчитывает Unicode символов, слов, повторяющихся строк и базовых текстовых показателей, позволяет фильтровать по правилам и экспортировать CSV, защищённый от внедрения формул.

Локальная обработка в браузере
Эта страница прошла проверку открытого каталога; после включения JavaScript можно использовать все функции.
Руководство по использованию

Как использовать анализ частотности слов и символов в тексте

Текст разбирается на слова, подсчитывается и экспортируется только в текущем браузере; он не загружается и не сохраняется.

  1. Введите текст

    Вставьте содержимое UTF-8; страница принимает не более 1000000 символов и 50,000 строк, а размер после кодирования дополнительно ограничен значением не более 1 MiB.

  2. Настроить правила подсчёта

    Выберите, игнорировать ли регистр, знаки препинания и пробелы, и задайте количество Top N для 1–500.

  3. Просмотреть или экспортировать

    Просматривайте частотность символов, частотность слов, базовые подсчёты и повторяющиеся строки с номерами строк или экспортируйте BOM с защитой от внедрения формул CSV.

Ограничения и примечания

  • Для разбиения на слова сначала используется Intl.Segmenter; если браузер не поддерживает эту возможность, применяется регулярное выражение Unicode; границы слов в китайском, японском и смешанном тексте могут различаться.
  • Количество CJK учитывает только диапазон унифицированных идеографических символов и не равно числу иероглифов в естественном языке, числу знаков или количеству читаемых слов.
  • Элементы с одинаковой частотой упорядочиваются по времени первого появления; параметры игнорирования изменяют нормализованные ключи и значения и не заменяют профессиональный анализ корпуса.

Часто задаваемые вопросы

Почему частота слов может различаться в разных браузерах?

Реализация Intl.Segmenter, предоставляемая браузером, и правила отката могут использовать разные границы слов; частотность символов обычно стабильнее.

Почему экспортированный CSV добавляет префикс к ячейкам?

Для содержимого, начинающегося с символов, которые могут запускать формулу, добавляется безопасный префикс, чтобы снизить риск его выполнения как формулы в табличных программах.

Игнорируют ли повторяющиеся строки пробелы?

Повторяющиеся строки обрабатываются в соответствии с текущими параметрами нормализации в интерфейсе инструмента, а соответствующие исходные номера строк сохраняются для проверки.

Отзывы о страницеНашли проблему или есть предложения по улучшению?
Функция обратной связи доступна только в онлайн-версии

Пожалуйста, отправляйте заявку после включения JavaScript в онлайн-версии; локальные функции текущего инструмента или примера не будут затронуты.

Перейти к отзыву в онлайн-версии