Анализ частотности слов и символов в тексте
Локально подсчитывает Unicode символов, слов, повторяющихся строк и базовых текстовых показателей, позволяет фильтровать по правилам и экспортировать CSV, защищённый от внедрения формул.
Как использовать анализ частотности слов и символов в тексте
Текст разбирается на слова, подсчитывается и экспортируется только в текущем браузере; он не загружается и не сохраняется.
Введите текст
Вставьте содержимое UTF-8; страница принимает не более 1000000 символов и 50,000 строк, а размер после кодирования дополнительно ограничен значением не более 1 MiB.
Настроить правила подсчёта
Выберите, игнорировать ли регистр, знаки препинания и пробелы, и задайте количество Top N для 1–500.
Просмотреть или экспортировать
Просматривайте частотность символов, частотность слов, базовые подсчёты и повторяющиеся строки с номерами строк или экспортируйте BOM с защитой от внедрения формул CSV.
Ограничения и примечания
- Для разбиения на слова сначала используется Intl.Segmenter; если браузер не поддерживает эту возможность, применяется регулярное выражение Unicode; границы слов в китайском, японском и смешанном тексте могут различаться.
- Количество CJK учитывает только диапазон унифицированных идеографических символов и не равно числу иероглифов в естественном языке, числу знаков или количеству читаемых слов.
- Элементы с одинаковой частотой упорядочиваются по времени первого появления; параметры игнорирования изменяют нормализованные ключи и значения и не заменяют профессиональный анализ корпуса.
Часто задаваемые вопросы
Почему частота слов может различаться в разных браузерах?
Реализация Intl.Segmenter, предоставляемая браузером, и правила отката могут использовать разные границы слов; частотность символов обычно стабильнее.
Почему экспортированный CSV добавляет префикс к ячейкам?
Для содержимого, начинающегося с символов, которые могут запускать формулу, добавляется безопасный префикс, чтобы снизить риск его выполнения как формулы в табличных программах.
Игнорируют ли повторяющиеся строки пробелы?
Повторяющиеся строки обрабатываются в соответствии с текущими параметрами нормализации в интерфейсе инструмента, а соответствующие исходные номера строк сохраняются для проверки.