Аналіз частотності слів і символів у тексті

Локально аналізує Unicode: символи, слова, повторювані рядки та базові текстові показники; дає змогу фільтрувати правила й експортувати CSV із захистом від ін’єкцій формул.

Локальна обробка в браузері
Цю сторінку перевірено за відкритим каталогом; після ввімкнення JavaScript можна користуватися повною функціональністю.
Посібник з використання

Як аналізувати частотність слів і символів у тексті

Текст розбирається на слова, підраховується та експортується лише в поточному браузері; його не буде завантажено чи збережено.

  1. Введіть текст

    Вставте вміст UTF-8; сторінка приймає не більше 1000000 символів і 50,000 рядків, а після кодування розмір не має перевищувати 1 MiB.

  2. Налаштувати правила підрахунку

    Виберіть, чи ігнорувати регістр, пунктуацію та пробіли, і встановіть кількість елементів у топ-N для 1–500.

  3. Переглянути або експортувати

    Переглядайте частоту символів, частоту слів, базові підрахунки та повторювані рядки з номерами рядків або експортуйте дані з BOM і захистом від ін’єкцій формул у CSV.

Обмеження та зауваження

  • Для токенізації спочатку використовуйте Intl.Segmenter; якщо браузер не підтримує це, використовуйте регулярний вираз Unicode; межі слів у китайському, японському та змішаному тексті можуть відрізнятися.
  • Кількість CJK враховує лише діапазон уніфікованих ідеографічних символів і не дорівнює кількості китайських ієрогліфів у природній мові, кількості символів або кількості читабельних слів.
  • Елементи з однаковою частотою впорядковуються за послідовністю першої появи; параметри ігнорування змінюють нормалізовані ключі та значення й не можуть замінити професійний корпусний аналіз.

Поширені запитання

Чому частота слів може відрізнятися в різних браузерах?

Реалізація Intl.Segmenter, яку надає браузер, і правила резервного використання можуть застосовувати різні межі слів; частотність символів зазвичай стабільніша.

Чому експортований CSV додає префікс до клітинок?

До вмісту, що починається із символу, який може запускати формулу, буде додано безпечний префікс, щоб зменшити ризик його виконання як формули в табличному програмному забезпеченні.

Чи ігноруються пробіли в повторюваних рядках?

Повторювані рядки обробляються відповідно до поточного параметра нормалізації в інтерфейсі інструмента, а відповідні вихідні номери рядків зберігаються для перевірки.

Відгук про сторінкуВиявили проблему або маєте пропозиції щодо покращення?
Функцію зворотного зв’язку потрібно використовувати в онлайн-версії

Будь ласка, увімкніть JavaScript в онлайн-версії, а потім надішліть; локальні функції поточного інструмента або прикладу не будуть зачеплені.

Перейти до онлайн-версії, щоб залишити відгук