Аналіз частотності слів і символів у тексті
Локально аналізує Unicode: символи, слова, повторювані рядки та базові текстові показники; дає змогу фільтрувати правила й експортувати CSV із захистом від ін’єкцій формул.
Як аналізувати частотність слів і символів у тексті
Текст розбирається на слова, підраховується та експортується лише в поточному браузері; його не буде завантажено чи збережено.
Введіть текст
Вставте вміст UTF-8; сторінка приймає не більше 1000000 символів і 50,000 рядків, а після кодування розмір не має перевищувати 1 MiB.
Налаштувати правила підрахунку
Виберіть, чи ігнорувати регістр, пунктуацію та пробіли, і встановіть кількість елементів у топ-N для 1–500.
Переглянути або експортувати
Переглядайте частоту символів, частоту слів, базові підрахунки та повторювані рядки з номерами рядків або експортуйте дані з BOM і захистом від ін’єкцій формул у CSV.
Обмеження та зауваження
- Для токенізації спочатку використовуйте Intl.Segmenter; якщо браузер не підтримує це, використовуйте регулярний вираз Unicode; межі слів у китайському, японському та змішаному тексті можуть відрізнятися.
- Кількість CJK враховує лише діапазон уніфікованих ідеографічних символів і не дорівнює кількості китайських ієрогліфів у природній мові, кількості символів або кількості читабельних слів.
- Елементи з однаковою частотою впорядковуються за послідовністю першої появи; параметри ігнорування змінюють нормалізовані ключі та значення й не можуть замінити професійний корпусний аналіз.
Поширені запитання
Чому частота слів може відрізнятися в різних браузерах?
Реалізація Intl.Segmenter, яку надає браузер, і правила резервного використання можуть застосовувати різні межі слів; частотність символів зазвичай стабільніша.
Чому експортований CSV додає префікс до клітинок?
До вмісту, що починається із символу, який може запускати формулу, буде додано безпечний префікс, щоб зменшити ризик його виконання як формули в табличному програмному забезпеченні.
Чи ігноруються пробіли в повторюваних рядках?
Повторювані рядки обробляються відповідно до поточного параметра нормалізації в інтерфейсі інструмента, а відповідні вихідні номери рядків зберігаються для перевірки.