テキストの単語頻度と文字頻度の分析
ローカルで Unicode の文字数、単語数、重複行、および基本的なテキスト指標を集計し、ルールで絞り込み、数式インジェクション対策済みの CSV としてエクスポートできます。
ブラウザー内でローカル処理
このページは公開ディレクトリのチェックに合格しています。JavaScript を有効にすると、すべての機能を使用できます。
使用ガイド
テキストの単語頻度と文字頻度の分析方法
テキストは現在のブラウザー内でのみ単語分割、カウント、エクスポートされ、アップロードも保存もされません。
入力テキスト
UTF-8の内容を貼り付けてください。ページで受け付けられるのは最大1000000文字、50,000行で、エンコード後のサイズも1 MiB以下に制限されます。
集計ルールを設定
大文字と小文字、句読点、空白を無視するかどうかを選択し、1–500 の Top N 数を設定します。
表示またはエクスポート
文字頻度、単語頻度、基本的なカウント、行番号付きの重複行を確認したり、BOM を含み、数式インジェクションを防止した CSV をエクスポートしたりできます。
制限事項と注意点
- 単語分割にはまず Intl.Segmenter を使用します。ブラウザが対応していない場合は Unicode 正規表現にフォールバックします。中国語、日本語、および混在テキストでは、単語の境界が異なる場合があります。
- CJK の数量は統合漢字の範囲のみを集計しており、自然言語における漢字数、文字数、または可読語数と同一視することはできません。
- 同頻度の項目は初めて現れた順に並びます。無視するオプションを使用すると正規化後のキーと値が変わるため、専門的なコーパス分析の代わりにはなりません。
よくある質問
なぜ異なるブラウザーでは単語頻度が異なる可能性があるのですか?
ブラウザーが提供する Intl.Segmenter の実装とフォールバックルールでは、異なる単語境界が使用される場合があります。文字の頻度のほうが通常は安定しています。
エクスポートした CSV では、なぜセルにプレフィックスが追加されるのですか?
数式として解釈される文字で始まる内容には、安全な接頭辞を付加し、表計算ソフトで数式として実行されるリスクを軽減します。
重複行では空白を無視しますか?
重複行は、ツール画面で現在選択されている正規化オプションに従って処理され、照合用に対応する元の行番号が保持されます。