文字詞頻與字元頻率分析
本機統計 Unicode 字元、詞語、重複行及基本文字指標,可篩選規則並匯出防止公式注入的 CSV。
瀏覽器本地處理
該頁面已通過公開目錄檢查;啟用JavaScript後可使用完整功能。
使用指南
如何使用文字詞頻與字元頻率分析
文字只會在目前瀏覽器中分詞、計數和匯出,不會上傳或儲存。
輸入文本
貼上 UTF-8 內容;頁面最多接收 1000000 字元、50,000 行,並進一步限制編碼後大小不超過 1 MiB。
設定統計規則
選擇是否忽略大小寫、標點符號和空白,並設定 1–500 的 Top N 數量。
檢視或匯出
查看字元頻率、詞頻、基本計數和帶行號的重複行,或匯出包含 BOM 且可防止公式注入的 CSV。
限制與注意事項
- 分詞優先使用 Intl.Segmenter;瀏覽器不支援時改用 Unicode 正規表示式,中文、日文及混合文字的詞語邊界可能不同。
- CJK 數量只統計統一表意文字範圍,不能等同於自然語言中的漢字數、字數或可讀詞數。
- 同頻項目按首次出現順序排列;忽略選項會改變正規化後的鍵和值,不能取代專業語料分析。
常見問題
為什麼不同瀏覽器的詞頻可能不同?
瀏覽器提供的 Intl.Segmenter 實作和回退規則可能使用不同的詞語邊界,字元頻率通常更穩定。
匯出的 CSV 為什麼給儲存格加前綴?
對以公式觸發字元開頭的內容會加上安全前綴,降低在試算表軟體中被當作公式執行的風險。
重複列會忽略空白嗎?
重複行按工具介面目前的正規化選項處理,並保留對應原始行號供核對。