文字詞頻與字元頻率分析

本機統計 Unicode 字元、詞語、重複行及基本文字指標,可篩選規則並匯出防止公式注入的 CSV。

瀏覽器本地處理
該頁面已通過公開目錄檢查;啟用JavaScript後可使用完整功能。
使用指南

如何使用文字詞頻與字元頻率分析

文字只會在目前瀏覽器中分詞、計數和匯出,不會上傳或儲存。

  1. 輸入文本

    貼上 UTF-8 內容;頁面最多接收 1000000 字元、50,000 行,並進一步限制編碼後大小不超過 1 MiB。

  2. 設定統計規則

    選擇是否忽略大小寫、標點符號和空白,並設定 1–500 的 Top N 數量。

  3. 檢視或匯出

    查看字元頻率、詞頻、基本計數和帶行號的重複行,或匯出包含 BOM 且可防止公式注入的 CSV。

限制與注意事項

  • 分詞優先使用 Intl.Segmenter;瀏覽器不支援時改用 Unicode 正規表示式,中文、日文及混合文字的詞語邊界可能不同。
  • CJK 數量只統計統一表意文字範圍,不能等同於自然語言中的漢字數、字數或可讀詞數。
  • 同頻項目按首次出現順序排列;忽略選項會改變正規化後的鍵和值,不能取代專業語料分析。

常見問題

為什麼不同瀏覽器的詞頻可能不同?

瀏覽器提供的 Intl.Segmenter 實作和回退規則可能使用不同的詞語邊界,字元頻率通常更穩定。

匯出的 CSV 為什麼給儲存格加前綴?

對以公式觸發字元開頭的內容會加上安全前綴,降低在試算表軟體中被當作公式執行的風險。

重複列會忽略空白嗎?

重複行按工具介面目前的正規化選項處理,並保留對應原始行號供核對。

頁面反饋發現問題或有改進建議?
反饋功能需要在線上版使用

請在線上版啟用 JavaScript 後提交;目前工具或案例的本地功能不受影響。

前往線上版反饋