文本词频与字符频率分析
本地统计 Unicode 字符、词语、重复行及基础文本指标,可筛选规则并导出防公式注入的 CSV。
浏览器本地处理
该页面已通过公开目录检查;启用JavaScript后可使用完整功能。
使用指南
如何使用文本词频与字符频率分析
文本只在当前浏览器中分词、计数和导出,不会上传或保存。
输入文本
粘贴 UTF-8 内容;页面最多接收 100 万字符、50,000 行,并进一步限制编码后大小不超过 1 MiB。
设置统计规则
选择是否忽略大小写、标点和空白,并设置 1–500 的 Top N 数量。
查看或导出
查看字符频率、词频、基础计数和带行号的重复行,或导出带 BOM 且防公式注入的 CSV。
限制与注意事项
- 分词优先使用 Intl.Segmenter;浏览器不支持时退回 Unicode 正则,中文、日文及混合文本的词边界可能不同。
- CJK 数量只统计统一表意文字范围,不能等同于自然语言中的汉字数、字数或可读词数。
- 同频项目按首次出现顺序排列;忽略选项会改变归一化后的键和值,不能替代专业语料分析。
常见问题
为什么不同浏览器的词频可能不同?
浏览器提供的 Intl.Segmenter 实现和回退规则可能使用不同词边界,字符频率通常更稳定。
导出的 CSV 为什么给单元格加前缀?
对以公式触发字符开头的内容会加安全前缀,降低在表格软件中被当作公式执行的风险。
重复行会忽略空白吗?
重复行按工具界面当前的归一化选项处理,并保留对应原始行号供核对。