Análise de frequência de palavras e caracteres
Estatísticas locais de Unicode: caracteres, palavras, linhas duplicadas e métricas básicas de texto; filtre por regras e exporte CSV com proteção contra injeção de fórmulas.
Como usar a análise de frequência de palavras e caracteres
O texto é segmentado, contado e exportado apenas no navegador atual; não é enviado nem salvo.
Inserir texto
Cole o conteúdo UTF-8; a página aceita no máximo 1000000 caracteres, 50,000 linhas e limita adicionalmente o tamanho após a codificação a no máximo 1 MiB.
Definir regras de contagem
Selecione se deseja ignorar maiúsculas e minúsculas, pontuação e espaços em branco, e defina a quantidade de Top N para 1–500.
Visualizar ou exportar
Consulte a frequência de caracteres, a frequência de palavras, contagens básicas e linhas duplicadas numeradas, ou exporte BOM com proteção contra injeção de fórmulas em CSV.
Restrições e observações
- A segmentação de palavras prioriza Intl.Segmenter; quando o navegador não oferece suporte, recorre a expressões regulares Unicode; os limites de palavras em textos em chinês, japonês e mistos podem ser diferentes.
- A quantidade de CJK contabiliza apenas o intervalo de ideogramas unificados e não pode ser equiparada à quantidade de caracteres chineses, de caracteres ou de palavras legíveis em uma língua natural.
- Os itens com a mesma frequência são ordenados pela ordem da primeira ocorrência; as opções de ignorar alterarão as chaves e os valores normalizados e não substituem uma análise profissional de corpus.
Perguntas frequentes
Por que a frequência das palavras pode ser diferente em navegadores distintos?
A implementação de Intl.Segmenter fornecida pelo navegador e as regras de fallback podem usar limites de palavras diferentes; a frequência de caracteres costuma ser mais estável.
Por que o CSV exportado adiciona um prefixo às células?
Um prefixo de segurança será adicionado ao conteúdo que começa com caracteres que acionam fórmulas, reduzindo o risco de ele ser executado como fórmula em softwares de planilhas.
As linhas duplicadas ignoram os espaços em branco?
As linhas duplicadas são tratadas de acordo com as opções de normalização atuais da interface da ferramenta, e os números das linhas originais correspondentes são preservados para conferência.