Análise de frequência de palavras e caracteres

Estatísticas locais de Unicode: caracteres, palavras, linhas duplicadas e métricas básicas de texto; filtre por regras e exporte CSV com proteção contra injeção de fórmulas.

Processamento local no navegador
Esta página passou na verificação do diretório público; ative JavaScript para usar todos os recursos.
Guia de uso

Como usar a análise de frequência de palavras e caracteres

O texto é segmentado, contado e exportado apenas no navegador atual; não é enviado nem salvo.

  1. Inserir texto

    Cole o conteúdo UTF-8; a página aceita no máximo 1000000 caracteres, 50,000 linhas e limita adicionalmente o tamanho após a codificação a no máximo 1 MiB.

  2. Definir regras de contagem

    Selecione se deseja ignorar maiúsculas e minúsculas, pontuação e espaços em branco, e defina a quantidade de Top N para 1–500.

  3. Visualizar ou exportar

    Consulte a frequência de caracteres, a frequência de palavras, contagens básicas e linhas duplicadas numeradas, ou exporte BOM com proteção contra injeção de fórmulas em CSV.

Restrições e observações

  • A segmentação de palavras prioriza Intl.Segmenter; quando o navegador não oferece suporte, recorre a expressões regulares Unicode; os limites de palavras em textos em chinês, japonês e mistos podem ser diferentes.
  • A quantidade de CJK contabiliza apenas o intervalo de ideogramas unificados e não pode ser equiparada à quantidade de caracteres chineses, de caracteres ou de palavras legíveis em uma língua natural.
  • Os itens com a mesma frequência são ordenados pela ordem da primeira ocorrência; as opções de ignorar alterarão as chaves e os valores normalizados e não substituem uma análise profissional de corpus.

Perguntas frequentes

Por que a frequência das palavras pode ser diferente em navegadores distintos?

A implementação de Intl.Segmenter fornecida pelo navegador e as regras de fallback podem usar limites de palavras diferentes; a frequência de caracteres costuma ser mais estável.

Por que o CSV exportado adiciona um prefixo às células?

Um prefixo de segurança será adicionado ao conteúdo que começa com caracteres que acionam fórmulas, reduzindo o risco de ele ser executado como fórmula em softwares de planilhas.

As linhas duplicadas ignoram os espaços em branco?

As linhas duplicadas são tratadas de acordo com as opções de normalização atuais da interface da ferramenta, e os números das linhas originais correspondentes são preservados para conferência.

Feedback da páginaEncontrou um problema ou tem uma sugestão de melhoria?
Recursos de feedback precisam ser usados na versão online

Envie somente após ativar JavaScript na versão online; a funcionalidade local da ferramenta ou do exemplo não é afetada.

Ir para o feedback na versão online