Análisis de la frecuencia de palabras y caracteres en un texto

Calcula localmente Unicode caracteres, palabras, líneas repetidas y métricas de texto básicas; permite filtrar reglas y exportar CSV protegido contra la inyección de fórmulas.

Procesamiento local en el navegador
Esta página ha superado la comprobación del directorio público; activa JavaScript para usar todas las funciones.
Guía de uso

Cómo analizar la frecuencia de palabras y caracteres en un texto

El texto se segmenta, cuenta y exporta únicamente en el navegador actual; no se sube ni se guarda.

  1. Introduce texto

    Pega contenido UTF-8; la página admite como máximo 1000000 caracteres y 50,000 líneas, y además limita el tamaño codificado a un máximo de 1 MiB.

  2. Configurar reglas de estadísticas

    Elige si se ignoran las mayúsculas y minúsculas, la puntuación y los espacios en blanco, y configura la cantidad de elementos del Top N de 1–500.

  3. Ver o exportar

    Consulta la frecuencia de caracteres, la frecuencia de palabras, los recuentos básicos y las líneas duplicadas con números de línea, o exporta un archivo CSV con BOM y protección contra la inyección de fórmulas.

Limitaciones y notas

  • La tokenización prioriza Intl.Segmenter; si el navegador no es compatible, se usa como alternativa la expresión regular Unicode; los límites de palabra pueden variar entre textos en chino, japonés y textos mixtos.
  • El recuento de CJK solo incluye el rango de ideogramas unificados; no equivale al número de caracteres chinos de un idioma natural, al recuento de caracteres ni al número de palabras legibles.
  • Los elementos con la misma frecuencia se ordenan según el orden de su primera aparición; las opciones de omisión cambian las claves y los valores normalizados y no sustituyen un análisis profesional de corpus.

Preguntas frecuentes

¿Por qué puede diferir la frecuencia de palabras entre distintos navegadores?

La implementación de Intl.Segmenter proporcionada por el navegador y las reglas de fallback pueden usar límites de palabras distintos; la frecuencia de caracteres suele ser más estable.

¿Por qué el CSV exportado añade un prefijo a las celdas?

Al contenido que comienza con un carácter que activa una fórmula se le añadirá un prefijo de seguridad para reducir el riesgo de que se ejecute como fórmula en un programa de hojas de cálculo.

¿Las filas duplicadas ignoran los espacios en blanco?

Las filas duplicadas se procesan según las opciones de normalización actuales de la interfaz de la herramienta y se conservan los números de fila originales correspondientes para su comprobación.

Comentarios de la página¿Has encontrado un problema o tienes sugerencias de mejora?
Las funciones de retroalimentación deben usarse en la versión en línea

Envía tras activar JavaScript en la versión en línea; las funciones locales de la herramienta o del ejemplo no se verán afectadas.

Ir a la versión en línea para dar feedback