Analyse de la fréquence des mots et des caractères dans un texte

Statistiques locales de Unicode caractères, de mots, de lignes répétées et d’indicateurs textuels de base, avec filtrage par règles et export de CSV protégé contre l’injection de formules.

Traitement local dans le navigateur
Cette page a passé la vérification du répertoire public ; les fonctionnalités complètes sont disponibles après activation de JavaScript.
Mode d’emploi

Comment utiliser l’analyse de la fréquence des mots et des caractères dans un texte

Le texte est segmenté, compté et exporté uniquement dans le navigateur actuel ; il n’est ni téléversé ni enregistré.

  1. Saisissez du texte

    Collez du contenu UTF-8 ; la page accepte au maximum 1000000 caractères et 50,000 lignes, et limite en outre la taille après encodage à 1 MiB.

  2. Configurer les règles de comptage

    Choisissez si vous souhaitez ignorer la casse, la ponctuation et les espaces, puis définissez la valeur Top N de 1–500.

  3. Afficher ou exporter

    Consultez la fréquence des caractères, la fréquence des mots, les compteurs de base et les lignes répétées avec leur numéro de ligne, ou exportez un fichier avec BOM et protégé contre l’injection de formules grâce à CSV.

Restrictions et remarques

  • La tokenisation privilégie Intl.Segmenter ; si le navigateur ne le prend pas en charge, elle utilise la regex Unicode. Les limites de mots peuvent différer pour les textes chinois, japonais et mixtes.
  • Le décompte de CJK ne comptabilise que les idéogrammes unifiés, et ne peut être assimilé au nombre de caractères chinois, au nombre total de caractères ou au nombre de mots lisibles d’une langue naturelle.
  • Les éléments de même fréquence sont classés selon leur ordre de première apparition ; les options d’ignorance modifient les clés et les valeurs normalisées et ne remplacent pas une analyse spécialisée de corpus.

Foire aux questions

Pourquoi la fréquence des mots peut-elle différer d’un navigateur à l’autre ?

L’implémentation de Intl.Segmenter fournie par le navigateur et les règles de repli peuvent utiliser des limites de mots différentes ; la fréquence des caractères est généralement plus stable.

Pourquoi l’exportation CSV ajoute-t-elle un préfixe aux cellules ?

Un préfixe de sécurité sera ajouté au contenu commençant par un caractère déclenchant une formule afin de réduire le risque qu’il soit interprété comme une formule par un tableur.

Les lignes en double ignorent-elles les espaces blancs ?

Les lignes en double sont traitées selon les options de normalisation actuellement sélectionnées dans l’interface de l’outil, et leur numéro de ligne d’origine est conservé pour vérification.

Commentaires sur la pageVous avez découvert un problème ou avez une suggestion d’amélioration ?
Les fonctions de retour nécessitent l’utilisation de la version en ligne

Veuillez activer JavaScript dans la version en ligne avant de soumettre ; les fonctionnalités locales de l’outil ou du cas ne sont pas affectées.

Aller vers la version en ligne pour envoyer des commentaires