Analyse de la fréquence des mots et des caractères dans un texte
Statistiques locales de Unicode caractères, de mots, de lignes répétées et d’indicateurs textuels de base, avec filtrage par règles et export de CSV protégé contre l’injection de formules.
Comment utiliser l’analyse de la fréquence des mots et des caractères dans un texte
Le texte est segmenté, compté et exporté uniquement dans le navigateur actuel ; il n’est ni téléversé ni enregistré.
Saisissez du texte
Collez du contenu UTF-8 ; la page accepte au maximum 1000000 caractères et 50,000 lignes, et limite en outre la taille après encodage à 1 MiB.
Configurer les règles de comptage
Choisissez si vous souhaitez ignorer la casse, la ponctuation et les espaces, puis définissez la valeur Top N de 1–500.
Afficher ou exporter
Consultez la fréquence des caractères, la fréquence des mots, les compteurs de base et les lignes répétées avec leur numéro de ligne, ou exportez un fichier avec BOM et protégé contre l’injection de formules grâce à CSV.
Restrictions et remarques
- La tokenisation privilégie Intl.Segmenter ; si le navigateur ne le prend pas en charge, elle utilise la regex Unicode. Les limites de mots peuvent différer pour les textes chinois, japonais et mixtes.
- Le décompte de CJK ne comptabilise que les idéogrammes unifiés, et ne peut être assimilé au nombre de caractères chinois, au nombre total de caractères ou au nombre de mots lisibles d’une langue naturelle.
- Les éléments de même fréquence sont classés selon leur ordre de première apparition ; les options d’ignorance modifient les clés et les valeurs normalisées et ne remplacent pas une analyse spécialisée de corpus.
Foire aux questions
Pourquoi la fréquence des mots peut-elle différer d’un navigateur à l’autre ?
L’implémentation de Intl.Segmenter fournie par le navigateur et les règles de repli peuvent utiliser des limites de mots différentes ; la fréquence des caractères est généralement plus stable.
Pourquoi l’exportation CSV ajoute-t-elle un préfixe aux cellules ?
Un préfixe de sécurité sera ajouté au contenu commençant par un caractère déclenchant une formule afin de réduire le risque qu’il soit interprété comme une formule par un tableur.
Les lignes en double ignorent-elles les espaces blancs ?
Les lignes en double sont traitées selon les options de normalisation actuellement sélectionnées dans l’interface de l’outil, et leur numéro de ligne d’origine est conservé pour vérification.