Analisi della frequenza delle parole e dei caratteri nel testo

Statistiche locali di Unicode: caratteri, parole, righe duplicate e metriche di base del testo; puoi filtrare le regole ed esportare CSV a prova di iniezione di formule.

Elaborazione locale nel browser
Questa pagina ha superato il controllo della directory pubblica; per usare tutte le funzionalità, abilita JavaScript.
Guida all’uso

Come usare l’analisi della frequenza delle parole e dei caratteri

Il testo viene segmentato, conteggiato ed esportato solo nel browser corrente; non viene caricato né salvato.

  1. Testo di input

    Incolla contenuti UTF-8; la pagina può ricevere al massimo 1000000 caratteri e 50,000 righe, con un ulteriore limite di dimensione codificata non superiore a 1 MiB.

  2. Impostazione delle regole di conteggio

    Scegli se ignorare maiuscole e minuscole, punteggiatura e spazi bianchi, quindi imposta il numero massimo di elementi per 1–500.

  3. Visualizza o esporta

    Visualizza la frequenza dei caratteri, la frequenza delle parole, i conteggi di base e le righe duplicate numerate, oppure esporta BOM con CSV e protezione dall’iniezione di formule.

Limiti e note

  • La tokenizzazione utilizza innanzitutto Intl.Segmenter; se il browser non lo supporta, passa all’espressione regolare Unicode. I confini delle parole possono variare nel testo cinese, giapponese e misto.
  • Il conteggio di CJK considera solo l’intervallo degli ideogrammi unificati e non equivale al numero di caratteri cinesi, alla lunghezza del testo o al numero di parole leggibili in una lingua naturale.
  • Gli elementi con la stessa frequenza sono ordinati in base alla prima comparsa; le opzioni di ignoramento modificano le chiavi e i valori normalizzati e non sostituiscono un’analisi professionale del corpus.

Domande frequenti

Perché la frequenza delle parole può variare tra browser diversi?

L’implementazione di Intl.Segmenter fornita dal browser e le regole di fallback potrebbero usare confini di parola diversi; la frequenza dei caratteri è generalmente più stabile.

Perché l’esportazione di CSV aggiunge un prefisso alle celle?

Ai contenuti che iniziano con caratteri che attivano formule viene aggiunto un prefisso di sicurezza, riducendo il rischio che vengano interpretati ed eseguiti come formule nei programmi per fogli di calcolo.

Le righe duplicate ignorano gli spazi bianchi?

Le righe duplicate vengono gestite in base alle opzioni di normalizzazione attualmente selezionate nell’interfaccia dello strumento, mantenendo i numeri di riga originali corrispondenti per la verifica.

Feedback della paginaHai trovato un problema o hai un suggerimento per migliorare?
La funzione di feedback deve essere usata nella versione online

Invia nella versione online dopo aver abilitato JavaScript; le funzioni locali del tool o del caso d’uso non sono influenzate.

Vai alla versione online per inviare feedback