Analyse von Worthäufigkeiten und Zeichenfrequenzen in Texten
Erfasst lokal Unicode Zeichen, Wörter, doppelte Zeilen und grundlegende Textkennzahlen, kann nach Regeln filtern und CSV geschützt vor Formelinjektionen exportieren.
Anleitung zur Analyse von Worthäufigkeiten und Zeichenfrequenzen in Texten
Der Text wird nur in diesem Browser tokenisiert, gezählt und exportiert; er wird weder hochgeladen noch gespeichert.
Eingabetext
Fügen Sie Inhalte von UTF-8 ein. Die Seite akzeptiert höchstens 1000000 Zeichen und 50,000 Zeilen; zusätzlich darf die Größe nach der Kodierung 1 MiB nicht überschreiten.
Regeln für die Statistik festlegen
Wählen Sie, ob Groß- und Kleinschreibung, Satzzeichen und Leerzeichen ignoriert werden sollen, und legen Sie die Top-N-Anzahl für 1–500 fest.
Anzeigen oder exportieren
Zeichenhäufigkeit, Worthäufigkeit, grundlegende Zählungen und doppelte Zeilen mit Zeilennummern anzeigen oder BOM mit CSV, das vor Formelinjektionen geschützt ist, exportieren.
Einschränkungen und Hinweise
- Für die Wortsegmentierung wird bevorzugt Intl.Segmenter verwendet; wenn der Browser dies nicht unterstützt, wird auf reguläre Ausdrücke mit Unicode zurückgegriffen. Die Wortgrenzen können bei regulären Ausdrücken sowie bei chinesischen, japanischen und gemischten Texten unterschiedlich sein.
- Die Anzahl von CJK zählt ausschließlich den Bereich der vereinheitlichten ideografischen Zeichen und kann nicht mit der Anzahl chinesischer Schriftzeichen in einer natürlichen Sprache, der Zeichenanzahl oder der Anzahl lesbarer Wörter gleichgesetzt werden.
- Elemente mit gleicher Häufigkeit werden nach der Reihenfolge ihres ersten Auftretens angeordnet; die Ignorieroptionen ändern die normalisierten Schlüssel und Werte und können keine professionelle Korpusanalyse ersetzen.
Häufig gestellte Fragen
Warum kann die Worthäufigkeit in verschiedenen Browsern unterschiedlich sein?
Die vom Browser bereitgestellte Implementierung von Intl.Segmenter und die Fallback-Regeln können unterschiedliche Wortgrenzen verwenden. Die Zeichenhäufigkeit ist in der Regel stabiler.
Warum wird den Zellen der exportierten CSV ein Präfix hinzugefügt?
Inhalten, die mit Zeichen beginnen, die eine Formel auslösen, wird ein Sicherheitspräfix vorangestellt, um das Risiko zu verringern, dass sie in Tabellenkalkulationsprogrammen als Formel ausgeführt werden.
Werden Leerzeichen bei doppelten Zeilen ignoriert?
Doppelte Zeilen werden gemäß der aktuellen Normalisierungsoption der Benutzeroberfläche verarbeitet; die zugehörigen ursprünglichen Zeilennummern bleiben zur Überprüfung erhalten.