Analyse von Worthäufigkeiten und Zeichenfrequenzen in Texten

Erfasst lokal Unicode Zeichen, Wörter, doppelte Zeilen und grundlegende Textkennzahlen, kann nach Regeln filtern und CSV geschützt vor Formelinjektionen exportieren.

Browserseitige lokale Verarbeitung
Diese Seite hat die öffentliche Verzeichnisprüfung bestanden; nach Aktivierung von JavaScript stehen die vollständigen Funktionen zur Verfügung.
Benutzerhandbuch

Anleitung zur Analyse von Worthäufigkeiten und Zeichenfrequenzen in Texten

Der Text wird nur in diesem Browser tokenisiert, gezählt und exportiert; er wird weder hochgeladen noch gespeichert.

  1. Eingabetext

    Fügen Sie Inhalte von UTF-8 ein. Die Seite akzeptiert höchstens 1000000 Zeichen und 50,000 Zeilen; zusätzlich darf die Größe nach der Kodierung 1 MiB nicht überschreiten.

  2. Regeln für die Statistik festlegen

    Wählen Sie, ob Groß- und Kleinschreibung, Satzzeichen und Leerzeichen ignoriert werden sollen, und legen Sie die Top-N-Anzahl für 1–500 fest.

  3. Anzeigen oder exportieren

    Zeichenhäufigkeit, Worthäufigkeit, grundlegende Zählungen und doppelte Zeilen mit Zeilennummern anzeigen oder BOM mit CSV, das vor Formelinjektionen geschützt ist, exportieren.

Einschränkungen und Hinweise

  • Für die Wortsegmentierung wird bevorzugt Intl.Segmenter verwendet; wenn der Browser dies nicht unterstützt, wird auf reguläre Ausdrücke mit Unicode zurückgegriffen. Die Wortgrenzen können bei regulären Ausdrücken sowie bei chinesischen, japanischen und gemischten Texten unterschiedlich sein.
  • Die Anzahl von CJK zählt ausschließlich den Bereich der vereinheitlichten ideografischen Zeichen und kann nicht mit der Anzahl chinesischer Schriftzeichen in einer natürlichen Sprache, der Zeichenanzahl oder der Anzahl lesbarer Wörter gleichgesetzt werden.
  • Elemente mit gleicher Häufigkeit werden nach der Reihenfolge ihres ersten Auftretens angeordnet; die Ignorieroptionen ändern die normalisierten Schlüssel und Werte und können keine professionelle Korpusanalyse ersetzen.

Häufig gestellte Fragen

Warum kann die Worthäufigkeit in verschiedenen Browsern unterschiedlich sein?

Die vom Browser bereitgestellte Implementierung von Intl.Segmenter und die Fallback-Regeln können unterschiedliche Wortgrenzen verwenden. Die Zeichenhäufigkeit ist in der Regel stabiler.

Warum wird den Zellen der exportierten CSV ein Präfix hinzugefügt?

Inhalten, die mit Zeichen beginnen, die eine Formel auslösen, wird ein Sicherheitspräfix vorangestellt, um das Risiko zu verringern, dass sie in Tabellenkalkulationsprogrammen als Formel ausgeführt werden.

Werden Leerzeichen bei doppelten Zeilen ignoriert?

Doppelte Zeilen werden gemäß der aktuellen Normalisierungsoption der Benutzeroberfläche verarbeitet; die zugehörigen ursprünglichen Zeilennummern bleiben zur Überprüfung erhalten.

SeitenfeedbackProblem entdeckt oder Vorschlag zur Verbesserung?
Die Feedback-Funktion muss in der Online-Version verwendet werden

Bitte reichen Sie es in der Online-Version ein, nachdem Sie JavaScript aktiviert haben; die lokalen Funktionen des aktuellen Tools oder Beispiels sind davon nicht betroffen.

Zur Online-Version wechseln und Feedback geben