Tekstfrequenties en tekenfrequenties analyseren

Lokaal worden Unicode tekens, woorden, dubbele regels en basisstatistieken van tekst geteld; regels kunnen worden gefilterd en een tegen formule-injectie beschermd CSV kan worden geëxporteerd.

Lokale verwerking in de browser
Deze pagina is door de openbare directorycontrole gekomen; schakel JavaScript in om de volledige functies te gebruiken.
Gebruiksaanwijzing

Tekstfrequenties en tekenfrequenties analyseren

De tekst wordt alleen in de huidige browser getokeniseerd, geteld en geëxporteerd; er wordt niets geüpload of opgeslagen.

  1. Voer tekst in

    Plak UTF-8-inhoud. De pagina accepteert maximaal 1000000 tekens en 50,000 regels, en beperkt bovendien de grootte na codering tot maximaal 1 MiB.

  2. Telregels instellen

    Kies of hoofdletters, interpunctie en spaties worden genegeerd, en stel het aantal Top N voor 1–500 in.

  3. Bekijken of exporteren

    Bekijk tekenfrequenties, woordfrequenties, basistellingen en dubbele regels met regelnummers, of exporteer BOM met CSV die tegen formule-injectie zijn beveiligd.

Beperkingen en aandachtspunten

  • Voor tokenisatie wordt bij voorkeur Intl.Segmenter gebruikt; als de browser dit niet ondersteunt, wordt teruggevallen op de reguliere expressie Unicode. Woordgrenzen kunnen verschillen in Chinese, Japanse en gemengde tekst.
  • Het aantal CJK telt alleen tekens binnen het bereik van uniforme ideogrammen en is niet gelijk aan het aantal Chinese karakters, tekens of leesbare woorden in een natuurlijke taal.
  • Items met dezelfde frequentie worden gerangschikt op volgorde van eerste voorkomen; de optie voor negeren wijzigt de genormaliseerde sleutels en waarden en is geen vervanging voor professionele corpusanalyse.

Veelgestelde vragen

Waarom kan de woordfrequentie per browser verschillen?

De door browsers geboden Intl.Segmenter-implementaties en fallbackregels kunnen verschillende woordgrenzen gebruiken; de tekenfrequentie is doorgaans stabieler.

Waarom voegt de geëxporteerde CSV een voorvoegsel aan cellen toe?

Aan inhoud die begint met een teken dat een formule activeert, wordt een veiligheidsvoorvoegsel toegevoegd om het risico te verkleinen dat deze in spreadsheetsoftware als formule wordt uitgevoerd.

Worden lege tekens genegeerd bij dubbele regels?

Dubbele rijen worden verwerkt volgens de huidige normalisatieopties van de tool, waarbij de bijbehorende oorspronkelijke rijnummers behouden blijven ter controle.

PaginafeedbackHeb je een probleem ontdekt of een verbetersuggestie?
Feedbackfuncties moeten worden gebruikt in de online versie

Activeer JavaScript in de online versie voordat u indient; de lokale functies van de huidige tool of case blijven onaangetast.

Ga naar feedback op de online versie