Tekstfrequenties en tekenfrequenties analyseren
Lokaal worden Unicode tekens, woorden, dubbele regels en basisstatistieken van tekst geteld; regels kunnen worden gefilterd en een tegen formule-injectie beschermd CSV kan worden geëxporteerd.
Tekstfrequenties en tekenfrequenties analyseren
De tekst wordt alleen in de huidige browser getokeniseerd, geteld en geëxporteerd; er wordt niets geüpload of opgeslagen.
Voer tekst in
Plak UTF-8-inhoud. De pagina accepteert maximaal 1000000 tekens en 50,000 regels, en beperkt bovendien de grootte na codering tot maximaal 1 MiB.
Telregels instellen
Kies of hoofdletters, interpunctie en spaties worden genegeerd, en stel het aantal Top N voor 1–500 in.
Bekijken of exporteren
Bekijk tekenfrequenties, woordfrequenties, basistellingen en dubbele regels met regelnummers, of exporteer BOM met CSV die tegen formule-injectie zijn beveiligd.
Beperkingen en aandachtspunten
- Voor tokenisatie wordt bij voorkeur Intl.Segmenter gebruikt; als de browser dit niet ondersteunt, wordt teruggevallen op de reguliere expressie Unicode. Woordgrenzen kunnen verschillen in Chinese, Japanse en gemengde tekst.
- Het aantal CJK telt alleen tekens binnen het bereik van uniforme ideogrammen en is niet gelijk aan het aantal Chinese karakters, tekens of leesbare woorden in een natuurlijke taal.
- Items met dezelfde frequentie worden gerangschikt op volgorde van eerste voorkomen; de optie voor negeren wijzigt de genormaliseerde sleutels en waarden en is geen vervanging voor professionele corpusanalyse.
Veelgestelde vragen
Waarom kan de woordfrequentie per browser verschillen?
De door browsers geboden Intl.Segmenter-implementaties en fallbackregels kunnen verschillende woordgrenzen gebruiken; de tekenfrequentie is doorgaans stabieler.
Waarom voegt de geëxporteerde CSV een voorvoegsel aan cellen toe?
Aan inhoud die begint met een teken dat een formule activeert, wordt een veiligheidsvoorvoegsel toegevoegd om het risico te verkleinen dat deze in spreadsheetsoftware als formule wordt uitgevoerd.
Worden lege tekens genegeerd bij dubbele regels?
Dubbele rijen worden verwerkt volgens de huidige normalisatieopties van de tool, waarbij de bijbehorende oorspronkelijke rijnummers behouden blijven ter controle.