Analiza częstotliwości słów i znaków w tekście
Lokalne statystyki Unicode: znaki, słowa, powtórzone wiersze i podstawowe wskaźniki tekstu; można filtrować reguły i eksportować CSV odporne na wstrzykiwanie formuł.
Jak analizować częstotliwość słów i znaków w tekście
Tekst jest tokenizowany, liczony i eksportowany tylko w bieżącej przeglądarce; nie jest przesyłany ani zapisywany.
Wprowadź tekst
Wklej treść UTF-8; strona przyjmuje maksymalnie 1000000 znaków i 50,000 wierszy, a dodatkowo ogranicza rozmiar po zakodowaniu do 1 MiB.
Ustawienia reguł statystyk
Wybierz, czy ignorować wielkość liter, znaki interpunkcyjne i białe znaki, oraz ustaw liczbę Top N dla 1–500.
Wyświetl lub eksportuj
Wyświetl częstotliwość znaków, częstotliwość słów, podstawowe statystyki oraz powtarzające się wiersze z numerami wierszy albo eksportuj BOM z ochroną przed wstrzykiwaniem formuł do CSV.
Ograniczenia i uwagi
- Najpierw do tokenizacji używany jest Intl.Segmenter; jeśli przeglądarka go nie obsługuje, używane jest wyrażenie regularne Unicode. Granice słów w języku chińskim, japońskim i tekście mieszanym mogą się różnić.
- Liczba CJK obejmuje wyłącznie zakres ujednoliconych ideogramów, więc nie jest równoznaczna z liczbą chińskich znaków w języku naturalnym, liczbą znaków ani liczbą czytelnych słów.
- Elementy o tej samej częstotliwości są uporządkowane według kolejności pierwszego wystąpienia; opcje ignorowania zmienią znormalizowane klucze i wartości i nie zastępują profesjonalnej analizy korpusowej.
Często zadawane pytania
Dlaczego częstotliwość słów może różnić się w różnych przeglądarkach?
Implementacja Intl.Segmenter udostępniana przez przeglądarkę oraz reguły awaryjne mogą używać różnych granic słów; częstotliwość znaków jest zwykle stabilniejsza.
Dlaczego wyeksportowany CSV dodaje prefiks do komórek?
Do treści zaczynających się od znaków wywołujących formułę zostanie dodany bezpieczny prefiks, aby zmniejszyć ryzyko potraktowania ich jako formuł w arkuszach kalkulacyjnych.
Czy przy powtarzających się wierszach białe znaki są pomijane?
Powtórzone wiersze są przetwarzane zgodnie z bieżącymi opcjami normalizacji interfejsu narzędzia, a odpowiadające im oryginalne numery wierszy są zachowywane do weryfikacji.