Metin sözcük sıklığı ve karakter sıklığı analizi

Yerel olarak Unicode karakterleri, sözcükleri, yinelenen satırları ve temel metin ölçümlerini sayın; kurallara göre filtreleyin ve formül enjeksiyonuna karşı korumalı CSV dışa aktarın.

Tarayıcı içinde yerel işlem
Bu sayfa genel dizin kontrolünden geçti; JavaScript etkinleştirildiğinde tüm işlevler kullanılabilir.
Kullanım kılavuzu

Metin sözcük sıklığı ve karakter sıklığı analizi nasıl kullanılır

Metin yalnızca mevcut tarayıcıda sözcüklere ayrılır, sayılır ve dışa aktarılır; yüklenmez veya kaydedilmez.

  1. Giriş metni

    UTF-8 içeriğini yapıştırın; sayfa en fazla 1000000 karakter ve 50,000 satır kabul eder ve kodlandıktan sonraki boyutu ayrıca 1 MiB değerini aşmayacak şekilde sınırlar.

  2. İstatistik kurallarını ayarla

    Büyük/küçük harf, noktalama işaretleri ve boşlukların yok sayılıp yok sayılmayacağını seçin ve 1–500 için Top N sayısını ayarlayın.

  3. Görüntüle veya dışa aktar

    Karakter sıklığını, sözcük sıklığını, temel sayımları ve satır numaralı yinelenen satırları görüntüleyin ya da BOM içeren ve formül enjeksiyonuna karşı korumalı CSV dışa aktarın.

Sınırlamalar ve dikkat edilmesi gerekenler

  • Kelime ayırmada öncelik Intl.Segmenter yöntemine verilir; tarayıcı desteklemediğinde Unicode normal ifadesine geri dönülür. Çince, Japonca ve karma metinlerde sözcük sınırları farklı olabilir.
  • CJK sayısı yalnızca Birleşik İdeografik Yazı kapsamındaki karakterleri sayar; doğal dildeki Çince karakter, karakter veya okunabilir sözcük sayısına eşdeğer değildir.
  • Aynı sıklıktaki öğeler ilk görülme sırasına göre listelenir; yok sayma seçenekleri normalleştirilmiş anahtarları ve değerleri değiştirir, profesyonel derlem analizinin yerini tutmaz.

Sık sorulan sorular

Farklı tarayıcıların kelime sıklıkları neden farklı olabilir?

Tarayıcı tarafından sağlanan Intl.Segmenter uygulaması ve geri dönüş kuralları farklı sözcük sınırları kullanabilir; karakter sıklığı genellikle daha kararlıdır.

Dışa aktarılan CSV hücrelere neden önek ekliyor?

Formül olarak yorumlanmasını tetikleyen karakterle başlayan içeriklere güvenlik öneki eklenerek elektronik tablo yazılımlarında formül olarak çalıştırılma riski azaltılır.

Yinelenen satırlarda boşluklar yok sayılır mı?

Yinelenen satırlar, araç arayüzündeki geçerli normalleştirme seçeneklerine göre işlenir ve karşılık gelen özgün satır numaraları denetim için korunur.

Sayfa geri bildirimiBir sorun mu buldunuz veya iyileştirme öneriniz mi var?
Geri bildirim işlevi yalnızca çevrimiçi sürümde kullanılmalıdır

Lütfen çevrimiçi sürümde JavaScript etkinleştirildikten sonra gönderin; geçerli araç veya örneğin yerel işlevleri etkilenmez.

Çevrimiçi sürüme geri bildirim gönder