การวิเคราะห์ความถี่ของคำและอักขระในข้อความ
สถิติในเครื่องสำหรับอักขระ คำ บรรทัดที่ซ้ำ และตัวชี้วัดข้อความพื้นฐาน Unicode สามารถกรองตามกฎและส่งออก CSV ที่ป้องกันการแทรกสูตรได้
วิธีใช้การวิเคราะห์ความถี่ของคำและอักขระในข้อความ
ข้อความจะถูกแยกคำ นับ และส่งออกภายในเบราว์เซอร์ปัจจุบันเท่านั้น โดยจะไม่ถูกอัปโหลดหรือบันทึก
ป้อนข้อความ
วางเนื้อหา UTF-8 โดยหน้าจะรับได้สูงสุด 1000000 อักขระ 50,000 บรรทัด และจำกัดขนาดหลังการเข้ารหัสเพิ่มเติมไม่ให้เกิน 1 MiB
ตั้งค่ากฎการนับสถิติ
เลือกว่าจะละเว้นตัวพิมพ์เล็กและใหญ่ เครื่องหมายวรรคตอน และช่องว่างหรือไม่ และตั้งค่าจำนวน Top N ของ 1–500
ดูหรือส่งออก
ดูความถี่ของอักขระ ความถี่ของคำ จำนวนพื้นฐาน และบรรทัดซ้ำพร้อมหมายเลขบรรทัด หรือส่งออกเป็น BOM และ CSV ที่ป้องกันการแทรกสูตร
ข้อจำกัดและข้อควรระวัง
- การตัดคำจะใช้ Intl.Segmenter ก่อน หากเบราว์เซอร์ไม่รองรับ จะใช้ Unicode แทน ขอบเขตคำของข้อความภาษาจีน ภาษาญี่ปุ่น และข้อความผสมอาจแตกต่างกัน
- จำนวน CJK นับเฉพาะช่วงอักขระเชิงความหมายแบบรวมเป็นหนึ่งเดียว ไม่อาจเทียบเท่ากับจำนวนอักษรจีนในภาษาธรรมชาติ จำนวนตัวอักษร หรือจำนวนคำที่อ่านได้
- รายการที่มีความถี่เท่ากันจะเรียงตามลำดับการปรากฏครั้งแรก ตัวเลือกการละเว้นจะเปลี่ยนคีย์และค่าหลังการทำให้เป็นมาตรฐาน และไม่สามารถใช้แทนการวิเคราะห์คลังข้อความโดยผู้เชี่ยวชาญได้
คำถามที่พบบ่อย
เหตุใดความถี่ของคำจึงอาจแตกต่างกันในเบราว์เซอร์ต่าง ๆ?
การใช้งาน Intl.Segmenter และกฎการย้อนกลับที่เบราว์เซอร์จัดเตรียมอาจใช้ขอบเขตคำที่แตกต่างกัน โดยทั่วไปความถี่ของอักขระจะมีความเสถียรมากกว่า
เหตุใด CSV ที่ส่งออกจึงเพิ่มคำนำหน้าให้เซลล์?
เนื้อหาที่ขึ้นต้นด้วยอักขระซึ่งใช้เรียกใช้สูตรจะถูกเติมคำนำหน้าด้านความปลอดภัย เพื่อลดความเสี่ยงที่ซอฟต์แวร์ตารางคำนวณจะตีความเป็นสูตรและดำเนินการ
แถวที่ซ้ำกันจะไม่สนใจช่องว่างใช่หรือไม่
จัดการบรรทัดซ้ำตามตัวเลือกการทำให้เป็นมาตรฐานปัจจุบันในอินเทอร์เฟซของเครื่องมือ และเก็บหมายเลขบรรทัดต้นฉบับที่เกี่ยวข้องไว้เพื่อตรวจสอบ