تحليل تردد النص وتردد الأحرف
إحصاءات محلية للحروف Unicode والكلمات والأسطر المكررة ومؤشرات النص الأساسية، مع إمكانية تصفية القواعد وتصدير CSV المحمي من حقن الصيغ.
كيفية استخدام تحليل تردد النص وتردد الأحرف
يتم تجزئة النص، وعدّه، وتصديره فقط في المتصفح الحالي، ولن يتم رفعه أو حفظه.
أدخل النص
الصق محتوى UTF-8؛ تستقبل الصفحة بحد أقصى 1000000 حرفًا و50,000 سطرًا، وتفرض كذلك ألا يتجاوز الحجم بعد الترميز 1 MiB.
إعداد قواعد الإحصاء
اختر ما إذا كنت تريد تجاهل الحالة وعلامات الترقيم والمسافات البيضاء، واضبط عدد أعلى العناصر N من 1 إلى 500.
عرض أو تصدير
اعرض تكرار الأحرف، وتكرار الكلمات، والعدّ الأساسي، والأسطر المكررة مع أرقام الأسطر، أو صدّر كملف BOM وآمن من حقن الصيغ في CSV.
القيود والتنبيهات
- يُفضَّل إجراء التقسيم اللفظي باستخدام Intl.Segmenter؛ وإذا كان المتصفح لا يدعم ذلك، فيُرجَع إلى تعبير Unicode النمطي. قد تختلف حدود الكلمات في النصوص الصينية واليابانية والنصوص المختلطة.
- لا يُحصى عدد CJK إلا ضمن نطاق الحروف الموحدة، ولا يمكن اعتباره مساويًا لعدد الحروف الصينية أو الكلمات أو الكلمات القابلة للقراءة في اللغة الطبيعية.
- تُرتَّب العناصر ذات التردد نفسه حسب ترتيب ظهورها الأول؛ أما خيار التجاهل فيغيّر المفاتيح والقيم بعد التطبيع، ولا يمكن أن يحل محل تحليل المتون الاحترافي.
الأسئلة الشائعة
لماذا قد يختلف تكرار الكلمات بين المتصفحات المختلفة؟
قد تستخدم تطبيقات Intl.Segmenter التي يوفرها المتصفح وقواعد التراجع حدود كلمات مختلفة، بينما تكون تكرارات الأحرف عادةً أكثر استقرارًا.
لماذا تتم إضافة بادئة إلى الخلايا في CSV المصدَّر؟
سيُضاف بادئة أمان إلى المحتوى الذي يبدأ بحروف تُحفّز الصيغ، لتقليل خطر تنفيذه كصيغة في برامج الجداول.
هل تتجاهل الصفوف المكررة المسافات البيضاء؟
تُعالَج الأسطر المكررة وفق خيارات التطبيع الحالية في واجهة الأداة، مع الاحتفاظ بأرقام الأسطر الأصلية المطابقة للمراجعة.