पाठ शब्द-आवृत्ति और वर्ण-आवृत्ति विश्लेषण
स्थानीय रूप से Unicode वर्णों, शब्दों, दोहराई गई पंक्तियों और मूल पाठ मेट्रिक्स की गणना करता है; नियम फ़िल्टर किए जा सकते हैं और फ़ॉर्मूला इंजेक्शन से सुरक्षित CSV निर्यात किए जा सकते हैं।
पाठ शब्द-आवृत्ति और वर्ण-आवृत्ति विश्लेषण का उपयोग कैसे करें
पाठ को केवल वर्तमान ब्राउज़र में टोकनाइज़, गिना और निर्यात किया जाता है; इसे अपलोड या सहेजा नहीं जाता।
इनपुट पाठ
UTF-8 सामग्री पेस्ट करें; पृष्ठ अधिकतम 1000000 वर्ण और 50,000 पंक्तियाँ स्वीकार करता है, तथा एन्कोड किए जाने के बाद इसका आकार 1 MiB से अधिक नहीं होना चाहिए।
सांख्यिकी नियम सेट करें
केस, विराम चिह्न और रिक्त स्थान को अनदेखा करना है या नहीं, यह चुनें और 1–500 के शीर्ष N की संख्या सेट करें।
देखें या निर्यात करें
अक्षर आवृत्ति, शब्द आवृत्ति, मूल गणनाएँ और पंक्ति संख्याओं वाली दोहराई गई पंक्तियाँ देखें, या BOM वाली और फ़ॉर्मूला इंजेक्शन से सुरक्षित CSV निर्यात करें।
सीमाएँ और ध्यान देने योग्य बातें
- शब्द-विभाजन में पहले Intl.Segmenter का उपयोग किया जाता है; ब्राउज़र समर्थन न होने पर Unicode रेगुलर एक्सप्रेशन पर वापस चला जाता है। चीनी, जापानी और मिश्रित पाठों में शब्द सीमाएँ भिन्न हो सकती हैं।
- CJK की संख्या केवल एकीकृत विचार-चिह्नों की सीमा में गिनी जाती है; यह प्राकृतिक भाषा में चीनी अक्षरों की संख्या, वर्णों की संख्या या पठनीय शब्दों की संख्या के बराबर नहीं है।
- समान-आवृत्ति वाली वस्तुओं को पहली बार दिखाई देने के क्रम में व्यवस्थित किया जाता है; अनदेखा करने के विकल्प सामान्यीकृत कुंजियों और मानों को बदल देंगे, इसलिए वे पेशेवर कॉर्पस विश्लेषण का विकल्प नहीं हैं।
सामान्य प्रश्न
अलग-अलग ब्राउज़र में शब्द आवृत्ति भिन्न क्यों हो सकती है?
ब्राउज़र द्वारा प्रदान किए गए Intl.Segmenter के कार्यान्वयन और फ़ॉलबैक नियम अलग-अलग शब्द सीमाओं का उपयोग कर सकते हैं; वर्ण आवृत्ति आम तौर पर अधिक स्थिर होती है।
निर्यात किए गए CSV में सेल के आगे उपसर्ग क्यों जोड़ा जाता है?
फ़ॉर्मूला ट्रिगर करने वाले वर्ण से शुरू होने वाली सामग्री में सुरक्षा उपसर्ग जोड़ा जाएगा, ताकि स्प्रेडशीट सॉफ़्टवेयर में उसे फ़ॉर्मूला के रूप में निष्पादित किए जाने का जोखिम कम हो।
क्या दोहराई गई पंक्तियाँ रिक्त स्थानों को अनदेखा करती हैं?
दोहराई गई पंक्तियों को टूल इंटरफ़ेस के वर्तमान सामान्यीकरण विकल्पों के अनुसार संसाधित किया जाता है और जाँच के लिए संबंधित मूल पंक्ति संख्याएँ सुरक्षित रखी जाती हैं।