텍스트 단어 빈도 및 문자 빈도 분석

로컬에서 Unicode 문자, 단어, 중복 행 및 기본 텍스트 지표를 집계하고, 규칙으로 필터링한 후 수식 삽입이 방지된 CSV를 내보낼 수 있습니다.

브라우저에서 로컬 처리
이 페이지는 공개 디렉터리 검사를 통과했습니다. JavaScript을 활성화하면 전체 기능을 사용할 수 있습니다.
사용 안내

텍스트 단어 빈도 및 문자 빈도 분석 사용 방법

텍스트는 현재 브라우저에서만 토큰화하고 개수를 세어 내보내며, 업로드하거나 저장하지 않습니다.

  1. 텍스트 입력

    UTF-8 콘텐츠를 붙여넣으세요. 페이지는 최대 1000000자, 50,000행을 허용하며, 인코딩 후 크기는 1 MiB를 초과할 수 없습니다.

  2. 통계 규칙 설정

    대소문자, 구두점 및 공백을 무시할지 선택하고, 1–500의 Top N 개수를 설정하세요.

  3. 확인 또는 내보내기

    문자 빈도, 단어 빈도, 기본 집계 및 줄 번호가 있는 중복 행을 확인하거나, BOM을 포함하고 수식 삽입을 방지하는 CSV을(를) 내보낼 수 있습니다.

제한 및 주의사항

  • 토큰화는 우선 Intl.Segmenter을 사용합니다. 브라우저가 지원하지 않으면 Unicode 정규식으로 대체합니다. 중국어, 일본어 및 혼합 텍스트의 단어 경계는 다를 수 있습니다.
  • CJK 수량은 통합 표의 문자 범위만 집계하며, 자연어의 한자 수, 글자 수 또는 읽을 수 있는 단어 수와 동일하지 않습니다.
  • 동일 빈도 항목은 처음 나타난 순서대로 정렬됩니다. 무시 옵션은 정규화된 키와 값을 변경하므로 전문적인 코퍼스 분석을 대신할 수 없습니다.

자주 묻는 질문

브라우저마다 단어 빈도가 다를 수 있는 이유는 무엇인가요?

브라우저에서 제공하는 Intl.Segmenter 구현과 대체 규칙은 서로 다른 단어 경계를 사용할 수 있으며, 문자 빈도는 일반적으로 더 안정적입니다.

내보낸 CSV은(는) 왜 셀에 접두사를 추가하나요?

수식으로 해석될 수 있는 문자로 시작하는 콘텐츠에는 안전 접두사를 추가하여 스프레드시트 소프트웨어에서 수식으로 실행될 위험을 줄입니다.

중복 행에서 공백을 무시하나요?

중복 행은 도구 인터페이스의 현재 정규화 옵션에 따라 처리되며, 대조할 수 있도록 해당 원본 행 번호가 유지됩니다.

페이지 피드백문제를 발견했거나 개선 제안이 있으신가요?
피드백 기능은 온라인 버전에서 사용해야 합니다

온라인 버전에서 JavaScript를 활성화한 후 제출해 주세요. 현재 도구나 사례의 로컬 기능에는 영향이 없습니다.

온라인 버전으로 피드백 보내기