단어 빈도 분석
글에서 어떤 단어가 몇 번 나왔는지 출현 빈도를 순위로 분석합니다.
| 순위 / 항목 | 횟수 | 비율 |
|---|
글을 다 쓰고 나서 읽어보면 유난히 자주 튀어나오는 표현이 있습니다. "그리고", "것 같다" 같은 말이 한 문단에 세 번씩 나오는데 정작 쓸 때는 못 알아챕니다.
이 도구는 붙여넣은 글을 쪼개서 무엇이 몇 번 나왔는지 많은 순으로 보여줍니다. 반복 표현을 잡아낼 때도, 블로그 글의 키워드 비중을 확인할 때도 쓸 수 있습니다.
어떻게 계산되나요
사용 순서
- 입력창에 분석할 텍스트를 붙여넣습니다.
- 분석 단위를 고릅니다 —
단어또는글자(공백 제외). - 필요하면 대소문자 무시 체크를 조정합니다(기본은 켜짐).
분석버튼을 누르면 표가 나타납니다.
결과 읽는 법
표에는 순위, 항목, 횟수, 비율이 나오고 상위 30개까지 표시됩니다. 표 위 문구에는 전체 개수와 고유 항목 수가 함께 나옵니다. 비율은 그 항목의 횟수를 전체 개수로 나눈 값입니다.
단어를 나누는 기준
공백과 함께 . , ! ? ; : ( ) [ ] { } " ' ~ 같은 문장부호를 기준으로 끊습니다. 그래서 "안녕하세요."는 마침표가 떨어진 안녕하세요로 집계됩니다.
다만 한국어는 조사가 붙어 있어 "여행은"과 "여행이"가 서로 다른 항목으로 잡힙니다. 어간만 묶어 세는 형태소 분석은 하지 않습니다. 한국어 글의 소재 비중을 볼 때는 이 점을 감안해서 보시고, 조사 영향을 덜 받는 글자 모드를 함께 보는 것도 방법입니다.
용어 정리
- 분석 단위
- 단어 단위로 셀지, 공백을 뺀 글자 하나하나로 셀지 고르는 옵션입니다.
- 대소문자 무시
- 켜면 Apple과 apple을 같은 항목으로 묶습니다. 영문 텍스트에서 주로 의미가 있습니다.
- 고유 개수
- 중복을 뺀 서로 다른 항목의 수. 전체 대비 이 값이 작을수록 같은 말을 반복했다는 뜻입니다.
- 비율
- 해당 항목의 횟수 ÷ 전체 개수. 한 단어가 유독 높으면 표현이 단조롭다는 신호일 수 있습니다.
- 형태소
- 의미를 가진 최소 단위. '여행은'을 '여행'+'은'으로 쪼개는 처리로, 이 도구는 지원하지 않습니다.
자주 묻는 질문
'여행은'과 '여행이'가 따로 세어집니다
한국어 조사를 분리하는 형태소 분석은 하지 않고 공백·문장부호로만 끊기 때문입니다. 소재의 비중을 대략 보려면 상위 항목들을 눈으로 묶어 합산하거나, 조사 영향이 적은 글자 모드를 함께 확인해 보세요.
결과가 30개까지만 나옵니다
화면 가독성을 위해 상위 30개만 표시합니다. 표 위 문구에 전체 개수와 고유 항목 수는 그대로 나오니, 상위권에 없는 특정 단어의 횟수가 궁금하다면 그 부분만 따로 붙여넣어 확인하는 방법이 있습니다.
조사·접속사 같은 흔한 말을 빼고 볼 수 있나요?
불용어(자주 나오지만 의미가 옅은 말)를 자동으로 걸러내는 기능은 없습니다. '그리고', '수', '것' 같은 항목이 상위에 오르는 것은 자연스러운 결과이니, 그 아래 순위부터 보시면 실제 내용어가 드러납니다.
글자 모드는 언제 쓰나요?
한국어에서 어떤 음절이 자주 반복되는지 보거나, 띄어쓰기가 불규칙한 텍스트를 다룰 때 유용합니다. 조사에 영향을 덜 받아 단어 모드와 다른 그림이 보이기도 합니다.
긴 글도 넣을 수 있나요?
브라우저에서 바로 계산하므로 일반적인 문서 길이는 문제없이 처리됩니다. 다만 아주 긴 텍스트에서는 기기 성능에 따라 잠깐 멈칫할 수 있습니다. 입력한 내용은 서버로 전송되지 않습니다.
어떤 문제가 있었는지 알려주시면 빠르게 고치겠습니다. (회신이 필요하면 이메일을 남겨주세요)