한국어 토큰 추정 가이드

한국어 토큰과 글자 수 환산 방법

한국어 글자 수와 AI 토큰 수에는 모든 모델에 통하는 고정 비율이 없습니다. 초기 예산에는 대표 문서의 실제 토큰 수로 환산율을 만들고, 운영 전에는 사용할 모델의 토크나이저나 API 응답으로 다시 확인하세요.

영어 환산식을 그대로 쓰면 안 되는 이유

OpenAI는 일반적인 영어 텍스트에서 1토큰이 약 4자 또는 약 0.75단어라는 경험칙을 안내합니다. 이는 영어 기준의 빠른 추정값입니다. 한국어는 조사와 어미가 결합하고, 한글·영문·숫자·기호가 섞이는 방식에 따라 토큰 분리가 달라집니다. GPT, Claude, Gemini처럼 모델 계열이 달라져도 결과가 달라질 수 있습니다.

대표 샘플로 환산율 구하기

  1. 실제 입력과 비슷한 한국어 문서 10~20개를 고릅니다.
  2. 공백을 포함한 글자 수와 사용할 모델의 토큰 수를 각각 기록합니다.
  3. 샘플 환산율 = 전체 토큰 수 ÷ 전체 글자 수로 계산합니다.
  4. 일반 문서와 표·코드·URL이 많은 문서를 분리해 평균과 큰 값의 범위를 만듭니다.

새 문서는 예상 입력 토큰 = 글자 수 × 샘플 환산율로 추정할 수 있습니다. 샘플이 50,000자이고 측정 결과가 40,000토큰이라면 환산율은 글자당 0.8토큰입니다. 같은 종류의 12,000자 문서는 약 9,600토큰으로 시작하되, 실제 모델에서 다시 측정해야 합니다.

월간 한국어 요약 예시

한 문서의 예상 입력이 9,600토큰이고 요약 출력이 800토큰이라고 가정합니다. 하루 100건, 월 30일이면 문서 본문만 월 2,880만 입력 토큰, 요약은 월 240만 출력 토큰입니다. 여기에 시스템 지시문, 재시도, 다단계 처리 횟수를 추가한 뒤 입력·출력 단가를 각각 적용하세요.

글자 수 외에 더해야 하는 토큰

문서 글자 수만 재면 시스템 지시문, 사용자 질문, 대화 기록, RAG 검색 문단, JSON 형식 지시, 모델 답변을 놓칩니다. API 비용을 계산할 때는 입력 토큰과 출력 토큰을 분리하고, 여러 번 호출하는 작업은 각 단계의 토큰을 모두 합산하세요.

정확도를 높이는 점검표

공식 참고 자료: OpenAI Tokenizer. 이 도구는 모델 계열에 따른 실제 분할을 확인하는 용도로 사용하고, 다른 제공사를 쓸 때는 해당 제공사의 토큰 계산 방법을 확인하세요.

한국어 문서 토큰 비용 계산하기