검색 증강 생성 예산 설계
사내 문서 RAG 비용 계산 방법
RAG 비용은 문서 보관함 전체 크기보다 질문마다 모델에 보내는 검색 문맥과 답변 길이에 더 크게 좌우됩니다. 구축 시 한 번 드는 색인 비용과 운영 중 반복되는 질문 비용을 나누면 월 예산을 과대 또는 과소평가하는 일을 줄일 수 있습니다.
RAG 비용을 두 부분으로 나누기
색인 비용은 문서를 정리하고 청크로 나눈 뒤 임베딩을 생성할 때 발생합니다. 전체 문서를 처음 색인할 때 크고, 이후에는 변경된 문서만 다시 처리하면 줄일 수 있습니다. 벡터 저장소, 파싱, OCR 비용이 있다면 토큰 비용과 별도 항목으로 기록하세요.
질문 비용은 사용자의 질문, 시스템 지시문, 이전 대화, 검색된 문단, 답변 출력에 사용됩니다. 검색 자체의 인프라 비용과 재정렬 모델 비용도 서비스 구성에 따라 추가될 수 있습니다.
질문 1건의 입력 토큰 계산식
입력 토큰 = 시스템 지시문 + 사용자 질문 + 대화 기록 + (검색 청크 수 × 청크당 토큰) + 인용·도구 결과로 잡습니다. 청크를 8개 검색하고 각 청크가 400토큰이라면 검색 문맥만 약 3,200토큰입니다. 여기에 질문과 지시문, 대화 기록을 더한 값이 모델 입력이 됩니다.
문서를 500토큰 단위로 나눴다고 해서 검색 결과가 항상 정확히 500토큰인 것은 아닙니다. 제목, 메타데이터, 청크 겹침, 구분자까지 포함한 실제 API 사용량을 샘플 요청으로 확인하세요.
월간 사내 문서 챗봇 예시
직원 100명이 한 달에 각 30번 질문하면 월 3,000건입니다. 질문당 입력이 4,500토큰, 출력이 700토큰이라면 재시도 전 월 사용량은 입력 1,350만 토큰, 출력 210만 토큰입니다. 재시도와 답변 재생성이 10%라면 각각 1.1을 곱한 뒤 선택한 모델의 최신 입력·출력 단가를 적용합니다.
전체 문서 크기는 언제 계산할까?
전체 문서 토큰은 최초 임베딩, 정기 재색인, 문서별 요약 생성 비용을 계산할 때 필요합니다. 반면 일상적인 질의응답에서는 검색된 일부 문단만 모델에 전달하는 것이 일반적이므로, 전체 저장소 토큰을 질문 수와 곱하면 비용을 크게 부풀릴 수 있습니다.
예산표에 넣을 항목
- 월간 신규·변경 문서 토큰과 임베딩 횟수
- 월 질문 수, 질문당 검색 청크 수와 실제 평균 청크 길이
- 시스템 지시문, 대화 기록, 인용 형식에 드는 입력 토큰
- 평균 답변과 긴 답변의 출력 토큰
- 재시도, 재정렬, 품질 검사, 답변 재작성에 드는 추가 호출
- 벡터 저장소, OCR, 문서 파싱, 로그 보관 같은 비토큰 비용
품질을 유지하며 비용 줄이기
중복 문서를 제거하고 제목과 섹션 경계를 보존해 청크를 만들면 불필요한 검색 결과를 줄일 수 있습니다. 질문 유형별로 검색 개수를 다르게 하고, 반복 질문은 권한과 문서 갱신 조건을 확인한 뒤 캐시하세요. 검색 청크 수를 무조건 줄이기보다 실제 질문 세트로 답변 정확도와 근거 인용률을 함께 비교하는 것이 안전합니다.
출시 후 실제 사용량으로 보정하기
요청마다 입력·출력 토큰, 검색 청크 수, 재시도, 응답 성공 여부를 기록하세요. 평균만 보지 말고 상위 10%의 큰 요청도 따로 확인하면 긴 대화나 대형 문서 질문이 예산에 미치는 영향을 찾을 수 있습니다. 모델과 제공사 가격은 바뀔 수 있으므로 구매 전 공식 가격표를 확인하세요.
입력과 출력의 범위부터 확인하려면 입력 토큰과 출력 토큰 비용 가이드를, 월간 호출량까지 합치려면 월간 AI API 비용 계산 가이드를 함께 보세요.