토큰 사용량 줄이기의 출발점은 호출마다 실리는 입력과 출력의 길이입니다. 대화 기록과 긴 시스템 안내, 첨부 문서가 붙으면 같은 질문이라도 청구 단위가 바로 커집니다. ChatGPT 비용 절감을 보려면 먼저 어느 구간이 길어지는지 사용량 화면에서 확인하십시오. 청구 합계만 보면 원인 기능이 가려지니 유형별로 나눠 보십시오.
API 호출 비용을 낮추려면 모델 라우팅과 컨텍스트 윈도우 최적화를 함께 점검해야 합니다. 싼 모델로 바꾸고도 긴 맥락을 그대로 넣으면 절감 폭이 줄어드니 입력 길이와 모델 등급을 한 세트로 조정하십시오. 반복 질문과 일회성 초안을 같은 경로로 보내면 단가가 섞여 원인 파악이 어려워집니다. 주간 합계만 보지 말고 호출 유형별로 길이를 나눠 보십시오.
토큰이 어디서 새는지 먼저 파악하기

요금은 대개 입력 토큰과 출력 토큰을 따로 곱합니다. 채팅 화면은 이전 대화를 다시 보내고, 검색 연결은 참고 조각을 매번 붙이므로 체감보다 입력이 깁니다. 로그에서 호출당 토큰을 보면 숨은 반복이 드러납니다. 입력만 큰 호출과 출력만 큰 호출을 나누어 기록하면 대책이 달라집니다.
사용량 화면에서 입력·출력 비율을 먼저 보시면 자를 지점이 분명해집니다. 출력 단가가 높은 모델에서는 긴 해설을 막는 효과가 크고, 입력이 대부분이면 히스토리와 첨부부터 줄이셔야 합니다. 같은 파일을 매 턴 넣는 습관이 있으면 그날부터 끊는 편이 낫습니다. 세션을 짧게 나누고 필요한 문장만 다시 붙이면 토큰 사용량 줄이기가 숫자로 확인됩니다.
도구 호출 결과도 다음 입력에 다시 실립니다. 긴 원시 응답 대신 요약 필드만 넘기십시오.
입력·출력 토큰이 inflating되는 대표 패턴
대표 패턴은 시스템 프롬프트를 매 호출에 통째로 넣는 방식입니다. 도구 설명, 정책 문구, 예시 대화가 반복되면 프롬프트 압축 없이 입력이 불어납니다. 역할 안내를 조금 고칠 때마다 전체가 새 입력으로 잡힙니다. 자주 바뀌는 값은 시스템 블록 밖인 사용자 메시지에 두십시오.
출력 쪽에서는 장황한 해설과 중복 요약, 코드 전체 재작성이 길이를 키웁니다. max_tokens와 짧은 형식 지시를 두지 않으면 모델이 여분의 문단을 붙입니다. 답변 앞에 개요를 또 쓰게 하는 지시도 출력을 불립니다. 작업은 한 종류만 남기고 예시 입출력은 짧은 한 쌍만 두는 편이 안전합니다.
디버깅용 전체 덤프를 프롬프트에 붙이는 일도 입력을 부풀립니다. 재현에 필요한 오류 메시지 몇 줄만 남기십시오.
모델·컨텍스트 길이로 비용 줄이는 설정
(출처: Ki-jung Kim (akaslany))
같은 작업도 모델 등급에 따라 단가가 크게 갈립니다. 초안과 분류는 가벼운 모델에 두고, 최종 검수만 상위 모델에 넘기는 모델 라우팅이 현장에서 많이 쓰입니다. 모든 요청을 최상위 모델에 고정하면 토큰 수가 같아도 금액이 커집니다. 난이도를 태그로 남기면 경로를 나중에 바꾸기 쉽습니다.
gpt-4o-mini API는 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.60달러이며 컨텍스트 윈도우는 128,000토큰입니다. 창이 넓다고 문서를 다 넣으면 절감이 사라지니 필요한 구간만 남기십시오. 최대 출력 한도는 16,384토큰이므로 긴 초안은 단계를 나누는 편이 안전합니다. 검색 결과나 회의록은 질문과 관련된 문단만 고르십시오.
컨텍스트 윈도우 최적화는 창 크기 숫자가 아니라 실제로 보내는 글자 수를 줄이는 작업.
| 항목 | 수치 |
|---|---|
| gpt-4o-mini 입력 | $0.15 / 1M 토큰 |
| gpt-4o-mini 출력 | $0.60 / 1M 토큰 |
| 컨텍스트 윈도우 | 128,000토큰 |
| GPT-5.6+ 캐시 쓰기 | 일반 입력의 1.25배 |
| GPT-5.6+ 캐시 읽기 | 일반 입력의 0.1배 |
| GPT-5.6+ 최소 캐시 길이 | 1,024토큰 |
가벼운 모델로 초안을 보내는 기준
가벼운 모델은 분류, 추출, 짧은 초안에 맞습니다. 모호한 판단이나 긴 규정 해석은 상위 모델로 올리고, 그 앞 단계는 싼 모델이 처리하게 두십시오. 모델 라우팅 규칙을 고정해야 호출마다 사람이 고르지 않습니다. 단순 오탈자 수정까지 비싼 모델에 맡기지 마십시오.
실패 시 바로 최상위 모델로 재시도하면 비용이 다시 붙습니다. 오류 유형을 나눈 뒤 재작성만 상위 모델에 넘기는 경로가 낫습니다. 일일 한도를 모델별로 나눠 두면 특정 경로가 폭주해도 전체가 멈추지 않습니다. 로그에 모델명과 토큰을 같이 남겨야 주간 점검이 가능합니다.
품질 샘플을 주기적으로 뽑아 가벼운 모델의 오답을 확인하십시오. 오답률이 높은 유형만 상위 모델 비율을 올리시면 됩니다.
프롬프트와 캐시로 반복 호출 아끼기
반복되는 긴 안내는 캐시에 맡기는 편이 낫습니다. OpenAI API 프롬프트 캐싱은 재사용된 입력 토큰에 최대 90% 할인된 cached-input 요금을 적용하고, 재계산을 생략해 지연도 줄입니다. GPT-5.6 이후 캐시 쓰기는 일반 입력의 1.25배, 읽기는 0.1배이며 최소 캐시 가능 길이는 1,024토큰입니다.
Claude 프롬프트 캐시는 자주 쓰는 긴 프롬프트에서 비용을 최대 90%, 지연을 최대 85%까지 줄일 수 있습니다. 캐시 쓰기는 기본 입력가의 25% 할증이고, 캐시 읽기는 기본 입력가의 10%로 청구됩니다. 한 번 쓰고 버리는 짧은 안내에 캐시를 켜면 쓰기 할증만 남을 수 있으니 반복 횟수를 먼저 보셔야 합니다. 이전 모델은 최소 캐시 길이가 2,048토큰인 경우가 있으니 시스템 블록 길이를 맞추십시오.
시스템 프롬프트 고정과 응답 길이 제한
시스템 프롬프트는 앞부분을 고정하고 바뀌는 사용자 입력만 뒤에 두면 캐시 적중률이 올라갑니다. 매 호출마다 안내 순서를 바꾸면 캐시가 깨지니 템플릿 문구를 잠그십시오. 날짜나 난수를 시스템 블록 한가운데에 넣지 않는 것이 핵심입니다. 고정 구간이 앞에 모여 있어야 캐시 키가 안정됩니다.
응답 길이는 형식과 상한을 함께 적습니다. 목록 대신 두세 문장으로 답하고, 코드는 변경된 함수만 달라고 하면 출력이 줄고 API 호출 비용도 내려갑니다. JSON만 반환하라는 한 줄이 긴 해설보다 토큰을 덜 씁니다. 기본 상한은 짧게 두고 사용자가 길게 요청한 경우에만 풀십시오.
시스템 문구를 버전으로 관리하면 캐시 깨짐을 추적하기 쉽습니다. 배포 전에 고정 구간 길이가 최소 캐시 길이를 넘는지 확인하십시오.
실무에서 바로 쓰는 AI 토큰 비용 절감 정리
AI 토큰 비용 절감은 누수 파악, 모델 선택, 컨텍스트 길이, 프롬프트 고정, 캐시, 출력 한도를 한 흐름으로 맞추는 일입니다. 입력 비율이 높으면 히스토리와 첨부를 줄이고, 출력 비율이 높으면 형식과 max_tokens를 조이십시오. 프롬프트 압축은 예시를 줄이고 규칙을 짧은 문장으로 남기는 작업입니다.
반복 호출이 많은 서비스는 캐시 최소 길이를 맞춘 뒤 시스템 블록을 안정적으로 유지하는 것이 우선입니다. 싼 모델로 초안을 만들고 비싼 모델로만 검수하면 같은 품질에서도 금액 차이가 납니다. 위 표를 기준으로 호출 경로를 나누고, 주간 사용량에서 입력과 출력을 다시 확인하시면 됩니다. 자주 쓰는 경로에만 캐시와 라우팅을 먼저 적용하십시오.
한 주에 한 번 상위 호출 경로의 토큰 분포를 보면 다음 절감 지점이 드러납니다. 표의 단가는 참고이고 실제 청구는 캐시 적중률에 따라 달라집니다.