2026년 LLM 토큰 가격 동향은 모델 이름보다 입력·출력·캐시 구간이 청구액을 가릅니다. 같은 작업을 ChatGPT API 요금과 Gemini 토큰 단가, Claude 사용비로 나눠 보면 과금 단위가 모두 1M 토큰입니다. 단가 숫자만 외우면 긴 컨텍스트와 캐시, 배치 조건에서 견적이 어긋납니다.
이 글은 공식 표의 숫자와 적용 조건을 맞춰 읽고, 업무 자동화에서 토큰 비용 절감이 가능한 지점을 고릅니다. 프로모션 기간과 지역 처리 할증처럼 날짜가 있는 항목도 함께 확인합니다.
주요 LLM 토큰 요금 구조와 최근 가격 변화

OpenAI API는 1M 토큰 단위로 과금합니다. GPT-5.6 짧은 컨텍스트 표준 단가는 Sol 입력 4달러·출력 20달러, Terra 입력 2달러·출력 12달러, Luna 입력 0.20달러·출력 1.20달러입니다. 세 등급 모두 출력 단가가 입력보다 몇 배 높습니다.
Gemini Developer API 유료 표준은 Gemini 3.5 Flash 입력 1.50달러·출력 9.00달러입니다. Claude API 표준은 Opus 5 입력 5달러·출력 25달러, Haiku 4.5 입력 1달러·출력 5달러입니다. 최근 변화는 등급 신설보다 구간 단가와 프로모션 만료가 청구에 더 크게 작용합니다.
입력·출력·캐시 토큰이 요금에 미치는 차이
입력보다 출력 토큰 단가가 높은 구조는 ChatGPT, Gemini, Claude에서 공통입니다. 긴 답변을 뽑을수록 청구가 빠르게 늘어나므로 최대 출력 길이를 제한하는 설정이 월 사용비에 직접 붙습니다. 요약만 받는 작업과 장문 초안을 받는 작업은 같은 모델이라도 비용 차이가 큽니다.
캐시 입력은 표준 입력의 10%로 청구되며 Sol 짧은 컨텍스트 캐시 입력은 0.40달러입니다. 반복 프롬프트가 많은 자동화일수록 캐시 적용 여부가 청구액을 좌우합니다. 지침을 매 호출마다 새로 넣으면 할인 구간을 쓰지 못합니다.
모델별 입력·출력 토큰 단가 비교 포인트
(출처: AI Frontier Korea (노정석))
모델 등급만 나란히 두지 말고 컨텍스트 구간을 같은 줄에 놓아야 비교가 성립합니다. Sol 긴 컨텍스트는 입력 8달러·출력 30달러로 짧은 구간보다 높습니다. Gemini 3.1 Pro는 프롬프트 20만 토큰을 기준으로 단가가 갈리므로 길이 측정 없이 단가만 고르지 마십시오.
Claude Sonnet 5는 2026년 9월 1일부터 입력 3달러·출력 15달러입니다. 요금표 숫자만 옮기지 말고 적용 시작일과 구간 조건을 견적에 함께 적어두십시오. 아래 표는 1M 토큰 기준 입력·출력 쌍을 한눈에 맞춘 것입니다.
| 모델 | 입력(1M) | 출력(1M) | 조건 |
|---|---|---|---|
| GPT-5.6 Sol 짧은 컨텍스트 | 4달러 | 20달러 | 캐시 입력 0.40달러, 프로모션 |
| GPT-5.6 Sol 긴 컨텍스트 | 8달러 | 30달러 | 짧은 구간 대비 할증 |
| GPT-5.6 Terra | 2달러 | 12달러 | 짧은 컨텍스트 표준 |
| GPT-5.6 Luna | 0.20달러 | 1.20달러 | 짧은 컨텍스트 표준 |
| Gemini 3.5 Flash | 1.50달러 | 9.00달러 | Batch 0.75달러/4.50달러 |
| Gemini 3.1 Flash-Lite | 0.25달러 | 1.50달러 | 텍스트 등 유료 표준 |
| Gemini 3.1 Pro | 2달러 | 12달러 | 프롬프트 20만 이하, 초과 시 4달러/18달러 |
| Claude Opus 5 | 5달러 | 25달러 | 1MTok 표준 |
| Claude Sonnet 5 | 3달러 | 15달러 | 2026년 9월 1일부터 |
| Claude Haiku 4.5 | 1달러 | 5달러 | 1MTok 표준 |
ChatGPT·Gemini·Claude 요금표에서 확인할 항목
ChatGPT 요금표에서는 짧은 컨텍스트와 긴 컨텍스트, 캐시 입력, 프로모션 종료 시점을 확인합니다. GPT-5.6 Sol 현재가는 프로모션이며 최소 2026년 11월 21일까지 유지된다고 명시되어 있습니다. 캐시 입력은 짧은 구간 기준 0.40달러이므로 표준 입력과 줄을 바꿔 적어야 합니다.
Gemini 표에서는 유료 표준과 Batch, 3.1 Flash-Lite 텍스트 단가를 구분합니다. Flash-Lite는 입력 0.25달러·출력 1.50달러입니다. Claude 표에서는 Opus 5, Sonnet 5, Haiku 4.5의 1MTok 입력·출력 쌍을 같은 단위로 맞춰 읽습니다.
업무·자동화에서 토큰 비용을 줄이는 실전 방법
토큰 비용 절감은 모델 교체보다 출력 길이와 반복 입력을 줄이는 일에서 먼저 납니다. 시스템 프롬프트를 고정해 캐시가 붙게 하면 입력 쪽 실효 단가가 크게 내려갑니다. 답변 형식을 짧게 지정하는 문장 하나도 출력 토큰을 줄입니다.
급하지 않은 일괄 처리는 Gemini Batch API로 비용을 50% 줄일 수 있습니다. 3.5 Flash Batch 단가는 입력 0.75달러·출력 4.50달러이므로 초안·요약·재처리 작업에 맞습니다. 실시간 채팅과 야간 일괄 작업을 같은 엔드포인트에 두지 마십시오.
배치 API와 캐시 입력으로 단가를 낮추는 조건
배치 할인은 실시간 응답이 필요 없는 작업에만 해당합니다. 초안 생성, 로그 요약, 야간 재처리처럼 대기할 수 있는 흐름에 Batch를 쓰면 표준 대비 절반 요금입니다. 사용자 대기 화면이 있는 기능에는 표준 호출을 유지하는 편이 맞습니다.
캐시는 같은 접두 입력이 반복될 때 효과가 납니다. 매 호출마다 지침을 새로 넣으면 할인 구간을 놓칩니다. 공통 지시문은 프롬프트 앞에 고정하고, 변동 값만 뒤에 붙이십시오. 캐시 히트율은 사용 로그에서 주 1회 확인하십시오.
컨텍스트 길이가 요금에 붙는 할증을 피하는 방법
Gemini 3.1 Pro는 프롬프트가 20만 토큰을 넘으면 입력 4달러·출력 18달러로 올라갑니다. 짧은 구간은 입력 2달러·출력 12달러이므로 자료 전체를 한 번에 넣기 전에 길이를 먼저 재야 합니다. 첨부 문서를 쪼개 넣으면 구간 할증을 피할 수 있습니다.
OpenAI도 긴 컨텍스트에서 Sol 입력을 8달러, 출력을 30달러로 올립니다. 대화 이력을 무제한으로 붙이면 단가 구간이 바뀌고 월 청구가 급증합니다. 이전 턴은 요약본만 남기고 원문은 저장소에 두는 편이 안전합니다.
데이터 레지던시 할증과 프로모션 만료가 청구에 미치는 영향
2026년 3월 5일 이후 출시 모델의 데이터 레지던시 엔드포인트는 OpenAI가 토큰 요금에 10% 할증합니다. 국내 처리가 필요한 업무는 기본 단가에 할증을 더한 금액으로 예산을 잡아야 합니다. 기본 엔드포인트와 레지던시 엔드포인트를 혼용하면 항목별 단가가 갈립니다.
Sol 프로모션이 끝나는 시점 이후에는 같은 트래픽도 견적이 달라질 수 있습니다. 대시보드 고지문과 청구 내역을 주기적으로 대조해 단가 변경일을 놓치지 마십시오. 만료 전에 대체 모델의 1M 단가를 미리 적어 두면 전환이 수월합니다.
자동화 파이프라인에서 모델 등급을 나누는 기준
초안과 분류처럼 오차가 허용되는 단계는 Luna나 Flash-Lite, Haiku처럼 낮은 단가 모델에 맡깁니다. 최종 문안과 정책 판단처럼 실수가 비싼 단계만 Sol, 3.1 Pro, Opus에 올리면 사용비를 안정적으로 관리할 수 있습니다. 모든 단계를 최상위 모델에 맡기는 구성은 출력 단가 부담이 큽니다.
자동화 파이프라인은 단계를 나누어 모델을 고정하는 편이 안전합니다. 한 호출에 모든 역할을 넣으면 출력 토큰이 늘고 고가 모델 비중도 함께 올라갑니다. 검수 단계만 고가 모델로 남기는 방식이 비용 대비 품질을 맞추기 쉽습니다.
LLM 토큰 가격 동향 정리와 선택 기준
LLM 토큰 가격 동향을 반영한 선택은 입력 단가보다 출력 단가와 컨텍스트 구간을 먼저 보는 일입니다. 캐시·배치·레지던시 할증을 더한 실효 단가가 견적서의 기준입니다. 공개 단가와 실제 청구가 달라지는 조건은 캐시 미적용과 긴 컨텍스트 진입입니다.
2026년 선택 기준은 작업 유형별로 모델을 나누고, 프로모션 만료일과 20만 토큰 경계를 달력에 적어 두는 일입니다. 숫자만 외우지 말고 조건이 바뀌는 날짜를 함께 관리하십시오. 분기마다 요금표를 다시 읽어 자동화 경로의 모델 매핑을 갱신하는 것이 안전합니다.