Claude 1M 토큰 비용 계산 및 모델별 요금 정리
Claude API의 1M 토큰당 가격 체계를 모델별로 상세히 안내합니다. 입력과 출력 요율 차이를 반영하여 월간 청구액을 산출하는 방법과 토큰당 텍스트 분량 기준을 확인하십시오. 실제 개발 환경에서 발생하는 비용 구조를 명확히 이해할 수 있습니다.
Claude에서 1M 토큰의 비용은 얼마입니까?
1M 토큰은 100만 토큰을 의미하며, 모든 Claude API(애플리케이션 프로그래밍 인터페이스) 가격이 책정되는 단위입니다. 입력과 출력의 요율이 다르고 모델마다 고유한 요율이 적용되므로 단일 가격은 존재하지 않습니다. 2026년 8월 기준으로 100만 입력 토큰당 비용은 Claude Haiku 4.5의 경우 $1, Claude Sonnet 5의 경우 $2, Claude Opus 5의 경우 $5입니다.
출력은 비용이 더 많이 발생하는 부분입니다. 현재 모든 모델에서 출력 요율은 입력 요율의 5배이므로, 전체 청구 금액은 단순히 대표 수치보다는 입력과 출력의 비율에 따라 결정됩니다. 긴 문서를 전송하고 짧은 답변을 받는 애플리케이션은 짧은 프롬프트에서 긴 답변을 작성하는 애플리케이션과 비용 구조가 매우 다릅니다.
이 페이지는 토큰 비용과 개발 전 예상 청구액을 산출하는 단위 경제학을 다룹니다. 작업 중 토큰이 실제로 어떻게 소모되는지 확인하려면 Claude Code 세션 내 토큰 소모 경로를 읽어 보십시오.
1M 토큰의 규모
토큰은 모델이 읽거나 쓰는 텍스트의 단위입니다. Anthropic의 대략적인 가이드에 따르면 4자당 1토큰이며, 영어 단어로는 약 0.75개에 해당합니다. 따라서 100만 토큰은 약 75만 단어, 즉 일반 텍스트로 약 4 MB 정도의 분량입니다.
일반적인 입력에 대한 추정치를 살펴보면 이 규모를 더 쉽게 이해할 수 있습니다.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]이 비율을 기준으로 할 때, 100만 토큰은 일반적인 웹 페이지 400개를 한 번 읽는 분량이나, 해당 분량의 연구 논문 8편에 해당합니다. 이는 중간 규모의 코드베이스를 한 번 훑거나, 한 사람이 한 달 동안 가볍게 대화하는 정도의 양입니다.
위 수치는 모두 추정치로 간주해야 합니다. 코드, JSON, 영어 이외의 언어로 된 텍스트는 토큰당 포함되는 단어 수가 적으므로, 0.75라는 비율은 낙관적인 수치입니다. 여기에 한 가지 더 고려할 점이 있습니다. Claude Opus 4.7 이상(Opus 5 및 Sonnet 5 포함)은 더 새로운 토크나이저를 사용하며, 이는 Sonnet 4.6 이하와 비교했을 때 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성합니다. Claude Haiku 4.5는 이전 토크나이저를 사용합니다. 따라서 Haiku 4.5에서 측정한 토큰 수는 동일한 입력이라 하더라도 Sonnet 5에서는 더 높게 나타나며, 이 경계를 넘어 단순하게 백만 토큰당 가격을 비교하는 것은 공정하지 않습니다. 결정을 내리기 전에 동일한 프롬프트를 두 모델 모두에 입력하여 토큰 수를 확인하십시오.
Claude의 백만 토큰당 요금
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5는 2026년 8월 31일까지 입력 토큰당 $2, 출력 토큰당 $10의 도입 가격이 적용됩니다. 2026년 9월 1일부터는 표준 요금인 입력 토큰당 $3, 출력 토큰당 $15가 적용됩니다. Claude Opus 5의 요금은 입력 토큰당 $5, 출력 토큰당 $25입니다.
요금은 변동될 수 있습니다. 이 페이지의 모든 수치는 2026년 8월 기준의 예시로 간주하시기 바라며, 예산을 확정하기 전에 공식 요금 페이지에서 현재 요금을 확인하십시오.
컨텍스트 길이에 따라 요율이 변하지는 않습니다. Claude 4.6 이상 버전에서는 전체 1M 토큰 컨텍스트 윈도우가 표준 요금으로 청구되므로, 900,000 토큰 요청은 9,000 토큰 요청과 토큰당 동일한 비용이 발생합니다. 긴 프롬프트는 토큰 수가 많기 때문에 비용이 더 많이 드는 것이며, 별도의 장문 컨텍스트 요율은 적용되지 않습니다.
가격 변동에도 유지되는 산술 연산
모든 청구 금액은 두 번의 곱셈과 한 번의 덧셈으로 계산됩니다.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rate실행 가능한 코드로 작성하면 다음과 같습니다.
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")이 코드는 0.0126를 출력합니다. 4,300개의 입력 토큰을 보내고 400개의 출력 토큰을 받는 요청은 Sonnet 5 기준으로 약 1.3 센트가 소요됩니다. 두 가지 요금 정보를 코드 내 한 곳에 보관하십시오. 가격이 변경되면 두 줄만 수정하면 되며, 시스템 내의 모든 견적 정보가 그에 맞춰 함께 변경됩니다.
실제 애플리케이션을 위한 작업 추정치
지원 어시스턴트를 예로 들어 보겠습니다. 시스템 프롬프트와 제품 문서는 총 4,000 토큰입니다. Messages API는 상태를 저장하지 않으며 모델은 호출 간에 아무것도 기억하지 못하므로, 모든 요청마다 이 내용이 전송됩니다. 사용자 질문은 약 300 토큰을 추가합니다. 답변은 약 400 토큰입니다. 즉, 요청당 4,300 토큰의 입력과 400 토큰의 출력이 발생합니다.
100만 입력 토큰으로 이러한 형태의 요청을 약 232회 처리할 수 있습니다. 하루 1,000회 요청 시 애플리케이션은 매일 430만 입력 토큰을 소비하므로, "100만 토큰"은 6시간도 채 되지 않는 트래픽 분량입니다.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]Claude Opus 5에서 해당 트래픽은 1,000회 요청당 $31.50의 비용이 듭니다. Sonnet 5에서는 $12.60입니다. Claude Haiku 4.5로 낮추면 $6.30가 되며, Sonnet 5에서 웜 프롬프트 캐시(warm prompt cache)를 사용하면 $5.40로 더 낮아집니다.
이 트래픽의 한 달 치를 계산하려면 30을 곱하십시오. 정가 기준 Sonnet 5는 월 약 $378입니다. 동일한 애플리케이션에 웜 캐시를 적용하면 약 $162입니다. 모델 선택과 캐싱 결정은 이 정도 규모에서 협상할 수 있는 어떤 요금보다 더 큰 가치를 지닙니다. 어떤 모델을 실행할지는 별개의 문제이며, 평가를 통과하는 가장 저렴한 모델이 최선입니다. Opus, Sonnet, Haiku 선택하기에서 이를 적절하게 테스트하는 방법을 다룹니다.
프롬프트 캐싱으로 반복되는 부분 비용 절감
4,000 토큰의 접두사는 모든 요청에서 동일하지만, 매번 전체 입력 비용을 지불하게 됩니다. 프롬프트 캐싱은 처리된 접두사를 저장하고 이를 재사용할 때 할인된 요금을 적용합니다.
캐시 읽기 비용은 기본 입력 요금의 0.1배입니다. 캐시 쓰기 비용은 5분 유지 시 기본 요금의 1.25배, 1시간 유지 시 2배입니다. 5분 캐시는 한 번만 읽어도 비용을 회수합니다. 쓰기 시 0.25배의 추가 비용이 발생하지만, 읽을 때마다 0.9배를 절약하기 때문입니다. 1시간 캐시는 두 번 읽어야 손익분기점에 도달합니다.
가장 간단한 활성화 방법은 최상위 필드 하나를 추가하는 것입니다.
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'그런 다음 응답으로 돌아오는 usage 블록을 확인합니다.
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}이 세 가지 입력 카운터는 서로 다른 요율로 청구되며, 이들의 합이 실제 입력 볼륨이 됩니다: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. input_tokens만 읽는 비용 추정 방식은 캐싱이 활성화되면 크게 틀리게 됩니다.
캐시의 효율을 떨어뜨리는 두 가지 요인이 있으며, 둘 다 별도의 오류 메시지 없이 실패합니다.
접두사는 바이트 단위로 동일해야 합니다. 캐시 조회는 접두사 일치 방식으로 작동하므로, 시스템 프롬프트 상단에 타임스탬프나 사용자 이름이 포함되면 매 요청마다 캐시가 무효화됩니다. 이 경우 매번 기본 입력의 1.25배를 지불하게 되며 캐시 읽기는 한 번도 발생하지 않습니다. 이 현상은 cache_creation_input_tokens은 높게 유지되는데 cache_read_input_tokens는 0인 것으로 확인할 수 있습니다. 요청 간 내용이 동일한 마지막 블록에 cache_control를 배치하고, 변하는 내용은 그 뒤에 두어야 합니다. tools 정의를 변경하면 그 아래의 모든 캐시가 무효화됩니다. 무효화는 도구, 시스템, 메시지 순서로 진행되기 때문입니다.
접두사는 충분히 길어야 합니다. 최소 캐시 가능 길이는 Opus 5 모델의 경우 512 토큰, Sonnet 5 모델의 경우 1,024 토큰, Haiku 4.5 모델의 경우 4,096 토큰입니다. 이보다 짧은 프롬프트는 캐시되지 않으며 오류도 반환되지 않습니다. 위 예시의 4,000 토큰 접두사는 Sonnet 5에서는 캐시되지만 Haiku 4.5에서는 캐시되지 않습니다. 4,000은 해당 모델의 최소 기준치 미만이기 때문입니다. 두 카운터가 모두 0으로 표시된다면 아무것도 캐시되지 않은 것입니다.
배치 처리를 통한 비용 절감
Batch API는 입력 및 출력 비용을 50% 할인된 가격으로 비동기 처리합니다. 위 예시에서 1,000건당 12.60였던 비용이 6.30로 줄어듭니다. 이 할인은 프롬프트 캐싱과 중복 적용되므로, 캐시된 배치 작업은 대량의 작업을 수행하는 가장 저렴한 방법입니다.
대신 지연 시간이 발생하므로, 사용자가 실시간으로 기다려야 하는 작업에는 배치 처리가 적합하지 않습니다. 야간 분류 작업이나 문서 백필(backfill) 작업에 적합합니다.
대화 내에서 채팅 비용이 증가하는 이유
API는 상태를 유지하지 않으므로, 클라이언트는 매번 대화 전체를 다시 전송합니다. 따라서 한 채팅 내의 토큰 사용량은 선형적으로 증가하는 것이 아니라 대화 길이의 제곱에 비례하여 증가합니다.
평균 500 토큰을 사용하는 대화 턴을 예로 들어보겠습니다. 1번째 턴은 500개의 입력 토큰을 보냅니다. 2번째 턴은 1,000개를 보냅니다. 20번째 턴은 10,000개를 보냅니다. n(n+1)/2 공식을 적용하면 20턴의 대화에서 전송된 총 입력 토큰은 약 105,000개에 달하지만, 실제 대화 기록의 길이는 10,000 토큰에 불과합니다.
이것이 바로 채팅 기능이 대화 기록상으로 보이는 것보다 비용이 더 많이 발생하는 이유이며, 긴 대화 스레드에서 안정적인 접두사를 캐싱하거나 이전 턴을 요약하는 것이 비용 효율적인 이유입니다. 도구 호출을 반복하는 에이전트도 같은 양상을 보이며, 상황은 더 나쁩니다. 모든 도구 결과가 기록에 남아 이후의 모든 턴에서 다시 전송되기 때문입니다. 직접 운영하는 에이전트에 엄격한 지출 한도 설정하기가 중요한 이유는 이러한 비용 증가가 자동으로 발생하며 아무도 이를 감시하지 않기 때문입니다.
토큰 수를 추측하기 전에 계산하십시오
단어 수로 토큰 수를 추정하는 방식을 중단하십시오. API는 메시지 생성과는 별도의 속도 제한 내에서 무료로 토큰 수를 계산해 줍니다.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'응답에는 하나의 필드가 포함됩니다:
{ "input_tokens": 14 }실제 시스템 프롬프트와 도구 정의, 그리고 대표적인 사용자 메시지를 입력한 다음, 해당 숫자를 위 비용 함수에 대입하십시오. 엔드포인트는 메시지 요청과 동일한 본문을 처리하므로 이미지와 PDF도 정확하게 계산됩니다. 두 가지 주의 사항이 있습니다. 이 수치는 추정치이며 실제 청구 금액과는 약간 다를 수 있습니다. 또한 전달하는 모델의 토크나이저를 기준으로 측정되므로, 실제로 실행할 모델을 전달해야 합니다.
출력 토큰은 아직 존재하지 않으므로 미리 계산할 수 없습니다. max_tokens로 제한을 설정한 다음, 실제 트래픽에서 usage.output_tokens을 통해 실제 분포를 측정하십시오.
청구서에 포함되는 기타 항목
토큰이 청구서 비용의 대부분을 차지합니다. 토큰 외에도 몇 가지 항목이 더 있으며, 이는 사용자들에게 혼란을 주기도 합니다.
- 도구 정의는 모든 요청 시 입력 토큰으로 계산됩니다. 도구 사용 시스템 프롬프트만으로도 Opus 5 기준 286에서 406 토큰이 추가되며, 이는 사용자가 정의한 스키마를 포함하기 전의 수치입니다. 상세한 도구 설명 10개를 추가하면 작은 프롬프트의 토큰 수가 두 배로 늘어날 수 있습니다.
- 웹 검색은 1,000회당 10달러가 청구되며, 검색 결과가 컨텍스트에 포함될 때 발생하는 토큰 비용이 별도로 추가됩니다.
- 웹 가져오기(Web fetch) 기능 자체에는 별도의 수수료가 없으나, 가져온 페이지는 입력 토큰으로 계산됩니다. 100 kB 분량의 문서 페이지는 대략 25,000 토큰에 해당합니다.
- Claude 4.6 이상 버전에서
inference_geo를 사용하여 미국 내 추론을 요청하면 캐시 읽기 및 쓰기를 포함한 모든 토큰 범주에 1.1배의 배수가 적용됩니다.
API 구매가 적절한 선택인지는 사용량에 따라 다릅니다. 특정 사용량 이하에서는 정액제 요금제가 훨씬 유리하며, Claude 구독과 API 비용 비교에서 실제 수치를 바탕으로 비교 결과를 확인할 수 있습니다.
FAQ
Claude에서 1M 토큰의 비용은 얼마입니까?
모델과 입력 또는 출력 토큰 여부에 따라 다릅니다. 2026년 8월 기준으로 100만 입력 토큰당 비용은 Claude Haiku 4.5의 경우 $1, 도입 가격이 적용된 Claude Sonnet 5의 경우 $2, Claude Opus 5의 경우 $5입니다. 출력 비용은 각 모델의 입력 단가의 5배입니다. Sonnet 5는 2026년 9월 1일부터 입력 $3, 출력 $15로 변경됩니다. 요금은 변동될 수 있으므로 예산을 확정하기 전에 공식 가격 페이지에서 확인하십시오.
1M 토큰은 1M 단어와 같습니까?
아닙니다. 1토큰은 영어 기준 약 4글자 또는 약 0.75단어이므로, 100만 토큰은 약 750,000단어에 해당합니다. 이 비율은 참고용일 뿐입니다. 코드, JSON 및 영어 이외의 언어는 단어당 더 많은 토큰을 사용합니다. Claude Opus 4.7 이상 버전은 Claude Sonnet 4.6 이하 버전보다 동일한 텍스트에 대해 약 30퍼센트 더 많은 토큰을 생성하는 최신 토크나이저를 사용하므로, 모델 세대 간에 토큰 수를 그대로 적용할 수 없습니다. 사용할 모델을 지정하여 무료 /v1/messages/count_tokens 엔드포인트로 측정하십시오.
프롬프트 캐싱은 항상 비용을 절감합니까?
아닙니다. 5분 캐시 쓰기 비용은 기본 입력 단가의 1.25배이므로, 작성만 되고 읽히지 않는 접두사는 일반 전송보다 25퍼센트 더 많은 비용이 발생합니다. 첫 번째 읽기부터 비용 절감 효과가 나타납니다. 캐싱은 두 가지 방식으로 실패하며, 모두 별도의 오류 메시지가 없습니다. 요청 간에 캐시된 접두사가 변경되면 정확히 일치해야 하는 특성상 조회가 일치하지 않습니다. 접두사가 모델의 최소 캐시 가능 길이(Sonnet 5는 1,024 토큰, Haiku 4.5는 4,096 토큰)보다 짧으면 아무것도 캐시되지 않으며 오류도 반환되지 않습니다. cache_creation_input_tokens 및 cache_read_input_tokens가 모두 0을 읽는다면 캐시가 작동하지 않는 것입니다.
메시지 수보다 청구 금액이 더 빨리 증가하는 이유는 무엇입니까?
대화 전체가 매 턴마다 다시 전송되기 때문입니다. Messages API는 상태를 유지하지 않으므로, 대화의 20번째 턴은 이전 19개 턴을 모두 입력으로 다시 전달합니다. 턴당 평균 500토큰이라고 가정하면, 20턴 대화 시 대화 기록은 10,000토큰에 불과하지만 약 105,000개의 입력 토큰이 전송됩니다. 에이전트 루프도 모든 도구 결과가 기록에 남기 때문에 동일하게 동작합니다. 안정적인 접두사를 캐시하거나, 이전 턴을 요약하여 요청에서 제외하십시오.