SSD Nodes Learn 🎉 VPS $4.99/월부터
가이드 Matt Connor작성자 Matt Connor

Claude API 비용이 비싼 이유와 토큰 요금 계산법

Claude API는 출력 토큰이 입력보다 5배 비싸며 매 대화마다 전체 기록을 다시 읽어 비용이 급증합니다. 실제 세션 데이터를 통해 청구 금액이 발생하는 구조를 분석하고, API 호출 횟수를 줄여 비용을 절감할 수 있는 4가지 핵심 전략을 확인하십시오.

Claude의 비용이 높은 이유: 요약

Claude의 비용이 높은 이유는 네 가지 요소가 복합적으로 작용하기 때문입니다. 출력 토큰은 입력 토큰보다 5배 높은 요율로 책정됩니다. API는 대화 내용을 기억하지 않으므로, 매번 대화가 오갈 때마다 전체 기록을 다시 전송하고 이에 대한 비용을 청구합니다. 에이전트는 하나의 질문을 수십 개의 API 호출로 변환하며, 각 호출마다 계속 늘어나는 대화 기록이 포함됩니다. 여기에 더해, 최첨단 모델은 소형 모델을 운영하는 비용이 아닌, 모델이 수행하는 작업의 난이도를 기준으로 가격이 책정됩니다.

토큰은 텍스트의 단위입니다. 대략적으로 1개의 토큰은 4글자 정도이며, 영어 단어로는 약 0.75개에 해당합니다. 요금은 100만 토큰 단위인 MTok(million tokens) 기준으로 고시됩니다. 아래의 모든 요금은 2026년 8월 기준 Claude API 공식 요금입니다.

대부분의 예상치 못한 청구 금액은 위 목록의 두 번째와 세 번째 이유에서 발생합니다. 사용자들은 보통 Claude가 작성하는 답변이 비용의 주된 원인이라고 생각합니다. 하지만 에이전트 세션에서 답변 작성 비용은 전체 청구 금액의 10분의 1도 되지 않는 경우가 많습니다.

공개된 요금, 수치에 대한 합의

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

절대적인 수치보다는 전체적인 구조를 확인하십시오. 모든 모델은 입력보다 출력에 대해 정확히 5배 높은 요금을 부과합니다. Opus 5는 백만 입력 토큰당 5 달러, 백만 출력 토큰당 25 달러가 청구됩니다. Haiku 4.5는 각각 15입니다. 즉, 가장 저렴한 모델과 가장 비싼 모델 사이의 격차는 5배이며, 읽기 작업과 쓰기 작업 사이의 격차 또한 5배입니다.

Sonnet 5는 2026년 8월 31일까지 백만 토큰당 210 달러의 도입 가격으로 제공됩니다. 2026년 9월 1일부터는 315로 변경됩니다. 요금은 모델 릴리스에 따라 변동되므로, 예산을 수립하기 전에 현재 요금을 확인하십시오.

마지막 열은 캐시 읽기 요금입니다. 이 항목이 청구 금액의 대부분을 결정합니다. 산술 계산을 마친 후 다시 확인하십시오.

출력 토큰 비용이 입력 토큰보다 5배 비싼 이유

읽기와 쓰기는 작업량이 동일하지 않습니다. 입력 토큰은 한 번의 패스로 처리됩니다. 모델은 전체 프롬프트를 한꺼번에 읽으며, 이 과정은 병렬로 수행됩니다. 이것이 60,000 토큰의 프롬프트가 1,000 토큰의 프롬프트보다 읽는 데 60,000배 더 오래 걸리지 않는 이유입니다.

출력 토큰은 한 번에 하나씩 생성됩니다. 새로운 토큰이 생성될 때마다 모델을 거치는 패스가 필요하며, 이전의 모든 토큰을 컨텍스트로 참조해야 합니다. 1,000개의 토큰을 작성한다는 것은 1,000번의 패스를 순차적으로 수행한다는 의미입니다. 이러한 직렬 작업은 읽기 작업처럼 분산할 수 없으므로, 각 출력 토큰은 하드웨어를 더 오랜 시간 점유하게 됩니다.

이것이 "답변을 짧게 줄여라"라는 지시가 기대보다 비용 절감 효과가 낮은 이유입니다. 이 방법은 에이전트 비용의 더 작은 부분을 차지하는 영역에만 영향을 미칩니다.

왜 모든 턴마다 전체 대화 내용이 다시 청구됩니까?

Claude API는 상태를 저장하지 않습니다(stateless). Anthropic 측에는 사용자가 메시지를 하나씩 추가하는 대화 세션이 존재하지 않습니다. 각 요청은 전체 메시지 기록을 포함하며, 모델은 응답을 생성하기 전에 이 기록 전체를 읽습니다. 따라서 30번째 턴에서는 1번째부터 29번째 턴까지의 내용도 함께 청구됩니다.

즉, 대화 비용은 대화 길이에 비례하는 것보다 더 빠르게 증가합니다. 1번째 턴에서는 적은 양의 컨텍스트가 청구되지만, 40번째 턴에서는 매우 큰 컨텍스트가 청구됩니다. 40번의 턴을 모두 합산하면, 실제로 작성된 토큰 수보다 훨씬 많은 양의 토큰에 대해 비용을 지불하게 됩니다.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

위 세션은 시스템 프롬프트, 도구 정의, 그리고 에이전트가 처음으로 연 파일들을 포함하여 20,000 토큰으로 시작합니다. 40 번째 턴에 이르면 컨텍스트는 100,000 토큰을 보유하게 됩니다. 40번의 모든 턴에 걸쳐 평균을 내면 요청당 약 60,000 토큰을 읽는 셈입니다.

에이전트가 채팅보다 훨씬 비싼 이유는 무엇입니까?

채팅은 질문 하나당 요청이 한 번 발생합니다. 반면 에이전트는 단계마다 요청이 발생합니다. 파일을 읽는 것도 한 단계이고, 테스트를 실행하는 것도 한 단계입니다. 테스트 결과를 읽는 것도, 파일을 수정하는 것도 각각 한 단계입니다. 코딩 에이전트가 하나의 작업을 완료하기 위해 40단계를 거치는 것은 흔한 일입니다.

도구 사용에는 두 가지 추가 비용이 따릅니다. 모델은 매번 어떤 도구가 존재하는지 알아야 하므로, 도구 정의는 모든 요청마다 입력 토큰으로 포함됩니다. Anthropic은 이 오버헤드를 공개했습니다. tool_choiceauto으로 설정된 Opus 5 모델에서 도구 사용 시스템 프롬프트는 286 토큰을 차지하며, 여기에 사용자가 정의한 도구 스키마의 토큰이 추가됩니다. 일부 서버 측 도구에는 별도의 요금이 부과되기도 합니다. 웹 검색은 결과가 소비하는 토큰 외에도 1,000회 검색당 10달러의 요금이 청구됩니다.

모든 도구 실행 결과는 영구적인 컨텍스트가 됩니다. 3,000줄을 출력하는 명령을 실행하면, 해당 세션이 끝날 때까지 모든 요청에 그 3,000줄이 포함됩니다. Claude Code가 보고하는 세션별 토큰 사용량을 확인하면 이를 알 수 있습니다. 출력이 많은 명령을 실행한 직후 입력 토큰 수가 급격히 증가하는 것을 확인하십시오.

단일 실제 세션에서의 연산

Opus 5를 사용한 에이전트 코딩의 현실적인 1시간 작업 사례입니다. 총 40회의 API 요청이 발생했습니다. 컨텍스트는 20,000 토큰에서 100,000 토큰으로 증가했으며, 요청당 평균 약 60,000 토큰을 처리했습니다. 모델은 요청당 약 700 토큰을 작성했는데, 이는 짧은 도구 호출과 몇 개의 긴 코드 블록이 혼합된 결과입니다.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

비용 구성을 살펴보겠습니다. 읽기 비용은 12.00 달러이고 쓰기 비용은 0.70 달러이므로, 실제로 읽게 되는 출력물은 전체 비용의 약 5%에 해당합니다. 모델은 28,000 토큰을 작성했고, 읽기 작업에 대해 2,400,000 토큰만큼 청구되었습니다. 사람이 직접 240만 토큰을 입력한 것이 아닙니다. 동일한 100,000 토큰이 반복적으로 읽혔을 뿐입니다.

레벨 1: 프롬프트 캐싱, 가장 큰 비중을 차지하는 요소

프롬프트 캐싱은 프롬프트의 고정된 접두사를 처리된 형태로 저장합니다. 다음 요청 시 해당 접두사는 다시 처리되지 않고 캐시에서 읽어옵니다. 캐시에 쓰는 비용은 5분 캐시의 경우 입력 요금의 1.25배, 1시간 캐시의 경우 2배입니다. 캐시에서 읽는 비용은 입력 요금의 0.1배입니다. Opus 5 모델의 경우, 이는 백만 토큰당 0.50 달러로, 5 달러보다 저렴합니다.

이를 앞선 세션에 적용해 봅니다. 대화가 진행됨에 따라 100,000개의 토큰이 각각 한 번씩 캐시에 기록됩니다. 나머지 2,300,000개의 입력 토큰은 캐시 읽기 작업이 됩니다.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

캐시 가능한 부분은 cache_control 필드로 표시합니다. 시스템 프롬프트와 도구 정의처럼 턴마다 변하지 않는 내용 뒤에 중단점(breakpoint)을 배치하십시오. 계속 참조하는 긴 문서 역시 동일한 고정 블록에 포함해야 합니다.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

이제 프롬프트의 순서가 비용을 결정합니다. 캐시 적중(hit)이 발생하려면 프롬프트의 시작 부분부터 정확히 일치해야 하므로, 매 요청마다 변하는 내용은 변하지 않는 내용 뒤에 위치해야 합니다. 시스템 프롬프트 상단에 타임스탬프를 넣으면 매 턴마다 캐시가 깨집니다. 전체 접두사가 캐시 미스(miss) 처리되어, 다시 쓰는 비용으로 입력 요금의 1.25배를 지불하게 됩니다.

응답을 통해 캐싱이 정상적으로 작동했는지 확인할 수 있습니다. 요청을 보낸 뒤 사용량 블록을 읽어보십시오.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

모든 응답에는 다음과 같은 usage 객체가 포함됩니다:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

반복 요청을 보냈음에도 cache_read_input_tokens 내에 0이 표시된다면 캐시 적중이 일어나지 않는 것입니다. 일반적인 원인은 중단점 이전의 내용이 변경되었기 때문입니다. 5분 캐시는 만료 시간이 있으므로, 6분 뒤에 보낸 요청은 캐시 미스가 발생하고 새로 쓰기 작업이 수행됩니다.

레벨 2: 단순한 작업은 더 작은 모델로 처리하기

에이전트 세션에서 발생하는 대부분의 작업은 어렵지 않습니다. 파일을 열거나, 포맷터를 실행하거나, diff를 읽는 작업 등이 이에 해당합니다. 이러한 작업에는 최상위 모델이 필요하지 않습니다. 해당 작업을 Haiku 4.5로 라우팅하면 입력 비용이 백만 토큰당 5 달러에서 1 달러로 낮아집니다.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

동일한 세션의 비용은 캐싱을 사용하지 않는 Opus 5에서는 12.70 달러, 캐싱을 사용하는 Opus 5에서는 2.48 달러, 캐싱을 사용하는 Sonnet 5에서는 0.99 달러, 그리고 캐싱을 사용하는 Haiku 4.5에서는 0.50 달러입니다. 캐싱만으로도 전체 비용의 약 80%가 절감됩니다. 모델 선택은 나머지 비용의 대부분을 줄여줍니다.

솔직한 주의 사항을 말씀드립니다. 더 저렴한 모델이 잘못된 답변을 내놓으면 세션 전체를 다시 진행해야 하며, 사용자의 시간까지 낭비하게 됩니다. 가격이 아닌 작업의 난이도에 따라 라우팅하십시오. Opus, Sonnet, Haiku 선택하기에서 각 모델이 어떤 작업에 적합한지 상세히 다룹니다.

레벨 3: 컨텍스트 위생

컨텍스트에 남겨둔 모든 토큰은 이후의 모든 턴마다 비용이 청구되므로, 토큰을 일찍 제거하는 것이 나중에 제거하는 것보다 훨씬 가치가 큽니다. 40턴으로 구성된 세션의 5번째 턴에 5,000 토큰짜리 파일을 그대로 붙여넣으면, 이 파일은 35번 더 읽히게 됩니다. 이는 175,000개의 불필요한 입력 토큰을 발생시키며, 부주의한 붙여넣기 한 번으로 Opus 5 모델 기준 거의 1달러에 달하는 비용이 낭비됩니다.

수치를 개선하는 4가지 습관은 다음과 같습니다.

  • 어제 하던 작업을 이어가지 말고, 새로운 작업을 시작할 때는 새로운 세션을 여십시오.
  • head -50와 같은 도구를 사용하여 모델이 출력을 받기 전에 노이즈가 많은 명령어를 미리 필터링하십시오.
  • 파일 전체를 요청하지 말고, 필요한 특정 함수 하나만 요청하십시오.
  • 긴 세션에서 진전이 없으면 요약을 요청한 뒤 그 요약본을 바탕으로 다시 시작하십시오. 요약본은 수백 토큰에 불과하지만, 전체 기록은 십만 토큰에 달할 수 있습니다.

Lever 4: 대화형이 아닌 모든 작업은 배치(Batch) 처리

Batch API는 요청을 비동기적으로 처리하며 입력 및 출력 비용을 50% 절감합니다. 작업 결과가 즉시 필요하지 않다면 배치 처리를 사용하십시오. 분류, 추출, 백로그 요약, 평가 실행 등이 이에 해당합니다. 배치 할인은 프롬프트 캐싱과 중복 적용됩니다. 대화형 세션은 대기할 대상이 없으므로 이 기능이 적용되지 않습니다.

바가지를 쓰고 있는 것일까요?

"왜 Claude는 비싼가"라는 질문 이면에 숨겨진 본질적인 의문이므로, 이에 대해 명확히 답변하겠습니다. 요금은 공개되어 있으며 표준 티어를 사용하는 모든 사용자에게 동일하게 적용되고, 토큰 단위로 과금됩니다. 청구서의 어떤 항목도 임의로 결정되지 않습니다. 요금표는 토큰 가격을 명시할 뿐, 사용자가 중요하게 생각하는 결과물에 대한 가치를 보장하지는 않습니다.

따라서 토큰이 아닌 결과물의 가치를 기준으로 비용을 산정하십시오. 위 세션은 캐싱을 적용하지 않았을 때 12.70 달러가 소요되었습니다. 만약 이 세션을 통해 1시간이 걸릴 작업을 완료했다면 이는 저렴한 비용입니다. 반면, 40번의 대화를 주고받으며 제자리걸음만 했다면 동일한 12.70 달러를 지불하고도 아무런 성과를 얻지 못한 것이며, 이때는 요금 자체가 문제가 아닙니다.

이 점을 기억해야 합니다. 청구 금액은 가치가 아닌 토큰 사용량에 비례합니다. 생산적인 세션과 낭비된 세션의 길이가 같다면 비용도 동일합니다. 이것이 요금표보다 4가지 레버가 더 중요한 이유입니다. 토큰당 가격은 협상할 수 없지만, 작업에 필요한 토큰의 양은 사용자가 결정할 수 있기 때문입니다.

그러므로 월별 총액이 아닌 작업 완료당 비용을 추적하십시오. 캐싱과 라우팅을 최적화하여 이 수치가 낮아진다면, 월별 총액이 증가하더라도 시스템은 개선되고 있는 것입니다. 총액의 증가는 더 많은 작업을 수행하고 있다는 증거이기 때문입니다.

비용 절감에 도움이 되지 않는 것

일부 널리 알려진 조언은 실질적인 효과가 거의 없습니다. 모델에게 "간결하게 작성하라"고 지시하면 출력물은 줄어들지만, 출력물은 전체 비용의 5%에 불과합니다. 질문 자체를 짧게 줄여도 60,000 토큰의 컨텍스트 대비 수백 토큰을 절약할 뿐입니다. 확장된 사고(extended thinking) 기능을 끄는 것은 사고 토큰이 전체 출력에서 상당한 비중을 차지할 때만 도움이 되며, 이는 추측할 필요 없이 사용량 블록을 통해 확인할 수 있습니다.

더 큰 컨텍스트 윈도우 자체가 비용을 발생시키는 것도 아닙니다. Claude 4.6 이상 버전에서는 전체 100만 토큰 윈도우가 표준 토큰당 요금으로 청구되므로, 900,000 토큰 요청은 9,000 토큰 요청과 동일한 토큰당 비용이 발생합니다. 윈도우 크기가 가격을 결정하지 않습니다. 윈도우에 무엇을 넣을지 선택하는 것이 가격을 결정합니다.

두 가지 사항은 단일 세션보다는 계획 단계에서 고려해야 합니다. 매일 대화형으로 사용하는 경우 토큰당 과금 방식과 정액제 요금제를 비교하십시오. API 및 구독 비용 비교에서 해당 계산을 다룹니다. 또한 에이전트가 서버에서 무인으로 실행되는 경우, 다른 설정을 조정하기 전에 엄격한 지출 한도를 설정하십시오. VPS에서 AI 에이전트를 위한 비용 제어에서 이를 다룹니다. 규모에 대한 감을 잡으려면 100만 Claude 토큰으로 실제로 할 수 있는 작업을 통해 요금표를 텍스트 분량으로 환산해 보십시오.

FAQ

에이전트를 사용하기 시작한 뒤 Claude 청구 금액이 왜 급증했습니까?

에이전트는 질문 하나당 여러 요청을 보내며, 각 요청마다 지금까지의 대화 전체를 포함하기 때문입니다. 일반 채팅은 질문당 하나의 요청을 보내지만, 코딩 에이전트는 단계마다 요청을 보냅니다. 하나의 작업에 40단계가 소요되는 것은 일반적입니다. 이러한 각 요청은 전체 컨텍스트에 대해 비용이 청구되므로, 100,000 토큰으로 끝나는 세션이라도 총 200만 토큰 이상의 입력 토큰 비용이 발생할 수 있습니다. API 응답의 input_tokenscache_read_input_tokens을 확인하여 직접 확인하십시오.

프롬프트 캐싱이 정말로 청구 금액을 크게 줄여줍니까?

작업 예시에서는 세션 비용이 12.70 달러에서 2.48 달러로 감소했습니다. 캐시 읽기 비용은 입력 요금의 10분의 1이기 때문입니다. 절감액은 전적으로 적중률(hit rate)에 달려 있습니다. 5분 캐시의 경우 쓰기 비용은 입력의 1.25배이고 읽기 비용은 0.1배이므로, 단 한 번만 읽어도 비용을 회수할 수 있습니다. 만약 요청할 때마다 프롬프트 앞부분이 계속 바뀐다면 적중이 전혀 발생하지 않으며, 쓰기 프리미엄만 지불하게 됩니다. 작동 여부를 가정하기 전에 cache_read_input_tokens을 통해 확인하십시오.

모든 작업에 Haiku를 사용해야 합니까?

아닙니다. Haiku 3.5는 입력 토큰 100만 개당 1 달러인 반면, Opus 3.5는 5 달러입니다. 따라서 분류나 라우팅과 같은 단순하고 대량의 작업에서는 비용 절감 효과가 확실합니다. 하지만 어려운 작업에서 잘못된 답변이 나오면 모델 비용보다 더 큰 손실이 발생합니다. 재시도 비용과 사용자의 시간이 추가로 소요되기 때문입니다. 기계적인 작업에는 작은 모델을 사용하고, 판단이 필요한 작업에는 최상위 모델을 사용하는 혼합 전략이 가장 효율적입니다.

API가 Claude 구독보다 저렴합니까?

사용량의 일정함에 따라 다릅니다. 구독은 사용량 제한이 있는 고정 월 요금제입니다. API는 토큰당 지불하는 방식이며 상한선이 없습니다. 사용량이 적거나 간헐적으로 발생할 때는 API가 더 저렴하지만, 매일 업무 시간에 집중적으로 사용한다면 구독이 더 저렴할 수 있습니다. 사용량 블록에서 일일 평균 토큰 수를 확인하고, 모델 요금을 적용하여 계산한 뒤 구독료와 비교하십시오.