SSD Nodes Learn Hosting plans →
가이드 Matt Connor작성자 Matt Connor · 업데이트됨 2026-08-26

Claude 1M 토큰 가격 계산 방법 및 모델별 비용 정리

Claude API의 100만 토큰당 입력 및 출력 비용을 확인하십시오. 모델별 요율 차이와 토큰 소비 구조를 분석하여 프로젝트의 예상 월간 청구 금액을 정확하게 계산하는 방법을 안내합니다.

Claude에서 1M 토큰은 얼마인가요?

1M 토큰은 100만 토큰을 의미하며, 모든 Claude API(애플리케이션 프로그래밍 인터페이스) 가격이 책정되는 단위입니다. 입력과 출력에 서로 다른 요율이 적용되고 모델마다 가격이 다르기 때문에 단일 가격은 존재하지 않습니다. 2026년 8월 기준으로 100만 입력 토큰당 가격은 Claude Haiku 4.5의 경우 $1, Claude Sonnet 5의 경우 $2, Claude Opus 5의 경우 $5입니다.

출력 비용이 더 높습니다. 현재 모든 모델에서 출력 요율은 입력 요율의 5배이므로, 전체 비용은 단순히 대표 수치보다는 입력과 출력의 비율에 따라 결정됩니다. 긴 문서를 보내고 짧은 답변을 받는 애플리케이션은 짧은 프롬프트로 긴 답변을 작성하는 애플리케이션과 비용 구조가 매우 다릅니다.

이 페이지는 단위 경제학, 즉 토큰당 비용과 개발 전 청구 금액을 추산하는 방법을 다룹니다. 작업 중 토큰이 실제로 어떻게 소비되는지 확인하려면 Claude Code 세션 내 토큰 소비 경로를 읽어보십시오.

1M 토큰의 규모

토큰은 모델이 읽거나 쓰는 텍스트의 단위입니다. Anthropic의 대략적인 기준에 따르면 4자당 1토큰이며, 영어 단어로는 약 0.75단어에 해당합니다. 따라서 100만 토큰은 약 75만 단어, 일반 텍스트 기준으로는 약 4 MB 정도입니다.

일반적인 입력 데이터에 대한 추정치를 살펴보면 규모를 더 쉽게 체감할 수 있습니다.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

이 비율을 적용하면 100만 토큰은 평균적인 웹 페이지 400개를 한 번 읽는 분량이나, 해당 크기의 연구 논문 8편에 해당합니다. 중간 규모의 코드베이스를 한 번 훑거나, 한 사람이 한 달 동안 가볍게 대화하는 분량과 비슷합니다.

위 수치는 모두 추정치임을 유의하십시오. 코드, JSON, 영어 이외의 언어는 토큰당 포함되는 단어 수가 적으므로 0.75라는 비율은 낙관적인 수치입니다. 토큰 수를 변화시키는 요인이 하나 더 있습니다. Claude Opus 4.7 이상(Opus 5 및 Sonnet 5 포함)은 Sonnet 4.6 이하보다 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성하는 최신 토크나이저를 사용합니다. Claude Haiku 4.5는 이전 토크나이저를 사용합니다. 따라서 Haiku 4.5에서 측정한 토큰 수는 동일한 입력이라도 Sonnet 5에서는 더 높게 나타나므로, 이 경계를 넘나들며 단순히 100만 토큰당 가격을 비교하는 것은 공정하지 않습니다. 결정을 내리기 전에 두 모델 모두에 동일한 프롬프트를 입력하여 토큰 수를 확인하십시오.

Claude의 백만 토큰당 비용

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

Claude Sonnet 5는 2026년 8월 31일까지 입력 토큰당 $2, 출력 토큰당 $10의 도입 가격이 적용됩니다. 2026년 9월 1일부터는 표준 요금인 입력 토큰당 $3, 출력 토큰당 $15가 적용됩니다. Claude Opus 5의 요금은 입력 토큰당 $5, 출력 토큰당 $25입니다. 이 표에 포함되지 않은 모델도 있습니다. Claude Fable 5는 입력 토큰당 $10, 출력 토큰당 $50로 책정되어 있으므로, 해당 요금을 지불할 가치가 있는지 여부는 실제 어떤 작업에 모델을 활용하느냐에 따라 달라집니다.

요금은 변동될 수 있습니다. 이 페이지의 모든 수치는 2026년 8월 기준의 예시로 간주하고, 예산을 확정하기 전에 공식 요금 페이지에서 현재 수치를 확인하십시오.

이 요금은 Claude의 비용을 나타낼 뿐 귀하의 작업 부하에 더 저렴한 옵션인지까지는 보장하지 않습니다. Claude와 ChatGPT 모두에서 비용을 산정한 세 가지 작업을 통해 각 API의 비용 효율성을 비교할 수 있습니다.

요금에 영향을 주지 않는 요소 중 하나는 컨텍스트 길이입니다. Claude 4.6 이상 버전에서는 1M 토큰의 전체 컨텍스트 윈도우가 표준 요금으로 청구됩니다. 따라서 900,000 토큰 요청과 9,000 토큰 요청의 토큰당 비용은 동일합니다. 긴 프롬프트는 토큰 수가 많기 때문에 비용이 더 많이 발생하는 것이며, 별도의 긴 컨텍스트용 요금은 적용되지 않습니다.

가격 변동에도 유효한 산술 연산

모든 청구 금액은 두 번의 곱셈과 한 번의 덧셈으로 계산됩니다.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

실행 가능한 코드로 작성하면 다음과 같습니다.

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

이 코드는 0.0126를 출력합니다. 4,300개의 입력 토큰을 보내고 400개의 출력 토큰을 받는 요청은 Sonnet 5 모델에서 약 1.3 센트의 비용이 발생합니다. 두 가지 요금 정보를 코드 내 한곳에서 관리하십시오. 가격이 변경되면 두 줄만 수정하면 되며, 시스템 내의 모든 견적 정보가 그에 맞춰 자동으로 갱신됩니다.

실제 애플리케이션을 위한 예상 비용 산정

지원 어시스턴트를 예로 들어 보겠습니다. 시스템 프롬프트와 제품 문서는 총 4,000 토큰입니다. Messages API는 상태를 저장하지 않으며 모델은 호출 간에 아무것도 기억하지 못하므로, 모든 요청마다 이 내용이 전송됩니다. 사용자 질문은 약 300 토큰을 추가합니다. 답변은 약 400 토큰입니다. 따라서 요청당 입력 4,300 토큰, 출력 400 토큰이 발생합니다.

100만 입력 토큰으로 이러한 형태의 요청을 약 232회 처리할 수 있습니다. 하루 1,000건의 요청이 발생하면 애플리케이션은 매일 430만 입력 토큰을 소비하므로, "100만 토큰"은 6시간도 채 되지 않는 트래픽 분량입니다.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

Claude Opus 5에서 해당 트래픽 비용은 1,000건의 요청당 $31.50입니다. Sonnet 5에서는 $12.60입니다. Claude Haiku 4.5로 낮추면 $6.30가 되며, Sonnet 5에서 웜 프롬프트 캐시(warm prompt cache)를 사용하면 $5.40로 더 낮아집니다.

이 트래픽의 한 달 치를 계산하려면 30을 곱하십시오. 정가 기준 Sonnet 5는 월 약 $378입니다. 동일한 애플리케이션에 웜 캐시를 적용하면 약 $162입니다. 모델 선택과 캐싱 결정은 이 정도 규모에서 협상할 수 있는 어떤 요금보다 더 큰 가치가 있습니다. 어떤 모델을 실행할지는 별개의 문제이며, 평가를 통과하는 가장 저렴한 모델이 최선입니다. Opus, Sonnet, Haiku 선택하기에서 이를 적절하게 테스트하는 방법을 다룹니다.

프롬프트 캐싱을 통한 반복 부분 비용 절감

4,000 토큰의 접두사는 모든 요청에서 동일하지만, 매번 전체 입력 비용을 지불하게 됩니다. 프롬프트 캐싱은 처리된 접두사를 저장하고 이를 재사용할 때 할인된 요금을 적용합니다.

캐시 읽기 비용은 기본 입력 요금의 0.1배입니다. 캐시 쓰기 비용은 5분 유지 시 기본 요금의 1.25배, 1시간 유지 시 2배입니다. 5분 캐시는 한 번만 읽어도 비용을 회수할 수 있습니다. 쓰기 시 0.25배의 추가 비용이 발생하지만, 읽을 때마다 0.9배를 절약하기 때문입니다. 1시간 캐시는 손익분기점에 도달하려면 두 번의 읽기가 필요합니다.

이를 활성화하는 가장 간단한 방법은 최상위 필드 하나를 추가하는 것입니다.

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

그런 다음 응답으로 돌아오는 usage 블록을 확인합니다.

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

세 가지 입력 카운터는 각각 다른 요율로 청구되며, 이들의 합계가 실제 입력 용량인 total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens이 됩니다. 캐싱이 활성화된 상태에서 input_tokens만 읽는 비용 추정 방식은 크게 잘못된 결과를 낳습니다.

캐시의 효율을 떨어뜨리는 두 가지 요인이 있으며, 둘 다 별도의 오류 메시지 없이 실패합니다.

접두사는 바이트 단위로 완전히 동일해야 합니다. 캐시 조회는 접두사 일치 방식을 사용하므로, 시스템 프롬프트 상단에 타임스탬프나 사용자 이름이 포함되면 모든 요청마다 캐시가 변경됩니다. 이 경우 매번 기본 입력의 1.25배를 지불하게 되며 캐시 읽기는 한 번도 발생하지 않습니다. 이 현상은 cache_creation_input_tokens은 높게 유지되는데 cache_read_input_tokens는 0으로 유지되는 것으로 확인할 수 있습니다. 요청마다 내용이 동일한 마지막 블록에 cache_control를 배치하고, 변하는 내용은 그 뒤에 두어야 합니다. tools 정의를 변경하면 그 아래의 모든 캐시가 무효화됩니다. 무효화는 도구, 시스템, 메시지 순서로 진행되기 때문입니다.

접두사는 충분히 길어야 합니다. 최소 캐시 가능 길이는 Opus 5 모델의 경우 512 토큰, Sonnet 5 모델은 1,024 토큰, Haiku 4.5 모델은 4,096 토큰입니다. 이보다 짧은 프롬프트는 캐시되지 않으며 오류도 반환되지 않습니다. 위 예시의 4,000 토큰 접두사는 Sonnet 5에서는 캐시되지만 Haiku 4.5에서는 캐시되지 않습니다. 4,000 토큰이 해당 모델의 최소 기준치 미만이기 때문입니다. 두 카운터가 모두 0을 나타낸다면, 아무것도 캐시되지 않은 것입니다.

배치 처리를 통한 요금 50% 절감

Batch API는 요청을 비동기적으로 처리하며 입출력 비용을 50% 할인합니다. 위 예시에서 1,000건당 $12.60였던 비용이 $6.30로 줄어듭니다. 이 할인은 프롬프트 캐싱과 중복 적용되므로, 캐시된 배치 작업은 대량의 업무를 처리하는 가장 저렴한 방법입니다.

대신 지연 시간이 발생하므로, 사용자가 결과를 기다려야 하는 작업에는 배치가 적합하지 않습니다. 야간 분류 작업이나 문서 백필(backfill) 작업에 적합합니다.

대화 내에서 채팅 비용이 증가하는 이유

API는 상태를 유지하지 않으므로, 클라이언트는 매번 대화 전체를 다시 전송합니다. 따라서 한 대화 내의 토큰 사용량은 직선 형태가 아니라 대화 길이의 제곱에 비례하여 증가합니다.

평균 500 토큰인 대화 턴을 예로 들어보겠습니다. 1번째 턴은 500개의 입력 토큰을 전송합니다. 2번째 턴은 1,000개를 전송합니다. 20번째 턴은 10,000개를 전송합니다. 이를 n(n+1)/2 공식으로 합산하면, 20턴 대화에서 전송된 총 입력 토큰은 약 105,000개에 달하지만, 실제 대화 기록의 길이는 10,000 토큰에 불과합니다.

이것이 채팅 기능의 비용이 대화 기록에서 예상되는 것보다 더 많이 발생하는 이유이며, 긴 대화 스레드에서 안정적인 접두사를 캐싱하거나 이전 턴을 요약하는 것이 비용 효율적인 이유입니다. 도구 호출을 반복하는 에이전트도 동일한 양상을 보이며, 상황은 더 나쁩니다. 모든 도구 결과가 기록에 남아 이후의 모든 턴에서 다시 전송되기 때문입니다. 직접 운영하는 에이전트에 엄격한 지출 한도 설정하기가 이 상황에서 가장 중요한데, 이러한 비용 증가는 자동으로 발생하며 아무도 이를 감시하지 않기 때문입니다.

추측하기 전에 토큰 수를 계산하십시오

단어 수를 기반으로 토큰 수를 유추하는 방식을 멈추십시오. API는 메시지 생성과는 별도의 속도 제한 내에서 무료로 토큰 수를 계산해 줍니다.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

응답에는 하나의 필드가 포함됩니다.

{ "input_tokens": 14 }

실제 시스템 프롬프트와 도구 정의를 대표적인 사용자 메시지와 함께 입력한 다음, 해당 숫자를 위의 비용 함수에 대입하십시오. 엔드포인트는 메시지 요청과 동일한 본문을 사용하므로 이미지와 PDF도 정확하게 계산됩니다. 두 가지 주의 사항이 있습니다. 이 수치는 추정치이며 실제 청구 금액과는 약간 다를 수 있습니다. 또한 전달하는 모델의 토크나이저를 기준으로 측정되므로, 실제로 실행할 모델을 전달해야 합니다.

출력 토큰은 아직 존재하지 않으므로 미리 계산할 수 없습니다. max_tokens로 제한을 설정한 다음, 실제 트래픽에서 usage.output_tokens을 통해 실제 분포를 측정하십시오.

청구서에 포함되는 기타 항목

토큰이 청구서의 대부분을 차지하지만, 토큰이 아닌 항목들도 존재하며 이는 사용자들에게 혼란을 주기도 합니다.

  • 도구 정의는 모든 요청마다 입력 토큰으로 계산됩니다. 도구 사용 시스템 프롬프트만으로도 사용자가 정의한 스키마를 제외하고 Opus 5 기준 286에서 406 토큰이 추가됩니다. 상세한 도구 설명이 10개 정도 포함되면 작은 프롬프트의 길이는 두 배가 될 수 있습니다.
  • 웹 검색은 검색 1,000회당 $10의 비용이 청구되며, 이는 검색 결과가 컨텍스트에 입력될 때 발생하는 토큰 비용과는 별개입니다.
  • 웹 가져오기(Web fetch) 기능 자체에는 별도의 수수료가 없으나, 가져온 페이지는 입력 토큰으로 계산됩니다. 100 kB 크기의 문서 페이지는 대략 25,000의 토큰을 소비합니다.
  • Claude 4.6 이상 버전에서 inference_geo를 사용하여 미국 내 추론을 요청하면 캐시 읽기 및 쓰기를 포함한 모든 토큰 범주에 1.1배의 승수가 적용됩니다.

API 구매가 적절한 선택인지는 사용량에 따라 다릅니다. 일반적으로 요금제 사용량 한도에 도달했을 때 이러한 고민이 시작되며, 한도를 벗어나는 방법은 대기 시간을 기다리는 것부터 해당 작업을 종량제 API 호출로 전환하는 것까지 다양합니다. 특정 사용량 이하에서는 정액제 월간 요금제가 유리하며, Claude 구독과 API 비교에서 실제 수치를 바탕으로 이를 비교해 볼 수 있습니다.

FAQ

Claude에서 1M 토큰은 얼마입니까?

모델에 따라, 그리고 입력 토큰인지 출력 토큰인지에 따라 다릅니다. 2026년 8월 기준으로 100만 입력 토큰당 비용은 Claude Haiku 4.5의 경우 $1, Claude Sonnet 5의 도입 가격은 $2, Claude Opus 5는 $5입니다. 출력 비용은 각 모델의 입력 요금의 5배입니다. Sonnet 5는 2026년 9월 1일부터 입력 $3, 출력 $15로 변경됩니다. 요금은 변동될 수 있으므로 예산을 확정하기 전에 공식 가격 페이지에서 확인하십시오.

1M 토큰은 1M 단어와 같습니까?

아닙니다. 토큰 하나는 영어 기준 약 4자, 즉 약 0.75단어이므로 100만 토큰은 약 75만 단어입니다. 이 비율은 지침일 뿐입니다. 코드, JSON 및 영어 이외의 언어는 단어당 더 많은 토큰을 사용합니다. Claude Opus 4.7 이상 버전은 Claude Sonnet 4.6 이전 버전보다 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성하는 최신 토크나이저를 사용하므로, 모델 세대 간에 토큰 수를 그대로 적용할 수 없습니다. 사용할 모델을 전달하여 무료 /v1/messages/count_tokens 엔드포인트로 측정하십시오.

프롬프트 캐싱은 항상 비용을 절감합니까?

아닙니다. 5분 캐시 쓰기 비용은 기본 입력 요금의 1.25배이므로, 작성만 되고 읽히지 않는 접두사는 일반 전송보다 25% 더 많은 비용이 듭니다. 첫 번째 읽기부터 비용 효율이 발생합니다. 캐싱은 두 가지 방식으로 실패하며, 둘 다 별도의 오류 메시지가 없습니다. 요청 간에 캐시된 접두사가 변경되면 정확히 일치해야 하므로 조회가 일치하지 않습니다. 접두사가 모델의 최소 캐시 가능 길이(Sonnet 5는 1,024 토큰, Haiku 4.5는 4,096 토큰)보다 짧으면 아무것도 캐시되지 않으며 오류도 반환되지 않습니다. cache_creation_input_tokenscache_read_input_tokens가 모두 0을 읽는다면 캐시가 작동하지 않는 것입니다.

왜 메시지 수보다 청구 금액이 더 빠르게 증가합니까?

대화 전체를 매 턴마다 다시 전송하기 때문입니다. Messages API는 상태를 유지하지 않으므로, 대화의 20번째 턴은 이전 19개 턴을 모두 입력으로 다시 전달합니다. 턴당 평균 500토큰이라고 가정하면, 20턴 대화 시 대화 기록은 10,000토큰이지만 약 105,000개의 입력 토큰이 전송됩니다. 에이전트 루프도 모든 도구 결과가 기록에 남기 때문에 동일하게 동작합니다. 안정적인 접두사를 캐시하거나, 이전 턴을 요약하여 요청에서 제외하십시오.