SSD Nodes Learn
가이드 Matt Connor작성자 Matt Connor · 업데이트됨 2026-07-24

Claude 모델 추천 및 API 비용 비교 가이드

Claude Opus 4.8, Sonnet 5, Haiku 4.5 중 무엇을 쓸지 고민되십니까? 2026년 7월 기준 모델별 API 요금과 100,000개 작업 수행 시 발생하는 실제 비용을 상세히 비교해 드립니다.

어떤 Claude 모델을 사용해야 합니까?

어떤 Claude 모델을 사용할지에 대한 답변은 다음과 같습니다. 우선 Claude Opus 4.8을 사용하십시오. 명확한 이유가 없다면 다른 모델로 변경하지 마십시오. Anthropic의 지침도 동일합니다. "어떤 모델을 사용할지 불확실하다면, 복잡한 에이전트 기반 코딩 및 엔터프라이즈 작업에는 Claude Opus 4.8을 사용하십시오." 작업 내용이 명확하고 하루에 여러 번 실행해야 한다면 Claude Sonnet 5로 낮추십시오. 정답의 형태를 이미 알고 있는 단순 반복형 대량 작업에는 Claude Haiku 4.5를 사용하십시오. 장기 실행 에이전트의 경우 Claude Fable 5가 가장 적합합니다.

모델 선택에는 비용이 발생합니다. 다음은 2026년 7월 23일 기준 Claude API (application programming interface)의 100만 토큰(MTok)당 요금입니다.

  • Claude Fable 5 (claude-fable-5): 입력 $10 / MTok, 출력 $50 / MTok. 1M context.
  • Claude Opus 4.8 (claude-opus-4-8): 입력 $5, 출력 $25. 1M context.
  • Claude Opus 4.7 (claude-opus-4-7): 입력 $5, 출력 $25. 1M context.
  • Claude Sonnet 5 (claude-sonnet-5): 2026년 8월 31일까지 도입 가격으로 입력 $2, 출력 $10. 2026년 9월 1일부터 표준 가격인 입력 $3, 출력 $15가 적용됩니다. 1M context.
  • Claude Haiku 4.5 (claude-haiku-4-5): 입력 $1, 출력 $5. 200K context.

해당 식별자는 작성된 그대로입니다. 뒤에 추가되는 내용은 없습니다.

1M-token 모델은 크기에 따른 추가 요금이 없습니다. "900k-token 요청은 9k-token 요청과 동일한 토큰당 요율로 청구됩니다."

각 모델의 실제 용도

Anthropic은 각 모델을 한 줄로 설명하며, 이 설명은 어떤 리더보드보다 유용합니다.

  • Claude Fable 5: "장기 실행 에이전트를 위한 차세대 지능." 네 모델 중 지연 시간(latency)이 가장 느립니다.
  • Claude Opus 4.8: "복잡한 에이전트 코딩 및 기업용 작업용." 중간 정도의 지연 시간을 가집니다.
  • Claude Sonnet 5: "속도와 지능의 최적의 조합." 빠릅니다.
  • Claude Haiku 4.5: "최첨단 지능에 근접한 가장 빠른 모델."

Haiku 4.5는 가격보다 작업 적합성을 결정하는 제한 사항을 가지고 있습니다. 컨텍스트 윈도우(context window)가 1M이 아닌 200K tokens이므로, 대규모 저장소나 긴 에이전트 기록은 포함할 수 없습니다. 동기식 Messages API의 최대 출력은 다른 모델의 128K tokens과 달리 64K tokens입니다. 또한 지식 컷오프(knowledge cutoff) 시점은 2025년 2월이며, 나머지 세 모델은 2026년 1월입니다.

실제 워크로드에서 모델 선택에 따른 비용 차이는 얼마입니까?

제품군 내 모든 모델은 출력 비용이 입력 비용의 5배로 책정됩니다. Opus 4.8은 입력에 $5, 출력에 $25가 소요됩니다. Haiku 4.5는 입력에 $1, 출력에 $5가 소요됩니다. 이 비율은 모든 모델에 동일하게 적용되므로, 출력량이 많은 작업일수록 모델 선택이 비용에 큰 영향을 미칩니다.

Agentic 작업은 이러한 특성을 가집니다. Thinking token은 출력 token으로 청구되며, 텍스트가 사용자에게 전달되지 않더라도 max_tokens에 포함됩니다. Fable 5, Opus 4.8, Opus 4.7 및 Sonnet 5에서는 reasoning summary가 기본적으로 생략되므로 thinking 필드가 빈 값으로 반환됩니다. 비용 청구 방식은 동일합니다. "어떤 경우든 block은 동일하게 청구되며, multi-turn 대화 시 동일하게 반환됩니다." Claude token 비용 산정 방식 상세 설명에서 이 측정 방식을 자세히 확인할 수 있습니다.

모델마다 thinking 기능의 작동 여부가 다르며, 이를 간과하면 비용 테스트 결과가 왜곡될 수 있습니다. Sonnet 5와 Fable 5는 thinking 기능이 기본적으로 활성화되어 있어 별도의 설정이 필요 없습니다. Opus 4.8과 Opus 4.7은 요청 시 thinking: {type: "adaptive"}을 설정하기 전까지는 기능이 비활성화 상태입니다. 수치를 분석하기 전에 양측의 설정을 동일하게 맞추십시오.

가장 저렴한 모델이 가장 비쌀 수 있는 이유

독립적인 코딩 작업 하나를 예로 들겠습니다. 요청에 60,000 tokens의 context가 포함되어 있고, 모델이 thinking 과정을 포함하여 8,000 tokens의 output을 생성합니다. Caching을 사용하지 않으므로 계산 방식은 다음과 같습니다.

Opus 4.8의 경우: $5인 0.06 MTok의 input은 $0.30이며, $25인 0.008 MTok의 output은 $0.20입니다. 한 번의 시도에 $0.50이 소요됩니다. Haiku 4.5의 경우 동일한 시도 비용은 $0.06 + $0.04로 총 $0.10입니다.

Haiku는 시도당 비용이 5배 저렴하므로 매우 경제적으로 보입니다. 하지만 실패한 시도가 초래하는 결과를 고려하면 이야기가 달라집니다. 잘못된 답변을 읽는 데 시간이 소요됩니다. 재시도 시 이전 답변을 context로 다시 전송하므로, 각 시도의 규모는 이전보다 커집니다. 세 번째 시도에서도 실패하여 Opus로 전환할 경우, Haiku 비용 $0.30와 Opus 비용 $0.50를 합쳐 총 $0.80가 소요됩니다. 이는 Opus를 한 번 실행했을 때보다 60% 더 많은 비용입니다.

결국 핵심은 답변을 얼마나 저렴하게 검증할 수 있느냐입니다. 잘못된 답변이 1초 만에 파악된다면 소형 모델이 경제적입니다. 하지만 오류를 찾는 데 diff를 정밀하게 읽어야 한다면, 소형 모델은 청구서에 나타나지 않는 시간 비용을 발생시킵니다.

소형 모델이 확실히 유리한 경우

다음과 같은 상황에서는 Haiku 4.5가 적합합니다.

  • 기계적인 subagent 작업. 파일 이름을 변경하거나 검색 결과를 수집하는 subagent는 고도의 추론 능력이 필요하지 않습니다. 이는 Claude로 AI agent를 구축하고 보조 도구를 제공했을 때 나타나는 표준 패턴입니다.
  • 로그 분류(Log triage). 특정 로그 라인이 노이즈인지 또는 사람이 확인해야 할 내용인지 결정하는 작업은 판단 범위가 좁고 실패 양상이 명확합니다.
  • 고정된 라벨 세트를 이용한 분류. 출력값이 짧고 샘플을 통해 정확도를 측정할 수 있습니다.
  • 대량의 프로덕션 호출. 하루 100,000회 실행 시 토큰당 비용 차이는 무시할 수 없는 수준이 됩니다. 이는 n8n에 연결된 AI workflow에서 흔히 발생하는 양상입니다.
  • 사용자에게 응답 속도가 중요한 모든 작업. Haiku 4.5는 해당 라인업에서 가장 빠른 모델로 평가됩니다.

Haiku 모델에만 해당되는 제한 사항이 있습니다. Opus 4.8 및 Sonnet 5의 최소 캐시 가능 프롬프트는 1,024 tokens이지만, Haiku는 4,096 tokens입니다. 이 최소값보다 적은 경우 "캐시 없이 처리되며 에러는 반환되지 않습니다". Sonnet 5에서는 캐시되는 1,500 tokens 길이의 지시문 블록이 Haiku 4.5에서는 캐시되지 않습니다. 이 현상은 cache_creation_input_tokenscache_read_input_tokens이 모두 0인 상태로 나타나며, 이는 항상 실행 중인 agent의 비용을 절감하는 방법 및 캐시가 적용되지 않는 다른 원인들과 함께 고려해야 합니다.

답변을 변화시키는 변수들

각 변수는 모델 이름이 결정하는 범위보다 더 넓은 영향을 미칩니다.

Effort. output_config.effort는 모델이 답변을 생성하기 전 수행하는 작업량을 제어합니다. 단계는 low, medium, high, xhigh, max이며, high가 기본값입니다: "efforthigh으로 설정하면 effort 파라미터를 완전히 생략한 것과 정확히 동일하게 동작합니다." 이 설정은 요청의 최상위 레벨이 아닌 output_config 내부에 포함됩니다:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort는 응답의 모든 토큰에 영향을 미칩니다: "도구 호출(tool calls)을 포함한 모든 토큰 소모량에 영향을 줄 수 있습니다. 예를 들어, effort를 낮추면 Claude의 도구 호출 횟수가 줄어듭니다." 이는 에이전트 루프(agentic loop)에서 복합적으로 작용합니다. 이는 토큰 제한이 아닙니다: "Effort는 행동 신호이지 엄격한 토큰 예산이 아닙니다." Anthropic은 단계별 비용 배수를 공개하지 않으므로 사용자가 직접 사례를 테스트해야 합니다. 따라서 오늘 오후에 high 설정의 Sonnet 5와 low 설정의 Opus 4.8을 직접 비교할 수 있습니다. Haiku 4.5는 effort를 지원하는 모델 목록에 포함되어 있지 않습니다.

Prompt caching. 캐시 읽기 비용은 기본 입력 비용의 0.1배입니다. 모델 선택 시 고려해야 할 요소는 계층별 캐시 비용입니다. Opus 4.8의 캐시 히트(cache hit) 비용은 $0.50 / MTok이며, Haiku 4.5의 캐시 미적용(uncached) 입력 비용은 $1 / MTok입니다. 따라서 캐시가 잘 적용된 Opus 접두사(prefix)가 캐시가 없는 Haiku 프롬프트보다 입력 토큰당 비용이 더 저렴합니다. 대규모의 고정된 접두사를 반복 전송하는 워크로드에서는 모델 선택보다 세션 관리(session hygiene)가 더 중요합니다.

Batches. 답변을 즉시 받을 필요가 없다면, Message Batches API를 통해 "입력 및 출력 토큰 모두 50% 할인된 가격"으로 동일한 모델을 실행할 수 있습니다. 이는 아래 비교표의 모든 수치를 절반으로 줄이며, 모든 계층에 적용됩니다. 2026년 9월 1일부터 배치 처리된 Opus 4.8 작업은 표준 가격의 동기식 Sonnet 5 작업보다 저렴하며, 동일한 비용으로 지연 시간(latency)을 대가로 성능을 얻을 수 있습니다.

단일 작업 비용 비교

워크로드: 100,000개의 지원 이메일을 분류합니다. 각 호출당 2,000개의 input tokens와 300개의 output tokens를 사용합니다. 이는 총 200 MTok의 input과 30 MTok의 output을 의미합니다.

  • Haiku 4.5: 200 x $1 = $200 (in), 30 x $5 = $150 (out). 합계 $350.
  • Sonnet 5, introductory rate: 200 x $2 = $400 (in), 30 x $10 = $300 (out). 합계 $700.
  • Sonnet 5, 2026년 9월 1일부터: 200 x $3 = $600 (in), 30 x $15 = $450 (out). 합계 $1,050.
  • Opus 4.8: 200 x $5 = $1,000 (in), 30 x $25 = $750 (out). 합계 $1,750.

내일의 가격으로 다시 계산하려면 네 개의 숫자를 변경하십시오. 아래의 조정 사항은 모델 이름보다 결과값에 더 큰 영향을 미칩니다.

  • Batching은 모든 라인의 비용을 절반으로 줄입니다: $175, $350, $525, $875가 됩니다. 야간 분류 작업은 대기 시간이 없으므로 Batching을 사용하지 않을 이유가 없습니다.
  • 공통 prefix 캐싱. 2,000개의 input tokens 중 1,200개가 매번 동일한 instruction block이라고 가정합니다. Sonnet 5의 introductory rate에서 이 비용은 $2 / MTok 대신 캐시 히트(cache hit) 적용 시 $0.20 / MTok가 됩니다. 따라서 120 MTok의 비용은 $240이 아닌 $24가 됩니다. 여기에 $2인 신규 input 80 MTok($160)와 $300의 output를 더하면, Sonnet 5의 비용은 $700이 아닌 약 $484가 됩니다. Haiku 4.5에서는 1,200 tokens가 최소 기준인 4,096-token 미만이므로 이 방식이 적용되지 않습니다.
  • Retries. 이메일의 8%에 대해 Haiku의 답변을 거절하고 Opus 4.8로 재실행한다고 가정합니다. $350에 0.08 x $1,750 = $140를 더하면 $490가 됩니다. 본인의 거절률을 직접 측정하십시오.
  • 작업에 Tool definitions를 사용하는 경우. tool_choiceauto로 설정된 Opus 4.8에서 생성되는 system prompt는 290 tokens입니다. Sonnet 5는 354 tokens, Haiku 4.5는 496 tokens입니다. 가장 저렴한 모델이 가장 큰 고정 오버헤드를 가집니다.

에스컬레이션 경로를 포함한 Haiku($490)와 캐싱을 적용한 Sonnet 5($484)의 비용은 동일하며, Sonnet 5는 단 한 번의 패스로 작업을 완료합니다. 모델 자체가 문제의 전부는 아닙니다.

세션 도중에 모델을 전환하면 비용이 절감됩니까?

표시된 가격보다 절감 효과가 적을 수 있습니다. 비용 절감은 token 단위로 이루어지며, 전환 시 기존의 전체 cached prefix를 잃을 위험이 있기 때문입니다.

Anthropic은 cache를 무효화하는 요소를 문서화했습니다. Prefix는 tools, system, messages 순서로 생성되며, "각 레벨의 변경 사항은 해당 레벨과 모든 후속 레벨을 무효화합니다"라고 명시되어 있습니다. 다음 두 가지 요청 설정도 해당 목록에 포함됩니다: "thinking configuration과 resolved effort level은 prompt 자체에 렌더링되므로, 이 중 하나라도 변경하면 새로운 cache prefix가 생성됩니다." 문서에서는 다음과 같이 권장합니다: "cache hit에 의존하는 대화 내부에서 effort를 변경하지 말고, workload 간에 effort를 변경하십시오."

모델은 해당 문서 목록에 포함되어 있지 않으므로, 어떤 경우에도 모델 전환에 따른 절감 여부를 단정할 수 없습니다. 모델 전환 후 첫 번째 요청에서 cache_read_input_tokens을 확인하여 결과를 판단하십시오. 150,000-token Opus 4.8 prefix의 경우, cache read 비용은 약 $0.08이며 fresh write 비용은 약 $0.94입니다. 이는 의도했던 token당 비용 차이보다 훨씬 큰 금액입니다.

따라서 이러한 설정은 하나의 대화 내부가 아니라 작업(task) 사이에 변경하십시오. Claude Code에서는 cache가 어차피 폐기되는 시점인 /clear을 먼저 수행한 다음, /model 또는 /effort을 수행해야 함을 의미합니다.

자신의 워크로드에서 답변을 테스트하는 방법

다른 모델의 토큰 수를 기준으로 프롬프트 크기를 산정하지 마십시오. token-counting endpoint는 무료로 사용할 수 있으며, 지정한 모델의 tokenizer를 사용하여 토큰을 계산합니다. 따라서 호출할 모델의 이름을 정확히 지정해야 합니다. Opus 4.7 및 이후 버전, Fable 5 및 Sonnet 5는 새로운 tokenizer를 사용합니다. 이 tokenizer는 "동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성"하므로, 이전 모델로 측정한 예산은 동일한 per-token rate를 적용하더라도 최신 모델에서는 부족하게 나타납니다.

그다음 반환된 값을 확인하십시오. input_tokens는 캐시되지 않은 나머지 부분만 나타냅니다. 따라서 실제 프롬프트 크기는 해당 필드에 cache_creation_input_tokenscache_read_input_tokens을 더한 값입니다. VPS에서 Claude API 앱을 처음 구축하기는 해당 측정을 수행하기에 가장 적합한 환경이며, 사용량에 적합한 Claude 플랜 선택하기는 토큰당 비용을 지불할지 여부를 결정하는 별개의 문제입니다.

FAQ

코딩에 가장 적합한 Claude 모델은 무엇입니까?

2026년 7월 기준, Claude Opus 4.8은 복잡한 에이전트 코딩을 위한 공식적인 시작점이며, 비용은 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25입니다. Claude Sonnet 5는 속도와 지능의 최적의 조합으로 평가받으며, 2026년 8월 31일까지 제공되는 도입 가격 기준 $2 / $10로 Sonnet 5의 절반 미만 비용이 발생합니다. 동일한 작업을 두 모델에 실행하고, thinking 설정을 동일하게 유지한 뒤 response.usage에서 총 토큰 지출액을 비교하십시오.

Claude Haiku 4.5가 Sonnet 5를 대체할 만큼 저렴합니까?

토큰당 비용만 따지면 Sonnet 5(도입 가격 $2 / $10 또는 2026년 9월 1일부터 $3 / $15) 대비 Haiku 4.5($1 / $5)가 훨씬 저렴합니다. 결정적인 요인은 제한 사항입니다. Haiku 4.5는 컨텍스트 윈도우가 1M이 아닌 200K이며, 동기식 Messages API에서 최대 출력은 64K입니다. 또한 2025년 2월 지식 컷오프를 가지며, output_config.effort를 지원하지 않습니다. 또한 최소 캐시 가능 프롬프트가 4,096토큰이므로 짧은 system prompt에서는 캐싱이 비활성화됩니다.

세션 중간에 더 저렴한 Claude 모델로 전환하면 비용이 절감됩니까?

생각보다 절감 효과가 크지 않습니다. Anthropic은 tools, system 또는 messages 접두사 변경, thinking 설정 변경, 그리고 output_config.effort 변경을 캐시 무효화 요인으로 명시합니다. 모델 전환이 기존 캐시에 미치는 영향은 문서화되어 있지 않으므로 미지수로 간주해야 하며, 전환 후 첫 요청 시 cache_read_input_tokens를 확인하십시오. 비용 차이는 중요합니다. 150,000토큰의 Opus 4.8 접두사에서 캐시 읽기 비용은 약 $0.08이며, 새로 쓰는 비용은 약 $0.94입니다. 이는 토큰당 절감액을 몇 차례의 턴(turn)으로 상쇄하고도 남는 금액입니다. Claude Code에서 /clear 이후 캐시가 무조건 폐기될 때 작업 간에 모델을 전환하십시오.

output_config.effort 설정이 비용에 어떤 영향을 미칩니까?

텍스트, tool calls, thinking에 모델이 사용하는 토큰 양이 달라집니다. effort를 낮추면 tool calls 횟수가 줄어듭니다. 이는 에이전트 루프에서 비용을 가중시키는데, 모든 tool 결과가 이후의 턴에서 다시 전송되기 때문입니다. 단계는 low, medium, high, xhigh, max이며, high가 기본값입니다. Anthropic은 effort를 토큰 예산이 아닌 행동 신호로 정의하며 단계별 비용 배수를 공개하지 않으므로, 실제 작업에서 직접 측정해야 합니다.

Claude Batches API를 사용하면 얼마나 절약할 수 있습니까?

비동기식 전달을 조건으로 입력 및 출력 토큰 모두 50%를 절약할 수 있습니다. 2026년 7월 기준, Opus 4.8은 $2.50(입력) / $12.50(출력), Sonnet 5는 도입 가격 기준 $1 / $5, Haiku 4.5는 $0.50 / $2.50입니다. 주목할 만한 비교는 티어 간 비교입니다. 2026년 9월 1일부터 배치 처리된 Opus 4.8 작업 비용이 표준 요금의 동기식 Sonnet 5 작업 비용보다 저렴하므로, 배치를 사용하면 동일한 비용으로 더 강력한 모델을 사용할 수 있습니다.