SSD Nodes Learn Hosting plans →
가이드 Matt Connor작성자 Matt Connor · 업데이트됨 2026-08-27

Claude 모델 선택 가이드: 비용 및 성능 비교

Claude Opus 4.8, Sonnet 5, Haiku 4.5 중 최적의 모델을 선택하는 방법을 안내합니다. 2026년 7월 기준 API 요금 체계와 10만 건 작업 수행 시 발생하는 실제 비용 차이를 분석하여 프로젝트 예산을 최적화하는 전략을 제시합니다.

어떤 Claude 모델을 사용해야 합니까?

어떤 Claude 모델을 사용해야 할지에 대한 짧은 답변은 다음과 같습니다. Claude Opus 4.8로 시작하고, 명확한 이유가 있을 때만 다른 모델로 변경하십시오. Anthropic의 지침도 동일합니다. "어떤 모델을 사용할지 확실하지 않다면, 복잡한 에이전트 코딩 및 엔터프라이즈 작업에는 Claude Opus 4.8로 시작하십시오." 작업이 잘 정의되어 있고 하루에 여러 번 실행하는 경우에는 Claude Sonnet 5로 하향 조정하십시오. 정답이 무엇인지 이미 알고 있는 기계적이고 대량의 작업에는 Claude Haiku 4.5로 다시 하향 조정하십시오. Claude Fable 5는 장기 실행 에이전트를 위해 이들 모두의 상위에 위치합니다.

이 선택에는 비용이 따릅니다. 다음은 2026년 7월 23일 기준 Claude API(application programming interface) 요금이며, 백만 토큰(문서상 MTok으로 표기)당 가격입니다.

  • Claude Fable 5 (claude-fable-5): 입력 MTok당 $10, 출력 MTok당 $50. 1M 컨텍스트.
  • Claude Opus 4.8 (claude-opus-4-8): 입력 $5, 출력 $25. 1M 컨텍스트.
  • Claude Opus 4.7 (claude-opus-4-7): 입력 $5, 출력 $25. 1M 컨텍스트.
  • Claude Sonnet 5 (claude-sonnet-5): 2026년 8월 31일까지 도입 가격으로 입력 $2, 출력 $10. 2026년 9월 1일부터 표준 요금인 입력 $3, 출력 $15가 적용됩니다. 1M 컨텍스트.
  • Claude Haiku 4.5 (claude-haiku-4-5): 입력 $1, 출력 $5. 200K 컨텍스트.

해당 식별자는 기록된 그대로 완전합니다. 뒤에 아무것도 추가되지 않습니다.

1M-token 모델에서는 크기 자체에 추가 요금이 붙지 않는다. “900k-token 요청은 9k-token 요청과 동일한 토큰당 요율로 청구된다.” 이 요율은 API에만 적용되지 않는다. Claude Enterprise는 좌석 요금에 더해 API 요율로 사용량을 측정한다. 따라서 아래 내용은 좌석 요금제를 사용하는 팀에도 동일한 산식으로 적용된다. 정액제 구독은 측정 방식을 바꾸지만 이 판단 자체를 바꾸지는 않는다. Claude Max의 두 요금제는 동일한 모델을 제공하며 사용량만 다르다. 같은 단계에서 더 낮은 요금제인 Claude Pro의 월 $20 요금은 토큰당 요율이 아니라 사용량 한도를 제공한다. 따라서 여기서 사용자를 멈추게 하는 것은 청구서가 아니라 한도 초기화다. 현재 이 요금제를 사용하고 있다면 아래 산식을 계산하기 전에 어떤 사용량 한도가 초기화되기를 기다리는지 확인해야 한다. 이 경우 해결 방법은 더 저렴한 요율이 아니라 더 작은 모델, 더 짧은 컨텍스트 또는 API로 전환하는 것이다. 아직 유료 결제를 시작하지 않았다면 애초에 Pro가 $20의 가치가 있는지는 위 요율이 아니라 무료 한도에 얼마나 자주 막히는지로 판단할 수 있다.

각 모델의 실제 용도

Anthropic은 모델별로 한 줄씩 라인업을 설명하며, 이 설명은 어떤 리더보드보다 더 나은 지침이 됩니다.

  • Claude Fable 5: "장기 실행 에이전트를 위한 차세대 지능." 4개 모델 중 지연 시간이 가장 긴 것으로 평가됩니다.
  • Claude Opus 4.8: "복잡한 에이전트형 코딩 및 엔터프라이즈 작업을 위한 모델." 중간 정도의 지연 시간을 가집니다.
  • Claude Sonnet 5: "속도와 지능의 최적 조합." 빠릅니다.
  • Claude Haiku 4.5: "최첨단 수준의 지능을 갖춘 가장 빠른 모델."

Fable 5는 이 비교에서 유일하게 작업 부하에 따른 가격이 책정되지 않은 모델이며, Opus 4.8 요금의 2배에 달하는 비용을 지불할 때 어떤 작업이 10달러를 투입해 50달러의 가치를 창출하는지에 대한 질문은 별도의 답변이 필요합니다.

Haiku 4.5는 가격보다 작업 적합성을 결정짓는 제약 사항도 가지고 있습니다. 컨텍스트 윈도우가 1M 토큰이 아닌 200K 토큰이므로, 대규모 저장소나 긴 에이전트 기록은 처리할 수 없습니다. 동기식 Messages API에서의 최대 출력은 다른 모델들의 128K 토큰과 달리 64K 토큰이며, 신뢰할 수 있는 지식 컷오프 시점은 2025년 2월로, 나머지 3개 모델의 2026년 1월보다 앞섭니다.

실제 워크로드에서 선택에 따른 비용은 어느 정도입니까?

라인업의 모든 모델은 출력 비용을 입력 비용의 5배로 책정합니다. Opus 4.8은 입력 5달러, 출력 25달러입니다. Haiku 4.5는 입력 1달러, 출력 5달러입니다. 이 비율은 전체 범위에서 동일하게 유지되므로, 출력이 많이 발생하는 작업일수록 모델 선택이 중요해집니다.

에이전트 작업은 이러한 유형의 작업에 해당합니다. 사고 토큰(thinking tokens)은 텍스트가 사용자에게 도달하지 않더라도 출력 토큰으로 청구되며 max_tokens에 포함되기 때문입니다. Fable 5, Opus 4.8, Opus 4.7 및 Sonnet 5에서는 추론 요약이 기본적으로 생략되므로 thinking 필드는 비어 있는 상태로 반환됩니다. 청구 방식은 변함이 없습니다. "어느 쪽이든 블록은 동일하게 청구되며 다중 턴 대화에서 동일하게 전달됩니다." Claude 토큰 청구의 실제 구성 요소에서 해당 측정 방식을 상세히 분석합니다.

비교하는 모델 간에 사고 기능이 실행되는지 여부가 다르므로, 이를 놓치면 비용 테스트 결과가 왜곡될 수 있습니다. Sonnet 5와 Fable 5에서는 사고 기능이 이미 켜져 있어 별도의 설정이 필요하지 않습니다. Opus 4.8과 Opus 4.7에서는 요청 시 thinking: {type: "adaptive"}을 설정하기 전까지는 꺼져 있습니다. 수치를 해석하기 전에 양쪽의 설정을 동일하게 맞추십시오.

가장 저렴한 모델이 가장 비싼 선택이 될 수 있는 이유

하나의 독립적인 코딩 작업을 가정해 봅니다. 요청에는 60,000 토큰의 컨텍스트가 포함되어 있고, 모델은 사고 과정을 포함하여 8,000 토큰의 결과물을 생성합니다. 캐싱을 사용하지 않는다고 가정하면 계산은 다음과 같습니다.

Opus 4.8 모델의 경우, 입력 0.06 MTok는 5달러 기준으로 0.30달러이며, 출력 0.008 MTok는 25달러 기준으로 0.20달러입니다. 즉, 한 번 시도하는 데 0.50달러가 듭니다. Haiku 4.5 모델에서 동일한 작업을 수행하면 0.06달러와 0.04달러가 합쳐져 0.10달러가 듭니다.

Haiku는 시도당 비용이 5배 저렴하므로 여유가 많아 보이지만, 실패한 시도가 어떤 결과를 초래하는지 따져봐야 합니다. 잘못된 답변을 읽는 데는 사용자의 시간이 소모됩니다. 재시도할 때 이전 답변을 컨텍스트로 다시 보내게 되므로, 시도할 때마다 데이터 크기는 점점 커집니다. 세 번째 시도에서도 실패하여 결국 상위 모델로 전환하게 되면, Haiku 비용 0.30달러에 Opus 비용 0.50달러가 더해져 총 0.80달러가 됩니다. 이는 Opus를 처음부터 한 번 사용하는 것보다 60% 더 비싼 비용입니다.

따라서 결정적인 질문은 답변을 얼마나 저렴하게 검증할 수 있느냐입니다. 잘못된 답변을 1초 만에 알아챌 수 있다면 작은 모델은 경제적인 선택입니다. 하지만 잘못된 부분을 찾기 위해 diff를 꼼꼼히 읽어야 한다면, 작은 모델은 청구서에는 나타나지 않는 사용자의 시간을 낭비하게 만듭니다.

소형 모델이 확실하게 우위를 점하는 경우

다음과 같은 상황에서는 Haiku 4.5가 적합한 선택입니다.

  • 기계적인 서브 에이전트 작업. 파일 이름을 변경하거나 검색 결과를 수집하는 서브 에이전트에는 최첨단 추론 능력이 필요하지 않습니다. 이는 Claude로 AI 에이전트를 구축하고 보조 도구를 제공할 때 나타나는 표준적인 패턴입니다.
  • 로그 분류. 특정 로그 라인이 단순 노이즈인지 아니면 사람이 확인해야 할 가치가 있는지를 판단하는 작업은 명확한 실패 모드를 가진 좁은 범위의 판단입니다.
  • 고정된 레이블 집합에 대한 분류. 출력값이 짧고 샘플을 통해 정확도를 측정할 수 있는 작업입니다.
  • 대량의 프로덕션 호출. 하루 100,000회 실행 시 토큰당 비용 차이는 무시할 수 없는 수준이 됩니다. 이는 n8n에 연결된 AI 워크플로우에서 흔히 볼 수 있는 형태입니다.
  • 사용자에게 응답 속도가 중요한 모든 작업. Haiku 4.5는 라인업 중 가장 빠른 모델로 평가받습니다.

Haiku에는 특별한 제한 사항이 하나 있습니다. 최소 캐시 가능 프롬프트 크기가 4,096 토큰입니다(Opus 4.8과 Sonnet 5는 1,024 토큰). 이 최소치 미만일 경우 "이보다 적은 수의 토큰을 캐시하려는 요청은 캐싱 없이 처리되며, 오류는 반환되지 않습니다". Sonnet 5에서는 캐시되는 1,500 토큰 분량의 지침 블록이 Haiku 4.5에서는 아무런 알림 없이 캐시되지 않습니다. 이를 확인하는 방법은 cache_creation_input_tokenscache_read_input_tokens이 모두 0으로 표시되는지 보는 것이며, 이는 상시 가동 에이전트의 비용을 절감하는 방법에서 캐시를 잃게 되는 다른 원인들과 함께 다룹니다.

답변을 결정하는 요소

각 요소는 모델 이름보다 청구 금액에 더 큰 영향을 미칩니다.

Effort. output_config.effort은 모델이 답변을 생성하기 전에 수행하는 작업량을 제어합니다. 수준은 low, medium, high, xhigh, max으로 나뉘며 high이 기본값입니다. "efforthigh로 설정하는 것은 effort 매개변수를 완전히 생략하는 것과 정확히 동일하게 동작합니다." 이 설정은 요청의 최상위 수준이 아니라 output_config 내부에 중첩됩니다.

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort는 응답의 모든 토큰에 영향을 미칩니다. "도구 호출을 포함하여 모든 토큰 사용량에 영향을 줄 수 있습니다. 예를 들어, 낮은 Effort 설정은 Claude가 더 적은 도구 호출을 수행함을 의미합니다." 이는 에이전트 루프에서 복합적으로 작용합니다. 이는 토큰 제한이 아닙니다. "Effort는 행동 신호이지 엄격한 토큰 예산이 아닙니다." Anthropic은 수준별 비용 승수를 공개하지 않으며 사용자가 직접 사례를 테스트할 것을 권장합니다. 따라서 high로 설정된 Sonnet 5 실행과 low으로 설정된 Opus 4.8 실행을 비교하는 것은 오늘 오후에 바로 수행할 수 있는 실질적인 테스트입니다. Haiku 4.5는 Effort를 지원하는 모델 목록에 포함되지 않습니다.

Prompt caching. 캐시 읽기 비용은 기본 입력 요금의 0.1배이며, 모델 선택을 결정하는 수치는 계층 전반에서 이 비용이 어떻게 작용하는지입니다. Opus 4.8의 캐시 적중 비용은 MTok당 $0.50이며, Haiku 4.5의 캐시되지 않은 입력 비용은 MTok당 $1이므로, 잘 캐시된 Opus 접두사는 캐시되지 않은 Haiku 프롬프트보다 입력 토큰당 비용이 저렴합니다. 대규모의 안정적인 접두사를 반복해서 전송하는 모든 작업 부하에서는 모델 선택보다 세션 위생 관리가 더 중요합니다.

Batches. 답변을 즉시 기다릴 필요가 없는 경우, Message Batches API는 동일한 모델을 사용하여 "입력 및 출력 토큰 모두에 대해 50% 할인"을 제공합니다. 이는 아래 비교표의 모든 행 비용을 절반으로 줄이며 계층 전반에 적용됩니다. 2026년 9월 1일부터는 배치 처리된 Opus 4.8 작업이 표준 가격의 동기식 Sonnet 5 작업보다 저렴하므로, 동일한 비용으로 지연 시간을 희생하는 대신 더 높은 성능을 얻을 수 있습니다.

작업 비용 비교

작업 내용: 지원 이메일 100,000건 분류, 건당 2,000 입력 토큰 및 300 출력 토큰 사용. 총 입력 200 MTok, 출력 30 MTok.

  • Haiku 4.5: 200 x $1 = $200(입력), 30 x $5 = $150(출력). 합계 $350.
  • Sonnet 5, 도입 요금: 200 x $2 = $400(입력), 30 x $10 = $300(출력). 합계 $700.
  • Sonnet 5, 2026년 9월 1일부터: 200 x $3 = $600(입력), 30 x $15 = $450(출력). 합계 $1,050.
  • Opus 4.8: 200 x $5 = $1,000(입력), 30 x $25 = $750(출력). 합계 $1,750.

다음 가격으로 다시 계산하려면 네 가지 수치를 조정하십시오. 아래 조정 사항은 모델 이름 변경보다 결과에 더 큰 영향을 미칩니다.

  • 배치 처리는 모든 비용을 절반으로 줄입니다: $175, $350, $525, $875. 야간 분류 작업은 대기 시간이 중요하지 않으므로 배치 처리를 사용하지 않을 이유가 없습니다.
  • 공유 접두사 캐싱. 2,000개의 입력 토큰 중 1,200개가 매번 동일한 지침 블록이라고 가정합니다. Sonnet 5 도입 요금 기준, 캐시 적중 시 MTok당 $0.20가 소요되어 $2보다 저렴하므로 120 MTok 비용은 $240이 아닌 $24가 됩니다. 여기에 $2 요금의 새로운 입력 80 MTok($160)과 출력 비용 $300을 더하면 Sonnet 5의 비용은 $700이 아닌 약 $484가 됩니다. Haiku 4.5는 1,200 토큰이 최소 캐시 단위인 4,096 토큰 미만이므로 이 기법이 적용되지 않습니다.
  • 재시도. 이메일의 8%에서 Haiku의 답변을 거부하고 Opus 4.8로 다시 실행한다고 가정합니다. $350에 0.08 x $1,750 = $140을 더하면 $490이 됩니다. 거부율은 타인의 수치가 아닌 직접 측정한 값을 사용하십시오.
  • 도구 정의(사용 시). 생성되는 시스템 프롬프트는 tool_choiceauto로 설정했을 때 Opus 4.8에서 290 토큰, Sonnet 5에서 354 토큰, Haiku 4.5에서 496 토큰입니다. 가장 저렴한 모델이 가장 큰 고정 오버헤드를 가집니다.

에스컬레이션 경로를 포함한 Haiku($490)와 캐싱을 적용한 Sonnet 5($484)의 비용은 비슷하며, 후자는 한 번의 패스로 작업을 완료합니다. 모델 선택이 비용 문제의 전부는 아닙니다.

세션 도중에 모델을 전환하면 비용이 절감됩니까?

토큰당 비용 절감 효과는 명목상 가격보다 작을 때가 많습니다. 캐시된 전체 접두사(prefix)를 잃을 위험이 있기 때문입니다.

Anthropic은 캐시가 무효화되는 조건을 문서화하고 있습니다. 접두사는 tools, system, messages 순서로 빌드되며, "각 단계에서의 변경은 해당 단계와 그 이후의 모든 단계를 무효화합니다." 두 가지 요청 설정도 이 목록에 포함됩니다. "사고(thinking) 구성과 확인된 effort 수준은 프롬프트 자체에 렌더링되므로, 이를 변경하면 새로운 캐시 접두사가 시작됩니다." 노력(effort) 설정에 관해서는 문서에서 "캐시 적중(cache hit)에 의존하는 대화 내부보다는 작업 부하에 따라 노력을 변경하십시오"라고 명시합니다.

모델은 해당 문서 목록에 없으므로 어느 쪽으로든 단정하지 마십시오. 전환 후 첫 번째 요청에서 cache_read_input_tokens을 읽고 숫자로 직접 확인하십시오. 150,000 토큰 규모의 Opus 4.8 접두사에서 캐시 읽기 비용은 약 $0.08인 반면, 새로 작성하는 비용은 약 $0.94입니다. 이는 토큰당 가격 차이를 쫓아 얻으려던 이득보다 훨씬 큽니다.

따라서 이러한 변경은 작업 내부가 아닌 작업 사이에서 수행하십시오. Claude Code의 경우 캐시가 어차피 폐기되는 시점인 /clear을 먼저 수행한 다음, /model/effort을 변경하는 것이 좋습니다. 두 명령 모두 CLI에서 입력하므로, Linux 환경에서 작업 중이라면 터미널용 설치를 권장합니다. Anthropic이 Linux용으로 기본 제공하는 도구는 안정적인 CLI와 아직 베타 단계인 데스크톱 앱을 함께 제공하기 때문입니다. 모델 교체가 실제 청구서에 반영되는지는 해당 세션의 결제 방식에 따라 다릅니다. Claude Code는 월 정액 요금제나 토큰당 API 크레딧 방식 중 하나로 실행되며, 후자의 경우에만 모델 변경이 달러 단위의 비용으로 산정됩니다.

자신의 워크로드에서 답변을 테스트하는 방법

다른 모델의 토큰 수를 기준으로 프롬프트 크기를 산정하지 마십시오. 토큰 계산 엔드포인트는 무료로 사용할 수 있으며, 지정한 모델의 토크나이저를 사용하여 계산하므로 호출하려는 모델을 정확히 명시해야 합니다. 해당 엔드포인트는 플랫폼에서 비용이 청구되지 않는 몇 안 되는 기능 중 하나이며, 비용 없이 실행할 수 있는 다른 기능들을 확인한 뒤 실제 크레딧을 사용하여 비교하는 것이 좋습니다. Opus 4.7 이상 버전, Fable 5, Sonnet 5는 "동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성"하는 최신 토크나이저를 사용하므로, 이전 모델 기준으로 측정된 예산은 토큰당 단가가 동일하더라도 최신 모델에서는 낮게 측정됩니다.

그다음 반환된 결과를 확인하십시오. input_tokens는 캐시되지 않은 나머지 부분일 뿐이므로, 실제 프롬프트 크기는 해당 필드에 cache_creation_input_tokenscache_read_input_tokens을 더한 값입니다. VPS에서 처음 시작하는 Claude API 앱은 해당 측정을 수행하기에 가장 작고 정직한 환경이며, 사용량에 적합한 Claude 플랜은 토큰당 비용을 지불할지 여부를 결정하는 별도의 사안입니다. 만약 이것이 구독 여부가 아닌 어떤 구독을 유지할지에 대한 문제라면, ChatGPT와 비교한 Claude의 요금제를 통해 동일한 코딩 작업이 다른 제공업체에서는 얼마의 비용이 드는지 확인할 수 있습니다. 측정을 위해 작업을 API로 완전히 이전하더라도, 구독 등급을 낮추거나 해지하면 이미 지불한 기간까지는 그대로 유지되므로 수치를 확인한 후 결정하더라도 불이익은 없습니다.

FAQ

코딩에 가장 적합한 Claude 모델은 무엇입니까?

Claude Opus 4.8은 복잡한 에이전트 기반 코딩을 위한 공식적인 시작점이며, 2026년 7월 기준으로 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러입니다. Claude Sonnet 5는 속도와 지능의 최적 조합으로 평가받으며, 2026년 8월 31일까지는 2달러/10달러로 Sonnet 5보다 절반 이하의 비용이 듭니다. 두 모델에서 동일한 작업을 실행하고 thinking 설정을 동일하게 유지한 뒤, response.usage에서 전체 토큰 비용을 비교하십시오.

Claude Haiku 4.5가 Sonnet 5를 대체할 만큼 저렴합니까?

토큰당 비용으로 보면 충분히 저렴합니다. 도입 가격 기준으로 Sonnet 5의 2달러/10달러 대비 1달러/5달러이며, 2026년 9월 1일부터는 3달러/15달러가 됩니다. 결정적인 요소는 제한 사항입니다. Haiku 4.5는 1M이 아닌 200K 토큰의 컨텍스트 윈도우를 가지며, 동기식 Messages API에서 최대 64K 출력, 2025년 2월의 신뢰할 수 있는 지식 컷오프, output_config.effort 미지원, 그리고 짧은 시스템 프롬프트에서 캐싱을 자동으로 비활성화하는 4,096 토큰의 최소 캐시 가능 프롬프트 제한이 있습니다.

세션 도중에 더 저렴한 Claude 모델로 전환하면 비용이 절감됩니까?

보이는 것만큼 자주 절감되지는 않습니다. Anthropic은 캐시 무효화 요인으로 tools, system 또는 messages 접두사 변경, thinking 설정 변경, output_config.effort 변경을 명시합니다. 모델 전환이 기존 캐시에 미치는 영향은 문서화되어 있지 않으므로, 이를 알 수 없는 상태로 간주하고 이후 첫 번째 요청에서 cache_read_input_tokens을 확인하십시오. 비용을 파악할 가치는 충분합니다. 150,000 토큰의 Opus 4.8 접두사에서 캐시 읽기 비용은 약 0.08달러인 반면 새로 쓰기 비용은 약 0.94달러이므로, 토큰당 절감액보다 훨씬 큽니다. 캐시가 어차피 폐기되는 작업 간 전환 시점이나 Claude Code에서 /clear 이후에 전환하십시오.

output_config.effort는 청구 금액에 어떤 영향을 줍니까?

이 설정은 모델이 텍스트, 도구 호출, thinking 전반에 걸쳐 소비하는 토큰 양을 변경합니다. effort를 낮추면 도구 호출 횟수가 줄어드는데, 모든 도구 결과가 이후 턴에서 다시 전송되므로 에이전트 루프에서는 이 효과가 누적됩니다. 단계는 low, medium, high, xhigh, max가 있으며, high이 기본값입니다. Anthropic은 effort를 토큰 예산이 아닌 행동 신호로 정의하며 단계별 비용 배수를 공개하지 않으므로, 본인의 작업에서 직접 측정해야 합니다.

Claude Batches API는 비용을 얼마나 절감합니까?

비동기식 전달을 대가로 입력 및 출력 토큰 모두에서 50%를 절감합니다. 2026년 7월 기준으로 Opus 4.8은 입력 2.50달러/출력 12.50달러, Sonnet 5는 도입 가격 기준 1달러/5달러, Haiku 4.5는 0.50달러/2.50달러입니다. 주목할 만한 비교는 계층 간의 차이입니다. 2026년 9월 1일부터 적용되는 표준 요금에서 배치 처리된 Opus 4.8 작업은 동기식 Sonnet 5 작업보다 비용이 저렴하므로, 배치 처리를 사용하면 동일한 비용으로 더 강력한 모델을 사용할 수 있습니다.