Claude Fable 5 가격 및 비용 최적화 가이드
Claude Fable 5는 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러입니다. 모델별 요금 체계를 비교하고 프롬프트 캐싱을 활용해 실제 API 호출 비용을 절감하는 방법을 상세히 설명합니다.
Claude Fable 5의 비용은 얼마입니까?
Claude Fable 5의 비용은 Claude API 기준으로 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다. 이는 2026년 8월 3일 기준 Anthropic의 공식 가격 페이지에 게시된 요금입니다. API 모델 ID는 claude-fable-5입니다. 이 모델은 2026년 6월 9일부터 Claude API, Amazon Bedrock, AWS의 Claude Platform, Google Cloud 및 Microsoft Foundry에서 정식으로 사용할 수 있게 되었습니다.
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]이 가격 체계를 단계별로 이해하십시오. Fable 5의 요금은 Claude Opus 5의 2배, 현재 Claude Sonnet 5 요금의 5배, Claude Haiku 4.5의 10배입니다. 모든 모델의 출력 토큰 가격이 입력 토큰 가격의 정확히 5배로 책정되어 있으므로, 청구서의 양쪽 비용 비율은 동일합니다. 따라서 작업에 필요한 입력 및 출력 토큰 비율을 알고 있다면, 곱셈을 통해 한 모델의 가격을 다른 모델의 가격으로 환산할 수 있습니다.
특정 날짜가 계산에 영향을 미칩니다. Sonnet 5는 2026년 8월 31일까지 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $10의 도입 가격이 적용됩니다. 2026년 9월 1일부터는 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15로 조정됩니다. Fable 5의 가격은 변동이 없으므로, 해당 날짜 이후 두 모델 간의 가격 차이는 5배에서 3배 조금 넘는 수준으로 좁혀집니다. 가을 예산을 계획 중이라면 이후의 Sonnet 요금을 기준으로 계산하십시오.
할인 정책과 비용을 증가시키는 배율
프롬프트 캐싱은 비용을 절감하는 가장 큰 수단입니다. 캐시 읽기 비용은 기본 입력 가격의 10분의 1이며, Fable 5 기준 백만 토큰당 $1입니다. 캐시에 데이터를 쓰는 비용은 일반 입력 토큰보다 비쌉니다. 5분 캐시는 기본 가격의 1.25배, 1시간 캐시는 2배입니다. 5분 캐시는 한 번만 읽어도 비용을 회수하며, 1시간 캐시는 두 번 읽으면 비용을 회수합니다. 이러한 계산 방식이 프롬프트 캐싱의 손익분기점을 모든 곳에 적용하기 전에 미리 파악해야 하는 이유입니다.
Batch API는 양쪽 모두 50% 할인을 적용하므로, 배치 처리된 Fable 5 작업 비용은 백만 토큰당 $5 및 $25입니다. 배치 요청은 비동기 방식으로 처리되므로 즉각적인 응답이 필요하지 않은 작업에만 유용합니다. 두 가지 할인은 중복 적용이 가능하므로, 캐싱과 배치를 동시에 사용하면 두 축 모두에서 비용을 절감할 수 있습니다.
1M 토큰 컨텍스트 윈도우는 Claude 4.6 이후 모델에서 표준 요금으로 제공됩니다. 긴 컨텍스트에 대한 추가 요금은 없으므로, 900k 토큰 요청도 9k 요청과 동일한 토큰당 요금이 청구됩니다.
청구 금액을 증가시키는 배율은 데이터 레지던시입니다. inference_geo: "us"를 설정하여 추론을 미국 내에서 수행하도록 제한하면 캐시 읽기와 쓰기를 포함한 모든 토큰 범주에 1.1배의 배율이 적용됩니다. 계약상 의무가 없다면 기본값인 글로벌 라우팅을 그대로 유지하십시오.
이 모델에는 한 가지 특별한 청구 규칙이 있습니다. Fable 5는 요청을 거부할 수 있는 안전 분류기를 포함합니다. 이 경우 Messages API는 오류 대신 stop_reason: "refusal"를 포함한 HTTP 200 응답을 반환하며, 출력 생성 전에 거부된 요청에 대해서는 비용이 청구되지 않습니다. 동일한 프롬프트를 다른 Claude 모델에서 재시도할 경우, 폴백 크레딧이 전환에 따른 프롬프트 캐시 비용을 환불해주므로 동일한 캐시를 다시 예열하는 비용을 지불할 필요가 없습니다.
Claude Fable 5는 어떤 플랜에 포함되어 있습니까?
2026년 8월 3일 기준으로, Anthropic의 Claude Fable 페이지에 따르면 해당 모델은 Pro, Max, Team 및 Enterprise 사용자에게 제공됩니다. 무료 플랜은 명시되지 않았습니다. 개발자의 경우 Claude API와 위에서 언급한 클라우드 마켓플레이스를 통해 일반적으로 사용할 수 있습니다.
플랜에서 사용할 수 있다는 것이 제한 없이 포함된다는 의미는 아닙니다. Anthropic 가격 페이지의 플랜 비교표는 일부 좌석(seat)의 주간 사용량 제한 내에서, 또는 다른 경우에는 사용 크레딧을 차감하는 방식으로 Fable 사용을 제한하고 있으며, 이러한 정책은 2026년 7월 중에 여러 번 변경되었습니다. Fable 5 재배포에 관한 Anthropic의 자체 성명에 따르면, 2026년 7월 7일까지 Pro, Max, Team 및 일부 Enterprise 플랜에서 주간 사용량 제한의 최대 50%까지 해당 모델을 사용할 수 있었으며, 그 이후에는 사용 크레딧이 적용되었습니다. 7월 나머지 기간 동안의 보고서들은 추가적인 연장과 좌석 유형별 차등 적용을 설명하고 있습니다.
따라서 이 페이지에는 플랜별 제한 수치를 기재하지 않습니다. 해당 월에 발표된 수치 중 2주 이상 유지된 것은 없었으며, 이곳에 오래된 정보를 게시하는 것은 정보를 제공하지 않는 것보다 더 나쁜 결과를 초래할 것입니다. 결정을 내리는 당일에 플랜 비교표에서 Fable 항목을 확인하시기 바라며, 뉴스 기사에 언급된 수치는 모두 구식이라고 간주하십시오.
변하지 않는 것은 API 요율입니다. 모든 경로에서 포함된 허용량을 모두 소진하면, 이후의 Fable 5 사용량은 위 차트에 명시된 가격으로 청구됩니다. 따라서 어떤 경우든 가격표를 기준으로 계획을 세워야 하며, 이는 다른 Claude 모델에 대해 API 요금과 구독을 비교할 때 도달하게 되는 결론과 동일합니다. 아직 티어를 선택하지 않았다면 사용량에 맞는 Claude 플랜부터 확인하십시오.
청구 금액이 가격 비율보다 높게 나오는 이유
Fable 5의 비용이 단순 가격 비교보다 높게 책정되는 데에는 두 가지 문서화된 메커니즘이 있습니다.
첫 번째는 토크나이저입니다. Fable 5는 Claude Opus 4.7과 함께 도입된 토크나이저를 사용합니다. Opus 4.7 이전에 출시된 모델들과 비교하면 동일한 텍스트라도 약 30% 더 많은 토큰이 생성되며, 정확한 증가량은 콘텐츠에 따라 다릅니다. Haiku 4.5는 해당 토크나이저 이전 모델이므로, 가격표상의 10배 차이는 동일한 텍스트 블록을 두 모델에 입력할 경우 실제로는 13배에 가까워집니다. Sonnet 5는 최신 토크나이저를 사용하므로 Fable과 Sonnet 간의 토큰당 비교는 공정하지만, Fable과 Haiku를 비교하는 것은 그렇지 않습니다.
두 번째는 사고(thinking) 과정입니다. Fable 5는 적응형 사고 기능이 항상 활성화되어 있으며, thinking: {"type": "disabled"}은 지원되지 않습니다. 사고 토큰은 전체 출력 요금으로 계산되어 출력 토큰으로 청구됩니다. 이 모델에서는 원시 사고 과정(chain of thought)이 반환되지 않으며, thinking.display은 기본적으로 "omitted"로 설정되어 있습니다. 즉, 눈에 보이는 답변은 짧더라도 실제 청구되는 출력 토큰 수는 많을 수 있습니다. Anthropic의 문서에는 청구되는 출력 토큰 수가 응답에 표시되는 토큰 수와 일치하지 않는다는 점이 명시되어 있습니다.
추측하지 말고 상세 내역을 확인하십시오. usage.output_tokens_details.thinking_tokens 필드는 추론에 사용된 청구 대상 출력 토큰 수를 보고합니다.
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}Anthropic의 사고 관련 문서에서 가져온 위 예시를 보면, 청구된 348개의 출력 토큰 중 312개가 사용자가 볼 수 없는 추론 과정에 사용되었습니다. 스트리밍 시 이 상세 내역은 마지막 message_delta 이벤트에서만 도착하므로, 마지막 텍스트 청크에서 읽기를 중단하는 클라이언트는 이를 기록하지 못합니다.
제어 설정은 effort이며, output_config.effort에서 설정할 수 있습니다. 단계는 low, medium, high(기본값), xhigh, max가 있습니다.
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}이 모델에 대한 Anthropic의 지침은 high에서 시작하고, 가장 높은 성능이 필요한 작업에만 xhigh으로 올리며, 일상적인 작업에는 medium 또는 low로 낮추라는 것입니다. Fable 5에서 낮은 수준의 노력을 기울이는 것이 이전 모델의 xhigh보다 나은 결과를 내는 경우가 많기 때문입니다. 여기에는 두 가지 주의사항이 있습니다. 요청 간에 노력을 변경하면 프롬프트 캐시가 무효화됩니다. 결정된 노력 값이 프롬프트에 렌더링되기 때문입니다. 따라서 작업 부하별로 수준을 선택하고 일정하게 유지하십시오. 또한 max_tokens는 사고와 응답 텍스트를 합친 전체 출력에 대한 엄격한 제한이므로, 사고 과정이 없는 답변에 맞춰 설정된 제한은 텍스트를 잘리게 만듭니다. stop_reason: "max_tokens"가 표시된다면 제한을 높이거나 노력을 낮춰야 합니다.
토큰당 비용이 아닌 작업 완료당 비용
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]3 행의 데이터는 벤치마크가 아니라 산술적인 계산 결과입니다. 요금은 공개되어 있습니다. 토큰 사용량은 귀하의 실제 사용 데이터로 대체해야 할 가정치입니다. 중간 행과 같은 형태의 코딩 세션은 Fable 5에서 $5.00, Sonnet 5에서 $1.00의 비용이 발생합니다. 긴 작업의 경우 Fable 5는 $40.00, Sonnet 5는 $8.00가 소요됩니다. 마지막 행의 Haiku 열은 단순 산술 계산일 뿐입니다. Haiku 4.5는 컨텍스트 윈도우가 200k 토큰이므로 해당 작업을 처리할 수 없습니다.
토큰당 비용은 의사결정을 위한 올바른 단위가 아닙니다. 작업 완료당 비용은 시도당 비용에 시도 횟수를 곱한 값입니다. 현재 요금 체계에서 Fable 5를 한 번 시도하는 비용은 Sonnet 5를 다섯 번 시도하는 비용과 같습니다. 따라서 재시도 횟수만으로는 업그레이드를 정당화하기 어렵습니다. Sonnet이 다섯 번 중 네 번 이상 실패해야만 저렴한 모델을 사용하는 것이 토큰 비용 측면에서 손해가 됩니다.
업그레이드를 정당화하는 요소는 토큰 청구서에 나타나지 않는 모든 것들입니다. 차트에 나타난 두 긴 작업 간의 비용 차이는 대부분의 시장에서 엔지니어의 한 시간 인건비보다 작습니다. 고성능 모델을 사용하여 검토 시간을 한 시간 절약하거나, 나중에 되돌려야 하는 잘못된 마이그레이션을 한 번이라도 방지한다면, 해당 모델은 청구서에 나타나지 않는 절감 효과를 통해 이미 비용을 회수한 셈입니다. 비교 기준을 '승인된 결과물당 비용'으로 설정하고, 총비용에 귀하의 시간 가치를 포함하십시오. 100만 토큰으로 실제로 무엇을 할 수 있는지 파악하면 이러한 추정치가 훨씬 덜 추상적으로 느껴질 것입니다.
Claude Fable 5가 제값을 하는 세 가지 작업
잘못된 판단의 비용이 큰 장기 에이전트 실행. Fable 5는 수 시간 단위의 작업을 위해 설계되었습니다. 1M 토큰의 컨텍스트 윈도우, 요청당 최대 128k 출력 토큰, 그리고 30분 이상 소요되는 작업과 수백만 토큰의 예산을 목표로 하는 xhigh 수준의 노력을 지원합니다. 40단계에서 에이전트가 잘못된 경로로 들어섰을 때 300단계가 되어서야 발견하게 되는 사후 수습 비용과 실행 비용을 비교해 보십시오.
대규모 코드베이스에서 한 번 수행하는 마이그레이션 또는 감사. 일회성 작업은 비용을 분산할 물량이 없으므로 토큰당 프리미엄이 단일 청구서에 합산되지만, 전체 작업을 하나의 컨텍스트 윈도우 안에 담을 수 있습니다. 비동기 실행이 가능하다면 Batch API를 통해 출력 토큰 백만 개당 $25로 비용을 절반으로 줄일 수 있습니다.
저렴한 모델이 이미 두 번 실패한 작업. 두 번의 실패와 그에 따른 디버깅 시간은 위 차트에 명시된 물량 기준으로 Fable을 한 번 사용하는 것보다 더 많은 비용이 듭니다. 문제를 상위 모델로 넘기는 것이 더 저렴한 선택이며, 이것이 바로 모델 계층(model ladder)이 존재하는 이유입니다. 만약 여전히 일반적인 계층 선택을 고민 중이라면, Claude 모델 계층 간의 성능 비교가 이 페이지와는 다른 관점에서 해답을 제공할 것입니다.
Sonnet 5 또는 Haiku 4.5가 정답인 세 가지 업무
대량 분류 및 추출 작업. 이 업무들은 처리량과 단위 비용으로 평가되며, 품질 상한선이 낮아 저렴한 모델로도 충분히 도달할 수 있습니다. Haiku 4.5가 정확하게 처리하는 작업에 10배의 비용을 지불하더라도 Fable 5는 측정 가능한 이점을 제공하지 않습니다.
지연 시간이 제품의 핵심인 대화형 작업. Anthropic의 모델 표에 따르면 Fable 5의 상대적 지연 시간은 더 길며, 사고(thinking) 기능을 끌 수 없습니다. 챗봇이나 에디터 자동 완성 기능에서 사용자는 품질보다 대기 시간을 먼저 체감하므로, 더 뛰어난 모델을 사용하면 오히려 사용자 경험이 저하됩니다.
2026년 1월 이후의 사건에 의존하는 모든 작업. Fable 5의 신뢰할 수 있는 지식 컷오프는 2026년 1월입니다. 반면 Opus 5는 2026년 5월입니다. 더 비싼 모델이 오히려 최신 정보가 부족하므로, 검색이나 데이터 가져오기 도구를 제공하지 않는 한 최신성 관련 질문에 대해 더 많은 비용을 내고 더 오래된 지식을 얻게 됩니다.
비용과는 완전히 별개의 제약 사항이 하나 있습니다. Fable 5는 30일 데이터 보존 정책을 따르며, Covered Model로 지정되어 있어 데이터 보존 제로(zero data retention) 옵션을 사용할 수 없습니다. 귀하의 계약 조건에 데이터 보존 제로가 필수라면, 가격과 관계없이 Fable 5는 선택할 수 없으며 어떤 할인도 이를 변경할 수 없습니다.
fable-method 저장소가 보여주는 것과 보여주지 않는 것
실무자들은 Fable 5 접근 방식이 어떻게 작동하는지를 더 저렴한 모델이 따라 할 수 있는 기술로 요약한 저장소를 공개했습니다. fable-method 저장소는 사고 기술, 오케스트레이션 루프, 그리고 에이전트의 자체 보고서를 읽는 대신 주장된 모든 확인 사항을 다시 실행하는 적대적 검증기를 설명합니다. 해당 저장소의 README에는 "이것은 커뮤니티의 요약이며, Anthropic의 결과물이 아닙니다"라고 명시되어 있습니다.
이 내용을 그대로 받아들이십시오. 이는 사람들이 모델을 어떻게 구동하고 있는지에 대한 증거일 뿐, 모델이 어떻게 작동하는지에 대한 문서가 아닙니다. 이 저장소의 어떤 내용도 Anthropic에 의해 검증되지 않았으며, 사양(spec)이 아닌 구전 지식에서 예상할 수 있듯이 서로 다른 표현을 사용하는 거의 동일한 포크(fork)가 여러 개 존재합니다.
비용 결정을 위해 참고할 만한 신호는 사람들이 복제할 가치가 있다고 판단한 부분이 절차적이라는 점입니다. 작업을 분류하고, 작업 완료를 증명할 확인 항목을 명명하고, 결정을 내리기 전에 증거를 수집한 다음, 요약본을 읽는 대신 관찰을 통해 검증하십시오. 명시적인 체크리스트와 검증 단계를 제공받은 저렴한 모델은 성능 격차의 일부를 해소합니다. 따라서 고가의 모델을 표준으로 채택하기 전에 자체 평가 세트에서 해당 실험을 수행해 보십시오. 결과는 작업 내용에 따라 달라지며, 이것이 바로 다른 사람의 수치가 귀하에게 큰 의미가 없는 이유입니다.
예산을 확정하기 전에 직접 수치를 확인하십시오
- 모든 응답에서
usage을 읽고,output_tokens_details.thinking_tokens은 표시되는 출력과 별도로 기록하십시오. 눈에 보이지 않는 추론 과정이 예산 초과를 유발하는 주된 항목입니다. - 기본값을 그대로 사용하지 말고
effort를 명시적으로 설정하십시오. 프롬프트 캐싱을 사용하는 대화 내내 이 값을 일정하게 유지해야 합니다. - 안정적인 접두사를 캐시 중단점 뒤에 배치하십시오. 기본 입력 비용의 10분의 1 수준인 캐시 읽기 비용은 대부분의 모델 하향 조정보다 더 큰 절감 효과를 가져옵니다.
- 즉각적인 답변이 필요하지 않은 작업은 Batch API로 옮기십시오.
- 대안의 가격을 정직하게 책정하십시오. Claude와 ChatGPT API 가격 비교를 자신의 작업 부하에 맞춰 직접 수행해 보는 것은 장기 계약 전 오후 시간을 투자할 가치가 충분합니다.
작업 부하가 자체 서버에서 실행되는 에이전트라면, 모델 선택보다 더 중요한 제어 요소들이 존재합니다. VPS에서 에이전트 비용 제어하기에서는 세션이 통제 불능 상태가 되는 것을 방지하는 루프 제한과 지출 한도를 다루며, Claude Code가 실제로 토큰을 소비하는 곳에서는 사용량 대시보드에서 확인하게 될 수치들의 의미를 설명합니다.
FAQ
Claude Fable 5의 백만 토큰당 비용은 얼마입니까?
Claude Fable 5는 2026년 8월 3일 Anthropic 가격 페이지 기준으로 Claude API에서 입력 토큰 백만 개당 $10, 출력 토큰 백만 개당 $50에 제공됩니다. 캐시 읽기 비용은 기본 입력 요금의 10분의 1인 백만 토큰당 $1입니다. Batch API를 사용하면 양쪽 모두 50% 할인되어 비동기 작업 시 백만 토큰당 $5 및 $25가 적용됩니다. inference_geo 매개변수를 사용하여 추론을 미국 내에서 수행하도록 설정하면 모든 항목에 1.1배의 배수가 적용됩니다.
Claude Fable 5는 Claude Pro 구독에 포함되어 있습니까?
Anthropic의 Claude Fable 페이지에 따르면 해당 모델은 Pro, Max, Team 및 Enterprise 사용자에게 제공되며 무료 플랜은 명시되어 있지 않습니다. 포함된 액세스 권한은 무제한이 아닙니다. 일부 사용자는 주간 사용량 제한의 일부로 Fable을 이용하고, 다른 사용자는 사용 크레딧을 통해 이용하며, 이 정책은 2026년 7월 중 여러 번 변경되었습니다. 기사에 기재된 수치를 신뢰하기보다는 결정하는 당일에 Anthropic 가격 페이지의 플랜 비교 표에서 Fable 항목을 확인하십시오. 포함된 허용량을 모두 사용하면 이후 사용량은 API 요금으로 청구됩니다.
Claude Fable 5 청구 금액이 실제 출력물보다 높게 나오는 이유는 무엇입니까?
Claude Fable 5는 적응형 사고(Adaptive thinking) 기능이 항상 활성화되어 있으며, 사고 토큰은 출력 토큰으로 청구되지만 원시 사고 과정(chain of thought)은 반환되지 않습니다. thinking.display이 기본값인 omitted로 설정된 경우, 사고 토큰에 대한 비용을 지불하면서도 빈 사고 필드만 보게 됩니다. 응답 내의 usage.output_tokens_details.thinking_tokens을 확인하여 비율을 파악하십시오. 스트리밍 시에는 마지막 message_delta 이벤트에서만 해당 정보가 도착합니다. 작업에 비해 추론 대비 답변 비율이 높다면 effort 수준을 낮추십시오.
Claude Fable 5와 Claude Opus 5 중 무엇을 사용해야 합니까?
Claude Opus 5는 토큰당 비용이 절반이며, 지식 차단 시점이 2026년 5월로 Fable 5의 2026년 1월보다 더 최신 상태입니다. Opus 5에서 시작한 뒤 해당 모델에서 작업이 실패하거나, 잘못된 답변으로 인한 비용이 가격 차이보다 커질 때 전환하십시오. Fable 5는 잘못된 분기 하나가 수 시간의 정리 작업을 유발할 수 있는 장기 에이전트 작업이나, 매 요청마다 비용이 발생하는 대신 일회성 작업의 프리미엄을 한 번의 청구서로 처리하려는 경우에 적합합니다.