Claude API와 구독 모델 비용 비교 분석
Claude API의 토큰당 단가와 구독형 플랜의 비용 효율성을 비교합니다. 사용량에 따른 손익분기점 계산법과 5시간 단위 롤링 윈도우 기반의 구독 모델 특징을 확인하십시오.
Claude API가 구독 모델보다 저렴한가요?
Claude API는 일정 사용량 미만에서는 구독보다 저렴하지만, 그 이상을 사용하면 더 비싸집니다. 하루 종일 대화형으로 코딩하는 개발자에게는 보통 정액제 플랜이 유리합니다. 스스로 호출을 수행하는 프로그램을 만드는 경우에는 API가 유일한 옵션이므로 비용이 결정 요인이 되지 않습니다. 나머지는 10분 내에 계산할 수 있는 산수 문제입니다.
참고할 만한 공식적인 손익분기점 수치는 없습니다. 구독 모델은 토큰 허용량이 아닌 사용량 윈도우(usage windows) 방식으로 판매되므로, 두 모델이 교차하는 지점을 알려주는 공개된 수치는 없습니다. 아래 내용은 현재의 토큰당 단가를 기준으로 한 계산식과, 플랜 비용보다 결과값에 더 큰 영향을 미치는 사용자 행동 패턴을 포함합니다. 아래의 모든 손익분기점 수치는 공개된 단가와 명시된 가정을 바탕으로 직접 계산한 것이며, 문서화된 수치가 아닙니다.
어떤 플랜을 구매할지 아직 결정하지 못했다면, 본인의 작업 방식에 맞는 Claude 플랜 찾기를 확인하십시오. 이 포스트는 사용자가 이미 구매할 플랜을 알고 있으며, 실제로 구매하는 것이 이득인지 알고 싶어 한다는 것을 전제로 합니다.
서로 다른 구조를 가진 두 가지 과금 모델
구독은 사용하지 않을 수도 있는 용량(capacity)입니다. 고정 비용을 지불하고 정해진 일정에 따라 재설정되는 허용량을 받습니다. Anthropic의 Claude Code 문서에 따르면 Team 및 Enterprise 시트의 구조는 다음과 같습니다: 사용량은 "Claude chat 및 Cowork와 공유되며, 5시간 단위의 롤링 윈도우와 주간 윈도우에 따라 재설정되는 시트당 허용량에서 차감됩니다". 구독자는 "세션 한도에 도달했습니다" 또는 "주간 한도에 도달했습니다"라는 메시지가 표시되는 메시지 횟수를 통해 동일한 구조를 경험합니다. 사용하지 않은 용량은 어쨌든 지출한 돈입니다. 허용 용량을 초과하면 윈도우가 재설정될 때까지 작업이 중단되며, /model로 모델을 변경해도 액세스가 복구되지 않습니다. 윈도우가 모든 모델에 공유되기 때문입니다.
API는 멈추지 않는 계량기입니다. 윈도우도 없고 한계도 없습니다. 모든 요청은 토큰당 가격이 책정되며, 일부 항목은 토큰 외의 기준으로 책정됩니다: 웹 검색은 "Claude API에서 1,000회 검색당 $10에 이용 가능합니다". 한도 때문에 멈추는 일은 없습니다. 청구서 금액이 계속 늘어날 뿐입니다.
2026년 7월 23일 기준, Claude 가격 페이지의 플랜 비용은 다음과 같습니다: Pro는 "연간 구독 시 월 $17 (선불 $200). 월간 결제 시 $20"이며, Claude Code가 포함됩니다. Max는 "월 $100부터"로 기재되어 있습니다. Team 시트는 "연간 결제 시 시트당 월 $20부터" 시작합니다. Enterprise는 두 모델을 동시에 실행하므로 흥미롭습니다: "시트 가격 + API 요율에 따른 사용량 $20/시트". 요금은 자주 변경되며, 각 플랜의 허용량은 토큰 단위로 공개되지 않으므로 결정하는 날에 가격 페이지를 확인하십시오.
API에서 얻을 수 없는 것
플랜 허용량 및 이를 기반으로 구축된 인터페이스. Claude Code의 /usage-credits 명령은 구독 사용 크레딧을 관리하며, 이는 "/login를 통해 claude.ai 구독으로 로그인한 후에 실행할 수 있습니다. API 키 인증으로는 이 명령을 사용할 수 없습니다." /usage 화면 또한 과금 모드에 따라 다릅니다: Session 블록은 "API 토큰 사용량을 보여주며 API 사용자용으로 설계되었습니다". 반면 구독자는 플랜 사용량 바와 사용 내역 요약을 봅니다.
Claude Code의 더 긴 프롬프트 캐시. 이 기능은 실제 비용이 발생하며 놓치기 쉽습니다. 문서에 따르면 "구독 시 수명은 1시간이며, 사용 크레딧을 사용하기 시작하면 5분으로 줄어듭니다. API 키 또는 클라우드 제공업체의 경우 기본값은 5분입니다". 캐시 수명보다 긴 휴식 후 보내는 첫 메시지는 캐시를 활용하지 못하므로, 전체 컨텍스트가 재처리되어 쓰기(write) 가격으로 과금됩니다. 구독을 사용하면 50분간 회의를 하고 돌아와도 캐시가 유지됩니다. API 키를 사용하면 동일한 휴식 후 세션 접두사(prefix)를 전체 다시 쓰기 해야 합니다.
구독에서 얻을 수 없는 것
프로그래밍 방식의 액세스. Claude를 호출하는 cron job이나 webhook 핸들러는 API 키가 필요하므로, 이것이 작업 부하의 핵심이라면 비교는 끝난 것입니다. VPS에서 첫 번째 Claude API 앱 구축하기에서 키 처리와 첫 번째 작동 스크립트를 다룹니다.
Batch API 할인. 가격 페이지에 명시되어 있습니다: "Batch API를 사용하면 대량의 요청을 비동기적으로 처리할 수 있으며, 입력 및 출력 토큰 모두에 50% 할인이 적용됩니다." 이는 사람이 기다릴 필요가 없는 모든 작업에 대해 계량기 수치를 절반으로 줄여줍니다. Opus 4.8의 100만 토큰당 Batch 요율은 입력 $2.50, 출력 $12.50이며, Sonnet 5의 도입 가격은 입력 $1, 출력 $5, Haiku 4.5는 입력 $0.50, 출력 $2.50입니다. 대가로 지연 시간(latency)이 발생합니다: 대부분의 배치 작업은 1시간 이내에 완료되지만, 24시간 이내에 완료되지 않은 배치는 만료되며, 스트리밍은 배치를 사용할 수 없습니다. 배치와 프롬프트 캐싱은 중첩 적용됩니다. 배치는 5분 이상 실행될 수 있으므로, 배치 내부에서 1시간 캐시를 사용하십시오.
프로젝트별 비용 귀속. 모든 API 응답은 usage 블록을 반환하므로, 단일 요청의 비용을 로그로 남겨 특정 프로젝트나 고객에게 귀속시킬 수 있습니다. 구독은 시트를 보유한 개인에 대해 하나의 사용량 바를 보고합니다.
한 가지 주의할 점은, 이 둘은 별개의 과금 체계라는 것입니다. Anthropic의 문서는 구독 과금은 claude.ai 지원으로, Console 과금은 API 플랫폼으로 연결하며, /usage-credits은 API 키 환경에서 작동하지 않습니다. 제가 확인한 내용 중 구독에 API 크레딧이 포함된다는 내용은 없으므로, 두 개의 계정과 두 개의 청구서를 고려하십시오.
손익분기점 계산식
한 번의 턴(turn) 가격을 구한 다음, 이를 확장하십시오.
turn cost = uncached_input_tokens x base_input_price
+ cache_write_tokens x 1.25 x base_input_price
+ cache_read_tokens x 0.10 x base_input_price
+ output_tokens x output_price
monthly API cost = turn cost x turns_per_active_day x active_days_per_month
break even when: monthly API cost = flat plan fee배수(multiplier)는 추정치가 아닌 공개된 수치입니다. 5분 캐시 쓰기는 "기본 입력 가격의 1.25배", 1시간 쓰기는 "기본 입력 가격의 2배"이며, 캐시 읽기는 "기본 입력 가격의 0.1배"입니다. Thinking 토큰은 출력 토큰으로 과금되므로, 추론 요약(reasoning summary)을 표시하지 않는 모델이라도 output_tokens에 포함됩니다.
2026년 7월 23일 기준 100만 토큰(MTok)당 기본 요율:
claude-fable-5: 입력 $10, 출력 $50. 캐시 읽기 $1. 5분 캐시 쓰기 $12.50. 1M 컨텍스트.claude-opus-4-8및claude-opus-4-7: 입력 $5, 출력 $25. 캐시 읽기 $0.50. 5분 캐시 쓰기 $6.25. 1M 컨텍스트.claude-sonnet-5: 2026년 8월 31일까지 도입 가격으로 입력 $2, 출력 $10, 이후 입력 $3, 출력 $15. 도입 가격 기준 캐시 읽기 $0.20, 5분 캐시 쓰기 $2.50. 1M 컨텍스트.claude-haiku-4-5: 입력 $1, 출력 $5. 캐시 읽기 $0.10. 5분 캐시 쓰기 $1.25. 200K 컨텍스트.
긴 컨텍스트에 대한 추가 요금은 없습니다: "900k-token 요청은 9k-token 요청과 동일한 토큰당 요율로 과금됩니다."
가정 사항을 포함한 계산 예시
Sonnet 5를 사용하여 60,000 토큰의 컨텍스트를 가진 세션 중간의 Claude Code 턴 한 번을 가정해 보겠습니다: 캐시에서 제공된 55,000 토큰, 새로 캐시에 쓰인 3,000 토큰, 캐시되지 않은 새로운 입력 2,000 토큰, 그리고 thinking을 포함한 출력 1,200 토큰.
- 캐시 읽기: 55,000 x $0.20/MTok = $0.0110
- 캐시 쓰기: 3,000 x $2.50/MTok = $0.0075
- 캐시되지 않은 입력: 2,000 x $2.00/MTok = $0.0040
- 출력: 1,200 x $10.00/MTok = $0.0120
이는 턴당 약 $0.035입니다. 활동적인 날에 120번의 턴을 수행하면 하루 약 $4.14입니다. 한 달에 20일 활동하면 한 달 약 $83입니다.
이를 위의 정액제 비용과 비교하면 두 가지 결론이 나옵니다. Pro 비용의 약 4배이므로, Pro 플랜의 허용량이 하루 120번의 Sonnet 턴을 감당할 수 있다면 서류상으로는 Pro가 더 저렴합니다. 이 조건은 공개된 수치로 확정할 수 없는 부분입니다. 동일한 $83은 최저 Max 비용보다 낮으므로, 이 경우에는 API가 Max보다 유리합니다.
이제 가정을 하나씩 변경하며 플랜 비용이 결정적인 숫자가 아니게 되는 지점을 확인하십시오.
손익분기점에 플랜 가격보다 더 큰 영향을 미치는 세 가지 요소
프롬프트 캐싱. 캐싱 없이 동일한 60,000 토큰 턴을 실행하면 전체 프롬프트가 새로운 입력으로 과금됩니다: 60,000 x $2.00/MTok = $0.12, 여기에 출력 $0.012가 추가되어 턴당 $0.132가 됩니다. 이는 캐시를 사용한 턴보다 거의 4배 비싸며, 한 달 $83의 비용을 약 $317로 만듭니다. 이것이 Anthropic이 공개한 유일한 손익분기점입니다. 작업량과 상관없이 결정되기 때문입니다: "캐시 히트는 표준 입력 가격의 10% 비용이 들며, 이는 5분 지속 시간의 캐시 읽기 1회(1.25x 쓰기) 또는 1시간 지속 시간의 캐시 읽기 2회(2x 쓰기)만으로도 캐싱이 이득임을 의미합니다."
알림 없이 캐싱을 꺼버리는 두 가지 실패 사례가 있습니다. 첫째는 모델의 최소 캐시 가능 길이보다 짧은 접두사입니다: Fable 5는 512 토큰, Opus 4.8 및 Sonnet 5는 1,024 토큰, Opus 4.7은 2,048 토큰, Haiku 4.5는 4,096 토큰입니다. 짧은 접두사는 캐싱되지 않으며 오류도 발생하지 않습니다. 둘째는 병렬 요청입니다. "캐시 엔트리는 첫 번째 응답이 시작된 후에야 사용할 수 있기 때문"입니다. 동시에 실행된 10개의 동일한 요청은 모두 전체 입력 가격을 지불합니다. 두 경우 모두 cache_read_input_tokens가 0으로 표시되는 것이 신호입니다.
모델 선택. 동일한 턴을 Opus 4.8에서 실행할 때의 가격을 계산해 보겠습니다(입력 $5, 출력 $25, 캐시 읽기 $0.50, 5분 쓰기 $6.25/MTok): 읽기 $0.0275, 쓰기 $0.0188, 캐시되지 않은 입력 $0.0100, 출력 $0.0300. 이는 턴당 약 $0.086으로, Sonnet 턴의 2.5배이며 동일한 작업량에서 한 달 약 $207이 소요됩니다. 모델 하나를 바꿈으로써 동일한 작업의 비용이 최저 Max 비용 미만에서 그 두 배 이상으로 늘어났습니다. 반대로 Haiku 4.5($1/$5)를 사용하면 로그 분류와 같은 기계적 작업의 비용은 훨씬 낮아집니다.
노력 수준(Effort level)은 모델 선택에 달려 있습니다. Thinking 토큰은 출력 요율로 과금되기 때문입니다. Opus 4.8의 API 기본값은 high이며, 코딩 및 에이전트 작업에 문서화된 시작점은 더 비싼 xhigh입니다. Claude Code에서는 /effort으로, API에서는 output_config.effort으로 낮출 수 있습니다. 또 다른 변수는 토크나이저입니다. 최신 모델은 "동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성"하는 새로운 토크나이저를 사용하므로, 이전 모델로 측정한 토큰 수는 현재의 실제 비용보다 적게 나타납니다.
세션 관리(Session hygiene). API는 상태가 유지되지 않는(stateless) 방식이므로, 모든 턴마다 전체 대화가 입력으로 다시 전송됩니다. 따라서 긴 세션은 새로운 세션보다 메시지당 비용이 더 많이 듭니다. 이것이 예상치 못한 청구서가 발생하는 주요 원인이며, Claude Code 세션에서 실제로 토큰을 소비하는 것에서 자세히 다룹니다. 관련 없는 작업 사이에는 /clear를 실행하십시오. 오래된 컨텍스트는 모든 후속 메시지에서 다시 전송되고 다시 과금되기 때문입니다. 하나의 긴 작업 내에서는 /compact를 실행하여 히스토리가 전체를 유지하는 대신 요약되도록 하십시오. 연속적으로 작업하십시오. 기본 캐시는 "5분의 수명을 가지며", "캐시된 콘텐츠가 사용될 때마다 추가 비용 없이 갱신됩니다". 10분마다 한 번씩 건드리는 세션은 매번 다시 쓰기 비용을 지불합니다. VPS의 tmux에서 실행되는 분리된 Claude Code 세션은 유휴 상태일 때는 거의 비용이 들지 않지만, 캐시 수명을 넘겨 유휴 상태로 두면 따뜻한(warm) 접두사를 잃게 됩니다.
결정하기 전에 자신의 사용량을 측정하십시오
제 예시를 보고 결정하지 마십시오. 본인의 일주일 데이터를 보고 결정하십시오.
Claude Code에서 일주일 동안 각 세션 끝에 /usage을 실행하십시오 (/cost은 동일한 화면의 별칭입니다). 이는 세션의 토큰 수와 예상 비용을 보고합니다. 단, 문서에 명시된 주의사항이 있습니다: "달러 수치는 토큰 수를 기반으로 로컬에서 계산된 추정치이며 실제 청구 금액과 다를 수 있습니다." /clear을 실행하면 합계가 재설정되므로, 먼저 화면을 확인하십시오. 구독 모델에서 이 달러 수치는 실제 청구액은 아니지만, 그 뒤에 있는 토큰 수는 이 계산식에 반드시 필요합니다. /context는 무엇이 윈도우를 채우고 있는지 보여줍니다.
API 계정의 경우, Claude Console의 사용량 페이지가 권위 있는 기록입니다. 프롬프트를 보내기 전에 가격을 확인하려면, client.messages.count_tokens()은 "사용량 티어에 따른 분당 요청 제한을 받지만 무료로 사용할 수 있으며", 실제 과금에 사용될 토크나이저를 사용하는 유일한 카운터입니다.
호출 후 사용량 블록을 읽되, 정확하게 읽어야 합니다:
u = response.usage
total_input = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokensinput_tokens은 "마지막 캐시 중단점 이후의 토큰"으로 문서화된, 캐시되지 않은 나머지 토큰만 카운트합니다. input_tokens: 4000을 보고하는 턴은 4,000 토큰 턴이 아닙니다. 세 개의 필드를 모두 더한 값이 이 계산식에 필요한 프롬프트 크기입니다.
그다음 비교하십시오. 측정된 한 달 비용이 플랜 비용보다 확실히 낮다면 API를 사용하십시오. 확실히 높다면, 플랜의 허용량이 귀하의 일반적인 작업일을 감당할 수 있는 한 플랜을 사용하십시오. 만약 경계선 근처라면 플랜을 선택하십시오. 플랜은 예상치 못한 비용을 발생시키지 않지만, API는 그럴 수 있기 때문입니다.
FAQ
Claude API가 Claude Pro나 Max보다 저렴한가요?
사용량에 따라 다르며, 구독은 토큰 허용량이 아닌 사용량 윈도우 방식으로 판매되므로 참조할 만한 공개된 손익분기점은 없습니다. 공개된 토큰당 단가로 전형적인 턴 하나의 가격을 구한 뒤, 이를 하루 평균 턴 수와 한 달 평균 작업 일수에 곱하여 플랜 비용과 비교하십시오. 한 계산 예시에서, 60,000 토큰 Sonnet 5 턴은 약 $0.035였으며, 하루 120번씩 20일 동안 수행하면 한 달 약 $83가 소요되었습니다. 이는 Pro 비용보다는 높고, 최저 Max 비용보다는 낮습니다.
한 달 Claude API 비용을 어떻게 계산하나요?
실제 토큰 수를 수집하기 위해 Claude Code에서 일주일 동안 /usage을 실행하거나, 이미 API 계정이 있다면 Claude Console의 사용량 페이지를 확인하십시오. 그 다음 한 턴의 가격을 계산하십시오: 입력은 기본 요율, 캐시 쓰기는 기본 입력의 1.25배, 캐시 읽기는 기본 입력의 0.1배, 출력은 출력 요율을 적용하며 thinking 토큰을 출력으로 계산합니다. 여기에 하루 평균 턴 수와 한 달 평균 작업 일수를 곱하십시오.
무엇이 Claude API 청구 금액을 가장 많이 변화시키나요?
다른 무엇보다 프롬프트 캐싱이 가장 큰 영향을 미칩니다. 60,000 토큰 Sonnet 5 턴은 접두사가 캐시에서 제공될 때 약 $0.035가 들지만, 그렇지 않을 때는 약 $0.132가 듭니다. 다음은 모델 선택입니다. 동일한 턴을 Opus 4.8에서 수행하면 약 $0.086이 듭니다. 세 번째는 세션 길이입니다. API는 상태를 유지하지 않으므로 모든 턴에서 전체 대화가 입력으로 다시 전송됩니다.
Claude 구독에 API 액세스가 포함되어 있나요?
두 개의 계정과 두 개의 청구서가 있는 것으로 간주하십시오. API 호출은 Console에서 생성한 계정에 대해 토큰당 과금되며, 제가 확인한 문서 중 구독이 API 크레딧을 제공한다는 내용은 없습니다. 두 서비스가 별개라는 가장 명확한 신호는 Claude Code의 /usage-credits 명령어로, 이는 "API 키 인증으로는 사용할 수 없습니다". 많은 개발자가 대화형 코딩을 위한 플랜과 자신이 만드는 프로그램을 위한 API 키를 모두 보유하고 있습니다.