SSD Nodes Learn Hosting plans →
가이드 Matt Connor작성자 Matt Connor · 업데이트됨 2026-09-09

Claude Pro 토큰 제한 및 메시지 한도 확인 방법

Claude Pro는 고정된 토큰 숫자를 제공하지 않으며 롤링 윈도우 기반의 메시지 제한을 적용합니다. 대화 길이와 첨부 파일에 따라 소모량이 달라지며, 현재 남은 사용량 확인 방법과 메시지 제한이 발생하는 구체적인 이유를 상세히 설명합니다.

Claude Pro에는 토큰이 얼마나 포함되어 있습니까?

Claude Pro는 토큰 허용량을 제공하지 않으며, 2026년 9월 기준으로 Anthropic은 이를 공개하지 않습니다. Claude 구독은 잔액에서 차감되는 토큰 방식이 아니라, 일정 시간 동안의 메시지 수를 기준으로 제한됩니다. 이 제한 범위는 선택한 모델, 대화의 길이, 각 턴마다 포함된 텍스트의 양에 따라 달라집니다.

사람들은 플랜이 API 키처럼 작동할 것이라고 예상하기 때문에 이 질문에 대한 답을 얻기 어렵습니다. API 키는 토큰 단위로 계산된 잔액을 소모하므로 사용자가 직접 청구 금액을 합산할 수 있습니다. 반면 구독 플랜은 Anthropic이 설정하고 조정하는 메시지 제한에 대한 접근 권한을 판매하는 것이므로, 고정된 토큰 숫자를 제시할 수 없습니다. 누군가 특정 숫자를 제시한다면 그것은 임의로 지어낸 것입니다.

따라서 질문을 바꾸어야 합니다. 무엇이 내 메시지를 비싸게 만드는가? 이 질문에는 실질적인 답이 있으며, 오늘 바로 조치를 취할 수 있습니다.

구독 모델에서 토큰 수를 기준으로 요금을 책정할 수 없는 이유

API는 모든 요청에 대해 토큰 단위로 요금을 청구합니다. 입력 토큰은 사용자가 전송하는 모든 내용을 포함하며, 출력 토큰은 모델이 생성하는 모든 내용을 포함합니다. 두 토큰의 요율이 다르기 때문에, 예상 비용을 산출하기 전에 입력 및 출력 토큰의 비용 차이를 먼저 확인해야 합니다.

소비자용 요금제에는 사용할 수 있는 잔액 개념이 없습니다. Anthropic은 첫 메시지를 보낸 시점부터 일정 시간이 지날 때까지의 롤링 윈도우 내에서 전송 가능한 메시지 수를 제한하며, 유료 요금제에는 일주일 단위로 측정되는 더 긴 기간의 제한이 추가로 적용됩니다. 메시지는 고정된 크기가 아니므로, 동일한 메시지 개수라도 사용자마다 실제 처리되는 작업량은 크게 다를 수 있습니다. Anthropic의 도움말 페이지에서는 짧은 대화를 기준으로 대략적인 메시지 제한 수를 설명하고, 긴 대화나 대용량 첨부 파일은 허용량을 더 빨리 소진한다고 경고합니다. 이 경고가 사실의 전부이며, 그 이면에 있는 메커니즘은 거의 설명되지 않습니다.

왜 20번째 대화 턴이 1번째 턴보다 훨씬 많은 비용을 소모하는가

모델은 요청 간에 기억을 유지하지 않습니다. 모델은 상태를 저장하지 않는(stateless) 방식이므로, 매 턴마다 전체 대화 내용을 다시 전송합니다. 여기에는 시스템 프롬프트, 사용자가 작성한 이전 메시지, Claude의 이전 답변, 그리고 첨부한 모든 파일이 포함됩니다. 사용자의 새로운 질문은 20단어 정도일 수 있지만, 이를 전달하는 요청에는 전체 대화 기록이 담겨 있습니다.

따라서 턴당 비용은 대화 길이에 비례하여 선형적으로 증가합니다. 아래 표는 시스템 프롬프트 약 1,000 토큰, 사용자 메시지당 약 1,000 토큰, 답변당 약 1,200 토큰이라는 가정하에 계산된 수치입니다. 이는 작동 방식을 설명하기 위한 예시이며, 실제 계정의 사용량을 측정한 것은 아닙니다.

ChartInput tokens per turn as one conversation grows (illustration)
The data behind this chart
[
  {
    "label": "Turn 1",
    "sent_this_turn": "2,000",
    "cumulative_input": "2,000"
  },
  {
    "label": "Turn 5",
    "sent_this_turn": "10,800",
    "cumulative_input": "32,000"
  },
  {
    "label": "Turn 10",
    "sent_this_turn": "21,800",
    "cumulative_input": "119,000"
  },
  {
    "label": "Turn 20",
    "sent_this_turn": "43,800",
    "cumulative_input": "458,000"
  }
]

1번째 턴에서는 2,000개의 입력 토큰을 전송합니다. 20번째 턴이 되면 사용자가 입력하는 질문의 길이는 같더라도 43,800개의 토큰을 전송하게 되며, 이는 처음보다 20배 이상 많은 양입니다. 전체 대화 과정에서 사용자는 총 458,000개의 입력 토큰을 전송하게 되는데, 이 중 대부분은 반복적으로 전송되는 동일한 텍스트입니다.

1턴짜리 대화를 20번 따로 진행했다면 첫 번째 행의 20배만큼만 전송했을 것이며, 추가적인 비용은 발생하지 않았을 것입니다. 동일한 질문이라도 대화 방식에 따라 부하의 차이가 큽니다. 파일을 첨부하면 이 격차는 더 벌어집니다. 2번째 턴에 첨부한 PDF는 대화 내용과 상관없이 3번째, 4번째, 그리고 그 이후의 모든 턴에서 계속 다시 전송되기 때문입니다.

같은 요금제를 사용하더라도 사용자마다 체감하는 사용량이 완전히 다른 이유가 바로 여기에 있습니다. 한 사용자는 일주일 내내 하나의 대화 스레드를 유지하여 수요일에 제한에 도달하는 반면, 다른 사용자는 작업마다 새로운 대화를 시작하여 제한에 거의 걸리지 않습니다. 두 사용자 모두 잘못된 방식으로 사용하는 것은 아닙니다. 단지 대화 습관의 차이로 인해 토큰 소모량이 10배 이상 차이가 나는 것입니다.

API를 사용하는 경우 프롬프트 캐싱(prompt caching)을 통해 반복 비용을 줄일 수 있습니다. 이는 요청의 앞부분 중 변하지 않는 내용을 저장하여 이후 호출 시 해당 부분에 대해 할인된 입력 요금을 적용하는 방식입니다. 구독 서비스에서는 사용자가 캐싱을 직접 제어할 수 없으므로, 대화 길이를 조절하는 것이 비용을 관리하는 유일한 방법입니다. 코딩 세션에서도 파일 내용과 도구 정의가 매 턴마다 함께 전송되므로 동일한 원리가 적용됩니다. 따라서 코딩 세션의 컨텍스트를 작게 유지하는 것이 어떤 설정보다 제한 관리에 효과적이며, Claude Code 세션에서 토큰이 실제로 어디에 소모되는지에 대한 내용을 읽어보는 것이 요금제 탓을 하기 전에 도움이 될 것입니다.

각 요금제 등급별 제공 범위와 상대적 비교

어떤 등급도 절대적인 사용량을 명시하지 않습니다. 공개된 정보는 상대적인 수치이며, 이를 통해 충분히 선택할 수 있습니다. Free 등급은 가장 낮은 단계이며, 서비스 수요가 높을 때는 사용 가능한 용량이 줄어들 수 있습니다. Pro 등급은 그 위에 위치합니다. Max 등급은 Pro 사용량의 배수로 설명되는 두 가지 크기로 판매되며, 대략 5배와 20배 수준입니다. Team 및 Enterprise 등급은 사용자당 요금이 책정되며 별도의 제한이 적용됩니다.

이러한 배수는 계약 조건이라기보다 서비스의 운영 의도로 이해해야 합니다. Anthropic은 제한 수치를 수시로 조정하며, 이를 사전에 공지하지 않습니다. 이것이 바로 정확한 토큰 수치를 명시할 수 없는 이유입니다. 비용 측면의 비교를 위해 Pro 요금과 제한 사항두 가지 Max 등급 간의 차이를 참조할 수 있으며, Free 요금제의 실제 허용 범위에서 기본 제공량을 확인할 수 있습니다.

모델 선택은 요금제 등급 위에 적용되는 두 번째 변수입니다. 가장 큰 모델은 가장 작은 모델보다 동일한 질문을 처리하는 데 더 많은 사용량을 소모합니다. 더 무거운 모델일수록 토큰당 운영 비용이 높기 때문입니다. 일상적인 업무를 Opus에서 Sonnet이나 Haiku로 변경하는 것이 업그레이드보다 더 많은 작업 시간을 확보해 주는 경우가 많으므로, 사용량 제한이 계속 발생한다면 업무에 적합한 모델 선택을 가장 먼저 시도해야 합니다.

추측 대신 직접 사용량을 확인하는 방법

본인의 계정이 가장 정확한 정보원이며, 두 번의 클릭만으로 확인할 수 있습니다. claude.ai에서 Settings를 연 다음 Usage를 선택하십시오. 현재 윈도우에서 소비한 양과 해당 윈도우가 초기화되는 시점이 표시됩니다. 응답이 거부되기 시작할 때 한 번, 그리고 긴 세션이 끝난 뒤 한 번 확인하면, 그 어떤 공개된 수치보다 빠르게 본인의 사용 패턴을 파악할 수 있습니다.

Claude Code에서는 터미널에서 두 개의 슬래시 명령어로 동일한 작업을 수행할 수 있습니다. /usage는 플랜 사용량과 초기화 시간을 보고합니다. /context는 현재 컨텍스트 윈도우를 채우고 있는 항목을 시스템 프롬프트, 도구 정의, 파일, 대화 기록으로 나누어 분석합니다. /context를 통해 이전 대화 내용이 대부분을 차지하고 있음이 확인되면, /clear을 사용하여 새로운 세션을 시작하십시오. 그러면 턴당 비용이 위 차트의 첫 번째 행 수준으로 다시 낮아집니다.

API에서는 사용량 카운트가 정확하며, 요청을 보내기 전에 미리 확인할 수 있습니다.

curl https://api.anthropic.com/v1/messages/count_tokens \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-sonnet-5",
    "messages": [{"role": "user", "content": "Summarise the attached report."}]
  }'

정상적인 응답은 단일 필드로 구성되며, 이 숫자가 과금의 기준이 됩니다.

{"input_tokens": 14}

모든 완료된 요청은 종료 시 동일한 계산 결과를 보고합니다.

{"usage": {"input_tokens": 21430, "output_tokens": 512}}

새로운 요청으로 짧은 질문을 하나 보낸 뒤, 긴 대화 스레드의 마지막에서 동일한 질문을 보내고 두 개의 input_tokens 값을 비교해 보십시오. 그 차이가 바로 구독 서비스가 측정하고 있는 영향이며, 숫자로 명확히 기록됩니다.

작업 도중 제한에 도달했을 때의 대처법

  1. 제한이 풀릴 때까지 기다립니다. 애플리케이션에 초기화 시간이 표시되며, 대기 시간은 대개 우회 방법을 찾는 것보다 짧습니다. 마감 기한이 급하지 않을 때 가장 적절한 방법입니다.
  2. 더 가벼운 모델로 전환합니다. 더 작은 모델은 모든 플랜에서 턴당 비용이 저렴하며, 일부 플랜에서는 별도의 할당량을 사용하므로 고성능 모델이 제한된 동안에도 작업을 계속할 수 있습니다.
  3. 다음 단계에 필요한 내용만 포함하여 새로운 대화창을 시작합니다. 전체 대화 기록 대신 결론만 붙여넣으십시오. 턴당 토큰 비용이 즉시 감소하며, 모델이 이미 완료된 수천 개의 토큰을 고려할 필요가 없으므로 답변 품질도 대개 향상됩니다.
  4. API로 작업을 옮깁니다. API는 요청당 토큰을 계산하며 사용한 만큼 비용이 청구됩니다. 기다려야 할 제한 시간이 없으며, 호출 전후에 각 호출의 비용을 확인할 수 있습니다.

어떤 선택지가 적합한지는 현재 문제가 시간 때문인지, 작업량 때문인지에 따라 다릅니다. 일회성으로 발생하는 과부하는 시간 문제에 해당합니다. 매주 수요일마다 부딪히는 한계는 작업량 문제이며, 이는 시간 조절보다는 API 사용이나 더 큰 플랜으로의 전환이 필요합니다. 작업 도중 제한 발생 시 전체 복구 체크리스트에서 단계별 복구 방법을 안내하며, 롤링 윈도우의 개방 및 초기화 방식에서 시간 제한이 작동하는 원리를 설명합니다. API 사용을 고려 중이라면 먼저 비용을 산정해 보십시오. 동일 작업량에 대한 구독 서비스와 API 비용 비교토큰 100만 개의 실제 비용에서 전환 전 필요한 계산 정보를 확인할 수 있습니다.

FAQ

Claude Pro는 몇 개의 토큰을 포함합니까?

Anthropic은 Pro 요금제의 토큰 허용량을 공개하지 않으며, 2026년 9월 기준으로 인용할 수 있는 특정 수치는 없습니다. Pro 요금제는 롤링 윈도우 내의 메시지 수를 기준으로 제한되며, 일주일 단위로 더 긴 제한이 적용됩니다. 메시지 허용량은 사용하는 모델과 대화 길이에 따라 달라집니다. Pro 요금제에 대해 특정 월간 토큰 수치를 명시한 페이지는 모두 추측에 불과합니다. claude.ai에서 Settings를 열고 Usage를 선택하면 본인의 사용량과 제한 초기화 시간을 확인할 수 있습니다.

새 대화를 시작하면 사용량이 초기화됩니까?

아니요. 사용량은 계정 전체의 윈도우를 기준으로 계산되므로, 새 대화를 시작한다고 해서 이미 사용한 양이 복구되지는 않습니다. 새 대화가 바꾸는 것은 그 시점부터 발생하는 모든 대화 턴의 비용입니다. 새 대화는 다시 전송할 이전 대화 기록이 없으므로, 대화가 길어짐에 따라 비용이 증가하는 대신 위 차트의 낮은 단계에서 시작합니다. 주제가 바뀔 때 새 대화를 여는 것은 모든 요금제에서 가장 비용 효율적인 습관입니다.

왜 어제보다 오늘 더 빨리 제한에 도달했습니까?

보통 오늘 작업이 하나의 긴 스레드에서 진행되었기 때문입니다. 모든 대화 턴은 전체 대화 내용과 첨부된 파일을 다시 전송하므로, 사용자에게는 메시지 수가 동일해 보여도 메시지당 비용은 꾸준히 증가합니다. 또 다른 일반적인 원인은 모델입니다. 더 무거운 모델은 턴당 허용량을 더 빨리 소진하므로, 가장 큰 모델을 사용한 오후 작업이 더 작은 모델을 사용한 오전 작업보다 빨리 종료됩니다.

정확한 토큰 계산을 위해 API로 전환해야 합니까?

수치나 예측 가능성이 필요하다면 전환하십시오. API는 모든 호출 시 입력 및 출력 토큰을 계산하며, 전송 전에 실행할 수 있는 토큰 계산 엔드포인트를 제공하고 대기해야 할 윈도우가 없습니다. 토큰당 비용이 청구되므로 사용량이 많으면 고정 구독료보다 비싸질 수 있고, 사용량이 적으면 훨씬 저렴해집니다. 전환하기 전에 실제 작업 부하를 현재 요금제와 비교하십시오. 전송하는 토큰 수에 따라 결과가 달라지기 때문입니다.