Claude Pro 사용량 제한 원인과 토큰 소모 이유
Anthropic은 Claude Pro의 정확한 토큰 제한을 공개하지 않습니다. 긴 대화 스레드, 파일 첨부, 이미지, 사고 과정 및 에이전트 작업이 어떻게 사용량을 빠르게 소모하는지 상세히 설명합니다.
Claude Pro 사용량 제한의 원인
Anthropic은 Claude Pro의 토큰 허용량을 공개하지 않으므로, 정확한 토큰 제한 수치를 알 수 있는 방법은 없습니다. 다만 무엇이 사용량을 소모하는지는 알 수 있으며, 이는 훨씬 유용합니다. 가장 큰 비중을 차지하는 것은 대화 길이이며, 그다음으로 첨부 파일 및 이미지, 사고(thinking) 과정, 도구 및 에이전트 작업 순입니다.
토큰은 텍스트의 단위로, 대략 짧은 단어나 긴 단어의 일부를 의미합니다. 사용자가 보내는 모든 요청은 토큰 단위로 측정되며, 플랜은 백그라운드에서 이를 계산합니다. Anthropic의 사용량 제한 모범 사례 페이지에서는 사용량 수치에 영향을 주는 요소로 메시지 길이, 파일 첨부 크기, 현재 대화 길이, 연구(Research) 및 웹 검색과 같은 도구 사용, 모델 선택, 사고 수준, 아티팩트 생성을 명시하고 있습니다. 이 목록에 있는 모든 항목은 동일한 역할을 합니다. 각 항목은 단일 요청에 포함되는 토큰의 개수를 변화시킵니다.
관련된 두 가지 질문은 별도의 페이지에서 다룹니다. Pro 플랜의 포함 사용량에서는 허용량의 규모와 왜 이를 토큰이 아닌 세션 단위로 설명하는지 다룹니다. 사용량 제한 도달 시 대처 방법에서는 제한 이후의 복구 방법을 다룹니다. 본 페이지는 사용량이 어디에 소모되는지를 설명합니다.
모든 메시지는 전체 대화 내용을 다시 전송합니다
이 메커니즘은 거의 모든 사용자를 놀라게 합니다. 모델은 대화 차수 사이에 기억을 유지하지 않습니다. 다음 메시지에 답변하기 위해 모델은 첫 단어부터 전체 대화 내용을 다시 읽습니다. Anthropic의 문서에도 명시되어 있듯이, 각 요청은 전체 대화 기록을 다시 전송합니다.
따라서 다섯 단어로 된 후속 질문은 다섯 단어짜리 요청이 아닙니다. 전체 스레드에 다섯 단어가 추가된 형태입니다.
이 계산을 한 번 해볼 필요가 있습니다. 각 대화 차수마다 사용자의 메시지와 Claude의 답변을 합쳐 약 500 토큰이 추가된다고 가정해 보겠습니다. 2번째 차수에서는 약 1,000 토큰을 전송합니다. 10번째 차수에서는 약 5,000 토큰을 전송합니다. 20번째 차수에서는 약 10,000 토큰을 전송하게 되는데, 이는 사용자가 입력한 양은 같아도 2번째 차수보다 10배 많은 비용이 드는 셈입니다. 20번의 대화를 거치면 스레드는 총 105,000 토큰을 전송하게 되지만, 20개의 새로운 채팅창에서 각각 질문했다면 약 10,000 토큰만 소모되었을 것입니다. 이 수치는 실제 측정값이 아닌 산술적인 계산이지만, 전체적인 비용 구조는 정확합니다.
같은 작업을 수행해도 비용이 크게 달라지는 이유가 바로 이것입니다. 사용자가 입력한 단어는 같아도, 그 위에 쌓인 대화 기록의 양이 다르기 때문입니다.
긴 스레드에는 두 번째 비용이 발생합니다. 대화가 컨텍스트 윈도우(2026년 9월 기준 Pro 요금제에서 200,000 토큰)에 가까워지면, Claude는 대화를 이어가기 위해 이전 메시지를 요약합니다. Anthropic은 이러한 자동 컨텍스트 관리가 트리거되는 대화는 사용량 제한을 더 많이 소모한다고 명시하고 있습니다. 요약 작업은 실제 연산 작업이며, 사용자는 동일한 사용량 한도 내에서 이 비용을 지불하게 됩니다.
이 과정을 직접 확인할 수 있습니다. 설정(Settings)에서 사용량(Usage)으로 이동하면 Pro 요금제의 5시간 세션 윈도우와 주간 윈도우에 대한 진행률 표시줄이 나타납니다. 긴 스레드에서 20번째 메시지를 보낸 후, 새로운 채팅창에서 첫 번째 메시지를 보내 진행률 표시줄이 얼마나 움직이는지 비교해 보십시오. 세션 및 주간 윈도우 작동 방식에서 각 윈도우가 언제 초기화되는지 확인할 수 있습니다.
파일이나 PDF 비용은 얼마입니까?
The data behind this chart
[
{
"label": "Text question only",
"input_tokens": 14
},
{
"label": "One tool definition plus a question",
"input_tokens": 403
},
{
"label": "One JPEG photo plus a question",
"input_tokens": 1028
},
{
"label": "One small PDF plus a question",
"input_tokens": 2188
}
]위 수치는 Anthropic의 토큰 계산 문서에 명시된 예시 출력값이며, claude-opus-5를 기준으로 측정되었습니다. 네 가지 프롬프트가 조금씩 다르므로 정확한 수치보다는 격차의 크기를 확인하십시오. 짧은 텍스트 질문은 14개의 입력 토큰으로 계산되었습니다. 짧은 질문이 포함된 사진은 1028개로 계산되었습니다. 짧은 질문이 포함된 작은 PDF(portable document format) 파일 하나는 2188개로 계산되었으며, 이는 일반 질문보다 약 150배 많은 양입니다.
이제 위에서 언급한 재전송 비용과 결합해 보십시오. 첨부 파일은 한 번 토큰으로 변환되면 이후 대화의 모든 턴마다 함께 전송됩니다. 첫 번째 메시지에 40페이지 분량의 보고서를 첨부하면, 두 번째, 세 번째, 그리고 스무 번째 메시지에서도 해당 40페이지에 대한 비용을 계속 지불하게 됩니다.
공개된 페이지당 수치는 상당히 큽니다. 수치가 문서화된 API(application programming interface)를 기준으로 볼 때, PDF 한 페이지는 밀도에 따라 보통 1,500에서 3,000개의 텍스트 토큰을 사용합니다. 여기에 각 페이지가 이미지로도 변환되므로 페이지 이미지에 대한 비용이 추가됩니다. 따라서 40페이지는 질문을 던지기도 전에 60,000개 이상의 토큰 비용이 발생합니다. 200,000개 토큰의 컨텍스트 윈도우에서 이는 상당한 비중을 차지하며, 필요하지 않을 수도 있는 페이지에 비용을 낭비하게 됩니다.
따라서 습관을 바꾸는 것은 간단합니다. 파일 전체가 아닌 필요한 부분만 첨부하십시오. Claude에게 보고서를 읽고 결제 조건을 찾으라고 요청하면, 이후 이어지는 모든 턴에서 보고서 전체에 대한 비용이 발생합니다. 결제 조건 섹션만 복사해서 붙여넣으면 단 한 번, 수백 개의 토큰 비용만 발생합니다.
스크린샷의 실제 비용이 겉보기보다 높은 이유
The data behind this chart
[
{
"label": "200 x 200 crop",
"standard_tokens": 64,
"high_res_tokens": 64
},
{
"label": "1000 x 1000 screenshot",
"standard_tokens": 1296,
"high_res_tokens": 1296
},
{
"label": "1920 x 1080 screenshot",
"standard_tokens": 1560,
"high_res_tokens": 2691
},
{
"label": "3840 x 2160 screenshot",
"standard_tokens": 1560,
"high_res_tokens": 4784
}
]Claude는 이미지를 패치 격자로 읽습니다. 각 패치는 28 x 28 픽셀 블록이며 하나의 시각적 토큰으로 계산됩니다. 따라서 이미지 비용은 (가로 길이를 28로 나눈 값을 올림) 곱하기 (세로 길이를 28로 나눈 값을 올림)으로 산출됩니다. 1000 x 1000 픽셀 스크린샷은 1296개의 시각적 토큰을 소모하며, 이는 대부분의 질문 전체보다 큰 용량입니다.
모델 선택에 따라서도 비용이 달라집니다. Claude 4.7 이상의 모델은 더 높은 해상도 계층에서 이미지를 읽습니다. 따라서 전체 4K 스크린샷을 처리할 때 최신 모델은 4784개의 시각적 토큰을 소모하는 반면, 이미지를 먼저 축소하는 구형 모델은 1560개만 소모합니다. 같은 파일, 같은 화면이라도 토큰 소모량은 약 3배 차이가 납니다.
Claude 앱은 한 메시지에 최대 20개의 이미지를 허용합니다. 20개의 전체 스크린샷을 첨부하면 질문을 입력하기도 전에 매우 큰 요청이 되며, 해당 대화의 이후 모든 턴에서 이 이미지들을 다시 전송하게 됩니다. 대신 필요한 부분만 잘라내어 사용하십시오. 실제 오류 메시지만 200 x 200 픽셀로 잘라내면 64개의 시각적 토큰만 소모하며, 보통 전체 바탕 화면을 찍은 사진보다 질문에 더 정확한 답변을 제공합니다.
사고와 노력 수준에는 어느 정도의 비용이 드는가?
노력 수준은 Claude가 답변하기 전에 얼마나 깊이 사고할지를 결정합니다. Claude 앱에서 이 설정은 전송 버튼 옆의 모델 메뉴에 있으며, 수준은 낮음, 중간, 높음, 매우 높음, 최대 단계로 나뉩니다. Anthropic은 이 설정의 대가를 명확히 밝히고 있습니다. 노력 수준이 높을수록 더 많은 토큰을 사용하므로 사용량 제한에 더 빨리 도달하게 됩니다. 일상적인 작업에는 낮음이나 중간 수준을 권장하는데, 이는 낮은 노력 수준이 사용량을 더 효율적으로 활용할 수 있게 해주기 때문입니다.
사고 과정에는 후속 비용도 따릅니다. 이전 대화 내용을 유지하는 모델의 경우, 이전 답변에서 발생한 사고 과정이 이후 대화의 모든 턴에서 입력 토큰으로 계산됩니다. 긴 추론 과정은 발생 시점에 한 번 비용을 지불하고, 그 이후의 각 메시지마다 부분적으로 다시 비용이 발생합니다.
모델 선택은 사용자가 간과하기 쉬운 또 다른 영향을 미칩니다. 텍스트를 토큰으로 분할하는 토크나이저가 Claude 4.7부터 변경되었습니다. 동일한 입력 텍스트라도 Claude 4.7 이후 모델에서는 이전 모델보다 약 30퍼센트 더 많은 토큰이 생성됩니다. Anthropic은 이러한 수치가 Pro 요금제의 사용량 제한에 어떻게 반영되는지 공개하지 않으므로, 이를 정확한 환산 비율로 생각하기보다는 일상적인 작업에는 가벼운 설정을 사용해야 하는 이유로 받아들여야 합니다. 종량제 방식의 경우 계산 방식이 공개되어 있으며, 입력 및 출력 토큰의 가격은 다르게 책정됩니다.
에이전트와 Claude Code가 사용량을 가장 빠르게 소진하는 이유
Claude Code와 Claude 앱은 하나의 사용 한도를 공유합니다.
Pro 및 Max 플랜 모두 Claude와 Claude Code 간에 공유되는 사용 한도를 제공합니다. 즉, 두 도구에서의 모든 활동은 동일한 사용 한도에 합산됩니다.
에이전트 작업은 쓰는 양보다 읽는 양이 훨씬 많습니다. 버그를 수정하기 위한 요청 한 번으로 10개의 파일을 열고, 검색을 실행하고, 결과를 읽은 뒤 4줄의 설명으로 답변할 수 있습니다. 사용자는 4줄의 답변만 보지만, 한도 측정 시스템은 그 과정에서 읽힌 모든 파일을 계산합니다. 이것이 세션의 겉모습과 실제 비용 사이의 가장 큰 차이입니다.
도구 정의 또한 질문을 하기 전부터 토큰을 소모합니다. 각 도구에 대한 설명이 요청과 함께 전송되기 때문입니다. 위에서 공개된 예시를 보면, 도구가 없는 짧은 질문은 14개의 입력 토큰을 소모한 반면, 도구 정의가 하나 포함된 짧은 질문은 403개를 소모했습니다. 실제 에이전트 설정에는 이보다 훨씬 많은 도구가 포함됩니다.
Claude Code 내부에서 /status를 입력하면 남은 세션 사용량을 확인할 수 있습니다. 작업 컨텍스트를 작게 유지하는 것이 사용량을 관리하는 가장 강력한 방법이며, 긴 Claude Code 세션에서 컨텍스트 관리하기에서 그 방법을 다룹니다. 첫 번째 명령을 내리기 전 에이전트 하네스가 부담하는 오버헤드에서는 나머지 차이에 대해 설명합니다.
일부 언어에서 동일한 작업의 비용이 더 높은 이유
토크나이저는 주로 영어 텍스트에 맞춰 학습되었으므로, 일반적인 영어 단어는 대개 토큰 하나로 처리됩니다. 러시아어, 아랍어, 힌디어, 일본어로 작성된 동일한 의미의 문장은 보통 더 많은 토큰으로 분할되며, 이는 동일한 질문이라도 사용자의 제한량을 더 많이 소모함을 의미합니다. 이 페이지에서 설명하는 메커니즘은 어디서나 동일하지만, 문장당 가격은 그렇지 않습니다.
추정치에 의존하기보다 직접 측정하십시오. Anthropic의 토큰 계산 엔드포인트는 호출 비용이 무료이며, 모든 메시지에 대해 입력 토큰 수를 반환합니다.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"messages": [{"role": "user", "content": "Paste your paragraph here"}]
}'응답은 한 줄로 표시됩니다.
{"input_tokens": 14}영어 단락으로 한 번, 그리고 같은 단락을 본인의 언어로 한 번, 총 두 번 실행하여 두 숫자를 비교하십시오. 호출 자체에는 비용이 들지 않지만, platform.claude.com의 Claude Console에서 발급받은 API 키가 필요합니다. 이는 Pro 구독 계정과 별개의 계정입니다. 모국어로 생각하고 작성하는 것이 더 빠르기 때문에, 단순히 비용을 위해 영어로 전환하는 것은 대개 좋지 않은 선택입니다. 대신 스레드를 짧게 유지하고 첨부 파일의 크기를 작게 관리하십시오. 이 두 가지 습관은 영어 사용자보다 본인에게 더 큰 비용 절감 효과를 가져다줍니다.
Pro 플랜을 효율적으로 유지하는 습관
- 주제가 바뀌면 새로운 대화를 시작하십시오. 이는 목록에서 가장 중요한 습관입니다. 대화 스레드가 길어질수록 이후 모든 메시지의 비용이 배가되기 때문입니다.
- 파일 전체가 아닌 필요한 부분만 첨부하십시오. 40페이지 대신 3페이지를 사용하십시오.
- 스크린샷은 오류 메시지만 보이도록 잘라내십시오.
- 반복되는 배경 정보는 매번 채팅에 붙여넣지 말고 프로젝트에 저장하십시오. Anthropic은 프로젝트 내 콘텐츠가 캐싱되며 재사용 시 제한 횟수에 포함되지 않는다고 명시하고 있습니다. 따라서 스타일 가이드나 스키마는 프로젝트 지식(project knowledge)에 포함하는 것이 좋습니다.
- 일상적인 질문에는 낮은 수준이나 중간 수준의 노력을 기울이고, 높은 수준의 노력은 그만한 가치가 있는 작업에만 사용하십시오.
- 질문 전체를 하나의 메시지에 담으십시오. 세 번의 확인 과정을 거치는 것이 상세한 메시지 하나보다 비용이 더 많이 듭니다. 각 확인 과정마다 이전 대화 내용을 모두 다시 전송하기 때문입니다.
한도가 이미 소진된 경우
2026년 9월 기준으로 Pro 요금제는 월 단위 결제 시 월 20달러, 연 단위 결제 시 월 17달러이며, Anthropic은 이를 무료 플랜 대비 5시간 세션당 최소 5배의 사용량을 제공한다고 설명합니다. Pro 요금 및 사용량 제한에서 해당 플랜에 대해 다룹니다. 위에서 언급한 습관들은 실제 사용량을 확보하는 데 도움을 주지만, 여전히 상한선은 존재합니다. 한 달에 한 번 한도가 소진된다면 이 방법들로 해결될 것입니다. 만약 업무상 며칠마다 한도가 소진된다면, Max 요금제가 적절한 선택인지 판단하기를 검토하는 것이 시간 활용 측면에서 더 효율적입니다.
FAQ
오늘 Claude Pro 사용 제한이 왜 이렇게 빨리 소진되었습니까?
대부분 긴 대화나 첨부 파일, 혹은 두 가지 모두가 원인입니다. 모든 메시지는 전체 대화 스레드를 다시 전송하므로, 동일한 분량의 단어를 입력하더라도 두 번째 메시지보다 스무 번째 메시지의 비용이 훨씬 큽니다. 첨부 파일 또한 매번 함께 재전송됩니다. Settings를 열고 Usage 항목에서 5시간 세션 및 주간 제한 중 얼마나 사용했는지 확인하십시오. 관련 없는 질문은 별도의 대화창에서 시작하는 것이 좋습니다.
새로운 대화를 시작하면 사용량을 절약할 수 있습니까?
네, 가장 효과적인 절약 습관입니다. 새로운 대화는 이전 기록 없이 시작되므로 첫 번째 메시지는 작성한 내용만큼의 비용만 발생합니다. 단, Claude가 이전 대화 내용을 알 수 없다는 단점이 있으므로, 전체 스레드를 복사하는 대신 유용한 부분만 짧게 요약하여 붙여넣으십시오. 이전 대화 전체를 새 대화에 붙여넣으면 피하려던 문제 상황이 그대로 재현됩니다.
첨부 파일은 첫 메시지 이후에도 계속 사용량을 소모합니까?
네, 같은 대화 내에서는 계속 소모됩니다. 파일은 한 번 토큰으로 변환되며, 이 토큰들은 이후 모든 대화 턴마다 포함되는 대화 기록의 일부가 됩니다. 40페이지 분량의 PDF는 대화가 종료될 때까지 요청에 계속 포함됩니다. 프로젝트에 포함된 파일은 예외입니다. Anthropic은 프로젝트 콘텐츠가 캐시되며 재사용 시 제한에 포함되지 않는다고 명시하고 있습니다.
영어가 아닌 다른 언어로 작성하면 사용 제한이 더 빨리 소모됩니까?
일반적으로 그렇습니다. 토크나이저는 같은 의미라도 영어가 아닌 텍스트를 더 많은 토큰으로 분할하므로, 동일한 질문이라도 영어보다 러시아어나 일본어로 작성할 때 비용이 더 많이 듭니다. 무료 토큰 계산 엔드포인트를 사용하여 같은 문단을 두 언어로 각각 측정해 보면 차이를 확인할 수 있습니다. 언어를 바꾸는 것보다 스레드를 짧게 유지하고 첨부 파일 크기를 줄이는 것이 좋습니다. 이러한 습관은 영어 사용자보다 비영어 사용자에게 더 큰 절약 효과를 줍니다.
Claude Code는 Claude 앱과 동일한 제한을 공유합니까?
네. Anthropic은 Pro 및 Max 사용 제한이 Claude와 Claude Code 간에 공유된다고 명시하고 있으므로, 두 곳에서의 활동 모두 동일한 제한에 합산됩니다. 에이전트 세션은 한 번의 요청으로 여러 파일을 읽고 여러 도구를 실행한 뒤 응답하므로 사용량이 빠르게 소모됩니다. Claude Code 내에서 /status를 실행하여 현재 세션의 남은 사용량을 확인하십시오.