Claude 메모리 기능 사용 시 추가 비용이 발생하나요?
Claude 메모리 기능 자체에 대한 별도 요금은 없으나, 기억된 정보가 입력 토큰으로 재전송되면서 비용이 발생합니다. 프롬프트 캐싱 적용 여부와 재전송되는 토큰량에 따라 실제 청구 금액이 달라지므로 상세한 과금 구조를 확인하십시오.
Claude의 메모리 기능에 추가 비용이 발생합니까?
Claude의 메모리 기능 자체에는 별도의 요금이 부과되지 않습니다. Anthropic이 공시한 요금은 입력 토큰 100만 개당, 출력 토큰 100만 개당 책정되며, 프롬프트 캐싱에 대한 추가 요금이 있을 뿐 '메모리 토큰'이라는 항목은 존재하지 않습니다. Claude API(application programming interface)에서 메모리 자체를 저장하는 데는 비용이 들지 않습니다. 메모리 도구는 클라이언트 측에서 작동하며 파일은 사용자가 소유한 저장소에 보관되기 때문입니다.
메모리 기능은 여전히 청구서에 영향을 미칩니다. 기억된 사실은 Claude가 읽는 요청 내부에 포함될 때만 답변을 변경하기 때문입니다. 기억한다는 것은 해당 내용을 다시 전송한다는 의미입니다. 그 텍스트는 입력 토큰으로 전달되며 모델의 일반적인 입력 요금으로 과금됩니다. 비용은 두 가지 수치에 의해 결정됩니다. 매 턴마다 다시 재생되는 기억된 텍스트의 토큰 수와, 해당 재생 텍스트가 프롬프트 캐시에서 제공될 수 있는지 여부입니다.
Pro 또는 Max 구독을 이용 중이라면 토큰 단위로 요금이 청구되지 않으므로, 메모리 사용은 비용이 아닌 사용량 한도 내에서 이루어집니다. 아래의 메커니즘은 동일하며 단위만 달라집니다. 해당 한도는 유한하므로, 매 턴마다 어느 정도의 메모리를 포함할지 결정하기 전에 Claude Pro의 가격과 제한 사항이 적용되는 지점을 파악하는 것이 좋습니다. Claude Enterprise는 다르게 운영됩니다. 좌석당 가격 외에도 모든 토큰을 API 요금으로 측정하기 때문에, 메모리 블록이 너무 크면 사용량 한도가 아닌 실제 비용으로 환산됩니다. 메모리를 정리하여 사용량을 하위 플랜의 한도 내로 충분히 낮출 수 있다면, Max에서 Pro로 하향 조정하는 것이 고려할 만한 후속 조치이며, 변경 사항은 이미 결제한 기간이 종료된 시점에 적용됩니다. Anthropic의 자체 티어 간 비교가 아니라 다른 제공업체와 비교를 고려하고 있다면, 현재 가격 기준으로 비교한 Claude와 ChatGPT의 플랜을 먼저 확인하십시오.
각 Claude 인터페이스에서 "메모리"가 의미하는 바
세 가지 서로 다른 제품이 이 단어를 공유하고 있으며, 이들을 혼동하는 것이 이 질문을 혼란스럽게 만드는 주된 이유입니다.
Claude API의 메모리 도구. tools 배열에 항목 하나를 추가하고 직접 작성한 코드에서 파일 작업을 구현합니다.
{"type": "memory_20250818", "name": "memory"}2026년 8월 기준으로 이 도구는 Claude 4 이후 모델의 Messages API에서 베타 헤더 없이 정식으로 제공됩니다. 이는 클라이언트 측에서 작동합니다. Claude가 view /memories와 같은 작업을 요청하면, 사용자의 핸들러가 직접 제어하는 저장소에서 이를 실행하고 tool_result 블록으로 결과를 반환합니다. Anthropic은 파일을 보관하지 않으므로 별도의 저장 비용이 발생하지 않습니다. 대신 왕복 요청에 대한 비용을 지불합니다. 도구 정의는 모든 요청마다 전송되며, 반환된 파일 내용은 그 시점부터 대화에 계속 유지됩니다.
Anthropic은 해당 오버헤드의 고정된 부분을 공개합니다. 2026년 8월 문서에 따르면, Claude Opus 5에서 auto 도구 선택 시 도구 사용 시스템 프롬프트는 286 토큰입니다. 이는 메모리 도구 여부와 관계없이 도구가 포함된 모든 요청 시 1회 지불됩니다.
Claude Code. 세션 시작 시 두 가지 메커니즘이 로드됩니다. CLAUDE.md 파일에는 사용자가 작성한 지침이 포함됩니다. 자동 메모리는 ~/.claude/projects/<project>/memory/ 아래에 Claude가 스스로 작성한 메모를 보관합니다. MEMORY.md의 처음 200줄 또는 25KB 중 먼저 도달하는 제한까지만 로드되며, 그 옆의 주제 파일들은 시작 시점이 아닌 필요할 때 읽어옵니다. 시작 시 로드된 모든 내용은 해당 세션의 이후 모든 요청에 포함되는 접두사가 됩니다. Claude Code가 세션 간 메모리를 불러오는 방법에서 파일별 로드 순서를 다룹니다.
웹 버전 Claude. claude.ai에서 메모리는 사용자와 대화하며 Claude가 작성하고 업데이트하는 항목들의 집합이며, 각 프로젝트마다 별도의 메모리 공간을 가집니다. 설정(Settings) > 메모리(Memory)에서 저장된 내용을 확인할 수 있으며, 해당 메뉴의 토글을 통해 메모리 일시 중지(Pause memory) 또는 메모리 초기화(Reset memory)를 수행할 수 있습니다. 이 인터페이스는 구독 기반으로 과금되므로, 여기서 사용하는 메모리는 사용량 제한을 소모합니다.
기억된 텍스트가 입력 토큰으로 과금되는 이유
Messages API는 상태를 저장하지 않습니다. 호출 사이에 아무것도 기억하지 않으므로, 클라이언트는 매번 전체 대화 내용을 전송하고 모델은 이를 다시 읽습니다. 메모리도 이 규칙의 예외가 아닙니다. 메모리는 동일한 요청 내에 포함된 또 하나의 텍스트 블록일 뿐입니다.
이 구분은 모든 응답의 usage 객체에서 확인할 수 있습니다.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens는 캐시에서 읽어오지도 않았고 캐시를 생성하는 데 사용되지도 않은 토큰만을 계산하며, 실제로는 마지막 캐시 중단점 이후의 토큰을 의미합니다. 요청에 대한 총 입력 토큰은 cache_read_input_tokens, cache_creation_input_tokens, input_tokens을 합한 값입니다. 3턴 전에 Claude가 열었던 메모리 파일은 그 이후 매 턴마다 총 입력 토큰에 포함됩니다. 캐시된 접두사가 유지되는 동안에는 cache_read_input_tokens에 해당하며, 그렇지 않을 때는 input_tokens에 해당합니다. 동일한 텍스트라도 상황에 따라 가격이 크게 달라집니다. 입력 토큰과 출력 토큰의 가격 차이를 참고하십시오. 메모리는 항상 입력 측에만 해당합니다.
자신의 사용량에서 이 수치를 확인하는 방법
블로그 게시물이나 이 글에 제시된 수치를 그대로 사용하지 마십시오. 자신의 메모리 블록을 직접 측정해야 합니다. 토큰 계산은 무료이며 자체적인 속도 제한이 있으므로 측정에 비용이 들지 않습니다.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'응답은 { "input_tokens": 14 }와 같은 하나의 숫자입니다. 메모리 텍스트를 system 필드에 붙여넣고 한 번 실행한 뒤, 텍스트 없이 다시 한 번 실행하십시오. 그 차이가 매 턴마다 메모리에 소요되는 비용입니다. 두 가지 주의 사항이 있습니다. 이 계산은 추정치이며, Anthropic이 시스템 최적화를 위해 추가하는 토큰은 사용자에게 청구되지 않습니다. 또한 실제로 사용할 모델을 기준으로 계산하십시오. Claude 4.7 이상 버전은 더 새로운 토크나이저를 사용하여 동일한 텍스트에 대해 약 30퍼센트 더 많은 토큰을 생성하기 때문입니다.
Claude Code 내부에서는 별도의 curl 명령 없이도 동일한 질문에 대한 답을 얻을 수 있습니다.
/context은 메모리 파일을 포함하여 현재 로드된 항목을 보여주므로, 입력을 시작하기 전에 컨텍스트 윈도우에서 차지하는 비중을 확인할 수 있습니다./memory는 CLAUDE.md 파일을 나열하고 자동 메모리 폴더를 엽니다./usage는 캐시 읽기 및 캐시 쓰기를 포함한 세션 총계를 출력합니다.- 상태 표시줄은 컨텍스트 윈도우 사용량을 지속적으로 표시할 수 있으므로, 사용량이 증가하는 과정을 실시간으로 확인할 수 있습니다.
/usage 세션 블록은 다음과 같습니다:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)마지막 줄을 주의 깊게 읽으십시오. 940.0k 캐시 읽기 수치는 대화 내용과 메모리 전체가 매 턴마다 캐시 요율로 다시 전송되고 있음을 의미합니다. 1.2k 입력 수치는 새로 추가된 부분만을 나타냅니다. Claude Code는 정가 기준으로 달러 금액을 로컬에서 계산하므로, 사용자가 적용받는 할인은 반영되지 않으며 실제 청구서와는 차이가 있을 수 있습니다. Claude Console의 Usage 페이지에 표시된 수치가 공식적인 기준입니다.
그런 다음 비교를 직접 수행하십시오. 일반 세션과 자동 메모리를 끈 세션, 두 개의 새로운 세션에서 동일한 첫 질문을 던져보십시오.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claude각 세션에서 /context을 실행하고 메모리 파일 항목을 비교하십시오. 그 차이가 작업이 시작되기 전, 매 세션 시작 시점에 누적된 메모리가 소요하는 비용입니다. Claude Code 토큰 사용량에 대한 전체 분석 문서를 위 두 수치와 함께 읽어보는 것을 권장합니다.
백만 토큰당 메모리 재사용 비용은 얼마입니까?
프롬프트 캐싱(prompt caching)을 사용하면 동일한 메모리 블록이라도 어떤 턴에서는 다른 턴보다 10배 더 많은 비용이 발생할 수 있습니다. Anthropic은 캐시 요금을 각 모델의 기본 입력 가격에 대한 배수로 공개하므로, 달러 가격이 변동되더라도 이 관계는 유지됩니다.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]캐시 읽기 비용은 기본 입력 가격의 0.1배입니다. 5분 유지 시간으로 항목을 작성하는 비용은 기본 가격의 1.25배이며, 1시간 유지 시간은 2배입니다. Anthropic은 손익분기점을 명확히 밝히고 있습니다. 5분 유지 시간의 경우 캐시 읽기를 1회 수행하면 캐싱 비용을 회수할 수 있고, 1시간 유지 시간의 경우 2회 수행하면 회수할 수 있습니다. 프롬프트 캐싱의 손익분기점은 메모리를 어디에 배치할지 결정하기 전에 수행해야 하는 계산입니다.
이러한 배수를 사용하면 재사용 횟수를 산술적으로 계산할 수 있습니다. 다음 블록은 실제 워크로드를 측정한 것이 아니라 위에서 공개된 배수를 사용한 산술 계산 결과입니다. 100턴 세션 동안 메모리 블록을 세 가지 방식으로 가격 책정하며, 일반 기본 입력 요금으로 청구되는 토큰 수로 환산하여 나타냅니다.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]100번의 턴 모두에서 캐시를 놓치는 4,000 토큰 메모리 블록은 400,000개의 기본 요금 토큰으로 청구됩니다. 동일한 블록을 5분 캐시 쓰기 1회와 캐시 읽기 99회로 처리하면 44,600개로 청구됩니다. 크기를 4분의 1로 줄이고 캐싱을 유지하면 11,150개로 청구됩니다. 이 3개의 행 전체에서 기능은 변경되지 않았으며, 오직 재사용 방식만 달라졌습니다. 이는 여전히 금액이 아닌 토큰 수이며, 토큰 수를 월 청구서의 금액으로 변환하는 것은 모델의 백만 토큰당 요금을 한 번 곱하는 과정입니다. 해당 요금은 사용하는 모델에 따라 결정되므로, 에이전트가 Claude Fable 5를 기반으로 한다면 공개된 백만 토큰당 요금 및 적합한 작업부터 확인하십시오.
두 번째 행은 이후의 99개 요청이 모두 캐시 항목이 살아있는 동안 도착한다고 가정합니다. 대부분의 실제 청구서에서 오류가 발생하는 지점이 바로 이 가정입니다.
휴식 후 동일한 질문을 할 때 비용이 더 발생하는 이유는 무엇입니까?
캐시 항목에는 수명이 있으며, 해당 항목을 쓰거나 읽는 요청 시점부터 시간이 측정됩니다. 기본값은 5분입니다. 1시간 옵션은 위에서 언급한 2배의 쓰기 비용이 발생합니다. Claude Code에서 구독 중일 때는 수명이 1시간이지만, 사용량 크레딧을 소진하기 시작하면 5분으로 단축됩니다. API 키나 클라우드 제공업체를 사용하는 경우 기본값은 5분입니다. ENABLE_PROMPT_CACHING_1H=1을 설정하면 사용량 크레딧을 사용하는 동안에도 1시간의 수명을 유지할 수 있습니다.
따라서 점심시간 동안 열어둔 세션에 한 줄짜리 질문을 입력하면, 자리를 비운 사이에 캐시 항목이 만료되어 비용이 많이 발생하게 됩니다. 메모리를 포함한 전체 접두사(prefix)가 기본 입력 요금으로 다시 처리되고 캐시에 다시 쓰이기 때문입니다. 휴식 시간의 길이가 해당 비용을 결정합니다.
이를 막연히 믿기보다 직접 확인할 수 있습니다. Pro, Max, Team 또는 Enterprise 플랜에서는 /usage 분석을 통해 최근 사용량의 10퍼센트 이상을 차지하는 동작을 식별할 수 있으며, 긴 컨텍스트와 캐시 미스(cache miss)가 해당 항목에 이름으로 표시됩니다. API를 사용하는 경우, 조용한 기간 이후 첫 번째 요청에서 cache_creation_input_tokens이 접두사의 전체 크기만큼 다시 치솟는 것을 확인하십시오.
캐시를 조용히 무효화하는 요인
캐시된 접두사는 도구, 시스템, 메시지 순으로 정렬됩니다. 특정 수준에서 변경이 발생하면 해당 수준과 그 이후의 모든 내용이 무효화됩니다. 도구 정의를 수정하면 전체 캐시가 삭제됩니다. 시스템 프롬프트를 수정하면 시스템 및 메시지 캐시가 삭제됩니다.
이는 시스템 프롬프트에 메모리를 유지하면서 에이전트가 학습함에 따라 이를 다시 작성하는 사용자에게 발생하는 함정입니다. 다시 작성할 때마다 그 뒤에 있는 모든 캐시된 복사본이 폐기되므로, 다음 요청 시 전체 쓰기 비용이 다시 발생합니다. 안정적인 내용은 앞쪽에 배치하여 변경되지 않도록 하고, 휘발성 내용은 메시지 목록의 뒤쪽에 배치하여 무효화 비용을 최소화하십시오.
두 번째로, 더 조용한 실패 사례가 있습니다. 각 모델에는 최소 캐시 가능 접두사 크기가 존재합니다. 2026년 8월 발표된 기준에 따르면 Claude Opus 5는 512 토큰, Claude Sonnet 5는 1,024 토큰, Claude Haiku 4.5는 4,096 토큰입니다. Anthropic의 문서는 이보다 적은 양을 처리할 때 발생하는 상황을 명확히 밝히고 있습니다. "이 토큰 수보다 적게 캐시하려는 요청은 캐싱 없이 처리되며, 오류도 반환되지 않습니다." 따라서 cache_control로 표시된 작은 메모리 파일은 아무런 동작을 하지 않으며, 조용히 무시됩니다. 이때 나타나는 증상은 프롬프트에 분명히 중단점이 포함되어 있음에도 cache_creation_input_tokens가 0으로 유지되는 것입니다.
더 이상 가치가 없는 메모리 정리하기
모든 메모리 라인은 매 턴마다 토큰 비용을 발생시키므로, 각 라인이 최근 답변에 기여했는지 확인해야 합니다. Claude Code는 이러한 제한 사항을 명확히 합니다. CLAUDE.md 파일은 200라인 미만으로 유지하십시오. 파일이 길어지면 더 많은 컨텍스트를 소비하게 되어 Claude가 지침을 안정적으로 따르기 어려워집니다. MEMORY.md은 로드 시점에 처음 200라인 또는 25KB로 제한되며, 이 제한을 초과하는 내용은 다음 세션 시작 시 삭제됩니다. 따라서 너무 큰 인덱스는 토큰만 낭비할 뿐 아무런 학습 효과를 주지 못합니다.
파일 크기를 작게 유지하는 두 가지 습관이 있습니다. 세부 정보는 인덱스에서 제거하고 주제별 파일로 옮기십시오. Claude는 시작 시점이 아니라 필요할 때 해당 파일을 읽습니다. 워크플로우 지침은 CLAUDE.md에서 제거하고 스킬(skills)로 옮기십시오. 스킬은 호출될 때만 로드됩니다. 이미 프런트매터(frontmatter)로 시작하는 메모리 파일의 경우, Claude Code는 버전 2.1.214 이상부터 modified 필드에 ISO 8601 타임스탬프 형식으로 작성 시간을 기록합니다. 이 타임스탬프는 정보가 최신 상태인지 확인하는 가장 빠른 방법입니다. 오래된 에이전트 메모리 정리하기에서 검토 과정을 더 자세히 다룹니다.
전체 내용을 컨텍스트에 로드하는 것보다 검색이 효율적인 경우
메모리 도구는 적시(just-in-time) 검색을 지원하기 위해 존재합니다. 에이전트는 모든 것을 미리 로드하는 대신 학습한 내용을 기록하고, 작업에 필요할 때만 파일을 읽어 들입니다. 이는 연산 방식을 변화시킵니다. 파일 읽기는 토큰 비용을 한 번만 발생시킨 뒤 캐시된 프리픽스(cached prefix) 내에 머무르지만, 영구적으로 로드된 블록은 매 턴마다 비용이 발생하기 때문입니다.
위의 두 차트에서 간단한 규칙을 도출할 수 있습니다. 거의 모든 턴에서 사용하는 텍스트는 안정적인 캐시 프리픽스에 두어야 합니다. 20번의 턴 중 한 번 정도 사용하는 텍스트는 view 호출 뒤에 두는 것이 좋습니다. 손익분기점은 Anthropic의 과금 정책이 아니라 사용자의 리플레이 횟수에 따라 달라집니다.
API에서는 플랫폼이 대화 내용을 정리하도록 설정할 수도 있습니다. 컨텍스트 편집(Context editing) 기능은 대화가 설정한 임계값을 넘어서면 오래된 도구 결과를 삭제합니다.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}기본값은 입력 토큰 100,000개와 도구 사용 기록 3개 유지입니다. 캐싱을 활성화하기 전에 상호작용 방식을 읽어보십시오. 콘텐츠를 삭제하면 삭제된 지점의 캐시 프리픽스가 무효화되므로, 다음 요청 시 캐시 쓰기 비용이 발생합니다. 이것이 바로 clear_at_least이 존재하는 이유입니다. 이 기능은 삭제로 얻는 이득이 쓰기 비용을 정당화할 만큼 커질 때까지 삭제를 보류합니다. 응답은 context_management 아래에 cleared_tool_uses 및 cleared_input_tokens와 함께 정확히 어떤 일이 발생했는지 보고하므로, 이론적인 추측이 아닌 측정 가능한 결과를 얻을 수 있습니다. Claude Code에서 컨텍스트 윈도우 관리하기에서도 동일한 개념을 코딩 세션에 적용합니다.
별도 항목으로 청구되는 것은 무엇인가
메모리 자체에는 별도의 비용이 발생하지 않지만, 일부 기능은 실제로 비용이 발생하므로 이를 파악해 두는 것이 좋습니다. 다음은 2026년 8월 기준 공개된 Claude API 요금입니다. 일부 작업은 비용이 전혀 들지 않지만, Claude API에는 무료 티어(free tier)가 없으며 가입 시 제공되는 소액의 크레딧만 존재하므로, 아래의 모든 항목은 첫 요청부터 실제 비용이 차감됩니다.
- 웹 검색(Web search): 검색 1,000회당 $10이며, 검색 결과가 컨텍스트에 포함될 때 발생하는 일반 토큰 비용이 추가됩니다.
- 코드 실행(Code execution): 조직당 매달 1,550시간까지 무료이며, 초과 시 컨테이너당 시간당 $0.05가 부과됩니다. 웹 검색이나 웹 가져오기(web fetch)와 함께 사용할 때는 무료입니다.
- Claude Managed Agents: 일반적인 토큰 비용 외에 세션 런타임 비용으로 세션 시간당 $0.08가 부과됩니다.
- 웹 가져오기(Web fetch): 추가 비용은 없으며, 가져온 콘텐츠에 대한 토큰 비용만 발생합니다.
메모리는 위 항목 중 어디에도 포함되지 않습니다. 메모리는 입력 토큰 수에 포함되어 나타나며, 바로 이 지점에서 측정할 수 있고 가지치기(pruning)나 캐싱을 통해 비용을 절감할 수 있습니다. 가상 사설 서버(VPS)에서 무인으로 실행되는 에이전트의 예산을 계획 중이라면, VPS 기반 AI 에이전트의 비용 제어를 다음 단계로 설정해야 합니다. 메모리 파일이 계속 커지는데 가지치기를 하지 않는 에이전트는 아무런 알림 없이 매주 비용이 증가하기 때문입니다.
FAQ
Claude의 메모리 기능에 별도의 요금이 부과됩니까?
아니요. Anthropic의 가격표에는 입력 토큰 백만 개당 요금, 출력 토큰 백만 개당 요금, 프롬프트 캐싱 배수만 명시되어 있으며 메모리 관련 항목은 없습니다. Claude API에서 메모리 도구는 클라이언트 측에서 작동하므로, 파일은 이미 비용을 지불하고 있는 저장소에 보관됩니다. 메모리 기능이 추가하는 것은 입력 토큰이며, 해당 토큰이 포함된 모든 턴마다 모델의 일반 입력 요금으로 청구됩니다.
메모리를 끄면 Claude 사용 비용이 저렴해집니까?
각 요청의 토큰 수가 줄어들므로 요청당 비용은 낮아집니다. 이것이 전체 비용을 절감할지는 이후 상황에 달려 있습니다. 만약 Claude가 메모리에 이미 저장되어 있던 내용을 다시 구성하기 위해 파일 3개를 다시 읽고 질문 2개를 해야 한다면, 해당 토큰 비용이 메모리 사용 비용보다 더 많이 발생합니다. 추측하지 말고 측정하십시오. 자동 메모리가 켜진 세션과 CLAUDE_CODE_DISABLE_AUTO_MEMORY=1로 시작한 세션에서 /context을 실행한 뒤, 동일한 작업에 소요된 총 토큰 수를 비교하십시오.
아무것도 변경하지 않았는데 사용량이 증가한 이유는 무엇입니까?
가장 흔한 원인은 일정 시간 경과 후 발생하는 캐시 미스입니다. 캐시 항목은 기본적으로 5분, 확장 설정 시 1시간 동안 유지되므로, 휴식 후 첫 번째 요청은 전체 접두사(prefix)를 기본 입력 요금으로 다시 처리하고 다시 작성합니다. 두 번째 흔한 원인은 접두사 편집입니다. 도구 정의를 변경하면 전체 캐시가 무효화되며, 시스템 프롬프트를 변경하면 시스템 및 메시지 캐시가 무효화됩니다. 구독 플랜을 사용하는 경우, 최근 사용량의 10퍼센트 이상을 차지하면 /usage 내역에서 해당 동작을 확인할 수 있습니다.
메모리는 시스템 프롬프트에 두어야 합니까, 아니면 도구 호출 뒤에 두어야 합니까?
거의 모든 턴에서 메모리를 사용한다면 시스템 프롬프트에 넣으십시오. 그러면 캐시된 접두사에 포함되어 캐시 읽기 요금이 적용됩니다. 일부 작업에서만 메모리가 필요하다면 view 호출 뒤에 배치하십시오. 한 번 읽은 파일은 매 턴마다 토큰 비용을 발생시키는 대신 한 번만 비용이 청구되기 때문입니다. 결정 기준은 재사용 횟수이며, usage 객체에서 해당 수치를 직접 확인할 수 있습니다.
메모리 기능이 구독 사용량 제한에 포함됩니까?
네, 간접적으로 포함됩니다. 구독 제한은 각 요청이 포함하는 토큰에 의해 소모되기 때문입니다. Anthropic의 도움말 문서에 따르면, 자동 컨텍스트 관리를 유발하는 긴 대화는 사용량 제한을 더 많이 소모합니다. 메모리는 각 요청을 약간 더 길게 만들며, 긴 세션은 매 턴마다 해당 길이를 반복합니다. Claude의 사용량 제한이 실제로 작동하는 방식에서 무엇이 언제 초기화되는지 확인할 수 있습니다.