Claudeのメモリ機能は追加料金がかかりますか?
Claudeのメモリ自体に料金項目はありません。再送信する記憶テキストが入力トークンとして課金され、プロンプトキャッシュの利用可否とトークン数で費用が変わります。
Claude のメモリ機能には追加料金がかかりますか?
Claude のメモリ機能自体に料金はかかりません。Anthropic が公開している料金は、入力 100 万トークンおよび出力 100 万トークンあたりで設定されており、プロンプトキャッシュには別料金があります。ただし、メモリトークンという料金項目はありません。Claude API(application programming interface)でメモリを保存しても料金はかかりません。メモリツールはクライアント側で動作し、ファイルは利用者が所有するストレージに保存されるためです。
ただし、メモリは請求額に影響します。記憶された事実は、Claude が読み取るリクエストに含まれている場合にだけ回答へ反映されます。つまり、メモリを利用するたびに、その内容を再送信する必要があります。再送信したテキストは入力トークンとして扱われ、通常の入力料金が適用されます。料金を左右するのは、毎回再送信するメモリのトークン数と、そのテキストをプロンプトキャッシュから提供できるかどうかの 2 点です。
Pro または Max のサブスクリプションでは、トークン単位の請求はありません。そのため、メモリは料金ではなく利用量の上限を消費します。仕組み自体は同じで、変わるのは計算単位だけです。この上限には限りがあるため、各ターンでどの程度のメモリを送るか決める前に、Claude Pro の料金と、制限によって利用できなくなる時点を確認しておくとよいでしょう。Claude Enterprise はさらに異なります。シート料金に加えて、API 料金で各トークンが計量されるため、メモリブロックが大きすぎると、利用量ではなく料金が増えます。メモリを整理して小規模プランの上限を十分下回れるなら、Max から Pro への変更を次に検討できます。変更は、すでに支払った利用期間の終了時に反映されます。Anthropic のプラン同士ではなく、プロバイダー間で比較する場合は、現在の料金で Claude のプランと ChatGPT を比較するところから始めてください。
各 Claude サーフェスで「memory」が意味するもの
3 つの別々の製品が同じ言葉を使っているため、混同しやすい点がこの疑問を複雑にしています。
Claude API の memory tool。 tools 配列に 1 つのエントリを追加し、ファイル操作を独自のコードで実装します。
{"type": "memory_20250818", "name": "memory"}2026 年 8 月時点で、このツールは Claude 4 以降のモデルにおいて、ベータヘッダーなしで Messages API から一般利用できます。これはクライアント側で動作します。Claude が view /memories などの操作を要求し、ハンドラーが管理下のストレージに対してその操作を実行し、結果を tool_result ブロックで返します。Anthropic がファイルを保持することはないため、転嫁されるストレージ料金はありません。料金が発生するのはラウンドトリップです。ツール定義はすべてのリクエストで送信され、返されたファイル内容はその時点以降、会話に残ります。
Anthropic は、このオーバーヘッドの固定部分を公開しています。Claude Opus 5 でツール選択に auto を指定した場合、2026 年 8 月の文書によると、tool-use system prompt は 286 tokens です。memory かどうかに関係なく、ツールが存在するすべてのリクエストで 1 回分の料金が発生します。
Claude Code。 セッション開始時に 2 つの仕組みが読み込まれます。CLAUDE.md ファイルにはユーザーが記述した指示を保存します。Auto memory には Claude が自分用に記述したメモを ~/.claude/projects/<project>/memory/ 配下に保存します。MEMORY.md の先頭 200 行または 25KB のうち、先に達した制限までだけが読み込まれます。隣接するトピックファイルは起動時ではなく、必要に応じて読み込まれます。起動時に読み込まれた内容は、そのセッションで後続するすべてのリクエストが保持するプレフィックスの一部になります。Claude Code がセッション間で memory を呼び出す方法では、ファイルごとの読み込み順序を説明しています。
Web 上の Claude。 claude.ai では、memory はチャット中に Claude が記述・更新するエントリの集合です。プロジェクトごとに別の memory 領域があります。Settings > Memory には保存内容が表示され、そこにあるトグルから Pause memory または Reset memory を選択できます。このサーフェスはサブスクリプションで課金されるため、ここでの memory は利用上限を消費します。
記憶されたテキストが入力トークンとして課金される理由
Messages APIはステートレスです。呼び出しの間で何も保持しないため、クライアントは各ターンで会話全体を送信し、モデルはそのすべてを再度読み取ります。メモリもこのルールの例外ではありません。同じリクエスト内のテキストブロックが1つ増えるだけです。
この内訳は、任意のレスポンスに含まれるusageオブジェクトで確認できます。
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokensには、キャッシュから読み取られず、キャッシュの作成にも使われなかったトークンだけが含まれます。実際には、最後のキャッシュブレークポイントより後のトークンです。リクエストの入力合計はcache_read_input_tokens、cache_creation_input_tokens、input_tokensの合計です。Claudeが3ターン前に開いたメモリファイルは、その後のすべてのターンでこの合計に含まれます。キャッシュされたプレフィックスが有効な間はcache_read_input_tokensに含まれ、キャッシュが有効でない場合はinput_tokensに含まれます。同じテキストでも、料金は大きく異なります。入力トークンと出力トークンでは料金が異なります。メモリが含まれるのは常に入力側です。
これらの数値を自分の利用状況で確認する方法
ブログ記事の数値をそのまま使わないでください。この記事も例外ではありません。自分のメモリブロックを測定します。トークン数の計測は無料で、独自のレート制限があります。そのため、測定に費用はかかりません。
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'結果は { "input_tokens": 14 } のような1つの数値です。メモリの内容を system フィールドに貼り付けた場合と、貼り付けない場合の2回実行します。その差が、毎回のターンでそのメモリにかかるコストです。注意点が2つあります。カウントは推定値です。また、Anthropic がシステム最適化のために追加するトークンは課金されません。実際に使用するモデルを対象に測定してください。Claude 4.7 以降では新しい tokenizer が使われ、同じテキストでもトークン数が約30パーセント増えるためです。
Claude Code 内では、curl を使わずに同じことを確認できます。
/contextでは、メモリファイルを含め、現在読み込まれている内容が表示されます。入力を始める前に、メモリがウィンドウ内で占める割合を確認できます。/memoryでは、CLAUDE.md ファイルが一覧表示され、自動メモリのフォルダーが開きます。/usageでは、セッションの合計値が表示されます。キャッシュの読み取り数と書き込み数も含まれます。- ステータス行にはコンテキストウィンドウの使用量を継続的に表示できます。使用量の増加を発生中に確認できます。
/usage のセッションブロックは次のようになります。
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)最後の行を注意して確認してください。940.0k のキャッシュ読み取り値は、会話とメモリのすべてが、毎回のターンでキャッシュ料金により再送信されていることを示します。1.2k の入力値は、新しく追加された部分だけを示します。Claude Code は公開価格からこの金額をローカルで計算するため、適用される割引は考慮されません。そのため、請求書の金額と異なる場合があります。正確な数値は Claude Console の Usage ページで確認してください。
次に、比較を直接実行します。2つの新しいセッションで同じ最初の質問をします。一方は通常どおりにし、もう一方は自動メモリを無効にします。
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeそれぞれで /context を実行し、memory files の項目を比較します。その差が、作業を始める前の各セッション開始時に、蓄積されたメモリにかかるコストです。Claude Code のトークン使用量の内訳を、この2つの数値と併せて読むと理解が深まります。
100 万トークンあたりのメモリ再利用コストはいくらですか?
プロンプトキャッシュがあるため、同じメモリブロックでもターンによってコストが 10 倍になることがあります。Anthropic はキャッシュ料金を各モデルの基本入力料金に対する倍率として公開しています。そのため、ドル価格が変動してもこの関係は維持されます。
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]キャッシュ読み取りの料金は、基本入力料金の 0.1 倍です。5 分間有効なエントリの書き込みは基本料金の 1.25 倍、1 時間有効なエントリの書き込みは基本料金の 2 倍です。Anthropic は損益分岐点を明確に示しています。5 分間の有効期間ではキャッシュを 1 回読み取った時点で元が取れ、1 時間の有効期間では 2 回読み取った時点で元が取れます。プロンプトキャッシュの損益分岐点は、メモリをどこに配置するか決める前に行う計算です。
これらの倍率を使うと、再利用回数を算術計算に変換できます。次のブロックは、上記で公開されている倍率に基づく計算であり、実際の稼働ワークロードの測定値ではありません。100 ターンのセッションでメモリブロックを 3 通りに使用した場合のコストを、通常の基本入力料金で請求されるトークン数に換算して示します。
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]4,000 トークンのメモリブロックが 100 ターンすべてでキャッシュミスすると、400,000 個の基本料金相当トークンとして請求されます。同じブロックを 5 分間有効なキャッシュに 1 回書き込み、99 回読み取る場合は、44,600 個相当として請求されます。サイズを 4 分の 1 に削減してキャッシュを維持すると、11,150 個相当として請求されます。3 行を通じて機能自体は変わっていません。変わったのは再利用方法だけです。これらは金額ではなく、依然としてトークン数です。トークン数を月額請求額に換算する方法は、モデルの 100 万トークンあたりの料金を 1 回掛けるだけです。その料金は使用するモデルによって決まります。そのため、エージェントを Claude Fable 5 で動かす場合は、まず 公開されている 100 万トークンあたりの料金と適した用途を確認してください。プロバイダーがモデルだけでは決まらず、まだ検討中であれば、Claude の API と ChatGPT で同じジョブを料金比較した結果で、この掛け算の結果がどのように変わるかを確認できます。メモリを多く使うエージェントでは、入力側の料金が大きく影響します。
2 行目では、後続する 99 件のリクエストが、キャッシュエントリの有効期間中に到着すると仮定しています。実際の請求額の多くが想定どおりにならない原因は、この仮定にあります。
休憩後に同じ質問をすると、なぜ料金が高くなるのですか?
キャッシュエントリには有効期間があり、その時間はエントリを作成または読み取ったリクエストから始まります。デフォルトは 5 分です。1 hour オプションでは、上記の 2x write 分の料金がかかります。Claude Code では、サブスクリプション利用時の有効期間は 1 時間ですが、usage credits を使う状態になると 5 分に短縮されます。API key または cloud provider では、デフォルトで 5 分です。ENABLE_PROMPT_CACHING_1H=1 を設定すると、usage credits の利用中も 1 時間の有効期間を維持できます。
そのため、昼休みの間に開いたままにしたセッションで 1 行の質問を入力すると、高額になります。離席中にキャッシュエントリの有効期間が切れるためです。メモリを含むプレフィックス全体が base input rate で再処理され、キャッシュにも再度書き込まれます。料金を決めるのは、停止していた時間の長さです。
推測ではなく、実際に確認できます。Pro、Max、Team、Enterprise のプランでは、/usage の内訳に、直近の使用量の 10 percent 以上を占める動作が表示されます。long context と cache misses も、そこで名前付きで表示されます。API では、静止時間の後の最初のリクエストで cache_creation_input_tokens がプレフィックス全体のサイズまで戻ることを確認してください。
キャッシュをひそかに無効にするもの
キャッシュされるプレフィックスの順序は、tools、system、messages です。あるレベルを変更すると、そのレベルと、それ以降のすべてのレベルが無効になります。tool の定義を編集すると、キャッシュ全体が破棄されます。system prompt を編集すると、system と message のキャッシュが破棄されます。
これは、エージェントの学習に応じて system prompt 内のメモリを書き換える運用で発生する落とし穴です。書き換えるたびに、その後ろにあるすべてのキャッシュ済みコピーが破棄されるため、次のリクエストでは再度すべてを書き込む必要があります。変化しない内容を先頭に置いて維持し、変化しやすい内容は messages リストの後方に置いてください。後方の内容なら、無効化されてもコストを抑えられます。
もう1つ、気付きにくい失敗があります。各モデルには、キャッシュ可能なプレフィックスの最小トークン数があります。2026年8月時点の公開情報では、Claude Opus 5 は 512 トークン、Claude Sonnet 5 は 1,024 トークン、Claude Haiku 4.5 は 4,096 トークンです。Anthropic のドキュメントには、この値を下回った場合の動作が明記されています。「このトークン数未満をキャッシュするリクエストは、キャッシュなしで処理され、エラーは返されません」。したがって、cache_control が付いた小さなメモリファイルは、何もせず、ひそかに無効になります。確認できる症状は、プロンプトに明らかにブレークポイントが含まれているのに、cache_creation_input_tokens が 0 のままになることです。
役割を失ったメモリを削除する
メモリの各行は、その内容を保持するすべてのターンでトークンを消費します。そのため、各行について、最近の回答を変えたかどうかを確認します。Claude Code では上限が明確です。CLAUDE.md は 200 行未満に抑えてください。ファイルが長いほどコンテキストを消費し、Claude がその内容に従う信頼性が低下するためです。MEMORY.md は読み込み時に先頭 200 行または 25KB に制限されます。この上限を超えた内容は、次回のセッション開始時に削除されます。そのため、大きすぎるインデックスはトークンを消費するだけで、何も教えません。
2 つの習慣で、メモリを小さく保てます。詳細をインデックスからトピックファイルへ移します。Claude はそれらを起動時ではなく、必要に応じて読み込みます。ワークフローの指示は CLAUDE.md から skills へ移します。skills は呼び出されたときだけ読み込まれます。frontmatter で始まる既存のメモリファイルについては、version 2.1.214 以降の Claude Code が書き込み時刻を ISO 8601 形式のタイムスタンプとして modified フィールドに記録します。このタイムスタンプを使うと、古くなった事実を最も早く見つけられます。古くなったエージェントメモリの削除では、レビュー手順を詳しく説明しています。
すべてをコンテキストに読み込むより、必要時に取得するほうが有効な場合
memory tool は、必要な時点での取得を支援します。最初にすべてを読み込むのではなく、エージェントが学習した内容を記録し、タスクで必要になった場合にだけファイルを読み戻します。この違いにより計算が変わります。ファイルの読み取りは、そのトークン分のコストが 1 回だけ発生し、その後はキャッシュされたプレフィックス内に保持されます。一方、常時読み込むブロックには、各ターンでコストが発生します。
上の 2 つのグラフから、単純なルールが導けます。ほぼすべてのターンで使うテキストは、安定したキャッシュ済みプレフィックスに含めます。20 回に 1 回使うテキストは、view 呼び出しの背後に置きます。損益分岐点を左右するのはリプレイ回数であり、Anthropic の料金体系ではありません。
API では、プラットフォームに会話のトリミングを任せることもできます。Context editing を使うと、会話が指定したしきい値を超えた時点で、古い tool の結果が削除されます。
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}デフォルトでは、入力トークン数が 100,000、保持する tool 使用回数が 3 です。有効化する前に、キャッシュを使った場合の動作を確認してください。コンテンツを削除すると、その削除位置でキャッシュ済みプレフィックスが無効になるため、次のリクエストでキャッシュ書き込みのコストが発生します。clear_at_least はそのために使用します。書き込みコストを正当化できるほど節約量が大きくなるまで、削除を延期します。context_management の下で、cleared_tool_uses と cleared_input_tokens を含むレスポンスに実際の処理結果が正確に報告されるため、このトレードオフを理論ではなく測定できます。Claude Code でコンテキストウィンドウを管理する でも、コーディングセッションに同じ考え方を適用します。
独立した料金項目があるもの
Memory 自体には料金がかかりませんが、一部の機能には実際に個別料金が設定されています。どの機能が該当するかを把握しておく価値があります。以下は、2026 年 8 月時点で公開されている Claude API の料金です。まったく無料の操作もありますが、Claude API に無料利用枠はありません。登録時に付与される少額のクレジットだけなので、以下の項目はすべて最初のリクエストから実費が発生します。
- Web search: 1,000 回あたり $10。検索結果がコンテキストに追加するすべての内容には、通常のトークン料金もかかります。
- Code execution: 組織ごとに毎月 1,550 時間まで無料です。その後はコンテナ 1 時間あたり $0.05 です。Web search または Web fetch と併用する場合は無料です。
- Claude Managed Agents: セッション実行時間に対して、セッション 1 時間あたり $0.08 が通常のトークン料金に加算されます。
- Web fetch: 追加料金はありません。取得したコンテンツのトークン料金だけがかかります。
Memory は、これらのどの項目にも記載されていません。Memory は入力トークン数に含まれます。ここで使用量を測定でき、pruning と caching によって削減できます。仮想プライベートサーバー (VPS) 上で unattended の agent を運用する予算を見積もる場合は、VPS 上の AI agent のコスト管理を次に整備してください。Memory ファイルが増え続け、pruning も行わない agent は、使用状況を報告する仕組みがなくても毎週コストが増加するためです。
FAQ
Claude のメモリ機能には別途料金がかかりますか?
いいえ。Anthropic の料金表には、100 万入力トークンあたりの料金、100 万出力トークンあたりの料金、プロンプトキャッシュの倍率が記載されていますが、メモリ専用の項目はありません。Claude API ではメモリツールはクライアント側で動作するため、ファイルはすでに料金を支払っているストレージに保存されます。メモリによって増えるのは入力トークンです。メモリの内容を含む各ターンで、モデルの通常の入力料金が適用されます。
メモリを無効にすると Claude は安くなりますか?
各リクエストのトークン数が減るため、リクエストごとの料金は下がります。全体で節約できるかどうかは、その後の処理によって決まります。Claude がメモリに保存されていた内容を再構築するために 3 つのファイルを読み直し、2 つの質問をしなければならない場合、そのトークン料金はメモリの利用による料金を上回る可能性があります。推測せずに測定してください。自動メモリを有効にしたセッションと、CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 で開始したセッションで /context を実行し、同じタスクにかかった合計トークン数を比較します。
何も変更していないのに使用量が増えたのはなぜですか?
最も一般的な原因は、休止後のキャッシュミスです。キャッシュエントリの有効期間はデフォルトで 5 分、拡張設定では 1 時間です。そのため、休止後の最初のリクエストでは、プレフィックス全体が基本入力料金で再処理され、再び書き込まれます。次に多い原因は、プレフィックスの編集です。ツール定義を変更するとキャッシュ全体が無効になり、システムプロンプトを変更するとシステムキャッシュとメッセージキャッシュが無効になります。サブスクリプションプランでは、最近の使用量の 10 パーセント以上を占める場合、/usage の内訳にこの動作が示されます。
メモリはシステムプロンプトに置くべきですか、それともツール呼び出しの背後に置くべきですか?
ほとんどすべてのターンで使用する場合は、システムプロンプトに入れてください。キャッシュされたプレフィックスに含まれるため、キャッシュ読み取り料金が適用されます。一部のタスクだけで必要な場合は、view 呼び出しの背後に置いてください。1 回だけ読み取るファイルであれば、毎ターンではなく 1 回分のトークン料金だけで済みます。判断の基準は再生回数です。usage オブジェクトを使うと、その数を直接確認できます。
メモリ機能はサブスクリプションの使用量上限に算入されますか?
はい、間接的に算入されます。サブスクリプションの上限は、各リクエストに含まれるトークンによって消費されるためです。Anthropic のヘルプドキュメントでは、自動コンテキスト管理が発生する長い会話は、使用量上限をより多く消費すると説明されています。メモリによって各リクエストが少し長くなり、長いセッションではその長さが各ターンで再利用されます。Claude の使用量上限の実際の仕組みでは、何がいつリセットされるかを説明しています。