هل تفرض ذاكرة Claude رسوماً إضافية؟
لا يوجد سعر مستقل لـ memory token في Claude. تُحاسَب الذاكرة عند إعادة إرسالها كـ input tokens، وقد يخفض prompt caching التكلفة وفق حجم النص المُعاد.
هل تكلّف ميزات ذاكرة Claude رسوماً إضافية؟
لا تفرض ميزات ذاكرة Claude رسوماً مستقلة. تنشر Anthropic أسعارها لكل مليون token من الإدخال ولكل مليون token من الإخراج، مع أسعار إضافية لـprompt caching، ولا يُسمّى أيٌّ منها memory token. لا يكلّف تخزين الذاكرة نفسها شيئاً في Claude API (واجهة برمجة التطبيقات)، لأن أداة الذاكرة تعمل من جهة العميل، ويُخزَّن الملف على مساحة تخزين تملكها أنت.
تؤثر الذاكرة في فاتورتك مع ذلك، لأن المعلومة المحفوظة لا تغيّر الإجابة إلا عندما تكون ضمن الطلب الذي يقرأه Claude. تذكّر المعلومة يعني إعادة إرسالها. يصل هذا النص على شكل input tokens، وتُحاسَب عليه وفق سعر الإدخال العادي للنموذج. يحدّد عاملان التكلفة: عدد tokens في النص المحفوظ الذي تعيد إرساله في كل دور، وما إذا كان يمكن تقديم هذا النص المعاد إرساله من prompt cache.
في اشتراك Pro أو Max، لا تُحاسَب لكل token إطلاقاً، لذلك تستهلك الذاكرة حصتك من الاستخدام بدلاً من أموالك. الآلية أدناه متطابقة. الذي يتغير هو وحدة القياس فقط. هذه الحصة محدودة، لذلك من المفيد معرفة تكلفة Claude Pro والنقطة التي تبدأ عندها حدوده بمنعك قبل أن تقرر مقدار الذاكرة التي ينبغي أن يحملها كل دور. يختلف Claude Enterprise مرة أخرى، لأنه يحسب كل token وفق أسعار API إضافة إلى سعر المقعد، لذلك تتحول كتلة الذاكرة الكبيرة إلى تكلفة مالية بدلاً من استهلاك الحصة. إذا أدى تقليص الذاكرة إلى إعادة استخدامك بسهولة إلى ما دون سقف خطة أصغر، فإن الانتقال من Max إلى Pro هو الخطوة التالية المناسبة، ويُطبَّق التغيير في نهاية الفترة التي دفعت تكلفتها مسبقاً. وإذا كانت المقارنة التي تجريها بين مزودين مختلفين لا بين مستويات Anthropic نفسها، فابدأ من مقارنة خطط Claude بخطط ChatGPT وفق الأسعار الحالية.
ما المقصود بـ"الذاكرة" في كل واجهة من واجهات Claude
تشترك ثلاثة منتجات منفصلة في استخدام الكلمة نفسها، والخلط بينها هو السبب الرئيسي وراء غموض هذا السؤال.
أداة الذاكرة في Claude API. تضيف إدخالاً واحداً إلى مصفوفة tools وتنفّذ عمليات الملفات في التعليمات البرمجية الخاصة بك.
{"type": "memory_20250818", "name": "memory"}اعتباراً من August 2026، أصبحت هذه الأداة متاحة عموماً في Messages API من دون ترويسة beta، وعلى نماذج Claude 4 والإصدارات الأحدث. تعمل الأداة من جهة العميل: يطلب Claude عملية مثل view /memories، ثم يشغّل المعالج الخاص بك هذه العملية على وحدة التخزين التي تتحكم بها، وتعيد النتيجة في كتلة tool_result. لا تحتفظ Anthropic بالملف، لذلك لا توجد رسوم تخزين تُحمّل عليك. تدفع بدلاً من ذلك مقابل دورة الطلب والاستجابة. يُرسل تعريف الأداة في كل طلب، ويبقى محتوى الملف الذي يعود في المحادثة منذ تلك النقطة.
تنشر Anthropic الجزء الثابت من هذه التكلفة الإضافية. في Claude Opus 5، عند استخدام اختيار أداة بقيمة auto، تكون مطالبة نظام استخدام الأداة مكوّنة من 286 رمزاً، وفقاً للتوثيق الصادر في August 2026. تُحتسب هذه التكلفة مرة واحدة لكل طلب عند وجود أي أداة، سواء كانت أداة ذاكرة أم غير ذلك.
Claude Code. تُحمَّل آليتان عند بدء كل جلسة. تحتوي ملفات CLAUDE.md على التعليمات التي تكتبها. وتحتوي الذاكرة التلقائية على ملاحظات يكتبها Claude لنفسه ضمن ~/.claude/projects/<project>/memory/. لا يُحمَّل سوى أول 200 سطر أو 25KB من MEMORY.md، أيهما يصل إلى الحد أولاً، بينما تُقرأ ملفات الموضوع الموجودة بجانبه عند الطلب بدلاً من تحميلها عند بدء التشغيل. يصبح كل ما يُحمَّل عند بدء التشغيل جزءاً من البادئة التي يحملها كل طلب لاحق في تلك الجلسة. يوضّح كيف يستعيد Claude Code الذاكرة بين الجلسات ترتيب التحميل ملفاً بعد ملف.
Claude على الويب. في claude.ai، تكون الذاكرة مجموعة من الإدخالات التي يكتبها Claude ويحدّثها أثناء الدردشة، مع مساحة ذاكرة منفصلة لكل مشروع. تعرض Settings > Memory العناصر المخزنة، ويوفّر المفتاح هناك الخيارين Pause memory وReset memory. تُحتسب تكلفة هذه الواجهة عبر الاشتراك، لذلك تستهلك الذاكرة هنا حدود الاستخدام.
لماذا تُحتسب النصوص المتذكَّرة ضمن رموز الإدخال
واجهة Messages API عديمة الحالة. فهي لا تحتفظ بأي شيء بين الاستدعاءات، لذلك يرسل عميلك المحادثة كاملة في كل دور، ويعيد النموذج قراءتها بالكامل. لا تُستثنى الذاكرة من هذه القاعدة. فهي كتلة نصية إضافية ضمن الطلب نفسه.
يظهر هذا التقسيم في الكائن usage ضمن أي استجابة.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}يحصي input_tokens الرموز التي لم تُقرأ من ذاكرة التخزين المؤقت ولم تُستخدم لإنشائها فقط. وهذا يعني عملياً الرموز التي تأتي بعد آخر نقطة تخزين مؤقت. إجمالي الإدخال للطلب هو cache_read_input_tokens مضافاً إليه cache_creation_input_tokens وinput_tokens. يبقى ملف ذاكرة فتحه Claude قبل 3 أدوار ضمن هذا الإجمالي في كل دور تالٍ. ويُحتسب ضمن cache_read_input_tokens ما دام الجزء الأول المخزّن مؤقتاً صالحاً، وضمن input_tokens عندما لا يكون صالحاً. النص نفسه، لكن بسعرين مختلفين جداً. تُحتسب أسعار مختلفة لرموز الإدخال والإخراج، والذاكرة لا تُحتسب إلا ضمن جانب الإدخال.
أين ترى هذه الأرقام في استخدامك الفعلي
لا تعتمد على رقم وارد في تدوينة، بما في ذلك هذه التدوينة. قِس كتلة الذاكرة الخاصة بك. احتساب الرموز مجاني وله حد معدل مستقل، لذلك لا تكلّفك عملية القياس شيئاً.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'الاستجابة عبارة عن رقم واحد، مثل { "input_tokens": 14 }. شغّل الأمر مرة بعد لصق نص الذاكرة في الحقل system، ومرة من دونه. الفرق بين النتيجتين هو تكلفة تلك الذاكرة عليك في كل دورة. انتبه إلى أمرين. العدد تقديري، والرموز الإضافية التي تضيفها Anthropic لتحسينات النظام الخاصة بها لا تُحتسب عليك. احسب أيضاً وفق النموذج الذي ستشغّله فعلياً، لأن Claude 4.7 والإصدارات الأحدث تستخدم محلل رموز أحدث ينتج رموزاً أكثر بنحو 30 بالمئة للنص نفسه.
داخل Claude Code، تحصل على الإجابة نفسها من دون استخدام curl إطلاقاً.
- يعرض
/contextما هو محمّل حالياً، بما في ذلك ملفات الذاكرة، لكي ترى حصتها من نافذة السياق قبل أن تكتب أي شيء. - يسرد
/memoryملفات CLAUDE.md ويفتح مجلد الذاكرة التلقائية. - يطبع
/usageإجماليات الجلسة، ومن بينها عمليات قراءة ذاكرة التخزين المؤقت وكتابتها. - يمكن لسطر الحالة عرض استخدام نافذة السياق باستمرار، لذلك يمكنك رؤية نموه أثناء حدوثه.
تبدو كتلة الجلسة /usage كما يلي:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)اقرأ السطر الأخير بعناية. يمثل رقم قراءة ذاكرة التخزين المؤقت البالغ 940.0k المحادثة والذاكرة وكل ما سبق، وهي تُرسل مجدداً في كل دورة وفق سعر ذاكرة التخزين المؤقت. أما رقم الإدخال البالغ 1.2k، فيمثل الجزء الجديد فقط. يحسب Claude Code هذا المبلغ بالدولار محلياً وفق أسعار القائمة، لذلك لا يراعي أي خصم لديك وقد يختلف عن فاتورتك. وتُعد صفحة Usage في Claude Console الرقم المعتمد.
بعد ذلك، شغّل المقارنة مباشرة. اطرح سؤال البداية نفسه في جلستين جديدتين، إحداهما عادية والأخرى مع إيقاف تشغيل الذاكرة التلقائية.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeشغّل /context في كل جلسة، وقارن قيمة إدخال ملفات الذاكرة. الفارق هو تكلفة الذاكرة المتراكمة لديك عند بدء كل جلسة، قبل تنفيذ أي عمل. يجدر بك قراءة تفصيل كامل لمواضع استخدام رموز Claude Code إلى جانب هذين الرقمين.
ما تكلفة إعادة تشغيل الذاكرة لكل مليون token؟
يُعدّ التخزين المؤقت للمطالبة السبب في أن كتلة الذاكرة نفسها قد تكلّف عشرة أضعاف تكلفتها في دور مقارنة بدور آخر. تنشر Anthropic أسعار التخزين المؤقت كمضاعفات لسعر الإدخال الأساسي لكل نموذج، لذلك تظل العلاقة نفسها حتى عند تغيّر الأسعار بالدولار.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]تكلّف قراءة من التخزين المؤقت 0.1 ضعف سعر الإدخال الأساسي. وتكلّف كتابة إدخال بعمر 5 دقائق 1.25 ضعف السعر الأساسي، بينما تكلّف الكتابة بعمر ساعة واحدة 2 ضعف السعر الأساسي. توضّح Anthropic نقطة التعادل مباشرة: يصبح التخزين المؤقت مجدياً بعد قراءة واحدة من التخزين المؤقت عند مدة 5 دقائق، أو بعد قراءتين من التخزين المؤقت عند مدة ساعة واحدة. نقطة التعادل في التخزين المؤقت للمطالبة هي الحساب الذي يجب إجراؤه قبل أن تقرر مكان وضع الذاكرة.
تحوّل هذه المضاعفات عدد مرات إعادة التشغيل إلى عملية حسابية. الكتلة التالية هي حساب مبني على المضاعفات المنشورة أعلاه، وليست قياساً لأي حمل عمل فعلي. وهي تسعّر كتلة ذاكرة بثلاث طرق خلال جلسة من 100 دور، مع التعبير عن النتيجة بعدد مكافئ من token المحتسبة بسعر الإدخال الأساسي العادي.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]تُحتسب كتلة ذاكرة من 4,000 token، تفشل في الوصول إلى التخزين المؤقت في جميع الأدوار وعددها 100، كما لو كانت 400,000 token بسعر الأساس. وتُحتسب الكتلة نفسها عند وضعها خلف كتابة واحدة في تخزين مؤقت بعمر 5 دقائق و99 قراءة من التخزين المؤقت كما لو كانت 44,600. وإذا قلّصتها إلى ربع حجمها مع الإبقاء على التخزين المؤقت، فستُحتسب كما لو كانت 11,150. لم تتغير الميزة عبر هذه الصفوف وعددها 3. الذي تغيّر فقط هو سلوك إعادة التشغيل. وما زالت هذه أعداد token وليست مبالغ مالية، وتحويل عدد token إلى مبلغ في فاتورتك الشهرية يتطلب عملية ضرب واحدة في سعر النموذج لكل مليون token. يحدّد النموذج الذي تشغّله هذا السعر، لذلك إذا كان الوكيل سيعمل على Claude Fable 5، فابدأ من الأسعار المنشورة له لكل مليون token والأعمال التي يناسبها. وإذا كان المزوّد لا يزال موضع سؤال، وليس النموذج وحده، فإن تسعير المهام نفسها على API الخاصة بـClaude وعلى ChatGPT يوضّح اختلاف نتيجة عملية الضرب هذه، ويعتمد الوكيل الذي يستهلك ذاكرة بكثافة بدرجة كبيرة على جانب الإدخال منها.
يفترض الصف الثاني أن كل طلب من الطلبات اللاحقة وعددها 99 يصل بينما لا يزال إدخال التخزين المؤقت صالحاً. وهذا الافتراض هو سبب معظم الأخطاء في الفواتير الفعلية.
لماذا تصبح تكلفة السؤال نفسه أعلى بعد فترة انقطاع؟
لكل إدخال في الذاكرة المؤقتة مدة صلاحية، ويبدأ احتسابها عند الطلب الذي يكتب الإدخال أو يقرأه. المدة الافتراضية هي 5 دقائق. أما خيار الساعة الواحدة، فتبلغ تكلفته ضعف تكلفة الكتابة الموضحة أعلاه. في Claude Code، تكون مدة الصلاحية ساعة واحدة ضمن الاشتراك، وتنخفض إلى 5 دقائق عند استخدام أرصدة الاستخدام؛ أما عند استخدام مفتاح API أو موفّر سحابي، فالمدة الافتراضية هي 5 دقائق. يؤدي ضبط ENABLE_PROMPT_CACHING_1H=1 إلى إبقاء مدة الصلاحية ساعة واحدة عند استخدام أرصدة الاستخدام.
لذلك، إذا كتبت سؤالاً من سطر واحد في جلسة تركتها مفتوحة أثناء الغداء، فستكون التكلفة مرتفعة لأن إدخال الذاكرة المؤقتة انتهت صلاحيته أثناء غيابك. تُعالج البادئة كاملة، بما في ذلك الذاكرة، مرة أخرى وفق معدل الإدخال الأساسي، ثم تُكتب مجدداً في الذاكرة المؤقتة. مدة التوقف هي التي تحدد هذه التكلفة.
يمكنك التحقق من ذلك بدلاً من الاعتماد على التقدير. في خطط Pro أو Max أو Team أو Enterprise، يعرض تفصيل /usage أي سلوك مسؤول عن 10 بالمئة أو أكثر من الاستخدام الأخير، ويظهر كل من السياق الطويل وإخفاقات الذاكرة المؤقتة بالاسم. في API، راقب cache_creation_input_tokens؛ إذ يقفز مجدداً إلى الحجم الكامل للبادئة في أول طلب بعد فترة من عدم النشاط.
ما الذي يبطل ذاكرة التخزين المؤقت بصمت
تُرتَّب البادئة المخزنة مؤقتاً بهذا التسلسل: الأدوات، ثم النظام، ثم الرسائل. يؤدي التغيير في مستوى واحد إلى إبطال ذاكرة ذلك المستوى وكل ما يليه. يؤدي تعديل تعريف أداة إلى التخلص من ذاكرة التخزين المؤقت بأكملها. ويؤدي تعديل موجه النظام إلى التخلص من ذاكرة النظام والرسائل.
هذا هو الفخ الذي يواجه كل من يحتفظ بالذاكرة في موجه النظام ويعيد كتابتها كلما تعلم الوكيل شيئاً جديداً. كل إعادة كتابة تتخلص من النسخة المخزنة مؤقتاً لكل ما يليها، لذلك يدفع الطلب التالي تكلفة كتابة كاملة من جديد. أبقِ المحتوى المستقر في المقدمة وحافظ على ثباته، وضع المحتوى المتغير في موضع متأخر من قائمة الرسائل، حيث يكون إبطاله أقل تكلفة.
يوجد فشل ثانٍ أكثر هدوءاً. يفرض كل نموذج حداً أدنى للبادئة التي يمكن تخزينها مؤقتاً: 512 رمزاً في Claude Opus 5، و1,024 في Claude Sonnet 5، و4,096 في Claude Haiku 4.5، وفق ما نُشر في August 2026. توضّح وثائق Anthropic ما يحدث عند النزول عن هذا الحد: "تُعالَج أي طلبات تهدف إلى تخزين عدد من الرموز يقل عن هذا الحد من دون تخزين مؤقت، ولا يُرجع أي خطأ." لذلك لا يفعل ملف ذاكرة صغير يحمل cache_control أي شيء إطلاقاً، من دون إصدار تنبيه. والعلامة التي يمكنك رؤيتها هي بقاء cache_creation_input_tokens عند 0، رغم أن موجهك يحتوي بوضوح على نقطة كسر.
تنقية الذاكرة التي لم تعد تستحق مكانها
تستهلك كل سطر من الذاكرة رموزاً في كل دورة تحمله، لذلك يتمثل السؤال بشأن كل سطر في معرفة ما إذا كان قد غيّر إجابة مؤخراً. يجعل Claude Code الحدود واضحة. احرص على إبقاء ملف CLAUDE.md بأقل من 200 سطر، لأن الملفات الأطول تستهلك مزيداً من السياق وتقلل مدى موثوقية اتباع Claude لتعليماتها. يقتصر MEMORY.md عند التحميل على أول 200 سطر أو 25KB، وأي محتوى يتجاوز هذا الحد يُحذف عند بدء الجلسة التالية، ولذلك فإن الفهرس الكبير يستهلك رموزاً من دون أن يضيف معرفة.
تساعد عادتان في إبقاء الملف صغيراً. انقل التفاصيل من الفهرس إلى ملفات الموضوعات، التي يقرأها Claude عند الطلب بدلاً من قراءتها عند بدء التشغيل. وانقل تعليمات سير العمل من CLAUDE.md إلى skills، التي لا تُحمّل إلا عند استدعائها. بالنسبة إلى ملفات الذاكرة التي تبدأ مسبقاً بـfrontmatter، يسجّل Claude Code وقت الكتابة في الحقل modified بوصفه طابعاً زمنياً وفق ISO 8601، وذلك في الإصدار 2.1.214 أو الإصدارات الأحدث. وهذا الطابع الزمني هو أسرع طريقة لاكتشاف حقيقة أصبحت قديمة. يتناول تنقية ذاكرة الوكيل القديمة عملية المراجعة بمزيد من التفصيل.
متى يكون الاسترجاع أفضل من تحميل كل شيء في السياق
توجد أداة الذاكرة لدعم الاسترجاع في الوقت المناسب. بدلاً من تحميل كل شيء مسبقاً، يسجّل الوكيل ما يتعلمه ويقرأ الملف مجدداً فقط عندما تحتاج المهمة إليه. يغيّر ذلك الحسابات، لأن قراءة الملف تستهلك رموزه مرة واحدة ثم تبقى داخل البادئة المخزّنة مؤقتاً، بينما تستهلك الكتلة المحمّلة دائماً رموزاً في كل دور.
تنتج عن المخططين أعلاه قاعدة بسيطة. ينتمي النص الذي تستخدمه في كل دور تقريباً إلى البادئة المستقرة المخزّنة مؤقتاً. أما النص الذي تستخدمه مرة واحدة كل عشرين دوراً، فينبغي وضعه خلف استدعاء view. تتغير نقطة التعادل وفق عدد مرات إعادة التشغيل لديك، وليس وفق أي رسوم تفرضها Anthropic.
يمكنك أيضاً أن تتيح للمنصة تقليص المحادثة عبر API. يمسح تحرير السياق نتائج الأدوات القديمة عندما تتجاوز المحادثة حداً تحدده.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}القيم الافتراضية هي تشغيل العملية عند 100,000 رمز إدخال، مع الاحتفاظ باستخدامات 3 أدوات. اقرأ التفاعل مع التخزين المؤقت قبل تفعيله: إذ يؤدي مسح المحتوى إلى إبطال البادئة المخزّنة مؤقتاً عند موضع المسح، ولذلك تدفع تكلفة كتابة ذاكرة التخزين المؤقت في الطلب التالي. هذا هو الغرض من clear_at_least. فهو يؤخر المسح حتى يصبح التوفير كبيراً بما يكفي لتبرير عملية الكتابة. وتعرض الاستجابة ما حدث بالضبط ضمن context_management، مع cleared_tool_uses وcleared_input_tokens، ولذلك يمكن قياس المقايضة بدلاً من التعامل معها نظرياً. يطبّق إدارة نافذة السياق في Claude Code الفكرة نفسها على جلسة برمجية.
ما الذي يُحتسب كبند مستقل
لا تُفرض رسوم مستقلة على الذاكرة، لكن بعض الميزات تُحتسب فعلاً بهذه الطريقة، ومن المفيد معرفة أيّها. هذه هي أسعار Claude API المنشورة اعتباراً من August 2026. بعض العمليات لا تكلّف شيئاً إطلاقاً، لكن لا توجد فئة مجانية في Claude API، بل يوجد رصيد صغير عند التسجيل فقط. لذلك، كل ما يلي هو إنفاق فعلي يبدأ من أول طلب.
- البحث على الويب: $10 لكل 1,000 عملية بحث، إضافة إلى تكلفة الرموز المعتادة لكل ما يضعه البحث في السياق.
- تنفيذ التعليمات البرمجية: 1,550 ساعة مجانية لكل مؤسسة شهرياً، ثم $0.05 لكل ساعة لكل حاوية. ويكون مجانياً عند استخدامه إلى جانب البحث على الويب أو جلب محتوى الويب.
- Claude Managed Agents: وقت تشغيل الجلسة بسعر $0.08 لكل ساعة جلسة، إضافة إلى رسوم الرموز المعتادة.
- جلب محتوى الويب: لا توجد رسوم إضافية، وتُحتسب فقط تكلفة رموز المحتوى الذي جرى جلبه.
لا تظهر الذاكرة في أي من هذه البنود. بل تظهر ضمن عدد رموز الإدخال، وهو الموضع الذي يمكنك فيه قياسها تحديداً، كما يمكن فيه تقليلها من خلال الحذف المؤتمت والتخزين المؤقت. إذا كنت تضع ميزانية لوكيل يعمل دون مراقبة على خادم خاص افتراضي (VPS)، فإن ضوابط تكلفة وكيل الذكاء الاصطناعي على VPS هي الخطوة التالية التي ينبغي تنفيذها، لأن الوكيل الذي يملك ملف ذاكرة متنامياً ولا يطبّق الحذف المؤتمت يصبح أكثر تكلفة كل أسبوع من دون أن يرصد أحد ذلك.
FAQ
هل توجد رسوم منفصلة على ميزات ذاكرة Claude؟
لا. تتضمن قائمة أسعار Anthropic أسعاراً لكل مليون رمز إدخال، ولكل مليون رمز إخراج، ومعاملات التخزين المؤقت للمطالبات، ولا تتضمن بنداً خاصاً بالذاكرة. في Claude API، تعمل أداة الذاكرة من جهة العميل، لذلك تُخزَّن الملفات في مساحة تخزين تدفع تكلفتها مسبقاً. ما تضيفه الذاكرة هو رموز الإدخال، التي تُحاسَب بسعر الإدخال المعتاد للنموذج في كل دورة تُرسَل فيها هذه الرموز.
هل يؤدي إيقاف الذاكرة إلى جعل Claude أقل تكلفة؟
يؤدي ذلك إلى خفض عدد الرموز في كل طلب، مما يخفض تكلفة كل طلب. لكن مدى خفض التكلفة الإجمالية يعتمد على ما يحدث بعد ذلك. إذا اضطر Claude إلى إعادة قراءة 3 ملفات وطرح سؤالين عليك لإعادة بناء المعلومات التي كانت الذاكرة تحتفظ بها، فقد تتجاوز تكلفة هذه الرموز تكلفة الذاكرة. قِس ذلك بدلاً من التخمين: شغّل /context في جلسة تكون فيها الذاكرة التلقائية مفعّلة، وفي جلسة بدأت باستخدام CLAUDE_CODE_DISABLE_AUTO_MEMORY=1، ثم قارن إجمالي الرموز المستهلكة للمهمة نفسها.
لماذا زاد استهلاكي رغم أنني لم أغيّر شيئاً؟
السبب الأكثر شيوعاً هو فشل إصابة ذاكرة التخزين المؤقت بعد توقف مؤقت. تبقى إدخالات ذاكرة التخزين المؤقت لمدة 5 دقائق افتراضياً، أو لمدة ساعة واحدة عند استخدام الإعداد الموسّع. لذلك يعيد أول طلب بعد التوقف معالجة البادئة الكاملة بسعر الإدخال الأساسي، ثم يكتبها من جديد. السبب الشائع الثاني هو تعديل البادئة: يؤدي تغيير تعريف أداة إلى إبطال ذاكرة التخزين المؤقت بالكامل، بينما يؤدي تغيير مطالبة النظام إلى إبطال ذاكرة تخزين النظام والرسائل مؤقتاً. في خطة الاشتراك، يوضح تفصيل /usage هذا السلوك عندما يمثل 10 بالمئة أو أكثر من الاستخدام الأخير.
هل ينبغي أن تكون الذاكرة في مطالبة النظام أم خلف استدعاء أداة؟
ضعها في مطالبة النظام عندما تستخدمها معظم الدورات، لأنها تبقى عندئذٍ في البادئة المخزنة مؤقتاً وتُحاسَب بسعر قراءة ذاكرة التخزين المؤقت. ضعها خلف استدعاء view عندما تحتاج إليها بعض المهام فقط، لأن قراءة ملف مرة واحدة تفرض تكلفة رموزه مرة واحدة، بدلاً من فرضها في كل دورة. العدد الحاسم هو عدد مرات إعادة التشغيل لديك، ويعرض لك الكائن usage هذا العدد مباشرةً.
هل تُحتسب ميزات الذاكرة ضمن حدود استخدام الاشتراك؟
نعم، بصورة غير مباشرة، لأن حدود الاشتراك تُستهلك وفق الرموز التي يحملها كل طلب. توضح وثائق مساعدة Anthropic أن المحادثات الأطول التي تؤدي إلى تشغيل إدارة السياق التلقائية تستهلك جزءاً أكبر من حد الاستخدام. تجعل الذاكرة كل طلب أطول قليلاً، وتعيد الجلسة الطويلة إرسال هذا الطول في كل دورة. يوضح كيفية عمل حدود استخدام Claude فعلياً ما الذي يُعاد ضبطه ومتى.