SSD Nodes Learn 🎉 VPS من $4.99/شهر
الأدلة Matt Connorبقلم Matt Connor

لماذا Claude مكلف؟ حساب تكلفة الرموز

تكلفة رموز الإخراج خمسة أضعاف الإدخال، وكل دور يعيد إرسال السياق كاملاً. شاهد حساب جلسة حقيقية وأربعة عوامل تقلل فاتورتك.

لماذا يُعد Claude مكلفاً؟ الإجابة المختصرة

يُعد Claude مكلفاً لأربعة أسباب تتراكم معاً. تُسعَّر رموز الإخراج بمعدل يعادل خمسة أضعاف معدل رموز الإدخال. لا تحتفظ واجهة API بذاكرة للمحادثة، لذلك يُرسل السجل الكامل مرة أخرى وتُحتسب تكلفته مرة أخرى مع كل دور. يحوّل الوكيل سؤالاً واحداً إلى عشرات من استدعاءات API، ويحمل كل استدعاء ذلك السجل المتزايد. وفوق ذلك كله، تُسعَّر واجهة النموذج المتقدمة وفقاً لصعوبة العمل الذي تنفذه، لا وفقاً لتكلفة تشغيل نموذج صغير.

الرمز هو جزء من النص. كقاعدة تقريبية، يعادل الرمز الواحد نحو أربعة أحرف، أو نحو 0.75 كلمة باللغة الإنجليزية. تُعرض الأسعار لكل مليون رمز، ويُرمز إليها بـ MTok (مليون رمز). كل سعر أدناه هو السعر المنشور لواجهة Claude API في أغسطس 2026.

تأتي معظم الفواتير المفاجئة من السببين الثاني والثالث في تلك القائمة. يعتقد الناس عادةً أن الإجابات التي يكتبها Claude هي ما يكلّف المال. لكن في جلسة الوكيل، غالباً ما يشكل الإخراج الكتابي أقل من عُشر قيمة الفاتورة.

الأسعار المنشورة، حتى نتفق على الأرقام

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

انظر إلى النمط بدلاً من الأرقام المطلقة. يفرض كل نموذج سعراً أعلى بخمس مرات تماماً على المخرجات مقارنة بالمدخلات. تبلغ تكلفة Opus 5 5 دولاراً لكل مليون رمز إدخال، و25 دولاراً لكل مليون رمز إخراج. وتبلغ تكلفة Haiku 4.5 1 و5. لذلك، فإن الفارق بين النموذج الأرخص والأغلى يبلغ خمسة أضعاف، كما أن الفارق بين القراءة والكتابة يبلغ خمسة أضعاف أيضاً.

يُطرح Sonnet 5 بسعر تمهيدي قدره 2 و10 دولاراً لكل مليون رمز حتى 31 أغسطس 2026. واعتباراً من 1 سبتمبر 2026، ينتقل إلى 3 و15. تتغير الأسعار مع إصدارات النماذج، لذا تحقّق من الأسعار الحالية قبل إعداد ميزانية تستند إليها.

العمود الأخير هو سعر قراءة ذاكرة التخزين المؤقت. وهو العامل الذي يحدد معظم الفواتير. عُد إليه بعد إجراء الحسابات.

لماذا تكلّف رموز الإخراج خمسة أضعاف رموز الإدخال؟

لا تتطلب القراءة والكتابة القدر نفسه من العمل. تُعالَج رموز الإدخال في مرور واحد. يقرأ النموذج الموجّه بالكامل دفعة واحدة، ويجري العمل عليه بالتوازي. لذلك لا تستغرق قراءة موجّه من 60,000 رمز مدة أطول بـ60,000 مرة من قراءة موجّه من 1,000 رمز.

تُنتَج رموز الإخراج واحداً تلو الآخر. يحتاج كل رمز جديد إلى مرور مستقل عبر النموذج، ويحتاج إلى كل الرموز السابقة له كسياق. تعني كتابة 1,000 رمز إجراء 1,000 مرور، واحداً بعد الآخر. لا يمكن توزيع هذا العمل المتسلسل بالطريقة التي يمكن بها توزيع القراءة، لذلك يشغل كل رمز إخراج العتاد مدة أطول.

لهذا السبب، فإن طلب «اجعل الإجابة أقصر» أقل تأثيراً مما يتوقع كثيرون. فهو يؤثر في النصف الأصغر من تكلفة تشغيل الوكيل.

لماذا تُحتسب تكلفة محادثتي كاملة مرة أخرى في كل دور؟

واجهة Claude API عديمة الحالة. لا توجد محادثة محفوظة لدى Anthropic تُضاف إليها رسالة واحدة. يحمل كل طلب سجل الرسائل بالكامل، ويقرأ النموذج كل هذا السجل قبل أن يكتب أي شيء. لذلك تُحتسب تكلفة الدور 30 على أساس الأدوار من 1 إلى 29 أيضاً.

هذا يعني أن تكلفة المحادثة تزداد بمعدل أسرع من طولها. يُحتسب في الدور 1 سياق صغير. أما الدور 40 فيُحتسب فيه سياق كبير. وعند جمع تكلفة الأدوار الأربعين، تكون قد دفعت مقابل عدد من الرموز يفوق بكثير عدد الرموز التي كُتبت فعلياً.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

تبدأ الجلسة أعلاه عند 20,000 من الرموز، وهي تتضمن مطالبة النظام، وتعريفات الأدوات، والملفات الأولى التي فتحها الوكيل. وبحلول الدور 40، يحتوي السياق على 100,000 من الرموز. وعند حساب المتوسط عبر الأدوار الأربعين، تحصل على نحو 60,000 رمز تتم قراءته في كل طلب.

لماذا يكلّف الوكيل أكثر بكثير من المحادثة؟

المحادثة هي طلب واحد لكل سؤال. أما الوكيل فيُصدر طلباً واحداً لكل خطوة. قراءة ملف خطوة. تشغيل اختبار خطوة. قراءة مخرجات الاختبار خطوة. تعديل الملف خطوة. إنجاز مهمة واحدة عبر أربعين خطوة أمر معتاد لدى وكيل البرمجة.

ترافق استخدام الأدوات تكلفتان إضافيتان. تُحتسب تعريفات الأدوات ضمن رموز الإدخال في كل طلب، لأن النموذج يجب أن يعرف الأدوات المتاحة في كل مرة. تنشر Anthropic هذه التكلفة الإضافية: تبلغ مطالبة النظام الخاصة باستخدام الأدوات 286 رمزاً على Opus 5 عند ضبط tool_choice على auto، إضافة إلى رموز مخططات أدواتك الخاصة. تفرض بعض الأدوات من جهة الخادم رسوماً منفصلة أيضاً. وتُحاسب خدمة البحث على الويب بمبلغ $10 لكل 1,000 عملية بحث، إضافة إلى الرموز التي تستهلكها النتائج.

تُصبح كل نتيجة أداة جزءاً دائماً من السياق. فإذا طبع أمر 3,000 سطر، تُضاف هذه الأسطر إلى كل طلب لاحق طوال بقية الجلسة. ويجعل استخدام الرموز لكل جلسة الذي يعرضه Claude Code ذلك واضحاً: راقب ارتفاع رقم الإدخال مباشرة بعد تشغيل أمر كثير المخرجات.

الحساب في جلسة فعلية واحدة

إليك ساعة واقعية من البرمجة الوكيلة باستخدام Opus 5. أُجريت أربعون طلباً إلى API. نما السياق من 20,000 إلى 100,000 رمز، ولذلك بلغ المتوسط نحو 60,000 رمز لكل طلب. كتب النموذج نحو 700 رمز لكل طلب، وكانت هذه الرموز مزيجاً من استدعاءات أدوات قصيرة وبعض الكتل البرمجية الأطول.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

انظر إلى التقسيم. بلغت تكلفة القراءة 12.00 دولاراً، وبلغت تكلفة الكتابة 0.70 دولاراً، ولذلك لا تمثل المخرجات التي قرأتها فعلياً سوى نحو خمسة بالمئة من الفاتورة. كتب النموذج 28,000 رمزاً، واحتُسبت تكلفة قراءة 2,400,000 رمزاً. لم يكتب أحد 2.4 مليون رمز. لقد قُرئت الرموز نفسها البالغ عددها 100,000 مرة بعد أخرى.

الرافعة 1: التخزين المؤقت للمطالبات، وهي الأكبر

يخزّن التخزين المؤقت للمطالبات الصيغة المعالَجة لبادئة ثابتة من مطالبتك. في الطلب التالي، تُقرأ هذه البادئة من ذاكرة التخزين المؤقت بدلاً من معالجتها مرة أخرى. تبلغ تكلفة الكتابة إلى ذاكرة التخزين المؤقت 1.25 ضعف سعر الإدخال لذاكرة التخزين المؤقت لمدة خمس دقائق، أو 2 ضعف السعر لذاكرة التخزين المؤقت لمدة ساعة واحدة. وتبلغ تكلفة القراءة منها 0.1 ضعف سعر الإدخال. في Opus 5، تبلغ التكلفة 0.50 دولاراً لكل مليون، بدلاً من 5 دولاراً.

طبّق ذلك على الجلسة السابقة. تتم كتابة كل رمز من الرموز البالغ عددها 100,000 إلى ذاكرة التخزين المؤقت مرة واحدة مع نمو المحادثة. أما رموز الإدخال البالغ عددها 2,300,000 المتبقية، فتصبح قراءات من ذاكرة التخزين المؤقت.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

حدّد الجزء القابل للتخزين المؤقت باستخدام حقل cache_control. ضع نقطة التوقف بعد المحتوى الذي لا يتغير بين الأدوار: مطالبة النظام وتعريفات الأدوات. وينبغي أن تضع المستند الطويل الذي تواصل الرجوع إليه في الكتلة الثابتة نفسها.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

يحدد ترتيب مطالبتك الآن التكلفة. يحتاج نجاح القراءة من ذاكرة التخزين المؤقت إلى تطابق تام بدءاً من أول المطالبة، لذلك يجب وضع كل ما يتغير في كل طلب بعد كل ما لا يتغير. إذا وضعت طابعاً زمنياً في أعلى مطالبة النظام، فسوف تكسر ذاكرة التخزين المؤقت في كل دور؛ إذ تصبح البادئة بأكملها غير مطابقة، وتدفع 1.25 ضعف سعر الإدخال لكتابتها مرة أخرى.

توضح الاستجابة ما إذا نجح ذلك. أرسل طلباً واقرأ كتلة الاستخدام.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

تتضمن كل استجابة كائناً من usage مثل هذا:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

إذا ظل الطلب المتكرر يعرض 0 في cache_read_input_tokens، فهذا يعني أن القراءة من ذاكرة التخزين المؤقت لا تحدث. والسبب المعتاد هو أن شيئاً ما قبل نقطة التوقف قد تغيّر. كما تنتهي صلاحية ذاكرة التخزين المؤقت لمدة خمس دقائق، لذلك يكون الطلب المرسل بعد ست دقائق غير مطابق، ثم تُجرى كتابة جديدة.

الرافعة 2: وجّه المهام السهلة إلى نموذج أصغر

معظم الأدوار في جلسة الوكيل ليست صعبة. فتح ملف، أو تشغيل أداة تنسيق، أو قراءة فرق التغييرات. لا تحتاج هذه المهام إلى النموذج المتقدم. يؤدي توجيهها إلى Haiku 4.5 إلى خفض معدل الإدخال من 5 دولاراً لكل مليون إلى 1.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

تكلّف الجلسة نفسها 12.70 دولاراً على Opus 5 من دون التخزين المؤقت، و2.48 مع التخزين المؤقت، و0.99 على Sonnet 5 مع التخزين المؤقت، و0.50 على Haiku 4.5 مع التخزين المؤقت. يزيل التخزين المؤقت وحده نحو ثمانين بالمئة من التكلفة. ويزيل اختيار النموذج معظم التكلفة المتبقية.

إليك التحفظ المهم. إذا أعطاك نموذج أرخص إجابة خاطئة، فستتحمل تكلفة الجلسة كاملة مرة أخرى، إضافة إلى وقتك. وجّه المهام وفقاً لدرجة صعوبتها، لا وفقاً للسعر. يوضّح الاختيار بين Opus وSonnet وHaiku الحالات التي يصمد فيها كل نموذج.

الحيلة 3: نظافة السياق

تُحتسب تكلفة كل token تتركه في السياق في كل دور متبقٍّ، لذلك تكون إزالة token مبكراً أكثر فائدة بكثير من إزالته متأخراً. إذا أُدرج ملف حجمه 5,000 token في الدور 5 من جلسة تتكون من 40 دوراً، فستتم قراءته 35 مرة إضافية. وهذا يعادل 175,000 token إضافية من الإدخال، أي ما يقارب دولاراً واحداً على Opus 5 بسبب لصق واحد غير محسوب.

هناك أربع عادات تؤثر في هذا الرقم:

  • ابدأ جلسة جديدة لمهمة جديدة بدلاً من متابعة جلسة الأمس.
  • صفِّ مخرجات الأوامر المليئة بالضوضاء قبل وصولها إلى النموذج، باستخدام شيء مثل head -50، بدلاً من تصفيتها بعد ذلك.
  • اطلب الدالة التي تهمك فقط، لا الملف بأكمله.
  • عندما تتوقف جلسة طويلة عن إحراز تقدم، اطلب تلخيصاً وابدأ من جديد اعتماداً عليه. يتكون التلخيص من بضع مئات من tokens، بينما يتكون السجل من مئات الآلاف.

الاستفادة 4: اجعل كل ما لا يتطلب تفاعلاً يعمل بنظام الدُفعات

تعالج Batch API الطلبات بشكل غير متزامن، وتمنح خصماً بنسبة 50 بالمئة على كل من الإدخال والإخراج. إذا لم تكن المهمة تحتاج إلى إجابة خلال الثانية التالية، فأرسلها إلى المعالجة الدفعية. يشمل ذلك التصنيف، والاستخراج، وتلخيص الأعمال المتراكمة، وعمليات التقييم. يمكن جمع خصم المعالجة الدفعية مع التخزين المؤقت للمطالبات. لا ينطبق هذا على الجلسة التفاعلية، لأنه لا يوجد فيها وقت انتظار.

هل أتعرض للاستغلال؟

هذا هو السؤال الحقيقي الكامن وراء عبارة «لماذا يُعد Claude مكلفاً؟»، ولذلك إليك إجابة مباشرة. الأسعار منشورة، وهي نفسها للجميع ضمن المستويات القياسية، وتُحتسب لكل token. لا يتضمن الفاتورة أي مبلغ اختياري. لكن جدول الأسعار لا يخبرك ما إذا كنت تحصل على قيمة مقابل ما تدفعه، لأنه يحدد سعر الـtokens بينما تهتم أنت بالنتائج.

لذلك احسب تكلفة النتيجة بدلاً من ذلك. بلغت تكلفة الجلسة أعلاه 12.70 دولاراً من دون الاستفادة من التخزين المؤقت. إذا أطلقت ميزة كانت ستستغرق منك ساعة، فهذه تكلفة منخفضة. أما إذا أمضت الجلسة أربعين دورة وهي تدور في حلقة مفرغة، فإن مبلغ 12.70 دولاراً نفسه لم يشترِ شيئاً، ولم يكن السعر هو المشكلة قط.

هذه هي النقطة التي تستحق التذكر. ترتفع فاتورتك مع عدد الـtokens، لا مع القيمة. تكلف الجلسة المنتجة والجلسة المهدرة، إذا كانتا بالطول نفسه، المبلغ نفسه. لذلك تهم العوامل الأربعة أكثر من جدول الأسعار: لا يمكنك التفاوض على سعر الـtoken، لكنك تقرر عدد الـtokens التي تتطلبها المهمة.

لذلك تتبع تكلفة كل مهمة مكتملة بالدولار، لا التكلفة الشهرية بالدولار. إذا انخفض هذا الرقم أثناء ضبط التخزين المؤقت والتوجيه، فهذا يعني أن إعدادك يتحسن حتى عندما يرتفع الإجمالي الشهري، لأن ارتفاع الإجمالي ناتج عن إنجاز مزيد من العمل.

ما الذي لا يخفض فاتورتك

لا تفيد بعض النصائح الشائعة إلا قليلاً. يؤدي توجيه النموذج إلى «الإيجاز» إلى تقليل المخرجات، لكن المخرجات شكّلت خمسة بالمئة من فاتورة المثال. ويوفّر اختصار سؤالك بضع مئات من الرموز مقابل سياق حجمه 60,000 رمز. ولا يفيد إيقاف التفكير الموسّع إلا عندما تكون رموز التفكير جزءاً فعلياً من مخرجاتك، وتوضح لك كتلة الاستخدام ذلك بدلاً من تركك للتخمين.

ولا تُعد نافذة السياق الأكبر تكلفة بحد ذاتها. في Claude 4.6 والإصدارات الأحدث، تُحتسب نافذة المليون رمز الكاملة وفق السعر القياسي لكل رمز، ولذلك تكلف الطلبات التي تحتوي على 900,000 رمز المبلغ نفسه لكل رمز الذي تكلفه الطلبات التي تحتوي على 9,000 رمز. لا يحدد حجم النافذة السعر. ما يحدد السعر هو ما تختار وضعه داخل النافذة.

ينبغي التخطيط لأمرين إضافيين بدلاً من معالجتهما في جلسة واحدة. إذا كان استخدامك يومياً وتفاعلياً، فقارن بين الدفع لكل رمز والاشتراك ذي السعر الثابت: يوضّح مقارنة تكلفة API والاشتراك هذه الحسابات. وإذا كان agent يعمل دون مراقبة على خادم، فضع حداً أقصى ثابتاً للإنفاق قبل ضبط أي شيء آخر، وهذا ما تغطيه ضوابط تكلفة agent يعمل على VPS. وللحصول على تصور عام للحجم، يحوّل ما الذي تشتريه فعلياً مليون من رموز Claude بطاقة الأسعار إلى صفحات من النص.

FAQ

لماذا ارتفعت فاتورة Claude عندما بدأت باستخدام agent؟

لأن agent يرسل طلبات كثيرة لكل سؤال، ويحمل كل طلب كامل المحادثة حتى تلك اللحظة. ترسل المحادثة طلباً واحداً لكل سؤال. أما coding agent فيرسل طلباً واحداً لكل خطوة، ومن الطبيعي أن يتطلب تنفيذ مهمة واحدة 40 خطوة. تُحاسَب كل هذه الطلبات على كامل السياق، لذلك قد تُحاسَب جلسة تنتهي عند 100,000 token على أكثر من مليوني input token إجمالاً. اقرأ input_tokens وcache_read_input_tokens في استجابة API لرؤية ذلك مباشرة.

هل يقلل prompt caching الفاتورة فعلاً بهذا القدر؟

في المثال التطبيقي، خفّض تكلفة الجلسة من 12.70 دولاراً إلى 2.48 دولار، لأن قراءة cache تكلف عُشر سعر input. يعتمد التوفير بالكامل على معدل إصابة cache. مع cache مدته خمس دقائق، يغطي تكلفته بعد قراءة واحدة، لأن الكتابة تكلف 1.25 ضعف سعر input، بينما تكلف القراءة 0.1 ضعفه. إذا تغيّر prompt قرب بدايته في كل طلب، فلن تحصل على أي إصابات، وستدفع الزيادة الخاصة بالكتابة من دون فائدة. تحقّق باستخدام cache_read_input_tokens قبل افتراض أنه يعمل.

هل ينبغي أن أستخدم Haiku لكل شيء؟

لا. يكلف Haiku 4.5 مبلغ 1 دولار لكل مليون input token، مقابل 5 دولاراً لـ Opus 5، لذلك يكون التوفير فعلياً في الأعمال البسيطة ذات الحجم الكبير، مثل التصنيف والتوجيه. تكلف الإجابة الخاطئة في الأعمال الصعبة أكثر مما وفّره النموذج، لأنك تدفع تكلفة إعادة المحاولة ووقتك أنت أيضاً. النمط العملي هو الاستخدام المختلط: النموذج الصغير للخطوات الآلية، والنموذج المتقدم للخطوة التي تحتاج إلى حكم.

هل تكون API أرخص من اشتراك Claude؟

يعتمد ذلك على مدى ثبات استخدامك. الاشتراك سعر شهري ثابت مع حدود استخدام مرفقة به. أما API فتعمل بنظام الدفع حسب عدد token من دون حد أقصى، وتكون أرخص عندما يكون استخدامك خفيفاً أو متقطعاً، وأغلى عندما تستخدمها بكثافة في كل يوم عمل. احسب متوسط عدد token يومياً من قسم الاستخدام، ثم سعّره وفق معدل النموذج الذي تستخدمه، وقارن الناتج بسعر الخطة.