هل يخفض Paritok فاتورة وكيل البرمجة؟
يضغط Paritok قراءات الملفات ومخرجات الأدوات قبل إرسالها إلى النموذج. تعرّف إلى آليته وحساب نقطة التعادل، مع ادعاء خفض الرموز بنسبة 74%.
ما يفعله Paritok بالطلب
Paritok هو بوابة للرموز: وكيل وسيط يقع بين وكيل البرمجة وواجهة برمجة تطبيقات النموذج، ويضغط كل طلب قبل إعادة توجيهه. يتصل وكيلك بـ http://127.0.0.1:8080 بدلاً من مزوّد الخدمة. يعيد الوكيل الوسيط كتابة مخططات الأدوات، وقراءات الملفات، ومخرجات الأدوات، والأدوار الأقدم، ثم يرسل الحمولة الأصغر إلى الخدمة العليا ويعيد الاستجابة دون تغيير.
يفوتر مزوّد الخدمة ما يصل إليه، لذلك تعني الحمولة الأصغر فاتورة أصغر. هذه هي الفكرة كاملة. وهذا ادعاء مختلف عن أن «سياقك يستمر مدة أطول»، وهو سبب أهمية هذه الأداة بدلاً من كونها مجرد وسيلة لترتيب الطلبات.
المشروع حديث العهد. تعود أولى وسومه العامة إلى July 2026، والوسم الحالي هو v1.3.0، المؤرخ في 5 August 2026. تخضع الأوزان وشفرة البوابة لترخيص Apache 2.0. نموذج الضغط هو محوّل LoRA (التكييف منخفض الرتبة) مبني على Qwen3-4B-Instruct-2507، وقد دُرِّب على 45,000 عينة مقطّرة من معلّم، مأخوذة من مسارات عمل فعلية لوكلاء البرمجة.
لماذا لا يُعدّ هذا اقتطاعاً للسياق
الاقتطاع يحذف المحتوى. عندما يقترب الوكيل من حد السياق ويحذف الأدوار الأقدم، يختفي الملف الذي قرأه في الدور 3. إذا احتاج إلى ذلك الملف في الدور 20، فإنه يقرأه مجدداً، ولذلك تدفع تكلفة هذه الرموز مرة ثانية. كان التوفير مجرد تأجيل للتكلفة.
يستبدل Paritok مقطعاً بصيغة أقصر مع وسم، [REF:id]، ويحتفظ بالنص الكامل على الـproxy. يستعيد النموذج المقطع عبر استدعاء read_original أو expand_context. يغيّر ذلك طريقة حدوث الفشل. يفشل الاقتطاع بسبب النسيان، ولا يخبرك بذلك مطلقاً. أما الضغط فيفشل بتزويد النموذج بملخص فاقد لبعض المعلومات، ويمكن للنموذج طلب النص الأصلي عندما لا يكفي الملخص.
تعمل أداة تصفية الأدوات بالطريقة نفسها. تُحوَّل مخططات الأدوات التي تمت تصفيتها إلى stubs بدلاً من إزالتها، ويستعيد النموذج أحدها عبر استدعاء gateway_search_tools. هذا مهم لأن أداة التصفية التي تخفي أداة نهائياً تغيّر ما يستطيع وكيلك تنفيذه، ولن تعرف ذلك إلا من خلال مهمة فشلت بهدوء.
الرافعات الثلاث، وأيّها مجاني
الرافعة الأولى هي مرشح مخطط الأدوات. يحمل كل طلب مصفوفة tools كاملة. في دور Claude Code مع إرفاق عدد قليل من خوادم MCP (بروتوكول سياق النموذج)، يقيس المشروع هذا الجزء بنحو 29,000 رمز. يضمّن المرشح طلب المستخدم ووصف كل أداة باستخدام BAAI/bge-small-en-v1.5، وهو نموذج تضمين حجمه 130 MB، ثم يُبقي الأدوات المطابقة ويضع بديلاً هيكلياً لبقية الأدوات. ينخفض حجم الجزء إلى نحو 8,000 رمز. يعمل نموذج التضمين هذا على CPU.
الرافعة الثانية هي ضغط المحتوى، وهي الجزء الذي يحتاج إلى نموذج 4B على GPU. تُعاد كتابة قراءات الملفات ومخرجات الأدوات وسجل المحادثة بحيث تصبح 25.7% من حجمها الأصلي. من هنا تأتي نسبة 74% المذكورة. اقرأها بعناية: نسبة 74% هي معدل ضغط المحتوى الذي يجري ضغطه، وليست نسبة الخفض في فاتورتك.
الرافعة الثالثة هي تلخيص السجل. عندما تمتلئ ميزانية السياق، تُلخَّص الأدوار التي تتجاوز النافذة الحديثة، لكي تستمر الجلسة الطويلة بدلاً من بلوغ الحد الأقصى.
الرافعة الثانية وحدها تحتاج إلى GPU. هذه أهم جملة في هذه الصفحة. يمنحك pip install "paritok[toolselect]" مرشح الأدوات على VPS عادي يعمل بوحدة CPU، وهو نصف المنتج الذي لا يكلّفك شيئاً شهرياً. جرّبه قبل استئجار بطاقة.
ما الذي قاسه المشروع، وعلى أي بيئة اختبار
The data behind this chart
[
{
"label": "Paritok-4B-v1",
"compressed_to_pct": 25.7,
"quality_retained_pct": 86.5
},
{
"label": "gpt-4.1-mini",
"compressed_to_pct": 50.2,
"quality_retained_pct": 85.6
},
{
"label": "gpt-5",
"compressed_to_pct": 61.9,
"quality_retained_pct": 93.6
}
]هذه أرقام المشروع المنشورة رسمياً، وقد قاسها باستخدام بيئة الاختبار الخاصة به مقابل SWE-bench Lite. يضغط Paritok-4B-v1 المحتوى إلى 25.7% من حجمه الأصلي، مع الاحتفاظ بنسبة 86.5% من معدل الحل غير المضغوط. يؤدي استخدام gpt-5 للضغط إلى الاحتفاظ بجودة أعلى، بنسبة 93.6%، لكنه يضغط المحتوى إلى 61.9% فقط، وستدفع أسعار frontier لتوفير أسعار frontier.
اقرأ عمود الجودة بواقعية. الاحتفاظ بنسبة 86.5% من معدل الحل يعني أن عمليات التشغيل المضغوطة أخفقت في حل مسائل نجحت عمليات التشغيل غير المضغوطة في حلها، أي ما يقارب مسألة واحدة من كل 7 مسائل. على معيار قياس، هذا رقم في جدول. أما في مستودعك، فهي مهمة ستنفذها مرتين.
The data behind this chart
[
{
"label": "Turn 1",
"saved_pct": 25
},
{
"label": "Turn 5",
"saved_pct": 39
},
{
"label": "Turn 12",
"saved_pct": 57
},
{
"label": "Turn 20",
"saved_pct": 63
}
]يزداد التوفير من البداية إلى النهاية مع استمرار الجلسة، لأن السجل يتراكم، والسجل هو الجزء الذي يجري ضغطه. يذكر المشروع توفيراً بنحو 25% في دورة واحدة، و39% بحلول الدورة 5، و63% بحلول الدورة 20. كما يوضح متى يتوقف هذا النمو: عند ميزانية قدرها 200,000 رمز، يستقر التوفير المطلق عند نحو 48,000 رمز لكل دورة، في وقت ما بين الدورة 8 والدورة 12 تقريباً، لأن السجل يتوقف عن النمو عندما يمتلئ السياق. تشير العبارة المتداولة «أكثر من 85%» إلى الجلسات التي بلغ فيها السياق سعته القصوى. هذه أفضل حالة، لذلك لا تضع خطتك على أساسها.
هل تبرّر Paritok تكلفة GPU بسعة 24GB؟
تُعدّ البطاقة بسعة 24GB وحدة التأجير المعتادة لنموذج بهذا الحجم. حتى 7 August 2026، بلغ السعر الوسيط المنشور عند الطلب لبطاقة RTX 4090 بسعة 24GB مقدار $0.44 لكل ساعة، بينما كانت أرخص العروض قريبة من $0.20. سنستخدم $0.44. إذا بقيت البطاقة قيد التشغيل طوال الشهر، فهذا يعني 730 ساعة، أي $321. وإذا شغّلتها خلال ساعات العمل فقط، لمدة 8 ساعات يومياً على مدى 22 يوماً، فستكون المدة 176 ساعة، أي $77.
حوّل الآن خفض عدد الرموز إلى خفض بالدولار. ينطبق التخفيض على رموز الإدخال. تمر رموز الإخراج عبر الـproxy دون تغيير، ولذلك لا تتغير تكلفتها إطلاقاً. افترض أن رموز الإدخال تمثل 80% من إجمالي فاتورتك، وهذا أمر معتاد لوكيل برمجي، ثم تحقّق من هذا الافتراض مقابل فاتورتك الفعلية. يصبح التوفير بالدولار مساوياً لتخفيض الرموز مضروباً في 0.8.
The data behind this chart
[
{
"label": "Turn 5 (39% saved)",
"bill_always_on_usd": "1,030",
"bill_workday_only_usd": 248
},
{
"label": "Turn 20 (63% saved)",
"bill_always_on_usd": 637,
"bill_workday_only_usd": 154
},
{
"label": "Saturated (85% saved)",
"bill_always_on_usd": 472,
"bill_workday_only_usd": 114
}
]عند معدل الجلسة المشبعة البالغ 85%، تحتفظ بنسبة 68% من الفاتورة. لذلك تسترد البطاقة التي تتركها قيد التشغيل تكلفتها عندما يتجاوز إنفاقك الشهري على الوكيل نحو $472، أو نحو $114 إذا أوقفت المثيل خارج ساعات العمل. وعند معدل الدورة-20 البالغ 63%، تصبح القيمتان $637 و $154. أما عند معدل الدورة-5 البالغ 39%، وهو ما تبدو عليه الجلسات القصيرة فعلياً، فتحتاج إلى نحو $1,030 شهرياً قبل أن يصبح استئجار البطاقة مجدياً أصلاً.
هناك عاملان يجعلان الوضع أفضل مما يوضحه الجدول. لا يحتاج النموذج إلى 24GB؛ إذ يبلغ حجم بنية q4 نحو 2.5GB، بينما تبلغ بنية bf16 نحو 8GB. لذلك فإن استخدام بطاقة أصغر، أو صندوق GPU تشغّله مسبقاً لغرض آخر، يخفض كل رقم في ذلك المخطط. كما أن إيقاف المثيل عندما لا يكتب أحد التعليمات البرمجية هو العامل الأكبر هنا، لأنه يخفض تكلفة التأجير بنحو ثلاثة أرباع.
وهناك عامل واحد يجعله أسوأ. تمريرة الضغط عمل فعلي. كل رمز يضغطه نموذج 4B يجب أن يقرأه ثم يكتبه، وهذا يضيف زمناً إلى كل دورة للوكيل. عند استئجار بطاقة بالساعة، تظهر هذه التكلفة في صورة انتظار، لا كسطر في الفاتورة، ولذلك يسهل عدم ملاحظتها إلى أن تشعر بها.
إذا كنت تقارن عموماً بين ساعات GPU المؤجرة ورموز API، فإن نقطة التعادل بين GPU VPS ورموز API تجري الحساب نفسه للاستدلال بحد ذاته.
تشغيل بوابة Paritok على VPS
يتطلب ذلك Python 3.10 أو إصداراً أحدث. يأتي Ubuntu 24.04 مع Python 3.12، لذلك تكفي صورة VPS عادية للنصف الذي يعمل على CPU فقط.
sudo apt update && sudo apt install -y python3-venv curl
python3 -m venv /opt/paritok/venv
source /opt/paritok/venv/bin/activate
pip install "paritok[proxy]==1.3.0"
pip install "paritok[toolselect]==1.3.0"ثبّت الإصدار. وسم المستودع v1.2.8 في 29 July 2026، ثم وسم v1.3.0 في 5 August 2026. المشروع الذي يتغير بهذه السرعة يعيد تسمية مفاتيح الإعداد بين الإصدارات. استخدام pip install paritok مجرداً، أو استخدام git clone من main، سيمنحك بوابة مختلفة في الأسبوع المقبل ولن يترك سجلاً يوضح أي إصدار أنتج الأرقام التي قستها.
الخلفية الافتراضية هي Ollama. اسحب النموذج، ثم امنحه الاسم المختصر الذي تبحث عنه الوكيل الوسيط.
ollama pull paritok/paritok-4b-v1
ollama cp paritok/paritok-4b-v1 paritok-4b-v1اكتب paritok.yaml بجواره. يحافظ use_gpu_server: false على تنفيذ الضغط على أجهزتك أنت.
use_gpu_server: false
local_model:
base_url: http://localhost:11434paritok proxy --port 8080 --config-file paritok.yamlparitok up هو الاختصار لكل ما سبق: فهو يسحب النموذج إذا لم يكن موجوداً، ويبدأ الوكيل الوسيط على المنفذ 8080. افحص الوكيل الوسيط قبل توجيه أي وكيل إليه.
curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/statsيعرض /health كائن JSON صغيراً يحتوي على "status":"ok" وسلسلة الإصدار. يعرض /stats إجماليات الضغط وتقدير الوكيل الوسيط نفسه لما وفّره. تعامل مع هذا التقدير على أنه تقييم الوكيل الوسيط لعمله، وتحقق منه باستخدام صفحة الاستخدام لدى مزود الخدمة.
إذا كانت الأولوية لمعدل النقل لا لسهولة الإعداد، فإن vLLM يقدّم adapter فوق النموذج الأساسي.
vllm serve Qwen/Qwen3-4B-Instruct-2507 \
--enable-lora \
--lora-modules paritok-4b-v1=paritok/paritok-4b-v1 \
--port 8000يُجهَّز Ollama بسرعة أكبر. ويتعامل vLLM مع الطلبات المتزامنة بكفاءة أعلى بكثير، ويبدأ ذلك في الأهمية بمجرد أن يشترك أكثر من وكيل في الخادم. الفرق العملي بين Ollama وvLLM هو ما يحدد الخيار المناسب هنا.
وجّه الوكيل إلى الوكيل الوسيط باستخدام متغيرات البيئة الخاصة بعنوان URL الأساسي.
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
export OPENAI_BASE_URL=http://127.0.0.1:8080يتجاهل Codex CLI المتغير OPENAI_BASE_URL، لذلك ينشئ المشروع ~/.codex/config.toml لك عندما يكون codex.enabled: true مضبوطاً في paritok.yaml. يؤدي تصدير المتغير وحده إلى إبقاء Codex متصلاً مباشرة بمزود الخدمة، وتظهر المشكلة في عداد /stats الذي لا يتحرك أثناء عملك.
أبقِ المستمع على 127.0.0.1، ولا تضعه مطلقاً على 0.0.0.0. يمرر الوكيل الوسيط مفتاح API الخاص بمزود الخدمة إلى الجهة الأعلى، لذلك فإن إتاحة الوصول إليه من الإنترنت تحوله إلى relay مفتوح لهذا المفتاح: يستطيع كل من يعثر على المنفذ إنفاق أموالك من دون أن يرى المفتاح نفسه. صِل إليه من حاسوب محمول عبر نفق SSH أو VPN بدلاً من فتح المنفذ.
شغّله تحت systemd ليستمر بعد إعادة التشغيل. عدّل المسارات لتطابق عملية التثبيت لديك.
[Unit]
Description=Paritok compression proxy
After=network-online.target
[Service]
User=paritok
WorkingDirectory=/opt/paritok
ExecStart=/opt/paritok/venv/bin/paritok proxy --port 8080 --config-file /opt/paritok/paritok.yaml
Restart=on-failure
[Install]
WantedBy=multi-user.targetفعّله باستخدام sudo systemctl enable --now paritok، ثم نفّذ curl على /health مرة أخرى. تعني الوحدة التي تبدأ ثم تخرج فوراً عادةً أن مسار ملف الإعداد غير صحيح، ويعرض journalctl -u paritok -n 50 السبب.
الخيار المستضاف، وما يترتب عليه
يوفّر المشروع أيضاً ميزة الضغط كخدمة. اضبط use_gpu_server: true باستخدام مفتاح API، وسيعمل نموذج 4B على أجهزته. تبلغ التكلفة $0.30 لكل مليون رمز تتم معالجته، وهي مجانية حتى نهاية August 2026 وفقاً لوثائقه الخاصة. يلغي ذلك تكلفة استئجار GPU وجميع أعمال التشغيل المذكورة أعلاه.
لكنه يعني أيضاً أن المطالبات والملفات التي يقرأها وكيلك تغادر جهازك وتصل إلى طرف ثالث قبل وصولها إلى موفّر النموذج. يهدف الاستضافة الذاتية إلى تجنّب هذه النقلة تحديداً. حدّد أي الخيارين تريد تحسينه قبل ضبط هذا الخيار، لأن تعديل الخيار لا يتطلب سوى تغيير في سطر واحد، لكن تبعاته ليست بسيطة.
كيفية قياس نتائجك قبل التغيير وبعده
الأرقام المنشورة هي أرقام المشروع، باستخدام أداة الاختبار الخاصة بالمشروع، على SWE-bench Lite. أما مستودعك فليس SWE-bench Lite. قِس نتائجك أنت.
- شغّل أسبوعاً عادياً من دون وجود proxy في المسار. سجّل input tokens وcache-read tokens وoutput tokens في أسطر منفصلة من صفحة الاستخدام لدى مزوّدك، وليس كمجموع بالدولار في سطر واحد.
- شغّل الأسبوع التالي مع وجود proxy في المقدمة، ونفّذ النوع نفسه من العمل.
- قارن سطري input وcache-read. يجب أن يبقى output ثابتاً تقريباً، لأن أي شيء لا يضغطه. إذا تغيّر output كثيراً، فقد تغيّر شيء آخر غير proxy.
- احسب عدد المهام التي اضطررت إلى إعادة تنفيذها. هذا هو جانب الجودة في المقايضة، ولا تعرضه أي لوحة معلومات.
- أضف ساعات استخدام GPU إلى الأسبوع الثاني قبل مقارنة الإجماليات.
يفيد فصل input عن output لأن تسعيرهما مختلف جداً، ولأن أداة الضغط تؤثر في أحدهما فقط. اعتباراً من August 2026، تبلغ تكلفة Claude Sonnet 4.6 مقدار $3 لكل مليون input tokens و$15 لكل مليون output tokens، بينما تبلغ تكلفة prompt-cache read نسبة 10% من سعر input، أي $0.30 لكل مليون. الفارق بين تكلفة input وoutput tokens هو ما يحدد ما إذا كان input-side compressor مفيداً لك. يوضح أين تُستخدم tokens فعلياً في Claude Code أي جزء من السياق كبير بما يكفي لتبرير ضغطه.
يزيد prompt caching تعقيد حسابات tool-filter تحديداً. توجد كتلة الأدوات في بداية الطلب، ولذلك تكون عادةً cache hit بعد الجولة الأولى، بسعر يعادل 10% من سعر input. يؤدي حذف 21,000 tokens من كتلة مخزنة مؤقتاً إلى توفير 21,000 بسعر $0.30 لكل مليون، أي نحو $0.006 لكل جولة، بدلاً من $0.063 الذي يوحي به السعر غير المخزن مؤقتاً. يُبقي المشروع الكتلة المصفّاة ثابتة طوال الجلسة حتى لا تتغير البادئة المخزنة مؤقتاً. أما filter الذي يعيد اختيار الأدوات في كل جولة، فسيفقد صلاحية تلك البادئة، وقد يكلّف أكثر مما يوفره.
ما لم يُتحقَّق منه بعد
تأتي كل أرقام الأداء المذكورة أعلاه من المشروع نفسه. لا توجد إعادة إنتاج مستقلة لنتائج SWE-bench Lite، ومع كون أولى الوسوم مؤرخة في July 2026، لا يتوفر للكود أيضاً سجل تشغيلي كافٍ. يقيس الطرف المستفيد من ظهور النتائج بصورة جيدة كلاً من معدل الضغط ونسبة الجودة المحتفظ بها. هذا لا يعني أنها خاطئة، بل يعني أنها غير مؤكدة. لذلك يجب أن تتعامل معها بطريقة مختلفة عن رقم أنتجته بنفسك.
هناك سلوك موثَّق يستحق معرفته قبل أن تلقي اللوم على إعدادك. يُحمِّل مرشح الأداة نموذج embedding عند الطلب الأول، وليس عند بدء التشغيل. لذلك يوثّق المشروع فترة تهيئة مدتها 10 إلى 15 ثانية، ثم نحو 15 ms لكل استدعاء بعد ذلك. أرسل طلباً تجريبياً واحداً بعد بدء الـproxy، حتى لا يبدو دور الوكيل الحقيقي الأول عالقاً.
يمكنك حسم أربعة أمور بنفسك خلال فترة بعد الظهر: هل يبدأ الـproxy ويستمر في العمل، وهل يتحرك /stats أثناء عملك، وهل ينخفض فعلاً سطر input-token لدى مزود الخدمة، وهل يظل الوكيل يُنهي المهمة. هذه الأمور تحسم ملاءمة الأداة لإعدادك بدرجة أفضل بكثير من أي معيار أداء منشور.
أما عن موضع هذه الأداة بجانب أدواتك الأخرى: فإن بوابة LiteLLM مستضافة ذاتياً توجّه الطلبات وتقيسها من دون تغيير محتواها. لذلك تعالج الأداتان مشكلتين مختلفتين ويمكن استخدامهما معاً، بحيث تكون Paritok الأقرب إلى الوكيل. إذا كان الهدف الفعلي هو خفض الفاتورة، لا استخدام هذه الأداة تحديداً، فإن مجموعة أوسع من ضوابط التكلفة لوكيل على VPS تتضمن عدة تغييرات يمكنك تجربتها أولاً دون تكلفة.
FAQ
هل يقلل Paritok فاتورة API لدي، أم يقلل استخدام السياق فقط؟
يقلل الفاتورة، لأن الوكيل الوسيط يعيد كتابة الطلب قبل وصوله إلى مزود الخدمة، ومزود الخدمة يحاسب على ما يستلمه. لكن مقدار التخفيض أصغر مما يوحي به الرقم المعلن. تمثل نسبة 74% معدل ضغط المحتوى الذي يجري ضغطه. وعلى مستوى العملية كاملة، يذكر المشروع انخفاضاً بنحو 25% في دورة واحدة و63% بحلول الدورة 20، كما أن رموز الإدخال فقط هي التي تتغير. تمر رموز الإخراج دون تعديل.
ما مقدار GPU الذي أحتاج إليه لاستضافة نموذج الضغط ذاتياً؟
يبلغ حجم إصدار q4 نحو 2.5 GB، بينما يبلغ حجم إصدار bf16 نحو 8 GB، لذلك يعمل النموذج ضمن بطاقة سعتها 24 GB مع مساحة كبيرة متبقية. وتعمل بطاقة أصغر أيضاً، كما أن ذلك يحسن حساب نقطة التعادل لصالحك. لا يحتاج مرشح مخطط الأدوات إلى GPU إطلاقاً؛ فهو يستخدم BAAI/bge-small-en-v1.5، وهو نموذج تضمين حجمه 130 MB يعمل على CPU. ثبّت paritok[toolselect] على VPS عادي، وستحصل على تقليل كتل الأدوات مقابل استهلاك قليل من RAM.
ماذا يحدث إذا أزال الضاغط شيئاً يحتاج إليه الوكيل؟
لا يُزال شيء. تحمل المقاطع المضغوطة وسم [REF:id]، ويستعيد النموذج النص الكامل باستخدام read_original أو expand_context. وتُستبدل مخططات الأدوات التي جرت تصفيتها بقوالب بدلاً من حذفها، ويستعيد النموذج أحدها باستخدام gateway_search_tools. الخطر الفعلي أقل وضوحاً من فقدان ملف: يعمل النموذج انطلاقاً من ملخص فاقد للمعلومات، ولا يدرك أنه ينبغي أن يطلب النص الأصلي. وهذا ما تقيسه نسبة الاحتفاظ بالجودة البالغة 86.5% على SWE-bench Lite.
لماذا يستغرق طلبي الأول 15 ثانية؟
يُحمَّل نموذج التضمين الذي يقف خلف مرشح الأدوات عند وصول الطلب الأول، وليس عند بدء التشغيل. يوثّق المشروع زمناً للإحماء يتراوح بين 10 و15 ثانية، ثم نحو 15 ms لكل استدعاء بعد ذلك. أرسل طلباً تجريبياً واحداً باستخدام curl بعد بدء الوكيل الوسيط، ولن تتعطل دورة الوكيل الحقيقية الأولى.
هل ينبغي أن أستخدم خادم GPU المستضاف بدلاً من الاستضافة الذاتية؟
يلغي ذلك تكلفة استئجار GPU وأعمال الصيانة، مقابل سعر يبلغ $0.30 لكل مليون رمز تتم معالجته اعتباراً من August 2026. لكنه يرسل مطالباتك والملفات التي يقرأها وكيلك إلى طرف ثالث قبل وصولها إلى مزود النموذج. إذا كنت تستخدم الاستضافة الذاتية لإبقاء الشيفرة على بنية تحتية تسيطر عليها، فإن هذا الإعداد يلغي سبب اختيارك لها. تضمن الاستضافة الذاتية بقاء السياق ومفتاح API الخاص بمزود الخدمة على جهازك.