الفرق بين وكيل الذكاء الاصطناعي وLLM والمساعد
تعرّف إلى الفرق العملي: يحتاج LLM إلى RAM، ويضيف المساعد واجهة محادثة، بينما يحتاج الوكيل إلى أدوات وحلقة تشغيل وبيانات اعتماد وجهاز دائم التشغيل.
ما الفرق بين وكيل الذكاء الاصطناعي، وLLM، والمساعد الذكي؟
وكيل الذكاء الاصطناعي وLLM والمساعد الذكي هي ثلاث طبقات ضمن حزمة واحدة. وللتمييز بينها، اسأل عما تحتاج إليه كل طبقة من الخادم. إن LLM (نموذج اللغة الكبير) هو ملف أوزان يحتاج إلى RAM وقدرة حوسبة. أما المساعد فهو ذلك النموذج بعد دمجه في واجهة محادثة، مع حساب وسجل محفوظ، ويعمل تقريباً دائماً على أجهزة يملكها طرف آخر. والوكيل هو مساعد يمتلك أيضاً أدوات وحلقة تشغيل، ويحتفظ ببيانات اعتماد، وهذا ما يفرض تشغيله على جهاز يظل قيد التشغيل.
يتوقف معظم ما يُكتب حول هذا السؤال عند التعريفات. ولا تهم التعريفات إلا لأن كل طبقة تُحمّل عليك تكلفة مختلفة. تكلفك إحداها RAM. وتكلفك التالية عنوان URL عاماً وTLS (أمان طبقة النقل). أما الأخيرة فتكلفك بيانات اعتماد، وكل بيانات اعتماد استخدمها وكيل هي بيانات اعتماد يجب عليك الآن تدويرها.
نموذج LLM هو أوزان، والأوزان تحتاج إلى RAM
نموذج LLM عبارة عن ملف يحتوي على أرقام. تنزّله، ثم يحمّله runtime في الذاكرة، ويجيب عن طلب واحد في كل مرة. نطاقه محدود: يدخل النص ويخرج النص. لا يملك النموذج ذاكرة بين الاستدعاءات، ولا ساعة، ولا وصولاً إلى الشبكة، ولا طريقة لفتح ملف. كل ما يبدو أن نموذج LLM «يتذكره» أدرجه البرنامج الذي يستدعيه في السياق.
حجم هذا الملف هو الرقم الذي يحدد خطة VPS، لأن الملف بأكمله يبقى في الذاكرة أثناء تشغيل النموذج. عند استخدام quantisation بمقدار 4-bit، وهي القيمة الافتراضية التي يوفّرها Ollama، احسب نحو 0.6 GB لكل مليار من المعاملات، ثم أضف 1 أو 2 GB لنافذة السياق وruntime نفسه.
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]يبلغ حجم إصدار qwen3:8b على القرص 5.2 GB، ويحتاج إلى نحو 8 GB من RAM ليعمل من دون استخدام swap. لن يتمكن VPS بسعة 4 GB من تحميل qwen3:14b، الذي يبلغ حجمه 9.3 GB قبل أن تكتب فيه كلمة واحدة. أما أكبر صف هنا، qwen3:32b، فيحتاج إلى نحو 24 GB، ما يعني في معظم قوائم الأسعار خطة مختلفة وفاتورة شهرية مختلفة.
توفير مساحة في الذاكرة مسألة، والسرعة مسألة أخرى. في VPS يعتمد على CPU فقط، يكون عنق الزجاجة هو عرض نطاق الذاكرة لا سرعة الساعة، لذلك قد يجيب النموذج الذي يتسع في الذاكرة بسرعة بضعة tokens في الثانية فقط. هذا مناسب لمهمة تعمل طوال الليل، لكنه غير عملي للمحادثة. ترفع GPU هذه السرعة بنحو مرتبة عشرية، لكنها ترفع فاتورتك أيضاً، لذلك اتخذ القرار بناءً على قياس: اختبر أداء VPS باستخدام الحمل الذي تخطط لتشغيله واقرأ متى يستحق VPS مزوّد بـGPU تكلفته. ولتشغيل الأوزان فعلياً، ابدأ بـOllama على VPS الخاص بك.
المساعد هو LLM مع واجهة محادثة
المساعد هو طبقة المنتج المحيطة بالنموذج. يُعد ChatGPT وClaude من المساعدين: نموذج، ونافذة محادثة، وحساب، ومحادثات محفوظة، وحدّ لمعدل الاستخدام. لا يعمل أيّ من ذلك تقريباً على عتاد تتحكم فيه، ولذلك يتطلب المساعد المستضاف اشتراكاً ولا يستهلك من RAM لديك شيئاً.
الإصدار المستضاف ذاتياً هو واجهة أمامية مثل Open WebUI موجّهة إلى Ollama محلي أو إلى API مستضاف. الواجهة الأمامية برنامج صغير. توقّع استهلاك نحو 1 GB من الذاكرة المقيمة لواجهة المحادثة، إضافةً إلى ما يحتاجه النموذج. لكنها تحتاج، بخلاف النموذج وحده، إلى URL عام وشهادة، لأنك تريد الوصول إليها من الهاتف: أصدر الشهادة باستخدام Certbot وNginx، أو أنهِ TLS عبر Traefik أمام عدة تطبيقات. إذا كنت لا تزال تختار واجهة أمامية، فقارن بدائل Open WebUI.
المساعد يجيب. لكنه لا ينفّذ الإجراءات. عندما يكتب أمر shell، يقرأ شخص ذلك الأمر ويقرر ما إذا كان سيلصقه. هذا الشخص هو طبقة أمان، والوكيل هو المكوّن الذي يزيلها.
يضيف الوكيل أدوات وحلقة تنفيذ
الوكيل هو مساعد يمكنه استدعاء الدوال ثم قراءة نتائجها. ينفّذ العمل جزءان. الجزء الأول هو أداة: وصف لدالة يمكن للنموذج طلبها، إضافة إلى الشيفرة التي تشغّلها فعلياً. والجزء الثاني هو الحلقة: يستدعي برنامجك النموذج، ويطلب النموذج أداة، ويشغّل برنامجك الأداة، ثم يضيف الناتج إلى المحادثة ويستدعي النموذج مرة أخرى. تتكرر هذه العملية إلى أن يعلن النموذج انتهاءه أو يوقفها حدّ معيّن.
الحلقة شيفرة عادية، ويمكن كتابة حلقة أساسية في أقل من مئة سطر. وما يجعلها وكيلاً هو أن الأدوات تستخدم بيانات اعتماد فعلية، لذلك يمكن للحلقة تغيير شيء خارجها. هذه الحقيقة وحدها تؤثر في كل قرار استضافة أدناه. تُعد مهارات الوكيل وخوادم MCP (بروتوكول سياق النموذج) طريقتين لمنح الوكيل أدوات إضافية دون إعادة كتابة الحلقة.
- تستمر بعد انتهاء جلستك. تنتهي المحادثة عند إغلاق علامة التبويب. وقد يستغرق تشغيل الوكيل عشرين دقيقة، وينبغي أن يستمر عند دخول حاسوبك المحمول في وضع السكون، لذلك يجب تشغيله على خادم يظل قيد التشغيل، وتبدأه خدمة أو مؤقت systemd يعيده بعد إعادة التشغيل.
- تحتفظ بأسرار. قد تكون هذه الأسرار مفتاح API، أو مفتاح SSH، أو كلمة مرور قاعدة بيانات. ويمكن لتعليمات خبيثة مخفية في مدخلاته أن تجعل الوكيل يستخدم أي شيء يستطيع قراءته، لذلك أبقِ الأسرار بعيداً عن متناول الوكيل.
- تزداد تكلفتها مع تكرارات الحلقة، لا مع سؤالك. في كل خطوة، يُعاد إرسال المحادثة كاملة كمدخل، لذلك يدفع تشغيل من عشر خطوات تكلفة ذلك النص عشر مرات. لهذا السبب تهيمن رموز الإدخال على تكلفة الوكيل، ولهذا تريد وضع حد صارم لما يمكن لتشغيل واحد إنفاقه.
- قد يخطئ بطريقة تُجري تغييرات فعلية. تكلفك إجابة خاطئة في المحادثة إعادة قراءتها. أما تنفيذ حذف خاطئ داخل حلقة فقد يؤدي إلى حذف الدليل. شغّله باعتباره مستخدماً يملك أقل قدر من الامتيازات التي تسمح له بالعمل، وبالنسبة إلى وكلاء البرمجة، اعزله قبل منحه مستودعك.
ما يحتاجه كل مستوى من الخادم
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]اقرأ عمود RAM بعناية، لأنّه لا يشمل النموذج. واجهة الدردشة وبيئة تشغيل الوكيل كلاهما برنامجان صغيران. إذا كان الوكيل يستدعي نموذجاً مستضافاً، فإن 2 GB من RAM تكفي لتشغيله، وتكون الخطة منخفضة التكلفة خياراً فعلياً لا حلاً وسطاً. أمّا إذا وضعت أوزان النموذج على الخادم نفسه، فسيسيطر سطر النموذج ذي الحجم 8 GB على كل شيء آخر.
الأعمدة الأخرى أهم مما يتوقع كثير من الناس. طبقة النموذج وحدها تصبح أسرع باستخدام GPU. وطبقة المساعد وحدها تحتاج عادةً إلى عنوان URL عاماً، لأن المتصفح يجب أن يصل إليها؛ أمّا الوكيل فلا يحتاج إليه إلا عندما يتعين على جهة خارجية استدعاؤه، مثل webhook. كما يحتفظ الوكيل ببيانات اعتماد عددها several، وهذا هو الفرق الفعلي بينه وبين نافذة الدردشة. قد تخطئ نافذة الدردشة. وقد يخطئ الوكيل ثم يتصرف بناءً على الخطأ.
هل تحتاج إلى GPU لتشغيل وكيل ذكاء اصطناعي؟
لا، إلا إذا كنت تستضيف الأوزان على الجهاز نفسه أيضاً. تتكوّن حلقة الوكيل من طلبات HTTP وتحليل JSON واستدعاءات للعمليات الفرعية، بينما يظل استخدام CPU قريباً من الحد الأدنى أثناء انتظار الشبكة. لذلك يتعلق السؤال عن GPU فعلياً بطبقة LLM.
قسّم القرار إلى جزأين. إذا كان لا يمكن أن يغادر النص جهازك، فأنفق على ذاكرة تكفي لاستيعاب نموذج، وعلى GPU لتشغيله بسرعة مناسبة. أما إذا كنت تريد الأتمتة فقط، فاستأجر النموذج حسب عدد الرموز، ووجّه الميزانية إلى ضمان التشغيل والنسخ الاحتياطية بدلاً من ذلك. تستدعي معظم الوكلاء المستضافين ذاتياً في 2026 نموذجاً مستضافاً، ولذلك تكون تكلفة تشغيلها أقل.
هل يمكنك استضافة وكيل ذكاء اصطناعي ذاتياً؟
نعم. الوكيل هو المكوّن الذي يستحق الاستضافة الذاتية أكثر من غيره، لأن الحلقة التشغيلية هي المكان الذي توجد فيه بياناتك وبيانات اعتمادك. يمكن لـVPS صغير بذاكرة RAM سعتها 2 GB ومدير خدمات وإمكانية الوصول إلى الشبكة الصادرة تشغيل وكيل فعلي. اختر مسار البناء الذاتي على VPS إذا أردت امتلاك الحلقة التشغيلية، أو انشر أحد الوكلاء الجاهزين المستضافين ذاتياً إذا كنت تفضّل البدء من حل مكتمل.
استضافة المساعد ذاتياً سهلة: تحتاج إلى حاوية واحدة وشهادة. أما استضافة النموذج ذاتياً فهي الجزء المكلف، وهي السبب الذي يدفع كثيرين إلى التخلي عن الأمر بعد مشاهدة الرموز تُعالج ببطء على وحدة المعالجة المركزية. استضف الأوزان ذاتياً عندما لا يمكن للبيانات مغادرة الخادم، أو عندما يجعل حجم استخدامك التسعير لكل رمز مكلفاً. وإلا فاترك الوكيل يستدعي API، واحتفظ بالأجزاء المهمة محلياً.
هل ChatGPT وكيل ذكاء اصطناعي؟
يصبح منتج الدردشة وكيلاً بمجرد أن يتمكن من استدعاء أداة والتصرف بناءً على نتيجتها من دون أن يطلب موافقتك أولاً. وفقاً لهذا المعيار، تُعدّ المساعدات المستضافة التي توفر التصفح أو تنفيذ التعليمات البرمجية أو الموصلات وكلاء. يكمن الفرق بالنسبة إليك في مكان تشغيل الحلقة، وفي الجهة التي تستخدم بيانات اعتمادها. في المنتج المستضاف، تعود هذه الأمور إلى المورّد. أما على خادمك الخاص، فتعود إليك، وتتحمل أيضاً مسؤولية كل ما تنفذه الحلقة عند الساعة الثالثة صباحاً.
الوكيل التفاعلي، والتخطيط، وتعدد الوكلاء
تميل القوائم المختصرة إلى ذكر سبعة أنواع من الوكلاء. معظم هذه الأنواع تسويقية. هناك تمييزان يغيران الشفرة التي تكتبها، وتمييز واحد يغير التكلفة. يستدعي الوكيل التفاعلي أداة، ويقرأ الإجابة، ثم يرد. يكتب وكيل التخطيط خطة أولاً، ثم ينفذها خطوةً بعد أخرى. يحقق ذلك أداءً أفضل في المهام الطويلة، لكنه يستهلك عدداً أكبر من الرموز لأن الخطة تُرسل مجدداً في كل خطوة. يتيح إعداد متعدد الوكلاء لوكيل واحد تشغيل وكلاء آخرين. وهذا يضاعف استهلاك الرموز وأنماط الفشل في الوقت نفسه، لذلك لا يكون مفيداً إلا عندما تكون المهام الفرعية مستقلة فعلاً، مثل البحث في أربعة مصادر في الوقت نفسه. ابدأ بالوكيل التفاعلي. أضف التخطيط عندما تصبح عمليات التنفيذ طويلة. استخدم تعدد الوكلاء كخيار أخير. للاطلاع على الصورة الأوسع، راجع ما الذي يستحق تعلمه عن وكلاء الذكاء الاصطناعي في 2026.
كيف تعرف الطبقة التي تشغّلها فعلياً
على الخادم، تحقّق من العمليات التي تشغل الذاكرة.
free -h
ps -eo rss,comm --sort=-rss | head -5إذا كان السطر العلوي هو ollama أو llama-server ويشغل عدة غيغابايت من RSS (حجم المجموعة المقيمة، أي الذاكرة التي تشغلها العملية فعلياً)، فأنت تستضيف النموذج. إذا لم تتجاوز أي عملية بضع مئات من الميغابايت، واستمرت فاتورة API في الارتفاع، فأنت تستضيف وكيلاً أو مساعداً وتستأجر النموذج. إذا كانت القائمة فارغة لأن كل شيء يحدث في علامة تبويب في المتصفح، فأنت تستخدم مساعداً بصفتك عميلاً. وهذا خيار مناسب إلى أن تحتاج إلى برنامج يتصرف نيابةً عنك.
أيّ خيار تريد تشغيله؟
- للحفاظ على خصوصية النص، شغّل النموذج: استضافة LLM ذاتياً باستخدام Ollama، ثم قارن أزمنة التشغيل عبر Ollama مقابل vLLM عندما يتحول مستخدم واحد إلى عشرة.
- لامتلاك دورة التنفيذ والأدوات، أنشئ الوكيل: إنشاء وكيل AI خاص بك على VPS.
- لتشغيل شيء جاهز هذا المساء، انشر أحد الوكلاء الجاهزين من وكلاء الاستضافة الذاتية الذين يستحقون التشغيل.
- إذا لم يكن لأي من ذلك خادم بعد، فابدأ من ما الذي يقدمه VPS فعلياً.
FAQ
هل وكيل الذكاء الاصطناعي مجرد LLM مع خطوات إضافية؟
الخطوات الإضافية هي جوهر المنتج. يحوّل LLM النص إلى نص ولا يفعل شيئاً آخر. يحيط به الوكيل بأدوات يمكنه استدعاؤها وحلقة تواصل استدعاءها، وتحمل هذه الأدوات بيانات اعتماد، لذلك يمكن للناتج تغيير ملف أو قاعدة بيانات أو خدمة قيد التشغيل. لهذا يحتاج الوكيل إلى جهاز يبقى قيد التشغيل، ومدير خدمات، وسياسة للأسرار، بينما يحتاج LLM فقط إلى ذاكرة تكفي للاحتفاظ بأوزانه أثناء الإجابة.
هل أحتاج إلى GPU لتشغيل وكيل ذكاء اصطناعي؟
لا تحتاج إليه لتشغيل الوكيل. تتكون الحلقة من طلبات HTTP ومعالجة JSON واستدعاءات subprocess، ويمكن لأي CPU تنفيذها أثناء انتظار الشبكة. تحتاج إلى GPU فقط عندما تستضيف أوزان النموذج بنفسك وتريد استخراج أكثر من بضع وحدات رمزية في الثانية منه. يعمل الوكيل الذي يستدعي نموذجاً مستضافاً بسهولة على VPS صغير من دون GPU إطلاقاً.
ما مقدار RAM الذي يحتاج إليه VPS لتشغيل وكيل ذكاء اصطناعي؟
يحتاج إلى نحو 2 GB عندما يستدعي الوكيل نموذجاً مستضافاً، لأن ما يحتفظ به يقتصر على بيئة التشغيل وتبعياتها وقاعدة بيانات محلية صغيرة. أضف النموذج إذا كنت تستضيف الأوزان: يريد qwen3:8b وحده نحو 8 GB، لذلك يبدأ الخادم الشامل من هذه القيمة ويزداد وفقاً للنموذج الذي تختاره.
هل يمكنني استضافة مساعد ذكاء اصطناعي بنفسي والحفاظ على خصوصية محادثاتي؟
نعم، مع شرط واحد يحسم الأمر. يحتفظ front end مستضاف ذاتياً مثل Open WebUI بالحسابات والسجل على خادمك. تبقى المحادثات نفسها خاصة فقط إذا كان النموذج الذي يعمل خلفه محلياً أيضاً. إذا وجّهت front end نفسه إلى API مستضاف، فسيغادر النص خادمك مع كل رسالة، وبذلك تحتفظ بالسجل لا بالخصوصية.
ما الفرق بين وكيل الذكاء الاصطناعي وروبوت المحادثة؟
يرد روبوت المحادثة ثم يتوقف. يقرر الوكيل ما الذي سيفعله تالياً، ويستدعي أداة، ويقرأ النتيجة، ثم يقرر من جديد حتى تكتمل المهمة أو يوقفه حد معين. الاختبار العملي هو التالي: إذا كان البرنامج يستطيع تغيير شيء من دون أن يضغط إنسان على زر بين الإجابة والإجراء، فهو وكيل، ويحتاج إلى الاستضافة وضوابط الحماية المرتبطة بذلك.