كيفية تشغيل نموذج Nemotron 3.5 Lightning على خادم VPS
تعلم كيفية تشغيل نموذج Nemotron 3.5 Lightning باستخدام Ollama على خادمك الخاص. تعرف على متطلبات الذاكرة العشوائية RAM، وأمر السحب الصحيح، وما إذا كان المعالج CPU كافياً للتشغيل.
الغرض من Nemotron 3.5 Lightning
نموذج Nemotron 3.5 Lightning هو نموذج NVIDIA مفتوح يعتمد على تقنية خليط الخبراء (mixture-of-experts) بحجم 30B، أُصدر في أغسطس 2026، وهو مصمم للوكلاء (agents) التي تعمل لساعات بدلاً من جلسات الدردشة الفردية. تعني تقنية MoE (خليط الخبراء) أن الأوزان مقسمة إلى العديد من الشبكات الفرعية المتخصصة، ويتم توجيه كل رمز (token) عبر عدد قليل منها فقط. تشير بطاقة نموذج NVIDIA إلى وجود 30 مليار معامل إجمالي مع 3 مليارات معامل نشط لكل رمز. أنت تدفع مقابل العدد الكبير في الذاكرة، وتحصل على العدد الصغير كسرعة في الأداء.
هذه المقايضة هي السبب للنظر في هذا النموذج لخادم تستأجره. الوكيل الذي يقوم بعمل حقيقي يرسل آلاف الطلبات القصيرة على مدار اليوم، لذا فإن الإنتاجية مقابل التكلفة هي التي تحدد ما إذا كان بإمكانه العمل على خادمك الخاص. النموذج الذي يستغرق 40 ثانية لكل رد هو مساعد جيد ولكنه وكيل سيئ، لأن المهمة الواحدة تتطلب عشرين استدعاءً وتنتظر كل واحد منها.
تصف NVIDIA البنية بأنها هجينة: طبقات Mamba-2 وMoE متداخلة مع طبقات انتباه مختارة. تمنح بطاقة النموذج طول سياق أقصى يصل إلى 1M رمز وترخيص OpenMDW-1.1، وهو مصنف كجاهز للاستخدام التجاري. اللغات الأساسية هي الإنجليزية والبرمجة، مع إدراج الإسبانية والفرنسية والألمانية والإيطالية واليابانية أيضاً.
نشرت Artificial Analysis قياسات الإطلاق في أغسطس 2026 التي تظهر ما يقرب من 670 رمزاً في الثانية كإنتاجية، وذلك على نقطة نهاية DeepInfra قبل الإصدار تخدم أوزان NVFP4. هذه نقطة نهاية GPU مستضافة. اقرأ هذه الأرقام كإمكانيات تسمح بها البنية، وليس كأداء سيقدمه خادمك الافتراضي الخاص (VPS).
أي وسم من Ollama يناسب خادم VPS الخاص بك
تنشر مكتبة Ollama إصدارات متعددة لنفس الأوزان. ما يتغير بينها هو التكميم (quantisation)، وهو عدد البتات المستخدم لتخزين كل وزن، وهذا يغير حجم التنزيل بشكل كبير.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]تؤدي الوسوم المسماة latest و30b و30b-a3b جميعها إلى نفس البصمة البرمجية لـ 30b-a3b-q4_K_M، لذا فإن التنزيل الافتراضي هو إصدار الأربع بتات بحجم 25 جيجابايت مع سياق كامل يبلغ 1M. إصدار Q8_0 بحجم 35 جيجابايت، وإصدار bf16 بحجم 66 جيجابايت، وكلاهما أيضاً بسياق 1M. إصدارات MLX بحجم 23 جيجابايت مخصصة لمعالجات Apple silicon وتقتصر على سياق 256K، لذا فهي خيار غير مناسب لخادم Linux VPS.
هذه هي أحجام التنزيل، وليست متطلبات الذاكرة. لا تنشر NVIDIA حداً أدنى لذاكرة الفيديو (VRAM) لإصدارات Ollama، لذا تعامل مع حجم التنزيل كحد أدنى فقط. يجب أن تكون الأوزان موجودة في مكان ما، في ذاكرة وحدة معالجة الرسومات (GPU) إذا كانت البطاقة تتسع لها، أو في ذاكرة النظام (RAM) بخلاف ذلك، ويُضاف فوقها ذاكرة التخزين المؤقت KV (ذاكرة المفتاح/القيمة، وهي ذاكرة النموذج لكل رمز في المحادثة). الرقم الفعلي لجهازك يأتي من أمر برمجي، وليس من الحسابات الرياضية، وهو موضح أدناه. إذا لم تستقر على مستوى تكميم بعد، فإن ما تكلفك به مستويات Q4 وQ8 وFP16 يغطي ما يتم التنازل عنه في كل خطوة.
اسحب الوسم (tag) بدقة، ولا تستخدم latest أبداً
latest هو مؤشر متغيّر. عندما تعيد المكتبة نشره، سيتغير سلوك الوكيل الخاص بك عند عملية السحب التالية دون وجود أي ملاحظات لديك لتفسير السبب. حدد الوسم بالاسم.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_Mيُعدّ نص التثبيت البرمجي خدمة systemd تعمل بصلاحيات المستخدم ollama وتحتفظ بالنماذج في المسار /usr/share/ollama/.ollama/models. هذا المسار يقع ضمن نظام ملفات الجذر (root filesystem) في معظم صور الخوادم الافتراضية (VPS)، لذا تحقق من المساحة المتوفرة قبل طلب 25 جيجابايت.
df -h /usr/share/ollamaعملية السحب التي تتوقف في منتصف الطريق وتُبلغ عن الخطأ no space left on device تعني ذلك حرفياً، وتبقى الأجزاء (blobs) غير المكتملة على القرص حتى تقوم بحذفها. بعد ذلك، تأكد مما تم تنزيله بنجاح:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mيطبع الأمر ollama show البنية المعمارية، وعدد المعاملات (parameters)، وطول السياق (context length)، ومستوى التكميم (quantisation) الذي يحمله الملف فعلياً. إذا اختلف أي من هذه القيم مع ما هو مذكور في صفحة المكتبة، فهذا يعني أنك سحبت وسماً مختلفاً عما كنت تقصده.
قم بتشغيل النموذج، وتحقق من مكان تشغيله الفعلي
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"بينما لا يزال النموذج محملاً في الذاكرة، افتح نافذة طرفية (shell) ثانية ونفذ الأمر التالي:
ollama psهذا هو الأمر الذي يجيب على سؤال الذاكرة الخاص بجهازك. يطبع ollama ps النموذج المحمّل، والحجم الذي يشغله في الذاكرة، وعموداً باسم PROCESSOR. تعني القيمة 100% GPU أن النموذج بالكامل موجود في ذاكرة الفيديو (VRAM). أما القيمة 100% CPU فتعني عدم وجود أي جزء منه في ذاكرة الفيديو، وأن المعالج يقوم بحساب كل رمز (token) باستخدام ذاكرة النظام (RAM). يشير التقسيم مثل 65%/35% CPU/GPU إلى أن الطبقات لم تتسع بالكامل في ذاكرة الفيديو، وأن حصة المعالج (CPU) هي التي تحدد سرعتك. لا تعتمد على التقديرات؛ قم بتحميل النموذج واقرأ هذا السطر.
إذا تعذر تحميل النموذج تماماً، سيرفض Ollama ذلك بوضوح بدلاً من التوقف المفاجئ (crash):
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)هل خادم VPS المعتمد على المعالج (CPU) فقط سريع بما يكفي؟
لا يحتوي خادم VPS للأغراض العامة على وحدة معالجة رسوميات (GPU)، لذا يقوم المعالج بكل العمل ويقرأ كل الأوزان التي يحتاجها من ذاكرة الوصول العشوائي (RAM) للنظام. تساعد تقنية MoE هنا، لأن حوالي 3 مليار فقط من أصل 30 مليار معامل يتم التعامل معها لكل رمز (token)، لذا فإن العمليات الحسابية لكل رمز أقل بكثير مما هي عليه في نموذج كثيف بحجم 30B. لكن الذاكرة لا تستفيد من ذلك على الإطلاق؛ إذ يجب أن تبقى جميع المعاملات البالغ عددها 30 ملياراً مقيمة في الذاكرة، لأن الموجه (router) يمكنه اختيار أي خبير لأي رمز.
لذا، فإن الاستنتاج (inference) المعتمد على المعالج فقط في هذا النموذج محدود بعرض نطاق الذاكرة (memory bandwidth) وليس بعدد الأنوية. إضافة المزيد من vCPUs إلى خطة تمتلك بالفعل عدداً معقولاً منها لا يغير الكثير. ما تحتاجه هو ذاكرة RAM كافية لحمل الأوزان بالإضافة إلى ذاكرة التخزين المؤقت KV، وأسرع ذاكرة توفرها لك الخطة.
قِس الأداء قبل تخصيص وكيل (agent) له، باستخدام الطريقة الموضحة في قياس الرموز في الثانية لنموذج لغوي محلي:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."السطر eval rate الذي يُطبع في النهاية هو سرعة التوليد لديك بالرموز في الثانية. هذا الرقم الفردي هو الذي يحسم المسألة، لأن الوقت الفعلي (wall-clock time) الذي يستغرقه الوكيل يعتمد عليه بشكل أساسي.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]هذه أرقام منشورة من طرف ثالث، تم تحويلها من الدقائق لكل مهمة التي أبلغت عنها Artificial Analysis عند الإطلاق، وقد تم قياسها على نقاط نهاية GPU مستضافة بدلاً من خادم VPS. بلغ متوسط Nemotron 3.5 Lightning حوالي 30 ثانية لكل مهمة، حيث استغرقت gpt-oss-120b حوالي 204 واستغرقت Qwen3.6 35B حوالي 210. استخدم هذه الأرقام لفهم طبيعة الفجوة، وليس كوعود بشأن أداء عتادك.
تعتمد النصيحة الصادقة على من ينتظر النتائج. إذا كان هناك شخص ينتظر الوكيل، أو إذا كان الوكيل يقوم بسلاسل طويلة من الاستدعاءات المتتالية، فاستأجر سعة GPU. إذا كان الوكيل يعمل وفق جدول زمني ليلاً ولا يراقبه أحد، فإن خطة CPU بذاكرة RAM كبيرة تعد خياراً معقولاً. في كلتا الحالتين، الإعداد هو نفسه، ويغطي تشغيل Ollama على خادم VPS كيفية تحديد حجم الخطة وكيفية مقارنة مثيل GPU بالدفع لمزود API لكل رمز. نقطة التعادل هي مسألة استغلال: يتم محاسبتك على مثيل GPU عن كل ساعة وجود له، بينما يتم محاسبتك على رموز API فقط عند استخدامها، لذا فإن الوكيل الذي يعمل معظم اليوم يفضل الخادم الذي تمتلكه، بينما الوكيل الذي يعمل مرتين في الساعة عادة لا يفضل ذلك.
نافذة السياق بحجم 1M ليست مجانية
حجم 1M من الرموز (tokens) هو الحد الأقصى للنموذج، ولا يوفره لك Ollama افتراضياً. يقدّم Ollama نافذة افتراضية أصغر بكثير، ويقوم بحذف أقدم الرموز بمجرد تجاوز المحادثة لهذا الحجم. لا يتم تسجيل أي شيء عند حدوث ذلك، لذا يبدو الأمر بالنسبة للوكيل (agent) وكأن النموذج قد نسي بداية مهمته الخاصة.
اضبط النافذة بشكل مقصود. للخادم بالكامل، عدّل الخدمة:
sudo systemctl edit ollamaأضف هذا، ثم نفّذ sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"لكل طلب، أرسل num_ctx ضمن كائن الخيارات (options object) بدلاً من ذلك:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'كل زيادة تستهلك ذاكرة، لأن ذاكرة التخزين المؤقت KV تنمو مع عدد الرموز التي تسمح بها. ارفع القيمة، وأعد التشغيل، ثم نفّذ ollama ps مجدداً وراقب الحجم المُبلغ عنه وهو يرتفع. إذا تحول عمود PROCESSOR من 100% GPU إلى حالة الانقسام (split) بعد ذلك التغيير، فهذا يعني أن ذاكرة التخزين المؤقت KV قد دفعت طبقات النموذج خارج ذاكرة الفيديو (VRAM) وستنخفض سرعتك بشكل حاد. يشرح اختيار num_ctx في Ollama هذه المقايضة بالتفصيل. لا تضبط القيمة على 1000000 لمجرد أن بطاقة النموذج تسمح بذلك، لأن التخصيص يحدث مسبقاً وسيفشل التحميل ببساطة.
ربطها بعميل يعمل باستمرار
يوثّق منشور إطلاق Ollama لهذا النموذج اختصاراً يبدأ عميلاً مدعوماً موجهاً إليه مسبقاً:
ollama launch claude --model nemotron-3.5-lightningيوثّق المنشور claude وopencode وopenclaw وhermes في هذا الموضع. يتطلب الأمر الفرعي إصداراً حديثاً من Ollama، لذا تحقق من ollama --version أولاً، وإذا كان مفقوداً، وجّه العميل إلى واجهة برمجة التطبيقات (API) بنفسك. يكشف Ollama عن نقطة نهاية متوافقة مع OpenAI، والتي تقبلها معظم بيئات تشغيل العملاء:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaيتجاهل Ollama المفتاح، لكن معظم العملاء يرفضون البدء دون تعيين مفتاح. جانب بيئة التشغيل لهذا الأمر مغطى في توجيه عميل برمجي إلى Ollama وفي بناء عميل OpenClaw الخاص بك.
هناك إعدادان للخادم يهمانك بمجرد تشغيل العميل دون مراقبة. يتحكم OLLAMA_KEEP_ALIVE في المدة التي يبقى فيها النموذج في الذاكرة بعد آخر طلب، ويقوم الإعداد الافتراضي بإلغاء تحميله بعد خمس دقائق، مما يجعل الطلب التالي يتحمل وقت التحميل بالكامل مرة أخرى. بالنسبة لملف بحجم 25 GB بدون وحدة معالجة رسوميات (GPU)، يكون هذا التوقف طويلاً بما يكفي لكسر مهلة الاتصال. اضبط OLLAMA_KEEP_ALIVE=-1 لإبقائه مقيماً في الذاكرة. يجعل OLLAMA_HOST=0.0.0.0:11434 واجهة برمجة التطبيقات قابلة للوصول من أجهزة أخرى، وهي لا تحمل أي نوع من المصادقة، لذا لا تفتحها إلا خلف قاعدة جدار ناري أو ضمن شبكة خاصة.
أنماط الفشل، مع السلاسل النصية التي ستراها
يفشل السحب فوراً. تعني Error: pull model manifest: file does not exist أن هذا الوسم (tag) غير موجود. أسماء الوسوم هي سلاسل نصية دقيقة، لذا انسخ واحداً من صفحة المكتبة بدلاً من تخمين لاحقة التكميم (quantisation).
لا يتم تحميل النموذج. تعني Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) أن حجم الوسم أكبر من المسموح به في هذه الخطة وفق الإعدادات الحالية. انتقل إلى تكميم أصغر، أو قلل OLLAMA_CONTEXT_LENGTH، لأن ذاكرة التخزين المؤقت KV تُحتسب ضمن هذا المتطلب.
لا توجد استجابة على المنفذ 11434. تعني curl: (7) Failed to connect to localhost port 11434 أن الخدمة لا تعمل، أو أنها لا تستمع في المكان الذي تتوقعه. اقرأ systemctl status ollama و journalctl -u ollama -n 50. إذا قمت أيضاً بتشغيل ollama serve يدوياً، فإن النسخة الثانية ستخرج مع الخطأ Error: listen tcp 127.0.0.1:11434: bind: address already in use.
الاستجابة بطيئة جداً. تحقق من ollama ps قبل تغيير أي شيء. أي حصة للمعالج (CPU) في عمود PROCESSOR على جهاز يحتوي على وحدة معالجة رسومية (GPU) تعني أن جزءاً من النموذج قد خرج من ذاكرة VRAM، لذا قلل سياق العمل (context) أو استخدم تكميماً أصغر. على جهاز لا يحتوي على GPU، البطء هو النتيجة المتوقعة ولا يوجد إعداد يمكنه إصلاح ذلك.
ينسى الوكيل تعليماته في منتصف المهمة. تجاوزت المحادثة نافذة السياق (context window) وتم تجاهل أقدم الرموز (tokens) بصمت. ارفع قيمة OLLAMA_CONTEXT_LENGTH، وتأكد عبر ollama ps من أن النموذج لا يزال ملائماً، وإذا لم يعد كذلك، فالحل هو استخدام جهاز أكبر بدلاً من تقليل النافذة.
موقع هذا النموذج مقارنة بالبدائل
يُعد نموذج 30B MoE خياراً ضخماً للاستضافة في المهام الصغيرة. إذا كان نموذج 8B كثيف (dense) يؤدي مهمتك بالفعل، فستكون تكلفة تشغيله أقل بكثير وسيحتاج ثوانٍ فقط للتحميل، وتُعد Qwen 3 بإصداري 8B و27B على خادم VPS المقارنة المباشرة لاتخاذ هذا القرار. للحصول على نظرة أشمل حول ما يمكن لخطة استضافة معينة استيعابه فعلياً، ابدأ من نماذج الذكاء الاصطناعي التي يمكنك استضافتها ذاتياً. إذا كنت تخطط لخدمة عدة وكلاء (agents) في وقت واحد بدلاً من وكيل واحد، اقرأ مقارنة بين Ollama وvLLM أولاً، لأن Ollama لا يقوم بمعالجة الطلبات المتزامنة على دفعات (batching) بالطريقة التي يعمل بها خادم الاستنتاج المخصص للإنتاج، وهنا تتوقف قابلية التوسع في إعدادات المستخدم الواحد.
FAQ
ما هو وسم Nemotron 3.5 Lightning الذي يجب عليّ سحبه على خادم Linux VPS؟
استخدم nemotron-3.5-lightning:30b-a3b-q4_K_M. حجمه 25 جيجابايت، ويدعم سياقاً كاملاً يصل إلى 1 مليون رمز (token)، وهو يطابق نفس البصمة البرمجية (digest) التي تشير إليها الوسوم latest و30b و30b-a3b اعتباراً من أغسطس 2026. حدد الاسم صراحة بدلاً من سحب latest، لضمان عدم تغير سلوك الوكيل الخاص بك دون علمك في حال إعادة نشر ذلك الوسم مستقبلاً. الوسوم mlx مخصصة لمعالجات Apple silicon ولن تعمل على Linux.
ما مقدار ذاكرة الوصول العشوائي (RAM) التي يحتاجها Nemotron 3.5 Lightning؟
لا تنشر NVIDIA حداً أدنى للذاكرة لإصدارات Ollama، لذا قم بالقياس بدلاً من التقدير. اسحب الوسم، وشغّل النموذج مرة واحدة، واقرأ ollama ps أثناء تحميله: سيطبع الحجم المشغول فعلياً وما إذا كان النموذج قد استقر في وحدة معالجة الرسوميات (GPU) أو المعالج (CPU). حجم التنزيل، 25 جيجابايت للوسم الافتراضي، هو الحد الأدنى، لأن ذاكرة التخزين المؤقت KV تُضاف فوقه وتنمو مع نافذة السياق التي تضبطها. إذا كانت الخطة صغيرة جداً، سيرفض Ollama التشغيل مع ظهور model requires more system memory وسيذكر الرقمين.
هل يمكنني تشغيل Nemotron 3.5 Lightning على خادم VPS بدون وحدة معالجة رسوميات (GPU)؟
نعم، إذا كانت الخطة توفر ذاكرة RAM كافية لحمل الأوزان، ويساعد تصميم MoE في ذلك لأن حوالي 3 فقط من أصل 30 مليار معامل يتم حسابها لكل رمز. العائق هو السرعة. بدون GPU، يقتصر أداء النموذج على عرض نطاق الذاكرة، لذا فإن إضافة vCPUs لن تحسن النتيجة بشكل ملحوظ. شغّل ollama run --verbose مع نص برمجي ثابت، واقرأ سطر eval rate، وقارن ذلك الرقم بالوقت المتاح للوكيل الخاص بك. بالنسبة لمهام المعالجة الدفعية (batch job) التي تعمل ليلاً، غالباً ما يكون الأمر مقبولاً. أما بالنسبة لأي شيء ينتظره مستخدم، فعادةً لا يكون كذلك.
لماذا لا يمنحني Ollama نافذة سياق كاملة بحجم 1 مليون؟
1 مليون هو الحد الأقصى للنموذج، وليس الإعداد الافتراضي في Ollama. يطبق Ollama نافذة أصغر بكثير ويتخلص من الرموز الأقدم بمجرد تجاوز المحادثة لها، دون طباعة أي خطأ، مما يظهر كأن الوكيل قد نسي تعليماته. اضبط OLLAMA_CONTEXT_LENGTH في خدمة systemd، أو مرر num_ctx لكل طلب. ارفع القيمة تدريجياً وأعد التحقق من ollama ps في كل مرة، لأن ذاكرة التخزين المؤقت KV تتناسب طردياً مع حجم النافذة وقد تؤدي إلى إخراج طبقات النموذج من الـGPU.
هل استخدام Nemotron 3.5 Lightning مجاني للأغراض التجارية؟
تضع بطاقة نموذج NVIDIA النموذج تحت ترخيص OpenMDW-1.1 وتصنفه جاهزاً للاستخدام التجاري. يغطي هذا الأوزان التي تقوم بتنزيلها وتشغيلها بنفسك. لا يتطرق الترخيص للبرمجيات الأخرى في حزمة العمل الخاصة بك، لذا تحقق من تراخيص وكيل التشغيل وأي أدوات تربطها به بشكل منفصل، واقرأ بطاقة النموذج الحالية قبل الاعتماد عليها في أي التزامات تعاقدية.