SSD Nodes Learn Hosting plans →
الأدلة Matt Connorبقلم Matt Connor · آخر تحديث في 2026-08-23

شغّل Nemotron 3.5 Lightning على خادم VPS

شغّل NVIDIA Nemotron 3.5 Lightning عبر Ollama على خادمك: تعرّف إلى الوسم الصحيح للسحب، وذاكرة RAM المطلوبة، وسرعة التشغيل بالمعالج فقط.

ما الغرض من Nemotron 3.5 Lightning

Nemotron 3.5 Lightning هو نموذج NVIDIA المفتوح بنمط mixture-of-experts وبحجم 30B، وقد أُصدر في August 2026. صُمّم للوكلاء الذين يعملون لساعات، وليس لنافذة محادثة واحدة. يعني MoE ‏(mixture of experts) تقسيم الأوزان إلى العديد من الشبكات الفرعية الخبيرة، ثم تمرير كل token عبر عدد قليل منها فقط. تذكر بطاقة النموذج أن إجمالي عدد المعاملات يبلغ 30 billion، مع تفعيل 3 billion لكل token. تتحمل في الذاكرة تكلفة العدد الكبير. وتحصل في السرعة على أثر العدد الصغير.

هذا التبادل هو سبب ملاءمة النموذج لخادم تستأجره. يرسل الوكيل الذي ينفّذ عملاً فعلياً آلاف الطلبات القصيرة على مدار اليوم، لذلك تحدد الإنتاجية مقابل التكلفة ما إذا كان يمكن تشغيله على خادمك الخاص. النموذج الذي يستغرق 40 seconds لكل رد قد يكون مساعداً عملياً، لكنه وكيل ضعيف، لأن المهمة الواحدة تنفّذ twenty calls وتنتظر كل واحدة منها.

تصف NVIDIA البنية بأنها هجينة: طبقات Mamba-2 وMoE متداخلة، مع طبقات attention مختارة. تذكر بطاقة النموذج أن الحد الأقصى لطول السياق يصل إلى 1M tokens، وأن الترخيص هو OpenMDW-1.1 وموسوم بأنه جاهز للاستخدام التجاري. اللغات الأساسية هي English وcode، كما تدرج البطاقة Spanish وFrench وGerman وItalian وJapanese.

نشرت Artificial Analysis قياسات الإطلاق في August 2026، وأظهرت ما يقارب 670 output tokens per second، على نقطة نهاية DeepInfra تجريبية قبل الإصدار تقدم أوزان NVFP4. هذه نقطة نهاية GPU مستضافة. تعامل مع الرقم باعتباره ما تسمح به البنية، لا باعتباره الأداء الذي سيقدمه VPS لديك.

أي وسم Ollama يناسب كل VPS

تنشر مكتبة Ollama إصدارات متعددة من الأوزان نفسها. ويكمن الاختلاف بينها في quantisation، أي عدد البتات المستخدمة لتخزين كل وزن، وهذا يغيّر حجم التنزيل بدرجة كبيرة.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

تحيل الوسوم المسماة latest و30b و30b-a3b جميعها إلى digest نفسه الخاص بـ 30b-a3b-q4_K_M، ولذلك يكون التنزيل الافتراضي هو الإصدار ذي 4 بتات بحجم 25 GB وبسعة سياق كاملة تبلغ 1M. يبلغ حجم Q8_0 ‏35 GB، بينما يبلغ حجم bf16 ‏66 GB، وكلاهما بسعة سياق تبلغ 1M. أما إصدارات MLX بحجم 23 GB فهي مخصصة لـ Apple silicon وتقتصر على سياق بسعة 256K، ولذلك فهي ليست الخيار الصحيح على VPS يعمل بنظام Linux.

هذه أحجام التنزيل، وليست متطلبات الذاكرة. لا تنشر NVIDIA رقماً أدنى لـ VRAM (ذاكرة الفيديو) لإصدارات Ollama، لذلك اعتبر حجم التنزيل حداً أدنى فقط، ولا تستنتج منه شيئاً آخر. يجب أن تبقى الأوزان محمّلة في مكان ما: في ذاكرة GPU إذا كانت البطاقة تستوعبها، وفي ذاكرة النظام RAM خلاف ذلك. ويُضاف إليها KV cache (ذاكرة التخزين المؤقت للمفتاح/القيمة، وهي الذاكرة التي يستخدمها النموذج لكل token من المحادثة). تحصل على الرقم الفعلي لجهازك من أمر، وليس من الحسابات النظرية، ويظهر هذا الأمر أدناه. إذا لم تحدد مستوى quantisation بعد، فتوضح تكلفة Q4 وQ8 وFP16 لكل منها ما الذي تتخلى عنه في كل خطوة.

اسحب الوسم المحدد تماماً، ولا تستخدم latest

latest مؤشر متغير. عندما تعيد المكتبة نشره، سيتغير سلوك وكيلك عند عملية السحب التالية، من دون وجود شيء في ملاحظاتك يوضح السبب. سمِّ الوسم.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

ينشئ برنامج التثبيت خدمة systemd تعمل بحساب المستخدم ollama، وتحتفظ بالنماذج ضمن /usr/share/ollama/.ollama/models. يوجد هذا المسار في نظام الملفات الجذر على معظم صور VPS، لذلك تحقّق من توفر مساحة كافية قبل أن تطلب 25 GB. إذا كانت المساحة المتوفرة في نظام الملفات محدودة، فمن المفيد قراءة مكان تخزين Ollama لنماذجه وكيفية نقلها قبل عملية السحب، لا بعد امتلاء القرص.

df -h /usr/share/ollama

إذا توقفت عملية السحب في منتصفها وأبلغت عن no space left on device، فهذا يعني ذلك تحديداً، وتبقى الكتل الجزئية على القرص إلى أن تحذفها. ثم تحقّق مما تم تنزيله:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

يطبع ollama show البنية، وعدد المعاملات، وطول السياق، ونوع quantisation الموجود فعلياً في الملف. إذا اختلف أي من هذه العناصر عن صفحة المكتبة، فقد سحبت وسمًا مختلفاً عن الوسم الذي قصدته.

شغّل النموذج، وتحقق من مكان تشغيله فعلياً

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

أثناء بقاء النموذج محمّلاً، افتح shell ثانياً:

ollama ps

هذا هو الأمر الذي يجيب عن سؤال الذاكرة على جهازك. يعرض ollama ps النموذج المحمّل، وحجم الذاكرة الذي يشغله، وعمود PROCESSOR. تعني 100% GPU أن النموذج موجود بالكامل في VRAM. وتعني 100% CPU أنه لا يوجد منه شيء فيها، وأن المعالج يحسب كل token باستخدام RAM النظام. ويعني توزيع مثل 65%/35% CPU/GPU أن الطبقات لم تتسع لها VRAM كلها، وأن حصة CPU تحدد سرعتك. لا تقدّر المتطلبات. حمّل النموذج واقرأ هذا السطر.

إذا تعذر تحميله تماماً، يرفض Ollama العملية بطريقة سليمة بدلاً من التعطل:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

هل تكفي VPS تعمل بوحدة CPU فقط؟

لا تحتوي VPS عامة الغرض على GPU، لذلك تنفّذ CPU كل العمل وتقرأ كل وزن تحتاج إليه من ذاكرة RAM النظام. يساعد MoE في هذه الحالة، لأن نحو 3 مليارات فقط من أصل 30 مليار معلمة تُستخدم لكل token، ولذلك تكون العمليات الحسابية لكل token أقل بكثير من نموذج dense بحجم 30B. لكن الذاكرة لا تستفيد من ذلك إطلاقاً. يجب أن تبقى المعلمات الثلاثون ملياراً كلها مقيمة في الذاكرة، لأن router يمكنه اختيار أي expert لأي token.

لذلك، يتحدد أداء الاستدلال باستخدام CPU فقط في هذا النموذج بعرض نطاق الذاكرة، لا بعدد الأنوية. تؤدي إضافة vCPUs إلى خطة تحتوي بالفعل على عدد معقول منها إلى تغيير محدود جداً. ما تحتاج إليه هو RAM كافية لاستيعاب الأوزان وذاكرة KV cache، إضافة إلى أسرع ذاكرة توفرها الخطة.

قِس الأداء قبل أن تعتمد عليه لتشغيل agent، باستخدام الطريقة الواردة في قياس عدد tokens في الثانية لنموذج LLM محلي:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

يمثل السطر eval rate المطبوع في النهاية سرعة التوليد لديك بوحدة tokens في الثانية. يحدد هذا الرقم وحده الإجابة، لأن الزمن الفعلي الذي يستغرقه agent يتأثر به بدرجة كبيرة. اضربه في طول الرد الذي تتوقعه. إذا كان الناتج أطول من مدة الانتظار المقبولة لديك، فإن تحديد الحد الأقصى للإخراج باستخدام num_predict هو الوسيلة التي تضع حداً لمدة استدعاء واحد دون تغيير العتاد.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

هذه أرقام منشورة من جهات خارجية، حُوّلت من الدقائق لكل مهمة التي أبلغت عنها Artificial Analysis عند الإطلاق. وقد قيسَت على نقاط نهاية GPU مستضافة، لا على VPS. بلغ متوسط Nemotron 3.5 Lightning نحو 30 ثانية لكل مهمة، إذ استغرقت gpt-oss-120b نحو 204، بينما استغرقت Qwen3.6 35B نحو 210. استخدم هذه الأرقام لفهم حجم الفارق، لا باعتبارها ضماناً لأداء عتادك.

تعتمد التوصية الصادقة على الجهة التي تنتظر النتيجة. إذا كان شخص ينتظر agent، أو كان agent ينفذ سلاسل طويلة من الاستدعاءات المتتالية، فاستأجر سعة GPU. أما إذا كان يعمل وفق جدول أثناء الليل ولا يراقبه أحد، فخطة CPU ذات RAM كبيرة خيار مناسب. في كلتا الحالتين، تكون عملية الإعداد نفسها، ويشرح تشغيل Ollama على VPS كيفية اختيار حجم الخطة وكيف تقارن مثيلاً يعمل بـGPU بتكلفة الدفع لمزود API لكل token. نقطة التعادل مسألة استخدام: يفرض مثيل GPU رسوماً عن كل ساعة يكون فيها موجوداً، بينما تُحتسب tokens الخاصة بـAPI عند استخدامها فقط. لذلك يفضّل agent الذي يعمل معظم اليوم الخادم الذي تملكه، بينما لا يفضّل ذلك عادةً agent يعمل مرتين في الساعة.

نافذة السياق البالغة 1M ليست متاحة تلقائياً

يمثل 1M من الرموز الحد الأقصى للنموذج، ولا يمنحك Ollama هذه القيمة افتراضياً. يوفّر Ollama نافذة افتراضية أصغر بكثير، ويحذف أقدم الرموز عند تجاوز المحادثة هذه النافذة. ولا يُسجّل أي شيء عند حدوث ذلك، لذلك يبدو الأمر للوكيل كما لو أنّ النموذج نسي بداية مهمته.

حدّد حجم النافذة صراحةً. لتطبيقه على الخادم بأكمله، عدّل الخدمة:

sudo systemctl edit ollama

أضف هذا السطر، ثم شغّل sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

أما لكل طلب، فأرسل num_ctx داخل كائن الخيارات بدلاً من ذلك:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

تستهلك كل زيادة مزيداً من الذاكرة، لأن ذاكرة التخزين المؤقت KV تكبر مع عدد الرموز التي تسمح بها. ارفع القيمة، ثم أعد التشغيل، وشغّل ollama ps مرة أخرى وراقب ازدياد الحجم المبلّغ عنه. إذا تحوّل العمود PROCESSOR من 100% GPU إلى split بعد هذا التغيير، فهذا يعني أنّ ذاكرة التخزين المؤقت KV دفعت طبقات النموذج خارج VRAM، وستنخفض السرعة بشدة. يشرح اختيار num_ctx في Ollama هذه المفاضلة بالتفصيل. لا تضبط القيمة على 1000000 لمجرد أنّ بطاقة النموذج تسمح بها، لأن التخصيص يحدث مسبقاً، وسيفشل التحميل ببساطة.

ربط النموذج بوكيل يعمل باستمرار

يوثّق منشور إطلاق هذا النموذج من Ollama اختصاراً يشغّل وكيلاً مدعوماً وموجهاً إليه مسبقاً:

ollama launch claude --model nemotron-3.5-lightning

يوثّق المنشور claude وopencode وopenclaw وhermes في ذلك الموضع. يحتاج هذا الأمر الفرعي إلى إصدار حديث من Ollama، لذلك تحقّق أولاً من ollama --version. إذا لم يكن متوفراً، وجّه الوكيل إلى API يدوياً. يوفّر Ollama نقطة نهاية متوافقة مع OpenAI، وتقبلها معظم أطر تشغيل الوكلاء:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

يتجاهل Ollama المفتاح، لكن معظم العملاء يرفضون البدء من دونه. يشرح توجيه وكيل برمجي إلى Ollama جانب إعداد إطار التشغيل، كما يشرح إنشاء وكيل OpenClaw خاص بك ذلك أيضاً.

يهم إعدادان للخادم عندما يعمل الوكيل دون مراقبة. يتحكّم OLLAMA_KEEP_ALIVE في المدة التي يبقى فيها النموذج في الذاكرة بعد الطلب الأخير. يفرّغ الإعداد الافتراضي النموذج بعد خمس دقائق، لذلك يستغرق الطلب التالي وقت التحميل الكامل مجدداً. في ملف حجمه 25 GB ومن دون GPU، تكون هذه المهلة طويلة بما يكفي لتجاوز مهلة الانتظار. اضبط OLLAMA_KEEP_ALIVE=-1 لإبقاء النموذج في الذاكرة. يجعل OLLAMA_HOST=0.0.0.0:11434 API قابلاً للوصول من أجهزة أخرى، ولا يوفّر أي نوع من المصادقة، لذلك لا تفتحه إلا خلف قاعدة جدار ناري أو على شبكة خاصة.

أنماط الفشل، مع السلاسل النصية التي ستراها

يفشل السحب فوراً. يعني Error: pull model manifest: file does not exist أن هذه الوسمة غير موجودة. أسماء الوسوم سلاسل نصية دقيقة، لذا انسخ إحداها من صفحة المكتبة بدلاً من تخمين لاحقة quantisation.

لا يُحمَّل النموذج. يعني Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) أن الوسمة أكبر من أن تناسب هذه الخطة وفق الإعدادات الحالية. انتقل إلى quantisation أصغر، أو خفّض OLLAMA_CONTEXT_LENGTH، لأن ذاكرة التخزين المؤقت KV تُحتسب ضمن هذا المتطلب.

لا يستجيب أي شيء على المنفذ 11434. يعني curl: (7) Failed to connect to localhost port 11434 أن الخدمة لا تعمل، أو أنها لا تستمع على العنوان المتوقع. اقرأ systemctl status ollama وjournalctl -u ollama -n 50. إذا شغّلت أيضاً ollama serve يدوياً، فستخرج النسخة الثانية مع Error: listen tcp 127.0.0.1:11434: bind: address already in use.

تستجيب، ولكن ببطء شديد. افحص ollama ps قبل تغيير أي شيء. إن ظهرت أي حصة CPU في العمود PROCESSOR على جهاز مزود بـGPU، فهذا يعني أن جزءاً من النموذج خرج من VRAM، لذا خفّض السياق أو استخدم quantisation أصغر. على جهاز لا يحتوي على GPU، يكون البطء متوقعاً، ولا يمكن لأي إعداد إصلاحه.

ينسى الوكيل تعليماته في منتصف المهمة. تجاوزت المحادثة نافذة السياق، وأُسقطت أقدم الرموز بصمت. ارفع OLLAMA_CONTEXT_LENGTH، وتحقق باستخدام ollama ps من أن النموذج ما زال يناسب الجهاز. إذا لم يعد يناسبه، فالحل هو استخدام جهاز أكبر، لا تقليص النافذة.

مقارنة هذا النموذج بالبدائل

تُعد استضافة نموذج MoE بحجم 30B مهمة كبيرة إذا كان الاستخدام محدوداً. إذا كان نموذج كثيف بحجم 8B ينجز مهمتك بالفعل، فستكون كلفة تشغيله أقل بكثير، وسيُحمَّل خلال ثوانٍ. راجع Qwen 3 بحجمي 8B و27B على VPS للمقارنة المباشرة اللازمة لاتخاذ هذا القرار. وللاطلاع على مسح أوسع للنماذج التي يمكن لخطة معينة استضافتها فعلياً، ابدأ من نماذج AI التي يمكنك استضافتها ذاتياً. إذا كنت تخطط لتشغيل عدة agents في الوقت نفسه بدلاً من agent واحد، فاقرأ أولاً مقارنة Ollama مع vLLM، لأن Ollama لا ينفذ batch للطلبات المتزامنة بالطريقة التي ينفذها خادم inference مخصص لبيئات الإنتاج، وعند هذه النقطة يتوقف إعداد المستخدم الواحد عن التوسع.

FAQ

ما هي وسم Nemotron 3.5 Lightning الذي ينبغي أن أسحبه على VPS يعمل بنظام Linux؟

استخدم nemotron-3.5-lightning:30b-a3b-q4_K_M. حجمه 25 GB، ويدعم سياقاً كاملاً بحد أقصى يبلغ 1M، وهو نفس الـdigest الذي تشير إليه الوسوم latest و30b و30b-a3b حتى August 2026. سمّه صراحةً بدلاً من سحب latest، حتى لا يؤدي نشر ذلك المؤشر مجدداً في المستقبل إلى تغيير سلوك وكيلك من دون أن تلاحظ ذلك. الوسوم mlx مخصّصة لبنى Apple silicon، ولن تفيدك على Linux.

ما مقدار RAM الذي يحتاج إليه Nemotron 3.5 Lightning؟

لا تنشر NVIDIA رقماً أدنى للذاكرة لبنى Ollama، لذلك قِس الاستخدام بدلاً من تقديره. اسحب الوسم، وشغّل النموذج مرة واحدة، واقرأ ollama ps أثناء بقائه محمّلاً؛ إذ يطبع الحجم المشغول فعلياً، وما إذا كان قد وُضع على GPU أو CPU. حجم التنزيل، وهو 25 GB للوسم الافتراضي، يمثل الحد الأدنى فقط، لأن KV cache تُضاف إليه وتنمو مع نافذة السياق التي تضبطها. إذا كانت الخطة صغيرة جداً، يرفض Ollama التشغيل مع model requires more system memory ويعرض الرقمين معاً.

هل يمكنني تشغيل Nemotron 3.5 Lightning على VPS بلا GPU؟

نعم، إذا كانت الخطة تتضمن RAM كافية لاستيعاب الأوزان. ويساعد تصميم MoE لأن نحو 3 فقط من أصل 30 billion parameter تُحسب لكل token. المشكلة هي السرعة. من دون GPU، يقيّد عرض نطاق الذاكرة النموذج، لذلك لا تؤدي زيادة vCPUs إلا إلى تحسن طفيف في النتيجة. شغّل ollama run --verbose باستخدام prompt ثابت، واقرأ السطر eval rate، ثم قارن هذا الرقم بالمهلة المحددة لوكيلك. يكون ذلك مناسباً غالباً لمهمة batch تعمل طوال الليل. لكنه لا يكون مناسباً عادةً لأي مهمة ينتظر الشخص نتيجتها.

لماذا لا يمنحني Ollama نافذة السياق الكاملة البالغة 1M؟

يمثل 1M الحد الأقصى للنموذج، وليس الإعداد الافتراضي في Ollama. يطبّق Ollama نافذة أصغر بكثير، ويحذف أقدم tokens عندما تتجاوز المحادثة هذه النافذة، من دون طباعة أي خطأ، فيبدو الأمر كما لو أن الوكيل نسي تعليماته الخاصة. اضبط OLLAMA_CONTEXT_LENGTH في خدمة systemd، أو مرّر num_ctx مع كل request. ارفع القيمة على مراحل، وأعد التحقق من ollama ps في كل مرة، لأن ذاكرة KV cache تتناسب مع حجم النافذة، وقد يؤدي ذلك إلى نقل بعض طبقات النموذج خارج GPU.

هل يُسمح باستخدام Nemotron 3.5 Lightning تجارياً مجاناً؟

تضع بطاقة نموذج NVIDIA النموذج تحت ترخيص OpenMDW-1.1، وتذكر أنه جاهز للاستخدام التجاري. وينطبق ذلك على الأوزان التي تنزّلها وتشغّلها بنفسك. لكنه لا يشمل البرامج الأخرى في مكدسك، لذلك تحقّق بشكل منفصل من تراخيص agent harness وأي أدوات تربطها به، واقرأ بطاقة النموذج الحالية قبل الاعتماد على ذلك في أي أمر تعاقدي.