اجرای مدل Nemotron 3.5 Lightning روی VPS با Ollama
راهنمای کامل اجرای Nemotron 3.5 Lightning روی سرور شخصی. نحوه استفاده از دستور ollama run nemotron-3.5-lightning، میزان RAM مورد نیاز و بررسی عملکرد CPU برای این مدل.
کاربرد Nemotron 3.5 Lightning چیست
مدل Nemotron 3.5 Lightning یک مدل Mixture-of-Experts با 30 میلیارد پارامتر از شرکت NVIDIA است که در اوت 2026 منتشر شد. این مدل برای عاملهایی (agents) طراحی شده که بهجای یک پنجره چت ساده، برای ساعتها فعالیت میکنند. ساختار MoE (ترکیب متخصصان) به این معناست که وزنها به چندین زیرشبکه تخصصی تقسیم شدهاند و هر توکن تنها از میان تعداد کمی از آنها عبور میکند. طبق کارت مدل NVIDIA، این مدل در مجموع 30 میلیارد پارامتر دارد که در هر توکن، 3 میلیارد پارامتر فعال هستند. شما هزینه تعداد زیاد پارامترها را در حافظه (RAM/VRAM) میپردازید، اما در عوض سرعتِ مربوط به تعداد کم پارامترهای فعال را دریافت میکنید.
این معامله (Trade-off) دلیلی است که باید برای سرورهای اجارهای خود به این مدل توجه کنید. عاملی که در طول روز کارهای واقعی انجام میدهد، هزاران درخواست کوتاه ارسال میکند؛ بنابراین، نرخ خروجی (throughput) به ازای هر دلار تعیین میکند که آیا این مدل میتواند روی سرور شخصی شما اجرا شود یا خیر. مدلی که برای هر پاسخ 40 ثانیه زمان میبرد، یک دستیار قابلقبول اما یک عامل ضعیف است، زیرا یک وظیفه ممکن است بیست فراخوانی ایجاد کند و شما باید برای تکتک آنها منتظر بمانید.
NVIDIA معماری این مدل را هیبریدی توصیف میکند: لایههای Mamba-2 و MoE بهصورت درهمتنیده (interleaved) به همراه لایههای توجه (attention) منتخب. کارت مدل، حداکثر طول کانتکست را تا 1M توکن اعلام کرده و دارای مجوز OpenMDW-1.1 است که برای استفاده تجاری آماده است. زبانهای اصلی آن انگلیسی و کدنویسی هستند، اما زبانهای اسپانیایی، فرانسوی، آلمانی، ایتالیایی و ژاپنی نیز در لیست پشتیبانی قرار دارند.
موسسه Artificial Analysis در اوت 2026 اندازهگیریهای زمان عرضه را منتشر کرد که نشاندهنده سرعت نزدیک به 670 توکن خروجی در ثانیه روی یک endpoint پیشانتشار DeepInfra با استفاده از وزنهای NVFP4 بود. این یک endpoint میزبانیشده GPU است. این اعداد را به عنوان توانایی معماری مدل در نظر بگیرید، نه عملکردی که لزوماً روی VPS شخصی شما حاصل خواهد شد.
کدام تگ Ollama برای کدام VPS مناسب است
کتابخانه Ollama چندین نسخه از وزنهای یکسان را منتشر میکند. تفاوت این نسخهها در کوانتیزاسیون (quantisation) است؛ یعنی هر وزن با چند بیت ذخیره میشود که این موضوع حجم دانلود را بهشدت تغییر میدهد.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]تگهای نامگذاریشده latest، 30b و 30b-a3b همگی به همان digest مربوط به 30b-a3b-q4_K_M اشاره دارند، بنابراین دانلود پیشفرض، نسخه چهار-بیتی 25 گیگابایتی با context کامل 1M است. نسخه Q8_0 حجمی معادل 35 گیگابایت و نسخه bf16 حجمی معادل 66 گیگابایت دارد که هر دو نیز در 1M هستند. نسخههای MLX با حجم 23 گیگابایت برای تراشههای Apple silicon طراحی شدهاند و سقف context آنها 256K است، بنابراین انتخاب اشتباهی برای یک VPS لینوکسی محسوب میشوند.
این ارقام، حجم دانلود هستند و نه نیازمندی حافظه. NVIDIA حداقل VRAM (حافظه ویدیویی) مشخصی برای نسخههای Ollama اعلام نمیکند، بنابراین حجم دانلود را فقط بهعنوان کفِ مقدار در نظر بگیرید. وزنها باید در جایی مستقر باشند؛ اگر کارت گرافیک ظرفیت داشته باشد در حافظه GPU و در غیر این صورت در RAM سیستم قرار میگیرند. علاوه بر این، KV cache (حافظه کلید/مقدار که حافظه مدل از گفتگو به ازای هر توکن است) نیز به آن اضافه میشود. عدد واقعی برای سختافزار شما از طریق یک دستور به دست میآید، نه از طریق محاسبات ریاضی، و در ادامه آمده است. اگر هنوز در مورد سطح کوانتیزاسیون تصمیم نگرفتهاید، هزینه هر یک از Q4، Q8 و FP16 توضیح میدهد که در هر مرحله چه چیزی را از دست میدهید.
از تگ دقیق استفاده کنید، هرگز از latest استفاده نکنید
latest یک اشارهگر متغیر است. هنگامی که کتابخانه آن را بازنشر میکند، رفتار عامل شما در pull بعدی تغییر میکند، بدون اینکه در یادداشتهای شما توضیحی برای این تغییر وجود داشته باشد. تگ را نامگذاری کنید.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_Mاسکریپت نصب، یک سرویس systemd را راهاندازی میکند که با کاربر ollama اجرا میشود و مدلها را در مسیر /usr/share/ollama/.ollama/models نگه میدارد. این مسیر در اکثر ایمیجهای VPS روی فایلسیستم ریشه (root) قرار دارد، بنابراین پیش از درخواست 25 گیگابایت، فضای دیسک را بررسی کنید.
df -h /usr/share/ollamaعملیات pull که در میانه راه متوقف میشود و خطای no space left on device را گزارش میدهد، دقیقاً به همین معناست؛ قطعات ناقص (partial blobs) تا زمانی که آنها را حذف نکنید روی دیسک باقی میمانند. سپس آنچه را که با موفقیت دریافت شده است تأیید کنید:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mدستور ollama show معماری، تعداد پارامترها، طول کانتکست و کوانتیزاسیونی که فایل واقعاً در خود دارد را چاپ میکند. اگر هر یک از این موارد با صفحه کتابخانه مغایرت داشته باشد، شما تگی متفاوت از آنچه مد نظرتان بوده را pull کردهاید.
سرویس را اجرا کنید و بررسی کنید که واقعاً کجا اجرا شده است
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"در حالی که مدل همچنان بارگذاری شده است، در یک ترمینال دوم:
ollama psاین دستوری است که به پرسش مربوط به حافظه برای دستگاه شما پاسخ میدهد. ollama ps مدل بارگذاریشده، حجم اشغالشده در حافظه و ستون PROCESSOR را نمایش میدهد. 100% GPU به این معنی است که تمام مدل در VRAM قرار دارد. 100% CPU به این معنی است که هیچ بخشی از آن در VRAM نیست و هر توکن توسط پردازنده از طریق RAM سیستم محاسبه میشود. تقسیمی مانند 65%/35% CPU/GPU به این معنی است که لایهها همگی در حافظه گرافیکی جا نشدهاند و سهم CPU سرعت شما را تعیین میکند. نیاز حافظه را حدس نزنید؛ آن را بارگذاری کنید و این خط را بخوانید.
اگر مدل به هیچ وجه بارگذاری نشود، Ollama به جای کرش کردن، به شکلی تمیز از اجرای آن خودداری میکند:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)آیا یک VPS فقط با CPU به اندازه کافی سریع است؟
یک VPS عمومی فاقد GPU است، بنابراین CPU تمام پردازشها را انجام میدهد و هر وزنی (weight) که نیاز دارد را از RAM سیستم میخواند. در اینجا مدلهای MoE کمککننده هستند، زیرا در هر توکن تنها حدود 3 میلیارد از 30 میلیارد پارامتر درگیر میشوند؛ بنابراین محاسبات ریاضی برای هر توکن بسیار کمتر از یک مدل متراکم 30B است. اما حافظه (RAM) هیچ کمکی دریافت نمیکند. تمام 30 میلیارد پارامتر باید در حافظه مقیم باشند، زیرا router ممکن است برای هر توکن، هر expertای را انتخاب کند.
بنابراین، استنتاج (inference) فقط با CPU در این مدل، بیش از آنکه توسط تعداد هستهها محدود شود، توسط پهنای باند حافظه محدود میشود. افزودن vCPU به پلنی که در حال حاضر تعداد هستههای معقولی دارد، تغییر چندانی ایجاد نمیکند. آنچه شما نیاز دارید، RAM کافی برای نگهداری وزنها به همراه KV cache، و سریعترین حافظهای است که آن پلن در اختیار شما قرار میدهد.
پیش از آنکه عاملی (agent) را به آن اختصاص دهید، با استفاده از روش اندازهگیری توکن بر ثانیه برای یک LLM محلی، سرعت آن را بسنجید:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."خط eval rate که در پایان چاپ میشود، سرعت تولید شما بر حسب توکن در ثانیه است. همین یک عدد، پاسخ پرسش شما را تعیین میکند، زیرا زمان واقعی (wall-clock time) یک عامل، تحت تأثیر مستقیم این عدد است.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]اینها ارقام منتشرشده توسط شخص ثالث هستند که از زمانهای گزارششده توسط Artificial Analysis در زمان عرضه (بر حسب دقیقه برای هر تسک) تبدیل شدهاند و روی endpointهای GPU میزبانیشده اندازهگیری شدهاند، نه روی یک VPS. مدل Nemotron 3.5 Lightning بهطور میانگین حدود 30 ثانیه برای هر تسک زمان صرف کرد، که در آن gpt-oss-120b تقریباً 204 و Qwen3.6 35B تقریباً 210 زمان برد. از این ارقام برای درک مقیاس تفاوت استفاده کنید، نه بهعنوان تضمینی برای سختافزار خودتان.
راهنمایی صادقانه به این بستگی دارد که چه کسی منتظر است. اگر یک انسان منتظر عامل است، یا عامل زنجیرههای طولانی از فراخوانیها را پشت سر هم انجام میدهد، ظرفیت GPU اجاره کنید. اگر عامل طبق زمانبندی در طول شب اجرا میشود و کسی آن را تماشا نمیکند، یک پلن CPU با RAM بالا گزینه معقولی است. در هر دو حالت، راهاندازی یکسان است و اجرای Ollama روی یک VPS ابعاد پلن و نحوه مقایسه یک نمونه GPU با پرداخت هزینه به ازای هر توکن به یک ارائهدهنده API را پوشش میدهد. نقطه سربهسر به میزان استفاده بستگی دارد: یک نمونه GPU برای هر ساعتی که وجود دارد هزینه دریافت میکند، در حالی که API فقط به ازای توکنهای مصرفی هزینه میگیرد؛ بنابراین عاملی که بیشتر روز مشغول است، استفاده از سرور شخصی را توجیه میکند و عاملی که دو بار در ساعت اجرا میشود، معمولاً اینطور نیست.
پنجره کانتکست 1M رایگان نیست
1M توکن حداکثر ظرفیت مدل است و Ollama بهصورت پیشفرض آن را در اختیار شما قرار نمیدهد. Ollama از یک پنجره پیشفرض بسیار کوچکتر استفاده میکند و بهمحض عبور مکالمه از آن حد، قدیمیترین توکنها را حذف میکند. هنگام وقوع این اتفاق هیچ لاگی ثبت نمیشود، بنابراین برای یک عامل (agent)، اینطور به نظر میرسد که مدل ابتدای وظیفه خود را فراموش کرده است.
پنجره را بهصورت هدفمند تنظیم کنید. برای کل سرور، سرویس را ویرایش کنید:
sudo systemctl edit ollamaاین مورد را اضافه کرده و سپس sudo systemctl restart ollama را اجرا کنید:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"برای هر درخواست، بهجای آن num_ctx را در شیء options ارسال کنید:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'هر افزایش، هزینه حافظه دارد، زیرا کش KV با تعداد توکنهای مجاز شما رشد میکند. مقدار را افزایش دهید، سرویس را ریاستارت کنید، سپس دوباره ollama ps را اجرا کرده و افزایش اندازه گزارششده را مشاهده کنید. اگر ستون PROCESSOR پس از این تغییر از 100% GPU به حالت split تغییر وضعیت داد، یعنی کش KV لایههای مدل را از VRAM خارج کرده و سرعت شما بهشدت افت خواهد کرد. انتخاب num_ctx در Ollama این موازنه را با جزئیات بررسی میکند. فقط به این دلیل که کارت مدل اجازه میدهد، مقدار 1000000 را تنظیم نکنید، زیرا تخصیص حافظه از همان ابتدا انجام میشود و بارگذاری مدل با شکست مواجه خواهد شد.
اتصال آن به یک ایجنت همیشه فعال
پست معرفی Ollama برای این مدل، میانبری را مستند کرده است که یک ایجنت پشتیبانیشده را راهاندازی میکند که از قبل به آن اشاره دارد:
ollama launch claude --model nemotron-3.5-lightningاین پست در آن موقعیت، claude، opencode، openclaw و hermes را مستند کرده است. این زیردستور به یک نسخه بهروز از Ollama نیاز دارد، بنابراین ابتدا ollama --version را بررسی کنید و اگر موجود نبود، ایجنت را خودتان به API متصل کنید. Ollama یک endpoint سازگار با OpenAI ارائه میدهد که اکثر ابزارهای ایجنت آن را میپذیرند:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama کلید را نادیده میگیرد، اما اکثر کلاینتها بدون تنظیم یک کلید، از اجرا خودداری میکنند. بخش مربوط به ابزارها در اتصال یک ایجنت کدنویسی به Ollama و ساخت ایجنت OpenClaw اختصاصی خودتان پوشش داده شده است.
هنگامی که ایجنت بهصورت بدون نظارت اجرا میشود، دو تنظیم سرور اهمیت پیدا میکنند. OLLAMA_KEEP_ALIVE کنترل میکند که یک مدل پس از آخرین درخواست چه مدت در حافظه باقی بماند؛ مقدار پیشفرض آن را پس از پنج دقیقه تخلیه میکند، بنابراین فراخوانی بعدی دوباره زمان بارگذاری کامل را صرف خواهد کرد. روی یک فایل 25 گیگابایتی بدون GPU، این وقفه بهقدری طولانی است که میتواند باعث شکست در timeout شود. برای نگه داشتن مدل در حافظه، OLLAMA_KEEP_ALIVE=-1 را تنظیم کنید. OLLAMA_HOST=0.0.0.0:11434 باعث میشود API از سایر ماشینها قابل دسترسی باشد و هیچگونه احراز هویتی ندارد، بنابراین آن را فقط پشت یک قانون فایروال یا در یک شبکه خصوصی باز کنید.
حالتهای شکست و پیامهای خطای مربوطه
عملیات pull بلافاصله با شکست مواجه میشود. خطای Error: pull model manifest: file does not exist به این معناست که آن تگ وجود ندارد. نام تگها رشتههای دقیقی هستند، بنابراین بهجای حدس زدن پسوند کوانتیزاسیون (quantisation)، یکی از آنها را از صفحه کتابخانه کپی کنید.
مدل بارگذاری نمیشود. خطای Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) به این معناست که حجم تگ برای این پلن با پیکربندی فعلی بیش از حد است. از یک کوانتیزاسیون کوچکتر استفاده کنید یا مقدار OLLAMA_CONTEXT_LENGTH را کاهش دهید، زیرا KV cache نیز در این محدودیت محاسبه میشود.
هیچ پاسخی روی پورت 11434 دریافت نمیشود. خطای curl: (7) Failed to connect to localhost port 11434 به این معناست که سرویس در حال اجرا نیست یا در پورتی که انتظار دارید گوش نمیدهد. فایلهای systemctl status ollama و journalctl -u ollama -n 50 را مطالعه کنید. اگر ollama serve را بهصورت دستی اجرا کردهاید، نسخه دوم با خطای Error: listen tcp 127.0.0.1:11434: bind: address already in use متوقف میشود.
پاسخدهی بسیار کند است. پیش از تغییر هر تنظیمی، ollama ps را بررسی کنید. وجود هرگونه سهم CPU در ستون PROCESSOR روی دستگاهی که دارای GPU است، به این معناست که بخشی از مدل از VRAM خارج شده است؛ بنابراین context را کاهش دهید یا از کوانتیزاسیون کوچکتر استفاده کنید. در دستگاهی که فاقد GPU است، کند بودن نتیجهای مورد انتظار است و هیچ تنظیمی آن را اصلاح نمیکند.
ایجنت در میانه انجام وظیفه، دستورالعملهای خود را فراموش میکند. مکالمه از پنجره context فراتر رفته و قدیمیترین توکنها بهصورت خودکار حذف شدهاند. مقدار OLLAMA_CONTEXT_LENGTH را افزایش دهید، با استفاده از ollama ps تأیید کنید که مدل همچنان در حافظه جا میشود؛ اگر دیگر جا نمیشود، راهحل استفاده از دستگاهی با سختافزار قویتر است، نه کاهش اندازه پنجره.
جایگاه این مدل در مقایسه با سایر گزینهها
یک مدل 30B از نوع MoE برای کارهای کوچک، گزینهای سنگین جهت میزبانی است. اگر یک مدل متراکم (dense) 8B از پس وظیفهٔ شما برمیآید، هزینهٔ اجرای آن بسیار کمتر خواهد بود و در عرض چند ثانیه بارگذاری میشود؛ مدلهای Qwen 3 در نسخههای 8B و 27B روی VPS مقایسهٔ مستقیمی برای این تصمیمگیری ارائه میدهد. برای بررسی جامعترِ آنچه یک پلن مشخص واقعاً میتواند پشتیبانی کند، از کدام مدلهای هوش مصنوعی را میتوانید خودتان میزبانی کنید شروع کنید. اگر قصد دارید بهجای یک عامل (agent)، چندین عامل را همزمان سرویسدهی کنید، ابتدا مقایسه Ollama با vLLM را مطالعه کنید؛ زیرا Ollama درخواستهای همزمان را به شیوهای که یک سرور استنتاج (inference) عملیاتی مدیریت میکند، دستهبندی (batch) نمیکند و این همان نقطهای است که مقیاسپذیری در تنظیمات تککاربره متوقف میشود.
FAQ
برای یک VPS لینوکسی، کدام تگ Nemotron 3.5 Lightning را باید pull کنم؟
از nemotron-3.5-lightning:30b-a3b-q4_K_M استفاده کنید. حجم آن 25 GB است، از حداکثر context یک میلیون توکنی پشتیبانی میکند و همان digest است که تگهای latest، 30b و 30b-a3b تا اوت 2026 به آن اشاره دارند. بهجای pull کردن latest، نام تگ را دقیقاً ذکر کنید تا انتشار مجدد آن pointer در آینده، بدون اطلاع شما رفتار agent را تغییر ندهد. تگهای mlx برای معماری Apple silicon هستند و در لینوکس کارایی ندارند.
Nemotron 3.5 Lightning به چه مقدار RAM نیاز دارد؟
شرکت NVIDIA حداقل حافظه مورد نیاز برای buildهای Ollama را اعلام نکرده است، بنابراین بهجای تخمین، اندازهگیری کنید. تگ را pull کنید، مدل را یکبار اجرا کنید و در حالی که مدل در حافظه بارگذاری شده است، ollama ps را بخوانید: این دستور حجم اشغالشده واقعی و اینکه آیا مدل روی GPU قرار گرفته یا CPU را نمایش میدهد. حجم دانلود، یعنی 25 GB برای تگ پیشفرض، حداقل مقدار است؛ زیرا KV cache به آن اضافه میشود و با افزایش context window که تنظیم میکنید، رشد میکند. اگر منابع سیستم کم باشد، Ollama با خطای model requires more system memory متوقف شده و هر دو عدد (نیاز و موجودی) را اعلام میکند.
آیا میتوانم Nemotron 3.5 Lightning را روی VPS بدون GPU اجرا کنم؟
بله، اگر پلن شما RAM کافی برای نگهداری وزنهای مدل داشته باشد. طراحی MoE در اینجا کمک میکند، زیرا در هر توکن تنها حدود 3 از 30 میلیارد پارامتر محاسبه میشوند. مشکل اصلی سرعت است. بدون GPU، مدل با محدودیت پهنای باند حافظه مواجه است، بنابراین افزایش vCPU تأثیر چندانی بر نتیجه ندارد. دستور ollama run --verbose را با یک prompt ثابت اجرا کنید، خط eval rate را بخوانید و آن عدد را با محدودیت زمانی مورد نیاز برای agent خود بسنجید. برای کارهای دستهای (batch job) که شبانه انجام میشوند، معمولاً مشکلی وجود ندارد. اما برای مواردی که کاربر منتظر پاسخ است، معمولاً مناسب نیست.
چرا Ollama به من context window کامل 1M را نمیدهد؟
1M حداکثر ظرفیت مدل است، نه مقدار پیشفرض Ollama. Ollama از یک window بسیار کوچکتر استفاده میکند و پس از پر شدن آن، قدیمیترین توکنها را بدون نمایش خطا حذف میکند؛ این اتفاق باعث میشود agent دستورالعملهای قبلی خود را فراموش کند. مقدار OLLAMA_CONTEXT_LENGTH را در سرویس systemd تنظیم کنید یا num_ctx را در هر درخواست ارسال نمایید. این مقدار را پلهپله افزایش دهید و هر بار ollama ps را بررسی کنید، زیرا حافظه KV cache با افزایش window رشد میکند و ممکن است باعث شود لایههای مدل از روی GPU خارج شوند.
آیا استفاده تجاری از Nemotron 3.5 Lightning رایگان است؟
کارت مدل NVIDIA، این مدل را تحت لایسنس OpenMDW-1.1 قرار داده و آن را برای استفاده تجاری مجاز دانسته است. این موضوع شامل وزنهایی است که دانلود و اجرا میکنید. این لایسنس درباره سایر نرمافزارهای موجود در stack شما چیزی نمیگوید، بنابراین لایسنسهای agent harness و هر ابزاری که به آن متصل میکنید را جداگانه بررسی کنید و پیش از هرگونه تعهد قراردادی، کارت مدل فعلی را مطالعه نمایید.