اجرای مدل Nemotron 3.5 Lightning روی VPS با Ollama
راهنمای کامل اجرای Nemotron 3.5 Lightning با استفاده از Ollama روی سرور شخصی. بررسی دقیق میزان RAM مورد نیاز، تگ pull برای نسخه بهینه و تحلیل سرعت مدل در حالت CPU-only.
مدل Nemotron 3.5 Lightning چه کاربردی دارد
مدل Nemotron 3.5 Lightning مدل 30 میلیاردی Mixture-of-Experts (MoE) متنباز NVIDIA است که در اوت 2026 منتشر شد و برای عاملهایی (agents) طراحی شده که بهجای یک پنجره چت ساده، برای ساعتها اجرا میشوند. معماری MoE به این معناست که وزنها به چندین زیرشبکه تخصصی تقسیم شدهاند و هر توکن تنها از میان تعداد کمی از آنها عبور میکند. طبق کارت مدل NVIDIA، این مدل در مجموع 30 میلیارد پارامتر دارد که 3 میلیارد از آنها به ازای هر توکن فعال هستند. شما هزینه حافظه را برای تعداد کل پارامترها میپردازید، اما سرعت اجرای آن متناسب با تعداد پارامترهای فعال است.
این موازنه، دلیلی است که باید این مدل را برای سرورهای اجارهای خود در نظر بگیرید. عاملی که کارهای واقعی انجام میدهد، در طول روز هزاران درخواست کوتاه ارسال میکند؛ بنابراین، نرخ throughput به ازای هر دلار تعیین میکند که آیا اجرای آن روی سرور شخصی شما بهصرفه است یا خیر. مدلی که پاسخدهی آن 40 ثانیه طول میکشد، شاید دستیار خوبی باشد اما عامل ضعیفی است، زیرا یک وظیفه ممکن است بیست فراخوانی ایجاد کند و شما باید منتظر تکتک آنها بمانید.
NVIDIA این معماری را هیبریدی توصیف میکند: لایههای Mamba-2 و MoE بهصورت درهمتنیده (interleaved) به همراه لایههای توجه (attention) منتخب. کارت مدل، حداکثر طول کانتکست را تا 1M توکن و مجوز آن را OpenMDW-1.1 اعلام کرده که برای استفاده تجاری آماده است. زبانهای اصلی این مدل انگلیسی و کدنویسی هستند و زبانهای اسپانیایی، فرانسوی، آلمانی، ایتالیایی و ژاپنی نیز در لیست پشتیبانی قرار دارند.
مؤسسه Artificial Analysis در اوت 2026 اندازهگیریهای زمان عرضه را منتشر کرد که نشاندهنده سرعت نزدیک به 670 توکن خروجی در ثانیه روی یک endpoint پیشانتشار DeepInfra با وزنهای NVFP4 بود. این یک endpoint میزبانیشده GPU است. این اعداد را بهعنوان توانایی معماری در نظر بگیرید، نه عملکردی که لزوماً روی VPS شما حاصل خواهد شد.
کدام تگ Ollama برای کدام VPS مناسب است
کتابخانه Ollama چندین نسخه از وزنهای یکسان را منتشر میکند. تفاوت این نسخهها در کوانتیزاسیون (quantisation) است؛ یعنی هر وزن با چند بیت ذخیره میشود که این موضوع تأثیر زیادی بر حجم دانلود دارد.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]تگهای نامگذاریشده latest، 30b و 30b-a3b همگی به همان دایجست (digest) مربوط به 30b-a3b-q4_K_M اشاره دارند، بنابراین دانلود پیشفرض، نسخه چهار-بیتی 25 گیگابایتی با کانتکست کامل 1M است. نسخه Q8_0 حجمی معادل 35 گیگابایت و نسخه bf16 حجمی معادل 66 گیگابایت دارد که هر دو نیز با کانتکست 1M هستند. نسخههای MLX با حجم 23 گیگابایت برای تراشههای Apple silicon طراحی شدهاند و کانتکست آنها به 256K محدود است، بنابراین برای یک VPS لینوکسی انتخاب اشتباهی محسوب میشوند.
این ارقام، حجم دانلود هستند و نه الزامات حافظه. NVIDIA حداقل مقدار VRAM (حافظه ویدیویی) را برای نسخههای Ollama اعلام نمیکند، بنابراین حجم دانلود را فقط بهعنوان کفِ مقدار مورد نیاز در نظر بگیرید. وزنها باید در جایی مستقر باشند؛ اگر کارت گرافیک ظرفیت داشته باشد در حافظه GPU و در غیر این صورت در RAM سیستم قرار میگیرند. علاوه بر این، KV cache (حافظه کلید/مقدار که حافظه مدل برای هر توکن در طول گفتگو است) نیز به آن اضافه میشود. عدد واقعی برای سختافزار شما از طریق یک دستور به دست میآید، نه از طریق محاسبات ریاضی، که در ادامه آمده است. اگر هنوز در مورد سطح کوانتیزاسیون تصمیم نگرفتهاید، هزینه هر یک از سطوح Q4، Q8 و FP16 توضیح میدهد که در هر مرحله چه چیزی را از دست میدهید.
دقیقاً همان تگ را دریافت کنید، هرگز از latest استفاده نکنید
latest یک اشارهگر متغیر است. هنگامی که کتابخانه آن را دوباره منتشر میکند، رفتار عامل شما در دریافت بعدی تغییر میکند، بدون اینکه در یادداشتهایتان توضیحی برای این تغییر وجود داشته باشد. نام تگ را مشخص کنید.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_Mاسکریپت نصب، یک سرویس systemd ایجاد میکند که با کاربر ollama اجرا میشود و مدلها را در مسیر /usr/share/ollama/.ollama/models نگه میدارد. این مسیر در اکثر ایمیجهای VPS روی فایلسیستم ریشه (root) قرار دارد، بنابراین پیش از درخواست 25 گیگابایت، فضای خالی را بررسی کنید. اگر این فایلسیستم فضای کمی دارد، مطالعه محل ذخیرهسازی مدلهای Ollama و نحوه انتقال آنها پیش از انجام عملیات دریافت (pull)، بهتر از زمانی است که دیسک پر شده باشد.
df -h /usr/share/ollamaدریافتی که در میانه راه متوقف میشود و خطای no space left on device را گزارش میدهد، دقیقاً به همین معناست و دادههای ناقص (blobs) تا زمانی که آنها را حذف نکنید، روی دیسک باقی میمانند. سپس بررسی کنید چه چیزی با موفقیت ذخیره شده است:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mدستور ollama show معماری، تعداد پارامترها، طول زمینه (context length) و کوانتیزاسیونی که فایل واقعاً در خود دارد را چاپ میکند. اگر هر یک از این موارد با صفحه کتابخانه مغایرت داشته باشد، شما تگی متفاوت از آنچه مد نظرتان بوده را دریافت کردهاید.
سرویسدهی و بررسی محل اجرای واقعی
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"در حالی که مدل همچنان بارگذاری شده است، در یک ترمینال دوم دستور زیر را اجرا کنید:
ollama psاین دستوری است که به پرسش مربوط به حافظه برای دستگاه شما پاسخ میدهد. ollama ps مدل بارگذاریشده، حجم اشغالشده در حافظه و ستون PROCESSOR را نمایش میدهد. مقدار 100% GPU به این معناست که تمام مدل در VRAM قرار دارد. مقدار 100% CPU یعنی هیچ بخشی از آن در VRAM نیست و هر توکن توسط پردازنده از طریق RAM سیستم محاسبه میشود. تقسیمی مانند 65%/35% CPU/GPU به این معناست که لایهها بهطور کامل در حافظه گرافیکی جا نشدهاند و سهم CPU سرعت شما را تعیین میکند. نیاز حافظه را حدس نزنید؛ مدل را بارگذاری کنید و این خط را بخوانید.
اگر مدل اصلاً بارگذاری نشود، Ollama بهجای کرش کردن، بهصورت تمیز عملیات را متوقف میکند:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)آیا یک VPS فقط با CPU به اندازه کافی سریع است؟
یک VPS عمومی فاقد GPU است، بنابراین CPU تمام پردازشها را انجام میدهد و هر وزنی را که نیاز دارد از RAM سیستم میخواند. در اینجا مدلهای MoE کمککننده هستند، زیرا برای هر توکن تنها حدود 3 میلیارد از 30 میلیارد پارامتر پردازش میشوند؛ بنابراین محاسبات ریاضی برای هر توکن بسیار کمتر از یک مدل متراکم 30B است. اما این موضوع کمکی به حافظه نمیکند. تمام 30 میلیارد پارامتر باید در حافظه مقیم باشند، زیرا روتر ممکن است برای هر توکن، هر متخصصی (expert) را انتخاب کند.
بنابراین، استنتاج (inference) فقط با CPU در این مدل، بیش از آنکه به تعداد هستهها وابسته باشد، توسط پهنای باند حافظه محدود میشود. افزودن vCPU به پلانی که تعداد هستههای معقولی دارد، تغییر چندانی ایجاد نمیکند. آنچه شما نیاز دارید، RAM کافی برای نگهداری وزنها به همراه KV cache و سریعترین حافظهای است که آن پلن در اختیار شما میگذارد.
پیش از اختصاص یک عامل (agent) به آن، با استفاده از روش اندازهگیری توکن بر ثانیه برای یک LLM محلی، سرعت را بسنجید:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."خط eval rate که در پایان چاپ میشود، سرعت تولید شما بر حسب توکن بر ثانیه است. همین یک عدد تعیینکننده است، زیرا زمان واقعی (wall-clock time) اجرای یک عامل تحت تأثیر آن است. آن را در طول پاسخ مورد انتظار خود ضرب کنید؛ اگر پاسخ طولانیتر از زمانی است که مایل به صبر کردن هستید، محدود کردن خروجی با num_predict تنها اهرمی است که بدون تغییر سختافزار، یک فراخوانی واحد را محدود میکند.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]اینها ارقام منتشرشده توسط شخص ثالث هستند که از زمانهای گزارششده توسط Artificial Analysis در زمان عرضه تبدیل شدهاند و روی endpointهای GPU میزبانیشده اندازهگیری شدهاند، نه روی یک VPS. مدل Nemotron 3.5 Lightning بهطور میانگین حدود 30 ثانیه برای هر وظیفه زمان صرف کرد، که در آن gpt-oss-120b تقریباً 204 و Qwen3.6 35B تقریباً 210 زمان برد. از این ارقام برای درک مقیاس تفاوت استفاده کنید، نه به عنوان تضمینی برای سختافزار خودتان.
راهنمایی صادقانه به این بستگی دارد که چه کسی منتظر است. اگر یک انسان منتظر عامل است، یا عامل زنجیرههای طولانی از فراخوانیها را پشت سر هم انجام میدهد، ظرفیت GPU اجاره کنید. اگر عامل طبق برنامه در طول شب اجرا میشود و کسی آن را تماشا نمیکند، یک پلن CPU با RAM بالا گزینه معقولی است. در هر صورت، راهاندازی یکسان است و اجرای Ollama روی یک VPS به نحوه انتخاب اندازه پلن و مقایسه یک نمونه GPU با پرداخت هزینه به ازای هر توکن به ارائهدهنده API میپردازد. نقطه سربهسر یک مسئله میزان استفاده است: هزینه نمونه GPU برای هر ساعتی که وجود دارد محاسبه میشود، در حالی که هزینه توکنهای API فقط هنگام استفاده محاسبه میشود؛ بنابراین عاملی که در بیشتر ساعات روز فعال است، استفاده از سرور شخصی را توجیه میکند و عاملی که دو بار در ساعت اجرا میشود، معمولاً چنین نیست.
پنجره کانتکست 1M رایگان نیست
تعداد 1M توکن حداکثر ظرفیت مدل است و Ollama بهصورت پیشفرض آن را در اختیار شما قرار نمیدهد. Ollama از یک پنجره پیشفرض بسیار کوچکتر استفاده میکند و بهمحض اینکه طول گفتگو از آن فراتر رود، قدیمیترین توکنها را حذف میکند. هنگام وقوع این اتفاق هیچ لاگی ثبت نمیشود، بنابراین برای یک عامل (agent)، اینطور به نظر میرسد که مدل ابتدای وظیفه خود را فراموش کرده است.
پنجره را بهصورت هدفمند تنظیم کنید. برای کل سرور، سرویس را ویرایش کنید:
sudo systemctl edit ollamaمورد زیر را اضافه کرده و سپس sudo systemctl restart ollama را اجرا کنید:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"برای هر درخواست، به جای آن num_ctx را در شیء options ارسال کنید:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'هر افزایش، حافظه مصرف میکند، زیرا KV cache با تعداد توکنهای مجاز شما رشد میکند. مقدار را افزایش دهید، سرویس را ریاستارت کنید، سپس دوباره ollama ps را اجرا کرده و افزایش اندازه گزارششده را مشاهده کنید. اگر پس از این تغییر، ستون PROCESSOR از 100% GPU به split تغییر وضعیت داد، یعنی KV cache لایههای مدل را از VRAM خارج کرده و سرعت شما بهشدت افت خواهد کرد. انتخاب num_ctx در Ollama این موازنه را بهطور دقیق بررسی میکند. مقدار 1000000 را صرفاً به این دلیل که کارت مدل اجازه آن را میدهد تنظیم نکنید، زیرا تخصیص حافظه در همان ابتدا انجام میشود و بارگذاری مدل بهسادگی با شکست مواجه خواهد شد.
اتصال آن به یک عامل همیشه فعال
پست معرفی Ollama برای این مدل، یک میانبر را مستند کرده است که یک عامل پشتیبانیشده را راهاندازی میکند که از قبل به آن اشاره دارد:
ollama launch claude --model nemotron-3.5-lightningاین پست claude، opencode، openclaw و hermes را در آن موقعیت مستند میکند. این زیردستور به نسخه بهروز Ollama نیاز دارد، بنابراین ابتدا ollama --version را بررسی کنید و اگر موجود نبود، خودتان عامل را به سمت API هدایت کنید. Ollama یک endpoint سازگار با OpenAI ارائه میدهد که اکثر ابزارهای عامل (agent harnesses) آن را میپذیرند:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama کلید را نادیده میگیرد، اما اکثر کلاینتها بدون تنظیم یک کلید، از اجرا خودداری میکنند. سمتِ ابزارِ این موضوع در هدایت یک عامل کدنویسی به سمت Ollama و در ساخت عامل OpenClaw شخصی پوشش داده شده است.
هنگامی که عامل بهصورت بدون نظارت اجرا میشود، دو تنظیم سرور اهمیت پیدا میکنند. OLLAMA_KEEP_ALIVE کنترل میکند که مدل پس از آخرین درخواست چه مدت در حافظه باقی بماند؛ مقدار پیشفرض آن را پس از پنج دقیقه تخلیه میکند، بنابراین درخواست بعدی باید دوباره زمان کامل بارگذاری را صرف کند. روی یک فایل 25 گیگابایتی بدون GPU، این وقفه بهقدری طولانی است که باعث شکستن timeout میشود. OLLAMA_KEEP_ALIVE=-1 را تنظیم کنید تا مدل در حافظه باقی بماند. OLLAMA_HOST=0.0.0.0:11434 باعث میشود API از سایر ماشینها قابل دسترسی باشد؛ این تنظیم هیچگونه احراز هویتی ندارد، بنابراین آن را فقط پشت یک قانون فایروال یا در یک شبکه خصوصی باز کنید.
حالتهای شکست و پیامهای خطای مربوطه
عملیات pull بلافاصله با شکست مواجه میشود. کد Error: pull model manifest: file does not exist به این معناست که آن تگ وجود ندارد. نام تگها رشتههای دقیقی هستند، بنابراین بهجای حدس زدن پسوند کوانتیزاسیون (quantisation)، یکی از آنها را مستقیماً از صفحه کتابخانه کپی کنید.
مدل بارگذاری نمیشود. کد Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) به این معناست که تگ مورد نظر برای این پلن با پیکربندی فعلی بیش از حد بزرگ است. از یک کوانتیزاسیون کوچکتر استفاده کنید یا مقدار OLLAMA_CONTEXT_LENGTH را کاهش دهید، زیرا KV cache نیز در این محدودیت محاسبه میشود.
هیچ پاسخی روی پورت 11434 دریافت نمیشود. کد curl: (7) Failed to connect to localhost port 11434 به این معناست که سرویس در حال اجرا نیست یا در پورتی که انتظار دارید گوش نمیدهد. فایلهای systemctl status ollama و journalctl -u ollama -n 50 را مطالعه کنید. اگر ollama serve را بهصورت دستی اجرا کردهاید، نسخه دوم با خطای Error: listen tcp 127.0.0.1:11434: bind: address already in use متوقف میشود.
پاسخدهی بسیار کند است. پیش از تغییر هر تنظیماتی، ollama ps را بررسی کنید. وجود هرگونه سهم CPU در ستون PROCESSOR روی دستگاهی که دارای GPU است، به این معناست که بخشی از مدل از VRAM خارج شده است؛ بنابراین context را کاهش دهید یا از کوانتیزاسیون کوچکتری استفاده کنید. در دستگاهی که فاقد GPU است، کند بودن نتیجهای مورد انتظار است و هیچ تنظیمی آن را اصلاح نمیکند.
عامل (agent) دستورالعملهای خود را در میانه انجام وظیفه فراموش میکند. مکالمه از پنجره context فراتر رفته و قدیمیترین توکنها بهطور خودکار حذف شدهاند. مقدار OLLAMA_CONTEXT_LENGTH را افزایش دهید، با استفاده از ollama ps تأیید کنید که مدل همچنان در حافظه جا میشود؛ اگر دیگر جا نمیشود، راهحل استفاده از دستگاهی قدرتمندتر است، نه کوچکتر کردن پنجره.
جایگاه این مدل در مقایسه با سایر گزینهها
یک مدل 30B از نوع MoE برای یک کار کوچک، گزینه سنگینی برای میزبانی است. اگر یک مدل 8B متراکم (dense) از قبل وظیفه شما را انجام میدهد، اجرای آن هزینه بسیار کمتری دارد و در چند ثانیه بارگذاری میشود؛ Qwen 3 در نسخههای 8B و 27B روی VPS مقایسه مستقیمی برای این تصمیمگیری ارائه میدهد. برای بررسی جامعتر اینکه هر پلن میزبانی واقعاً چه چیزی را میتواند پشتیبانی کند، از کدام مدلهای هوش مصنوعی را میتوانید خودتان میزبانی کنید شروع کنید. اگر قصد دارید بهجای یک عامل (agent)، چندین عامل را همزمان سرویسدهی کنید، ابتدا مقایسه Ollama با vLLM را مطالعه کنید؛ زیرا Ollama درخواستهای همزمان را به شیوهای که یک سرور استنتاج (inference) عملیاتی مدیریت میکند، دستهبندی (batch) نمیکند و این همان نقطهای است که مقیاسپذیری در یک تنظیمات تککاربره متوقف میشود.
FAQ
برای یک VPS لینوکسی، کدام تگ Nemotron 3.5 Lightning را باید pull کنم؟
از nemotron-3.5-lightning:30b-a3b-q4_K_M استفاده کنید. حجم آن 25 گیگابایت است، از حداکثر کانتکست 1M پشتیبانی میکند و همان digest است که تگهای latest، 30b و 30b-a3b تا اوت 2026 به آن اشاره دارند. بهجای pull کردن latest، نام آن را دقیقاً ذکر کنید تا انتشار مجدد آن اشارهگر در آینده، بدون اطلاع شما رفتار agent را تغییر ندهد. تگهای mlx برای معماری Apple silicon هستند و در لینوکس کاربردی ندارند.
Nemotron 3.5 Lightning به چه مقدار RAM نیاز دارد؟
NVIDIA حداقل حافظه مورد نیاز برای buildهای Ollama را اعلام نکرده است، بنابراین بهجای تخمین، اندازهگیری کنید. تگ را pull کنید، مدل را یکبار اجرا کنید و در حالی که مدل در حافظه بارگذاری شده است، ollama ps را بخوانید: این دستور حجم دقیق اشغالشده و اینکه آیا مدل روی GPU قرار گرفته یا CPU را نمایش میدهد. حجم دانلود، یعنی 25 گیگابایت برای تگ پیشفرض، حداقل مقدار است؛ زیرا KV cache به آن اضافه میشود و با افزایش کانتکست window که تنظیم میکنید، رشد میکند. اگر پلن شما خیلی کوچک باشد، Ollama با خطای model requires more system memory امتناع کرده و هر دو عدد را اعلام میکند.
آیا میتوانم Nemotron 3.5 Lightning را روی VPS بدون GPU اجرا کنم؟
بله، اگر پلن شما RAM کافی برای نگهداری وزنها (weights) را داشته باشد. طراحی MoE در اینجا کمک میکند، زیرا در هر توکن تنها حدود 3 از 30 میلیارد پارامتر محاسبه میشوند. مشکل اصلی سرعت است. بدون GPU، مدل محدود به پهنای باند حافظه است، بنابراین افزودن vCPU تأثیر چندانی بر نتیجه ندارد. دستور ollama run --verbose را با یک prompt ثابت اجرا کنید، خط eval rate را بخوانید و آن عدد را با محدودیت زمانی agent خود بسنجید. برای کارهای دستهای (batch job) که شبانه انجام میشوند، معمولاً مشکلی نیست. اما برای هر کاری که کاربر منتظر پاسخ آن است، معمولاً مناسب نیست.
چرا Ollama کانتکست window کامل 1M را به من نمیدهد؟
1M حداکثر ظرفیت مدل است، نه مقدار پیشفرض Ollama. Ollama از یک window بسیار کوچکتر استفاده میکند و پس از پر شدن، قدیمیترین توکنها را بدون نمایش خطا حذف میکند؛ این اتفاق باعث میشود agent دستورالعملهای خود را فراموش کند. مقدار OLLAMA_CONTEXT_LENGTH را در سرویس systemd تنظیم کنید یا num_ctx را در هر درخواست ارسال کنید. این مقدار را پلهپله افزایش دهید و هر بار ollama ps را بررسی کنید، زیرا حافظه KV cache با افزایش window مقیاسپذیر است و میتواند لایههای مدل را از روی GPU خارج کند.
آیا استفاده تجاری از Nemotron 3.5 Lightning رایگان است؟
کارت مدل NVIDIA، این مدل را تحت لایسنس OpenMDW-1.1 قرار داده و آن را برای استفاده تجاری مجاز دانسته است. این موضوع شامل وزنهایی است که دانلود و اجرا میکنید. این لایسنس درباره سایر نرمافزارهای موجود در stack شما چیزی نمیگوید، بنابراین لایسنسهای agent harness و هر ابزاری که به آن متصل میکنید را جداگانه بررسی کنید و پیش از هرگونه تعهد قراردادی، کارت مدل فعلی را مطالعه نمایید.