SSD Nodes Learn 🎉 VPS از $5.50/ماه
راهنماها Matt Connorتوسط Matt Connor · به‌روزرسانی شده 2026-08-13

اجرای مدل Nemotron 3.5 Lightning روی VPS با Ollama

راهنمای کامل اجرای Nemotron 3.5 Lightning روی سرور شخصی. نحوه استفاده از دستور ollama run nemotron-3.5-lightning، میزان RAM مورد نیاز و بررسی عملکرد CPU برای این مدل.

کاربرد Nemotron 3.5 Lightning چیست

مدل Nemotron 3.5 Lightning یک مدل Mixture-of-Experts با 30 میلیارد پارامتر از شرکت NVIDIA است که در اوت 2026 منتشر شد. این مدل برای عامل‌هایی (agents) طراحی شده که به‌جای یک پنجره چت ساده، برای ساعت‌ها فعالیت می‌کنند. ساختار MoE (ترکیب متخصصان) به این معناست که وزن‌ها به چندین زیرشبکه تخصصی تقسیم شده‌اند و هر توکن تنها از میان تعداد کمی از آن‌ها عبور می‌کند. طبق کارت مدل NVIDIA، این مدل در مجموع 30 میلیارد پارامتر دارد که در هر توکن، 3 میلیارد پارامتر فعال هستند. شما هزینه تعداد زیاد پارامترها را در حافظه (RAM/VRAM) می‌پردازید، اما در عوض سرعتِ مربوط به تعداد کم پارامترهای فعال را دریافت می‌کنید.

این معامله (Trade-off) دلیلی است که باید برای سرورهای اجاره‌ای خود به این مدل توجه کنید. عاملی که در طول روز کارهای واقعی انجام می‌دهد، هزاران درخواست کوتاه ارسال می‌کند؛ بنابراین، نرخ خروجی (throughput) به ازای هر دلار تعیین می‌کند که آیا این مدل می‌تواند روی سرور شخصی شما اجرا شود یا خیر. مدلی که برای هر پاسخ 40 ثانیه زمان می‌برد، یک دستیار قابل‌قبول اما یک عامل ضعیف است، زیرا یک وظیفه ممکن است بیست فراخوانی ایجاد کند و شما باید برای تک‌تک آن‌ها منتظر بمانید.

NVIDIA معماری این مدل را هیبریدی توصیف می‌کند: لایه‌های Mamba-2 و MoE به‌صورت درهم‌تنیده (interleaved) به همراه لایه‌های توجه (attention) منتخب. کارت مدل، حداکثر طول کانتکست را تا 1M توکن اعلام کرده و دارای مجوز OpenMDW-1.1 است که برای استفاده تجاری آماده است. زبان‌های اصلی آن انگلیسی و کدنویسی هستند، اما زبان‌های اسپانیایی، فرانسوی، آلمانی، ایتالیایی و ژاپنی نیز در لیست پشتیبانی قرار دارند.

موسسه Artificial Analysis در اوت 2026 اندازه‌گیری‌های زمان عرضه را منتشر کرد که نشان‌دهنده سرعت نزدیک به 670 توکن خروجی در ثانیه روی یک endpoint پیش‌انتشار DeepInfra با استفاده از وزن‌های NVFP4 بود. این یک endpoint میزبانی‌شده GPU است. این اعداد را به عنوان توانایی معماری مدل در نظر بگیرید، نه عملکردی که لزوماً روی VPS شخصی شما حاصل خواهد شد.

کدام تگ Ollama برای کدام VPS مناسب است

کتابخانه Ollama چندین نسخه از وزن‌های یکسان را منتشر می‌کند. تفاوت این نسخه‌ها در کوانتیزاسیون (quantisation) است؛ یعنی هر وزن با چند بیت ذخیره می‌شود که این موضوع حجم دانلود را به‌شدت تغییر می‌دهد.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

تگ‌های نام‌گذاری‌شده latest، 30b و 30b-a3b همگی به همان digest مربوط به 30b-a3b-q4_K_M اشاره دارند، بنابراین دانلود پیش‌فرض، نسخه چهار-بیتی 25 گیگابایتی با context کامل 1M است. نسخه Q8_0 حجمی معادل 35 گیگابایت و نسخه bf16 حجمی معادل 66 گیگابایت دارد که هر دو نیز در 1M هستند. نسخه‌های MLX با حجم 23 گیگابایت برای تراشه‌های Apple silicon طراحی شده‌اند و سقف context آن‌ها 256K است، بنابراین انتخاب اشتباهی برای یک VPS لینوکسی محسوب می‌شوند.

این ارقام، حجم دانلود هستند و نه نیازمندی حافظه. NVIDIA حداقل VRAM (حافظه ویدیویی) مشخصی برای نسخه‌های Ollama اعلام نمی‌کند، بنابراین حجم دانلود را فقط به‌عنوان کفِ مقدار در نظر بگیرید. وزن‌ها باید در جایی مستقر باشند؛ اگر کارت گرافیک ظرفیت داشته باشد در حافظه GPU و در غیر این صورت در RAM سیستم قرار می‌گیرند. علاوه بر این، KV cache (حافظه کلید/مقدار که حافظه مدل از گفتگو به ازای هر توکن است) نیز به آن اضافه می‌شود. عدد واقعی برای سخت‌افزار شما از طریق یک دستور به دست می‌آید، نه از طریق محاسبات ریاضی، و در ادامه آمده است. اگر هنوز در مورد سطح کوانتیزاسیون تصمیم نگرفته‌اید، هزینه هر یک از Q4، Q8 و FP16 توضیح می‌دهد که در هر مرحله چه چیزی را از دست می‌دهید.

از تگ دقیق استفاده کنید، هرگز از latest استفاده نکنید

latest یک اشاره‌گر متغیر است. هنگامی که کتابخانه آن را بازنشر می‌کند، رفتار عامل شما در pull بعدی تغییر می‌کند، بدون اینکه در یادداشت‌های شما توضیحی برای این تغییر وجود داشته باشد. تگ را نام‌گذاری کنید.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

اسکریپت نصب، یک سرویس systemd را راه‌اندازی می‌کند که با کاربر ollama اجرا می‌شود و مدل‌ها را در مسیر /usr/share/ollama/.ollama/models نگه می‌دارد. این مسیر در اکثر ایمیج‌های VPS روی فایل‌سیستم ریشه (root) قرار دارد، بنابراین پیش از درخواست 25 گیگابایت، فضای دیسک را بررسی کنید.

df -h /usr/share/ollama

عملیات pull که در میانه راه متوقف می‌شود و خطای no space left on device را گزارش می‌دهد، دقیقاً به همین معناست؛ قطعات ناقص (partial blobs) تا زمانی که آن‌ها را حذف نکنید روی دیسک باقی می‌مانند. سپس آنچه را که با موفقیت دریافت شده است تأیید کنید:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

دستور ollama show معماری، تعداد پارامترها، طول کانتکست و کوانتیزاسیونی که فایل واقعاً در خود دارد را چاپ می‌کند. اگر هر یک از این موارد با صفحه کتابخانه مغایرت داشته باشد، شما تگی متفاوت از آنچه مد نظرتان بوده را pull کرده‌اید.

سرویس را اجرا کنید و بررسی کنید که واقعاً کجا اجرا شده است

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

در حالی که مدل همچنان بارگذاری شده است، در یک ترمینال دوم:

ollama ps

این دستوری است که به پرسش مربوط به حافظه برای دستگاه شما پاسخ می‌دهد. ollama ps مدل بارگذاری‌شده، حجم اشغال‌شده در حافظه و ستون PROCESSOR را نمایش می‌دهد. 100% GPU به این معنی است که تمام مدل در VRAM قرار دارد. 100% CPU به این معنی است که هیچ بخشی از آن در VRAM نیست و هر توکن توسط پردازنده از طریق RAM سیستم محاسبه می‌شود. تقسیمی مانند 65%/35% CPU/GPU به این معنی است که لایه‌ها همگی در حافظه گرافیکی جا نشده‌اند و سهم CPU سرعت شما را تعیین می‌کند. نیاز حافظه را حدس نزنید؛ آن را بارگذاری کنید و این خط را بخوانید.

اگر مدل به هیچ وجه بارگذاری نشود، Ollama به جای کرش کردن، به شکلی تمیز از اجرای آن خودداری می‌کند:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

آیا یک VPS فقط با CPU به اندازه کافی سریع است؟

یک VPS عمومی فاقد GPU است، بنابراین CPU تمام پردازش‌ها را انجام می‌دهد و هر وزنی (weight) که نیاز دارد را از RAM سیستم می‌خواند. در اینجا مدل‌های MoE کمک‌کننده هستند، زیرا در هر توکن تنها حدود 3 میلیارد از 30 میلیارد پارامتر درگیر می‌شوند؛ بنابراین محاسبات ریاضی برای هر توکن بسیار کمتر از یک مدل متراکم 30B است. اما حافظه (RAM) هیچ کمکی دریافت نمی‌کند. تمام 30 میلیارد پارامتر باید در حافظه مقیم باشند، زیرا router ممکن است برای هر توکن، هر expertای را انتخاب کند.

بنابراین، استنتاج (inference) فقط با CPU در این مدل، بیش از آنکه توسط تعداد هسته‌ها محدود شود، توسط پهنای باند حافظه محدود می‌شود. افزودن vCPU به پلنی که در حال حاضر تعداد هسته‌های معقولی دارد، تغییر چندانی ایجاد نمی‌کند. آنچه شما نیاز دارید، RAM کافی برای نگهداری وزن‌ها به همراه KV cache، و سریع‌ترین حافظه‌ای است که آن پلن در اختیار شما قرار می‌دهد.

پیش از آنکه عاملی (agent) را به آن اختصاص دهید، با استفاده از روش اندازه‌گیری توکن بر ثانیه برای یک LLM محلی، سرعت آن را بسنجید:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

خط eval rate که در پایان چاپ می‌شود، سرعت تولید شما بر حسب توکن در ثانیه است. همین یک عدد، پاسخ پرسش شما را تعیین می‌کند، زیرا زمان واقعی (wall-clock time) یک عامل، تحت تأثیر مستقیم این عدد است.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

این‌ها ارقام منتشرشده توسط شخص ثالث هستند که از زمان‌های گزارش‌شده توسط Artificial Analysis در زمان عرضه (بر حسب دقیقه برای هر تسک) تبدیل شده‌اند و روی endpointهای GPU میزبانی‌شده اندازه‌گیری شده‌اند، نه روی یک VPS. مدل Nemotron 3.5 Lightning به‌طور میانگین حدود 30 ثانیه برای هر تسک زمان صرف کرد، که در آن gpt-oss-120b تقریباً 204 و Qwen3.6 35B تقریباً 210 زمان برد. از این ارقام برای درک مقیاس تفاوت استفاده کنید، نه به‌عنوان تضمینی برای سخت‌افزار خودتان.

راهنمایی صادقانه به این بستگی دارد که چه کسی منتظر است. اگر یک انسان منتظر عامل است، یا عامل زنجیره‌های طولانی از فراخوانی‌ها را پشت سر هم انجام می‌دهد، ظرفیت GPU اجاره کنید. اگر عامل طبق زمان‌بندی در طول شب اجرا می‌شود و کسی آن را تماشا نمی‌کند، یک پلن CPU با RAM بالا گزینه معقولی است. در هر دو حالت، راه‌اندازی یکسان است و اجرای Ollama روی یک VPS ابعاد پلن و نحوه مقایسه یک نمونه GPU با پرداخت هزینه به ازای هر توکن به یک ارائه‌دهنده API را پوشش می‌دهد. نقطه سربه‌سر به میزان استفاده بستگی دارد: یک نمونه GPU برای هر ساعتی که وجود دارد هزینه دریافت می‌کند، در حالی که API فقط به ازای توکن‌های مصرفی هزینه می‌گیرد؛ بنابراین عاملی که بیشتر روز مشغول است، استفاده از سرور شخصی را توجیه می‌کند و عاملی که دو بار در ساعت اجرا می‌شود، معمولاً این‌طور نیست.

پنجره کانتکست 1M رایگان نیست

1M توکن حداکثر ظرفیت مدل است و Ollama به‌صورت پیش‌فرض آن را در اختیار شما قرار نمی‌دهد. Ollama از یک پنجره پیش‌فرض بسیار کوچک‌تر استفاده می‌کند و به‌محض عبور مکالمه از آن حد، قدیمی‌ترین توکن‌ها را حذف می‌کند. هنگام وقوع این اتفاق هیچ لاگی ثبت نمی‌شود، بنابراین برای یک عامل (agent)، این‌طور به نظر می‌رسد که مدل ابتدای وظیفه خود را فراموش کرده است.

پنجره را به‌صورت هدفمند تنظیم کنید. برای کل سرور، سرویس را ویرایش کنید:

sudo systemctl edit ollama

این مورد را اضافه کرده و سپس sudo systemctl restart ollama را اجرا کنید:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

برای هر درخواست، به‌جای آن num_ctx را در شیء options ارسال کنید:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

هر افزایش، هزینه حافظه دارد، زیرا کش KV با تعداد توکن‌های مجاز شما رشد می‌کند. مقدار را افزایش دهید، سرویس را ری‌استارت کنید، سپس دوباره ollama ps را اجرا کرده و افزایش اندازه گزارش‌شده را مشاهده کنید. اگر ستون PROCESSOR پس از این تغییر از 100% GPU به حالت split تغییر وضعیت داد، یعنی کش KV لایه‌های مدل را از VRAM خارج کرده و سرعت شما به‌شدت افت خواهد کرد. انتخاب num_ctx در Ollama این موازنه را با جزئیات بررسی می‌کند. فقط به این دلیل که کارت مدل اجازه می‌دهد، مقدار 1000000 را تنظیم نکنید، زیرا تخصیص حافظه از همان ابتدا انجام می‌شود و بارگذاری مدل با شکست مواجه خواهد شد.

اتصال آن به یک ایجنت همیشه فعال

پست معرفی Ollama برای این مدل، میان‌بری را مستند کرده است که یک ایجنت پشتیبانی‌شده را راه‌اندازی می‌کند که از قبل به آن اشاره دارد:

ollama launch claude --model nemotron-3.5-lightning

این پست در آن موقعیت، claude، opencode، openclaw و hermes را مستند کرده است. این زیردستور به یک نسخه به‌روز از Ollama نیاز دارد، بنابراین ابتدا ollama --version را بررسی کنید و اگر موجود نبود، ایجنت را خودتان به API متصل کنید. Ollama یک endpoint سازگار با OpenAI ارائه می‌دهد که اکثر ابزارهای ایجنت آن را می‌پذیرند:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama کلید را نادیده می‌گیرد، اما اکثر کلاینت‌ها بدون تنظیم یک کلید، از اجرا خودداری می‌کنند. بخش مربوط به ابزارها در اتصال یک ایجنت کدنویسی به Ollama و ساخت ایجنت OpenClaw اختصاصی خودتان پوشش داده شده است.

هنگامی که ایجنت به‌صورت بدون نظارت اجرا می‌شود، دو تنظیم سرور اهمیت پیدا می‌کنند. OLLAMA_KEEP_ALIVE کنترل می‌کند که یک مدل پس از آخرین درخواست چه مدت در حافظه باقی بماند؛ مقدار پیش‌فرض آن را پس از پنج دقیقه تخلیه می‌کند، بنابراین فراخوانی بعدی دوباره زمان بارگذاری کامل را صرف خواهد کرد. روی یک فایل 25 گیگابایتی بدون GPU، این وقفه به‌قدری طولانی است که می‌تواند باعث شکست در timeout شود. برای نگه داشتن مدل در حافظه، OLLAMA_KEEP_ALIVE=-1 را تنظیم کنید. OLLAMA_HOST=0.0.0.0:11434 باعث می‌شود API از سایر ماشین‌ها قابل دسترسی باشد و هیچ‌گونه احراز هویتی ندارد، بنابراین آن را فقط پشت یک قانون فایروال یا در یک شبکه خصوصی باز کنید.

حالت‌های شکست و پیام‌های خطای مربوطه

عملیات pull بلافاصله با شکست مواجه می‌شود. خطای Error: pull model manifest: file does not exist به این معناست که آن تگ وجود ندارد. نام تگ‌ها رشته‌های دقیقی هستند، بنابراین به‌جای حدس زدن پسوند کوانتیزاسیون (quantisation)، یکی از آن‌ها را از صفحه کتابخانه کپی کنید.

مدل بارگذاری نمی‌شود. خطای Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) به این معناست که حجم تگ برای این پلن با پیکربندی فعلی بیش از حد است. از یک کوانتیزاسیون کوچک‌تر استفاده کنید یا مقدار OLLAMA_CONTEXT_LENGTH را کاهش دهید، زیرا KV cache نیز در این محدودیت محاسبه می‌شود.

هیچ پاسخی روی پورت 11434 دریافت نمی‌شود. خطای curl: (7) Failed to connect to localhost port 11434 به این معناست که سرویس در حال اجرا نیست یا در پورتی که انتظار دارید گوش نمی‌دهد. فایل‌های systemctl status ollama و journalctl -u ollama -n 50 را مطالعه کنید. اگر ollama serve را به‌صورت دستی اجرا کرده‌اید، نسخه دوم با خطای Error: listen tcp 127.0.0.1:11434: bind: address already in use متوقف می‌شود.

پاسخ‌دهی بسیار کند است. پیش از تغییر هر تنظیمی، ollama ps را بررسی کنید. وجود هرگونه سهم CPU در ستون PROCESSOR روی دستگاهی که دارای GPU است، به این معناست که بخشی از مدل از VRAM خارج شده است؛ بنابراین context را کاهش دهید یا از کوانتیزاسیون کوچک‌تر استفاده کنید. در دستگاهی که فاقد GPU است، کند بودن نتیجه‌ای مورد انتظار است و هیچ تنظیمی آن را اصلاح نمی‌کند.

ایجنت در میانه انجام وظیفه، دستورالعمل‌های خود را فراموش می‌کند. مکالمه از پنجره context فراتر رفته و قدیمی‌ترین توکن‌ها به‌صورت خودکار حذف شده‌اند. مقدار OLLAMA_CONTEXT_LENGTH را افزایش دهید، با استفاده از ollama ps تأیید کنید که مدل همچنان در حافظه جا می‌شود؛ اگر دیگر جا نمی‌شود، راه‌حل استفاده از دستگاهی با سخت‌افزار قوی‌تر است، نه کاهش اندازه پنجره.

جایگاه این مدل در مقایسه با سایر گزینه‌ها

یک مدل 30B از نوع MoE برای کارهای کوچک، گزینه‌ای سنگین جهت میزبانی است. اگر یک مدل متراکم (dense) 8B از پس وظیفهٔ شما برمی‌آید، هزینهٔ اجرای آن بسیار کمتر خواهد بود و در عرض چند ثانیه بارگذاری می‌شود؛ مدل‌های Qwen 3 در نسخه‌های 8B و 27B روی VPS مقایسهٔ مستقیمی برای این تصمیم‌گیری ارائه می‌دهد. برای بررسی جامع‌ترِ آنچه یک پلن مشخص واقعاً می‌تواند پشتیبانی کند، از کدام مدل‌های هوش مصنوعی را می‌توانید خودتان میزبانی کنید شروع کنید. اگر قصد دارید به‌جای یک عامل (agent)، چندین عامل را هم‌زمان سرویس‌دهی کنید، ابتدا مقایسه Ollama با vLLM را مطالعه کنید؛ زیرا Ollama درخواست‌های هم‌زمان را به شیوه‌ای که یک سرور استنتاج (inference) عملیاتی مدیریت می‌کند، دسته‌بندی (batch) نمی‌کند و این همان نقطه‌ای است که مقیاس‌پذیری در تنظیمات تک‌کاربره متوقف می‌شود.

FAQ

برای یک VPS لینوکسی، کدام تگ Nemotron 3.5 Lightning را باید pull کنم؟

از nemotron-3.5-lightning:30b-a3b-q4_K_M استفاده کنید. حجم آن 25 GB است، از حداکثر context یک میلیون توکنی پشتیبانی می‌کند و همان digest است که تگ‌های latest، 30b و 30b-a3b تا اوت 2026 به آن اشاره دارند. به‌جای pull کردن latest، نام تگ را دقیقاً ذکر کنید تا انتشار مجدد آن pointer در آینده، بدون اطلاع شما رفتار agent را تغییر ندهد. تگ‌های mlx برای معماری Apple silicon هستند و در لینوکس کارایی ندارند.

Nemotron 3.5 Lightning به چه مقدار RAM نیاز دارد؟

شرکت NVIDIA حداقل حافظه مورد نیاز برای buildهای Ollama را اعلام نکرده است، بنابراین به‌جای تخمین، اندازه‌گیری کنید. تگ را pull کنید، مدل را یک‌بار اجرا کنید و در حالی که مدل در حافظه بارگذاری شده است، ollama ps را بخوانید: این دستور حجم اشغال‌شده واقعی و اینکه آیا مدل روی GPU قرار گرفته یا CPU را نمایش می‌دهد. حجم دانلود، یعنی 25 GB برای تگ پیش‌فرض، حداقل مقدار است؛ زیرا KV cache به آن اضافه می‌شود و با افزایش context window که تنظیم می‌کنید، رشد می‌کند. اگر منابع سیستم کم باشد، Ollama با خطای model requires more system memory متوقف شده و هر دو عدد (نیاز و موجودی) را اعلام می‌کند.

آیا می‌توانم Nemotron 3.5 Lightning را روی VPS بدون GPU اجرا کنم؟

بله، اگر پلن شما RAM کافی برای نگهداری وزن‌های مدل داشته باشد. طراحی MoE در اینجا کمک می‌کند، زیرا در هر توکن تنها حدود 3 از 30 میلیارد پارامتر محاسبه می‌شوند. مشکل اصلی سرعت است. بدون GPU، مدل با محدودیت پهنای باند حافظه مواجه است، بنابراین افزایش vCPU تأثیر چندانی بر نتیجه ندارد. دستور ollama run --verbose را با یک prompt ثابت اجرا کنید، خط eval rate را بخوانید و آن عدد را با محدودیت زمانی مورد نیاز برای agent خود بسنجید. برای کارهای دسته‌ای (batch job) که شبانه انجام می‌شوند، معمولاً مشکلی وجود ندارد. اما برای مواردی که کاربر منتظر پاسخ است، معمولاً مناسب نیست.

چرا Ollama به من context window کامل 1M را نمی‌دهد؟

1M حداکثر ظرفیت مدل است، نه مقدار پیش‌فرض Ollama. Ollama از یک window بسیار کوچک‌تر استفاده می‌کند و پس از پر شدن آن، قدیمی‌ترین توکن‌ها را بدون نمایش خطا حذف می‌کند؛ این اتفاق باعث می‌شود agent دستورالعمل‌های قبلی خود را فراموش کند. مقدار OLLAMA_CONTEXT_LENGTH را در سرویس systemd تنظیم کنید یا num_ctx را در هر درخواست ارسال نمایید. این مقدار را پله‌پله افزایش دهید و هر بار ollama ps را بررسی کنید، زیرا حافظه KV cache با افزایش window رشد می‌کند و ممکن است باعث شود لایه‌های مدل از روی GPU خارج شوند.

آیا استفاده تجاری از Nemotron 3.5 Lightning رایگان است؟

کارت مدل NVIDIA، این مدل را تحت لایسنس OpenMDW-1.1 قرار داده و آن را برای استفاده تجاری مجاز دانسته است. این موضوع شامل وزن‌هایی است که دانلود و اجرا می‌کنید. این لایسنس درباره سایر نرم‌افزارهای موجود در stack شما چیزی نمی‌گوید، بنابراین لایسنس‌های agent harness و هر ابزاری که به آن متصل می‌کنید را جداگانه بررسی کنید و پیش از هرگونه تعهد قراردادی، کارت مدل فعلی را مطالعه نمایید.