SSD Nodes Learn Hosting plans →
راهنماها Matt Connorتوسط Matt Connor · به‌روزرسانی شده 2026-08-27

اجرای مدل Nemotron 3.5 Lightning روی VPS با Ollama

راهنمای کامل اجرای Nemotron 3.5 Lightning با استفاده از Ollama روی سرور شخصی. بررسی دقیق میزان RAM مورد نیاز، تگ pull برای نسخه بهینه و تحلیل سرعت مدل در حالت CPU-only.

مدل Nemotron 3.5 Lightning چه کاربردی دارد

مدل Nemotron 3.5 Lightning مدل 30 میلیاردی Mixture-of-Experts (MoE) متن‌باز NVIDIA است که در اوت 2026 منتشر شد و برای عامل‌هایی (agents) طراحی شده که به‌جای یک پنجره چت ساده، برای ساعت‌ها اجرا می‌شوند. معماری MoE به این معناست که وزن‌ها به چندین زیرشبکه تخصصی تقسیم شده‌اند و هر توکن تنها از میان تعداد کمی از آن‌ها عبور می‌کند. طبق کارت مدل NVIDIA، این مدل در مجموع 30 میلیارد پارامتر دارد که 3 میلیارد از آن‌ها به ازای هر توکن فعال هستند. شما هزینه حافظه را برای تعداد کل پارامترها می‌پردازید، اما سرعت اجرای آن متناسب با تعداد پارامترهای فعال است.

این موازنه، دلیلی است که باید این مدل را برای سرورهای اجاره‌ای خود در نظر بگیرید. عاملی که کارهای واقعی انجام می‌دهد، در طول روز هزاران درخواست کوتاه ارسال می‌کند؛ بنابراین، نرخ throughput به ازای هر دلار تعیین می‌کند که آیا اجرای آن روی سرور شخصی شما به‌صرفه است یا خیر. مدلی که پاسخ‌دهی آن 40 ثانیه طول می‌کشد، شاید دستیار خوبی باشد اما عامل ضعیفی است، زیرا یک وظیفه ممکن است بیست فراخوانی ایجاد کند و شما باید منتظر تک‌تک آن‌ها بمانید.

NVIDIA این معماری را هیبریدی توصیف می‌کند: لایه‌های Mamba-2 و MoE به‌صورت درهم‌تنیده (interleaved) به همراه لایه‌های توجه (attention) منتخب. کارت مدل، حداکثر طول کانتکست را تا 1M توکن و مجوز آن را OpenMDW-1.1 اعلام کرده که برای استفاده تجاری آماده است. زبان‌های اصلی این مدل انگلیسی و کدنویسی هستند و زبان‌های اسپانیایی، فرانسوی، آلمانی، ایتالیایی و ژاپنی نیز در لیست پشتیبانی قرار دارند.

مؤسسه Artificial Analysis در اوت 2026 اندازه‌گیری‌های زمان عرضه را منتشر کرد که نشان‌دهنده سرعت نزدیک به 670 توکن خروجی در ثانیه روی یک endpoint پیش‌انتشار DeepInfra با وزن‌های NVFP4 بود. این یک endpoint میزبانی‌شده GPU است. این اعداد را به‌عنوان توانایی معماری در نظر بگیرید، نه عملکردی که لزوماً روی VPS شما حاصل خواهد شد.

کدام تگ Ollama برای کدام VPS مناسب است

کتابخانه Ollama چندین نسخه از وزن‌های یکسان را منتشر می‌کند. تفاوت این نسخه‌ها در کوانتیزاسیون (quantisation) است؛ یعنی هر وزن با چند بیت ذخیره می‌شود که این موضوع تأثیر زیادی بر حجم دانلود دارد.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

تگ‌های نام‌گذاری‌شده latest، 30b و 30b-a3b همگی به همان دایجست (digest) مربوط به 30b-a3b-q4_K_M اشاره دارند، بنابراین دانلود پیش‌فرض، نسخه چهار-بیتی 25 گیگابایتی با کانتکست کامل 1M است. نسخه Q8_0 حجمی معادل 35 گیگابایت و نسخه bf16 حجمی معادل 66 گیگابایت دارد که هر دو نیز با کانتکست 1M هستند. نسخه‌های MLX با حجم 23 گیگابایت برای تراشه‌های Apple silicon طراحی شده‌اند و کانتکست آن‌ها به 256K محدود است، بنابراین برای یک VPS لینوکسی انتخاب اشتباهی محسوب می‌شوند.

این ارقام، حجم دانلود هستند و نه الزامات حافظه. NVIDIA حداقل مقدار VRAM (حافظه ویدیویی) را برای نسخه‌های Ollama اعلام نمی‌کند، بنابراین حجم دانلود را فقط به‌عنوان کفِ مقدار مورد نیاز در نظر بگیرید. وزن‌ها باید در جایی مستقر باشند؛ اگر کارت گرافیک ظرفیت داشته باشد در حافظه GPU و در غیر این صورت در RAM سیستم قرار می‌گیرند. علاوه بر این، KV cache (حافظه کلید/مقدار که حافظه مدل برای هر توکن در طول گفتگو است) نیز به آن اضافه می‌شود. عدد واقعی برای سخت‌افزار شما از طریق یک دستور به دست می‌آید، نه از طریق محاسبات ریاضی، که در ادامه آمده است. اگر هنوز در مورد سطح کوانتیزاسیون تصمیم نگرفته‌اید، هزینه هر یک از سطوح Q4، Q8 و FP16 توضیح می‌دهد که در هر مرحله چه چیزی را از دست می‌دهید.

دقیقاً همان تگ را دریافت کنید، هرگز از latest استفاده نکنید

latest یک اشاره‌گر متغیر است. هنگامی که کتابخانه آن را دوباره منتشر می‌کند، رفتار عامل شما در دریافت بعدی تغییر می‌کند، بدون اینکه در یادداشت‌هایتان توضیحی برای این تغییر وجود داشته باشد. نام تگ را مشخص کنید.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

اسکریپت نصب، یک سرویس systemd ایجاد می‌کند که با کاربر ollama اجرا می‌شود و مدل‌ها را در مسیر /usr/share/ollama/.ollama/models نگه می‌دارد. این مسیر در اکثر ایمیج‌های VPS روی فایل‌سیستم ریشه (root) قرار دارد، بنابراین پیش از درخواست 25 گیگابایت، فضای خالی را بررسی کنید. اگر این فایل‌سیستم فضای کمی دارد، مطالعه محل ذخیره‌سازی مدل‌های Ollama و نحوه انتقال آن‌ها پیش از انجام عملیات دریافت (pull)، بهتر از زمانی است که دیسک پر شده باشد.

df -h /usr/share/ollama

دریافتی که در میانه راه متوقف می‌شود و خطای no space left on device را گزارش می‌دهد، دقیقاً به همین معناست و داده‌های ناقص (blobs) تا زمانی که آن‌ها را حذف نکنید، روی دیسک باقی می‌مانند. سپس بررسی کنید چه چیزی با موفقیت ذخیره شده است:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

دستور ollama show معماری، تعداد پارامترها، طول زمینه (context length) و کوانتیزاسیونی که فایل واقعاً در خود دارد را چاپ می‌کند. اگر هر یک از این موارد با صفحه کتابخانه مغایرت داشته باشد، شما تگی متفاوت از آنچه مد نظرتان بوده را دریافت کرده‌اید.

سرویس‌دهی و بررسی محل اجرای واقعی

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

در حالی که مدل همچنان بارگذاری شده است، در یک ترمینال دوم دستور زیر را اجرا کنید:

ollama ps

این دستوری است که به پرسش مربوط به حافظه برای دستگاه شما پاسخ می‌دهد. ollama ps مدل بارگذاری‌شده، حجم اشغال‌شده در حافظه و ستون PROCESSOR را نمایش می‌دهد. مقدار 100% GPU به این معناست که تمام مدل در VRAM قرار دارد. مقدار 100% CPU یعنی هیچ بخشی از آن در VRAM نیست و هر توکن توسط پردازنده از طریق RAM سیستم محاسبه می‌شود. تقسیمی مانند 65%/35% CPU/GPU به این معناست که لایه‌ها به‌طور کامل در حافظه گرافیکی جا نشده‌اند و سهم CPU سرعت شما را تعیین می‌کند. نیاز حافظه را حدس نزنید؛ مدل را بارگذاری کنید و این خط را بخوانید.

اگر مدل اصلاً بارگذاری نشود، Ollama به‌جای کرش کردن، به‌صورت تمیز عملیات را متوقف می‌کند:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

آیا یک VPS فقط با CPU به اندازه کافی سریع است؟

یک VPS عمومی فاقد GPU است، بنابراین CPU تمام پردازش‌ها را انجام می‌دهد و هر وزنی را که نیاز دارد از RAM سیستم می‌خواند. در اینجا مدل‌های MoE کمک‌کننده هستند، زیرا برای هر توکن تنها حدود 3 میلیارد از 30 میلیارد پارامتر پردازش می‌شوند؛ بنابراین محاسبات ریاضی برای هر توکن بسیار کمتر از یک مدل متراکم 30B است. اما این موضوع کمکی به حافظه نمی‌کند. تمام 30 میلیارد پارامتر باید در حافظه مقیم باشند، زیرا روتر ممکن است برای هر توکن، هر متخصصی (expert) را انتخاب کند.

بنابراین، استنتاج (inference) فقط با CPU در این مدل، بیش از آنکه به تعداد هسته‌ها وابسته باشد، توسط پهنای باند حافظه محدود می‌شود. افزودن vCPU به پلانی که تعداد هسته‌های معقولی دارد، تغییر چندانی ایجاد نمی‌کند. آنچه شما نیاز دارید، RAM کافی برای نگهداری وزن‌ها به همراه KV cache و سریع‌ترین حافظه‌ای است که آن پلن در اختیار شما می‌گذارد.

پیش از اختصاص یک عامل (agent) به آن، با استفاده از روش اندازه‌گیری توکن بر ثانیه برای یک LLM محلی، سرعت را بسنجید:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

خط eval rate که در پایان چاپ می‌شود، سرعت تولید شما بر حسب توکن بر ثانیه است. همین یک عدد تعیین‌کننده است، زیرا زمان واقعی (wall-clock time) اجرای یک عامل تحت تأثیر آن است. آن را در طول پاسخ مورد انتظار خود ضرب کنید؛ اگر پاسخ طولانی‌تر از زمانی است که مایل به صبر کردن هستید، محدود کردن خروجی با num_predict تنها اهرمی است که بدون تغییر سخت‌افزار، یک فراخوانی واحد را محدود می‌کند.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

این‌ها ارقام منتشرشده توسط شخص ثالث هستند که از زمان‌های گزارش‌شده توسط Artificial Analysis در زمان عرضه تبدیل شده‌اند و روی endpointهای GPU میزبانی‌شده اندازه‌گیری شده‌اند، نه روی یک VPS. مدل Nemotron 3.5 Lightning به‌طور میانگین حدود 30 ثانیه برای هر وظیفه زمان صرف کرد، که در آن gpt-oss-120b تقریباً 204 و Qwen3.6 35B تقریباً 210 زمان برد. از این ارقام برای درک مقیاس تفاوت استفاده کنید، نه به عنوان تضمینی برای سخت‌افزار خودتان.

راهنمایی صادقانه به این بستگی دارد که چه کسی منتظر است. اگر یک انسان منتظر عامل است، یا عامل زنجیره‌های طولانی از فراخوانی‌ها را پشت سر هم انجام می‌دهد، ظرفیت GPU اجاره کنید. اگر عامل طبق برنامه در طول شب اجرا می‌شود و کسی آن را تماشا نمی‌کند، یک پلن CPU با RAM بالا گزینه معقولی است. در هر صورت، راه‌اندازی یکسان است و اجرای Ollama روی یک VPS به نحوه انتخاب اندازه پلن و مقایسه یک نمونه GPU با پرداخت هزینه به ازای هر توکن به ارائه‌دهنده API می‌پردازد. نقطه سربه‌سر یک مسئله میزان استفاده است: هزینه نمونه GPU برای هر ساعتی که وجود دارد محاسبه می‌شود، در حالی که هزینه توکن‌های API فقط هنگام استفاده محاسبه می‌شود؛ بنابراین عاملی که در بیشتر ساعات روز فعال است، استفاده از سرور شخصی را توجیه می‌کند و عاملی که دو بار در ساعت اجرا می‌شود، معمولاً چنین نیست.

پنجره کانتکست 1M رایگان نیست

تعداد 1M توکن حداکثر ظرفیت مدل است و Ollama به‌صورت پیش‌فرض آن را در اختیار شما قرار نمی‌دهد. Ollama از یک پنجره پیش‌فرض بسیار کوچک‌تر استفاده می‌کند و به‌محض اینکه طول گفتگو از آن فراتر رود، قدیمی‌ترین توکن‌ها را حذف می‌کند. هنگام وقوع این اتفاق هیچ لاگی ثبت نمی‌شود، بنابراین برای یک عامل (agent)، این‌طور به نظر می‌رسد که مدل ابتدای وظیفه خود را فراموش کرده است.

پنجره را به‌صورت هدفمند تنظیم کنید. برای کل سرور، سرویس را ویرایش کنید:

sudo systemctl edit ollama

مورد زیر را اضافه کرده و سپس sudo systemctl restart ollama را اجرا کنید:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

برای هر درخواست، به جای آن num_ctx را در شیء options ارسال کنید:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

هر افزایش، حافظه مصرف می‌کند، زیرا KV cache با تعداد توکن‌های مجاز شما رشد می‌کند. مقدار را افزایش دهید، سرویس را ری‌استارت کنید، سپس دوباره ollama ps را اجرا کرده و افزایش اندازه گزارش‌شده را مشاهده کنید. اگر پس از این تغییر، ستون PROCESSOR از 100% GPU به split تغییر وضعیت داد، یعنی KV cache لایه‌های مدل را از VRAM خارج کرده و سرعت شما به‌شدت افت خواهد کرد. انتخاب num_ctx در Ollama این موازنه را به‌طور دقیق بررسی می‌کند. مقدار 1000000 را صرفاً به این دلیل که کارت مدل اجازه آن را می‌دهد تنظیم نکنید، زیرا تخصیص حافظه در همان ابتدا انجام می‌شود و بارگذاری مدل به‌سادگی با شکست مواجه خواهد شد.

اتصال آن به یک عامل همیشه فعال

پست معرفی Ollama برای این مدل، یک میان‌بر را مستند کرده است که یک عامل پشتیبانی‌شده را راه‌اندازی می‌کند که از قبل به آن اشاره دارد:

ollama launch claude --model nemotron-3.5-lightning

این پست claude، opencode، openclaw و hermes را در آن موقعیت مستند می‌کند. این زیردستور به نسخه به‌روز Ollama نیاز دارد، بنابراین ابتدا ollama --version را بررسی کنید و اگر موجود نبود، خودتان عامل را به سمت API هدایت کنید. Ollama یک endpoint سازگار با OpenAI ارائه می‌دهد که اکثر ابزارهای عامل (agent harnesses) آن را می‌پذیرند:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama کلید را نادیده می‌گیرد، اما اکثر کلاینت‌ها بدون تنظیم یک کلید، از اجرا خودداری می‌کنند. سمتِ ابزارِ این موضوع در هدایت یک عامل کدنویسی به سمت Ollama و در ساخت عامل OpenClaw شخصی پوشش داده شده است.

هنگامی که عامل به‌صورت بدون نظارت اجرا می‌شود، دو تنظیم سرور اهمیت پیدا می‌کنند. OLLAMA_KEEP_ALIVE کنترل می‌کند که مدل پس از آخرین درخواست چه مدت در حافظه باقی بماند؛ مقدار پیش‌فرض آن را پس از پنج دقیقه تخلیه می‌کند، بنابراین درخواست بعدی باید دوباره زمان کامل بارگذاری را صرف کند. روی یک فایل 25 گیگابایتی بدون GPU، این وقفه به‌قدری طولانی است که باعث شکستن timeout می‌شود. OLLAMA_KEEP_ALIVE=-1 را تنظیم کنید تا مدل در حافظه باقی بماند. OLLAMA_HOST=0.0.0.0:11434 باعث می‌شود API از سایر ماشین‌ها قابل دسترسی باشد؛ این تنظیم هیچ‌گونه احراز هویتی ندارد، بنابراین آن را فقط پشت یک قانون فایروال یا در یک شبکه خصوصی باز کنید.

حالت‌های شکست و پیام‌های خطای مربوطه

عملیات pull بلافاصله با شکست مواجه می‌شود. کد Error: pull model manifest: file does not exist به این معناست که آن تگ وجود ندارد. نام تگ‌ها رشته‌های دقیقی هستند، بنابراین به‌جای حدس زدن پسوند کوانتیزاسیون (quantisation)، یکی از آن‌ها را مستقیماً از صفحه کتابخانه کپی کنید.

مدل بارگذاری نمی‌شود. کد Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) به این معناست که تگ مورد نظر برای این پلن با پیکربندی فعلی بیش از حد بزرگ است. از یک کوانتیزاسیون کوچک‌تر استفاده کنید یا مقدار OLLAMA_CONTEXT_LENGTH را کاهش دهید، زیرا KV cache نیز در این محدودیت محاسبه می‌شود.

هیچ پاسخی روی پورت 11434 دریافت نمی‌شود. کد curl: (7) Failed to connect to localhost port 11434 به این معناست که سرویس در حال اجرا نیست یا در پورتی که انتظار دارید گوش نمی‌دهد. فایل‌های systemctl status ollama و journalctl -u ollama -n 50 را مطالعه کنید. اگر ollama serve را به‌صورت دستی اجرا کرده‌اید، نسخه دوم با خطای Error: listen tcp 127.0.0.1:11434: bind: address already in use متوقف می‌شود.

پاسخ‌دهی بسیار کند است. پیش از تغییر هر تنظیماتی، ollama ps را بررسی کنید. وجود هرگونه سهم CPU در ستون PROCESSOR روی دستگاهی که دارای GPU است، به این معناست که بخشی از مدل از VRAM خارج شده است؛ بنابراین context را کاهش دهید یا از کوانتیزاسیون کوچک‌تری استفاده کنید. در دستگاهی که فاقد GPU است، کند بودن نتیجه‌ای مورد انتظار است و هیچ تنظیمی آن را اصلاح نمی‌کند.

عامل (agent) دستورالعمل‌های خود را در میانه انجام وظیفه فراموش می‌کند. مکالمه از پنجره context فراتر رفته و قدیمی‌ترین توکن‌ها به‌طور خودکار حذف شده‌اند. مقدار OLLAMA_CONTEXT_LENGTH را افزایش دهید، با استفاده از ollama ps تأیید کنید که مدل همچنان در حافظه جا می‌شود؛ اگر دیگر جا نمی‌شود، راه‌حل استفاده از دستگاهی قدرتمندتر است، نه کوچک‌تر کردن پنجره.

جایگاه این مدل در مقایسه با سایر گزینه‌ها

یک مدل 30B از نوع MoE برای یک کار کوچک، گزینه سنگینی برای میزبانی است. اگر یک مدل 8B متراکم (dense) از قبل وظیفه شما را انجام می‌دهد، اجرای آن هزینه بسیار کمتری دارد و در چند ثانیه بارگذاری می‌شود؛ Qwen 3 در نسخه‌های 8B و 27B روی VPS مقایسه مستقیمی برای این تصمیم‌گیری ارائه می‌دهد. برای بررسی جامع‌تر اینکه هر پلن میزبانی واقعاً چه چیزی را می‌تواند پشتیبانی کند، از کدام مدل‌های هوش مصنوعی را می‌توانید خودتان میزبانی کنید شروع کنید. اگر قصد دارید به‌جای یک عامل (agent)، چندین عامل را هم‌زمان سرویس‌دهی کنید، ابتدا مقایسه Ollama با vLLM را مطالعه کنید؛ زیرا Ollama درخواست‌های هم‌زمان را به شیوه‌ای که یک سرور استنتاج (inference) عملیاتی مدیریت می‌کند، دسته‌بندی (batch) نمی‌کند و این همان نقطه‌ای است که مقیاس‌پذیری در یک تنظیمات تک‌کاربره متوقف می‌شود.

FAQ

برای یک VPS لینوکسی، کدام تگ Nemotron 3.5 Lightning را باید pull کنم؟

از nemotron-3.5-lightning:30b-a3b-q4_K_M استفاده کنید. حجم آن 25 گیگابایت است، از حداکثر کانتکست 1M پشتیبانی می‌کند و همان digest است که تگ‌های latest، 30b و 30b-a3b تا اوت 2026 به آن اشاره دارند. به‌جای pull کردن latest، نام آن را دقیقاً ذکر کنید تا انتشار مجدد آن اشاره‌گر در آینده، بدون اطلاع شما رفتار agent را تغییر ندهد. تگ‌های mlx برای معماری Apple silicon هستند و در لینوکس کاربردی ندارند.

Nemotron 3.5 Lightning به چه مقدار RAM نیاز دارد؟

NVIDIA حداقل حافظه مورد نیاز برای buildهای Ollama را اعلام نکرده است، بنابراین به‌جای تخمین، اندازه‌گیری کنید. تگ را pull کنید، مدل را یک‌بار اجرا کنید و در حالی که مدل در حافظه بارگذاری شده است، ollama ps را بخوانید: این دستور حجم دقیق اشغال‌شده و اینکه آیا مدل روی GPU قرار گرفته یا CPU را نمایش می‌دهد. حجم دانلود، یعنی 25 گیگابایت برای تگ پیش‌فرض، حداقل مقدار است؛ زیرا KV cache به آن اضافه می‌شود و با افزایش کانتکست window که تنظیم می‌کنید، رشد می‌کند. اگر پلن شما خیلی کوچک باشد، Ollama با خطای model requires more system memory امتناع کرده و هر دو عدد را اعلام می‌کند.

آیا می‌توانم Nemotron 3.5 Lightning را روی VPS بدون GPU اجرا کنم؟

بله، اگر پلن شما RAM کافی برای نگهداری وزن‌ها (weights) را داشته باشد. طراحی MoE در اینجا کمک می‌کند، زیرا در هر توکن تنها حدود 3 از 30 میلیارد پارامتر محاسبه می‌شوند. مشکل اصلی سرعت است. بدون GPU، مدل محدود به پهنای باند حافظه است، بنابراین افزودن vCPU تأثیر چندانی بر نتیجه ندارد. دستور ollama run --verbose را با یک prompt ثابت اجرا کنید، خط eval rate را بخوانید و آن عدد را با محدودیت زمانی agent خود بسنجید. برای کارهای دسته‌ای (batch job) که شبانه انجام می‌شوند، معمولاً مشکلی نیست. اما برای هر کاری که کاربر منتظر پاسخ آن است، معمولاً مناسب نیست.

چرا Ollama کانتکست window کامل 1M را به من نمی‌دهد؟

1M حداکثر ظرفیت مدل است، نه مقدار پیش‌فرض Ollama. Ollama از یک window بسیار کوچک‌تر استفاده می‌کند و پس از پر شدن، قدیمی‌ترین توکن‌ها را بدون نمایش خطا حذف می‌کند؛ این اتفاق باعث می‌شود agent دستورالعمل‌های خود را فراموش کند. مقدار OLLAMA_CONTEXT_LENGTH را در سرویس systemd تنظیم کنید یا num_ctx را در هر درخواست ارسال کنید. این مقدار را پله‌پله افزایش دهید و هر بار ollama ps را بررسی کنید، زیرا حافظه KV cache با افزایش window مقیاس‌پذیر است و می‌تواند لایه‌های مدل را از روی GPU خارج کند.

آیا استفاده تجاری از Nemotron 3.5 Lightning رایگان است؟

کارت مدل NVIDIA، این مدل را تحت لایسنس OpenMDW-1.1 قرار داده و آن را برای استفاده تجاری مجاز دانسته است. این موضوع شامل وزن‌هایی است که دانلود و اجرا می‌کنید. این لایسنس درباره سایر نرم‌افزارهای موجود در stack شما چیزی نمی‌گوید، بنابراین لایسنس‌های agent harness و هر ابزاری که به آن متصل می‌کنید را جداگانه بررسی کنید و پیش از هرگونه تعهد قراردادی، کارت مدل فعلی را مطالعه نمایید.