SSD Nodes Learn 🎉 VPS kutoka $5.50/mwezi
Mwongozo Matt ConnorNa Matt Connor · Imeboreshwa 2026-08-13

Jinsi ya kuendesha Nemotron 3.5 Lightning kwenye VPS

Jifunze kuendesha NVIDIA Nemotron 3.5 Lightning kwa kutumia Ollama kwenye seva yako. Pata mwongozo wa tag sahihi, mahitaji ya RAM, na ukweli kuhusu kasi ya CPU pekee.

Nemotron 3.5 Lightning inatumika kwa nini

Nemotron 3.5 Lightning ni mfumo wa 30B mixture-of-experts wa NVIDIA, uliotolewa mnamo Agosti 2026, na umejengwa kwa ajili ya mawakala (agents) wanaoendesha kwa saa nyingi badala ya dirisha moja la gumzo. MoE (mixture of experts) inamaanisha kuwa uzito (weights) umegawanywa katika mitandao midogo mingi ya wataalamu, na kila token hupitishwa kwenye michache tu kati yao. Kadi ya mfumo wa NVIDIA inaonyesha jumla ya vigezo (parameters) bilioni 30, huku bilioni 3 zikiwa hai kwa kila token. Unalipia idadi kubwa katika kumbukumbu. Unapata idadi ndogo kama kasi.

Biashara hiyo ndiyo sababu ya kuangalia mfumo huu kwa seva unayokodisha. Wakala anayefanya kazi halisi hutuma maelfu ya maombi mafupi kwa siku, kwa hivyo throughput kwa kila dola huamua kama inaweza kuishi kwenye mashine yako mwenyewe. Mfumo unaochukua sekunde 40 kwa kila jibu ni msaidizi anayefaa lakini wakala mbaya, kwa sababu kazi moja hufanya wito ishirini na unasubiri kila mmoja wao.

NVIDIA inaelezea usanifu huu kama mseto: tabaka za Mamba-2 na MoE zilizounganishwa na tabaka teule za umakini (attention layers). Kadi ya mfumo inatoa urefu wa juu wa muktadha (context length) hadi token 1M na leseni ya OpenMDW-1.1, iliyotiwa alama kuwa tayari kwa matumizi ya kibiashara. Lugha kuu ni Kiingereza na msimbo (code), huku Kihispania, Kifaransa, Kijerumani, Kiitaliano na Kijapani pia zikiorodheshwa.

Artificial Analysis ilichapisha vipimo vya uzinduzi mnamo Agosti 2026 ikionyesha karibu token 670 kwa sekunde, kwenye endpoint ya awali ya DeepInfra inayohudumia uzito wa NVFP4. Hiyo ni endpoint ya GPU iliyopangishwa (hosted). Isome kama kile ambacho usanifu unaruhusu, si kama kile ambacho VPS yako itafanya.

Ni tag ipi ya Ollama inayofaa VPS ipi

Maktaba ya Ollama huchapisha matoleo kadhaa ya uzito (weights) sawa. Kinachobadilika kati yao ni quantisation, ambayo ni idadi ya biti zinazotumiwa kuhifadhi kila uzito, na hii hubadilisha ukubwa wa faili ya kupakua kwa kiasi kikubwa.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

Tag zilizopewa majina latest, 30b na 30b-a3b zote huelekeza kwenye digest sawa na 30b-a3b-q4_K_M, kwa hivyo upakuaji wa kawaida ni toleo la biti nne la 25 GB lenye context ya 1M kamili. Q8_0 ni 35 GB na bf16 ni 66 GB, zote zikiwa na 1M pia. Matoleo ya MLX yenye 23 GB ni kwa ajili ya Apple silicon na yana ukomo wa 256K context, kwa hivyo ni chaguo lisilo sahihi kwenye Linux VPS.

Hizo ni ukubwa wa faili za kupakua, si mahitaji ya kumbukumbu. NVIDIA haichapishi takwimu ya chini kabisa ya VRAM (video RAM) kwa matoleo ya Ollama, kwa hivyo chukulia ukubwa wa upakuaji kama msingi tu na si kitu kingine. Uzito lazima uwe mahali fulani, kwenye kumbukumbu ya GPU ikiwa kadi ina uwezo wa kuushikilia, na kwenye system RAM ikiwa sivyo, na KV cache (key/value cache, kumbukumbu ya mfano ya kila token katika mazungumzo) huongezwa juu yake. Namba halisi kwa ajili ya maunzi yako inatokana na amri, si kwa hesabu, na iko hapa chini. Ikiwa bado hujaamua kiwango cha quantisation, gharama za Q4, Q8 na FP16 inaelezea kile kinachopotea katika kila hatua.

Vuta tag kamili, usitumie latest kamwe

latest ni pointer inayobadilika. Wakati maktaba inapochapisha upya, tabia ya wakala wako hubadilika kwenye pull inayofuata bila maelezo yoyote kwenye madokezo yako ya kwa nini imetokea. Taja tag husika.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

Hati ya usakinishaji huweka service ya systemd inayofanya kazi kama mtumiaji wa ollama na kuhifadhi models chini ya /usr/share/ollama/.ollama/models. Njia hiyo iko kwenye root filesystem katika picha nyingi za VPS, kwa hivyo hakikisha kuna nafasi ya kutosha kabla ya kuomba 25 GB.

df -h /usr/share/ollama

Pull inayosimama katikati na kuripoti no space left on device inamaanisha hivyo hasa, na blobs zilizopakuliwa kwa sehemu hubaki kwenye diski hadi utakapozifuta. Kisha thibitisha kilichofanikiwa kuhifadhiwa:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show huchapisha usanifu (architecture), idadi ya vigezo (parameter count), urefu wa muktadha (context length) na quantisation ambayo faili inayo. Ikiwa yoyote kati ya hayo hayalingani na ukurasa wa maktaba, umepakua tag tofauti na ile uliyokusudia.

Ihudumie, na uangalie mahali ilipofanya kazi

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Wakati modeli bado imepakiwa, kwenye shell ya pili:

ollama ps

Hii ndiyo amri inayojibu swali la kumbukumbu kwa mashine yako. ollama ps huchapisha modeli iliyopakiwa, ukubwa inaotumia kwenye kumbukumbu, na safu ya PROCESSOR. 100% GPU inamaanisha yote iko kwenye VRAM. 100% CPU inamaanisha hakuna sehemu yoyote iliyo huko, na kila token huhesabiwa na processor kutoka kwenye RAM ya mfumo. Mgawanyo kama 65%/35% CPU/GPU unamaanisha tabaka (layers) hazikutoshea zote, na sehemu ya CPU ndiyo huamua kasi yako. Usikisie mahitaji. Ipakie na usome mstari huu.

Ikiwa haiwezi kupakia kabisa, Ollama hukataa kwa usafi badala ya kuacha kufanya kazi (crash):

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

Je, VPS inayotumia CPU pekee ina kasi ya kutosha?

VPS ya kawaida haina GPU, kwa hivyo CPU hufanya kazi yote na kusoma kila uzito (weight) unaohitajika kutoka kwenye RAM ya mfumo. MoE husaidia hapa, kwa sababu ni takriban bilioni 3 kati ya vigezo bilioni 30 pekee ndivyo vinavyoguswa kwa kila token, hivyo hesabu kwa kila token ni ndogo sana ikilinganishwa na modeli ya 30B iliyojaa (dense). Kumbukumbu haisaidiwi hata kidogo. Vigezo vyote bilioni 30 lazima vibaki kwenye kumbukumbu, kwa sababu router inaweza kuchagua mtaalamu (expert) yeyote kwa token yoyote.

Kwa hivyo, inference ya CPU pekee kwenye modeli hii hupunguzwa kasi na bandwidth ya kumbukumbu badala ya idadi ya cores. Kuongeza vCPUs kwenye mpango ambao tayari una idadi inayofaa ya cores hakubadilishi mengi. Unachohitaji ni RAM ya kutosha kuhifadhi uzito pamoja na KV cache yako, na kumbukumbu ya kasi zaidi inayotolewa na mpango huo.

Ipime kabla ya kuikabidhi wakala (agent), kwa kutumia mbinu iliyo katika kupima token kwa sekunde kwa LLM ya ndani:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

Mstari wa eval rate unaochapishwa mwishoni ndio kasi yako ya uzalishaji katika token kwa sekunde. Nambari hiyo moja ndiyo huamua swali, kwa sababu muda wa saa wa wakala hutawaliwa nayo.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Hizo ni takwimu zilizochapishwa na wahusika wengine, zilizobadilishwa kutoka dakika za kila kazi ambazo Artificial Analysis iliripoti wakati wa uzinduzi, na zilipimwa kwenye GPU endpoints zilizopangishwa badala ya VPS. Nemotron 3.5 Lightning ilikuwa na wastani wa sekunde 30 kwa kila kazi, ambapo gpt-oss-120b ilichukua takriban 204 na Qwen3.6 35B takriban 210. Zitumie kwa ajili ya kuona tofauti ya kasi, si kama ahadi kuhusu maunzi yako.

Mwongozo wa kweli hutegemea nani anayesubiri. Ikiwa mtu anamsubiri wakala, au wakala hufanya msururu mrefu wa maombi mfululizo, kodi uwezo wa GPU. Ikiwa inaendeshwa kwa ratiba usiku na hakuna anayeitazama, mpango wa CPU wenye RAM kubwa ni mahali pazuri. Kwa vyovyote vile, usanidi ni uleule, na kuendesha Ollama kwenye VPS kunashughulikia ukubwa wa mpango na jinsi mfano wa GPU unavyolinganishwa na kulipia mtoa huduma wa API kwa kila token. Ukomo wa faida ni swali la matumizi: mfano wa GPU hutoza kila saa inayokuwepo, wakati token za API hutoza tu zinapotumika, kwa hivyo wakala anayefanya kazi muda mwingi wa siku anafaa zaidi kwenye seva unayomiliki, na wakala anayefanya kazi mara mbili kwa saa kwa kawaida hafai.

Dirisha la muktadha la 1M si la bure

Token 1M ndio uwezo wa juu zaidi wa modeli, na Ollama haikupi kiasi hicho kwa chaguo-msingi. Ollama hutumia dirisha dogo zaidi la chaguo-msingi na hufuta token za zamani zaidi pindi mazungumzo yanapozidi kiasi hicho. Hakuna kinachorekodiwa wakati hilo linapotokea, kwa hivyo kwa wakala (agent), inaonekana kama modeli inasahau mwanzo wa kazi yake yenyewe.

Weka dirisha hilo kwa makusudi. Kwa seva nzima, hariri huduma:

sudo systemctl edit ollama

Ongeza hili, kisha endesha sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Kwa kila ombi, tuma num_ctx ndani ya kitu cha options badala yake:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Kila ongezeko hugharimu kumbukumbu, kwa sababu KV cache hukua kulingana na idadi ya token unazoruhusu. Ongeza thamani hiyo, anzisha upya, kisha endesha ollama ps tena na uangalie ukubwa unaoripotiwa ukipanda. Ikiwa safu ya PROCESSOR itabadilika kutoka 100% GPU kwenda kwenye split baada ya mabadiliko hayo, KV cache imesukuma matabaka ya modeli nje ya VRAM na kasi yako itashuka sana. Kuchagua num_ctx katika Ollama inaelezea biashara hiyo kwa kina. Usiweke 1000000 kwa sababu tu kadi ya modeli inaruhusu, kwa sababu ugawaji wa kumbukumbu hutokea mwanzoni na mzigo utashindwa kupakiwa.

Kuingiza kwenye wakala anayefanya kazi muda wote

Chapisho la uzinduzi wa Ollama kwa modeli hii linaelezea njia ya mkato inayozindua wakala anayekubalika akiwa tayari ameelekezwa kwenye modeli hiyo:

ollama launch claude --model nemotron-3.5-lightning

Chapisho hilo linaelezea claude, opencode, openclaw na hermes katika nafasi hiyo. Subcommand hiyo inahitaji toleo la sasa la Ollama, kwa hivyo kagua ollama --version kwanza, na ikiwa haipo, elekeza wakala kwenye API mwenyewe. Ollama hutoa endpoint inayooana na OpenAI, ambayo mifumo mingi ya wakala huikubali:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama hupuuza ufunguo (key), lakini wateja wengi hukataa kuanza bila ufunguo kuwekwa. Upande wa mfumo wa wakala (harness) umeelezwa katika kuelekeza wakala wa uandishi wa msimbo kwenye Ollama na katika kujenga wakala wako mwenyewe wa OpenClaw.

Mipangilio miwili ya seva ni muhimu pindi wakala anapoanza kufanya kazi bila kusimamiwa. OLLAMA_KEEP_ALIVE hudhibiti muda ambao modeli inakaa kwenye kumbukumbu baada ya ombi la mwisho, na chaguo-msingi huiondoa baada ya dakika tano, hivyo ombi linalofuata litasubiri tena muda wote wa kupakia. Kwenye faili ya 25 GB bila GPU, pause hiyo ni ndefu kiasi cha kusababisha timeout. Weka OLLAMA_KEEP_ALIVE=-1 ili kuifanya ibaki kwenye kumbukumbu. OLLAMA_HOST=0.0.0.0:11434 hufanya API iweze kufikiwa kutoka kwa mashine nyingine, na haina uthibitishaji wa aina yoyote, kwa hivyo ifungue tu nyuma ya sheria ya firewall au mtandao wa kibinafsi.

Njia za kufeli, pamoja na ujumbe utakaouona

Uvutaji (pull) unafeli mara moja. Error: pull model manifest: file does not exist inamaanisha kuwa tag hiyo haipo. Majina ya tag ni mfuatano kamili wa herufi, kwa hivyo nakili moja kutoka kwenye ukurasa wa maktaba badala ya kukisia suffix ya quantisation.

Model haitapakia. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) inamaanisha kuwa tag ni kubwa mno kwa mpango huu kama ulivyosanidiwa. Tumia quantisation ndogo zaidi, au punguza OLLAMA_CONTEXT_LENGTH, kwa sababu KV cache huhesabiwa ndani ya hitaji hilo.

Hakuna jibu kwenye port 11434. curl: (7) Failed to connect to localhost port 11434 inamaanisha kuwa huduma haifanyi kazi, au haisikilizi mahali unapotarajia. Soma systemctl status ollama na journalctl -u ollama -n 50. Ikiwa pia uliianzisha ollama serve kwa mkono, nakala ya pili itafunga na kutoa Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Inajibu, kwa polepole sana. Kagua ollama ps kabla ya kubadilisha chochote. Sehemu yoyote ya CPU katika safu ya PROCESSOR kwenye mashine yenye GPU inamaanisha kuwa sehemu ya model imemwagika nje ya VRAM, kwa hivyo punguza context au chukua quantisation ndogo zaidi. Kwenye mashine isiyo na GPU, polepole ni matokeo yanayotarajiwa na hakuna mpangilio unaoweza kurekebisha hilo.

Wakala anasahau maelekezo yake katikati ya kazi. Mazungumzo yamevuka dirisha la context na token za zamani zaidi zimeondolewa kimya kimya. Ongeza OLLAMA_CONTEXT_LENGTH, thibitisha na ollama ps kuwa model bado inatoshea, na ikiwa haitoshei tena, suluhisho ni mashine kubwa zaidi badala ya dirisha dogo zaidi.

Mahali ambapo modeli hii inasimama ikilinganishwa na njia mbadala

Modeli ya 30B MoE ni kitu kikubwa cha kuendesha kwa kazi ndogo. Ikiwa modeli ya 8B ya kawaida tayari inashughulikia kazi yako, itagharimu kidogo zaidi kuendesha na kupakia kwa sekunde chache, na Qwen 3 katika 8B na 27B kwenye VPS ndiyo kulinganisha kwa moja kwa moja kwa uamuzi huo. Kwa uchunguzi mpana zaidi wa kile ambacho mpango fulani unaweza kuhifadhi, anza kutoka ni modeli zipi za AI unazoweza kujiendeshea mwenyewe. Ikiwa unapanga kuhudumia mawakala kadhaa kwa wakati mmoja badala ya mmoja, soma Ollama ikilinganishwa na vLLM kwanza, kwa sababu Ollama haifanyi batching ya maombi ya wakati mmoja kama seva ya uzalishaji ya inference inavyofanya, na hapo ndipo usanidi wa mtumiaji mmoja unapoacha kuongezeka (scale).

FAQ

Ni tag ipi ya Nemotron 3.5 Lightning ninayopaswa kuvuta kwenye Linux VPS?

Tumia nemotron-3.5-lightning:30b-a3b-q4_K_M. Ina ukubwa wa 25 GB, inabeba uwezo kamili wa context wa 1M, na ni digest ileile inayoelekezwa na tag za latest, 30b na 30b-a3b kufikia Agosti 2026. Iandike kwa uwazi badala ya kuvuta latest, ili uchapishaji mpya wa pointer hiyo usibadilishe tabia ya wakala wako bila wewe kugundua. Tag za mlx ni za Apple silicon na hazitakusaidia kwenye Linux.

Nemotron 3.5 Lightning inahitaji RAM kiasi gani?

NVIDIA haichapishi kiasi cha chini cha kumbukumbu kwa ajili ya build za Ollama, kwa hivyo pima badala ya kukadiria. Vuta tag hiyo, endesha model mara moja, na usome ollama ps wakati imepakiwa: inaonyesha ukubwa unaotumiwa kihalisi na kama imekaa kwenye GPU au CPU. Ukubwa wa download, 25 GB kwa tag ya kawaida, ni kima cha chini, kwa sababu KV cache huongezwa juu yake na hukua kulingana na context window unayoweka. Ikiwa plan ni ndogo mno, Ollama inakataa kwa kutoa model requires more system memory na kutaja namba zote mbili.

Je, ninaweza kuendesha Nemotron 3.5 Lightning kwenye VPS isiyo na GPU?

Ndiyo, ikiwa plan ina RAM ya kutosha kuhifadhi weights, na muundo wa MoE husaidia kwa sababu ni takriban 3 kati ya bilioni 30 za parameters pekee ndizo zinazokokotolewa kwa kila token. Kasi ndiyo changamoto. Bila GPU, model inategemea bandwidth ya kumbukumbu, kwa hivyo kuongeza vCPU hakubadilishi matokeo kwa kiasi kikubwa. Endesha ollama run --verbose na prompt isiyobadilika, soma mstari wa eval rate, na ulinganishe namba hiyo na muda unaohitajika na wakala wako. Kwa kazi za batch za usiku kucha, mara nyingi inafaa. Kwa chochote ambacho mtu anasubiri, kwa kawaida haifai.

Kwa nini Ollama hainipi context window kamili ya 1M?

1M ni uwezo wa juu wa model, si chaguo-msingi la Ollama. Ollama hutumia window ndogo zaidi na hufuta token za zamani zaidi pindi mazungumzo yanapoizidi, bila kutoa error yoyote, jambo linaloonekana kama wakala anasahau maelekezo yake mwenyewe. Weka OLLAMA_CONTEXT_LENGTH kwenye service ya systemd, au pitisha num_ctx kwa kila ombi. Iongeze hatua kwa hatua na uangalie upya ollama ps kila mara, kwa sababu kumbukumbu ya KV cache huongezeka kulingana na window na inaweza kusukuma layers za model kutoka kwenye GPU.

Je, Nemotron 3.5 Lightning ni bure kwa matumizi ya kibiashara?

Model card ya NVIDIA inaiweka model hii chini ya leseni ya OpenMDW-1.1 na kuashiria kuwa iko tayari kwa matumizi ya kibiashara. Hiyo inahusu weights unazodownload na kuziendesha mwenyewe. Haizungumzii programu nyingine kwenye stack yako, kwa hivyo kagua leseni za agent harness na zana zozote unazounganisha nayo kando, na usome model card ya sasa kabla ya kuitegemea kwa jambo lolote la kimkataba.