SSD Nodes Learn Hosting plans →
Mwongozo Matt ConnorNa Matt Connor · Imeboreshwa 2026-09-02

Jinsi ya kuendesha Nemotron 3.5 Lightning kwenye VPS

Jifunze jinsi ya kutumia Ollama kuendesha Nemotron 3.5 Lightning kwenye seva yako. Pata mwongozo wa tag sahihi, mahitaji ya RAM ya GB 24, na tathmini ya kasi ya CPU pekee.

Nemotron 3.5 Lightning inatumika kwa nini

Nemotron 3.5 Lightning ni modeli ya NVIDIA ya 30B mixture-of-experts iliyo wazi, iliyotolewa mnamo Agosti 2026, na imejengwa kwa ajili ya mawakala (agents) wanaoendesha kwa saa nyingi badala ya dirisha moja la gumzo. MoE (mixture of experts) inamaanisha kuwa uzito (weights) umegawanywa katika mitandao midogo mingi ya wataalamu, na kila token hupitishwa kupitia wachache tu kati yao. Kadi ya modeli ya NVIDIA inaonyesha jumla ya vigezo bilioni 30 huku bilioni 3 zikiwa hai kwa kila token. Unalipia idadi kubwa iliyo kwenye kumbukumbu. Unapata idadi ndogo kama kasi.

Biashara hiyo ndiyo sababu ya kuangalia modeli hii kwa seva unayokodisha. Wakala anayefanya kazi halisi hutuma maelfu ya maombi mafupi kwa siku, kwa hivyo throughput kwa kila dola huamua ikiwa inaweza kuishi kwenye seva yako mwenyewe. Modeli inayochukua sekunde 40 kwa kila jibu ni msaidizi anayefaa lakini wakala duni, kwa sababu kazi moja hufanya wito ishirini na unasubiri kila mmoja wao.

NVIDIA inaelezea usanifu huu kama mseto: tabaka za Mamba-2 na MoE zilizounganishwa na tabaka teule za umakini (attention layers). Kadi ya modeli inatoa urefu wa juu wa muktadha (context length) hadi token 1M na leseni ya OpenMDW-1.1, iliyotiwa alama kuwa tayari kwa matumizi ya kibiashara. Lugha kuu ni Kiingereza na msimbo (code), huku Kihispania, Kifaransa, Kijerumani, Kiitaliano na Kijapani pia zikiorodheshwa.

Artificial Analysis ilichapisha vipimo vya uzinduzi mnamo Agosti 2026 ikionyesha karibu token 670 kwa sekunde, kwenye endpoint ya DeepInfra ya kabla ya kutolewa inayohudumia uzito wa NVFP4. Hiyo ni endpoint ya GPU iliyopangishwa (hosted). Ione kama kile ambacho usanifu unaruhusu, si kama kile ambacho VPS yako itafanya.

Ni tag ipi ya Ollama inayofaa kwa VPS ipi

Maktaba ya Ollama huchapisha matoleo kadhaa ya uzani (weights) sawa. Kinachobadilika kati yao ni quantisation, yaani idadi ya bits zinazotumiwa kuhifadhi kila uzani, na jambo hili hubadilisha ukubwa wa faili ya kupakua kwa kiasi kikubwa.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

Tags zilizopewa majina latest, 30b na 30b-a3b zote huelekeza kwenye digest sawa na 30b-a3b-q4_K_M, kwa hivyo upakuaji chaguo-msingi ni toleo la four-bit la 25 GB lenye context ya 1M kamili. Q8_0 ni 35 GB na bf16 ni 66 GB, zote zikiwa na 1M pia. Matoleo ya MLX yenye 23 GB ni kwa ajili ya Apple silicon na yana ukomo wa 256K context, kwa hivyo ni chaguo lisilo sahihi kwenye Linux VPS.

Hizo ni ukubwa wa faili za kupakua, si mahitaji ya kumbukumbu. NVIDIA haichapishi takwimu ya chini kabisa ya VRAM (video RAM) kwa matoleo ya Ollama, kwa hivyo chukulia ukubwa wa upakuaji kama kiwango cha chini kabisa na si kingine. Uzani lazima uwe mahali fulani, kwenye kumbukumbu ya GPU ikiwa kadi ina uwezo wa kuuhifadhi, au kwenye system RAM ikiwa sivyo, na KV cache (key/value cache, kumbukumbu ya mfano ya mazungumzo kwa kila token) huongezwa juu yake. Namba halisi kwa maunzi yako inapatikana kupitia amri, si kwa hesabu, na iko hapa chini. Ikiwa bado hujaamua kiwango cha quantisation, gharama za Q4, Q8 na FP16 inaelezea kile kinachopotea katika kila hatua.

Vuta tag kamili, usitumie latest kamwe

latest ni pointer inayobadilika. Wakati maktaba inapochapisha upya, tabia ya agent wako hubadilika kwenye pull inayofuata bila maelezo yoyote kwenye madokezo yako ya kwa nini hilo limetokea. Taja tag husika.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

Script ya usakinishaji huweka service ya systemd inayofanya kazi kama mtumiaji wa ollama na kuhifadhi models chini ya /usr/share/ollama/.ollama/models. Njia hiyo iko kwenye root filesystem katika picha nyingi za VPS, kwa hivyo hakikisha kuna nafasi ya kutosha kabla ya kuomba 25 GB. Ikiwa filesystem hiyo imejaa, mahali ambapo Ollama huhifadhi models zake na jinsi ya kuzihamisha inafaa kusomwa kabla ya kufanya pull badala ya kusubiri hadi diski ijae.

df -h /usr/share/ollama

Pull inayokwama katikati na kuripoti no space left on device inamaanisha hivyo hasa, na blobs za muda hubaki kwenye diski hadi utakapozifuta. Kisha thibitisha kile kilichokamilika:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show huchapisha usanifu (architecture), idadi ya vigezo (parameter count), urefu wa muktadha (context length) na quantisation iliyomo kwenye faili husika. Ikiwa yoyote kati ya hayo hayalingani na ukurasa wa maktaba, umepakua tag tofauti na ile uliyokusudia.

Ihudumie, kisha uangalie ilikokimbia kihalisi

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Wakati modeli bado imepakiwa, kwenye shell ya pili:

ollama ps

Hii ndiyo amri inayojibu swali la kumbukumbu kwa mashine yako. ollama ps huchapisha modeli iliyopakiwa, ukubwa inaouchukua kwenye kumbukumbu, na safu ya PROCESSOR. 100% GPU inamaanisha yote iko kwenye VRAM. 100% CPU inamaanisha hakuna hata sehemu moja iliyo huko, na kila token huhesabiwa na processor kutoka kwenye RAM ya mfumo. Mgawanyo kama 65%/35% CPU/GPU unamaanisha kuwa layers zote hazikutosha, na sehemu ya CPU ndiyo huamua kasi yako. Usikisie mahitaji. Ipakiwe kisha usome mstari huu.

Ikiwa haiwezi kupakia kabisa, Ollama hukataa kwa usafi badala ya kupata hitilafu (crash):

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

Je, VPS inayotumia CPU pekee inatosha kwa kasi?

VPS ya kawaida haina GPU, kwa hivyo CPU hufanya kazi zote na kusoma kila uzito (weight) unaohitajika kutoka kwenye RAM ya mfumo. MoE husaidia hapa, kwa sababu takriban vigezo bilioni 3 kati ya bilioni 30 ndivyo vinavyoguswa kwa kila token, hivyo hesabu kwa kila token ni ndogo sana ikilinganishwa na modeli ya 30B iliyojaa (dense). Kumbukumbu haisaidiwi hata kidogo. Vigezo vyote bilioni 30 lazima vibaki kwenye kumbukumbu, kwa sababu router inaweza kuchagua mtaalamu yeyote kwa token yoyote.

Kwa hivyo, inference ya CPU pekee kwenye modeli hii hupunguzwa kasi na bandwidth ya kumbukumbu badala ya idadi ya cores. Kuongeza vCPUs kwenye mpango ambao tayari una idadi inayofaa ya cores hakubadilishi mengi. Unachohitaji ni RAM ya kutosha kuhifadhi uzito pamoja na KV cache yako, na kumbukumbu ya kasi zaidi inayotolewa na mpango huo.

Ipime kabla ya kuikabidhi agent, kwa kutumia mbinu iliyo katika kupima token kwa sekunde kwa LLM ya ndani:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

Mstari wa eval rate unaochapishwa mwishoni ndio kasi yako ya uzalishaji kwa token kwa sekunde. Nambari hiyo moja ndiyo huamua swali, kwa sababu muda wa saa wa agent hutawaliwa na kasi hiyo. Izididishe kwa urefu wa jibu unaotarajia, na ikiwa jibu ni refu kuliko muda unaoweza kusubiri, kudhibiti matokeo kwa num_predict ndiyo njia pekee ya kupunguza wito mmoja bila kubadilisha maunzi (hardware).

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Hizo ni takwimu zilizochapishwa na watu wengine, zilizobadilishwa kutoka dakika za kila kazi ambazo Artificial Analysis iliripoti wakati wa uzinduzi, na zilipimwa kwenye GPU endpoints zilizopangishwa badala ya VPS. Nemotron 3.5 Lightning ilikuwa na wastani wa sekunde 30 kwa kila kazi, ambapo gpt-oss-120b ilichukua takriban 204 na Qwen3.6 35B takriban 210. Zitumie kwa ajili ya kuona tofauti ya kasi, si kama ahadi kuhusu maunzi yako.

Mwongozo wa kweli hutegemea nani anayesubiri. Ikiwa mtu anamsubiri agent, au agent anafanya msururu mrefu wa wito mfululizo, kodi uwezo wa GPU. Ikiwa inaendeshwa kwa ratiba usiku na hakuna anayeitazama, mpango wa CPU wenye RAM kubwa ni mahali pazuri. Kwa vyovyote vile, usanidi ni uleule, na kuendesha Ollama kwenye VPS kunashughulikia ukubwa wa mpango na jinsi instance ya GPU inavyolinganishwa na kulipia mtoa huduma wa API kwa kila token. Ulinganifu wa gharama ni swali la matumizi: instance ya GPU hutoza kila saa inayokuwepo, wakati token za API hutoza tu zinapotumika, kwa hivyo agent anayefanya kazi muda mwingi wa siku anafaa zaidi kwenye seva unayomiliki, na agent anayefanya kazi mara mbili kwa saa kwa kawaida haifai.

Dirisha la muktadha la 1M si la bure

1M tokens ndio uwezo wa juu zaidi wa modeli, na Ollama haikupi kiasi hicho kwa chaguo-msingi. Ollama hutumia dirisha dogo zaidi la chaguo-msingi na hufuta tokens za zamani zaidi pindi mazungumzo yanapozidi uwezo huo. Hakuna kinachorekodiwa wakati hilo linapotokea, kwa hivyo kwa wakala (agent), inaonekana kama modeli inasahau mwanzo wa kazi yake yenyewe.

Weka dirisha hilo kwa makusudi. Kwa seva nzima, hariri huduma:

sudo systemctl edit ollama

Ongeza hili, kisha endesha sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Kwa kila ombi, tuma num_ctx ndani ya kitu cha options badala yake:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Kila ongezeko hugharimu kumbukumbu, kwa sababu KV cache hukua kulingana na idadi ya tokens unazoruhusu. Ongeza thamani hiyo, anzisha upya, kisha endesha ollama ps tena na uangalie ukubwa unaoripotiwa ukipanda. Ikiwa safu ya PROCESSOR itabadilika kutoka 100% GPU na kuwa split baada ya mabadiliko hayo, KV cache imesukuma matabaka ya modeli nje ya VRAM na kasi yako itashuka sana. Kuchagua num_ctx katika Ollama hufafanua biashara hiyo kwa kina. Usiweke 1000000 kwa sababu tu kadi ya modeli inaruhusu, kwa sababu ugawaji wa kumbukumbu hutokea mwanzoni na mzigo utashindwa kupakiwa.

Kuunganisha kwenye wakala anayefanya kazi muda wote

Chapisho la uzinduzi wa Ollama kwa modeli hii linaelezea njia ya mkato inayozindua wakala anayekubalika akiwa tayari ameelekezwa kwenye modeli hiyo:

ollama launch claude --model nemotron-3.5-lightning

Chapisho hilo linaelezea claude, opencode, openclaw na hermes katika nafasi hiyo. Subcommand hiyo inahitaji toleo la sasa la Ollama, kwa hivyo kagua ollama --version kwanza, na ikiwa haipo, elekeza wakala kwenye API wewe mwenyewe. Ollama hutoa endpoint inayooana na OpenAI, ambayo mifumo mingi ya mawakala huikubali:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama hupuuza ufunguo huo (key), lakini wateja wengi hukataa kuanza bila ufunguo kuwekwa. Upande wa mfumo wa wakala (harness) umeelezwa katika kuelekeza wakala wa usimbaji kwenye Ollama na katika kujenga wakala wako wa OpenClaw.

Mipangilio miwili ya seva ni muhimu pindi wakala anapoanza kufanya kazi bila kusimamiwa. OLLAMA_KEEP_ALIVE hudhibiti muda ambao modeli hukaa kwenye kumbukumbu baada ya ombi la mwisho, na chaguo-msingi huiondoa baada ya dakika tano, hivyo ombi linalofuata hulazimika kusubiri muda wote wa kupakia upya. Kwenye faili ya 25 GB bila GPU, pause hiyo ni ndefu kiasi cha kusababisha timeout. Weka OLLAMA_KEEP_ALIVE=-1 ili kuifanya ibaki kwenye kumbukumbu. OLLAMA_HOST=0.0.0.0:11434 hufanya API ipatikane kutoka kwa mashine nyingine, na haina uthibitisho wa aina yoyote, kwa hivyo ifungue tu nyuma ya sheria ya firewall au mtandao wa kibinafsi.

Njia za kufeli, pamoja na ujumbe utakaouona

Uvutaji (pull) unashindwa mara moja. Error: pull model manifest: file does not exist inamaanisha kuwa tag hiyo haipo. Majina ya tag ni vibambo kamili, kwa hivyo nakili moja kutoka kwenye ukurasa wa maktaba badala ya kukisia suffix ya quantisation.

Model haitapakia. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) inamaanisha kuwa tag ni kubwa mno kwa mpango huu kama ulivyosanidiwa. Tumia quantisation ndogo zaidi, au punguza OLLAMA_CONTEXT_LENGTH, kwa sababu KV cache huhesabiwa ndani ya mahitaji hayo.

Hakuna jibu kwenye port 11434. curl: (7) Failed to connect to localhost port 11434 inamaanisha kuwa huduma haifanyi kazi, au haisikilizi mahali unapotarajia. Soma systemctl status ollama na journalctl -u ollama -n 50. Ikiwa pia uliianzisha ollama serve kwa mkono, nakala ya pili itafunga na kutoa Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Inajibu, kwa polepole sana. Angalia ollama ps kabla ya kubadilisha kitu chochote. Mgao wowote wa CPU kwenye safu ya PROCESSOR kwenye mashine yenye GPU inamaanisha sehemu ya model imetoka nje ya VRAM, kwa hivyo punguza context au chukua quantisation ndogo zaidi. Kwenye mashine isiyo na GPU, polepole ni matokeo yanayotarajiwa na hakuna mpangilio unaoweza kurekebisha hilo.

Wakala anasahau maelekezo yake katikati ya kazi. Mazungumzo yamevuka dirisha la context na token za zamani zaidi zimeondolewa kimya kimya. Ongeza OLLAMA_CONTEXT_LENGTH, thibitisha na ollama ps kuwa model bado inatoshea, na ikiwa haitoshei tena, suluhisho ni mashine kubwa zaidi badala ya dirisha dogo.

Nafasi ya modeli hii ikilinganishwa na njia mbadala

Modeli ya 30B MoE ni kubwa mno kwa kazi ndogo. Ikiwa modeli ya 8B ya kawaida (dense) tayari inatosheleza kazi yako, itagharimu kidogo zaidi kuiendesha na itapakia kwa sekunde chache, na Qwen 3 katika 8B na 27B kwenye VPS ndiyo kulinganisha sahihi kwa uamuzi huo. Kwa uchunguzi mpana zaidi wa kile ambacho mpango fulani unaweza kuhimili, anza na ni modeli zipi za AI unazoweza kujiendeshea mwenyewe. Ikiwa unapanga kuhudumia mawakala kadhaa kwa wakati mmoja badala ya mmoja, soma Ollama ikilinganishwa na vLLM kwanza, kwa sababu Ollama haifanyi batching ya maombi yanayokuja kwa wakati mmoja kama seva ya uzalishaji (production inference server), na hapo ndipo usanidi wa mtumiaji mmoja unapoacha kuongezeka (scale).

FAQ

Ni tag ipi ya Nemotron 3.5 Lightning ninayopaswa kuvuta kwenye Linux VPS?

Tumia nemotron-3.5-lightning:30b-a3b-q4_K_M. Ina ukubwa wa 25 GB, inabeba uwezo kamili wa context wa 1M, na ni digest ileile inayoelekezwa na tag za latest, 30b na 30b-a3b kufikia Agosti 2026. Iandike tag hiyo kwa uwazi badala ya kuvuta latest, ili uchapishaji mpya wa pointer hiyo usibadilishe tabia ya agent wako bila wewe kujua. Tag za mlx ni za Apple silicon na hazitakusaidia kwenye Linux.

Nemotron 3.5 Lightning inahitaji RAM kiasi gani?

NVIDIA haijachapisha kiasi cha chini cha kumbukumbu kwa ajili ya build za Ollama, kwa hivyo pima badala ya kukadiria. Vuta tag hiyo, endesha model mara moja, na usome ollama ps wakati imepakiwa: inaonyesha ukubwa unaotumiwa na kama imekaa kwenye GPU au CPU. Ukubwa wa download, 25 GB kwa tag ya kawaida, ni kiwango cha chini, kwa sababu KV cache huongezwa juu yake na hukua kulingana na context window uliyoweka. Ikiwa plan ni ndogo mno, Ollama inakataa kwa kutoa model requires more system memory na kutaja namba zote mbili.

Je, ninaweza kuendesha Nemotron 3.5 Lightning kwenye VPS isiyo na GPU?

Ndiyo, ikiwa plan ina RAM ya kutosha kuhifadhi weights, na muundo wa MoE unasaidia kwa sababu ni takriban vigezo 3 kati ya bilioni 30 pekee vinavyokokotolewa kwa kila token. Kasi ndiyo changamoto. Bila GPU, model inategemea bandwidth ya kumbukumbu, kwa hivyo kuongeza vCPU hakubadilishi matokeo kwa kiasi kikubwa. Endesha ollama run --verbose na prompt isiyobadilika, soma mstari wa eval rate, na ulinganishe namba hiyo na muda unaohitajika na agent wako. Kwa kazi za batch za usiku, mara nyingi inafaa. Kwa kazi yoyote ambayo mtu anaisubiri, kwa kawaida haifai.

Kwa nini Ollama hainipi context window kamili ya 1M?

1M ni uwezo wa juu wa model, si chaguo-msingi la Ollama. Ollama hutumia window ndogo zaidi na hufuta token za zamani pindi mazungumzo yanapoizidi, bila kutoa error yoyote, jambo linaloonekana kama agent anasahau maelekezo yake mwenyewe. Weka OLLAMA_CONTEXT_LENGTH kwenye systemd service, au pitisha num_ctx kwa kila ombi. Iongeze hatua kwa hatua na uangalie upya ollama ps kila wakati, kwa sababu kumbukumbu ya KV cache huongezeka kulingana na window na inaweza kusababisha layers za model kuondolewa kwenye GPU.

Je, Nemotron 3.5 Lightning ni bure kwa matumizi ya kibiashara?

Model card ya NVIDIA inaiweka model hii chini ya leseni ya OpenMDW-1.1 na kuashiria kuwa iko tayari kwa matumizi ya kibiashara. Hiyo inahusu weights unazopakua na kuziendesha mwenyewe. Haizungumzii programu nyingine kwenye stack yako, kwa hivyo kagua leseni za agent harness na zana zozote unazounganisha nayo kando, na usome model card ya sasa kabla ya kuitegemea kwa jambo lolote la kimkataba.