Nemotron 3.5 Lightning draaien op een VPS met Ollama
Leer hoe u Nemotron 3.5 Lightning installeert via Ollama op uw eigen server. Wij bespreken de benodigde RAM, de juiste pull-tag en of CPU-only draaien snel genoeg is.
Waar Nemotron 3.5 Lightning voor dient
Nemotron 3.5 Lightning is het open 30B mixture-of-experts-model van NVIDIA, uitgebracht in augustus 2026. Het is ontworpen voor agents die urenlang actief zijn in plaats van voor een enkel chatvenster. MoE (mixture of experts) betekent dat de gewichten zijn verdeeld over vele expert-subnetwerken, waarbij elk token slechts door enkele daarvan wordt gerouteerd. De modelkaart van NVIDIA vermeldt 30 miljard totale parameters, met 3 miljard actieve parameters per token. U betaalt voor het hoge aantal in het geheugen. U krijgt het lage aantal terug in de vorm van snelheid.
Deze afweging is de reden om dit model te overwegen voor een gehuurde server. Een agent die daadwerkelijk werk verricht, verstuurt gedurende de dag duizenden korte verzoeken; de doorvoer per dollar bepaalt daarom of de agent rendabel op uw eigen server kan draaien. Een model dat 40 seconden per antwoord nodig heeft, is een bruikbare assistent maar een slechte agent, omdat één taak twintig aanroepen vereist en u op elk daarvan moet wachten.
NVIDIA beschrijft de architectuur als hybride: afwisselende Mamba-2- en MoE-lagen met geselecteerde attention-lagen. De modelkaart geeft een maximale contextlengte van 1M tokens aan en een OpenMDW-1.1-licentie, wat betekent dat het model gereed is voor commercieel gebruik. De primaire talen zijn Engels en code, met ondersteuning voor Spaans, Frans, Duits, Italiaans en Japans.
Artificial Analysis publiceerde in augustus 2026 prestatiemetingen bij de lancering die bijna 670 output-tokens per seconde lieten zien op een pre-release DeepInfra-endpoint dat de NVFP4-gewichten serveerde. Dit betreft een gehost GPU-endpoint. Interpreteer dit als wat de architectuur toelaat, niet als wat uw VPS zal presteren.
Welke Ollama-tag past bij welke VPS
De Ollama-bibliotheek publiceert verschillende builds van dezelfde gewichten. Het verschil tussen deze builds is de kwantisatie, oftewel het aantal bits waarin elk gewicht wordt opgeslagen; dit heeft grote invloed op de downloadgrootte.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]De tags genaamd latest, 30b en 30b-a3b verwijzen allemaal naar dezelfde digest als 30b-a3b-q4_K_M. De standaarddownload is daarom de 25 GB vier-bits build met de volledige 1M context. Q8_0 is 35 GB en bf16 is 66 GB, beide eveneens met 1M context. De MLX-builds van 23 GB zijn bedoeld voor Apple silicon en hebben een limiet van 256K context; deze zijn dus niet geschikt voor een Linux VPS.
Dit zijn downloadgroottes, geen geheugenvereisten. NVIDIA publiceert geen minimumwaarde voor VRAM (video-RAM) voor de Ollama-builds, dus beschouw de downloadgrootte enkel als een ondergrens. De gewichten moeten ergens in het geheugen worden geladen: in het GPU-geheugen als de kaart voldoende capaciteit heeft, en anders in het systeem-RAM. De KV-cache (key/value cache, het geheugen van het model per token voor het gesprek) komt hier nog bovenop. Het werkelijke getal voor uw hardware is afkomstig van een commando, niet van een berekening; zie hieronder. Als u nog niet heeft besloten welk kwantisatieniveau u wilt gebruiken, beschrijft wat Q4, Q8 en FP16 elk kosten wat u bij elke stap inlevert.
Gebruik de exacte tag, nooit latest
latest is een variabele verwijzing. Wanneer de bibliotheek deze opnieuw publiceert, verandert het gedrag van uw agent bij de volgende pull, zonder dat uw aantekeningen verklaren waarom. Benoem de tag.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MHet installatiescript configureert een systemd-service die wordt uitgevoerd als de ollama-gebruiker en de modellen opslaat onder /usr/share/ollama/.ollama/models. Dat pad bevindt zich op de root-filesystem op de meeste VPS-images; controleer daarom de beschikbare ruimte voordat u 25 GB aanvraagt.
df -h /usr/share/ollamaEen pull die halverwege stopt en no space left on device rapporteert, betekent precies dat; de gedeeltelijke blobs blijven op de schijf staan totdat u ze verwijdert. Controleer daarna wat er daadwerkelijk is binnengehaald:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show toont de architectuur, het aantal parameters, de contextlengte en de kwantisatie die het bestand daadwerkelijk bevat. Als een van deze waarden afwijkt van de bibliotheekpagina, heeft u een andere tag binnengehaald dan u bedoelde.
Serveren en controleren waar het proces daadwerkelijk draait
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Terwijl het model geladen is, opent u een tweede shell:
ollama psDit is het commando dat de vraag over het geheugengebruik voor uw machine beantwoordt. ollama ps toont het geladen model, de grootte die het in het geheugen inneemt en een PROCESSOR-kolom. 100% GPU betekent dat het volledig in het VRAM staat. 100% CPU betekent dat er niets in het VRAM staat en dat elke token door de processor vanuit het systeem-RAM wordt berekend. Een verdeling zoals 65%/35% CPU/GPU betekent dat niet alle lagen in het geheugen pasten en dat het CPU-aandeel uw snelheid bepaalt. Schat de vereisten niet in. Laad het model en lees deze regel af.
Als het model helemaal niet kan laden, weigert Ollama dit op een gecontroleerde wijze in plaats van te crashen:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Is een VPS met alleen een CPU snel genoeg?
Een VPS voor algemeen gebruik beschikt niet over een GPU, dus de CPU voert al het werk uit en leest elk benodigd gewicht uit het systeem-RAM. MoE helpt hierbij, omdat er per token slechts ongeveer 3 miljard van de 30 miljard parameters worden aangesproken. De rekenkracht per token is daardoor aanzienlijk lager dan bij een dense 30B-model. Het geheugen profiteert hier echter niet van. Alle 30 miljard parameters moeten in het geheugen geladen blijven, omdat de router voor elk token een willekeurige expert kan kiezen.
Inference op basis van alleen een CPU wordt bij dit model daarom eerder beperkt door de geheugenbandbreedte dan door het aantal cores. Het toevoegen van vCPU's aan een plan dat al over een redelijk aantal beschikt, verandert weinig. Wat u nodig heeft, is voldoende RAM om de gewichten en uw KV-cache vast te houden, evenals het snelste geheugen dat het plan biedt.
Meet de prestaties voordat u er een agent op inzet, met behulp van de methode in tokens per seconde meten voor een lokale LLM:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."De regel eval rate die aan het einde wordt geprint, is uw generatiesnelheid in tokens per seconde. Dat ene getal beantwoordt de vraag, omdat de doorlooptijd van een agent hierdoor wordt bepaald.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Dit zijn gepubliceerde cijfers van derden, omgerekend vanuit de minuten per taak die Artificial Analysis bij de lancering rapporteerde. Deze zijn gemeten op gehoste GPU-endpoints en niet op een VPS. Nemotron 3.5 Lightning deed er gemiddeld ongeveer 30 seconden over per taak, waarbij gpt-oss-120b ongeveer 204 in beslag nam en Qwen3.6 35B ongeveer 210. Gebruik deze cijfers om de verhoudingen in te schatten, niet als garantie voor uw hardware.
Het eerlijke advies hangt af van wie er op de resultaten wacht. Als een persoon op de agent wacht, of als de agent lange ketens van opeenvolgende aanroepen maakt, huur dan GPU-capaciteit. Als de agent 's nachts volgens een schema draait en niemand meekijkt, is een CPU-plan met veel RAM een redelijke keuze. De configuratie is in beide gevallen hetzelfde, en Ollama draaien op een VPS behandelt de dimensionering van het plan en hoe een GPU-instantie zich verhoudt tot het betalen per token bij een API-provider. Het omslagpunt is een kwestie van bezettingsgraad: een GPU-instantie wordt per uur gefactureerd, terwijl API-tokens alleen worden afgerekend bij gebruik. Een agent die het grootste deel van de dag actief is, is daarom gunstiger op een eigen server, terwijl een agent die twee keer per uur wordt aangeroepen meestal niet rendabel is op een eigen instantie.
Het 1M contextvenster is niet gratis
1M tokens is het maximum van het model, en Ollama stelt dit niet standaard voor u in. Ollama hanteert standaard een veel kleiner venster en verwijdert de oudste tokens zodra een gesprek deze limiet overschrijdt. Er wordt niets gelogd wanneer dit gebeurt, waardoor het voor een agent lijkt alsof het model het begin van zijn eigen taak vergeet.
Stel het venster bewust in. Bewerk voor de gehele server de service:
sudo systemctl edit ollamaVoeg dit toe en voer vervolgens sudo systemctl restart ollama uit:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Stuur per verzoek in plaats daarvan num_ctx mee in het options-object:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Elke verhoging kost geheugen, omdat de KV-cache meegroeit met het aantal tokens dat u toestaat. Verhoog de waarde, herstart de service en voer daarna opnieuw ollama ps uit om te zien hoe de gerapporteerde grootte toeneemt. Als de kolom PROCESSOR na die wijziging verspringt van 100% GPU naar een split, heeft de KV-cache modellagen uit het VRAM verdrongen en zal uw snelheid aanzienlijk dalen. Het kiezen van num_ctx in Ollama behandelt deze afweging in detail. Stel niet zomaar 1000000 in omdat de modelkaart dit toestaat, aangezien de toewijzing vooraf plaatsvindt en de belasting simpelweg zal falen.
Integreren in een altijd actieve agent
De aankondiging van Ollama voor dit model beschrijft een snelkoppeling waarmee een ondersteunde agent wordt gestart die al naar het model verwijst:
ollama launch claude --model nemotron-3.5-lightningHet bericht documenteert claude, opencode, openclaw en hermes op die positie. Het subcommando vereist een recente versie van Ollama, dus controleer eerst ollama --version. Als deze ontbreekt, wijs de agent dan handmatig naar de API. Ollama stelt een OpenAI-compatibel eindpunt beschikbaar, dat door de meeste agent-frameworks wordt geaccepteerd:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama negeert de sleutel, maar de meeste clients weigeren te starten zonder dat er een is ingesteld. De kant van het framework wordt behandeld in een coding agent naar Ollama wijzen en in uw eigen OpenClaw-agent bouwen.
Twee serverinstellingen zijn van belang zodra de agent onbeheerd draait. OLLAMA_KEEP_ALIVE bepaalt hoe lang een model in het geheugen blijft na het laatste verzoek. De standaardinstelling ontlaadt het model na vijf minuten, waardoor de volgende aanroep opnieuw de volledige laadtijd vereist. Bij een bestand van 25 GB zonder GPU is die pauze lang genoeg om een time-out te veroorzaken. Stel OLLAMA_KEEP_ALIVE=-1 in om het model in het geheugen te houden. OLLAMA_HOST=0.0.0.0:11434 maakt de API bereikbaar vanaf andere machines. Aangezien er geen enkele vorm van authenticatie aanwezig is, mag u deze alleen openstellen achter een firewallregel of binnen een privénetwerk.
Foutmodi en de bijbehorende meldingen
De pull mislukt onmiddellijk. Error: pull model manifest: file does not exist betekent dat de tag niet bestaat. Tag-namen zijn exacte reeksen; kopieer er een vanaf de bibliotheekpagina in plaats van te gokken op een kwantisatie-achtervoegsel.
Het model laadt niet. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) betekent dat de tag te groot is voor dit abonnement met de huidige configuratie. Stap over op een kleinere kwantisatie of verlaag OLLAMA_CONTEXT_LENGTH, omdat de KV-cache wordt meegeteld in die vereiste.
Er is geen antwoord op poort 11434. curl: (7) Failed to connect to localhost port 11434 betekent dat de service niet draait of niet luistert op de verwachte locatie. Lees systemctl status ollama en journalctl -u ollama -n 50. Als u ollama serve ook handmatig hebt gestart, sluit het tweede exemplaar af met Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Het antwoord is erg traag. Controleer ollama ps voordat u instellingen wijzigt. Elk CPU-aandeel in de kolom PROCESSOR op een machine met GPU betekent dat een deel van het model buiten het VRAM is geplaatst; verlaag in dat geval de context of kies de kleinere kwantisatie. Op een machine zonder GPU is traagheid het verwachte resultaat en kan geen enkele instelling dit verhelpen.
De agent vergeet halverwege een taak de instructies. Het gesprek heeft het contextvenster overschreden en de oudste tokens zijn stilletjes verwijderd. Verhoog OLLAMA_CONTEXT_LENGTH, bevestig met ollama ps dat het model nog steeds past, en als dat niet meer het geval is, is de oplossing een krachtigere machine in plaats van een kleiner venster.
Waar dit model staat ten opzichte van de alternatieven
Een 30B MoE is een omvangrijk model om te hosten voor een kleine taak. Als een dense 8B-model uw taak al kan afhandelen, zijn de kosten voor uitvoering aanzienlijk lager en laadt het binnen enkele seconden. Qwen 3 op 8B en 27B op een VPS biedt de directe vergelijking voor die beslissing. Voor een breder overzicht van wat een specifiek abonnement daadwerkelijk kan bevatten, begint u bij welke AI-modellen u zelf kunt hosten. Als u van plan bent om meerdere agents tegelijkertijd te bedienen in plaats van één, lees dan eerst Ollama vergeleken met vLLM. Ollama verwerkt gelijktijdige verzoeken namelijk niet op de manier waarop een productie-inferenceserver dat doet, en dat is het punt waarop een setup voor één gebruiker niet langer schaalt.
FAQ
Welke Nemotron 3.5 Lightning tag moet ik ophalen op een Linux VPS?
Gebruik nemotron-3.5-lightning:30b-a3b-q4_K_M. Deze is 25 GB groot, ondersteunt de volledige 1M context en is dezelfde digest waar de latest, 30b en 30b-a3b tags naar verwijzen per augustus 2026. Specificeer de naam expliciet in plaats van latest op te halen, zodat een toekomstige update van die pointer het gedrag van uw agent niet ongemerkt kan wijzigen. De mlx tags zijn builds voor Apple silicon en werken niet op Linux.
Hoeveel RAM heeft Nemotron 3.5 Lightning nodig?
NVIDIA publiceert geen minimaal geheugenvereiste voor de Ollama-builds, dus meet dit in plaats van te schatten. Haal de tag op, voer het model eenmaal uit en lees ollama ps terwijl het geladen is: dit toont de werkelijk bezette grootte en of het model in de GPU of de CPU is geladen. De downloadgrootte, 25 GB voor de standaard tag, is het minimum, omdat de KV-cache hier nog bovenop komt en meegroeit met het contextvenster dat u instelt. Als het plan te klein is, weigert Ollama met model requires more system memory en toont het beide waarden.
Kan ik Nemotron 3.5 Lightning draaien op een VPS zonder GPU?
Ja, mits het plan voldoende RAM heeft om de gewichten te bevatten. Het MoE-ontwerp helpt hierbij, omdat er slechts ongeveer 3 van de 30 miljard parameters per token worden berekend. De snelheid is het knelpunt. Zonder GPU wordt het model beperkt door de geheugenbandbreedte, waardoor het toevoegen van vCPU's nauwelijks invloed heeft op de resultaten. Voer ollama run --verbose uit met een vaste prompt, lees de eval rate regel en beoordeel dat getal op basis van de deadline van uw agent. Voor een batchtaak 's nachts is dit vaak acceptabel. Voor interactieve toepassingen meestal niet.
Waarom geeft Ollama mij niet het volledige 1M contextvenster?
1M is het maximum van het model, niet de standaardinstelling van Ollama. Ollama hanteert een veel kleiner venster en verwijdert de oudste tokens zodra een gesprek dit overschrijdt, zonder foutmelding. Dit resulteert erin dat de agent zijn eigen instructies lijkt te vergeten. Stel OLLAMA_CONTEXT_LENGTH in op de systemd-service, of geef num_ctx mee per verzoek. Verhoog dit in stappen en controleer telkens ollama ps, omdat het geheugengebruik van de KV-cache schaalt met het venster en model-layers uit de GPU kan verdringen.
Is Nemotron 3.5 Lightning gratis voor commercieel gebruik?
De modelkaart van NVIDIA plaatst het model onder de OpenMDW-1.1 licentie en markeert het als geschikt voor commercieel gebruik. Dit heeft betrekking op de gewichten die u zelf downloadt en uitvoert. Dit zegt niets over de overige software in uw stack; controleer daarom de licenties van de agent-harness en eventuele gekoppelde tools afzonderlijk, en lees de actuele modelkaart voordat u dit in contractuele situaties inzet.