SSD Nodes Learn 🎉 VPS da $5.50/mese
Guide Matt ConnorDi Matt Connor · Aggiornato 2026-08-13

Nemotron 3.5 Lightning su VPS: guida a Ollama

Esegui Nemotron 3.5 Lightning con Ollama sul tuo server: tag esatto da scaricare, RAM necessaria e velocita reale in modalita solo CPU.

A cosa serve Nemotron 3.5 Lightning

Nemotron 3.5 Lightning è il modello open da 30B a mixture of experts di NVIDIA, rilasciato ad agosto 2026. È progettato per agenti che restano in esecuzione per ore, non per una sola sessione di chat. MoE (mixture of experts) significa che i pesi sono suddivisi tra molte sottoreti specializzate e che ogni token viene instradato soltanto attraverso alcune di esse. La model card di NVIDIA indica 30 miliardi di parametri totali, di cui 3 miliardi attivi per token. In memoria si paga il numero più grande. In termini di velocità si beneficia del numero più piccolo.

Questo compromesso è il motivo per cui il modello è interessante su un server in affitto. Un agente che svolge attività reali invia migliaia di richieste brevi nell'arco della giornata. Perciò il throughput per dollaro determina se può essere eseguito sul proprio server. Un modello che impiega 40 secondi per ogni risposta è un assistente utilizzabile, ma un agente poco efficace: una singola attività può richiedere venti chiamate e bisogna attendere ciascuna di esse.

NVIDIA descrive l'architettura come ibrida: livelli Mamba-2 e MoE intercalati, con alcuni livelli di attention. La model card indica una lunghezza massima del contesto fino a 1M token e una licenza OpenMDW-1.1, contrassegnata come pronta per l'uso commerciale. Le lingue principali sono l'inglese e i linguaggi di programmazione. Sono inoltre indicate spagnolo, francese, tedesco, italiano e giapponese.

Artificial Analysis ha pubblicato ad agosto 2026 misurazioni del lancio che mostrano quasi 670 token di output al secondo, su un endpoint DeepInfra pre-release che utilizzava i pesi NVFP4. Si tratta di un endpoint GPU ospitato. Il dato indica ciò che l'architettura consente di ottenere, non le prestazioni che avrai sul tuo VPS.

Quale tag Ollama scegliere per ogni VPS

La libreria Ollama pubblica diverse build con gli stessi pesi. La differenza riguarda la quantizzazione, cioè il numero di bit usati per memorizzare ogni peso; questo modifica notevolmente la dimensione del download.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

I tag denominati latest, 30b e 30b-a3b puntano tutti allo stesso digest di 30b-a3b-q4_K_M. Il download predefinito è quindi la build a 4 bit da 25 GB con contesto completo da 1M. Q8_0 occupa 35 GB e bf16 occupa 66 GB; entrambe supportano anch'esse un contesto da 1M. Le build MLX da 23 GB sono destinate ai sistemi Apple silicon e limitano il contesto a 256K. Su una VPS Linux sono quindi la scelta sbagliata.

Queste sono dimensioni del download, non requisiti di memoria. NVIDIA non pubblica un valore minimo di VRAM (memoria video) per le build Ollama. Considera quindi la dimensione del download solo come una soglia minima, non come un requisito completo. I pesi devono risiedere da qualche parte: nella memoria GPU se la scheda è sufficiente a contenerli, oppure nella RAM di sistema. A questo si aggiunge la cache KV (cache key/value, la memoria che il modello usa per ogni token della conversazione). Il valore reale per il tuo hardware si ottiene con un comando, non con un calcolo teorico, ed è riportato più avanti. Se non hai ancora scelto il livello di quantizzazione, quanto costano Q4, Q8 e FP16 e a cosa devi rinunciare spiega cosa perdi a ogni passaggio.

Preleva il tag esatto, non latest

latest è un riferimento variabile. Quando la libreria lo ripubblica, il comportamento dell'agente cambia al pull successivo, senza lasciare nelle note alcuna spiegazione. Specifica il tag.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

Lo script di installazione configura un servizio systemd eseguito dall'utente ollama e conserva i modelli in /usr/share/ollama/.ollama/models. Nella maggior parte delle immagini VPS, questo percorso si trova sul filesystem root. Verifica quindi lo spazio disponibile prima di richiedere 25 GB.

df -h /usr/share/ollama

Se un pull si interrompe e restituisce no space left on device, significa esattamente questo. I blob parziali restano sul disco finché non li elimini. Verifica quindi che cosa è stato scaricato:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show mostra l'architettura, il numero di parametri, la lunghezza del contesto e la quantizzazione effettivamente contenuti nel file. Se uno di questi valori non corrisponde alla pagina della libreria, hai eseguito il pull di un tag diverso da quello previsto.

Avvialo e verifica dove è stato effettivamente eseguito

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Mentre il modello è ancora caricato, apri una seconda shell:

ollama ps

Questo comando risponde alla domanda sulla memoria per la tua macchina. ollama ps mostra il modello caricato, lo spazio che occupa in memoria e una colonna PROCESSOR. 100% GPU indica che il modello è interamente nella VRAM. 100% CPU indica che non lo è affatto e che ogni token viene elaborato dal processore usando la RAM di sistema. Una suddivisione come 65%/35% CPU/GPU indica che i layer non entravano tutti nella VRAM e che la quota elaborata dalla CPU determina la velocità. Non stimare il requisito. Carica il modello e leggi questa riga.

Se il modello non può essere caricato, Ollama rifiuta l'operazione senza causare un arresto anomalo:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

Una VPS solo CPU è abbastanza veloce?

Una VPS per uso generico non dispone di GPU, quindi la CPU esegue tutto il lavoro e legge dalla RAM di sistema ogni peso necessario. MoE è utile in questo caso, perché per ogni token vengono utilizzati solo circa 3 miliardi dei 30 miliardi di parametri. Il numero di operazioni per token è quindi molto inferiore rispetto a un modello denso da 30B. La memoria, invece, non trae alcun vantaggio. Tutti i 30 miliardi di parametri devono rimanere residenti, perché il router può selezionare qualsiasi esperto per ogni token.

L'inferenza solo CPU su questo modello è quindi limitata dalla larghezza di banda della memoria, non dal numero di core. Aggiungere vCPU a un piano che ne dispone già di un numero adeguato cambia molto poco. Servono abbastanza RAM per contenere i pesi e la cache KV, oltre alla memoria più veloce disponibile nel piano.

Misurate le prestazioni prima di affidargli un agente, usando il metodo descritto in misurare i token al secondo per un LLM locale:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

La riga eval rate stampata alla fine indica la velocità di generazione in token al secondo. Questo singolo numero determina la risposta, perché il tempo trascorso da un agente è dominato da questo valore.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Si tratta di dati pubblicati da terze parti, convertiti dai minuti per attività riportati da Artificial Analysis al momento del lancio. Le misurazioni sono state eseguite su endpoint GPU gestiti, non su una VPS. Nemotron 3.5 Lightning ha registrato una media di circa 30 secondi per attività. gpt-oss-120b ha richiesto circa 204, mentre Qwen3.6 35B circa 210. Usate questi valori per valutare l'ordine di grandezza del divario, non come garanzia per il vostro hardware.

La valutazione corretta dipende da chi deve attendere. Se è una persona ad attendere l'agente, oppure se l'agente esegue lunghe sequenze di chiamate consecutive, conviene noleggiare capacità GPU. Se invece l'agente viene eseguito durante la notte secondo una pianificazione e nessuno ne attende il risultato, un piano CPU con molta RAM è una soluzione ragionevole. In entrambi i casi la configurazione è la stessa; eseguire Ollama su una VPS descrive il dimensionamento del piano e il confronto tra un'istanza GPU e il pagamento di un provider API in base ai token. Il punto di pareggio dipende dall'utilizzo: un'istanza GPU viene fatturata per ogni ora in cui esiste, mentre i token API vengono fatturati solo quando sono utilizzati. Di conseguenza, un agente attivo per gran parte della giornata favorisce una macchina di proprietà, mentre un agente che si attiva due volte all'ora generalmente no.

La finestra di contesto da 1M non è gratuita

1M di token è il limite massimo del modello, ma Ollama non lo assegna automaticamente. Per impostazione predefinita, Ollama usa una finestra molto più piccola ed elimina i token più vecchi quando una conversazione la supera. Quando accade, non viene registrato alcun evento. Per un agente, il risultato è che il modello sembra dimenticare l'inizio dell'attività.

Impostare intenzionalmente la finestra. Per l'intero server, modificare il servizio:

sudo systemctl edit ollama

Aggiungere questa impostazione, quindi eseguire sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Per una singola richiesta, passare invece num_ctx nell'oggetto delle opzioni:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Ogni aumento richiede più memoria, perché la cache KV cresce in base al numero di token consentiti. Aumentare il valore, riavviare, quindi eseguire di nuovo ollama ps e monitorare l'aumento della dimensione riportata. Se, dopo questa modifica, la colonna PROCESSOR passa da 100% GPU a uno stato suddiviso, la cache KV ha spostato i layer del modello fuori dalla VRAM e la velocità diminuirà drasticamente. Come scegliere num_ctx in Ollama descrive in dettaglio questo compromesso. Non impostare 1000000 solo perché la scheda del modello lo consente: l'allocazione avviene subito e il caricamento fallisce.

Collegarlo a un agent sempre attivo

Il post di lancio di Ollama per questo modello documenta una scorciatoia che avvia un agent supportato già configurato per usarlo:

ollama launch claude --model nemotron-3.5-lightning

In quella posizione, il post documenta claude, opencode, openclaw e hermes. Il sottocomando richiede una versione aggiornata di Ollama. Controlla quindi prima ollama --version e, se non è disponibile, configura manualmente l'agent per usare l'API. Ollama espone un endpoint compatibile con OpenAI, accettato dalla maggior parte degli agent harness:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama ignora la chiave, ma la maggior parte dei client non si avvia se non ne viene impostata una. La configurazione dell'harness è descritta in configurare un agent di coding per usare Ollama e in creare un agent OpenClaw personalizzato.

Quando l'agent viene eseguito senza supervisione, sono importanti due impostazioni del server. OLLAMA_KEEP_ALIVE controlla per quanto tempo un modello rimane in memoria dopo l'ultima richiesta. Il valore predefinito lo scarica dopo cinque minuti, quindi la richiesta successiva deve attendere nuovamente l'intero tempo di caricamento. Per un file da 25 GB senza GPU, questa pausa è abbastanza lunga da causare il superamento del timeout. Imposta OLLAMA_KEEP_ALIVE=-1 per mantenerlo residente. OLLAMA_HOST=0.0.0.0:11434 rende l'API raggiungibile da altre macchine e non applica alcuna autenticazione. Esporlo quindi soltanto tramite una regola firewall o una rete privata.

Modalità di errore e stringhe visualizzate

Il pull non riesce immediatamente. Error: pull model manifest: file does not exist indica che il tag non esiste. I nomi dei tag sono stringhe esatte. Copiane uno dalla pagina della libreria invece di indovinare il suffisso della quantizzazione.

Il modello non viene caricato. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) indica che, con la configurazione attuale, il tag è troppo grande per questo piano. Passa a una quantizzazione più piccola oppure riduci OLLAMA_CONTEXT_LENGTH, perché la cache KV rientra in questo requisito.

Nessun processo risponde sulla porta 11434. curl: (7) Failed to connect to localhost port 11434 indica che il servizio non è in esecuzione oppure non è in ascolto dove previsto. Leggi systemctl status ollama e journalctl -u ollama -n 50. Se hai anche avviato ollama serve manualmente, la seconda istanza termina con Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Il servizio risponde, ma molto lentamente. Controlla ollama ps prima di modificare qualsiasi impostazione. Su una macchina con GPU, una quota di CPU nella colonna PROCESSOR indica che una parte del modello è stata spostata fuori dalla VRAM. Riduci quindi il contesto oppure usa la quantizzazione più piccola. Su una macchina senza GPU, la lentezza è prevista e nessuna impostazione può risolverla.

L'agente dimentica le istruzioni durante un'attività. La conversazione ha superato la finestra di contesto e i token più vecchi sono stati eliminati senza messaggi. Aumenta OLLAMA_CONTEXT_LENGTH, verifica con ollama ps che il modello sia ancora contenibile e, se non lo è più, usa una macchina più potente invece di ridurre la finestra.

Dove si colloca questo modello rispetto alle alternative

Un modello MoE da 30B è impegnativo da ospitare per un’attività di piccole dimensioni. Se un modello denso da 8B gestisce già il tuo caso d’uso, eseguirlo costerà molto meno e il caricamento richiederà pochi secondi. Per confrontare direttamente le due opzioni, consulta Qwen 3 a 8B e 27B su un VPS. Per una panoramica più ampia dei modelli che un determinato piano può gestire, parti da quali modelli AI puoi eseguire in self-hosting. Se prevedi di servire più agenti contemporaneamente invece di uno solo, leggi prima Ollama a confronto con vLLM, perché Ollama non raggruppa le richieste concorrenti come fa un server di inferenza per la produzione. È questo il limite oltre il quale una configurazione per un singolo utente non scala più.

FAQ

Quale tag di Nemotron 3.5 Lightning devo scaricare su un VPS Linux?

Usa nemotron-3.5-lightning:30b-a3b-q4_K_M. Occupa 25 GB, include l'intera finestra di contesto massima di 1M ed è lo stesso digest a cui puntano i tag latest, 30b e 30b-a3b ad agosto 2026. Indicalo esplicitamente invece di scaricare latest, così una futura ripubblicazione di quel puntatore non potrà modificare il comportamento del tuo agente senza che tu te ne accorga. I tag mlx sono build per Apple silicon e non sono utili su Linux.

Quanta RAM richiede Nemotron 3.5 Lightning?

NVIDIA non pubblica un requisito minimo di memoria per le build di Ollama, quindi misura invece di fare una stima. Scarica il tag, esegui il modello una volta e leggi ollama ps mentre il modello è caricato: mostra lo spazio effettivamente occupato e indica se il modello è stato caricato sulla GPU o sulla CPU. La dimensione del download, 25 GB per il tag predefinito, è un valore minimo, perché la cache KV viene aggiunta a questa dimensione e cresce con la finestra di contesto configurata. Se il piano ha una capacità insufficiente, Ollama rifiuta l'avvio con model requires more system memory e indica entrambi i valori.

Posso eseguire Nemotron 3.5 Lightning su un VPS senza GPU?

Sì, se il piano dispone di RAM sufficiente per contenere i pesi. L'architettura MoE è utile perché per ogni token vengono calcolati solo circa 3 dei 30 miliardi di parametri. Il limite è la velocità. Senza GPU, il modello è vincolato dalla larghezza di banda della memoria, quindi aggiungere vCPU incide poco sul risultato. Esegui ollama run --verbose con un prompt fisso, leggi la riga eval rate e confronta quel valore con il tempo massimo previsto per il tuo agente. Per un processo batch eseguito durante la notte è spesso sufficiente. Per qualsiasi attività che richiede l'attesa di una persona, di solito non lo è.

Perché Ollama non mi fornisce l'intera finestra di contesto di 1M?

1M è il limite massimo del modello, non il valore predefinito di Ollama. Ollama applica una finestra molto più piccola ed elimina i token più vecchi quando una conversazione la supera, senza stampare errori. Questo può sembrare che l'agente abbia dimenticato le proprie istruzioni. Imposta OLLAMA_CONTEXT_LENGTH sul servizio systemd oppure passa num_ctx per ogni richiesta. Aumenta il valore per gradi e controlla nuovamente ollama ps ogni volta, perché la memoria della cache KV cresce con la finestra e può spostare alcuni layer del modello fuori dalla GPU.

Nemotron 3.5 Lightning è gratuito per l'uso commerciale?

La model card di NVIDIA colloca il modello sotto la licenza OpenMDW-1.1 e lo indica come pronto per l'uso commerciale. Questo riguarda i pesi che scarichi ed esegui autonomamente. Non riguarda gli altri software presenti nel tuo stack. Controlla quindi separatamente le licenze dell'agent harness e degli eventuali strumenti a cui lo colleghi, e leggi la model card aggiornata prima di basarti su queste informazioni per attività di natura contrattuale.