Como rodar Nemotron 3.5 Lightning em um VPS
Use o Nemotron 3.5 Lightning com Ollama no seu servidor: veja a tag exata para baixar, a RAM necessária e se o modo apenas CPU tem velocidade aceitável.
Para que serve o Nemotron 3.5 Lightning
O Nemotron 3.5 Lightning é o modelo aberto de 30B com mistura de especialistas da NVIDIA, lançado em agosto de 2026. Foi desenvolvido para agentes que funcionam durante horas, e não apenas para uma janela de chat. MoE (mixture of experts) significa que os pesos são divididos por várias sub-redes especializadas e que cada token passa apenas por algumas delas. A model card da NVIDIA indica 30 billion de parâmetros no total, com 3 billion ativos por token. O custo está na quantidade total de parâmetros mantida na memória. A vantagem de velocidade vem da quantidade menor de parâmetros ativos.
Essa relação é o motivo para considerar este modelo num servidor alugado. Um agente que executa trabalho real envia milhares de pedidos curtos ao longo do dia. Por isso, o débito por dólar determina se o modelo pode funcionar no seu próprio servidor. Um modelo que demora 40 segundos por resposta é um assistente utilizável, mas um agente fraco, porque uma tarefa pode fazer 20 chamadas e é necessário esperar por cada uma.
A NVIDIA descreve a arquitetura como híbrida: camadas Mamba-2 e MoE intercaladas, com algumas camadas de attention. A model card indica um comprimento máximo de contexto de até 1M tokens e uma licença OpenMDW-1.1, marcada como pronta para uso comercial. Os idiomas principais são inglês e código. Também estão listados espanhol, francês, alemão, italiano e japonês.
A Artificial Analysis publicou medições do lançamento em agosto de 2026 que mostram quase 670 tokens de saída por segundo, num endpoint DeepInfra de pré-lançamento que servia os pesos NVFP4. Esse é um endpoint de GPU alojado. Interprete o valor como aquilo que a arquitetura permite, e não como aquilo que o seu VPS irá atingir.
Qual tag do Ollama escolher para cada VPS
A biblioteca do Ollama publica várias builds dos mesmos pesos. O que muda entre elas é a quantização, ou seja, quantos bits são usados para armazenar cada peso. Isso altera bastante o tamanho do download.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]As tags denominadas latest, 30b e 30b-a3b apontam todas para o mesmo digest que 30b-a3b-q4_K_M. Por isso, o download predefinido é a build de quatro bits com 25 GB e o contexto completo de 1M. A Q8_0 tem 35 GB e a bf16 tem 66 GB. Ambas também usam 1M de contexto. As builds MLX, com 23 GB, destinam-se a Apple silicon e estão limitadas a um contexto de 256K. Por isso, são a escolha errada numa VPS Linux.
Esses valores são tamanhos de download, não requisitos de memória. A NVIDIA não publica um valor mínimo de VRAM (memória de vídeo) para as builds do Ollama. Trate, portanto, o tamanho do download apenas como um limite inferior. Os pesos têm de permanecer residentes em algum lugar: na memória da GPU, se a placa os comportar, ou na RAM do sistema, caso contrário. A cache KV (cache de chave/valor, a memória do modelo por token para a conversação) é adicionada a esse valor. O valor real para o seu hardware é obtido por um comando, apresentado abaixo, e não por aritmética. Se ainda não escolheu um nível de quantização, o custo de Q4, Q8 e FP16 explica o que é sacrificado em cada etapa.
Obtenha a tag exata, nunca latest
latest é um ponteiro que muda. Quando a biblioteca o republica, o comportamento do seu agente muda na próxima obtenção, sem nada nas suas notas que explique o motivo. Especifique a tag.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MO script de instalação configura um serviço systemd que é executado pelo utilizador ollama e mantém os modelos em /usr/share/ollama/.ollama/models. Na maioria das imagens de VPS, esse caminho fica no sistema de ficheiros raiz. Por isso, verifique o espaço disponível antes de pedir 25 GB. Se esse sistema de ficheiros tiver pouco espaço, vale a pena ler onde o Ollama armazena os modelos e como movê-los antes da obtenção, e não depois de o disco ficar cheio.
df -h /usr/share/ollamaUma obtenção que para a meio e indica no space left on device significa exatamente isso. Os blobs parciais permanecem no disco até serem eliminados. Em seguida, confirme o que foi instalado:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show apresenta a arquitetura, o número de parâmetros, o comprimento do contexto e a quantização efetivamente contida no ficheiro. Se algum desses valores não corresponder à página da biblioteca, obteve uma tag diferente da pretendida.
Sirva o modelo e confirme onde foi executado
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Enquanto o modelo ainda estiver carregado, abra uma segunda shell:
ollama psEste é o comando que responde à questão da memória na sua máquina. ollama ps apresenta o modelo carregado, o espaço que ocupa na memória e uma coluna PROCESSOR. 100% GPU significa que todo o modelo está na VRAM. 100% CPU significa que não está na VRAM e que cada token é processado pelo processador a partir da RAM do sistema. Uma divisão como 65%/35% CPU/GPU significa que as camadas não couberam todas, e a proporção processada pela CPU determina a velocidade. Não estime o requisito. Carregue o modelo e leia esta linha.
Se não conseguir carregá-lo, o Ollama recusa o carregamento de forma controlada, sem falhar:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)Um VPS somente com CPU é rápido o suficiente?
Um VPS de uso geral não tem GPU, portanto a CPU faz todo o trabalho e lê cada peso de que precisa a partir da RAM do sistema. O MoE ajuda neste ponto, porque apenas cerca de 3 bilhões dos 30 bilhões de parâmetros são utilizados por token. Assim, a quantidade de operações por token é muito menor do que num modelo denso de 30B. A memória não beneficia de todo. Os 30 bilhões de parâmetros têm de permanecer residentes, porque o router pode escolher qualquer expert para qualquer token.
Por isso, a inferência somente com CPU neste modelo é limitada pela largura de banda da memória, e não pelo número de cores. Adicionar vCPUs a um plano que já tenha uma quantidade razoável altera muito pouco o desempenho. Precisa de RAM suficiente para manter os pesos e a sua cache KV, além da memória mais rápida disponibilizada pelo plano.
Meça o desempenho antes de atribuir um agente a esse VPS, usando o método descrito em medir tokens por segundo para um LLM local:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."A linha eval rate apresentada no fim é a velocidade de geração, em tokens por segundo. Esse único número responde à questão, porque o tempo total de execução de um agente é dominado por ele. Multiplique-o pelo tamanho da resposta que espera. Se o resultado for superior ao tempo que está disposto a esperar, limitar a saída com num_predict é o mecanismo que limita uma chamada individual sem alterar o hardware.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Estes são valores publicados por terceiros e convertidos a partir dos minutos por tarefa comunicados pela Artificial Analysis no lançamento. As medições foram feitas em endpoints GPU alojados, e não num VPS. O Nemotron 3.5 Lightning teve uma média de cerca de 30 segundos por tarefa. gpt-oss-120b demorou aproximadamente 204, enquanto Qwen3.6 35B demorou aproximadamente 210. Use estes valores para perceber a dimensão da diferença, não como uma garantia para o seu hardware.
A orientação correta depende de quem está à espera. Se uma pessoa estiver à espera do agente, ou se o agente fizer longas cadeias de chamadas consecutivas, alugue capacidade GPU. Se for executado durante a noite segundo um agendamento e ninguém estiver a acompanhar a execução, um plano CPU com muita RAM é uma opção razoável. Em ambos os casos, a configuração é a mesma. Executar Ollama num VPS aborda o dimensionamento do plano e compara uma instância GPU com o pagamento de um fornecedor de API por token. O ponto de equilíbrio depende da utilização: uma instância GPU é cobrada por cada hora em que existe, enquanto os tokens da API só são cobrados quando utilizados. Assim, um agente ocupado durante grande parte do dia favorece o servidor que possui, enquanto um agente executado duas vezes por hora normalmente não.
A janela de contexto de 1M não é gratuita
1M de tokens é o máximo do modelo, mas o Ollama não o disponibiliza por predefinição. O Ollama utiliza uma janela predefinida muito menor e descarta os tokens mais antigos quando uma conversa ultrapassa esse limite. Nada é registado quando isso acontece. Para um agente, parece que o modelo se esqueceu do início da própria tarefa.
Defina a janela de forma intencional. Para todo o servidor, edite o serviço:
sudo systemctl edit ollamaAdicione isto e execute sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Por pedido, envie num_ctx no objeto de opções:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Cada aumento consome memória, porque a cache KV cresce com o número de tokens permitido. Aumente o valor, reinicie e execute ollama ps novamente. Monitorize o tamanho apresentado enquanto aumenta. Se a coluna PROCESSOR mudar de 100% GPU para uma configuração dividida depois dessa alteração, a cache KV expulsou camadas do modelo da VRAM e a velocidade cairá muito. Escolher num_ctx no Ollama explica esta troca em detalhe. Não defina 1000000 apenas porque o model card o permite. A alocação ocorre logo no início e o carregamento falha.
Ligação a um agente sempre ativo
A publicação de lançamento da Ollama para este modelo documenta um atalho que inicia um agente compatível já configurado para o utilizar:
ollama launch claude --model nemotron-3.5-lightningA publicação documenta claude, opencode, openclaw e hermes nessa posição. O subcomando requer uma versão atual da Ollama. Por isso, verifique primeiro ollama --version. Se o comando não estiver disponível, configure manualmente o agente para usar a API. A Ollama disponibiliza um endpoint compatível com OpenAI, que a maioria dos frameworks de agentes aceita:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaA Ollama ignora a chave, mas a maioria dos clientes recusa iniciar sem uma chave definida. A configuração do framework está descrita em configurar um agente de programação para usar a Ollama e em criar o seu próprio agente OpenClaw.
Quando o agente é executado sem supervisão, duas configurações do servidor são importantes. OLLAMA_KEEP_ALIVE controla durante quanto tempo o modelo permanece na memória depois do último pedido. O valor predefinido descarrega-o após cinco minutos, pelo que a chamada seguinte volta a pagar o tempo total de carregamento. Num ficheiro de 25 GB sem GPU, essa pausa é suficientemente longa para exceder um timeout. Defina OLLAMA_KEEP_ALIVE=-1 para manter o modelo residente. OLLAMA_HOST=0.0.0.0:11434 torna a API acessível a partir de outras máquinas e não fornece qualquer tipo de autenticação. Exponha-a apenas através de uma regra de firewall ou de uma rede privada.
Modos de falha e mensagens apresentadas
O pull falha imediatamente. Error: pull model manifest: file does not exist significa que essa tag não existe. Os nomes das tags são strings exatas. Copie uma da página da biblioteca em vez de adivinhar um sufixo de quantização.
O modelo não carrega. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) significa que a tag é demasiado grande para este plano com a configuração atual. Use uma quantização menor ou reduza OLLAMA_CONTEXT_LENGTH, porque o cache KV é contabilizado nesse requisito.
Nada responde na porta 11434. curl: (7) Failed to connect to localhost port 11434 significa que o serviço não está em execução ou não está a escutar no endereço esperado. Consulte systemctl status ollama e journalctl -u ollama -n 50. Se também iniciou ollama serve manualmente, a segunda cópia termina com Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Responde, mas muito lentamente. Verifique ollama ps antes de alterar qualquer coisa. Qualquer utilização de CPU na coluna PROCESSOR de uma máquina com GPU significa que parte do modelo saiu da VRAM. Reduza o contexto ou use uma quantização menor. Numa máquina sem GPU, a lentidão é esperada e nenhuma definição a corrige.
O agente esquece as instruções a meio de uma tarefa. A conversa ultrapassou a janela de contexto e os tokens mais antigos foram descartados silenciosamente. Aumente OLLAMA_CONTEXT_LENGTH, confirme com ollama ps que o modelo continua a caber e, se já não couber, a solução é uma máquina maior, não uma janela menor.
Onde este modelo se compara com as alternativas
Um MoE de 30B é grande para alojar uma tarefa pequena. Se um modelo denso de 8B já executar a sua tarefa, será muito mais barato de executar e carregará em segundos. Para essa decisão, consulte Qwen 3 com 8B e 27B numa VPS. Para uma análise mais abrangente do que um determinado plano consegue efetivamente alojar, comece por quais modelos de IA pode alojar por conta própria. Se pretende servir vários agentes em simultâneo em vez de apenas um, leia primeiro Ollama comparado com vLLM, porque o Ollama não agrupa pedidos concorrentes da mesma forma que um servidor de inferência de produção. É nesse ponto que uma configuração para um único utilizador deixa de escalar.
FAQ
Que tag do Nemotron 3.5 Lightning devo obter numa VPS Linux?
Use nemotron-3.5-lightning:30b-a3b-q4_K_M. O tamanho é 25 GB, inclui o contexto máximo completo de 1M e corresponde ao mesmo digest apontado pelos tags latest, 30b e 30b-a3b em agosto de 2026. Indique-o explicitamente em vez de obter latest, para que uma futura republicação desse ponteiro não altere o comportamento do seu agente sem que se aperceba. Os tags mlx são compilações para Apple silicon e não serão úteis no Linux.
De quanta RAM precisa o Nemotron 3.5 Lightning?
A NVIDIA não publica um valor mínimo de memória para as compilações do Ollama, por isso meça em vez de fazer uma estimativa. Obtenha o tag, execute o modelo uma vez e leia ollama ps enquanto ele estiver carregado: essa informação mostra o tamanho efetivamente ocupado e indica se o modelo foi carregado na GPU ou na CPU. O tamanho da transferência, 25 GB para o tag predefinido, é um valor mínimo, porque a cache KV é adicionada a esse valor e aumenta com a janela de contexto definida. Se o plano for demasiado pequeno, o Ollama recusa a execução com model requires more system memory e indica ambos os valores.
Posso executar o Nemotron 3.5 Lightning numa VPS sem GPU?
Sim, desde que o plano tenha RAM suficiente para conter os pesos. A arquitetura MoE ajuda, porque apenas cerca de 3 dos 30 mil milhões de parâmetros são calculados por token. O problema é a velocidade. Sem uma GPU, o modelo fica limitado pela largura de banda da memória, por isso adicionar vCPUs quase não altera o resultado. Execute ollama run --verbose com um prompt fixo, leia a linha eval rate e compare esse valor com o prazo definido para o seu agente. Para um trabalho em lote durante a noite, normalmente é suficiente. Para qualquer tarefa em que uma pessoa tenha de esperar pelo resultado, geralmente não é.
Porque é que o Ollama não me fornece a janela de contexto completa de 1M?
1M é o máximo do modelo, não o valor predefinido do Ollama. O Ollama aplica uma janela muito menor e descarta os tokens mais antigos quando uma conversa ultrapassa esse limite. Não apresenta nenhum erro, o que dá a impressão de que o agente se esqueceu das próprias instruções. Defina OLLAMA_CONTEXT_LENGTH no serviço systemd ou passe num_ctx em cada pedido. Aumente o valor por etapas e volte a verificar ollama ps de cada vez, porque a memória da cache KV aumenta com a janela e pode levar as camadas do modelo a sair da GPU.
O Nemotron 3.5 Lightning pode ser utilizado comercialmente sem custos?
A ficha do modelo da NVIDIA coloca o modelo sob a licença OpenMDW-1.1 e indica que está pronto para utilização comercial. Isto abrange os pesos que descarrega e executa por sua conta. Não abrange os restantes componentes da sua stack. Verifique separadamente as licenças do harness do agente e de quaisquer ferramentas que ligue a ele. Consulte também a ficha do modelo atual antes de se basear nesta informação para qualquer questão contratual.