SSD Nodes Learn 🎉 VPS desde $5.50/mês
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-13

Rodar Nemotron 3.5 Lightning em um VPS

Veja como rodar o NVIDIA Nemotron 3.5 Lightning no Ollama: tag exata para baixar, RAM necessária e se o modo apenas CPU oferece velocidade suficiente.

Para que serve o Nemotron 3.5 Lightning

O Nemotron 3.5 Lightning é o modelo aberto de 30B da NVIDIA baseado numa arquitetura mixture-of-experts, lançado em agosto de 2026. Foi desenvolvido para agentes que executam tarefas durante horas, e não apenas para uma janela de chat. MoE (mixture of experts) significa que os pesos são divididos por várias sub-redes especializadas, e cada token é encaminhado apenas por algumas delas. A ficha do modelo indica 30 bilhões de parâmetros no total, com 3 bilhões ativos por token. A memória necessária corresponde ao número total. A velocidade corresponde ao número ativo.

Esse compromisso é o motivo para considerar este modelo num servidor alugado. Um agente que executa trabalho real envia milhares de pedidos curtos ao longo do dia. Por isso, o débito por dólar determina se ele pode ser executado no seu próprio servidor. Um modelo que demora 40 segundos por resposta pode ser um assistente utilizável, mas é um agente fraco. Uma tarefa pode fazer 20 chamadas, e é necessário esperar por cada uma delas.

A NVIDIA descreve a arquitetura como híbrida: camadas Mamba-2 e MoE intercaladas, com algumas camadas de atenção. A ficha do modelo indica um comprimento máximo de contexto de até 1M tokens e uma licença OpenMDW-1.1, classificada como pronta para uso comercial. Os idiomas principais são inglês e código. Também são indicados espanhol, francês, alemão, italiano e japonês.

A Artificial Analysis publicou medições de lançamento em agosto de 2026 que mostram quase 670 tokens de saída por segundo, num endpoint DeepInfra de pré-lançamento que disponibilizava os pesos NVFP4. Esse é um endpoint de GPU alojado. Interprete o valor como uma indicação do que a arquitetura permite, e não como o desempenho que o seu VPS terá.

Qual tag do Ollama escolher para cada VPS

A biblioteca do Ollama publica várias compilações dos mesmos pesos. O que muda entre elas é a quantização, ou seja, quantos bits são usados para armazenar cada peso. Isto altera bastante o tamanho da transferência.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

As tags latest, 30b e 30b-a3b resolvem todas para o mesmo digest que 30b-a3b-q4_K_M. Por isso, a transferência predefinida é a compilação de quatro bits com 25 GB e o contexto completo de 1M. Q8_0 ocupa 35 GB e bf16 ocupa 66 GB. Ambas também usam 1M de contexto. As compilações MLX, com 23 GB, destinam-se a Apple silicon e estão limitadas a um contexto de 256K. Por isso, são a escolha errada num VPS Linux.

Estes são tamanhos de transferência, não requisitos de memória. A NVIDIA não publica um valor mínimo de VRAM (memória de vídeo) para as compilações do Ollama. Por isso, trate o tamanho da transferência apenas como um limite inferior. Os pesos têm de permanecer em algum local: na memória da GPU, se a placa tiver capacidade suficiente, ou na RAM do sistema, caso contrário. A cache KV (cache de chave/valor, a memória que o modelo usa por token para a conversa) é adicionada a esse valor. O valor real para o seu hardware é obtido por um comando, não por cálculo, e aparece abaixo. Se ainda não escolheu um nível de quantização, o custo de Q4, Q8 e FP16 explica o que é perdido em cada passo.

Extraia a tag exata, nunca latest

latest é um ponteiro que muda. Quando a biblioteca o republica, o comportamento do seu agente muda na próxima extração, sem que as suas notas expliquem o motivo. Especifique a tag.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

O script de instalação configura um serviço systemd que é executado como o utilizador ollama e mantém os modelos em /usr/share/ollama/.ollama/models. Na maioria das imagens de VPS, esse caminho fica no sistema de ficheiros raiz. Verifique o espaço disponível antes de solicitar 25 GB.

df -h /usr/share/ollama

Uma extração que para a meio e informa no space left on device significa exatamente isso. Os blobs parciais permanecem no disco até serem eliminados. Em seguida, confirme o que foi instalado:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show apresenta a arquitetura, a quantidade de parâmetros, o comprimento do contexto e a quantização efetivamente presente no ficheiro. Se algum desses dados não corresponder à página da biblioteca, foi extraída uma tag diferente da pretendida.

Servir o modelo e verificar onde foi executado

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Enquanto o modelo ainda estiver carregado, abra uma segunda shell:

ollama ps

Este é o comando que responde à questão da memória na sua máquina. ollama ps apresenta o modelo carregado, o espaço que ocupa na memória e uma coluna PROCESSOR. 100% GPU significa que todo o modelo está na VRAM. 100% CPU significa que não está nenhuma parte na VRAM e que todos os tokens são processados pelo processador a partir da RAM do sistema. Uma divisão como 65%/35% CPU/GPU significa que nem todas as camadas couberam e que a proporção processada pela CPU determina a velocidade. Não estime os requisitos. Carregue o modelo e leia esta linha.

Se não conseguir carregá-lo, o Ollama recusa o pedido de forma controlada em vez de falhar:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

Um VPS apenas com CPU é suficientemente rápido?

Um VPS de uso geral não tem GPU, por isso a CPU faz todo o trabalho e lê cada peso de que precisa a partir da RAM do sistema. O MoE ajuda neste aspeto, porque apenas cerca de 3 mil milhões dos 30 mil milhões de parâmetros são processados por token. Assim, a quantidade de cálculos por token é muito menor do que num modelo denso de 30B. A memória não beneficia de todo. Os 30 mil milhões de parâmetros têm de permanecer residentes, porque o router pode escolher qualquer expert para qualquer token.

Por isso, a inferência apenas com CPU neste modelo é limitada pela largura de banda da memória, não pelo número de cores. Adicionar vCPUs a um plano que já tenha uma quantidade razoável delas altera muito pouco o resultado. Precisa de RAM suficiente para manter os pesos e o seu cache KV, além da memória mais rápida disponibilizada pelo plano.

Faça uma medição antes de atribuir um agente a esse VPS, usando o método descrito em medir tokens por segundo para um LLM local:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

A linha eval rate apresentada no fim indica a velocidade de geração em tokens por segundo. Esse único número determina a resposta, porque o tempo total de execução de um agente é dominado por esse valor.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Estes são valores publicados por terceiros e convertidos a partir dos minutos por tarefa comunicados pela Artificial Analysis no lançamento. Foram medidos em endpoints GPU alojados, não num VPS. O Nemotron 3.5 Lightning teve uma média de cerca de 30 segundos por tarefa, sendo que gpt-oss-120b demorou aproximadamente 204 e Qwen3.6 35B aproximadamente 210. Use estes valores para perceber a dimensão da diferença, não como uma garantia para o seu hardware.

A orientação correta depende de quem está à espera. Se uma pessoa estiver à espera do agente, ou se o agente fizer longas sequências de chamadas consecutivas, alugue capacidade GPU. Se o agente for executado durante a noite segundo um agendamento e ninguém estiver a acompanhar a execução, um plano CPU com muita RAM é uma opção razoável. Em qualquer dos casos, a configuração é a mesma. executar Ollama num VPS explica o dimensionamento do plano e compara uma instância GPU com o pagamento de um fornecedor de API por token. O ponto de equilíbrio depende da utilização: uma instância GPU é faturada por todas as horas em que existe, enquanto os tokens de uma API só são faturados quando são usados. Por isso, um agente ocupado durante grande parte do dia favorece o servidor que possui, enquanto um agente que é executado duas vezes por hora normalmente não.

A janela de contexto de 1M não é gratuita

1M de tokens é o máximo do modelo, e o Ollama não o disponibiliza por predefinição. O Ollama utiliza uma janela predefinida muito menor e descarta os tokens mais antigos quando uma conversa ultrapassa esse limite. Nada é registado quando isso acontece. Para um agente, parece que o modelo se esqueceu do início da própria tarefa.

Defina a janela de forma explícita. Para todo o servidor, edite o serviço:

sudo systemctl edit ollama

Adicione esta configuração e execute sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Por pedido, envie num_ctx no objeto de opções:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Cada aumento consome memória, porque a cache KV cresce com o número de tokens permitido. Aumente o valor, reinicie o serviço e execute ollama ps novamente. Monitorize o tamanho apresentado enquanto aumenta. Se a coluna PROCESSOR mudar de 100% GPU para um valor dividido depois dessa alteração, a cache KV expulsou camadas do modelo da VRAM e a velocidade cairá significativamente. Escolher num_ctx no Ollama explica este compromisso em detalhe. Não defina 1000000 apenas porque o model card permite esse valor. A alocação ocorre antecipadamente e o carregamento falha.

Integrar com um agente sempre ativo

A publicação de lançamento do Ollama para este modelo documenta um atalho que inicia um agente compatível já configurado para o utilizar:

ollama launch claude --model nemotron-3.5-lightning

A publicação documenta claude, opencode, openclaw e hermes nessa posição. O subcomando requer uma versão atual do Ollama. Por isso, verifique primeiro ollama --version. Se não estiver disponível, configure manualmente o agente para utilizar a API. O Ollama expõe um endpoint compatível com OpenAI, aceite pela maioria dos ambientes de execução de agentes:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

O Ollama ignora a chave, mas a maioria dos clientes não inicia sem uma chave definida. A configuração do ambiente de execução é explicada em configurar um agente de programação para usar o Ollama e em criar o seu próprio agente OpenClaw.

Quando o agente é executado sem supervisão, duas definições do servidor são importantes. OLLAMA_KEEP_ALIVE controla durante quanto tempo um modelo permanece na memória depois do último pedido. O valor predefinido descarrega-o após cinco minutos, fazendo com que a chamada seguinte volte a pagar todo o tempo de carregamento. Num ficheiro de 25 GB sem GPU, essa pausa pode ser suficientemente longa para exceder um tempo limite. Defina OLLAMA_KEEP_ALIVE=-1 para manter o modelo residente. OLLAMA_HOST=0.0.0.0:11434 torna a API acessível a outras máquinas. Esta opção não fornece qualquer tipo de autenticação. Por isso, exponha-a apenas atrás de uma regra de firewall ou numa rede privada.

Modos de falha e mensagens que verá

A obtenção da imagem falha imediatamente. Error: pull model manifest: file does not exist significa que essa tag não existe. Os nomes das tags são sequências exatas. Copie uma da página da biblioteca em vez de adivinhar um sufixo de quantização.

O modelo não carrega. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) significa que a tag é demasiado grande para este plano com a configuração atual. Use uma quantização menor ou reduza OLLAMA_CONTEXT_LENGTH, porque o cache KV é contabilizado nesse requisito.

Nada responde na porta 11434. curl: (7) Failed to connect to localhost port 11434 significa que o serviço não está em execução ou não está a escutar no local esperado. Consulte systemctl status ollama e journalctl -u ollama -n 50. Se também iniciou ollama serve manualmente, a segunda cópia termina com Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Responde, mas muito lentamente. Verifique ollama ps antes de alterar qualquer coisa. Qualquer utilização de CPU na coluna PROCESSOR numa máquina com GPU significa que parte do modelo saiu da VRAM. Reduza o contexto ou use uma quantização menor. Numa máquina sem GPU, a lentidão é esperada e nenhuma definição a corrige.

O agente esquece-se das instruções a meio de uma tarefa. A conversa ultrapassou a janela de contexto e os tokens mais antigos foram descartados silenciosamente. Aumente OLLAMA_CONTEXT_LENGTH, confirme com ollama ps que o modelo continua a caber e, se já não couber, a solução é uma máquina maior, não uma janela menor.

Onde este modelo se posiciona face às alternativas

Um modelo MoE de 30B é grande para alojar numa tarefa pequena. Se um modelo denso de 8B já executa a sua tarefa, será muito mais barato de executar e carregará em segundos. Para essa decisão, consulte a comparação direta Qwen 3 a 8B e 27B numa VPS. Para uma análise mais abrangente do que um determinado plano consegue efetivamente alojar, comece por quais modelos de IA pode alojar por conta própria. Se planear servir vários agentes em simultâneo em vez de um só, leia primeiro Ollama em comparação com vLLM, porque o Ollama não agrupa pedidos concorrentes da mesma forma que um servidor de inferência de produção. É nesse ponto que uma configuração para um único utilizador deixa de escalar.

FAQ

Qual tag do Nemotron 3.5 Lightning devo baixar numa VPS Linux?

Use nemotron-3.5-lightning:30b-a3b-q4_K_M. Ele tem 25 GB, inclui o contexto máximo completo de 1M e usa o mesmo digest para o qual apontam as tags latest, 30b e 30b-a3b em agosto de 2026. Especifique o nome em vez de baixar latest, para que uma futura republicação desse ponteiro não altere o comportamento do seu agente sem que você perceba. As tags mlx são compilações para Apple silicon e não serão úteis no Linux.

De quanta RAM o Nemotron 3.5 Lightning precisa?

A NVIDIA não publica um valor mínimo de memória para as compilações do Ollama. Por isso, faça a medição em vez de estimar. Baixe a tag, execute o modelo uma vez e leia ollama ps enquanto ele estiver carregado. Esse comando mostra o tamanho efetivamente ocupado e informa se o modelo foi carregado na GPU ou na CPU. O tamanho do download, 25 GB para a tag padrão, é um valor mínimo, porque o cache KV é adicionado a esse valor e cresce conforme a janela de contexto configurada. Se o plano for pequeno demais, o Ollama recusa a operação com model requires more system memory e informa os dois valores.

Posso executar o Nemotron 3.5 Lightning numa VPS sem GPU?

Sim, desde que o plano tenha RAM suficiente para manter os pesos. O design MoE ajuda porque apenas cerca de 3 dos 30 bilhões de parâmetros são calculados por token. O problema é a velocidade. Sem GPU, o modelo fica limitado pela largura de banda da memória, portanto adicionar vCPUs quase não altera o resultado. Execute ollama run --verbose com um prompt fixo, leia a linha eval rate e compare esse valor com o prazo aceitável para o seu agente. Para um job em lote durante a noite, geralmente é suficiente. Para qualquer tarefa que dependa da espera de uma pessoa, normalmente não é.

Por que o Ollama não me fornece a janela de contexto completa de 1M?

1M é o máximo do modelo, não o padrão do Ollama. O Ollama aplica uma janela muito menor e descarta os tokens mais antigos quando a conversa ultrapassa esse limite, sem imprimir um erro. Isso pode parecer que o agente se esqueceu das próprias instruções. Defina OLLAMA_CONTEXT_LENGTH no serviço systemd ou passe num_ctx em cada pedido. Aumente o valor gradualmente e verifique ollama ps novamente a cada alteração, porque a memória do cache KV cresce com a janela e pode fazer com que camadas do modelo sejam removidas da GPU.

O uso do Nemotron 3.5 Lightning é gratuito para fins comerciais?

O model card da NVIDIA coloca o modelo sob a licença OpenMDW-1.1 e indica que ele está pronto para uso comercial. Isso abrange os pesos que você baixa e executa por conta própria. A licença não abrange os outros componentes da sua stack. Verifique separadamente as licenças do harness do agente e de todas as ferramentas conectadas a ele. Leia também o model card atual antes de usar estas informações em qualquer contexto contratual.