Ejecutar Nemotron 3.5 Lightning en un VPS con Ollama
Aprende a desplegar Nemotron 3.5 Lightning mediante Ollama en tu servidor. Conoce el tag exacto, los requisitos de RAM y si es viable ejecutar este modelo MoE solo con CPU.
Para qué sirve Nemotron 3.5 Lightning
Nemotron 3.5 Lightning es el modelo de mezcla de expertos (MoE) de 30B de NVIDIA, lanzado en agosto de 2026, diseñado para agentes que operan durante horas en lugar de sesiones de chat puntuales. MoE significa que los pesos se dividen en múltiples subredes expertas y cada token se enruta solo a través de unas pocas. La ficha técnica de NVIDIA indica un total de 30 mil millones de parámetros, con 3 mil millones activos por token. El coste reside en la gran cantidad de memoria necesaria, mientras que el beneficio es la velocidad de procesamiento.
Este equilibrio es la razón para considerar este modelo en un servidor alquilado. Un agente que realiza trabajo real envía miles de peticiones cortas a lo largo del día, por lo que el rendimiento por dólar determina si es viable ejecutarlo en su propia infraestructura. Un modelo que tarda 40 segundos por respuesta es un asistente aceptable pero un agente deficiente, ya que una sola tarea puede requerir veinte llamadas y usted debe esperar por cada una de ellas.
NVIDIA describe la arquitectura como híbrida: capas de Mamba-2 y MoE intercaladas con capas de atención seleccionadas. La ficha técnica especifica una longitud de contexto máxima de hasta 1M de tokens y una licencia OpenMDW-1.1, marcada como apta para uso comercial. Los idiomas principales son inglés y código, aunque también se incluyen español, francés, alemán, italiano y japonés.
Artificial Analysis publicó mediciones de lanzamiento en agosto de 2026 que mostraban casi 670 tokens de salida por segundo en un endpoint de pre-lanzamiento de DeepInfra utilizando los pesos NVFP4. Se trata de un endpoint de GPU alojado. Interprete esto como el potencial de la arquitectura, no como el rendimiento que obtendrá en su VPS.
Qué etiqueta de Ollama elegir para un VPS
La biblioteca de Ollama publica varias compilaciones de los mismos pesos. Lo que cambia entre ellas es la cuantización, que es la cantidad de bits en los que se almacena cada peso, y esto altera significativamente el tamaño de la descarga.
The data behind this chart
[
{
"label": "30b-a3b-q4_K_M",
"size_gb": 25
},
{
"label": "30b-a3b-q8_0",
"size_gb": 35
},
{
"label": "30b-a3b-bf16",
"size_gb": 66
},
{
"label": "30b-a3b-mlx",
"size_gb": 23
}
]Las etiquetas llamadas latest, 30b y 30b-a3b se resuelven todas al mismo resumen que 30b-a3b-q4_K_M, por lo que la descarga predeterminada es la compilación de cuatro bits de 25 GB con el contexto completo de 1M. Q8_0 tiene 35 GB y bf16 tiene 66 GB, ambos también con 1M. Las compilaciones MLX de 23 GB son para Apple silicon y tienen un límite de 256K de contexto, por lo que son la elección incorrecta en un VPS Linux.
Esos son tamaños de descarga, no requisitos de memoria. NVIDIA no publica una cifra mínima de VRAM (memoria de vídeo) para las compilaciones de Ollama, así que considere el tamaño de la descarga como un valor mínimo y nada más. Los pesos deben residir en algún lugar: en la memoria de la GPU si la tarjeta los admite y en la RAM del sistema en caso contrario; además, se debe sumar la caché KV (caché de clave/valor, la memoria por token del modelo para la conversación). El número real para su hardware se obtiene mediante un comando, no mediante aritmética, y se muestra a continuación. Si aún no ha decidido un nivel de cuantización, lo que cuestan Q4, Q8 y FP16 detalla lo que se sacrifica en cada paso.
Extraiga la etiqueta exacta, nunca latest
latest es un puntero dinámico. Cuando la biblioteca lo vuelve a publicar, el comportamiento de su agente cambia en la siguiente extracción sin que sus notas expliquen el motivo. Especifique la etiqueta.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_MEl script de instalación configura un servicio de systemd que se ejecuta como el usuario ollama y mantiene los modelos en /usr/share/ollama/.ollama/models. Esa ruta se encuentra en el sistema de archivos raíz en la mayoría de las imágenes de VPS, así que verifique el espacio disponible antes de solicitar 25 GB.
df -h /usr/share/ollamaUna extracción que se detiene a mitad de camino e informa no space left on device significa exactamente eso, y los blobs parciales permanecen en el disco hasta que usted los elimine. Después, confirme qué se ha descargado:
ollama show nemotron-3.5-lightning:30b-a3b-q4_K_Mollama show imprime la arquitectura, el número de parámetros, la longitud del contexto y la cuantización que contiene el archivo. Si alguno de estos datos no coincide con la página de la biblioteca, usted extrajo una etiqueta distinta a la que pretendía.
Ejecútelo y verifique dónde se ejecutó realmente
sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"Mientras el modelo sigue cargado, en una segunda terminal:
ollama psEste es el comando que responde a la pregunta sobre la memoria en su equipo. ollama ps muestra el modelo cargado, el tamaño que ocupa en memoria y una columna PROCESSOR. 100% GPU significa que todo el modelo está en la VRAM. 100% CPU significa que no hay nada en ella y que cada token es calculado por el procesador a partir de la RAM del sistema. Una división como 65%/35% CPU/GPU significa que no todas las capas cupieron en la VRAM y que la parte gestionada por la CPU determina su velocidad. No estime los requisitos. Cárguelo y lea esta línea.
Si no puede cargarse en absoluto, Ollama lo rechaza de forma limpia en lugar de bloquearse:
Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)¿Es suficiente un VPS solo con CPU?
Un VPS de propósito general no tiene GPU, por lo que la CPU realiza todo el trabajo y lee cada peso necesario de la memoria RAM del sistema. MoE ayuda en este caso, ya que solo se utilizan unos 3 mil millones de los 30 mil millones de parámetros por token; por lo tanto, la aritmética por token es mucho menor que en un modelo denso de 30B. La memoria no se beneficia en absoluto. Los 30 mil millones de parámetros deben permanecer residentes, ya que el router puede elegir cualquier experto para cualquier token.
Por lo tanto, la inferencia solo con CPU en este modelo está limitada por el ancho de banda de la memoria y no por el número de núcleos. Añadir vCPU a un plan que ya tiene una cantidad razonable cambia muy poco. Lo que necesita es suficiente RAM para alojar los pesos más su caché KV, y la memoria más rápida que le ofrezca el plan.
Mídalo antes de asignar un agente, utilizando el método en medición de tokens por segundo para un LLM local:
ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."La línea eval rate impresa al final es su velocidad de generación en tokens por segundo. Ese único número decide la cuestión, ya que el tiempo de reloj de pared de un agente está dominado por él.
The data behind this chart
[
{
"label": "Nemotron 3.5 Lightning",
"sec_per_task": 30
},
{
"label": "gpt-oss-120b",
"sec_per_task": 204
},
{
"label": "Qwen3.6 35B",
"sec_per_task": 210
}
]Esas son cifras publicadas por terceros, convertidas a partir de los minutos por tarea que Artificial Analysis informó en el lanzamiento, y fueron medidas en endpoints de GPU alojados en lugar de en un VPS. Nemotron 3.5 Lightning promedió alrededor de 30 segundos por tarea, donde gpt-oss-120b tomó aproximadamente 204 y Qwen3.6 35B aproximadamente 210. Úselas para observar la magnitud de la diferencia, no como una promesa sobre su hardware.
La recomendación honesta depende de quién esté esperando. Si una persona espera al agente, o el agente realiza largas cadenas de llamadas consecutivas, alquile capacidad de GPU. Si se ejecuta según un horario durante la noche y nadie lo está observando, un plan de CPU con mucha RAM es un alojamiento razonable. De cualquier manera, la configuración es la misma, y ejecutar Ollama en un VPS cubre el dimensionamiento del plan y cómo se compara una instancia de GPU con pagar a un proveedor de API por token. El punto de equilibrio es una cuestión de utilización: una instancia de GPU factura cada hora que existe, mientras que los tokens de API se facturan solo cuando se usan; por lo tanto, un agente que está ocupado la mayor parte del día favorece el servidor propio, y un agente que se ejecuta dos veces por hora generalmente no.
La ventana de contexto de 1M no es gratuita
1M de tokens es el máximo del modelo, y Ollama no lo asigna por defecto. Ollama utiliza una ventana predeterminada mucho más pequeña y descarta los tokens más antiguos una vez que la conversación los supera. No se registra nada cuando esto ocurre, por lo que, para un agente, parece que el modelo olvida el inicio de su propia tarea.
Configure la ventana de forma deliberada. Para todo el servidor, edite el servicio:
sudo systemctl edit ollamaAñada esto y luego ejecute sudo systemctl restart ollama:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Por petición, envíe num_ctx en el objeto de opciones en su lugar:
curl http://localhost:11434/api/chat -d '{
"model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
"messages": [{"role": "user", "content": "Say ready"}],
"options": {"num_ctx": 32768},
"stream": false
}'Cada incremento consume memoria, ya que la caché KV crece con el número de tokens que permita. Aumente el valor, reinicie, luego ejecute ollama ps de nuevo y observe cómo aumenta el tamaño reportado. Si la columna PROCESSOR cambia de 100% GPU a una división después de ese cambio, la caché KV desplazó capas del modelo fuera de la VRAM y su velocidad caerá drásticamente. Elegir num_ctx en Ollama analiza este equilibrio en detalle. No establezca 1000000 solo porque la tarjeta del modelo lo permita, ya que la asignación ocurre por adelantado y la carga simplemente fallará.
Conexión a un agente siempre activo
La publicación de lanzamiento de Ollama para este modelo documenta un acceso directo que inicia un agente compatible ya configurado para apuntar a él:
ollama launch claude --model nemotron-3.5-lightningLa publicación documenta claude, opencode, openclaw y hermes en esa posición. El subcomando requiere una versión actual de Ollama, así que verifique ollama --version primero y, si no está presente, apunte el agente a la API usted mismo. Ollama expone un endpoint compatible con OpenAI, el cual es aceptado por la mayoría de los entornos de agentes:
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollamaOllama ignora la clave, pero la mayoría de los clientes se niegan a iniciar si no se ha configurado una. La parte del entorno de ejecución se trata en apuntar un agente de programación a Ollama y en crear su propio agente OpenClaw.
Dos configuraciones del servidor son importantes una vez que el agente se ejecuta sin supervisión. OLLAMA_KEEP_ALIVE controla cuánto tiempo permanece un modelo en memoria después de la última petición; el valor predeterminado lo descarga después de cinco minutos, por lo que la siguiente llamada vuelve a incurrir en el tiempo de carga completo. En un archivo de 25 GB sin GPU, esa pausa es lo suficientemente larga como para provocar un tiempo de espera agotado. Establezca OLLAMA_KEEP_ALIVE=-1 para mantenerlo residente. OLLAMA_HOST=0.0.0.0:11434 hace que la API sea accesible desde otras máquinas y no incluye ningún tipo de autenticación, por lo que debe abrirla únicamente detrás de una regla de firewall o en una red privada.
Modos de fallo y mensajes asociados
La descarga falla inmediatamente. Error: pull model manifest: file does not exist significa que esa etiqueta no existe. Los nombres de las etiquetas son cadenas exactas, así que copie uno de la página de la biblioteca en lugar de adivinar un sufijo de cuantización.
El modelo no se carga. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) significa que la etiqueta es demasiado grande para este plan según la configuración actual. Utilice una cuantización menor o reduzca OLLAMA_CONTEXT_LENGTH, ya que la caché KV se contabiliza dentro de ese requisito.
No hay respuesta en el puerto 11434. curl: (7) Failed to connect to localhost port 11434 significa que el servicio no está en ejecución o no está escuchando donde usted espera. Lea systemctl status ollama y journalctl -u ollama -n 50. Si además inició ollama serve manualmente, la segunda copia se cerrará con Error: listen tcp 127.0.0.1:11434: bind: address already in use.
Responde muy lentamente. Compruebe ollama ps antes de cambiar nada. Cualquier uso de CPU en la columna PROCESSOR en una máquina con GPU significa que parte del modelo se ha desbordado fuera de la VRAM; reduzca el contexto o utilice la cuantización más pequeña. En una máquina sin GPU, la lentitud es el resultado esperado y ningún ajuste lo solucionará.
El agente olvida sus instrucciones a mitad de una tarea. La conversación superó la ventana de contexto y los tokens más antiguos se descartaron silenciosamente. Aumente OLLAMA_CONTEXT_LENGTH, confirme con ollama ps que el modelo aún cabe y, si ya no es así, la solución es una máquina más potente en lugar de una ventana más pequeña.
Dónde se sitúa este modelo frente a las alternativas
Un modelo MoE de 30B es una carga pesada para tareas pequeñas. Si un modelo denso de 8B ya resuelve su necesidad, su ejecución será mucho más económica y cargará en segundos; Qwen 3 de 8B y 27B en un VPS es la comparación directa para tomar esa decisión. Para un análisis más amplio sobre la capacidad de su plan actual, comience por qué modelos de IA puede autohospedar. Si planea servir a varios agentes simultáneamente en lugar de uno solo, lea primero Ollama comparado con vLLM, ya que Ollama no procesa peticiones concurrentes por lotes como lo hace un servidor de inferencia de producción, y ahí es donde una configuración de usuario único deja de escalar.
FAQ
¿Qué etiqueta de Nemotron 3.5 Lightning debo descargar en un VPS Linux?
Utilice nemotron-3.5-lightning:30b-a3b-q4_K_M. Tiene un tamaño de 25 GB, admite el contexto máximo completo de 1M y es el mismo resumen (digest) al que apuntan las etiquetas latest, 30b y 30b-a3b a fecha de agosto de 2026. Asígnelo explícitamente en lugar de descargar latest; de este modo, una futura republicación de ese puntero no podrá alterar el comportamiento de su agente sin que usted lo note. Las etiquetas mlx son compilaciones para Apple silicon y no funcionarán en Linux.
¿Cuánta memoria RAM necesita Nemotron 3.5 Lightning?
NVIDIA no publica una cifra de memoria mínima para las compilaciones de Ollama, por lo que es mejor medir que estimar. Descargue la etiqueta, ejecute el modelo una vez y lea ollama ps mientras esté cargado: mostrará el tamaño ocupado realmente y si se ha alojado en la GPU o en la CPU. El tamaño de descarga, 25 GB para la etiqueta predeterminada, es un valor mínimo, ya que la caché KV se añade encima y aumenta según la ventana de contexto que usted defina. Si el plan es demasiado pequeño, Ollama rechazará la ejecución con model requires more system memory e indicará ambos valores.
¿Puedo ejecutar Nemotron 3.5 Lightning en un VPS sin GPU?
Sí, siempre que el plan tenga suficiente RAM para albergar los pesos. El diseño MoE ayuda, ya que solo se calculan unos 3 de los 30 mil millones de parámetros por token. El inconveniente es la velocidad. Sin una GPU, el modelo está limitado por el ancho de banda de la memoria, por lo que añadir vCPU apenas mejora el resultado. Ejecute ollama run --verbose con un prompt fijo, lea la línea eval rate y compare ese número con el tiempo de respuesta requerido por su agente. Para un trabajo por lotes nocturno suele ser suficiente. Para cualquier interacción en tiempo real, generalmente no lo es.
¿Por qué Ollama no me ofrece la ventana de contexto completa de 1M?
1M es el máximo del modelo, no el valor predeterminado de Ollama. Ollama aplica una ventana mucho más pequeña y descarta los tokens más antiguos una vez que la conversación la supera, sin mostrar ningún error, lo que provoca que el agente parezca olvidar sus propias instrucciones. Defina OLLAMA_CONTEXT_LENGTH en el servicio de systemd o pase num_ctx en cada petición. Auméntelo gradualmente y vuelva a comprobar ollama ps en cada paso, ya que la memoria de la caché KV escala con la ventana y puede desplazar capas del modelo fuera de la GPU.
¿Es Nemotron 3.5 Lightning de uso comercial gratuito?
La tarjeta del modelo de NVIDIA lo clasifica bajo la licencia OpenMDW-1.1 y lo marca como apto para uso comercial. Esto cubre los pesos que usted descarga y ejecuta por su cuenta. No dice nada sobre el resto del software de su pila tecnológica, por lo que debe verificar las licencias del agente y de cualquier herramienta que conecte a él por separado, además de leer la tarjeta del modelo actual antes de depender de esto para cualquier fin contractual.