SSD Nodes Learn Hosting plans →
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-24

Ejecutar Nemotron 3.5 Lightning en un VPS con Ollama

Aprende a ejecutar NVIDIA Nemotron 3.5 Lightning con Ollama: usa la etiqueta exacta, calcula la RAM necesaria y comprueba si CPU-only ofrece velocidad suficiente.

Para qué sirve Nemotron 3.5 Lightning

Nemotron 3.5 Lightning es el modelo abierto de 30B basado en una mezcla de expertos de NVIDIA. Se publicó en agosto de 2026 y está diseñado para agentes que funcionan durante horas, no para una sola ventana de chat. MoE (mixture of experts) significa que los pesos se dividen entre muchas subredes expertas y que cada token se procesa sólo con unas pocas. La ficha del modelo de NVIDIA indica 30 billion de parámetros totales y 3 billion activos por token. La memoria debe reservarse para la cifra grande. La velocidad se beneficia de la cifra pequeña.

Ese equilibrio explica por qué conviene considerar este modelo para un servidor alquilado. Un agente que realiza trabajo real envía miles de solicitudes cortas a lo largo del día. Por tanto, el rendimiento por unidad de coste determina si puede ejecutarse en un servidor propio. Un modelo que tarda 40 segundos por respuesta puede servir como asistente, pero es una mala opción para un agente. Una sola tarea puede generar veinte llamadas y hay que esperar cada una.

NVIDIA describe la arquitectura como híbrida: capas Mamba-2 y MoE intercaladas, con determinadas capas de atención. La ficha del modelo indica una longitud de contexto máxima de hasta 1M tokens y una licencia OpenMDW-1.1, marcada como apta para uso comercial. Los idiomas principales son el inglés y el código. También se incluyen español, francés, alemán, italiano y japonés.

Artificial Analysis publicó mediciones de lanzamiento en agosto de 2026. Mostraban casi 670 tokens de salida por segundo en un endpoint de DeepInfra previo al lanzamiento que servía los pesos NVFP4. Ese resultado corresponde a un endpoint de GPU alojado. Debe interpretarse como lo que permite la arquitectura, no como el rendimiento que tendrá en su VPS.

Qué etiqueta de Ollama corresponde a cada VPS

La biblioteca de Ollama publica varias compilaciones con los mismos pesos. La diferencia es la cuantización, es decir, cuántos bits se utilizan para almacenar cada peso. Esto cambia mucho el tamaño de la descarga.

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

Las etiquetas latest, 30b y 30b-a3b resuelven todas al mismo digest que 30b-a3b-q4_K_M, por lo que la descarga predeterminada es la compilación de cuatro bits de 25 GB con el contexto completo de 1M. Q8_0 ocupa 35 GB y bf16 ocupa 66 GB; ambas también usan un contexto de 1M. Las compilaciones MLX de 23 GB están destinadas a Apple silicon y limitan el contexto a 256K, por lo que no son adecuadas para un VPS Linux.

Esos son tamaños de descarga, no requisitos de memoria. NVIDIA no publica una cifra mínima de VRAM (memoria de vídeo) para las compilaciones de Ollama, así que considere el tamaño de descarga sólo como un mínimo orientativo. Los pesos deben permanecer en algún lugar: en la memoria de la GPU si la tarjeta puede contenerlos, y en la RAM del sistema en caso contrario. Además, se añade la caché KV (caché de clave/valor, la memoria por token que el modelo utiliza para la conversación). La cifra real para su hardware se obtiene mediante un comando, no mediante un cálculo, y se muestra a continuación. Si todavía no ha elegido un nivel de cuantización, qué coste tienen Q4, Q8 y FP16 explica qué se pierde en cada paso.

Extraiga la etiqueta exacta, nunca latest

latest es un puntero que cambia. Cuando la biblioteca vuelva a publicarla, el comportamiento de su agente cambiará en la siguiente extracción, sin que sus notas expliquen el motivo. Especifique la etiqueta.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

El script de instalación configura un servicio de systemd que se ejecuta como el usuario ollama y mantiene los modelos en /usr/share/ollama/.ollama/models. En la mayoría de las imágenes VPS, esa ruta está en el sistema de archivos raíz. Compruebe que haya espacio disponible antes de solicitar 25 GB. Si ese sistema de archivos está casi lleno, conviene leer dónde almacena Ollama sus modelos y cómo moverlos antes de extraerlos, no después de que hayan llenado el disco.

df -h /usr/share/ollama

Una extracción que se detiene a mitad de camino y muestra no space left on device indica exactamente eso. Los blobs parciales permanecen en el disco hasta que los elimina. Después, confirme qué se descargó:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show muestra la arquitectura, el número de parámetros, la longitud del contexto y la cuantización que contiene realmente el archivo. Si alguno de esos datos no coincide con la página de la biblioteca, extrajo una etiqueta distinta de la prevista.

Sírvelo y comprueba dónde se ejecutó realmente

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

Mientras el modelo siga cargado, abre una segunda shell:

ollama ps

Este es el comando que responde a la pregunta sobre la memoria de tu máquina. ollama ps muestra el modelo cargado, el espacio que ocupa en memoria y una columna PROCESSOR. 100% GPU significa que todo está en la VRAM. 100% CPU significa que no está en ella y que cada token lo calcula el procesador usando la RAM del sistema. Una distribución como 65%/35% CPU/GPU significa que no cabían todas las capas y que la parte asignada a la CPU determina la velocidad. No calcules el requisito de forma aproximada. Carga el modelo y lee esta línea.

Si no puede cargarse, Ollama lo rechaza correctamente en lugar de bloquearse:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

¿Es suficientemente rápido un VPS sólo con CPU?

Un VPS de propósito general no tiene GPU, por lo que la CPU realiza todo el trabajo y lee de la RAM del sistema cada peso que necesita. MoE ayuda en este caso, porque sólo se utilizan unos 3 billion de los 30 billion de parámetros por token. Por tanto, el cálculo por token es mucho menor que en un modelo denso de 30B. La memoria no se beneficia en absoluto. Los 30 billion de parámetros deben permanecer residentes, porque el router puede seleccionar cualquier experto para cualquier token.

Por tanto, la inferencia sólo con CPU en este modelo está limitada por el ancho de banda de memoria, no por el número de núcleos. Añadir vCPU a un plan que ya tiene una cantidad razonable cambia muy poco. Necesita suficiente RAM para alojar los pesos y la caché KV, además de la memoria más rápida que ofrezca el plan.

Mídalo antes de asignarle un agente, mediante el método descrito en medir tokens por segundo para un LLM local:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

La línea eval rate que se imprime al final es la velocidad de generación en tokens por segundo. Ese único número determina la respuesta, porque el tiempo transcurrido de un agente depende principalmente de él. Multiplíquelo por la longitud de respuesta que espera. Si el resultado supera el tiempo que está dispuesto a esperar, limitar la salida con num_predict es el mecanismo que limita una llamada individual sin cambiar el hardware.

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

Son cifras publicadas por terceros y convertidas a partir de los minutos por tarea que Artificial Analysis comunicó durante el lanzamiento. Se midieron en endpoints GPU alojados, no en un VPS. Nemotron 3.5 Lightning promedió unos 30 segundos por tarea. gpt-oss-120b tardó aproximadamente 204, y Qwen3.6 35B tardó aproximadamente 210. Úselas para apreciar la magnitud de la diferencia, no como una garantía sobre su hardware.

La recomendación depende de quién tenga que esperar. Si una persona espera al agente o el agente ejecuta cadenas largas de llamadas consecutivas, alquile capacidad GPU. Si se ejecuta según un horario durante la noche y nadie lo supervisa, un plan de CPU con mucha RAM es una opción razonable. En ambos casos, la configuración es la misma. ejecutar Ollama en un VPS explica cómo dimensionar el plan y cómo se compara una instancia GPU con pagar a un proveedor de API por token. El punto de equilibrio depende del uso: una instancia GPU se factura por cada hora que existe, mientras que los tokens de API sólo se facturan cuando se utilizan. Por tanto, un agente ocupado la mayor parte del día favorece el servidor propio, mientras que un agente que se ejecuta dos veces por hora normalmente no.

La ventana de contexto de 1M no es gratuita

1M de tokens es el máximo del modelo, pero Ollama no la asigna de forma predeterminada. Ollama ofrece una ventana predeterminada mucho menor y descarta los tokens más antiguos cuando una conversación la supera. No se registra nada cuando ocurre, por lo que un agente parece olvidar el inicio de su propia tarea.

Configure la ventana de forma explícita. Para todo el servidor, edite el servicio:

sudo systemctl edit ollama

Añada esto y ejecute sudo systemctl restart ollama:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Para una petición concreta, envíe num_ctx en el objeto de opciones:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

Cada aumento consume memoria porque la caché KV crece con el número de tokens permitidos. Aumente el valor, reinicie y vuelva a ejecutar ollama ps. Compruebe cómo aumenta el tamaño indicado. Si la columna PROCESSOR cambia de 100% GPU a un reparto después de ese cambio, la caché KV expulsó capas del modelo de la VRAM y la velocidad disminuirá mucho. Cómo elegir num_ctx en Ollama explica este equilibrio en detalle. No establezca 1000000 sólo porque la tarjeta del modelo lo permita: la asignación se realiza al principio y la carga simplemente falla.

Integrarlo en un agente siempre activo

La publicación de lanzamiento de este modelo de Ollama documenta un acceso directo que inicia un agente compatible ya configurado para usarlo:

ollama launch claude --model nemotron-3.5-lightning

La publicación documenta claude, opencode, openclaw y hermes en esa posición. El subcomando requiere una versión actual de Ollama, así que compruebe primero ollama --version. Si no está disponible, configure manualmente el agente para usar la API. Ollama expone un endpoint compatible con OpenAI que la mayoría de los sistemas de agentes aceptan:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama ignora la clave, pero la mayoría de los clientes no se inician si no se establece una. La configuración del lado del sistema de agentes se explica en configurar un agente de programación para usar Ollama y en crear su propio agente OpenClaw.

Una vez que el agente se ejecuta sin supervisión, hay dos ajustes del servidor que son importantes. OLLAMA_KEEP_ALIVE controla cuánto tiempo permanece un modelo en memoria después de la última solicitud. El valor predeterminado lo descarga después de cinco minutos, por lo que la siguiente llamada vuelve a pagar todo el tiempo de carga. En un archivo de 25 GB sin GPU, esa pausa puede ser suficiente para provocar un timeout. Establezca OLLAMA_KEEP_ALIVE=-1 para mantenerlo residente. OLLAMA_HOST=0.0.0.0:11434 permite acceder a la API desde otros equipos y no proporciona ningún tipo de autenticación, así que expóngala sólo detrás de una regla de firewall o en una red privada.

Modos de fallo y mensajes que aparecerán

La descarga falla inmediatamente. Error: pull model manifest: file does not exist significa que esa etiqueta no existe. Los nombres de las etiquetas son cadenas exactas. Copie una de la página de la biblioteca en lugar de adivinar un sufijo de cuantización.

El modelo no carga. Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) significa que la etiqueta es demasiado grande para este plan con la configuración actual. Cambie a una cuantización menor o reduzca OLLAMA_CONTEXT_LENGTH, porque la caché KV se incluye en ese requisito.

Nada responde en el puerto 11434. curl: (7) Failed to connect to localhost port 11434 significa que el servicio no está en ejecución o no está escuchando donde espera. Lea systemctl status ollama y journalctl -u ollama -n 50. Si también inició ollama serve manualmente, la segunda instancia termina con Error: listen tcp 127.0.0.1:11434: bind: address already in use.

Responde, pero muy lentamente. Compruebe ollama ps antes de cambiar nada. Cualquier porcentaje de CPU en la columna PROCESSOR de una máquina con GPU significa que parte del modelo salió de la VRAM. Reduzca el contexto o use una cuantización menor. En una máquina sin GPU, la lentitud es el comportamiento esperado y ningún ajuste la corrige.

El agente olvida sus instrucciones a mitad de una tarea. La conversación superó la ventana de contexto y los tokens más antiguos se descartaron de forma silenciosa. Aumente OLLAMA_CONTEXT_LENGTH y confirme con ollama ps que el modelo todavía cabe. Si ya no cabe, la solución es una máquina más grande, no una ventana más pequeña.

Dónde se sitúa este modelo frente a las alternativas

Alojar un MoE de 30B es costoso para una tarea pequeña. Si un modelo denso de 8B ya resuelve la tarea, será mucho más barato de ejecutar y se cargará en segundos. Qwen 3 de 8B y 27B en un VPS ofrece la comparación directa necesaria para tomar esa decisión. Para obtener una visión más amplia de lo que puede alojar realmente un plan determinado, consulte primero qué modelos de IA puede autoalojar. Si tiene previsto servir varios agentes a la vez en lugar de uno, lea primero Ollama frente a vLLM, porque Ollama no agrupa las solicitudes simultáneas como lo hace un servidor de inferencia para producción. Ese es el punto en el que una configuración para un solo usuario deja de escalar.

FAQ

¿Qué etiqueta de Nemotron 3.5 Lightning debo descargar en un VPS Linux?

Use nemotron-3.5-lightning:30b-a3b-q4_K_M. Ocupa 25 GB, incluye el contexto máximo completo de 1M y corresponde al mismo digest al que apuntan las etiquetas latest, 30b y 30b-a3b a fecha de agosto de 2026. Especifique ese nombre en lugar de descargar latest, para que una futura republicación de ese puntero no cambie el comportamiento de su agente sin que lo advierta. Las etiquetas mlx son compilaciones para Apple silicon y no le servirán en Linux.

¿Cuánta RAM necesita Nemotron 3.5 Lightning?

NVIDIA no publica una cifra mínima de memoria para las compilaciones de Ollama, así que mídala en lugar de estimarla. Descargue la etiqueta, ejecute el modelo una vez y lea ollama ps mientras esté cargado: muestra el tamaño ocupado realmente e indica si se ejecutó en la GPU o en la CPU. El tamaño de la descarga, 25 GB para la etiqueta predeterminada, es el mínimo, porque la caché KV se añade aparte y crece con la ventana de contexto configurada. Si el plan tiene poca memoria, Ollama rechaza la ejecución con model requires more system memory e indica ambas cifras.

¿Puedo ejecutar Nemotron 3.5 Lightning en un VPS sin GPU?

Sí, si el plan tiene suficiente RAM para contener los pesos. El diseño MoE ayuda porque sólo se calculan aproximadamente 3 de los 30 mil millones de parámetros por token. El problema es la velocidad. Sin GPU, el modelo está limitado por el ancho de banda de memoria, por lo que añadir vCPU apenas mejora el resultado. Ejecute ollama run --verbose con un prompt fijo, lea la línea eval rate y compare esa cifra con el plazo de respuesta de su agente. Para un trabajo por lotes durante la noche suele ser suficiente. Para cualquier tarea en la que una persona espere la respuesta, normalmente no lo es.

¿Por qué Ollama no me proporciona la ventana de contexto completa de 1M?

1M es el máximo del modelo, no el valor predeterminado de Ollama. Ollama aplica una ventana mucho menor y descarta los tokens más antiguos cuando una conversación la supera, sin mostrar ningún error. Esto puede parecer que el agente ha olvidado sus propias instrucciones. Establezca OLLAMA_CONTEXT_LENGTH en el servicio de systemd o pase num_ctx en cada solicitud. Auméntelo gradualmente y vuelva a comprobar ollama ps cada vez, porque la memoria de la caché KV escala con la ventana y puede hacer que algunas capas del modelo salgan de la GPU.

¿Se puede usar Nemotron 3.5 Lightning con fines comerciales sin coste?

La tarjeta del modelo de NVIDIA sitúa el modelo bajo la licencia OpenMDW-1.1 y lo marca como preparado para uso comercial. Esto cubre los pesos que descarga y ejecuta por su cuenta. No se aplica al resto del software de su pila. Compruebe por separado las licencias del arnés del agente y de las herramientas que conecte a él. Lea también la tarjeta del modelo vigente antes de basarse en esto para cualquier asunto contractual.