Ejecutar Meta Muse Glimmer 30B en un VPS
Las etiquetas de Muse Glimmer ocupan de 17 GB a 59 GB. Calcula la RAM y el disco para tu VPS Linux y conoce el coste de inferencia solo con CPU.
Requisitos de Muse Glimmer en un VPS
Muse Glimmer funciona en un VPS Linux convencional sin GPU. La etiqueta que descargue determina si cabe en la memoria. Meta Superintelligence Labs publicó el modelo el 10 de agosto de 2026 con licencia Apache 2.0: 30 billion parameters, una ventana de contexto de 128K y un encoder de percepción específico de 1.8B parameters para leer imágenes junto con texto. Meta lo orienta a agentes locales siempre activos, no al chat, con una capacidad de razonamiento que se establece en cada solicitud.
Las etiquetas publicadas de Ollama, consultadas el 16 de agosto de 2026, van de 17 GB a 59 GB. Ese rango determina todo el dimensionamiento. La etiqueta predeterminada figura con aproximadamente 18 GB, por lo que el VPS más pequeño razonable debe tener claramente más de 18 GB de RAM libre. El espacio en disco para la descarga y la memoria para la ventana de contexto se suman a ese requisito.
¿Qué etiqueta de muse-glimmer debe descargar?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama muestra 11 etiquetas para este modelo que no son compilaciones para Apple. Todas contienen los mismos 30 mil millones de pesos, almacenados con distintas precisiones numéricas. El tamaño mostrado es lo que debe descargar y también es, aproximadamente, la cantidad que debe mantener en memoria antes de añadir cualquier contexto.
Las dos compilaciones de 4 bits son las más pequeñas: 30b-nvfp4, con 17 GB, y 30b-q4_K_M, con 18 GB. La etiqueta predeterminada 30b aparece con el mismo tamaño que la compilación q4_K_M. Las compilaciones de 8 bits, 30b-q8_0 y 30b-mxfp8, ocupan cerca de 31 GB. 30b-bf16 es la versión sin cuantificar de 16 bits, con 57 GB. Es más memoria de la que ofrecen la mayoría de los servidores alquilados a un precio razonable para un proyecto secundario.
Las etiquetas -dflash corresponden a las mismas compilaciones con compatibilidad con DFlash y todas aparecen con un tamaño mayor que su equivalente normal. Ollama describe DFlash como una función de aceleración y la muestra en Apple Silicon y en GPU de escritorio. En un VPS que sólo usa CPU, pagaría ese tamaño adicional en memoria real por una función medida en otro tipo de hardware. Por eso, empiece con la etiqueta normal y cambie una sola variable cada vez.
Empiece con 4 bits salvo que tenga un motivo concreto para no hacerlo. Pasar de 4 bits a 8 bits duplica aproximadamente los bytes que la CPU debe leer para cada token que genera. Por tanto, el rendimiento disminuye mientras aumenta el uso de memoria. Ese equilibrio se explica en cuánto cuestan realmente las cuantificaciones q4, q8 y fp16, y en un servidor que sólo usa CPU la respuesta breve es que la compilación de 4 bits es la única con la que conviene empezar.
Por qué las etiquetas MLX no hacen nada en un servidor Linux
MLX es el framework de arrays de Apple, y el motor MLX de Ollama es su backend para Apple Silicon. Cualquier etiqueta cuyo nombre contenga mlx está compilada para ese motor y ese hardware. En una VPS Linux x86 son decenas de gigabytes de descarga que no puede ejecutar, y permanecerán en el disco sin hacer nada. Las cifras de velocidad del anuncio, medidas en un Mac, corresponden a esas etiquetas, por lo que tampoco describen su servidor. Cuando lea la lista de etiquetas en la página del modelo, descarte primero todos los nombres mlx y calcule el tamaño a partir de los restantes.
¿Cuánta RAM y espacio en disco necesita realmente?
Dos elementos consumen memoria, y sólo uno de ellos es el tamaño del tag. Los pesos son fijos para el tag que descargue. La caché KV, es decir, el estado por token que el modelo conserva para la conversación, aumenta con la longitud de contexto configurada. La documentación de Ollama indica que atender solicitudes en paralelo multiplica el contexto por el número de solicitudes en curso. Por tanto, un equipo que responde a dos agentes a la vez necesita más memoria que el mismo equipo cuando responde a uno.
No tome una cifra de RAM de ninguna guía, incluida esta. Descargue el tag, envíele un prompt y, mientras el modelo siga residente, ejecute estos dos comandos.
ollama ps
free -hollama ps muestra lo que está cargado en ese momento y cómo se distribuye el trabajo entre la CPU y la GPU. free -h muestra lo que queda disponible. Esos dos resultados en su propio equipo son más fiables que cualquier tabla publicada, porque ya incluyen la configuración de contexto, la cuantización y todo lo demás que esté ejecutando el servidor.
El disco es la parte más sencilla. Ollama almacena los modelos en /usr/share/ollama/.ollama/models en Linux, una ruta que se encuentra en el sistema de archivos raíz en la mayoría de las imágenes de VPS. Un volumen raíz de 40GB no podrá contener la compilación bf16 de 57 GB, ni tampoco dos tags de 8 bits uno junto al otro. Si nunca ha comprobado qué escribe realmente una operación de descarga, dónde almacena Ollama los modelos y cómo moverlos explica ese directorio. Mueva el almacén a un volumen montado antes de descargar nada.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaEl usuario ollama debe ser el propietario de ese directorio, porque el servicio se ejecuta como ollama y escribe allí sus blobs con esa identidad. Si una descarga falla por permisos, journalctl -u ollama -n 50 muestra el motivo.
Sobre la swap hace falta una afirmación clara: la swap no permite ejecutar un tag más grande. La generación accede a los pesos para cada token que produce. Por tanto, los pesos que están en la swap se leen repetidamente desde el disco, vmstat 1 muestra ocupadas las columnas si y so, y la salida se ralentiza hasta varios segundos por token. Mantenga un archivo de swap pequeño como protección frente al OOM killer. Dimensione la RAM para el tag que realmente quiera usar.
Instalar Ollama y fijar una etiqueta con nombre
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaEl script de instalación configura un servicio de systemd, por lo que el servidor vuelve a estar disponible después de reiniciar. Si prefiere no ejecutarlo como un servicio del sistema gestionado por root, ejecutar Ollama sin privilegios con Podman explica ese procedimiento. Después, descargue una etiqueta explícita.
ollama pull muse-glimmer:30b
ollama listLea usted mismo la columna de tamaño en ollama list y compárela con la lista actual de etiquetas en la página del modelo. Las etiquetas publicadas se añaden, cambian de nombre y se eliminan. El tamaño indicado en una guía representa una instantánea de un día concreto.
Nunca escriba ollama pull muse-glimmer en un servidor del que dependa. Un nombre de modelo sin etiqueta se resuelve en la etiqueta latest, y latest es un puntero que el editor puede mover a otra compilación. Una descarga rutinaria puede sustituir el modelo que usa su agente, con necesidades de memoria y comportamiento diferentes, sin que ningún registro lo indique. Especifique la etiqueta en sus scripts, archivos de unidad y configuración del agente. Alojar un LLM en su propio servidor con Ollama en un VPS explica el resto de la configuración del servidor.
¿Puedes ejecutar Muse Glimmer sin GPU?
Sí, pero conviene ser claro sobre el límite. Generar un token implica leer los pesos del modelo desde la memoria, por lo que la velocidad depende del ancho de banda de memoria y no del número de vCPU que anuncia el plan. Después de unos pocos núcleos, añadir más aporta muy poco. En un VPS compartido, ese ancho de banda se comparte con todos los demás clientes del host, por lo que un modelo de 30B en 4 bits genera pocos tokens por segundo.
No aceptes como válida la cifra de nadie, incluida la mía. Mide los tokens por segundo en tu propio equipo y decide según los resultados.
El resultado es una diferencia clara en las tareas para las que el modelo resulta útil. El chat interactivo es incómodo, porque lees más rápido de lo que el servidor escribe y cada respuesta empieza con una pausa larga. El trabajo de agentes en segundo plano funciona bien, porque una tarea que se ejecuta sin supervisión durante diez minutos no depende de que sea rápida. Esa segunda carga de trabajo es exactamente la que Meta describe para este modelo.
Si necesitas velocidad interactiva, las dos respuestas honestas son una GPU o una API alojada. Calcula el punto de equilibrio entre un VPS con GPU y los tokens de una API antes de alquilar nada, y qué ofrece realmente un VPS con GPU explica qué estás comprando. Para la cuestión más general de qué puede ejecutar un equipo concreto, empieza por qué modelos puedes alojar por tu cuenta, y ejecutar un modelo Qwen de tamaño similar en un VPS es la comparación más cercana dentro de esta clase de tamaño. Si las cifras que mides resultan demasiado lentas para utilizarlas, Nemotron 3.5 Lightning en un VPS plantea las mismas preguntas sobre RAM y tokens por segundo para un modelo diseñado para priorizar la velocidad sobre el tamaño.
¿Por qué olvida cosas mucho antes de alcanzar 128K tokens?
El contexto predeterminado de Ollama es de 4096 tokens, independientemente de lo que admita el modelo. Ese valor aparece en las propias FAQ de Ollama en agosto de 2026. La etiqueta anuncia 128K, pero el servidor entrega al modelo 4096 tokens hasta que se indique lo contrario. Por eso, una transcripción extensa de un agente pierde los primeros turnos y el modelo parece tener amnesia.
Auméntelo en el servidor para todas las solicitudes:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Dentro de una sesión interactiva, /set parameter num_ctx 32768 cambia este valor sólo para esa sesión. Mediante la API, envíe num_ctx en las opciones de la solicitud.
Cada token de contexto adicional consume memoria además de la que necesitan los pesos. Si solicita los 128K completos en un equipo dimensionado sólo para los pesos, la carga fallará o se ejecutará con una configuración más lenta. Auméntelo por pasos y ejecute ollama ps después de cada paso. Cómo funcionan num_ctx y la longitud de contexto en Ollama explica los cálculos.
Intensidad del razonamiento: baja, media, alta y xhigh
Meta documenta cuatro niveles de razonamiento para Muse Glimmer, desde low hasta xhigh, y recomienda los dos niveles superiores para tareas complejas de programación y de agentes. En Ollama, esto se controla mediante el parámetro think. Use --think= en la línea de comandos o envíe think en el cuerpo de la API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"En una sesión interactiva, /set think y /set nothink permiten cambiar este ajuste. La documentación de Ollama indica que la mayoría de los modelos aceptan un valor booleano o un nivel como low, medium o high, y que algunos aceptan max para seleccionar el nivel máximo disponible. Las cadenas exactas que acepta este modelo se indican en su página del modelo. Consulte esa página en lugar de adivinar y pruebe una opción manualmente antes de integrarla en un agente.
En un equipo que sólo usa CPU, este ajuste tiene un impacto notable. Una intensidad mayor genera más tokens de razonamiento antes de mostrar la primera palabra de la respuesta, y un token de razonamiento consume el mismo tiempo de reloj que un token de respuesta. Mantenga el nivel low para las tareas habituales. La longitud de la respuesta también requiere control. Por eso, limite la respuesta con num_predict en lugar de permitir que una respuesta demasiado extensa ocupe un equipo lento durante varios minutos.
Mantener el modelo cargado para un agente siempre activo
De forma predeterminada, Ollama descarga un modelo inactivo después de cinco minutos. Para un agente que se ejecuta cada diez minutos, esto implica cargar desde el disco 18 GB completos en cada ejecución. En un VPS con almacenamiento conectado por red, esta carga no es rápida. Mantenga el modelo en memoria.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Un valor negativo mantiene el modelo residente hasta que algo lo descargue, y keep_alive en una solicitud de API anula el valor predeterminado del servidor para esa llamada. El coste es directo: la RAM permanece ocupada mientras no ocurre nada. Por tanto, esta configuración es adecuada para un equipo dedicado al agente. Mantener un modelo de Ollama cargado explica las variantes.
Diríjalo a un agente de programación
Ollama ofrece una API compatible con OpenAI en http://127.0.0.1:11434/v1, por lo que la mayoría de las herramientas de agentes se conectan con una URL base y cualquier clave de API no vacía. La página de Muse Glimmer de Ollama también documenta un acceso directo de inicio que conecta un agente compatible con un modelo local mediante un solo comando. También debe fijar allí la etiqueta.
ollama launch claude --model muse-glimmer:30bLos agentes envían prompts grandes. El contenido de los archivos, la salida de las herramientas y una transcripción que crece llegan como tokens de entrada. En un equipo con CPU, el procesamiento del prompt es la parte que más carga genera antes de que siquiera comience la generación. Mantenga la configuración de contexto tan pequeña como permita la tarea. Conectar un agente de programación con Ollama cubre el lado del cliente, ejecutar un agente de programación en un VPS cubre el equipo donde se ejecuta y controlar los costes de un agente en un VPS cubre lo que ocurre cuando funciona durante todo el día.
La entrada de imágenes funciona de la misma forma. La API de Ollama acepta imágenes en el campo images de un mensaje. Por tanto, un cliente que sólo admita texto nunca enviará una imagen, por muy capaz que sea el codificador de percepción.
No abra el puerto 11434
La API de Ollama no tiene autenticación. Configurar OLLAMA_HOST=0.0.0.0:11434 para acceder a ella desde su portátil expone un ejecutor de modelos sin autenticación en Internet pública. Cualquiera que lo encuentre puede cargar modelos en su disco y leer todo lo que su agente le envíe. Déjelo enlazado a localhost y use un túnel.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsProtección del endpoint de la API de Ollama cubre las opciones adecuadas, incluido un reverse proxy que solicite credenciales.
Qué falla y qué verá
La descarga se detiene a mitad de camino. Es un problema de disco. Ejecute df -h contra el directorio del modelo. Una compilación bf16 de 57 GB no cabe en un volumen raíz de 40GB. Tampoco caben dos tags de 8 bits una junto a otra.
El modelo se carga y después el proceso termina. Es falta de memoria. dmesg -T registra el proceso que el kernel selecciona mediante el asesino de procesos por falta de memoria, y journalctl -u ollama -n 100 muestra el mismo evento desde el servicio. La solución es usar un tag más pequeño o un num_ctx más pequeño. Añadir más swap no lo soluciona.
Se ejecuta a segundos por token. Ejecute vmstat 1 y observe las columnas si y so. La actividad de swap sostenida indica que los pesos no caben en la RAM y que el sistema los lee de nuevo desde el disco mientras trabaja.
Un tag que funcionaba la semana pasada ya no está. Las listas de tags cambian. Vuelva a consultar la página del modelo, fije la versión que esté disponible y registre el nombre del tag en un lugar que pueda volver a consultar.
Vuelva a comprobar los tamaños antes de descargar
Los tamaños de la tabla se obtuvieron de la página de tags del modelo el 16 August 2026. Una lista de tags publicada no constituye una garantía. Lea la lista actual en la página del modelo y confirme qué se ha almacenado realmente en el disco:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama almacena las capas del modelo como blobs compartidos. Por tanto, dos tags que comparten una capa no ocupan el doble de disco. Compare lo que indica du con el tamaño publicado y planifique el espacio de disco tomando como referencia el mayor de los dos valores.
FAQ
¿Cuánta RAM necesita Muse Glimmer en un VPS?
Parta del tamaño de la etiqueta y añada la ventana de contexto. La etiqueta predeterminada ocupa aproximadamente 18 GB según la información del 16 August 2026, por lo que un equipo de 16GB no puede alojarla y uno de 24GB la aloja con poco espacio restante para el contexto. Considere esto un punto de partida, no una respuesta definitiva. Descargue la etiqueta, cárguela una vez y ejecute ollama ps y free -h en su propio equipo para consultar sus valores. Un contexto más largo y las solicitudes paralelas añaden memoria a la que ocupan los pesos.
¿Puedo ejecutar Muse Glimmer sin GPU?
Sí. Se carga y responde únicamente con CPU en un VPS. La velocidad de generación está limitada por el ancho de banda de memoria, no por el número de núcleos. En un host compartido, ese ancho de banda se comparte, por lo que debe esperar pocos tokens por segundo con 4-bit. Es utilizable para tareas de agentes en segundo plano que se ejecutan sin supervisión, pero resulta lento para el chat interactivo. Ejecute ollama ps durante una solicitud y consulte la columna del procesador para confirmar dónde se ejecuta el trabajo.
¿Sirven de algo las etiquetas MLX en un VPS Linux?
No. Todas las etiquetas cuyo nombre contiene mlx están compiladas para el motor MLX de Ollama, que es su backend para Apple Silicon. En un servidor Linux x86, esas etiquetas ocupan mucho espacio y no se pueden ejecutar. Use la etiqueta 30b sin más, u otra etiqueta que no sea MLX, e ignore las pruebas de rendimiento en hardware Apple asociadas a las compilaciones MLX.
¿Por qué el modelo olvida cosas mucho antes de 128K tokens?
Porque la ventana de contexto predeterminada de Ollama es de 4096 tokens, independientemente de lo que admita el modelo. Por eso, el servidor trunca las conversaciones largas antes de que el modelo llegue a verlas. Establezca OLLAMA_CONTEXT_LENGTH en el servidor, /set parameter num_ctx para una sesión o envíe num_ctx en las opciones de la solicitud de API. El uso de memoria aumenta con este valor, así que increméntelo por pasos y compruebe ollama ps cada vez.
¿Debo fijar la etiqueta o usar latest?
Fíjela. muse-glimmer sin etiqueta se resuelve en latest. Es un puntero que el editor puede mover a otra compilación en cualquier momento, por lo que una operación rutinaria de pull puede cambiar el modelo que ejecuta su agente. Escriba muse-glimmer:30b en los scripts, los archivos de unidad y la configuración del agente. Consulte la lista de etiquetas en la página del modelo antes de fijarla, porque las etiquetas publicadas cambian.