Ejecutar Meta Muse Glimmer 30B en un VPS Linux
Aprende a dimensionar tu VPS para el modelo Muse Glimmer 30B. Analizamos los requisitos de RAM y disco según la etiqueta de Ollama y el rendimiento esperado en CPU sin GPU.
Requisitos de Muse Glimmer en un VPS
Muse Glimmer funciona en un VPS Linux estándar sin GPU, y la etiqueta que descargue determinará si cabe en la memoria. Meta Superintelligence Labs publicó el modelo el 10 de agosto de 2026 bajo la licencia Apache 2.0: 30 mil millones de parámetros, una ventana de contexto de 128K y un codificador de percepción dedicado de 1.8B parámetros para procesar imágenes junto con texto. Meta lo orienta a agentes locales siempre activos en lugar de a chats, con una capacidad de razonamiento que se ajusta por cada petición.
Las etiquetas de Ollama publicadas, consultadas el 16 de agosto de 2026, oscilan entre 17 GB y 59 GB. Ese rango constituye todo el problema de dimensionamiento. La etiqueta predeterminada se lista en aproximadamente 18 GB, por lo que el servidor más pequeño razonable debe tener claramente más de 18 GB de RAM libre. El espacio en disco para la descarga y la memoria para la ventana de contexto se suman a esa cifra.
¿Qué etiqueta de muse-glimmer debería descargar?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama enumera 11 etiquetas para este modelo que no son compilaciones para Apple. Contienen los mismos 30 mil millones de pesos almacenados con diferentes precisiones numéricas. El tamaño que ve es lo que descarga y también es, aproximadamente, lo que debe mantener en memoria antes de añadir cualquier contexto.
Las dos compilaciones de 4 bits son las más pequeñas: 30b-nvfp4 con 17 GB y 30b-q4_K_M con 18 GB. La etiqueta predeterminada 30b aparece con el mismo tamaño que la compilación q4_K_M. Las compilaciones de 8 bits, 30b-q8_0 y 30b-mxfp8, se sitúan cerca de los 31 GB. 30b-bf16 es la versión de 16 bits sin cuantizar con 57 GB, lo cual supone más memoria RAM de la que ofrecen la mayoría de los servidores alquilados a un precio razonable para un proyecto personal.
Las etiquetas -dflash son las mismas compilaciones con soporte para DFlash, y cada una aparece con un tamaño mayor que su equivalente estándar. Ollama describe DFlash como una función de velocidad y la demuestra en Apple Silicon y en GPU de escritorio. En un VPS que solo utiliza CPU, estaría pagando ese tamaño extra en memoria real por una función medida en otro hardware, así que comience con la etiqueta estándar y cambie una sola cosa a la vez.
Empiece con 4 bits a menos que tenga una razón específica para no hacerlo. Pasar de 4 bits a 8 bits duplica aproximadamente los bytes que la CPU debe leer por cada token generado, por lo que el rendimiento disminuye mientras el uso de memoria aumenta. Ese equilibrio es el tema de lo que realmente cuestan la cuantización q4, q8 y fp16, y en un servidor basado en CPU, la respuesta corta es que la compilación de 4 bits es la única por la que vale la pena empezar.
Por qué las etiquetas MLX no funcionan en un servidor Linux
MLX es el framework de matrices de Apple, y el motor MLX de Ollama es su backend para Apple Silicon. Cualquier etiqueta con mlx en el nombre está compilada para ese motor y ese hardware. En un VPS Linux x86, se trata de decenas de gigabytes de descarga que no puede ejecutar, y que ocuparán espacio en su disco sin realizar ninguna función. Las cifras de velocidad del anuncio, medidas en un Mac, corresponden a esas etiquetas, por lo que tampoco describen el rendimiento de su servidor. Cuando consulte la lista de etiquetas en la página del modelo, filtre primero cualquier nombre con mlx y, a continuación, seleccione el tamaño entre las opciones restantes.
¿Cuánta RAM y disco necesita realmente?
Dos elementos consumen memoria, y solo uno de ellos es el tamaño del tag. Los pesos son fijos según el tag que descargue. La caché KV, el estado por token que el modelo mantiene para la conversación, crece con la longitud de contexto que configure. La propia documentación de Ollama señala que servir peticiones en paralelo multiplica el contexto por el número de peticiones en curso, por lo que un servidor que responde a dos agentes a la vez necesita más memoria que el mismo servidor respondiendo a uno solo.
No tome una cifra de RAM de ninguna guía, incluida esta. Descargue el tag, envíele un prompt y, mientras el modelo siga residente en memoria, ejecute estos dos comandos.
ollama ps
free -hollama ps muestra qué hay cargado en este momento y cómo se reparte el trabajo entre CPU y GPU. free -h muestra lo que queda disponible. Esos dos resultados en su propio servidor superan a cualquier tabla publicada, porque ya incluyen su configuración de contexto, su cuantización y todo lo demás que el servidor esté ejecutando.
El disco es la parte sencilla. Ollama almacena los modelos en /usr/share/ollama/.ollama/models en Linux, que se encuentra en el sistema de archivos raíz en la mayoría de las imágenes de VPS. Un volumen raíz de 40GB no albergará la compilación bf16 de 57 GB, y tampoco podrá contener dos tags de 8-bit simultáneamente. Mueva el almacenamiento a un volumen montado antes de descargar nada.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaEl usuario ollama debe ser el propietario de ese directorio, porque el servicio se ejecuta como ollama y escribe sus blobs allí con ese mismo usuario. Si una descarga falla por permisos, journalctl -u ollama -n 50 es donde aparece el motivo.
La swap requiere una afirmación clara: la swap no le permite ejecutar un tag más grande. La generación accede a los pesos por cada token que produce, por lo que los pesos que residen en la swap se leen del disco una y otra vez; vmstat 1 muestra las columnas si y so ocupadas, y la salida se ralentiza a segundos por token. Mantenga un archivo de swap pequeño como seguro contra el killer de falta de memoria (OOM). Ajuste la RAM al tamaño del tag que realmente desea utilizar.
Instalar Ollama y fijar una etiqueta específica
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaEl script de instalación configura un servicio de systemd, por lo que el servidor se reinicia automáticamente tras un reinicio del sistema. Si prefiere no ejecutarlo como un servicio gestionado por root, ejecutar Ollama sin privilegios de root bajo Podman cubre esa alternativa. A continuación, descargue una etiqueta explícita.
ollama pull muse-glimmer:30b
ollama listConsulte usted mismo la columna de tamaño en ollama list y compárela con la lista de etiquetas actual en la página del modelo. Las etiquetas publicadas se añaden, renombran y eliminan, y el tamaño indicado en una guía es solo una instantánea de un día concreto.
Nunca escriba ollama pull muse-glimmer en un servidor del que dependa. Un nombre de modelo sin especificar se resuelve en la etiqueta latest, y latest es un puntero que el editor puede mover a una compilación diferente. Una descarga rutinaria sustituiría entonces el modelo bajo su agente, con diferentes necesidades de memoria y un comportamiento distinto, sin que sus registros anuncien nada al respecto. Escriba la etiqueta en sus scripts, en sus archivos de unidad y en la configuración de su agente. Alojamiento propio de un LLM con Ollama en un VPS cubre el resto de la configuración del servidor.
¿Se puede ejecutar Muse Glimmer sin una GPU?
Sí, y es necesario ser directo sobre el límite de rendimiento. Generar un token implica leer los pesos del modelo desde la memoria, por lo que la velocidad está determinada por el ancho de banda de la memoria y no por la cantidad de vCPU que ofrezca el plan. Superado un pequeño número de núcleos, añadir más aporta muy poco. En un VPS compartido, ese ancho de banda se comparte con el resto de los inquilinos del host, por lo que un modelo de 30B en 4-bit producirá un número reducido de tokens por segundo.
No acepte las cifras de nadie, incluidas las mías. Mida los tokens por segundo en su propio equipo y decida según lo que observe.
El resultado es una diferencia clara en cuanto a la utilidad del modelo. El chat interactivo es tedioso, ya que usted lee más rápido de lo que el servidor escribe y cada respuesta comienza con una pausa prolongada. El trabajo de agente en segundo plano funciona bien, ya que a una tarea que se ejecuta sin supervisión durante diez minutos no le importa la lentitud. Esa segunda carga de trabajo es exactamente la que Meta describe para este modelo.
Si necesita velocidad interactiva, las dos respuestas honestas son una GPU o una API alojada. Calcule el punto de equilibrio entre un VPS con GPU y los tokens de API antes de alquilar nada, y lo que realmente le ofrece un VPS con GPU describe lo que está adquiriendo. Para la cuestión más amplia de qué modelos puede albergar un equipo determinado, comience por qué modelos puede alojar usted mismo, y ejecutar un modelo Qwen de tamaño similar en un VPS es la comparación más cercana en esta categoría de tamaño.
¿Por qué olvida información mucho antes de alcanzar los 128K tokens?
Porque la ventana de contexto predeterminada de Ollama es de 4096 tokens, independientemente de lo que soporte el modelo. Ese valor predeterminado figura en el FAQ de Ollama a fecha de agosto de 2026. La etiqueta anuncia 128K, pero el servidor entrega al modelo 4096 tokens a menos que se indique lo contrario; por ello, una transcripción larga de un agente pierde sus turnos iniciales y el modelo parece sufrir amnesia.
Auméntelo en el servidor para cada petición:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Dentro de una sesión interactiva, /set parameter num_ctx 32768 lo cambia solo para esa sesión. A través de la API, envíe num_ctx en las opciones de la petición.
Cada token adicional de contexto consume memoria además de la requerida por los pesos del modelo. Si solicita los 128K completos en un equipo dimensionado solo para los pesos, la carga fallará o el rendimiento se degradará a un nivel más lento. Auméntelo gradualmente y ejecute ollama ps después de cada incremento. Cómo funcionan num_ctx y la longitud de contexto en Ollama detalla los cálculos necesarios.
Niveles de capacidad de razonamiento: low, medium, high y xhigh
Meta documenta cuatro niveles de capacidad de razonamiento para Muse Glimmer, desde low hasta xhigh, y recomienda los dos niveles superiores para tareas complejas de programación y agentes. En Ollama, esto se gestiona mediante el parámetro think. Utilice --think= en la línea de comandos o envíe think en el cuerpo de la API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Dentro de una sesión interactiva, /set think y /set nothink permiten alternar esta configuración. La documentación de Ollama indica que la mayoría de los modelos aceptan un valor booleano o un nivel como low, medium o high, y que algunos aceptan max para el nivel más alto disponible. Las cadenas exactas que acepta este modelo se encuentran en su página específica; consúltela en lugar de adivinar y realice una prueba manual antes de integrarlo en un agente.
En un equipo que solo utiliza CPU, este parámetro tiene un impacto significativo. Un nivel de razonamiento más alto implica que se generan más tokens de pensamiento antes de que aparezca la primera palabra de la respuesta, y un token de pensamiento consume el mismo tiempo de procesamiento que un token de respuesta. Mantenga el nivel low para tareas rutinarias.
Mantener el modelo cargado para un agente siempre activo
Ollama descarga un modelo inactivo después de cinco minutos de forma predeterminada. Para un agente que se ejecuta cada diez minutos, esto implica cargar 18 GB desde el disco en cada ejecución, y en un VPS con almacenamiento conectado por red, esa carga no es rápida. Manténgalo fijado en la memoria en su lugar.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Un valor negativo mantiene el modelo residente hasta que algo lo descargue, y keep_alive en una petición API sobrescribe el valor predeterminado del servidor para esa llamada específica. El coste es claro: la RAM permanece ocupada mientras no ocurre nada, por lo que este ajuste es para un equipo dedicado al agente. Mantener un modelo de Ollama cargado cubre las variaciones.
Apuntar un agente de programación al servicio
Ollama ofrece una API compatible con OpenAI en http://127.0.0.1:11434/v1, por lo que la mayoría de las herramientas de agentes se conectan utilizando una URL base y cualquier clave API que no esté vacía. La página Muse Glimmer de Ollama también documenta un acceso directo de ejecución que conecta un agente compatible con un modelo local en un solo comando; asegúrese de fijar la etiqueta (tag) correspondiente en dicho comando.
ollama launch claude --model muse-glimmer:30bLos agentes envían prompts de gran tamaño. El contenido de los archivos, la salida de las herramientas y el historial de la conversación se procesan como tokens de entrada; en un servidor basado en CPU, el procesamiento del prompt es la fase que más penaliza el rendimiento antes de que comience la generación. Mantenga el contexto tan reducido como lo permita la tarea. Apuntar un agente de programación a Ollama cubre la configuración del cliente, ejecutar un agente de programación en un VPS trata sobre el servidor donde reside, y controlar los costes de los agentes en un VPS explica lo que sucede cuando el agente se ejecuta durante todo el día.
La entrada de imágenes funciona de la misma manera. La API de Ollama acepta imágenes en el campo images de un mensaje, por lo que un cliente que solo admita texto nunca enviará una, independientemente de la capacidad del codificador de percepción del modelo.
No abra el puerto 11434
La API de Ollama no dispone de autenticación. Configurar OLLAMA_HOST=0.0.0.0:11434 para acceder desde su equipo portátil expone un ejecutor de modelos sin autenticar a la red pública. Cualquier usuario que lo encuentre podrá cargar modelos en su disco y leer todo lo que su agente envíe a través de él. Mantenga el servicio vinculado a localhost y utilice un túnel en su lugar.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsAsegurar el endpoint de la API de Ollama cubre las opciones adecuadas, incluido un reverse proxy que solicita credenciales.
Qué falla y qué verá
La descarga se detiene a mitad de camino. Disco. Ejecute df -h en el directorio del modelo. Una compilación bf16 de 57 GB no cabe en un volumen raíz de 40GB, y tampoco dos etiquetas de 8 bits juntas.
El modelo se carga y luego el proceso muere. Falta de memoria. dmesg -T registra al "out of memory killer" del kernel seleccionando un proceso, y journalctl -u ollama -n 100 muestra el lado del servicio del mismo evento. La solución es una etiqueta más pequeña o un num_ctx más pequeño. No es añadir más swap.
Se ejecuta a segundos por token. Ejecute vmstat 1 y observe las columnas si y so. Una actividad constante de swap significa que los pesos no caben en la RAM y el equipo los está leyendo del disco mientras trabaja.
Una etiqueta que funcionaba la semana pasada ha desaparecido. Las listas de etiquetas cambian. Vuelva a leer la página del modelo, fije la versión actual y anote el nombre de la etiqueta en un lugar donde pueda consultarlo de nuevo.
Vuelva a comprobar los tamaños usted mismo antes de descargar
Los tamaños de la tabla se obtuvieron de la página de etiquetas del modelo el 16 de agosto de 2026, y una lista de etiquetas publicada no es una garantía. Lea la lista actual en la página del modelo y luego confirme lo que realmente se ha guardado en su disco:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama almacena las capas del modelo como blobs compartidos, por lo que dos etiquetas que comparten una capa no ocupan el doble de espacio en disco. Compare lo que informa du con el tamaño publicado y planifique su espacio en disco basándose en el mayor de los dos.
FAQ
¿Cuánta memoria RAM necesita Muse Glimmer en un VPS?
Parta del tamaño de la etiqueta (tag) y añada la ventana de contexto. La etiqueta predeterminada se lista con aproximadamente 18 GB a fecha de 16 de agosto de 2026, por lo que un servidor de 16GB no puede alojarla en absoluto y uno de 24GB la aloja con poco margen para el contexto. Considere esto como un punto de partida, no como una respuesta definitiva. Descargue la etiqueta, cárguela una vez, ejecute ollama ps y free -h en su propio servidor y lea sus propios valores. Un contexto más largo y las peticiones paralelas añaden consumo de memoria además del peso del modelo.
¿Puedo ejecutar Muse Glimmer sin una GPU?
Sí. Se carga y responde en un VPS que solo usa CPU. La velocidad de generación está limitada por el ancho de banda de la memoria más que por el número de núcleos; en un host compartido, ese ancho de banda es compartido, así que espere un número bajo de tokens por segundo a 4-bit. Esto es utilizable para tareas de agentes en segundo plano que se ejecutan sin supervisión, pero resulta lento para un chat interactivo. Ejecute ollama ps durante una petición y lea la columna del procesador para confirmar dónde se está realizando el trabajo.
¿Son útiles las etiquetas MLX en un VPS Linux?
No. Cada etiqueta con mlx en el nombre está compilada para el motor MLX de Ollama, que es su backend para Apple Silicon. En un servidor Linux x86, esas etiquetas son una descarga pesada que no podrá ejecutar. Utilice la etiqueta estándar 30b, o alguna de las otras etiquetas que no sean MLX, e ignore los benchmarks de hardware de Apple que acompañan a las compilaciones MLX.
¿Por qué el modelo olvida cosas mucho antes de llegar a los 128K tokens?
Porque la ventana de contexto predeterminada de Ollama es de 4096 tokens, independientemente de lo que soporte el modelo, por lo que el servidor trunca las conversaciones largas antes de que el modelo las vea. Configure OLLAMA_CONTEXT_LENGTH en el servidor, o /set parameter num_ctx para una sesión, o envíe num_ctx en las opciones de la petición API. El uso de memoria aumenta con esto, así que increméntelo gradualmente y compruebe ollama ps cada vez.
¿Debo fijar la etiqueta o simplemente usar latest?
Fíjela. muse-glimmer sin etiqueta se resuelve como latest, que es un puntero que el editor puede mover a una compilación diferente en cualquier momento; por lo tanto, una actualización rutinaria puede cambiar el modelo que ejecuta su agente. Escriba muse-glimmer:30b en scripts, archivos de unidad y configuraciones de agente. Consulte la lista de etiquetas en la página del modelo antes de fijarla, ya que las etiquetas publicadas cambian.