Muse Glimmer 30B em VPS: RAM, disco e CPU
As tags do Muse Glimmer ocupam de 17 GB a 59 GB. Veja quanta RAM e disco uma VPS Linux precisa e o custo da inferência só com CPU.
O que o Muse Glimmer precisa numa VPS
O Muse Glimmer funciona numa VPS Linux comum, sem GPU, e a tag que descarregar determina se cabe na memória. A Meta Superintelligence Labs publicou o modelo em 10 August 2026 sob a licença Apache 2.0: 30 billion parameters, uma janela de contexto de 128K e um encoder de perceção dedicado com 1.8B parameters, para poder ler imagens juntamente com texto. A Meta posiciona-o para agentes locais sempre ativos, e não para chat, com uma capacidade de raciocínio definida por pedido.
As tags publicadas do Ollama, consultadas em 16 August 2026, vão de 17 GB a 59 GB. Esse intervalo representa todo o problema de dimensionamento. A tag predefinida aparece listada com cerca de 18 GB, pelo que a máquina mais pequena viável precisa claramente de mais de 18 GB de RAM livre. O espaço em disco para a transferência e a memória para a janela de contexto são necessários além disso.
Qual tag muse-glimmer deve transferir?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama listou 11 tags para este modelo que não são builds para Apple. Todas contêm os mesmos 30 bilhões de pesos, armazenados com diferentes precisões numéricas. O tamanho apresentado é o que será transferido e também corresponde aproximadamente à memória que precisa de estar disponível antes de adicionar qualquer contexto.
As duas builds de 4 bits são as menores: 30b-nvfp4, com 17 GB, e 30b-q4_K_M, com 18 GB. A tag padrão 30b aparece com o mesmo tamanho da build q4_K_M. As builds de 8 bits, 30b-q8_0 e 30b-mxfp8, têm cerca de 31 GB. 30b-bf16 é a release não quantizada de 16 bits, com 57 GB. Esse valor excede a RAM disponibilizada pela maioria dos servidores alugados a um preço razoável para um projeto paralelo.
As tags -dflash correspondem às mesmas builds com suporte a DFlash, e cada uma aparece com um tamanho superior ao da respetiva versão normal. O Ollama descreve DFlash como um recurso de velocidade e demonstra-o em Apple Silicon e em GPUs de desktop. Numa VPS apenas com CPU, esse tamanho adicional será consumido por memória real para um recurso medido noutro hardware. Por isso, comece pela tag normal e altere uma coisa de cada vez.
Comece com 4 bits, exceto se tiver uma razão específica para não o fazer. Passar de 4 bits para 8 bits duplica aproximadamente os bytes que a CPU tem de ler para cada token gerado. O throughput diminui e o uso de memória aumenta. Esse compromisso é explicado em quanto custam realmente as quantizações q4, q8 e fp16, e, numa máquina com CPU, a resposta curta é que a build de 4 bits é a única pela qual vale a pena começar.
Por que as tags MLX não fazem nada em um servidor Linux
MLX é o framework de arrays da Apple, e o mecanismo MLX do Ollama é o seu backend para Apple Silicon. Qualquer tag com mlx no nome foi criada para esse mecanismo e para esse hardware. Num VPS Linux x86, trata-se de dezenas de gigabytes de download que não pode executar e que ficará no disco sem fazer nada. Os valores de velocidade do anúncio, medidos num Mac, referem-se a essas tags e também não descrevem o seu servidor. Ao consultar a lista de tags na página do modelo, filtre primeiro todos os nomes mlx e só depois dimensione os recursos com base no que restar.
Quanto de RAM e disco são realmente necessários?
Duas coisas consomem memória, e apenas uma delas é o tamanho da tag. Os pesos são definidos pela tag que você baixa. O cache KV, que contém o estado por token mantido pelo modelo para a conversa, cresce conforme o tamanho de contexto configurado. A documentação do Ollama observa que o atendimento de pedidos em paralelo multiplica o contexto pelo número de pedidos em andamento. Portanto, um servidor que responde a dois agentes ao mesmo tempo precisa de mais memória do que o mesmo servidor respondendo a um.
Não use o valor de RAM de nenhum guia, incluindo este. Baixe a tag, envie um prompt e, enquanto o modelo ainda estiver residente, execute estes dois comandos.
ollama ps
free -hollama ps mostra o que está carregado neste momento e como o trabalho está dividido entre CPU e GPU. free -h mostra o que ainda está disponível. Esses dois resultados no seu próprio servidor são mais confiáveis do que qualquer tabela publicada, porque já incluem a configuração de contexto, a quantização e tudo o que o servidor está executando.
O disco é a parte mais simples. O Ollama armazena os modelos em /usr/share/ollama/.ollama/models no Linux, que fica no sistema de arquivos raiz na maioria das imagens de VPS. Um volume raiz de 40GB não comporta a compilação bf16 de 57 GB e também não comporta duas tags de 8 bits lado a lado. Mova o armazenamento para um volume montado antes de baixar qualquer coisa.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaO usuário ollama deve ser o proprietário desse diretório, porque o serviço é executado como ollama e grava os blobs nesse local usando essa própria conta. Se um download falhar por causa de permissões, journalctl -u ollama -n 50 mostrará o motivo.
É preciso fazer uma afirmação direta sobre a swap: a swap não permite executar uma tag maior. A geração acessa os pesos para cada token produzido. Portanto, os pesos armazenados na swap são lidos novamente do disco repetidas vezes, vmstat 1 mostra as colunas si e so ocupadas, e a saída fica mais lenta, chegando a segundos por token. Mantenha um arquivo de swap pequeno como proteção contra o OOM killer. Dimensione a RAM para a tag que você realmente pretende usar.
Instalar o Ollama e fixar uma tag nomeada
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaO script de instalação configura um serviço systemd, por isso o servidor volta a arrancar depois de um reboot. Se preferir não executar o Ollama como um serviço de sistema gerido pelo root, executar o Ollama sem root com Podman aborda esse cenário. Em seguida, descarregue uma tag explícita.
ollama pull muse-glimmer:30b
ollama listLeia por sua conta a coluna de tamanho em ollama list e compare-a com a lista atual de tags na página do modelo. As tags publicadas são adicionadas, renomeadas e removidas, e o tamanho indicado num guia representa um retrato de um único dia.
Nunca escreva ollama pull muse-glimmer num servidor de que dependa. Um nome de modelo sem tag é resolvido para a tag latest, e latest é um ponteiro que o publicador pode mover para outra build. Um pull normal substitui então o modelo usado pelo seu agente, com necessidades de memória e comportamento diferentes, sem que nada nos logs o indique. Especifique a tag nos seus scripts, nos ficheiros de unidade e na configuração do agente. Alojar um LLM no seu próprio servidor com Ollama numa VPS aborda o restante da configuração do servidor.
É possível executar o Muse Glimmer sem uma GPU?
Sim, mas é importante deixar claro o limite de desempenho. Gerar um token significa ler os pesos do modelo a partir da memória. Por isso, a velocidade depende da largura de banda da memória, e não do número de vCPUs anunciado pelo plano. Depois de alguns núcleos, adicionar mais núcleos oferece poucos ganhos. Numa VPS partilhada, essa largura de banda é partilhada com todos os outros utilizadores do host. Por isso, um modelo 30B em 4-bit produz poucos tokens por segundo.
Não aceite o valor indicado por outra pessoa, incluindo o meu. Meça os tokens por segundo no seu próprio servidor e decida com base no resultado.
O resultado é uma divisão clara quanto ao uso adequado do modelo. O chat interativo é incómodo, porque lê mais depressa do que o servidor escreve e cada resposta começa com uma espera longa. O trabalho de agentes em segundo plano funciona bem, porque uma tarefa executada sem supervisão durante dez minutos não é afetada pelo facto de ser lenta. É exatamente este o tipo de carga que a Meta descreve para este modelo.
Se precisa de velocidade interativa, as duas respostas honestas são uma GPU ou uma API alojada. Calcule o ponto de equilíbrio entre uma VPS com GPU e tokens de API antes de alugar qualquer recurso, e o que uma VPS com GPU oferece efetivamente explica o que está a comprar. Para a questão mais geral sobre o que uma determinada máquina consegue alojar, comece por quais modelos pode alojar localmente, e executar um modelo Qwen de tamanho semelhante numa VPS é a comparação mais próxima nesta classe de tamanho.
Por que ele esquece as coisas muito antes de 128K tokens?
Isso acontece porque a janela de contexto padrão do Ollama é de 4096 tokens, independentemente do que o modelo suporta. Esse valor padrão consta na própria FAQ do Ollama em agosto de 2026. A tag anuncia 128K, mas o servidor fornece 4096 ao modelo até que esse valor seja alterado. Por isso, uma transcrição longa de um agente perde as primeiras interações, e o modelo parece ter amnésia.
Aumente o valor no servidor para todos os pedidos:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Numa sessão interativa, /set parameter num_ctx 32768 altera o valor apenas para essa sessão. Pela API, envie num_ctx nas opções do pedido.
Cada token adicional de contexto consome memória além da memória ocupada pelos pesos. Se pedir os 128K completos num servidor dimensionado apenas para os pesos, o carregamento pode falhar ou recorrer a uma execução mais lenta. Aumente o valor gradualmente e execute ollama ps após cada etapa. Como funcionam num_ctx e o comprimento do contexto no Ollama explica os cálculos.
Intensidade do raciocínio: low, medium, high e xhigh
A documentação da Meta define quatro intensidades de raciocínio para o Muse Glimmer, de low a xhigh, e recomenda as duas mais altas para tarefas complexas de programação e de agentes. No Ollama, isto é controlado pelo parâmetro think. Use --think= na linha de comandos ou envie think no corpo da API.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Numa sessão interativa, /set think e /set nothink alternam esta opção. A documentação do Ollama indica que a maioria dos modelos aceita um booleano ou um nível como low, medium ou high, e que alguns aceitam max para o nível máximo disponível. As cadeias exatas aceites por este modelo estão na respetiva página do modelo. Consulte essa página em vez de adivinhar e teste uma opção manualmente antes de a integrar num agente.
Num sistema apenas com CPU, esta definição tem um impacto significativo. Uma intensidade mais alta faz com que sejam gerados mais tokens de raciocínio antes de aparecer a primeira palavra da resposta, e um token de raciocínio consome o mesmo tempo de relógio que um token de resposta. Para tarefas rotineiras, mantenha a definição low.
Manter o modelo carregado para um agente sempre ativo
Por padrão, o Ollama descarrega um modelo inativo após cinco minutos. Para um agente executado a cada dez minutos, isso significa carregar novamente do disco todos os 18 GB em cada execução. Numa VPS com armazenamento ligado pela rede, esse carregamento não é rápido. Mantenha o modelo na memória.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Um valor negativo mantém o modelo residente até que algo o descarregue, e keep_alive num pedido à API substitui o valor predefinido do servidor apenas para essa chamada. O custo é direto: a RAM permanece ocupada enquanto nada acontece. Por isso, esta definição destina-se a um servidor dedicado ao agente. Manter um modelo do Ollama carregado aborda as variações.
Aponte um agente de programação para ele
Ollama disponibiliza uma API compatível com OpenAI em http://127.0.0.1:11434/v1, por isso a maioria das ferramentas de agentes liga-se usando um URL base e qualquer chave de API não vazia. A página Muse Glimmer do Ollama também documenta um atalho de inicialização que liga um agente compatível a um modelo local com um único comando. Fixe também a tag nesse comando.
ollama launch claude --model muse-glimmer:30bOs agentes enviam prompts grandes. O conteúdo dos ficheiros, a saída das ferramentas e uma transcrição crescente chegam como tokens de entrada. Num servidor com CPU, o processamento do prompt é a parte mais pesada antes de a geração sequer começar. Mantenha a configuração de contexto tão pequena quanto a tarefa permitir. Ligar um agente de programação ao Ollama aborda o lado do cliente, executar um agente de programação numa VPS aborda o servidor onde ele é executado, e controlar os custos de um agente numa VPS aborda o que acontece quando ele é executado durante todo o dia.
A entrada de imagens funciona da mesma forma. A API do Ollama recebe imagens no campo images de uma mensagem. Por isso, um cliente apenas de texto nunca enviará uma imagem, por mais capaz que seja o codificador de perceção.
Não abra a porta 11434
A API do Ollama não tem autenticação. Definir OLLAMA_HOST=0.0.0.0:11434 para poder aceder a ela a partir do seu portátil coloca um executor de modelos sem autenticação na Internet pública. Qualquer pessoa que o encontre pode carregar modelos no seu disco e ler tudo o que o seu agente enviar através dele. Mantenha-o ligado a localhost e utilize um túnel.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsProteger o endpoint da API do Ollama aborda as opções corretas, incluindo um reverse proxy que solicita credenciais.
O que falha e o que verá
O pull para a meio. Disco. Execute df -h no diretório do modelo. Um build bf16 de 57 GB não cabe num volume raiz de 40GB, e duas tags de 8 bits lado a lado também não.
O modelo carrega e depois o processo termina. Memória insuficiente. dmesg -T regista a escolha de um processo pelo OOM killer do kernel, e journalctl -u ollama -n 100 mostra o mesmo evento no serviço. A correção é usar uma tag menor ou um num_ctx menor. Mais swap não resolve.
O processo executa a segundos por token. Execute vmstat 1 e monitorize as colunas si e so. Atividade de swap contínua significa que os pesos não cabem na RAM e que o sistema os está a ler novamente do disco durante a execução.
Uma tag que funcionava na semana passada desapareceu. As listas de tags mudam. Consulte novamente a página do modelo, fixe a versão atual e registe o nome da tag num local que possa consultar novamente.
Verifique novamente os tamanhos antes de fazer o pull
Os tamanhos da tabela foram lidos na página de tags do modelo em 16 August 2026, e uma lista de tags publicada não é uma garantia. Leia a lista atual na página do modelo e confirme depois o que foi efetivamente gravado no disco:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsO Ollama armazena as camadas dos modelos como blobs partilhados, por isso duas tags que partilham uma camada não ocupam o dobro do espaço em disco. Compare o valor apresentado por du com o tamanho publicado e planeie o espaço em disco com base no maior dos dois.
FAQ
Quanta RAM o Muse Glimmer precisa numa VPS?
Comece pelo tamanho da tag e some a janela de contexto. A tag predefinida está listada com cerca de 18 GB em 16 August 2026, por isso uma máquina de 16GB não consegue sequer armazená-la e uma máquina de 24GB fica com pouco espaço para o contexto. Use esse valor como ponto de partida, não como resposta definitiva. Faça pull da tag, carregue-a uma vez, execute ollama ps e free -h na sua própria máquina e consulte os seus próprios valores. Um contexto maior e pedidos paralelos também aumentam o consumo de memória além dos pesos.
Posso executar o Muse Glimmer sem uma GPU?
Sim. O modelo carrega e responde apenas com a CPU numa VPS. A velocidade de geração é limitada pela largura de banda da memória, não pelo número de cores. Num host partilhado, essa largura de banda é partilhada, por isso espere poucos tokens por segundo com 4-bit. Isso é aceitável para trabalho de agentes em segundo plano que corre sem supervisão, mas é lento para conversação interativa. Execute ollama ps durante um pedido e consulte a coluna do processador para confirmar onde o trabalho está a ser executado.
As tags MLX têm alguma utilidade numa VPS Linux?
Não. Todas as tags com mlx no nome são compiladas para o motor MLX do Ollama, que é o seu backend para Apple Silicon. Num servidor Linux x86, essas tags são um download grande que não pode ser executado. Use a tag simples 30b ou outra tag que não seja MLX e ignore os benchmarks de hardware Apple associados às compilações MLX.
Porque é que o modelo se esquece das coisas muito antes dos 128K tokens?
Porque a janela de contexto predefinida do Ollama é de 4096 tokens, independentemente do que o modelo suporta. Assim, o servidor trunca as conversações longas antes de o modelo as receber. Defina OLLAMA_CONTEXT_LENGTH no servidor, /set parameter num_ctx para uma sessão ou envie num_ctx nas opções do pedido à API. O consumo de memória aumenta com esse valor, por isso aumente-o gradualmente e verifique ollama ps de cada vez.
Devo fixar a tag ou usar simplesmente latest?
Fixe-a. muse-glimmer sem uma tag resolve para latest, que é um ponteiro que o publicador pode mover para outra compilação a qualquer momento. Por isso, um pull de rotina pode alterar o modelo executado pelo seu agente. Escreva muse-glimmer:30b nos scripts, ficheiros de unidade e configuração do agente. Consulte a lista de tags na página do modelo antes de fixar uma, porque as tags publicadas mudam.