Meta Muse Glimmer 30B VPS üzerinde nasıl çalıştırılır?
Muse Glimmer 17GB ile 59GB arası RAM gerektirir. VPS kiralarken ihtiyaç duyacağınız disk alanı, bellek miktarı ve CPU tabanlı çıkarım maliyetleri hakkında detaylı rehber.
Muse Glimmer için VPS gereksinimleri
Muse Glimmer, GPU içermeyen standart bir Linux VPS üzerinde çalışır; belleğe sığıp sığmayacağını çektiğiniz etiket belirler. Meta Superintelligence Labs, modeli 10 Ağustos 2026 tarihinde Apache 2.0 lisansı ile yayınlamıştır: 30 milyar parametre, 128K bağlam penceresi ve metinle birlikte görselleri okuyabilmesi için 1.8B parametreli özel bir algı kodlayıcı içerir. Meta, modeli sohbet odaklı değil, sürekli çalışan yerel aracılar için tasarlamıştır ve akıl yürütme gücü her istek bazında ayarlanabilir.
16 Ağustos 2026 tarihinde incelenen yayınlanmış Ollama etiketleri, 17 GB ile 59 GB arasında değişmektedir. Bu aralık, boyutlandırma probleminin tamamını oluşturur. Varsayılan etiket yaklaşık 18 GB olarak listelenmiştir, bu nedenle en küçük mantıklı sunucu, 18 GB'dan belirgin şekilde daha fazla boş RAM alanına sahip olmalıdır. İndirme işlemi için gereken disk alanı ve bağlam penceresi için gereken bellek, bu değerlerin üzerine eklenmelidir.
Hangi muse-glimmer etiketini çekmelisiniz?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama, bu model için Apple sürümleri olmayan 11 adet etiket listeledi. Bunlar, farklı sayısal hassasiyetlerde depolanan aynı 30 milyar ağırlığı içerir. Gördüğünüz boyut, indireceğiniz boyuttur ve aynı zamanda herhangi bir bağlam eklenmeden önce bellekte tutmanız gereken miktara yakındır.
İki adet 4-bit sürüm küçük olanlardır: 17 GB ile 30b-nvfp4 ve 18 GB ile 30b-q4_K_M. Varsayılan 30b etiketi, q4_K_M sürümüyle aynı boyutta listelenmiştir. 8-bit sürümler olan 30b-q8_0 ve 30b-mxfp8, 31 GB civarındadır. 30b-bf16, 57 GB boyutundaki kuantize edilmemiş 16-bit sürümdür; bu, kiralanan çoğu sunucunun yan proje için ödenebilecek bir fiyata sunduğundan daha fazla RAM gerektirir.
-dflash etiketleri, DFlash desteğine sahip aynı sürümlerdir ve her biri kendi düz ikizinden daha büyük listelenmiştir. Ollama, DFlash'ı bir hız özelliği olarak tanımlar ve bunu Apple Silicon ile masaüstü GPU'larda gösterir. Yalnızca CPU içeren bir VPS'de, başka donanımlarda ölçülen bir özellik için bu ekstra boyutu gerçek bellekte ödersiniz; bu nedenle düz etiketle başlayın ve her seferinde tek bir şeyi değiştirin.
Özel bir nedeniniz yoksa 4-bit ile başlayın. 4-bit'ten 8-bit'e geçmek, CPU'nun ürettiği her token için okuması gereken bayt sayısını kabaca ikiye katlar; bu nedenle bellek kullanımı artarken iş hacmi düşer. Bu takas, q4, q8 ve fp16 kuantizasyonunun size gerçek maliyeti konusunun temelidir ve bir CPU sunucusunda kısa cevap, 4-bit sürümün başlamaya değer tek sürüm olduğudur.
MLX etiketleri Linux sunucuda neden işe yaramaz
MLX, Apple'ın dizi (array) çerçevesidir ve Ollama'nın MLX motoru, Apple Silicon donanımı için geliştirilmiş arka uçtur. İsminde mlx geçen her etiket, bu motor ve donanım için oluşturulmuştur. x86 mimarisine sahip bir Linux VPS üzerinde bu etiketler, çalıştıramayacağınız onlarca gigabaytlık gereksiz veri indirilmesine neden olur ve diskte hiçbir işlev görmeden yer kaplar. Duyurularda yer alan ve Mac üzerinde ölçülen hız değerleri bu etiketlere aittir; dolayısıyla sunucunuzun performansını yansıtmazlar. Model sayfasındaki etiket listesini incelerken, öncelikle mlx içeren tüm isimleri filtreleyin, ardından kalan seçenekler arasından boyut değerlendirmesi yapın.
Ne kadar RAM ve disk alanına gerçekten ihtiyaç var?
Bellek kullanımını iki unsur belirler; bunlardan yalnızca biri etiket boyutudur. Ağırlıklar, çektiğiniz etikete göre sabittir. Modelin konuşma boyunca tuttuğu her bir belirteç (token) durumu olan KV cache, yapılandırdığınız bağlam uzunluğuyla (context length) birlikte büyür. Ollama'nın kendi belgeleri, paralel istekleri sunmanın bağlamı o an işlenmekte olan istek sayısıyla çarptığını belirtir; bu nedenle aynı anda iki aracı yanıtlayan bir sunucu, tek bir aracı yanıtlayan aynı sunucudan daha fazla belleğe ihtiyaç duyar.
Bu kılavuz dahil hiçbir rehberdeki RAM değerini mutlak kabul etmeyin. Etiketi çekin, bir komut gönderin ve model bellekteyken şu iki komutu çalıştırın.
ollama ps
free -hollama ps, o an neyin yüklü olduğunu ve iş yükünün CPU ile GPU arasında nasıl paylaşıldığını gösterir. free -h ise geriye ne kadar kaldığını gösterir. Kendi sunucunuzdaki bu iki çıktı, yayınlanmış herhangi bir tablodan daha değerlidir; çünkü bu çıktılar bağlam ayarlarınızı, kuantizasyonunuzu ve sunucuda çalışan diğer her şeyi zaten içerir.
Disk alanı işin daha kolay kısmıdır. Ollama, modelleri Linux üzerinde /usr/share/ollama/.ollama/models dizininde saklar; bu dizin çoğu VPS imajında kök dosya sisteminde yer alır. 40 GB'lık bir kök birim, 57 GB boyutundaki bf16 sürümünü barındırmayacağı gibi, iki adet 8-bit etiketi yan yana da tutamaz. Bir "pull" işleminin gerçekte ne yazdığına hiç bakmadıysanız, Ollama modelleri nereye kaydeder ve nasıl taşınır rehberi bu dizini incelemenizi sağlar. Herhangi bir şey çekmeden önce depolama alanını bağlı bir birime taşıyın.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaServis ollama kullanıcısı olarak çalıştığı ve blob dosyalarını kendi yetkisiyle yazdığı için, ilgili dizinin sahibi ollama kullanıcısı olmalıdır. Bir "pull" işlemi izinler nedeniyle başarısız olursa, nedenini journalctl -u ollama -n 50 dosyasında görebilirsiniz.
Swap (takas alanı) hakkında tek bir net ifade yeterlidir: swap, daha büyük bir etiketi çalıştırmanıza olanak tanımaz. Üretim süreci, oluşturduğu her belirteç için ağırlıklara erişir; bu nedenle swap alanında yaşayan ağırlıklar sürekli olarak diskten geri okunur. vmstat 1 komutu si ve so sütunlarının meşgul olduğunu gösterir ve çıktı hızı belirteç başına saniyeler seviyesine düşer. OOM (Out of Memory) katili (killer) durumuna karşı önlem olarak küçük bir swap dosyası tutun. RAM boyutunu, gerçekten kullanmak istediğiniz etikete göre belirleyin.
Ollama kurulumu ve adlandırılmış bir etiket sabitleme
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaKurulum betiği bir systemd servisi oluşturur, böylece sunucu yeniden başlatıldıktan sonra servis otomatik olarak ayağa kalkar. Eğer servisi root tarafından yönetilen bir sistem servisi olarak çalıştırmak istemiyorsanız, Ollama'yı Podman altında rootless çalıştırma rehberi bu yöntemi açıklamaktadır. Ardından, belirli bir etiketi (tag) çekin.
ollama pull muse-glimmer:30b
ollama listollama list içindeki boyut sütununu kendiniz inceleyin ve model sayfasındaki güncel etiket listesiyle karşılaştırın. Yayınlanan etiketler eklenir, yeniden adlandırılır veya kaldırılır; rehberdeki bir boyut bilgisi yalnızca o güne ait bir anlık görüntüdür.
Bağımlı olduğunuz bir sunucuda asla ollama pull muse-glimmer yazmayın. Yalın bir model adı, latest etiketine çözümlenir ve latest, yayıncının farklı bir sürüme yönlendirebileceği bir işaretçidir. Rutin bir çekme işlemi (pull), ajanınızın altındaki modeli değiştirir; bu durum farklı bellek gereksinimlerine ve farklı davranışlara yol açar ve loglarınızda buna dair hiçbir uyarı yer almaz. Etiketi betiklerinizde, unit dosyalarınızda ve ajan yapılandırmanızda mutlaka belirtin. VPS üzerinde Ollama ile LLM self-hosting rehberi, sunucu kurulumunun geri kalanını kapsamaktadır.
Muse Glimmer GPU olmadan çalıştırılabilir mi?
Evet, ancak performans sınırları konusunda açık olmak gerekir. Bir token üretmek, model ağırlıklarının bellekten okunması anlamına gelir; bu nedenle hız, planın sunduğu vCPU sayısından ziyade bellek bant genişliği ile belirlenir. Birkaç çekirdekten sonra, daha fazla çekirdek eklemek çok az performans artışı sağlar. Paylaşımlı bir VPS üzerinde bu bant genişliği, sunucudaki diğer tüm kullanıcılarla paylaşılır; bu yüzden 4-bit seviyesindeki 30B bir model, saniyede çok az sayıda token üretir.
Bu konuda kimsenin verdiği rakamı, benimkiler dahil, doğrudan kabul etmeyin. Kendi sunucunuzda saniyedeki token sayısını ölçün ve elde ettiğiniz sonuca göre karar verin.
Sonuç, modelin kullanım alanları açısından net bir ayrım yaratır. Etkileşimli sohbet oldukça yavaştır; çünkü okuma hızınız sunucunun yazma hızından fazladır ve her yanıt uzun bir bekleme süresiyle başlar. Arka plan aracı görevleri ise sorunsuzdur; çünkü on dakika boyunca gözetimsiz çalışan bir görev için yavaşlık bir sorun teşkil etmez. Meta'nın bu model için tanımladığı kullanım senaryosu tam olarak bu ikinci iş yüküdür.
Etkileşimli hız gerekiyorsa, dürüst iki seçenek GPU veya barındırılan bir API kullanmaktır. Herhangi bir kiralama yapmadan önce GPU VPS ile API token maliyetleri arasındaki başa baş noktasını hesaplayın ve bir GPU VPS'in size gerçekte ne sağladığını inceleyerek ne satın aldığınızı anlayın. Belirli bir sunucunun kapasitesine ilişkin daha geniş bir soru için kendi sunucunuzda barındırabileceğiniz modellere göz atın; benzer boyuttaki bir Qwen modelini VPS üzerinde çalıştırmak, bu boyut sınıfındaki en yakın karşılaştırmayı sunar. Ölçtüğünüz değerler kabul edilemeyecek kadar düşükse, Nemotron 3.5 Lightning on a VPS makalesi, boyut yerine hıza odaklanan bir model için aynı RAM ve saniyedeki token sorularını ele almaktadır.
Model neden 128K token sınırına ulaşmadan önceki bilgileri unutuyor?
Ollama'nın varsayılan bağlam penceresi, modelin desteklediği değer ne olursa olsun 4096 tokendır. Bu varsayılan değer, Ağustos 2026 itibarıyla Ollama'nın kendi FAQ bölümünde belirtilmiştir. Etiket 128K değerini duyursa da, siz aksi belirtilene kadar sunucu modele 4096 token sağlar; bu nedenle uzun bir aracı (agent) dökümü ilk kısımlarını kaybeder ve model hafıza kaybı yaşıyormuş gibi görünür.
Sunucu tarafında her istek için bu değeri artırın:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Etkileşimli bir oturum içinde, /set parameter num_ctx 32768 değeri yalnızca o oturum için değiştirir. API üzerinden ise istek seçenekleri içerisinde num_ctx parametresini gönderin.
Her bir ek bağlam tokenı, model ağırlıklarına ek olarak bellek tüketir. Yalnızca ağırlıklar için boyutlandırılmış bir sunucuda 128K değerinin tamamını talep ederseniz yükleme başarısız olur veya sistem daha yavaş bir işleme yöntemine geri döner. Değeri kademeli olarak artırın ve her adımdan sonra ollama ps komutunu çalıştırın. Ollama'da num_ctx ve bağlam uzunluğu nasıl çalışır başlıklı yazı, bu hesaplamaların detaylarını açıklamaktadır.
Akıl yürütme gücü: low, medium, high ve xhigh
Meta, Muse Glimmer için low seviyesinden xhigh seviyesine kadar dört farklı akıl yürütme gücü tanımlar ve karmaşık kodlama ile ajan görevleri için en yüksek iki seviyenin kullanılmasını önerir. Ollama üzerinde bu ayar think parametresi ile yönetilir. Komut satırında --think= bayrağını kullanın veya API gövdesinde think parametresini gönderin.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Etkileşimli bir oturum içerisinde, /set think ve /set nothink komutları bu ayarı değiştirir. Ollama belgelerine göre çoğu model boolean bir değer veya low, medium, high gibi bir seviye kabul eder; bazı modeller ise mevcut en yüksek seviye için max değerini destekler. Bu modelin tam olarak hangi dizeleri kabul ettiği model sayfasında belirtilmiştir; bu nedenle tahmin yürütmek yerine ilgili sayfayı okuyun ve bir ajana entegre etmeden önce manuel olarak test edin.
Yalnızca CPU kullanılan bir sunucuda bu ayar performansı doğrudan etkiler. Daha yüksek bir güç seviyesi, yanıtın ilk kelimesi görünmeden önce daha fazla düşünme token'ı üretilmesi anlamına gelir ve bir düşünme token'ı, yanıt token'ı ile aynı sürede işlenir. Rutin işler için ayarı low seviyesinde bırakın. Yanıt uzunluğu da aynı özeni hak eder; bu nedenle yavaş bir sunucunun uzun ve gereksiz yanıtlarla dakikalarca meşgul edilmemesi için num_predict ile yanıtı sınırlandırın.
Modeli her zaman açık bir aracı için bellekte tutma
Ollama, boşta kalan bir modeli varsayılan olarak beş dakika sonra bellekten kaldırır. On dakikada bir tetiklenen bir aracı için bu, her çalıştırmada diskten 18 GB boyutunda tam bir yükleme yapmak anlamına gelir; ağ tabanlı depolama birimine sahip bir VPS üzerinde bu yükleme işlemi hızlı gerçekleşmez. Bunun yerine modeli belleğe sabitleyin.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Negatif bir değer, modelin başka bir işlem tarafından kaldırılana kadar bellekte kalmasını sağlar; bir API isteğindeki keep_alive parametresi ise o çağrı için sunucu varsayılanını geçersiz kılar. Bunun maliyeti bellidir: hiçbir işlem yapılmadığı sırada bile RAM işgal altında kalır, bu nedenle bu ayar yalnızca aracıya ayrılmış bir sunucu için uygundur. Ollama modelini bellekte tutma konusu, bu yapılandırmanın farklı varyasyonlarını ele almaktadır.
Bir kodlama aracını ona yönlendirme
Ollama, http://127.0.0.1:11434/v1 adresinde OpenAI uyumlu bir API sunar; bu nedenle çoğu araç, bir temel URL ve boş olmayan herhangi bir API anahtarı ile bağlantı kurar. Ollama'nın Muse Glimmer sayfası, desteklenen bir aracı tek bir komutla yerel bir modele bağlayan bir başlatma kısayolunu da belgeler; buradaki etiketi de sabitlemeniz önerilir.
ollama launch claude --model muse-glimmer:30bAraçlar büyük istemler gönderir. Dosya içerikleri, araç çıktıları ve sürekli büyüyen bir döküm, girdi belirteçleri olarak ulaşır; CPU tabanlı bir sunucuda, üretim aşaması başlamadan önce istem işleme süreci en çok kaynak tüketen kısımdır. Bağlam ayarını görevin izin verdiği ölçüde küçük tutun. Bir kodlama aracını Ollama'ya yönlendirme istemci tarafını, bir VPS üzerinde kodlama aracı çalıştırma aracın barındığı sunucuyu ve bir VPS üzerinde araç maliyetlerini kontrol etme ise aracın gün boyu çalışması durumunda neler yaşanacağını ele alır.
Görüntü girdisi de aynı şekilde çalışır. Ollama API, görüntüleri bir mesajın images alanından alır; bu nedenle, algı kodlayıcısı ne kadar yetenekli olursa olsun, yalnızca metin destekleyen bir istemci asla görüntü gönderemez.
11434 numaralı portu dışarıya açmayın
Ollama API üzerinde kimlik doğrulama mekanizması bulunmamaktadır. OLLAMA_HOST=0.0.0.0:11434 ayarını yaparak servisi dizüstü bilgisayarınızdan erişilebilir hale getirmek, kimlik doğrulaması olmayan bir model çalıştırıcısını genel internete açmak anlamına gelir. Bu durumda, servisi bulan herhangi bir kişi diskinize modeller yükleyebilir ve ajanınızın bu servis üzerinden gönderdiği tüm verileri okuyabilir. Servisi localhost üzerinde tutun ve bunun yerine bir tünel kullanın.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsOllama API uç noktasının güvenliğini sağlama bölümü, kimlik doğrulama talep eden bir reverse proxy kullanımı da dahil olmak üzere uygun seçenekleri kapsamaktadır.
Neler bozulur ve ne görürsünüz
Çekme işlemi yarıda durur. Disk. Model dizinine karşı df -h komutunu çalıştırın. 57 GB boyutundaki bir bf16 derlemesi 40GB'lık bir root birimine sığmaz; iki adet 8-bit etiket yan yana da sığmayacaktır.
Model yüklenir ve ardından süreç sonlanır. Bellek yetersizliği. dmesg -T, çekirdeğin bellek yetersizliği nedeniyle bir süreci sonlandırdığını (OOM killer) kaydeder; journalctl -u ollama -n 100 ise aynı olayın servis tarafındaki yansımasını gösterir. Çözüm, daha küçük bir etiket veya daha küçük bir num_ctx kullanmaktır. Çözüm daha fazla swap alanı değildir.
Sistem token başına saniyelerle çalışır. vmstat 1 komutunu çalıştırın ve si ile so sütunlarını izleyin. Sürekli swap etkinliği, ağırlıkların RAM'e sığmadığı ve sistemin çalışırken bunları diskten geri okuduğu anlamına gelir.
Geçen hafta çalışan bir etiket artık yok. Etiket listeleri değişir. Model sayfasını tekrar okuyun, güncel olanı sabitleyin ve etiket adını tekrar bakabileceğiniz bir yere kaydedin.
Çekme işleminden önce boyutları kendiniz tekrar kontrol edin
Tablodaki boyutlar 16 Ağustos 2026 tarihinde modelin etiket sayfasından alınmıştır; yayınlanan bir etiket listesi garanti teşkil etmez. Model sayfasındaki güncel listeyi okuyun ve ardından diskinize gerçekte ne kadar veri indiğini doğrulayın:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama, model katmanlarını paylaşımlı blob'lar olarak saklar; bu nedenle bir katmanı paylaşan iki etiket, diskte iki kat yer kaplamaz. du komutunun bildirdiği değerleri yayınlanan boyutla karşılaştırın ve disk planınızı bu iki değerden büyük olanına göre yapın.
FAQ
Muse Glimmer bir VPS üzerinde ne kadar RAM gerektirir?
Etiket boyutundan başlayın ve bağlam penceresini (context window) ekleyin. Varsayılan etiket 16 Ağustos 2026 itibarıyla yaklaşık 18 GB olarak listelenmiştir; bu nedenle 16GB bir sunucu bunu hiç barındıramaz, 24GB bir sunucu ise bağlam için çok az yer bırakarak barındırır. Bunu bir yanıt değil, bir başlangıç noktası olarak kabul edin. Etiketi çekin, bir kez yükleyin, ardından kendi sunucunuzda ollama ps ve free -h komutlarını çalıştırın ve kendi değerlerinizi okuyun. Daha uzun bağlam ve eşzamanlı istekler, ağırlıkların üzerine ek bellek yükü getirir.
Muse Glimmer'ı GPU olmadan çalıştırabilir miyim?
Evet. Yalnızca CPU içeren bir VPS üzerinde yüklenir ve yanıt verir. Üretim hızı çekirdek sayısından ziyade bellek bant genişliği ile sınırlıdır ve paylaşımlı bir sunucuda bu bant genişliği paylaşıldığı için 4-bit seviyesinde saniyede az sayıda token beklemelisiniz. Bu, gözetimsiz çalışan arka plan aracı işleri için kullanılabilir ancak interaktif sohbet için yavaştır. Bir istek sırasında ollama ps komutunu çalıştırın ve işlemin nerede yürütüldüğünü doğrulamak için işlemci sütununu okuyun.
MLX etiketleri bir Linux VPS üzerinde işe yarar mı?
Hayır. Adında mlx bulunan her etiket, Ollama'nın Apple Silicon altyapısı olan MLX motoru için oluşturulmuştur. x86 bir Linux sunucuda bu etiketler çalıştıramayacağınız büyük boyutlu indirmelerdir. Sade 30b etiketini veya MLX olmayan diğer etiketlerden birini kullanın ve MLX sürümleriyle birlikte sunulan Apple donanım kıyaslama sonuçlarını dikkate almayın.
Model neden 128K token sınırından çok önce bir şeyleri unutuyor?
Çünkü model neyi desteklerse desteklesin Ollama'nın varsayılan bağlam penceresi 4096 tokendır; bu nedenle sunucu, uzun konuşmaları model görmeden önce keser. Sunucuda OLLAMA_CONTEXT_LENGTH ayarını yapın, tek bir oturum için /set parameter num_ctx kullanın veya API isteği seçeneklerinde num_ctx gönderin. Bellek kullanımı bununla birlikte artar, bu yüzden kademeli olarak yükseltin ve her seferinde ollama ps değerini kontrol edin.
Etiketi sabitlemeli miyim yoksa sadece latest mı kullanmalıyım?
Sabitleyin. Etiketsiz muse-glimmer kullanımı, yayıncının herhangi bir zamanda farklı bir sürüme yönlendirebileceği bir işaretçi olan latest değerine çözümlenir; bu nedenle rutin bir çekme işlemi, aracınızın üzerinde çalıştığı modeli değiştirebilir. Betiklerde, unit dosyalarında ve araç yapılandırmalarında muse-glimmer:30b kullanın. Sabitlemeden önce model sayfasındaki etiket listesini kontrol edin, çünkü yayınlanan etiketler değişebilir.