SSD Nodes Learn 🎉 VPS $5.50/aydan başlayan
Rehberler Matt ConnorYazan Matt Connor

Meta Muse Glimmer 30B VPS üzerinde nasıl çalıştırılır?

Muse Glimmer 30B modelleri 17GB ile 59GB arası RAM gerektirir. Model boyutuna göre gereken disk alanı, RAM miktarı ve CPU tabanlı çıkarım maliyetlerini detaylıca inceleyin.

Bir VPS üzerinde Muse Glimmer gereksinimleri

Muse Glimmer, GPU içermeyen standart bir Linux VPS üzerinde çalışır; belleğe sığıp sığmayacağını çektiğiniz etiket belirler. Meta Superintelligence Labs, modeli 10 Ağustos 2026 tarihinde Apache 2.0 lisansı ile yayınlamıştır: 30 milyar parametre, 128K bağlam penceresi ve metinlerin yanı sıra görselleri de okuyabilmesi için özel 1.8B parametreli algı kodlayıcı içerir. Meta, modeli sohbet arayüzlerinden ziyade, istek başına ayarlanan akıl yürütme gücüyle sürekli çalışan yerel aracılar için konumlandırmaktadır.

16 Ağustos 2026 tarihinde okunan yayınlanmış Ollama etiketleri, 17 GB ile 59 GB arasında değişmektedir. Bu aralık, boyutlandırma probleminin tamamını oluşturur. Varsayılan etiket yaklaşık 18 GB olarak listelenmiştir; bu nedenle en küçük mantıklı sunucu, 18 GB'dan belirgin şekilde daha fazla boş RAM alanına sahip olmalıdır. İndirme işlemi için disk alanı ve bağlam penceresi için gereken bellek, bu değerlerin üzerine eklenmelidir.

Hangi muse-glimmer etiketi çekilmelidir?

ChartPublished muse-glimmer tag sizes on 16 August 2026 (Linux tags only)
The data behind this chart
[
  {
    "label": "30b-nvfp4",
    "size_gb": 17
  },
  {
    "label": "30b (default)",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M",
    "size_gb": 18
  },
  {
    "label": "30b-q4_K_M-dflash",
    "size_gb": 20
  },
  {
    "label": "30b-nvfp4-dflash",
    "size_gb": 21
  },
  {
    "label": "30b-q8_0",
    "size_gb": 31
  },
  {
    "label": "30b-mxfp8",
    "size_gb": 33
  },
  {
    "label": "30b-q8_0-dflash",
    "size_gb": 33
  },
  {
    "label": "30b-mxfp8-dflash",
    "size_gb": 35
  },
  {
    "label": "30b-bf16",
    "size_gb": 57
  },
  {
    "label": "30b-bf16-dflash",
    "size_gb": 59
  }
]

Ollama, bu model için Apple sürümleri olmayan 11 adet etiket listeler. Bunlar, farklı sayısal hassasiyetlerde saklanan aynı 30 milyar ağırlığı içerir. Gördüğünüz boyut, indireceğiniz boyuttur ve aynı zamanda herhangi bir bağlam eklenmeden önce bellekte tutmanız gereken miktardır.

İki adet 4-bit sürüm küçük olanlardır: 17 GB ile 30b-nvfp4 ve 18 GB ile 30b-q4_K_M. Varsayılan 30b etiketi, q4_K_M sürümüyle aynı boyutta listelenmiştir. 8-bit sürümler olan 30b-q8_0 ve 30b-mxfp8, 31 GB civarındadır. 30b-bf16, 57 GB boyutundaki kuantize edilmemiş 16-bit sürümdür; bu, çoğu kiralanan sunucunun bir yan proje için ödenebilecek bir fiyata sunduğundan daha fazla RAM gerektirir.

-dflash etiketleri, DFlash desteğine sahip aynı sürümlerdir ve her biri kendi düz ikizinden daha büyük olarak listelenmiştir. Ollama, DFlash'ı bir hız özelliği olarak tanımlar ve bunu Apple Silicon ile masaüstü GPU'larda gösterir. Yalnızca CPU içeren bir VPS üzerinde, başka donanımlarda ölçülen bir özellik için bu ekstra boyutu gerçek bellek olarak ödersiniz; bu nedenle düz etiketle başlayın ve her seferinde tek bir şeyi değiştirin.

Özel bir nedeniniz yoksa 4-bit ile başlayın. 4-bit'ten 8-bit'e geçmek, CPU'nun oluşturduğu her token için okuması gereken bayt sayısını kabaca ikiye katlar; bu nedenle bellek kullanımı artarken iş hacmi düşer. Bu takas, q4, q8 ve fp16 kuantizasyonunun gerçek maliyeti konusunun içeriğidir ve bir CPU sunucusunda kısa cevap, 4-bit sürümün başlangıç için tek mantıklı seçenek olduğudur.

MLX etiketlerinin Linux sunucuda hiçbir işe yaramamasının nedeni

MLX, Apple'ın dizi çerçevesidir ve Ollama'nın MLX motoru, Apple Silicon donanımı için geliştirilmiş arka uçtur. İsminde mlx geçen her etiket, bu motor ve donanım için oluşturulmuştur. x86 mimarili bir Linux VPS üzerinde bu etiketler, çalıştıramayacağınız onlarca gigabaytlık bir indirme yükü oluşturur ve diskinizde hiçbir işe yaramadan yer kaplar. Duyuruda yer alan ve Mac üzerinde ölçülen hız değerleri bu etiketlere aittir; dolayısıyla sunucunuzun performansını yansıtmazlar. Model sayfasındaki etiket listesini incelerken, önce mlx içeren tüm isimleri filtreleyin, ardından kalan seçenekler arasından boyut seçimi yapın.

Gerçekte ne kadar RAM ve disk alanı gerekir?

Bellek tüketimini iki unsur belirler; bunlardan yalnızca biri etiket boyutudur. Ağırlıklar, çektiğiniz etikete göre sabittir. Modelin konuşma boyunca tuttuğu her bir token durumu olan KV cache, yapılandırdığınız bağlam uzunluğuyla (context length) birlikte büyür. Ollama'nın kendi belgeleri, eş zamanlı isteklerin sunulmasının bağlamı, işlemdeki istek sayısıyla çarptığını belirtir; bu nedenle aynı anda iki aracı yanıtlayan bir sunucu, tek bir aracı yanıtlayan sunucudan daha fazla belleğe ihtiyaç duyar.

Bu kılavuz dahil hiçbir rehberdeki RAM değerini mutlak kabul etmeyin. Etiketi çekin, bir istem gönderin ve model bellekte yüklüyken şu iki komutu çalıştırın.

ollama ps
free -h

ollama ps, o anda nelerin yüklü olduğunu ve iş yükünün CPU ile GPU arasında nasıl paylaşıldığını gösterir. free -h ise geriye ne kadar boş alan kaldığını belirtir. Kendi sunucunuzdan alacağınız bu iki çıktı, yayınlanmış tüm tablolardan daha güvenilirdir; çünkü bu çıktılar halihazırda bağlam ayarlarınızı, kuantizasyonunuzu ve sunucuda çalışan diğer her şeyi kapsar.

Disk alanı işin daha kolay kısmıdır. Ollama, modelleri Linux üzerinde /usr/share/ollama/.ollama/models dizininde saklar; bu dizin çoğu VPS imajında kök dosya sisteminde yer alır. 40 GB'lık bir kök birim, 57 GB boyutundaki bf16 sürümünü barındırmayacağı gibi, iki adet 8-bit etiketi yan yana da tutamaz. Herhangi bir çekme işlemi yapmadan önce depolama alanını mount edilmiş bir birime taşıyın.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/mnt/models"
sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollama

Servis ollama kullanıcısı olarak çalıştığı ve blob dosyalarını bu kullanıcı yetkisiyle yazdığı için, ilgili dizinin sahibi ollama kullanıcısı olmalıdır. Eğer bir çekme işlemi izin hataları nedeniyle başarısız olursa, nedenini journalctl -u ollama -n 50 dosyasında görebilirsiniz.

Swap alanı hakkında söylenecek tek bir net gerçek vardır: swap, daha büyük bir etiketi çalıştırmanızı sağlamaz. Üretim süreci, oluşturduğu her token için ağırlıklara erişir; bu nedenle swap alanında yaşayan ağırlıklar sürekli olarak diskten tekrar okunur. vmstat 1 komutu si ve so sütunlarının meşgul olduğunu gösterir ve çıktı hızı token başına saniyeler seviyesine düşer. OOM (Out of Memory) killer'a karşı bir önlem olarak küçük bir swap dosyası bulundurun. RAM miktarını, kullanmak istediğiniz etikete göre boyutlandırın.

Ollama kurulumu ve adlandırılmış bir etiket sabitleme

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama

Kurulum betiği bir systemd servisi oluşturur, böylece sunucu yeniden başlatıldıktan sonra servis otomatik olarak ayağa kalkar. Eğer servisi root tarafından yönetilen bir sistem servisi olarak çalıştırmak istemiyorsanız, Ollama'yı Podman altında rootless çalıştırma bölümü bu yöntemi açıklar. Ardından belirli bir etiketi çekin.

ollama pull muse-glimmer:30b
ollama list

ollama list içindeki boyut sütununu kendiniz inceleyin ve model sayfasındaki güncel etiket listesiyle karşılaştırın. Yayınlanan etiketler eklenir, yeniden adlandırılır veya kaldırılır; bir kılavuzdaki boyut bilgisi yalnızca o güne ait bir anlık görüntüdür.

Bağımlı olduğunuz bir sunucuda asla ollama pull muse-glimmer yazmayın. Yalın bir model adı, latest etiketine çözümlenir ve latest, yayıncının farklı bir sürüme yönlendirebileceği bir işaretçidir. Rutin bir çekme işlemi, modelinizi farklı bellek gereksinimleri ve farklı davranışlarla değiştirir ve loglarınızda buna dair hiçbir uyarı yer almaz. Betiklerinizde, unit dosyalarınızda ve aracı yapılandırmanızda etiketi açıkça belirtin. Ollama ile bir VPS üzerinde LLM self-hosting bölümü sunucu kurulumunun geri kalanını kapsar.

Muse Glimmer GPU olmadan çalıştırılabilir mi?

Evet, ancak performans sınırları konusunda açık olmak gerekir. Bir token üretmek, model ağırlıklarının bellekten okunması anlamına gelir; bu nedenle hız, planın sunduğu vCPU sayısından ziyade bellek bant genişliği ile belirlenir. Birkaç çekirdekten sonra, daha fazla çekirdek eklemek performansa çok az katkı sağlar. Paylaşımlı bir VPS üzerinde bu bant genişliği, sunucudaki diğer tüm kiracılarla paylaşıldığından, 4-bit seviyesindeki 30B bir model saniyede çok az sayıda token üretir.

Bu konuda kimsenin verdiği rakamı, benimkiler dahil, doğrudan kabul etmeyin. Kendi sunucunuzda saniyedeki token sayısını ölçün ve elde ettiğiniz sonuca göre karar verin.

Sonuç, modelin kullanım alanları açısından net bir ayrım yaratır. Etkileşimli sohbet oldukça zahmetlidir; çünkü okuma hızınız sunucunun yazma hızından yüksektir ve her yanıt uzun bir duraksama ile başlar. Arka plan ajan görevleri ise sorunsuzdur; çünkü on dakika boyunca denetimsiz çalışan bir görev için yavaşlık bir engel teşkil etmez. Meta'nın bu model için tanımladığı kullanım senaryosu tam olarak bu ikinci iş yüküdür.

Etkileşimli bir hız gerekiyorsa, dürüst iki seçenek GPU veya barındırılan bir API kullanmaktır. Herhangi bir kiralama yapmadan önce GPU VPS ile API token maliyetleri arasındaki başa baş noktasını hesaplayın ve bir GPU VPS'in size gerçekte neler sağladığını inceleyerek ne satın aldığınızı anlayın. Belirli bir sunucunun kapasitesine dair daha geniş bir soru için kendi sunucunuzda barındırabileceğiniz modeller listesinden başlayın; benzer boyuttaki bir Qwen modelini VPS üzerinde çalıştırmak ise bu boyut sınıfındaki en yakın karşılaştırmayı sunar.

Neden 128K token dolmadan önce hatırladıklarını unutuyor?

Çünkü Ollama'nın varsayılan bağlam penceresi, model neyi desteklerse desteklesin 4096 tokendır. Bu varsayılan değer, Ağustos 2026 itibarıyla Ollama'nın kendi FAQ bölümünde yer almaktadır. Etiket 128K değerini duyursa da, siz aksini belirtmediğiniz sürece sunucu modele 4096 token sağlar; bu nedenle uzun bir aracı transkripti ilk kısımlarını kaybeder ve model amnezi yaşıyormuş gibi görünür.

Sunucu tarafında her istek için bu değeri yükseltin:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

Etkileşimli bir oturumun içinde, /set parameter num_ctx 32768 değeri yalnızca o oturum için değiştirir. API üzerinden ise, istek seçenekleri içerisinde num_ctx gönderin.

Her bir fazladan bağlam tokenı, ağırlıkların üzerine ek olarak bellek tüketir. Sadece ağırlıklar için boyutlandırılmış bir makinede 128K'nın tamamını isterseniz yükleme başarısız olur veya daha yavaş bir işleme biçimine geri döner. Değeri kademeli olarak artırın ve her adımdan sonra ollama ps komutunu çalıştırın. Ollama'da num_ctx ve bağlam uzunluğu nasıl çalışır başlıklı yazı, bu hesaplamaların detaylarını açıklamaktadır.

Akıl yürütme gücü: low, medium, high ve xhigh

Meta, Muse Glimmer için low seviyesinden xhigh seviyesine kadar dört farklı akıl yürütme gücü tanımlar ve karmaşık kodlama ile ajan görevleri için en yüksek iki seviyenin kullanılmasını önerir. Ollama içerisinde bu ayar think parametresi üzerinden yönetilir. Komut satırında --think= bayrağını kullanın veya API gövdesinde think parametresini gönderin.

ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"

Etkileşimli bir oturum sırasında /set think ve /set nothink komutları bu ayarı değiştirir. Ollama belgelerine göre çoğu model boolean bir değer veya low, medium, high gibi bir seviye kabul eder; bazı modeller ise en yüksek seviye için max değerini destekler. Bu modelin tam olarak hangi dizeleri kabul ettiği model sayfasında belirtilmiştir; bu nedenle tahmin yürütmek yerine ilgili sayfayı okuyun ve bir ajana entegre etmeden önce manuel olarak test edin.

Sadece CPU kullanılan bir sunucuda bu ayar performansı doğrudan etkiler. Daha yüksek bir güç seviyesi, yanıtın ilk kelimesi görünmeden önce daha fazla düşünme token'ı üretilmesi anlamına gelir ve bir düşünme token'ı, yanıt token'ı ile aynı sürede işlenir. Rutin işler için ayarı low seviyesinde bırakın.

Modeli her zaman aktif bir ajan için bellekte tutma

Ollama, boşta kalan bir modeli varsayılan olarak beş dakika sonra bellekten kaldırır. Her on dakikada bir tetiklenen bir ajan için bu, her çalıştırmada diskten 18 GB boyutunda tam bir yükleme yapmak anlamına gelir; ağ tabanlı depolama birimine sahip bir VPS üzerinde bu yükleme işlemi hızlı gerçekleşmez. Bunun yerine modeli belleğe sabitleyin.

[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"

Negatif bir değer, modelin başka bir işlem tarafından kaldırılana kadar bellekte kalmasını sağlar; bir API isteğindeki keep_alive parametresi ise sunucunun varsayılan ayarını yalnızca o çağrı için geçersiz kılar. Bunun maliyeti açıktır: hiçbir işlem yapılmadığı sırada da RAM işgal altında kalır, bu nedenle bu ayar yalnızca ajana ayrılmış bir sunucu için uygundur. Bir Ollama modelini bellekte tutma dokümanı, bu konudaki farklı yöntemleri kapsamaktadır.

Bir kodlama aracını bu yapıya yönlendirme

Ollama, http://127.0.0.1:11434/v1 adresinde OpenAI uyumlu bir API sunar; bu nedenle çoğu araç, bir temel URL ve boş olmayan herhangi bir API anahtarı ile bağlantı kurabilir. Ollama'nın Muse Glimmer sayfası, desteklenen bir aracı tek bir komutla yerel bir modele bağlayan bir başlatma kısayolunu da belgeler; buradaki etiketi de sabitlemeniz önerilir.

ollama launch claude --model muse-glimmer:30b

Araçlar büyük istemler (prompt) gönderir. Dosya içerikleri, araç çıktıları ve sürekli büyüyen bir transkript, girdi belirteçleri (token) olarak ulaşır. CPU tabanlı bir sunucuda, üretim aşaması başlamadan önce istem işleme süreci sistemi en çok zorlayan kısımdır. Bağlam ayarını görevin izin verdiği ölçüde küçük tutun. Bir kodlama aracını Ollama'ya yönlendirme istemci tarafını, bir VPS üzerinde kodlama aracı çalıştırma aracın barındığı sunucuyu ve bir VPS üzerinde araç maliyetlerini kontrol etme ise aracın gün boyu çalışması durumunda neler yaşanacağını ele alır.

Görüntü girdisi de aynı şekilde çalışır. Ollama API, görüntüleri bir mesajın images alanında kabul eder; bu nedenle, algı kodlayıcısı ne kadar yetenekli olursa olsun, yalnızca metin destekleyen bir istemci asla görüntü gönderemez.

11434 numaralı portu dışarıya açmayın

Ollama API üzerinde kimlik doğrulama mekanizması bulunmamaktadır. OLLAMA_HOST=0.0.0.0:11434 ayarını yaparak servisi dizüstü bilgisayarınızdan erişilebilir hale getirmek, kimlik doğrulaması olmayan bir model çalıştırıcısını genel internete açmak anlamına gelir. Bu durumda, servisi bulan herhangi biri diskinize modeller yükleyebilir ve ajanınızın bu servis üzerinden gönderdiği tüm verileri okuyabilir. Servisi localhost üzerinde dinlemeye bırakın ve bunun yerine bir tünel kullanın.

ssh -N -L 11434:127.0.0.1:11434 user@your-vps

Ollama API uç noktasının güvenliğini sağlama bölümü, kimlik bilgisi talep eden bir reverse proxy kullanımı da dahil olmak üzere uygun seçenekleri kapsamaktadır.

Neler bozulur ve ne ile karşılaşırsınız

Çekme işlemi yarıda durur. Disk. Model dizini üzerinde df -h komutunu çalıştırın. 57 GB boyutundaki bir bf16 derlemesi 40GB'lık bir kök dizine sığmaz; aynı şekilde yan yana iki adet 8-bit etiket de sığmayacaktır.

Model yüklenir ve ardından süreç sonlanır. Bellek yetersizliği. dmesg -T, çekirdeğin bellek yetersizliği nedeniyle bir süreci sonlandırdığını (OOM killer) kaydeder; journalctl -u ollama -n 100 ise aynı olayın servis tarafındaki yansımasını gösterir. Çözüm, daha küçük bir etiket veya daha küçük bir num_ctx kullanmaktır. Çözüm daha fazla swap alanı eklemek değildir.

Token başına saniyeler süren bir hızla çalışır. vmstat 1 komutunu çalıştırın ve si ile so sütunlarını izleyin. Sürekli swap etkinliği, ağırlıkların RAM'e sığmadığını ve sistemin işlem yaparken bunları sürekli diskten okuduğunu gösterir.

Geçen hafta çalışan bir etiket artık yok. Etiket listeleri değişebilir. Model sayfasını tekrar okuyun, güncel olanı sabitleyin ve etiket adını tekrar bakabileceğiniz bir yere kaydedin.

Çekme işleminden önce boyutları kendiniz tekrar kontrol edin

Tablodaki boyutlar 16 Ağustos 2026 tarihinde modelin etiket sayfasından alınmıştır; yayınlanan bir etiket listesi garanti teşkil etmez. Model sayfasındaki güncel listeyi okuyun ve ardından diskinize gerçekte ne kadar veri indiğini doğrulayın:

ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/models

Ollama, model katmanlarını paylaşımlı blob'lar olarak saklar; bu nedenle aynı katmanı paylaşan iki etiket, diskte iki kat yer kaplamaz. du komutunun bildirdiği değerleri yayınlanan boyutla karşılaştırın ve disk planlamanızı bu iki değerden büyük olanına göre yapın.

FAQ

Muse Glimmer bir VPS üzerinde ne kadar RAM gerektirir?

Etiket boyutundan başlayın ve bağlam penceresini (context window) ekleyin. Varsayılan etiket 16 Ağustos 2026 itibarıyla yaklaşık 18 GB olarak listelenmiştir; bu nedenle 16GB bir sunucu bunu hiç barındıramaz, 24GB bir sunucu ise bağlam için çok az boş alan bırakarak barındırır. Bunu bir cevap değil, başlangıç noktası olarak kabul edin. Etiketi çekin, bir kez yükleyin, ardından kendi sunucunuzda ollama ps ve free -h komutlarını çalıştırarak kendi değerlerinizi okuyun. Daha uzun bağlam ve eşzamanlı istekler, ağırlıkların üzerine ek bellek yükü getirir.

Muse Glimmer'ı GPU olmadan çalıştırabilir miyim?

Evet. Sadece CPU içeren bir VPS üzerinde yüklenir ve yanıt verir. Üretim hızı çekirdek sayısından ziyade bellek bant genişliği ile sınırlıdır ve paylaşımlı bir sunucuda bu bant genişliği paylaşıldığı için 4-bit seviyesinde saniyede düşük sayıda token üretimi beklemelisiniz. Bu, arka planda gözetimsiz çalışan aracı işleri için kullanılabilir, ancak interaktif sohbet için yavaştır. Bir istek sırasında ollama ps komutunu çalıştırın ve işlemin nerede yürütüldüğünü doğrulamak için işlemci sütununu inceleyin.

MLX etiketleri bir Linux VPS üzerinde işe yarar mı?

Hayır. Adında mlx bulunan her etiket, Ollama'nın Apple Silicon arka ucu olan MLX motoru için oluşturulmuştur. x86 Linux sunucularda bu etiketler çalıştıramayacağınız büyük boyutlu indirmelerdir. Sade 30b etiketini veya MLX olmayan diğer etiketlerden birini kullanın ve MLX sürümleriyle birlikte sunulan Apple donanım kıyaslama sonuçlarını dikkate almayın.

Model neden 128K token sınırına ulaşmadan çok önce bir şeyleri unutuyor?

Çünkü model neyi desteklerse desteklesin, Ollama'nın varsayılan bağlam penceresi 4096 tokendır; bu nedenle sunucu, uzun konuşmaları model onları görmeden önce keser. Sunucuda OLLAMA_CONTEXT_LENGTH ayarını yapın, tek bir oturum için /set parameter num_ctx kullanın veya API istek seçenekleri içinde num_ctx gönderin. Bellek kullanımı bununla birlikte artar, bu yüzden değeri kademeli olarak yükseltin ve her seferinde ollama ps ile kontrol edin.

Etiketi sabitlemeli miyim yoksa sadece latest mı kullanmalıyım?

Sabitleyin. Etiketsiz muse-glimmer, yayıncının herhangi bir zamanda farklı bir sürüme yönlendirebileceği bir işaretçi olan latest değerine çözümlenir; bu nedenle rutin bir çekme işlemi, aracınızın üzerinde çalıştığı modeli değiştirebilir. Betiklerde, unit dosyalarında ve aracı yapılandırmalarında muse-glimmer:30b yazın. Sabitlemeden önce model sayfasındaki etiket listesini kontrol edin, çünkü yayınlanan etiketler değişebilir.