VPS üzerinde GLM 5.2 çalıştırma rehberi
Ollama kütüphanesindeki GLM 5.2 modeli sadece bulut tabanlıdır ve 378 GB RAM gerektirir. VPS sisteminizde çalışabilecek alternatif GLM modelini ve RAM gereksinimlerini öğrenin.
GLM 5.2 bir VPS üzerinde çalıştırılabilir mi?
Hayır; herhangi bir kiralama işlemi yapmadan önce bunun nedenini bilmek önemlidir. 18 Ağustos 2026 itibarıyla, Ollama kütüphanesindeki GLM 5.2 tam olarak bir etikete sahiptir: glm-5.2:cloud. :cloud etiketi, Ollama'nın sunucularında çalışır. Sunucunuz istemi gönderir ve token'ları alır; bu nedenle ağırlıklar diskinize asla dokunmaz. Model 756 milyar parametrelidir. 756 milyar parametrenin her biri için dört bit, yaklaşık 378 GB ağırlık demektir; bu hesaplama bağlam, aktivasyonlar veya işletim sistemi hesaba katılmadan yapılan basit bir aritmetiktir. Hiçbir standart VPS planı bu kadar bellek sunmaz.
Kiraladığınız bir sunucuya sığabilecek GLM modeli glm-4.7-flash modelidir. Bu model, 4 etikette indirilebilir ağırlıklarla yayınlanmıştır. Bu, uzmanların karışımı (mixture-of-experts) yapısında bir modeldir; yani her token için ağın yalnızca küçük bir kısmı çalışır. Z.ai bunu 30B-A3B olarak tanımlar: toplamda 30 milyar parametre, token başına yaklaşık 3 milyar aktif parametre. Dolayısıyla bu rehber, üzerinde işlem yapabileceğiniz soruyu yanıtlar. Bir etiketi sabitleyin, sunucuyu boyutlandırın, kendi hızınızı ölçün ve uç noktayı gizli tutun.
Herhangi bir komutu kopyalamadan önce etiketi doğrulayın; buradakiler de dahil. Ollama kütüphanesi bildirim yapılmaksızın değişebilir. glm-4.7-flash etiket listesini açın ve etiketin hala mevcut olduğunu onaylayın. Yerel ağırlıklara sahip daha yeni bir GLM sürümü çıktıysa onu tercih edin ve test ettiğiniz etiketi kaydedin.
Yine de GLM 5.2'nin kendisini istiyorsanız, ollama signin sonrasında ollama run glm-5.2:cloud çalışır ve istemci tarafında diğer tüm Ollama modelleri gibi davranır. Neyi kabul ettiğinizi anlayın: istem sunucunuzdan ayrılır. Self-host etme nedeniniz verilerin makinenizde kalması zorunluluğu ise, :cloud etiketi bu gereksinimi karşılamaz.
Hangi GLM etiketleri mevcut ve hangisi sabitlenmeli
Burada üç resmi GLM girdisi önem taşır. glm-5.2 ve glm-5.1 yalnızca bulut tabanlıdır. glm-4.7-flash yerel sürümdür ve aşağıda, Ollama'nın her biri için listelediği indirme boyutlarıyla birlikte yayınlanmış etiketleri yer almaktadır.
The data behind this chart
[
{
"label": "q4_K_M",
"download_gb": 19
},
{
"label": "latest",
"download_gb": 19
},
{
"label": "q8_0",
"download_gb": 32
},
{
"label": "bf16",
"download_gb": 60
}
]Bunlar kütüphane sayfasındaki yayınlanmış verilerdir, ölçüm sonuçları değildir. latest ve q4_K_M etiketlerinin her ikisi de 19 GB olarak listelenmiştir, bu nedenle latest şu anda Q4 sürümüne karşılık gelmektedir. Bu durum her yeniden yayınlamada değişebilir; bu yüzden bir betik veya Dockerfile içerisine asla çıplak bir ollama pull glm-4.7-flash yazmamalısınız. Kuantizasyon adını belirtin. En büyük etiket olan bf16, kuantize edilmemiş bfloat16 ağırlıklarını içeren 60 GB boyutunda bir indirmedir.
Kütüphanede yapılan bir arama, someuser/glm-5.2 gibi isminde eğik çizgi (slash) bulunan ad alanı (namespaced) yüklemelerini de döndürür. Eğik çizgi, içeriğin bir kullanıcı hesabı tarafından yayınlandığını gösterir; yani bu, resmi bir girdi değil, topluluk tarafından yapılan bir yeniden yüklemedir. İçerisinde hangi ağırlıkların olduğu konusunda hiçbir garanti yoktur. Bu tür bir dosyaya, internette bulduğunuz herhangi bir imzalanmamış ikili dosyaya nasıl yaklaşıyorsanız öyle yaklaşın.
Ollama kurulumu ve tam etiket çekme
Ollama Linux yükleyicisi tek bir komuttan oluşur.
curl -fsSL https://ollama.com/install.sh | sh
ollama --versionYükleyici, ollama kullanıcısı olarak çalışan bir systemd servisi oluşturur. Herhangi bir işlem yapmadan önce servisin başladığını doğrulayın.
systemctl status ollama --no-pagerActive: active (running), API'nin 11434 numaralı portu dinlediği anlamına gelir. Eğer birim mevcut değilse, yükleyici standart bir binary kurulumuna dönmüştür; bu durumda Ollama Linux belgeleri servis dosyasını manuel olarak oluşturmanız için gerekli bilgileri sağlar.
glm-4.7-flash sayfası, minimum Ollama sürümünü listeler. Eski bir binary modeli yavaş çalıştırmaz, doğrudan reddeder: çekme işlemi, modelin daha yeni bir Ollama sürümü gerektirdiğine dair bir mesajla başarısız olur. Yükseltme yapmak için kurulum betiğini tekrar çalıştırın. 18 Ağustos 2026 itibarıyla güncel sürüm 0.32.14'tür ve bu sürüm belirtilen minimum gereksinimin üzerindedir.
Şimdi ismiyle bir etiket çekin.
ollama pull glm-4.7-flash:q4_K_M
ollama lsollama ls, glm-4.7-flash:q4_K_M öğesini 19 GB'a yakın bir boyutla listelemelidir. Yarıda kesilen bir çekme işlemi çalıştırılabilir hiçbir dosya bırakmaz, bu nedenle aynı komutu tekrar çalıştırın. Küçük bir planda başarısız olan çekme işleminin en yaygın nedeni ağ sorunu değil, disk doluluğudur; çünkü model kök dosya sistemindeki /usr/share/ollama/.ollama/models dizinine yazılır. Başlamadan önce df -h /usr/share/ollama ile kontrol edin.
Her bir kuantizasyon seviyesi ne kadar RAM gerektirir?
İşe indirme boyutunu bir taban değeri olarak kabul ederek başlayın ve üzerine ekleme yapın. Ağırlıkların bellekte yerleşik olması gerekir. Bunların üzerinde, çalışma zamanının konuşmadaki mevcut token'ları hatırlamak için kullandığı bellek olan KV cache (anahtar/değer önbelleği), hesaplama tamponları ve işletim sisteminin kullandığı diğer kaynaklar bulunur. Tam olarak 19 GB RAM'e sahip bir kutu, 19 GB etiketli modeli çalıştıramaz.
Herkes için geçerli olan tek bir çarpan yoktur; çünkü KV cache, izin verdiğiniz bağlam uzunluğuyla birlikte büyür ve geri kalan kısım çalışma zamanı sürümleri arasında değişiklik gösterir. Bu nedenle tahmin etmek yerine ölçüm yapın. Modeli basit bir komutla yükleyin ve ardından sunucunun ne kadar bellek ayırdığını kontrol edin.
ollama run glm-4.7-flash:q4_K_M "Reply with the single word: ready"
ollama psollama ps, yüklenen modeli SIZE sütunu ve PROCESSOR sütunu ile birlikte yazdırır. SIZE, çalışma zamanının fiilen ayırdığı miktardır ve planınızla karşılaştırmanız gereken sayı budur. PROCESSOR, işlemin nerede gerçekleştiğini belirtir; dolayısıyla 100% CPU, hiçbir GPU'nun dahil olmadığı anlamına gelir.
Model sığmadığında hata sessizce gerçekleşir ve iki şekilde ortaya çıkar. Swap etkinleştirilmişse yükleme başarılı gibi görünür ancak her token için sayfalar disk ile RAM arasında taşındığı için üretim süreci aşırı yavaşlar. Swap yoksa süreç doğrudan sonlandırılır ve journalctl -k | grep -i "out of memory", çekirdeğin ollama ifadesini içeren Out of memory: Killed process satırını gösterir. Her ikisini de kontrol edin, çünkü terminalde yazdığınız komut satırında faydalı bir hata mesajı görüntülenmez.
19 GB Q4 etiketinden 32 GB Q8 etiketine geçiş, bu sayı üzerinde sahip olduğunuz temel kontrol mekanizmasıdır. Q4, çıktı kalitesinden bir miktar ödün vermenize neden olur; bunun boyutu göreve bağlıdır. Yapılandırılmış çıktılar ve uzun mantık yürütme zincirleri, gündelik sohbetlere kıyasla bu durumdan daha fazla etkilenir. Q4, Q8 ve FP16'nın pratikteki farkları başlıklı bölümü, karar vermeden önce okumanızda fayda vardır; çünkü yalnızca CPU kullanılan bir VPS üzerinde kuantizasyon tercihi, genellikle modelin çalışıp çalışmayacağını belirleyen temel faktördür.
Sadece CPU içeren bir VPS üzerinde ne olur
Çoğu VPS planı GPU içermez ve Ollama, sizi uyarmadan modeli CPU üzerinde çalıştırır. Sonucun kullanılabilir olup olmadığı, iş yüküne ve sabrınıza bağlıdır.
Mixture-of-experts tasarımı hız konusunda yardımcı olur. 30 milyar parametrenin sadece yaklaşık 3 milyarı herhangi bir token için kullanılır, bu nedenle token başına düşen aritmetik işlem, yoğun bir 30B modelinin gerektireceğinden çok daha azdır. Azalmayan tek şey bellektir. Yönlendirici bir sonraki token için herhangi bir uzmanı seçebileceğinden, her uzman bellekte kalmalıdır. Bu nedenle, sadece CPU içeren bir sunucu, Q4 etiketi için yine de 19 GB veya daha fazlasına ihtiyaç duyar ve verimliliği saat hızından ziyade bellek bant genişliği tarafından belirlenir.
Bunun pratik bir sonucu vardır: aynı çekirdek sayısına ve aynı RAM miktarına sahip iki plan, bellek altsistemleri farklı olduğu için gözle görülür şekilde farklı hızlarda üretim yapabilir. Paylaşımlı bir plan ikinci bir değişken ekler; çünkü gürültülü bir komşudan kaynaklanan CPU çalınma süresi, saatten saate değişen saniye başına token değeri olarak kendini gösterir. Başkalarının yayınladığı rakamların sizinkini tahmin edememesinin ve bir sonraki bölümün bir sonuç tablosu yerine bir ölçüm tarifi olmasının nedeni budur.
Kendi saniye başına token değerinizi ölçün
Ollama'nın generate uç noktası, nihai JSON nesnesi içerisinde zamanlama alanları döndürür. Üretilen token sayısını üretim süresine böldüğünüzde, kendi planınız ve isteminiz (prompt) üzerindeki değerinize ulaşırsınız.
sudo apt install -y jq
curl -s http://localhost:11434/api/generate -d '{
"model": "glm-4.7-flash:q4_K_M",
"prompt": "Write a 200 word explanation of how TCP congestion control works.",
"stream": false,
"options": {"num_ctx": 8192}
}' | jq '{
tokens: .eval_count,
tokens_per_second: (.eval_count / .eval_duration * 1e9),
prompt_seconds: (.prompt_eval_duration / 1e9),
load_seconds: (.load_duration / 1e9)
}'eval_count üretilen token sayısını, eval_duration ise bu üretimin gerçekleşmesi için harcanan nanosaniye değerini ifade eder; dolayısıyla eval_count / eval_duration * 1e9 saniye başına düşen token sayısıdır. prompt_eval_duration, isteminizin okunması için geçen süreyi kapsar; bu süre, bir kullanıcının ilk token görünene kadar beklediği "ilk yanıt süresi" deneyimidir. load_duration ise modelin diskten yüklenmesi için harcanan süredir; bu nedenle yeniden başlatma sonrası yapılan ilk çağrıda yüksek, sonraki çağrılarda ise sıfıra yakındır.
Testi üç kez çalıştırın ve ikinci ile üçüncü sonuçları baz alın, çünkü ilk sonuç yükleme süresini de içerir. Ardından testi çok daha uzun bir istemle tekrar çalıştırın; çünkü istem işleme süresi girdi uzunluğuyla ölçeklenirken, üretim hızı ölçeklenmez. Elde ettiğiniz sayıları plan adınızın ve kuantizasyon değerinizin yanına not edin. Bu kayıt, okuduğunuz herhangi bir kıyaslama (benchmark) testinden daha değerlidir, çünkü ödemesini yaptığınız donanım üzerinde ölçülmüştür.
Bağlam uzunluğu belleği nasıl katlar
Ollama varsayılan olarak 4096 token'lık bir bağlam kullanır. Model, glm-4.7-flash için 198K token gibi çok daha yüksek değerler sunsa da, bu değer varsayılan olarak gelmez ve etkinleştirilmesinin bir maliyeti vardır.
KV önbelleği, her katmandaki her token için bir anahtar vektörü ve bir değer vektörü tutar. Boyutu, izin verdiğiniz token sayısıyla doğrusal olarak artar. 4096'dan 32768 token'a çıkmak, bağlamı sekiz katına çıkarır; dolayısıyla KV önbelleği de yaklaşık sekiz katına çıkar. Yalnızca ağırlıkları sığdıracak boyuttaki bir sunucuda, bu ek bellek tahsisi sizi doğrudan swap alanına iter. Kısa istemlere düzgün yanıt veren bir makinenin, uzun bir belge yapıştırıldığında aniden yavaşlamasının nedeni budur.
Bu değeri, yukarıdaki curl komutunda olduğu gibi options nesnesi içindeki num_ctx parametresiyle istek bazında ayarlayabilir veya sunucu varsayılanını değiştirebilirsiniz.
sudo install -d -m 755 /etc/systemd/system/ollama.service.d
printf '[Service]\nEnvironment="OLLAMA_CONTEXT_LENGTH=16384"\n' \
| sudo tee /etc/systemd/system/ollama.service.d/override.conf
sudo systemctl daemon-reload
sudo systemctl restart ollama
systemctl show ollama --property=EnvironmentSon komut, OLLAMA_CONTEXT_LENGTH değerinizi yazdırmalıdır. Eğer boş bir Environment= çıktısı alıyorsanız, geçersiz kılma dosyası yanlış dizindedir veya yeniden yükleme işlemi atlanmıştır. Bir sonraki model yüklemesinden sonra ollama ps, 4096 değerindekine kıyasla gözle görülür biçimde daha büyük bir SIZE göstermelidir. Değeri kademeli olarak artırın ve her seferinde bu sayıyı izleyin. Ollama bağlam uzunluğunu num_ctx ile ayarlama bölümü, bu ayarın keep-alive ve paralel isteklerle nasıl etkileşime girdiğini açıklar; her ikisi de aynı maliyeti katlar.
API'nin kutudan daha ucuz olduğu durumlar
Self-hosting (kendi sunucunuzda barındırma) otomatik olarak daha ucuz değildir; bu aile için yayınlanan liste fiyatları durumu alışılmadık derecede net bir şekilde ortaya koymaktadır.
The data behind this chart
[
{
"label": "GLM-5.2 input",
"usd_per_million_tokens": 1.4
},
{
"label": "GLM-5.2 output",
"usd_per_million_tokens": 4.4
},
{
"label": "GLM-4.7-Flash input",
"usd_per_million_tokens": 0
},
{
"label": "GLM-4.7-Flash output",
"usd_per_million_tokens": 0
}
]18 Ağustos 2026 itibarıyla Z.ai, GLM-5.2 modelini milyon girdi token'ı başına $1.4 ve milyon çıktı token'ı başına $4.4 fiyatla listelemektedir. Bu kılavuzun yerel olarak çalıştırdığı model olan GLM-4.7-Flash ise her iki yönde de $0 fiyatla listelenmektedir. Bunlar yayınlanan fiyatlardır ve değişkenlik gösterebilirler; bu nedenle bir bütçe planlaması yapmadan önce güncel sayfayı kontrol edin.
Dolayısıyla, şu an için self-hosting glm-4.7-flash lehine olan maliyet argümanı zayıftır. Yeterli RAM kapasitesine sahip bir VPS her ay gerçek bir maliyet oluştururken, yayıncı aynı modeli ücretsiz olarak sunmaktadır. Kendi sunucunuzda çalıştırarak satın aldığınız şey farklıdır: istemleriniz kontrolünüz altındaki bir makinede kalır ve siz değiştirmediğiniz sürece model sürümü asla değişmez. Bunlar self-hosting için geçerli nedenlerdir. Ancak bu model ve bu fiyatlar için maliyet, bu nedenlerden biri değildir.
İstediğiniz model ücretsiz olmadığında veya verilerinizin yasal olarak kendi ağınızın dışına çıkamaması gerektiği durumlarda hesaplama değişir. GPU VPS ile API token'ları arasındaki başa baş noktası, her değişkeni isimlendirerek bu hesaplamayı detaylandırmaktadır. Eğer hala makine seçimi aşamasındaysanız, bir VPS'in aylık gerçek maliyeti toplamın diğer yarısını oluşturmaktadır.
Uç noktayı localhost üzerinde tutun
Bu adım, kullanıcıların genellikle atladığı ancak en kritik olan kısımdır.
Ollama varsayılan olarak 11434 numaralı portta 127.0.0.1 adresine bağlanır, bu nedenle yalnızca sunucunun kendisinden erişilebilir durumdadır. Varsayımda bulunmak yerine bunu kendi sisteminizde doğrulayın.
ss -ltnp | grep 11434Görmeniz gereken çıktı 127.0.0.1:11434 şeklindedir. 0.0.0.0:11434 veya *:11434 çıktısını görmek, API'nin genel ağ arayüzü dahil olmak üzere tüm arayüzlerde dinleme yaptığı anlamına gelir.
Bu durum önemlidir çünkü Ollama API'sinde kimlik doğrulama yoktur. Parola, token veya izin verilenler listesi bulunmaz. 11434 numaralı porta erişebilen herkes modellerinizi listeleyebilir, ödemesini yaptığınız donanım üzerinde üretim çalıştırabilir, diskiniz dolana kadar yeni modeller indirebilir ve mevcut olanları silebilir. 11434 numaralı port sabit ve bilinen bir port olduğu için tarayıcılar açık olanları hızla tespit eder.
OLLAMA_HOST=0.0.0.0 ayarını yapmayın. Birçok rehber, dizüstü bilgisayarınızdaki bir istemci bağlanamadığında çözüm olarak bunu önerir ancak bu yanlış bir yöntemdir. Bunun yerine portu yönlendirin.
ssh -N -L 11434:127.0.0.1:11434 you@your-serverBu komut, dizüstü bilgisayarınızdaki 11434 numaralı portu SSH üzerinden sunucunun loopback adresine eşler; böylece http://localhost:11434 için yapılandırılmış herhangi bir istemci değişiklik yapılmadan çalışır ve dışarıya yeni bir şey açılmaz. Birden fazla kişi veya makine için sunucuyu özel bir tünel ağına alın ve Ollama'yı asla 0.0.0.0 adresine değil, tünel adresine bağlayın.
Sunucu dışındaki bir noktadan doğrulama yapın. Dizüstü bilgisayarınızdan, SSH tüneli kapalıyken:
curl -m 5 http://your-server-ip:11434/api/tagscurl: (28) Connection timed out veya curl: (7) Failed to connect doğru sonuçtur. Modellerinizin JSON listesini görüyorsanız port internete açıktır ve derhal düzeltilmesi gerekir. Sağlayıcınızın ağ güvenlik duvarı, sunucu üzerinde çalışan güvenlik duvarından ayrı bir denetim mekanizmasıdır, bu nedenle her ikisini de kontrol edin. VPS barındırmanın güvenli olup olmadığına dair daha geniş kapsamlı soru konusu, çalışır durumda bıraktığınız bir makine için temel güvenlik önlemlerinin geri kalanını kapsar.
glm-4.7-flash hala çok büyükse
Q4 etiketi planınıza sığmadığında çözüm, bağlamı küçültmek değil, daha küçük bir model kullanmaktır. Modeli sığdırmak için bağlamı kesmek, yüklenen ancak ilk uzun istemde başarısız olan bir yapıya neden olur. 8B ve 27B boyutlarında Qwen 3 kurulumu mütevazı sunuculara uygun boyutlarda aynı kurulum yolunu izler; Ollama ile VPS üzerinde LLM barındırmaya dair genel kılavuz ise hangi modeli seçerseniz seçin değişmeyen kısımları ele alır. Hangi modelde karar kılarsanız kılın, etiketi sabitleyin, kendi planınız üzerinde ölçüm yapın ve uç noktayı loopback üzerinde bırakın.
FAQ
GLM 5.2 bir VPS üzerinde yerel olarak çalıştırılabilir mi?
Hayır. 18 Ağustos 2026 itibarıyla GLM 5.2, Ollama kütüphanesinde yalnızca glm-5.2:cloud olarak mevcuttur; bu etiket Ollama'nın kendi altyapısında çalışır ve çalışması için ollama signin gerektirir. Model 756 milyar parametrelidir; bu nedenle parametre başına dört bitlik sıkıştırmada bile ağırlıklar yüzlerce gigabayta ulaşır ve standart bir VPS planının sunduğu kapasiteyi fazlasıyla aşar. Kiralık bir sunucuya sığabilecek indirilebilir ağırlıklara sahip GLM modeli glm-4.7-flash'tür.
glm-4.7-flash ne kadar RAM gerektirir?
Etiketin indirme boyutunu bir taban değer olarak kabul edin ve üzerine KV önbelleği ile işletim sistemi için gerekli alanı ekleyin. Ollama, Q4 etiketini 19 GB, Q8 etiketini 32 GB ve bfloat16 etiketini 60 GB olarak listeler. KV önbelleği belirlediğiniz bağlam uzunluğuyla (context length) birlikte büyüdüğü için herkes için geçerli sabit bir çarpan yoktur. Modeli yükleyin, ollama ps komutunu çalıştırın ve kendi sunucunuzdaki gerçek değer için SIZE sütununu okuyun.
Kendi VPS'imde saniye başına üretilen token sayısını nasıl ölçerim?
"stream": false kullanarak http://localhost:11434/api/generate adresine bir istek gönderin, ardından yanıttan eval_count ve eval_duration değerlerini okuyun. eval_duration nanosaniye cinsinden raporlandığı için saniye başına düşen token sayısı eval_count / eval_duration * 1e9 formülüyle hesaplanır. İlk çalıştırmayı dikkate almayın, çünkü o esnada load_duration ağırlıkların diskten okunmasını da içerir. Uzun bir istem (prompt) ile testi tekrarlayın, çünkü prompt_eval_duration girdi uzunluğuyla birlikte artarken üretim hızı sabit kalır.
OLLAMA_HOST değerini neden 0.0.0.0 olarak ayarlamamalıyım?
Ollama API'sinin kimlik doğrulama mekanizması yoktur; bu nedenle onu 0.0.0.0 adresine bağlamak, kimlik doğrulaması gerektirmeyen bir uç noktanın genel internete açılmasına neden olur. 11434 numaralı porta erişen herkes donanımınız üzerinde üretim yapabilir ve yüklü modelleri değiştirebilir. Varsayılan 127.0.0.1 bağlamasını koruyun, ss -ltnp | grep 11434 ile kontrol edin ve API'ye dizüstü bilgisayarınızdan ssh -N -L 11434:127.0.0.1:11434 you@your-server gibi bir SSH tüneli üzerinden erişin.