Ollama ile VPS Üzerinde Qwen 27B Çalıştırma Rehberi
Ollama kütüphanesinde Qwen 3.8 bulunmamaktadır. 27B modelini CPU tabanlı bir VPS üzerinde çalıştırmak için gereken RAM miktarı ve 8 GB ile 64 GB arası sistemlerdeki performans verileri.
Qwen 3.8 27B modelini GPU'suz bir VPS üzerinde çalıştırabilir misiniz?
Qwen 3.8 27B modelini bir VPS üzerinde çalıştırmak için öncelikle mevcut bir model etiketine ihtiyacınız vardır; 4 Ağustos 2026 itibarıyla Ollama kütüphanesinde herhangi bir qwen3.8 girdisi bulunmamaktadır. En yakın yayınlanmış 27B etiketi qwen3.6:27b'dir: 27,8 milyar parametre, Q4_K_M nicemleme (quantisation) ve Apache 2.0 lisansı. Aşağıdaki her komut ve her sayı, 27 Temmuz 2026 tarihinde yayınlanan Ollama v0.32.5 sürümü üzerinde bu etiketi kullanmaktadır.
Kısa cevap, 32 GB veya daha büyük bir VPS üzerinde evet, ancak yavaş bir şekilde çalıştırılabilir. Q4 seviyesindeki 27B yoğun (dense) bir model, tek bir bağlam (context) token'ı bile depolanmadan önce yalnızca ağırlıklar için yaklaşık 17 GB RAM gerektirir. Bu durum, 8 GB ve 16 GB'lık planları tamamen devre dışı bırakır. Yaygın bir çift kanallı DDR4 VPS üzerinde üst sınır yaklaşık 3 token/saniyedir; bu hız çoğu insanın okuma hızından daha yavaştır.
3.8 sayısı nereden geliyor? Büyük olasılıkla parametre sayısından. qwen3.6:27b için Ollama sayfası 27,8B parametre bildirmektedir ve 27,8 sayısını daha sonra 3,8 olarak hatırlamak kolaydır. Ayrıca, önceki sürümden aynı Q4_K_M yapısına sahip bir qwen3.5:27b de mevcuttur. Herhangi bir komutu kopyalamadan önce Ollama qwen3.6 etiket sayfası üzerinden güncel listeyi kontrol edin. Eğer daha sonra gerçek bir qwen3.8 yayınlanırsa, buradaki hesaplama yine geçerli olacaktır; çünkü bu hesaplama sürüm numarasına değil, parametre sayısına ve ağırlık başına bit değerine bağlıdır.
Hangi Ollama etiketinin çekileceği ve nasıl kontrol edileceği
Mevcut olmayan bir etiketi çekmeye çalışmak net bir hata mesajı döndürür, bu nedenle sunucu üzerinde karar vermek oldukça hızlıdır.
ollama pull qwen3.8:27b
# Error: pull model manifest: file does not exist
ollama pull qwen3.6:27b
ollama show qwen3.6:27bollama show komutu, sahip olduğunuz etiket için mimariyi, parametre sayısını, bağlam uzunluğunu ve nicemleme (quantisation) değerini yazdırır. Eğer parametre satırı 27.8B ve nicemleme satırı Q4_K_M değerlerini gösteriyorsa, bu kılavuzun hazırlandığı yapıya sahipsiniz demektir. Kütüphane ayrıca aynı ağırlıklar için daha yüksek hassasiyete sahip qwen3.6:27b-q8_0 ve qwen3.6:27b-bf16 sürümlerini ve CPU üzerinde çok farklı davranış sergileyen MoE (uzman karışımı) modelleri olan bir dizi 35b-a3b etiketini de barındırır. Bunlar hakkında daha fazla bilgi aşağıdadır.
Parametre sayısı, ağırlık başına bayt hesabı
The data behind this chart
[
{
"label": "Q4_K_M",
"size_gb": 17,
"bits_per_weight": 4.89,
"notes": "published tag qwen3.6:27b"
},
{
"label": "Q5_K_M",
"size_gb": 19.8,
"bits_per_weight": 5.7,
"notes": "computed, no library tag exists"
},
{
"label": "NVFP4",
"size_gb": 20,
"bits_per_weight": 5.76,
"notes": "published tag 27b-nvfp4"
},
{
"label": "Q8_0",
"size_gb": 30,
"bits_per_weight": 8.63,
"notes": "published tag 27b-q8_0"
},
{
"label": "BF16",
"size_gb": 56,
"bits_per_weight": 16.1,
"notes": "published tag 27b-bf16"
}
]Formül tek satırdır. Ağırlıkların bayt değeri = parametre sayısı * ağırlık başına bit / 8. Net 4 bit değerinde, 27,8 milyar parametre 13,9 GB eder. Yayınlanan Q4_K_M etiketi 17 GB'tır; bu da pratikte ağırlık başına 4.89 bit değerine denk gelir.
Bu fark bir hata değildir. K-quant formatları, her tensörü nominal genişlikte saklamaz. Sıkıştırma altında en çok kalite kaybına uğrayan tensörler 5 veya 6 bit seviyesinde tutulur; token embedding ve çıktı katmanları ise genellikle Q6_K veya Q8_0 seviyesinde bırakılır. Formattaki isim bir ortalamadır ve bu ortalama 4,9 civarında gerçekleşir. Aynı etki ölçeğin diğer ucunda da görülür: BF16 için 56 GB değeri, sabit 16 bit yerine ağırlık başına 16.1 bit eder; çünkü dosya aynı zamanda meta verileri ve tam hassasiyetli bir embedding tablosunu da barındırır.
Q5_K_M için bu modelde yayınlanmış bir etiket yoktur, bu nedenle 19.8 GB satırı, ölçülmek yerine bu format için alışılagelmiş olan ağırlık başına 5,7 bit üzerinden hesaplanmıştır. Q8_0, Q4 değerini neredeyse ikiye katlayarak 30 GB seviyesine çıkarır. Yalnızca CPU kullanılan bir sistemde bu iki kat artış, token başına bellek trafiğini de iki katına çıkarır; dolayısıyla saniyedeki token hızınızı kabaca yarıya düşürür. Sadece bu nedenle bile Q4_K_M burada doğru varsayılan tercihtir.
Bağlam büyüdükçe KV önbelleğinin maliyeti
Ağırlıklar sabit bir maliyettir. KV önbelleği (anahtar ve değer önbelleği; modelin daha önce gördüğü her token için tuttuğu dikkat durumu), bağlam uzunluğuyla doğru orantılı olarak büyür ve çoğu kullanıcının RAM kapasitesinin tükenmesine neden olan asıl unsurdur.
The data behind this chart
[
{
"label": "4k tokens",
"kv_f16_gb": 1,
"kv_q8_gb": 0.5
},
{
"label": "8k tokens",
"kv_f16_gb": 2,
"kv_q8_gb": 1
},
{
"label": "16k tokens",
"kv_f16_gb": 4,
"kv_q8_gb": 2
},
{
"label": "32k tokens",
"kv_f16_gb": 8,
"kv_q8_gb": 4
},
{
"label": "64k tokens",
"kv_f16_gb": 16,
"kv_q8_gb": 8
},
{
"label": "128k tokens",
"kv_f16_gb": 32,
"kv_q8_gb": 16
}
]Bu rakamlar, Qwen'in bu boyut sınıfındaki yakın tarihli yoğun modellerinde kullandığı yapıyı varsayar: 64 katman, GQA (gruplandırılmış sorgu dikkati) altında 8 anahtar/değer başlığı ve 128'lik bir başlık boyutu. Bu, f16 formatında token başına 256 KiB eder; yani 32k token için 8 GB ve 128k için 32 GB demektir. Benim hesaplamalarıma güvenmek yerine kendi sisteminizi esas alın. Modeli yükleyin ve ağırlıklar, önbellek ve ek yükü tek bir rakam olarak raporlayan ollama ps sütunundaki SIZE değerini okuyun.
Model kartındaki 256K bağlam değerinin bir plan değil, bir manşet olmasının nedeni budur. Bunu f16 formatında doldurmak, ağırlıklar için halihazırda harcanan 17 GB'ın üzerine 64 GB'lık bir önbellek maliyeti ekler. Ollama varsayılan olarak size tam pencereyi sunmaz. Çok daha küçük bir pencere yükler ve siz bunu OLLAMA_CONTEXT_LENGTH ile bilinçli olarak artırırsınız. Artışları kademeli yapın ve her değişiklikten sonra ollama ps değerini kontrol edin.
İki ayar, önbellek kullanımını yarı yarıya veya daha fazla düşürür. OLLAMA_KV_CACHE_TYPE=q8_0, önbelleği 16 bit yerine 8 bit olarak saklar ve 32k token için gereken alanı 8 GB'tan 4 GB'a düşürür. Bu ayar flash attention gerektirir, bu nedenle OLLAMA_FLASH_ATTENTION=1 ayarını da yapın ve değişikliğin uygulandığını varsaymak yerine ollama ps üzerinden düşüşü doğrulayın. OLLAMA_NUM_PARALLEL=1 de aynı derecede önemlidir. Ollama aynı anda birden fazla isteğe hizmet verebilir ve her yuva kendi bağlam dilimini alır; bu nedenle paralellik ayarını varsayılan değerde bırakmak, bütçelediğiniz önbellek miktarını sessizce katlar.
8, 16, 32 ve 64 GB RAM kapasitesinde neler çalışır
The data behind this chart
[
{
"label": "8 GB",
"q4_max_ctx_ktok": 0,
"q8_max_ctx_ktok": 0,
"notes": "Weights alone exceed the box. Use a 4b or 8b model."
},
{
"label": "16 GB",
"q4_max_ctx_ktok": 0,
"q8_max_ctx_ktok": 0,
"notes": "17 GB of weights does not fit in 16 GB of RAM."
},
{
"label": "32 GB",
"q4_max_ctx_ktok": 32,
"q8_max_ctx_ktok": 0,
"notes": "Q4 fits with room to spare. Q8 weights do not fit."
},
{
"label": "64 GB",
"q4_max_ctx_ktok": 128,
"q8_max_ctx_ktok": 64,
"notes": "Both fit. Q8 leaves much less room for context."
}
]Bu iki sayıyı, ağırlıkların yanında f16 önbelleğinde tutulan, işletim sistemi için yaklaşık 1,5 GB boş alan ve küçük bir güvenlik payı bırakılmış, başsız (headless) bir Linux VPS üzerinde barındırılabilecek binlerce token'lık bağlam (context) kapasitesi olarak okuyun. Sıfır değeri, ağırlıkların RAM'e sığmadığını ve dolayısıyla hiçbir şeyin çalışmayacağını ifade eder.
8 GB ve 16 GB kapasiteler sınırda değildir. 17 GB boyutundaki ağırlıklar 16 GB RAM'e sığmaz; bağlam ayarlarını değiştirmek bunu düzeltmez. Swap alanı eklemek de bir çözüm değildir. Ollama, GGUF dosyasını bellek eşlemeli (memory-mapped) olarak kullanır; bu nedenle yerleşik sayfalar (resident pages) RAM'i aştığında çekirdek bunları diskten çıkarıp tekrar okumaya başlar ve her token için diskten gigabaytlarca veri çekilir. Sunucu yüksek iowait durumuna düşer ve saniyede bir token'ın çok altında bir hızla çalışır.
32 GB başlangıç noktasıdır. Ağırlıklar 17 GB yer kaplar ve elinizde yaklaşık 13 GB boş alan kalır; bu da güvenlik payı dahil yaklaşık 32k token'lık f16 bağlamı karşılar. 30 GB boyutundaki Q8_0 ağırlıkları bu seviyeye kesinlikle sığmaz.
64 GB rahat bir kapasitedir. Q4 seviyesi yaklaşık 128k token'lık bağlam için alan bırakır; Q8_0 ağırlıkları ise arkasında yaklaşık 64k token ile sığabilir. Q8 için 64 GB RAM'e yatırım yapmadan önce ne satın aldığınızı netleştirin: zaten yavaş olan bir makinede, yarı hızda biraz daha iyi bir çıktı alırsınız. Çoğu kullanıcı için daha uzun bağlam kapasitesine sahip Q4 daha iyi bir tercihtir.
Bir VPS üzerinde CPU çıkarımı ne kadar hızlıdır?
Yoğun bir modelden tek bir token üretmek, tüm ağırlıkların bellekten bir kez okunması anlamına gelir. Bir kısmının değil, tamamının. Dolayısıyla hız sınırı çekirdek sayınız değil, bellek bant genişliğinin ağırlıkların boyutuna bölümüdür. Q4 nicemlemesinde bu, token başına 17 GB bellek trafiği demektir.
The data behind this chart
[
{
"label": "DDR4-2666, 2 channel",
"mem_bandwidth_gb_s": 42.6,
"ceiling_tok_s": 2.5
},
{
"label": "DDR4-3200, 2 channel",
"mem_bandwidth_gb_s": 51.2,
"ceiling_tok_s": 3
},
{
"label": "DDR5-4800, 2 channel",
"mem_bandwidth_gb_s": 76.8,
"ceiling_tok_s": 4.5
},
{
"label": "DDR4-3200, 8 channel",
"mem_bandwidth_gb_s": 204.8,
"ceiling_tok_s": 12
},
{
"label": "DDR5-4800, 12 channel",
"mem_bandwidth_gb_s": 460.8,
"ceiling_tok_s": 27.1
}
]Bunlar ölçüm değil, üst sınırlardır. Bellek gecikmesi ve kusurlu ön getirme (prefetching) nedeniyle teorik zirveye asla ulaşılamadığından, gerçek çıktı gösterilen değerin yaklaşık yüzde 50 ila 70'i civarında gerçekleşir. Çift kanallı DDR4-3200 bir VPS, saniyede 3 token üst sınırına sahiptir, bu nedenle yaklaşık 2 token beklenmelidir. Çift kanallı DDR5-4800 bir sunucu ise 4.5 üst sınırına sahiptir, bu nedenle yaklaşık 3 token beklenmelidir.
Büyük sunucu grupları bir uyarı ile gelir. On iki kanallı bir EPYC platformu 460.8 GB/s bant genişliğine ve saniyede 27.1 token üst sınırına sahiptir, ancak siz tüm bir EPYC sunucusunu kiralamazsınız. Bellek bant genişliği, o makinedeki tüm kiracılar tarafından paylaşılan sunucu genelinde bir kaynaktır; bu nedenle 8 vCPU'luk bir dilim, on iki kanallı özel bir bant genişliği ile gelmez. GPU odaklı kılavuzlar bunu tamamen atlar; aynı vCPU sayısına sahip iki VPS planının aynı model üzerinde üç kat fark göstermesinin nedeni budur.
Daha fazla vCPU, aynı nedenden dolayı erken bir aşamada fayda sağlamayı bırakır. Çekirdekler veriyi bellek denetleyicisinin iletebileceğinden daha hızlı talep ettiğinde, ek iş parçacıkları (threads) sadece zamanlama yükü ekler, başka bir şey katmaz. OLLAMA_NUM_THREAD değerini fiziksel çekirdek sayınıza ayarlayın, ölçüm yapın ve ardından bu sayının yarısını deneyin. Birçok paylaşımlı planda daha düşük ayar daha hızlıdır.
İstem işleme (prompt processing) farklı davranır. İlk token görünmeden önce girdinizin üzerinden geçilen ön dolum (prefill) aşaması, bant genişliği yerine hesaplama kapasitesine bağlıdır, bu nedenle çekirdek sayısıyla ölçeklenir. Bunun pratik etkisi, büyük bir istemde çıktı başlamadan önce uzun bir duraklama ve ardından yukarıda belirtilen yavaş ve sabit hızdır. Her istek için bir prompt eval rate ve bir eval rate yazdıran --verbose ile her iki aşamayı ayrı ayrı zamanlayın.
Eğer yoğun 27B modeli çok yavaşsa, CPU kullanımından vazgeçmeden önce qwen3.6:35b-a3b etiketlerine göz atın. Bunlar, 27,8 milyar parametrenin tamamı yerine token başına yaklaşık 3 milyar parametreyi etkinleştirir; böylece diskteki dosya daha büyük olsa bile token başına bellek trafiği yaklaşık on kat azalır. RAM kullanım alanını hız ile takas edersiniz. Çalışma zamanı seçimi burada da önemlidir ve Ollama ve llama.cpp aynı temel çıkarım kodu üzerinde farklı CPU ayarlama kontrolleri sunar.
Ne zaman GPU saati kiralanmalı
The data behind this chart
[
{
"label": "L40S, 48 GB",
"mem_bandwidth_gb_s": 864,
"ceiling_tok_s": 51
},
{
"label": "RTX 4090, 24 GB",
"mem_bandwidth_gb_s": 1008,
"ceiling_tok_s": 59
},
{
"label": "A100, 80 GB",
"mem_bandwidth_gb_s": 2039,
"ceiling_tok_s": 120
},
{
"label": "H100 SXM, 80 GB",
"mem_bandwidth_gb_s": 3350,
"ceiling_tok_s": 197
}
]Yayınlanan GPU bellek bant genişliğine uygulanan aynı formül, farklı bir cevap kategorisi sunar. 24 GB kapasiteli bir tüketici sınıfı kart, bu ağırlıklarda saniyede 59 token tavanına sahiptir. Güncel bir veri merkezi kartı ise 197 değerine ulaşır. Bu, thread sayılarını optimize ederek kapatabileceğiniz bir fark değildir. Kart, belleğini 1008 GB/s hızında çalıştırırken, VPS'niz onlarca GB/s hızında çalışır.
Bu nedenle sınırı tercihe göre değil, iş yüküne göre belirleyin. İş eşzamansız (asynchronous) olduğunda ve kimse beklemediğinde CPU çıkarımı (inference) doğru tercihtir: bir belge yığınının gece boyunca özetlenmesi veya siz uyurken çalışan bir gece sınıflandırma işi gibi. Bir kişi çıktı için beklediği anda veya istekler 30 saniyede birden daha hızlı geldiği anda bir GPU kiralayın; çünkü yalnızca CPU içeren bir sunucunun toplu işleme (batching) kapasitesi yoktur ve kuyruk sürekli büyür.
Maliyet karşılaştırması göründüğünden daha karmaşıktır. 64 GB bir VPS, model yüklü olsun ya da olmasın ayın her saati için faturalandırılırken, bir GPU örneği yalnızca çalışır durumda tuttuğunuz saatler için faturalandırılır. Gerçek kullanımınız günde iki saat ise, kiralanan GPU hem daha hızlı hem de daha ucuz olabilir. Önce görev döngünüzü (duty cycle) hesaplayın, ardından fiyatlandırın. GPU içeren bir VPS seçimi konusu, örnek üzerinde nelerin kontrol edilmesi gerektiğini ele alır; vLLM, GPU üzerinde eşzamanlı istekleri sunduğunuzda Ollama'nın önüne geçer konusu ise vLLM'in istekleri düzgün bir şekilde gruplandırması nedeniyle tercih edildiğini açıklar.
İnsanların unuttuğu üçüncü bir seçenek daha vardır. Toplu işler için 27B modelini CPU üzerinde tutun ve etkileşimli yolun önüne barındırılan bir API modeli koyun. Hiçbir kural, tek bir modelin her iki işi de yapmasını zorunlu kılmaz.
Ollama kurulumu ve kendi sisteminizi ölçümleme
Kurulum betiği resmi betiktir ve özel bir ollama kullanıcısı altında çalışan bir systemd servisi oluşturur.
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
free -gollama --version komutu 0.32.5 veya daha yeni bir sürüm çıktısı vermelidir. Herhangi bir işlem yapmadan önce free -g komutunu kontrol edin. Mem satırındaki total sütunu 32 değerinin altındaysa burada durun ve daha küçük bir model seçin; çünkü çalıştıramayacağınız 17 GB boyutunda bir modeli indirmek, bir saatinizi ve ciddi miktarda disk alanınızı boşa harcar.
Çalışma zamanı seçeneklerini shell ortamınızda değil, bir systemd override dosyası içerisinde ayarlayın. Model servis içerisinde çalıştığı için etkileşimli ortamınızı hiçbir zaman görmez.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_CONTEXT_LENGTH=8192"
Environment="OLLAMA_NUM_PARALLEL=1"
Environment="OLLAMA_MAX_LOADED_MODELS=1"
Environment="OLLAMA_FLASH_ATTENTION=1"
Environment="OLLAMA_KV_CACHE_TYPE=q8_0"
Environment="OLLAMA_KEEP_ALIVE=60m"sudo systemctl restart ollama
ollama pull qwen3.6:27b
ollama run qwen3.6:27b --verbose "Name two Linux distributions."--verbose çıktısı, elde etmek istediğiniz ölçüm değeridir. eval rate, üretim sırasındaki saniye başına token hızınızdır. prompt eval rate, ön doldurma (prefill) hızınızdır. load duration, ağırlıkların diskten okunmasının ne kadar sürdüğünü gösterir; OLLAMA_KEEP_ALIVE=60m ayarının yapılma nedeni budur: CPU üzerinde, her istekte 17 GB veriyi diskten yeniden yüklemek, isteğin kendisinden daha maliyetlidir.
Model yüklüyken, ikinci bir terminalden bellek kullanımını kontrol edin.
ollama psSIZE sütunu, KV önbelleği dahil gerçek bellek kullanımını gösterir ve ağırlıklar ile KV tablosundaki bağlam uzunluğunuza (context length) karşılık gelen satırın toplamına yakın olmalıdır. 8-bit önbellek ile 8192 token değerinde, ağırlıkların üzerine yaklaşık bir gigabayt eklenmesini bekleyin; önbellek f16 kalsaydı bu değer 2 GB olacaktı. PROCESSOR sütunu 100% CPU değerini göstermelidir. Eğer başka bir değer görüyorsanız, bir süreç GPU'yu kullanıyor demektir ve bu kılavuzdaki hız değerleri sizin sisteminizi yansıtmaz.
Hata modları ve göreceğiniz kesin dizeler
Model yüklenmeyi reddediyor. Ollama, her iki rakamı da içeren model requires more system memory (18.6 GiB) than is available (15.2 GiB) biçiminde bir satır yazdırır. Bu, iyi bir hata türüdür; çünkü Ollama, çekirdeğin müdahale etmesine izin vermek yerine bellek ayırmadan önce kontrolü gerçekleştirmiştir. Bağlam uzunluğunu (context length) düşürün, daha küçük bir etikete (tag) geçin veya daha büyük bir plana yükseltin.
İşlem, yanıtın ortasında kayboluyor. İstemci yararlı hiçbir şey göstermez ve journalctl -u ollama -n 50 servisin yeniden başladığını gösterir. dmesg -T | tail komutunu çalıştırın; Out of memory: Killed process ... (ollama) yazan bir satır, çekirdek OOM killer'ın (bellek yetersizliği sonlandırıcısı) süreci durdurduğu anlamına gelir. Bu durum, ön yükleme kontrolü başarılı olmasına rağmen uzun bir görüşme sırasında önbellek tahmini aştığında meydana gelir. Bağlam uzunluğunu kısaltın.
Çekme (pull) işlemi anında başarısız oluyor. Error: pull model manifest: file does not exist, etiketin kütüphanede bulunmadığı anlamına gelir. qwen3.8:27b yazmak tam olarak bu sonucu üretir; sürüm numarasındaki herhangi bir yazım hatası da aynı sonucu verir. Ağınızı suçlamadan önce kütüphane sayfasından etiketi doğrulayın.
Her şey çalışıyor ancak dayanılmaz derecede yavaş. Yeterli RAM'e sahip bir makinede saniyede bir token'ın altında hız, hesaplama kapasitesinden ziyade sayfalama (paging) sorununa işaret eder. Üretim sırasında vmstat 1 komutunu çalıştırın. Sıfır olmayan bir si veya so sütunu, çekirdeğin swap yaptığını gösterir; çözüm, daha az bağlam veya daha az yüklü modeldir. Swap etkinliği olmaksızın sürekli yüksek wa değeri, bellek eşlemeli ağırlıkların diskten tekrar okunduğu anlamına gelir; bu da ağırlıkların aslında belleğe tam sığmadığını gösterir.
İlk token 30 saniye sürüyor ve ardından çıktı hızlanıyor. Bu, ön doldurma (prefill) aşamasıdır ve normaldir. Uzun bir sistem istemi (system prompt), önbelleği ıskalayan her istekte maliyet oluşturur; bu nedenle başka bir ayar yapmadan önce sistem istemini kısaltın.
Sadece CPU kullanan 27B bir model gerçekte ne işe yarar
Beklentileri umutlara göre değil, rakamlara göre belirleyin. Saniyede iki ila dört token hızıyla, 500 tokenlık bir yanıt iki ila dört dakika sürer. Bu hız sohbet için kullanılamaz ancak bir kuyruk yapısı için gayet uygundur. Belge özetleme, toplu etiketleme, dosya yığınlarından alan çıkarma ve otomatik kod inceleme gibi işlemler bu hızı tolere edebilir, çünkü yanıtı bekleyen canlı bir kullanıcı yoktur.
Gizlilik argümanı asıl önemli olan noktadır. Model, kiraladığınız ve kontrol ettiğiniz donanım üzerinde çalışır; hiçbir istek sunucudan dışarı çıkmaz ve token başına fatura ödemezsiniz. Düzenlemeye tabi veriler için saniyede üç token hızında bile bu durum oldukça değerlidir. Bunu alternatifleriyle dürüstçe kıyaslayın: frontier ölçeğinde bir modeli kendi sunucunuzda barındırmak, donanım gereksinimini on kat artırır ve CPU üzerinde çalışan 27B bir model, çıktının okunabilir olduğu bu eğrideki en ekonomik noktadır.
Eğer bu ilk Ollama kurulumunuzsa, Ollama'yı bir VPS üzerinde çalıştırmaya yönelik tam kılavuz, bu rehberde halihazırda yapılandırılmış olduğunu varsaydığımız servis kurulumunu, HTTP API'sini ve güvenlik duvarı kurallarını kapsar. 11434 numaralı portu internete açmayın. Ollama kendi içinde bir kimlik doğrulama mekanizmasıyla gelmez; bu nedenle porta erişebilen herkes modelinizi kullanabilir ve istemlerinizi okuyabilir.
FAQ
Ollama üzerinde Qwen 3.8 27B modeli var mı?
Hayır. 4 Ağustos 2026 itibarıyla Ollama kütüphanesinde qwen3.8 ad alanı bulunmamaktadır. Mevcut 27B etiketleri, 27,8 milyar parametreli yoğun bir modelin Q4_K_M sürümleri olan qwen3.5:27b ve qwen3.6:27b etiketleridir. Arama terimindeki 3.8 ifadesi, büyük olasılıkla sürüm numarası olarak hatırlanan 27,8B parametre sayısından kaynaklanmaktadır. Güncel liste için https://ollama.com/library/qwen3.6/tags adresini kontrol edin ve en yeni 27B sürümünü çekmek istiyorsanız qwen3.6:27b komutunu kullanın. Mevcut olmayan bir etiket Error: pull model manifest: file does not exist hatası ile başarısız olur.
Bir VPS üzerinde Qwen 27B modelini çalıştırmak için ne kadar RAM gerekir?
Q4_K_M için pratik minimum değer 32 GB'tır. Ağırlıklar 17 GB yer kaplar, işletim sistemi yaklaşık 1,5 GB RAM tüketir ve KV önbelleği f16 modunda her 4000 bağlam (context) token'ı için yaklaşık 1 GB ek yük getirir. 16 GB'lık bir plan ağırlıkları belleğe sığdıramaz; dosya bellek eşlemeli (memory-mapped) olduğu ve çekirdek her token için veriyi diskten tekrar okuduğu için swap alanı da çözüm sağlamaz. 64 GB RAM, uzun bağlamlar veya 30 GB boyutundaki Q8_0 ağırlıkları için yeterli alan sağlar.
CPU üzerinde 27B modeli saniyede kaç token üretir?
Bellek bant genişliğinizi ağırlıkların boyutuna bölün ve çıkan sonucun yüzde 50 ila 70'ini alın. Çift kanallı DDR4-3200 bir VPS, 3 token/saniye civarında bir üst sınıra sahiptir ve yaklaşık 2 token/saniye hız sunar. Çift kanallı DDR5-4800 bir makine ise 4.5 civarında bir üst sınıra sahiptir ve yaklaşık 3 token/saniye hız sunar. Çok kanallı sunucu platformları kağıt üzerinde daha iyi görünse de, bellek bant genişliği sunucudaki tüm kiracılar arasında paylaşıldığı için kendi hızınızı ollama run qwen3.6:27b --verbose ile ölçmeli ve eval rate satırını incelemelisiniz.
Sadece CPU içeren bir VPS üzerinde Q4 mü yoksa Q8 mi kullanmalıyım?
Neredeyse her durumda Q4_K_M tercih edilmelidir. Q8_0, 17 GB yerine 30 GB yer kaplar; bu nedenle 64 GB'lık bir plan gerektirir ve token başına neredeyse iki kat daha fazla bellek trafiği oluşturarak saniyedeki token hızınızı yaklaşık yarıya düşürür. 27B modelinde Q4_K_M ile Q8_0 arasındaki kalite farkı çoğu görev için ihmal edilebilir düzeydedir. RAM kapasitesini daha uzun bağlamlar için kullanmak, modelin ifade biçiminden ziyade yapabileceklerini değiştirdiği için daha verimlidir.
GPU kiralamak ne zaman yüksek RAM'li bir VPS'ten daha ucuzdur?
Görev döngünüz düşük olduğunda veya bir kullanıcı yanıt beklediğinde. 24 GB belleğe sahip bir GPU, bu ağırlıklarla yaklaşık 59 token/saniye hıza ulaşır; tipik bir VPS'te bu hız 2 veya 3'tür ve GPU yalnızca çalıştığı saatler için ücretlendirilir. 64 GB'lık bir VPS ise model yüklü olsun ya da olmasın tüm ay boyunca ücretlendirilir. Günde kaç saat gerçek anlamda token ürettiğinizi hesaplayın. İki veya üç saatin altındaki kullanımlarda, saatlik GPU kiralama hem hız hem de maliyet açısından genellikle daha avantajlıdır. Sürekli düşük öncelikli toplu işler (batch work) için ise her zaman açık olan VPS daha ekonomiktir.