SSD Nodes Learn 8GB RAM — yılda $66
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-01

GPU VPS ne zaman gerekli, CPU ne zaman yeterli?

GPU VPS, büyük modellerde ve toplu işlemlerde hız ile kapasite sağlar. Quantized chat modelleri, embedding ve Whisper small için önce CPU ile başlayıp ölçüm yapılabilir.

GPU özellikli bir VPS mi gerekli, yoksa CPU yeterli mi?

GPU özellikli bir VPS, bir modeli kendiniz çalıştırırken iki şeyi değiştirir: token üretim hızını ve bir modelin belleğe sığıp sığmadığını. Bunun dışında hiçbir şeyi değiştirmez. İş yükü, aynı anda tek bir kişiye yanıt veren quantized 7B ile 27B arasında bir chat modelinden, düşük hacimli bir embedding görevinden veya Whisper small ile konuşma yazıya dönüştürme işleminden oluşuyorsa, yeterli RAM'e sahip sıradan bir CPU VPS bu işlemleri zaten gerçekleştirebilir. CPU ile başlayın, sizi rahatsız eden ölçümü belirleyin ve ardından daha yüksek kapasiteye geçin.

Bunun nedeni bellek bant genişliğidir. Bir language model bir token ürettiğinde, ihtiyaç duyduğu tüm ağırlıkları bellekten okur. 4 bit olarak quantized bir 8B model diskte yaklaşık 4.7 GB yer kaplar ve bellekte de yaklaşık aynı miktarda alan kullanır. Bu nedenle bir token üretmek için yaklaşık 4.7 GB verinin taşınması gerekir. Makinenin bellek bant genişliğini bu sayıya böldüğünüzde, saniye başına token sayısı için üst sınırı elde edersiniz. Okuyacağınız neredeyse tüm benchmark sonuçlarının temelinde bu tek bölme işlemi vardır.

Bir GPU size gerçekte ne kazandırır

Bant genişliği. Modern bir sunucudaki DDR5, saniyede onlarca gigabayt veri aktarır. GPU belleği (VRAM, video RAM) ise saniyede yüzlerce ila bin gigabayttan fazla veri aktarır. Hızlanma oranını bu fark belirler ve fark büyüktür.

Hızla birlikte kapasite. 64 GB RAM’e sahip bir CPU sunucusu, 4 bitlik bir 70B modeli yükleyebilir. Model çalışır, ancak hızı sohbet etmekten çok okumaya yakındır. Model VRAM’e sığıyorsa GPU burada yardımcı olur. Katmanlar sistem RAM’ine taştığı anda yavaş yol yeniden belirleyici olur.

Toplu işlem aktarım hızı. Çoğu kişinin gözden kaçırdığı nokta budur. GPU tek bir kullanıcı için üretim yaparken hesaplama kapasitesinin çoğu boşta kalır, çünkü bellek erişimini bekler. Aynı anda 20 isteğe hizmet verildiğinde, aynı ağırlık okuması 20 isteğin tümüne hizmet eder. Toplam saniye başına token sayısı birkaç kat artarken kullanıcı başına hız çok az düşer. CPU bunu aynı şekilde yapamaz. CPU sunucusunda eş zamanlı iki kullanıcı, birbirlerinin hızını yaklaşık yarıya indirir. Çok sayıda istemcinin çağırdığı bir API oluşturuluyorsa, ham tek akış hızından çok toplu işlem, GPU kullanımı için temel gerekçedir.

İstem işleme. Uzun bir istemi okumak bellekten çok hesaplama gücü gerektirir. GPU’ların en büyük farkı burada ortaya çıkar. CPU’nun bir dakikada işlediği 30,000 tokenlık bağlam, GPU’da birkaç saniyede işlenebilir. Belgeleri her isteğe ekleyen retrieval düzeneklerinde bu fark sürekli hissedilir.

Yaklaşık değerler ve nasıl okunacağı

Aşağıdaki blokta, Temmuz 2026 itibarıyla 4-bit kuantizasyona sahip 8B model için yayımlanmış tek akışlı tipik değerler yer alır. Bunlar bir taahhüt değil, büyüklük mertebesine ilişkin kılavuz değerlerdir. Kuantizasyonunuz, bağlam uzunluğunuz ve çıkarım motorunuz bu değerleri değiştirebilir.

Chart8B model at 4-bit: typical single-stream generation speed (July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU, DDR4",
    "mem_bandwidth_gbs": 40,
    "tokens_per_sec": 6
  },
  {
    "label": "16 vCPU, DDR5",
    "mem_bandwidth_gbs": 75,
    "tokens_per_sec": 11
  },
  {
    "label": "24GB GPU",
    "mem_bandwidth_gbs": 300,
    "tokens_per_sec": 50
  },
  {
    "label": "40GB data-centre GPU",
    "mem_bandwidth_gbs": 1555,
    "tokens_per_sec": 130
  }
]

24 GB GPU satırında, DDR5 CPU sistemindeki 11 değerine karşılık saniyede 50 token gösterilir. Bu yaklaşık beş kattır ve ham hesaplama gücündeki herhangi bir farktan çok bant genişliği oranıyla açıklanır. Gerçek aktarım hızı da bant genişliğinin model boyutuna bölünmesiyle elde edilen değerin altında kalır; çünkü büyüyen bağlam üzerinde attention işlemi, bu basit bölmenin hesaba katmadığı ek iş yükü oluşturur.

Karşılaştırma amacıyla, bir kişi saniyede yaklaşık 5 ila 10 kelime okur. Saniyede 15 veya daha fazla token, tek bir okuyucu için normal yazma hızına yakın bir deneyim sağlar. Bu nedenle yalnızca CPU kullanan pek çok kurulum pratikte yeterlidir.

Satın almadan önce VRAM kapasitesini belirleme

Model dosyasının boyutu alt sınırdır, gereksinim değildir. Ağırlıklar, KV cache (key-value cache; attention mekanizmasının tuttuğu, token başına bellek) ve yaklaşık 1 GB ek yük için kapasite ayırın.

Temmuz 2026 itibarıyla kullanılabilecek pratik kural şudur: Normal 8k-16k context için model dosyasının gigabayt cinsinden boyutuna yüzde 20 ekleyin. 4.7 GB boyutundaki bir 8B model için yaklaşık 6 GB VRAM gerekir. 4 bitlik bir 27B model yaklaşık 16 GB yer kaplar ve yaklaşık 20 GB VRAM gerektirir. 4 bitlik bir 70B model yaklaşık 40 GB boyutundadır ve 48 GB'lık bir kart veya iki daha küçük kart gerektirir.

Uzun context değerleri bu kuralı geçersiz kılar. KV cache, context uzunluğuyla doğrusal olarak büyür ve 128k token düzeyinde ağırlıkların kendisini aşabilir. Uzun context kullanmayı planlıyorsanız önce cache için gereken kapasiteyi belirleyin ve engine'in cache quantization için hangi seçenekleri sunduğunu kontrol edin.

Makinenin gerçekten sahip olduğu kaynakları kontrol etme

Bir GPU bulut sunucusunda, başka bir işlem yapmadan önce sürücünün kartı gördüğünü doğrulayın.

nvidia-smi

GPU adını, sürümünü ve toplam belleğin ne kadarının kullanıldığını listeleyen bir tablo görüntülenmelidir. NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, sürücünün eksik olduğu veya çekirdek yükseltmesinden sonra çekirdek modülünün yeniden oluşturulmadığı anlamına gelir. Standart bir Ubuntu imajında çözüm genellikle sudo apt install -y ubuntu-drivers-common && sudo ubuntu-drivers install komutunu çalıştırmak ve ardından yeni modülün yüklenmesi için sistemi yeniden başlatmaktır.

Kapsayıcılar için yalnızca sürücü yeterli değildir. Docker'ın aygıtı kapsayıcıya aktarması için NVIDIA Container Toolkit gerekir.

sudo apt-get update && sudo apt-get install -y --no-install-recommends ca-certificates curl gnupg2
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Ardından aktarımın bir kapsayıcı içinden çalıştığını doğrulayın:

sudo docker run --rm --gpus all ubuntu:24.04 nvidia-smi

Aynı tablo görüntülenmelidir. Karşılayamadığı bir GPU yeteneğini belirten docker: Error response from daemon: could not select device driver satırı, toolkit'in yüklü olduğunu ancak Docker'ın yeniden yapılandırılmadığını veya yeniden başlatılmadığını gösterir. Bu durumda nvidia-ctk satırını ve yeniden başlatma işlemini tekrar çalıştırın. Compose'ta bunun karşılığı, driver değeri nvidia olan ve yetenekler listesinde gpu bulunan bir deploy.resources.reservations.devices girdisidir. Bu girdi, VPS üzerinde Docker Compose bölümünde ele alınan standart hizmet tanımlarına eklenebilir.

Yükseltme yapmadan önce ölçüm alın

Kullanılması planlanan modeli, mevcut CPU sunucusunda çalıştırın ve değerleri kaydedin. VPS üzerinde Ollama ile bir LLM barındırma işlemi için tek bir flag yeterlidir:

ollama run llama3.1:8b --verbose "Summarise the causes of the 1929 crash in 200 words."

Çıktının sonunda süre ölçümleri yer alır. eval rate, saniye başına üretilen token sayısını gösterir. prompt eval rate, makinenin girdiyi okuma hızını gösterir. Bu iki değer, hangi yükseltmenin fayda sağlayacağını gösterir: düşük eval rate değeri bellek bant genişliği sorununa, uzun girdilerde düşük prompt eval rate değeri ise işlem gücü sorununa işaret eder.

GPU bulunan bir makinede modelin gerçekten GPU üzerine yüklendiğini denetleyin:

ollama ps

Her şey sığıyorsa PROCESSOR sütununda 100% GPU, sığmıyorsa 43%/57% CPU/GPU gibi bir değer görülür. Kısmi bölme genellikle beklenenden daha kötü sonuç verir. Bunun nedeni, her token'ın yine de yavaş olan bölümde beklemesidir.

Maliyet sorusu

GPU örneklerinin maliyeti, karşılaştırılabilir bir CPU örneğinin maliyetinin birkaç katıdır. Ayrıca ürettikleri token sayısına göre değil, çalışır durumda oldukları her saat için ücretlendirilirler. Günde birkaç isteğe yanıt veren ve sürekli açık kalan bir GPU, çıkarım çalıştırmanın en pahalı yoludur. Başabaş noktası kullanım oranıdır: yoğun kullanılan bir GPU, token başına ucuzdur; boşta kalan GPU ise tamamen israftır.

Üç gerçekçi model işe yarar. Düzenli ve düşük hacimli çalışmaları bir CPU VPS üzerinde tutun. Ara sıra gelen zor istekleri barındırılan bir API'ye gönderin ve token başına ödeme yapın. Toplu işler, ince ayar veya toplu embedding çalışması için saatlik GPU kiralayın, ardından GPU'yu imha edin. Bu modelleri birlikte kullanmak normaldir. Sürekli açık bir VPS üzerinde AI agent maliyetlerini denetleme bölümünde açıklanan bütçe disiplini burada da geçerlidir. Fark, sızıntının token sayısı değil, boşta geçen süre olmasıdır.

GPU olmadan hâlâ sorunsuz çalışanlar

Düşük hacimli embedding işlemleri. Küçük bir embedding modeli, birkaç CPU çekirdeğinde dakikada yüzlerce kısa belgeyi işler. Bir kez oluşturulan bir index'in hızlı olması gerekmez.

Transkripsiyon için Whisper small ve base. CPU üzerinde Faster-whisper, small model ile gerçeğe yakın zamanlı transkripsiyon yapar. Bu, gece boyunca çalışan bir işlem hattı için yeterlidir.

Bir veya iki kullanıcı için yaklaşık 27B boyutuna kadar quantized chat modelleri. Yavaştır, ancak okunabilir çıktılar üretir ve kullanılabilir durumdadır.

Batch job olarak değerlendirilebilecek her işlem. Ekranı kimse izlemiyorsa, wall-clock hızı bir gereksinimden çok zamanlama ayrıntısıdır.

Gerçekten GPU gerektiren işlemler şunlardır: küçük bir adapter'ın ötesinde training veya fine-tuning, aynı anda çok sayıda kullanıcıya hizmet sunma, image ve video generation ve gecikmenin ürünün kendisi olduğu real-time speech işlemleri.

FAQ

7B veya 8B model için ne kadar VRAM gerekir?

Normal 8k - 16k bağlam için 4-bit nicemlenmiş bir 8B model yaklaşık 6 GB gerektirir. Ağırlıklar yaklaşık 4.7 GB yer kaplar. Geri kalan alan KV önbelleği ve yaklaşık 1 GB ek yük için kullanılır. 12 GB belleğe sahip bir kart, daha uzun bağlamlar için yeterli alan bırakır. 128k bağlam kullanılması planlanıyorsa önbellek ayrıca hesaplanmalıdır. Çünkü önbellek ağırlıklardan daha büyük olabilir.

Ollama GPU olmadan çalıştırılabilir mi?

Evet. Ollama otomatik olarak CPU kullanımına geçer ve yalnızca modeli tutacak kadar RAM gerektirir. Bellek hızına bağlı olarak 4-bit 8B model için saniyede yaklaşık 5 - 12 token beklenmelidir. Bu hız, tek kullanıcı için okuma hızına yakındır. CPU üzerinde asıl sorun uzun istemlerdir. Çünkü 30,000 tokenlık bağlamı okumak işlemciye bağlıdır ve yanıtı üretmekten çok daha uzun sürer.

GPU neden CPU'dan çok az daha hızlı?

Genellikle modelin tamamı VRAM'e sığmamıştır. Bu nedenle bazı katmanlar CPU üzerinde çalışır ve her token yavaş olan bölümü bekler. ollama ps komutunu çalıştırın ve PROCESSOR sütununda 100% GPU değerinin bulunduğunu doğrulayın. Bölünmüş kullanım gösteriliyorsa daha düşük nicemleme düzeyi veya daha küçük bir model kullanın. Diğer yaygın neden, modelin yüklenme süresinin ölçümü baskıladığı kısa bir karşılaştırmadır.

Tek kullanıcı için GPU VPS kullanmaya değer mi?

Genellikle hayır. Bir kişi saniyede 5 - 10 kelime okur. CPU sunucu, yaklaşık 13B boyutuna kadar olan modellerde zaten bundan daha hızlı token üretir. Tek kullanıcı için maliyeti haklı çıkaran durumlar uzun istemler, görüntü üretimi ve ince ayardır. Aynı anda çok sayıda kullanıcıya hizmet verilmesi en güçlü gerekçedir. Çünkü toplu işleme, tek bir GPU'nun bir isteği yanıtlama maliyetine yakın bir maliyetle yirmi isteği yanıtlamasını sağlar.

GPU'yu saatlik olarak mı kiralamalıyım, yoksa sürekli açık mı çalıştırmalıyım?

İş yükü aralıklıysa saatlik kiralama yapılmalıdır: ince ayar, toplu embedding çalıştırma veya toplu transkripsiyon işi gibi. GPU örneği üretilen token sayısına göre değil, çalışır durumda kaldığı süreye göre ücretlendirildiğinden kart yalnızca yoğun kullanılıyorsa sürekli açık tutulmalıdır. Düşük trafikli bir asistan için CPU VPS veya token başına ücretlendirilen barındırılan bir API, boşta duran GPU'dan daha ucuzdur.