SSD Nodes Learn Hosting plans →
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-13

GPU destekli VPS mi CPU mu: Hangisine ihtiyacınız var?

GPU destekli bir VPS kiralamadan önce CPU performansını ölçün. Kuantize modeller, embedding ve Whisper işlemleri için standart RAM kapasitesi genellikle yeterlidir.

GPU destekli bir VPS mi yoksa CPU yeterli mi?

GPU destekli bir VPS, bir modeli kendi başınıza çalıştırmanızla ilgili iki şeyi değiştirir: token üretim hızı ve modelin belleğe sığıp sığamayacağı. Bunun dışında hiçbir şeyi değiştirmez. İş yükünüz tek bir kişiye yanıt veren 7B ile 27B arası kuantize edilmiş bir sohbet modeli, düşük hacimli bir embedding görevi veya Whisper small ile konuşma dökümü ise, yeterli RAM'e sahip standart bir CPU VPS bu işi zaten görür. CPU üzerinde başlayın, sizi rahatsız eden değeri ölçün ve ardından yükseltme yapın.

Bunun nedeni bellek bant genişliğidir. Bir dil modeli bir token ürettiğinde, ihtiyaç duyduğu her ağırlığı bellekten okur. 4 bit kuantize edilmiş 8B bir model, diskte yaklaşık 4.7 GB yer kaplar ve bellekte de hemen hemen aynı boyuttadır; dolayısıyla bir token üretmek, yaklaşık 4.7 GB verinin taşınması anlamına gelir. Makinenin bellek bant genişliğini bu sayıya böldüğünüzde, saniyedeki token üretim hızının üst sınırını bulursunuz. Bu basit bölme işlemi, okuyacağınız neredeyse tüm performans testlerinin temelini açıklar.

GPU size gerçekte ne kazandırır

Bant genişliği. Modern bir sunucudaki DDR5 bellek, saniyede onlarca gigabayt veri aktarabilir. GPU belleği (VRAM) ise yüzlerce, hatta binden fazla gigabayt aktarır. Aradaki oran hız artışını belirler ve bu fark oldukça büyüktür.

Hız ile birlikte kapasite. 64 GB RAM'e sahip bir CPU sunucusu, 70B parametreli bir modeli 4-bit seviyesinde yükleyebilir. Model çalışır, ancak hızı sohbet etmekten ziyade okuma hızına yakın olur. GPU burada yalnızca model VRAM'e sığdığında yardımcı olur; çünkü katmanlar sistem RAM'ine taştığı anda yavaş olan yol tekrar devreye girer.

Toplu işleme (Batch throughput). İnsanların en çok hafife aldığı kısım budur. Bir kullanıcı için üretim yapan GPU, bellekten veri beklediği için işlem gücünün büyük kısmını boşta tutar. Aynı anda 20 isteğe hizmet verdiğinizde, okunan aynı ağırlık verisi 20 isteğin tamamı için kullanılır. Saniye başına üretilen toplam token sayısı birkaç kat artarken, kullanıcı başına düşen hız neredeyse hiç değişmez. CPU bunu yapamaz. Bir CPU sunucusunda aynı anda iki kullanıcı olması, her birinin hızını kabaca yarıya düşürür. Birçok istemcinin çağrı yaptığı bir API oluşturuyorsanız, toplu işleme (batching) özelliği, ham tek akışlı hızdan çok daha önemli bir GPU tercih sebebidir.

İstem işleme (Prompt processing). Uzun bir istemi okumak bellek odaklı değil, işlem gücü odaklı bir iştir ve GPU'ların en büyük farkı attığı alan burasıdır. CPU'nun bir dakikada işlediği 30.000 token'lık bir bağlam, GPU'da sadece birkaç saniye sürer. Belgeleri her isteğin içine yerleştiren retrieval (bilgi getirme) kurulumları, bu farkı sürekli hisseder.

Yaklaşık değerler ve bu değerlerin okunması

Aşağıdaki blok, Temmuz 2026 itibarıyla 4-bit kuantizasyon seviyesindeki 8B bir model için yayınlanmış tipik tek akışlı (single-stream) verileri içermektedir. Bu değerler bir taahhüt değil, büyüklük sırası hakkında yol gösterici niteliktedir. Kuantizasyonunuz, bağlam uzunluğunuz ve çıkarım motorunuz bu değerleri değiştirecektir.

Chart8B model at 4-bit: typical single-stream generation speed (July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU, DDR4",
    "mem_bandwidth_gbs": 40,
    "tokens_per_sec": 6
  },
  {
    "label": "16 vCPU, DDR5",
    "mem_bandwidth_gbs": 75,
    "tokens_per_sec": 11
  },
  {
    "label": "24GB GPU",
    "mem_bandwidth_gbs": 300,
    "tokens_per_sec": 50
  },
  {
    "label": "40GB data-centre GPU",
    "mem_bandwidth_gbs": 1555,
    "tokens_per_sec": 130
  }
]

24 GB GPU satırı, DDR5 CPU kutusu için 11 değerine karşılık saniyede 50 token göstermektedir. Bu yaklaşık beş katlık bir farktır ve ham hesaplama gücü farkından ziyade bant genişliği oranını yansıtmaktadır. Gerçek iş hacmi, bant genişliğinin model boyutuna bölünmesiyle elde edilen değerin altında kalır; çünkü büyüyen bir bağlam üzerindeki dikkat (attention) mekanizması, basit bölme işleminin hesaba katmadığı ek bir iş yükü oluşturur.

Karşılaştırma yapmak gerekirse, bir insan saniyede yaklaşık 5 ila 10 kelime okur. Saniyede 15 token ve üzerindeki herhangi bir hız, tek bir okuyucu için normal bir yazma hızı hissi verir. Sadece CPU kullanılan birçok kurulumun sessizce yeterli olmasının nedeni budur.

Satın alma öncesinde VRAM boyutlandırma

Model dosya boyutu bir gereksinim değil, alt sınırdır. Ağırlıkların üzerine KV cache (key-value cache, attention mekanizmasının her token için tuttuğu bellek) ve yaklaşık 1 GB ek yük ekleyerek bütçenizi belirleyin.

Temmuz 2026 itibarıyla pratik bir kural şudur: Model dosya boyutunu gigabayt cinsinden alın ve normal 8k ile 16k arası bağlam (context) için yüzde 20 ekleyin. 4.7 GB boyutundaki bir 8B model yaklaşık 6 GB VRAM gerektirir. 4 bit seviyesindeki bir 27B model yaklaşık 16 GB yer kaplar ve kabaca 20 GB VRAM ister. 4 bit seviyesindeki bir 70B model yaklaşık 40 GB yer kaplar ve 48 GB kapasiteli bir kart ya da iki adet daha küçük kart gerektirir. Aynı hesaplama yöntemi bu sınırların çok ötesinde de geçerliliğini korur ve Kimi K3 gibi 2.8 trilyon parametreli bir model için VRAM hesaplaması, kart seçiminin artık bir sorun olmaktan çıktığı noktayı göstermektedir.

Uzun bağlamlar bu kuralı bozar. KV cache, bağlam uzunluğuyla doğrusal olarak büyür ve 128k token seviyesinde ağırlıkların kendisini aşabilir. Uzun bağlamlar kullanmayı planlıyorsanız, önce cache için boyutlandırma yapın ve kullandığınız motorun cache kuantizasyonu için neler sunduğunu kontrol edin.

Makinenin mevcut durumunu kontrol etme

Bir GPU örneğinde, başka bir işlem yapmadan önce sürücünün kartı görüp görmediğini doğrulayın.

nvidia-smi

GPU adını, sürücü sürümünü ve toplam bellekten kullanılan miktarı listeleyen bir tablo görmelisiniz. NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver hatası, sürücünün eksik olduğunu veya çekirdek yükseltmesinden sonra çekirdek modülünün yeniden derlenmediğini gösterir. Standart bir Ubuntu imajında çözüm genellikle sudo apt install -y ubuntu-drivers-common && sudo ubuntu-drivers install komutunu çalıştırmak ve ardından yeni modülün yüklenmesi için sistemi yeniden başlatmaktır.

Konteynerler için yalnızca sürücü yeterli değildir. Docker'ın cihazı içeri aktarabilmesi için NVIDIA Container Toolkit gereklidir.

sudo apt-get update && sudo apt-get install -y --no-install-recommends ca-certificates curl gnupg2
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Ardından, passthrough işleminin bir konteyner içerisinden çalışıp çalışmadığını test edin:

sudo docker run --rm --gpus all ubuntu:24.04 nvidia-smi

Aynı tablo ekrana gelmelidir. Karşılanamayan bir GPU yeteneğini belirten bir docker: Error response from daemon: could not select device driver satırı, araç setinin yüklü olduğunu ancak Docker'ın yeniden yapılandırılmadığını veya yeniden başlatılmadığını gösterir; bu durumda nvidia-ctk satırını tekrar çalıştırın ve servisi yeniden başlatın. Compose yapısında bunun karşılığı, driver değeri nvidia olan ve yetenek listesinde gpu bulunan bir deploy.resources.reservations.devices girdisidir; bu yapı, Docker Compose on a VPS bölümünde ele alınan standart servis tanımlarına eklenir.

Yükseltme öncesi ölçüm yapın

Kullanmayı planladığınız modeli mevcut CPU sunucunuzda çalıştırın ve değerleri kaydedin. Ollama ile VPS üzerinde LLM barındırma rehberinde belirtildiği üzere, bu işlem tek bir bayrak ile gerçekleştirilir:

ollama run llama3.1:8b --verbose "Summarise the causes of the 1929 crash in 200 words."

Çıktı, zamanlama verileriyle sona erer. eval rate, saniye başına token cinsinden üretim hızınızdır. prompt eval rate ise makinenin girdi verinizi ne kadar hızlı okuduğunu gösterir. Bu iki değer, hangi yükseltmenin faydalı olacağını belirler: düşük bir eval rate bellek bant genişliği sorununa, uzun girdilerde düşük bir prompt eval rate ise işlem gücü sorununa işaret eder.

GPU içeren bir makinede, modelin gerçekten GPU üzerine yüklenip yüklenmediğini kontrol edin:

ollama ps

PROCESSOR sütunu, her şey GPU'ya sığdığında 100% GPU değerini, sığmadığında ise 43%/57% CPU/GPU benzeri bir değer gösterir. Kısmi bir bölünme genellikle beklenenden daha kötü sonuç verir; çünkü her token, yavaş olan tarafın tamamlanmasını beklemek zorundadır.

Maliyet sorusu

GPU örnekleri, benzer CPU örneklerinden birkaç kat daha pahalıdır ve üretilen token miktarına göre değil, var oldukları her saat için ücretlendirilirler. Günde sadece birkaç istek alan sürekli açık bir GPU, çıkarım (inference) çalıştırmanın en maliyetli yoludur. Başabaş noktası kullanım oranına bağlıdır: yoğun kullanılan bir GPU, token başına ucuzdur; boşta duran bir GPU ise tamamen israftır.

Üç dürüst yöntem işe yarar. Düşük hacimli sürekli işleri bir CPU VPS üzerinde tutun. Ara sıra gelen zorlu istekleri barındırılan bir API'ye gönderin ve token başına ödeme yapın. Toplu işler, ince ayar (fine-tuning) veya büyük ölçekli embedding işlemleri için saatlik GPU kiralayın ve işiniz bittiğinde örneği silin. Bunları bir arada kullanmak normaldir ve Sürekli açık bir VPS üzerinde yapay zeka ajanı maliyet kontrolü bölümünde açıklanan bütçeleme disiplini burada da geçerlidir; tek fark, burada sızıntının token sayısı değil, boşta geçen süre olmasıdır.

GPU olmadan sorunsuz çalışan iş yükleri

Düşük hacimli embedding işlemleri. Küçük bir embedding modeli, birkaç CPU çekirdeği üzerinde dakikada yüzlerce kısa belgeyi işleyebilir; bir kez oluşturulan bir dizinin ise yüksek hızda çalışması gerekmez.

Transkripsiyon için Whisper small ve base modelleri. CPU üzerinde çalışan faster-whisper, small modeli kullanarak neredeyse gerçek zamanlı transkripsiyon yapar; bu da gece boyunca çalışan bir iş akışı için yeterlidir.

Bir veya iki kullanıcı için 27B parametreye kadar kuantize edilmiş sohbet modelleri. Yavaş olsa da okunabilir ve kullanılabilirdir.

Toplu iş (batch job) olarak adlandırabileceğiniz her şey. Ekran başında kimse beklemiyorsa, işlemin tamamlanma süresi bir gereksinimden ziyade zamanlama detayından ibarettir.

Gerçekten GPU gerektiren işler: küçük bir adaptörün ötesinde eğitim veya ince ayar (fine-tuning) yapmak, aynı anda çok sayıda kullanıcıya hizmet vermek, görsel ve video üretimi ile gecikmenin ürünün kendisi olduğu gerçek zamanlı konuşma işleme süreçleri.

FAQ

7B veya 8B bir model için ne kadar VRAM gerekir?

Normal 8k ile 16k arası bir bağlam (context) uzunluğunda, 4-bit kuantize edilmiş 8B bir model için yaklaşık 6 GB VRAM yeterlidir. Model ağırlıkları yaklaşık 4.7 GB yer kaplar; geri kalan kısım ise KV önbelleği ve yaklaşık 1 GB'lık ek yükten oluşur. 12 GB kapasiteli bir kart, daha uzun bağlamlar için rahat bir çalışma alanı sağlar. Eğer 128k bağlam uzunluğunda çalıştırmayı planlıyorsanız, önbellek boyutunu ayrıca hesaplamalısınız; çünkü önbellek, model ağırlıklarından daha büyük hale gelebilir.

Ollama'yı GPU olmadan çalıştırabilir miyim?

Evet. Ollama otomatik olarak CPU kullanımına geçer ve sadece modeli bellekte tutacak kadar RAM'e ihtiyaç duyar. Bellek hızına bağlı olarak, 4-bit 8B bir model için saniyede yaklaşık 5 ila 12 token arası bir hız beklenebilir; bu da tek bir kullanıcı için okuma hızına yakındır. Uzun istemler (prompt) CPU üzerinde gerçek bir darboğaz oluşturur; çünkü 30.000 token'lık bir bağlamı okumak işlemciye dayalıdır ve yanıt üretmekten çok daha uzun sürer.

GPU performansım neden CPU ile neredeyse aynı?

Bunun yaygın nedeni, modelin tamamının VRAM'e sığmamasıdır. Bu durumda bazı katmanlar CPU üzerinde çalışır ve her token, yavaş olan tarafın tamamlanmasını bekler. ollama ps komutunu çalıştırın ve PROCESSOR sütununda 100% GPU değerinin görünüp görünmediğini kontrol edin. Eğer bir bölünme varsa, daha düşük bir kuantizasyon veya daha küçük bir model kullanın. Diğer bir yaygın neden ise, model yükleme süresinin ölçümü domine ettiği kısa süreli kıyaslama testleridir.

Tek bir kullanıcı için GPU destekli bir VPS kiralamaya değer mi?

Genellikle hayır. Bir kişi saniyede 5 ila 10 kelime okur ve bir CPU sunucusu, yaklaşık 13B boyutuna kadar olan modeller için bu hızın üzerinde token üretebilir. Tek bir kullanıcı için maliyeti haklı çıkaran durumlar; uzun istemler, görsel oluşturma ve ince ayar (fine-tuning) işlemleridir. Aynı anda birçok kullanıcıya hizmet vermek en güçlü gerekçedir; çünkü toplu işleme (batching), tek bir GPU'nun yirmi isteği, tek bir isteği yanıtlama maliyetine yakın bir bedelle yanıtlamasını sağlar.

GPU'yu saatlik mi kiralamalıyım yoksa sürekli açık mı tutmalıyım?

İnce ayar, toplu vektörleştirme (embedding) veya toplu transkripsiyon gibi iş yükleri düzensiz olduğunda saatlik kiralama yapın. Kart sürekli meşgul kalacaksa sürekli açık tutun; çünkü GPU örnekleri üretilen token başına değil, var oldukları süre boyunca ücretlendirilir. Düşük trafikli bir asistan, boşta duran bir GPU yerine CPU tabanlı bir VPS üzerinde veya token başına ödeme yapılan bir API hizmetinde daha ucuza mal olur.