SSD Nodes Learn 🎉 VPS $4.99/aydan başlayan
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-07

GPU VPS mi API mi: Başa baş noktası nasıl hesaplanır?

GPU kiralama maliyeti ile token başına API ücretlendirmesini karşılaştırın. Aylık sabit 365 dolarlık GPU maliyeti ile hangi token hacminde tasarruf edeceğinizi öğrenin.

Başa baş noktasının gerçek konumu

Bir GPU VPS, token başına faturalandırılan API hizmetlerine karşı şu noktada avantaj sağlar: Aylık sabit kira bedelinin, o ay ürettiğiniz toplam çıktı token sayısına bölünmesiyle elde edilen birim maliyet, API'nin aynı miktardaki token için talep ettiği ücretin altına düştüğünde. Kira bedeli sabittir. API faturası ise her istekte artar. Dolayısıyla cevap hiçbir zaman basit bir evet veya hayır değil, her zaman aylık bir hacim değeridir.

Saati 0.50 dolardan, 730 saatlik bir ay için 365 dolara mal olan orta seviye bir GPU VPS üzerinden hesaplama yapalım. Üst düzey bir model API'sine kıyasla, ayda 24.3 milyon çıktı tokeninde başa baş noktasına ulaşırsınız. Küçük bir ticari modele kıyasla bu değer 73 milyondur. Aynı boyuttaki barındırılan açık ağırlıklı (open-weight) bir modele kıyasla ise asla başa baş noktasına ulaşamazsınız; çünkü tek bir kart, bir ay içerisinde bu kesişim noktasına yetecek kadar token üretemez.

Yayımlanmış başa baş analizleri bu soruya cevap vermemektedir. 2026 yılının başlarında yapılan iki çalışma, kesişim noktasını H200 üzerinde %72 sürekli kullanımda, MI300X üzerinde ise %22 ile %48 görev döngüsü arasında konumlandırmıştır. Her iki çalışma da aynı satıcının kendi sunucusuz (serverless) ürünüyle kıyaslama yapmakta ve buradaki okuyucuların çoğunun bir ayda harcadığından daha yüksek saatlik maliyete sahip hızlandırıcıları baz almaktadır. Aritmetik aynıdır. Aşağıdaki bölüm, bu hesabı tek bir kart, 7B ile 30B aralığında bir açık model ve standart ölçümlü API faturalandırması için yeniden yapmaktadır.

Aşağıdaki her sayı bir sonuç değil, bir girdidir. Hepsini kendi verilerinizle değiştirin.

Kendi değerlerinizi yerine koyabileceğiniz formül

cost_per_million = (hourly_rate * 1000000) / (tokens_per_second * 3600 * duty_cycle)

breakeven_millions_per_month = (hourly_rate * hours_per_month) / api_price_per_million

capacity_millions_per_month = (tokens_per_second * 3600 * hours_per_month) / 1000000

required_duty_cycle = breakeven_millions_per_month / capacity_millions_per_month

Dört adet girdi bulunmaktadır; bunların tamamını ölçebilir veya ilgili kaynaklardan öğrenebilirsiniz.

  • hourly_rate, GPU VPS'in saatlik maliyetidir; boşta kaldığı saatler de buna dahildir. Aylık ödeme yapıyorsanız, aylık tutarı 730'a bölün.
  • tokens_per_second, sunucunuzun gerçek eşzamanlılık altında sürdürdüğü toplam çıktı hızıdır. Bu, bir satıcı tablosundaki tek akışlı (single-stream) değer değildir.
  • duty_cycle, GPU'nun ay içinde token üretmekle geçirdiği sürenin oranıdır. Tüm ay kiraladığınız ve günde iki saat kullandığınız bir sunucu için bu oran %8.3'tür.
  • api_price_per_million, karşılaştırma yaptığınız, ölçümlenen çıktı token fiyatıdır.

Örnekte her iki taraf için de çıktı token fiyatları kullanılmıştır, çünkü sohbet ve ajan tabanlı işlerde fatura kalemine çıktı tokenları hakimdir. İstemi (prompt) uzun olan işleriniz varsa, her iki tarafa da girdi maliyetini ekleyin. API tarafında bu, faturada ayrı bir satırdır. Kendi kartınızda ise ön dolum (prefill) GPU süresi tükettiği için, bu durum zaten daha düşük bir ölçümlenen tokens_per_second değerine yansır.

Aritmetiğe güvenmeden önce saniye başına token ölçümü nasıl yapılır

Yukarıdaki her şey tek bir ölçülen sayıya dayanır. Bu sayıyı üç kat hatalı ölçerseniz, sonuç da üç kat hatalı olur. Ölçümü, kiraladığınız kart üzerinde, gerçekten çalıştıracağınız model ve kuantizasyon (quantisation) ile yapın.

Ollama, tek akışlı (single-stream) değeri tek bir komutla verir:

ollama run qwen3:8b --verbose "Write 400 words about disk latency."

--verbose, yanıtın ardından bir zamanlama bloğu yazdırır. Önemli olan satır, yalnızca üretimi sayan saniye başına token cinsinden eval rate değeridir. prompt eval rate, ön dolum (prefill) hızıdır ve genellikle çok daha yüksektir. Sizin sayılarınız şunlardan farklı olacaktır:

eval count:       412 token(s)
eval duration:    9.612s
eval rate:        42.86 tokens/s

Tek akış, bir maliyet modeli için yanlış sayıdır; çünkü aynı anda birçok isteğe hizmet verebilen bir kartta tek seferde yalnızca bir isteği ölçer. Toplu (aggregate) değer için, modeli vLLM ile sunun ve sunucunun kendisi hakkında raporladığı iş hacmini (throughput) okuyun:

pip install vllm
vllm serve Qwen/Qwen3-8B --max-model-len 8192

İstekler işlenirken, sunucu her raporlama aralığında bir durum satırı günlüğe kaydeder. Tam alan adları vLLM sürümleri arasında değişebilir, bu yüzden benimkini değil, kendinizinkini okuyun:

Avg prompt throughput: 812.4 tokens/s, Avg generation throughput: 396.1 tokens/s, Running: 16 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.7%

Avg generation throughput, formülün ihtiyaç duyduğu sayıdır. Eş zamanlı istekler ekledikçe KV önbelleği (key-value cache, vLLM'in VRAM'de tuttuğu istek başına dikkat durumu) dolana kadar artar, ardından artış durur. Bunun ötesine geçerseniz, istekler hızlanmak yerine kuyruğa girer; bunu artan bir Waiting sayacı olarak görürsünüz. vLLM ayrıca bir yük oluşturucu olan vllm bench serve ile birlikte gelir. Bayrakları sürümler arasında değiştiği için, bir blog yazısından komut kopyalamak yerine, kurduğunuz sürümde vllm bench serve --help komutunu çalıştırın.

Test çalışırken kartı izleyin:

nvidia-smi --query-gpu=utilization.gpu,memory.used,power.draw --format=csv -l 5

Eğer utilization.gpu üretim sırasında %100 civarında seyrediyorsa, iş hacmi sınırındasınızdır (throughput-bound) ve ölçtüğünüz sayı gerçek tavan değeridir. Eğer düşük kalıyorsa, sınır başka bir şeydir: çok az eş zamanlı istek, yavaş bir istemci veya VRAM'e sığmayan ve kısmen sistem RAM'ine aktarılan bir model. Ollama ve vLLM burada çok farklı ödünleşimler (trade-off) yapar ve aynı kart üzerindeki aralarındaki fark, başa baş noktanızı birkaç kat değiştirecek kadar büyüktür.

Bir ay boyunca fatura nasıl görünür

Bu çalışma örneğinde, saatlik 0,50 dolar maliyetli 24 GB GPU VPS, vLLM ile sunulan 8B açık kaynaklı bir model ve 16 eşzamanlı istek ile saniyede 400 çıktı token'ı toplam hız ele alınmıştır. Kartı kullansanız da kullanmasanız da kira bedeli sabittir. Bu hızdaki kapasite, kart hiç durmadan çalışırsa ayda 1.051 milyon çıktı token'ıdır.

ChartMonthly cost by output volume: one GPU VPS at $0.50 per hour against metered APIs (USD)
The data behind this chart
[
  {
    "output_tokens_millions": 5,
    "gpu_vps_usd": 365,
    "open_api_usd": 1,
    "small_api_usd": 25,
    "frontier_api_usd": 75
  },
  {
    "output_tokens_millions": 10,
    "gpu_vps_usd": 365,
    "open_api_usd": 2,
    "small_api_usd": 50,
    "frontier_api_usd": 150
  },
  {
    "output_tokens_millions": 25,
    "gpu_vps_usd": 365,
    "open_api_usd": 5,
    "small_api_usd": 125,
    "frontier_api_usd": 375
  },
  {
    "output_tokens_millions": 50,
    "gpu_vps_usd": 365,
    "open_api_usd": 10,
    "small_api_usd": 250,
    "frontier_api_usd": 750
  },
  {
    "output_tokens_millions": 100,
    "gpu_vps_usd": 365,
    "open_api_usd": 20,
    "small_api_usd": 500,
    "frontier_api_usd": 1500
  },
  {
    "output_tokens_millions": 250,
    "gpu_vps_usd": 365,
    "open_api_usd": 50,
    "small_api_usd": 1250,
    "frontier_api_usd": 3750
  },
  {
    "output_tokens_millions": 500,
    "gpu_vps_usd": 365,
    "open_api_usd": 100,
    "small_api_usd": 2500,
    "frontier_api_usd": 7500
  },
  {
    "output_tokens_millions": 1000,
    "gpu_vps_usd": 365,
    "open_api_usd": 200,
    "small_api_usd": 5000,
    "frontier_api_usd": 15000
  }
]

GPU maliyet çizgisi 365 dolar seviyesinde düz bir çizgidir; çünkü kira bedeli kartı nasıl kullandığınızla ilgilenmez. Her API maliyet çizgisi ise sıfır noktasından geçen düz bir çizgidir. Her çift tam olarak bir kez kesişir.

Ayda 25 milyon çıktı token'ında, öncü (frontier) API 375 dolar fatura çıkarır; böylece iki taraf arasındaki fark on doların altındadır. 50 milyon token'da, küçük ticari model 250 dolar fatura çıkarır ve hala daha ucuz olan seçenektir. Kartın ayın %95'inde meşgul olmasını gerektiren 1000 milyon çıktı token'ı seviyesinde, barındırılan açık ağırlıklı (open-weight) API, aynı kira bedeline karşılık 200 dolar fatura çıkarır. Kart, en yoğun çalıştığı hacimde bile neredeyse iki kat daha maliyetli hale gelir.

Bu son sonuç insanları şaşırtır ancak bu bir tesadüf değildir. Barındırılan açık ağırlıklı bir uç nokta (endpoint), yüksek kullanım oranında çalışan bir GPU filosudur; bu nedenle fiyatı, tam kapasite çalışan bir kartın maliyetine yakındır. Tek bir kart kiralayıp onu tam yükün altında çalıştırarak, tam kapasite çalışan bir filoyu maliyet açısından geçemezsiniz. Geçebileceğiniz tek şey, silikon süresinden ziyade yetenek bazlı fiyatlandırılan öncü model fiyatlarıdır.

Her görev döngüsünde milyon çıktı token'ı başına maliyet

Hacim ve görev döngüsü, aynı gerçeğin iki farklı bakış açısıdır. Kiralama işlemi saatleri satın alır. Boşta geçen saatler hiçbir şey üretmez ancak yine de maliyet yaratır.

ChartCost per million output tokens at each duty cycle (USD, list prices August 2026)
The data behind this chart
[
  {
    "label": "100% duty",
    "self_host_usd_per_million": "0.35",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "50% duty",
    "self_host_usd_per_million": "0.69",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "25% duty",
    "self_host_usd_per_million": "1.39",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "10% duty",
    "self_host_usd_per_million": "3.47",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "5% duty",
    "self_host_usd_per_million": "6.94",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "2% duty",
    "self_host_usd_per_million": "17.36",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  }
]

Üç API sütunu, Ağustos 2026 itibarıyla yayınlanan tipik liste fiyatlarıdır: Barındırılan 8B açık ağırlıklı bir model için milyon çıktı token'ı başına 0.20 dolar, küçük bir ticari model için 5.00 dolar ve öncü bir model için 15.00 dolar. Bunlar örnek niteliğindedir. Herhangi bir karar vermeden önce güncel fiyat sayfasına bakın; eğer karşılaştırmanız token bazlı ücretlendirme yerine sabit bir aylık plan üzerinden yapılıyorsa, abonelik hesaplaması farklı işler ve başa baş noktası değişir.

Kartı tam kapasite çalıştırdığınızda bir milyon çıktı token'ının maliyeti 0.35 dolardır ve bu gerçekten ucuzdur. %10 görev döngüsünde aynı milyon token'ın maliyeti 3.47 dolara çıkar. %2 görev döngüsünde ise maliyet 17.36 dolar olur; bu rakam, barındırılan açık bir modelin aynı çıktı için talep ettiği 0.20 dolar ile aynı seviyede değildir.

Yaklaşık %10 görev döngüsünün altında, bir GPU kiralamak pahalı bir tercihtir. 0.20 dolara satılan bir çıktı için milyon token başına 3.47 dolar ödüyorsunuz; aradaki farkla satın aldığınız şey ise gizlilik ve değişmeyen bir faturadır. Bunlar gerçek anlamda değerli olabilir. Ancak bunlar bir fiyat avantajı değildir, bu nedenle onları bu şekilde sınıflandırmayın.

Her API katmanı için başa baş hacmi

ChartBreak-even output volume per month, and the duty cycle it requires
The data behind this chart
[
  {
    "label": "Hosted open 8B API",
    "breakeven_tokens_millions": 1825,
    "required_duty_pct": 174
  },
  {
    "label": "Small commercial model",
    "breakeven_tokens_millions": 73,
    "required_duty_pct": 6.9
  },
  {
    "label": "Frontier model",
    "breakeven_tokens_millions": 24.3,
    "required_duty_pct": 2.3
  }
]

Frontier katmanına karşı ayda 24.3 milyon çıktı token'ına ihtiyacınız vardır; bu da kartın kapasitesinin yalnızca 2.3% kadarıdır. Bu oldukça düşük bir eşiktir. Kodlama ajanlarını mesai saatleri boyunca çalıştıran küçük bir ekip bu sınırı kolayca aşar.

Küçük ticari katmana karşı ayda 73 milyon token'a veya 6.9% görev döngüsüne (duty cycle) ihtiyacınız vardır. Barındırılan açık ağırlıklı (open-weight) katmana karşı gereken görev döngüsü 174% seviyesindedir. 100% üzerindeki herhangi bir değer tanım gereği ulaşılamazdır: kartın bir ayın içerdiğinden daha fazla saat çalışması gerekir. Bu saatlik ücretle orta seviye bir kart bu karşılaştırmada kazanamaz; dolayısıyla sonucu değiştirmenin tek yolu daha ucuz bir kart, daha hızlı bir kart veya fiyat dışındaki bir nedendir.

Formülün gizledikleri

Formül, GPU saatlerini ve tokenları fiyatlandırır. Ancak gerçek maliyetlerin birçoğu bu formülün dışındadır.

Soğuk başlatmalar (Cold starts). 16-bit ağırlıklara sahip 8B bir model yaklaşık 16 GB yer kaplar ve bu modelin yerel diskten VRAM'e yüklenmesi onlarca saniye sürer. Kira maliyetinden tasarruf etmek için sunucuyu kullanımlar arasında durdurursanız, her seferinde ilk istekte bu bekleme süresini ödersiniz. Bekleme süresinden kaçınmak için sunucuyu açık bırakırsanız, kullanım oranınız düşer ve bu da token başına maliyeti artırır. Serverless çıkarım (inference) hizmetlerinin varlık sebebi tamamen bu dengedir.

Depolama ve indirme. Model ağırlıkları büyüktür. 16-bit 8B bir model yaklaşık 16 GB, 4-bit kuantize edilmiş 30B bir model yaklaşık 18 GB yer kaplar; 16-bit 30B bir model ise 24 GB'lık bir karta sığmaz. Bu disk alanı için her ay ödeme yaparsınız ve her yeniden kurulumda zaman kaybedersiniz. Bir haftalık denemelerden sonra du -sh ~/.cache/huggingface/hub komutunu çalıştırın. Disk kullanımı beklediğinizden daha hızlı artar, çünkü bir kez denediğiniz her kuantizasyon orada durmaya devam eder.

Kendi zamanınız. Sürücü ve CUDA sürümleri, dün çalışan bir bağlam uzunluğunda (context length) alınan bellek yetersizliği (out-of-memory) hataları, sohbet şablonunu değiştiren bir model güncellemesi. Bunların hiçbiri token başına maliyet tablosunda görünmez ancak tamamı sizin akşamlarınıza mal olur. Daha önce bu tür bir sunucuyu boyutlandırmadıysanız, bir aylık kiraya taahhüt vermeden önce bir GPU VPS'in size gerçekte ne sunduğunu okumanızda fayda vardır.

Kalite farkı. Bu, en büyük gizli maliyettir ve fiyatlandırılması en zor olanıdır. 8B bir açık kaynak model, bir sınır (frontier) modeli değildir. Eğer sınır modelinin tek seferde yaptığı bir iş için üç deneme gerektiriyorsa, faydalı yanıt başına gerçek fiyatı tablodaki değerin üç katıdır ve yine de görev başarısız olabilir. Fiyat karşılaştırması yapmadan önce kendi istemlerinizle (prompts) karşılaştırma yapın. Ajan iş yükleri için genel çözüm, yönlendirmeyi zorluğa göre yapmak ve ucuz yerel tokenları toplu işler için kullanmaktır; bir VPS üzerinde ajan harcamalarını kontrol etmenin özü de büyük ölçüde buna dayanır.

Unuttuğunuz faturalar. Durdurduğunuz saatlik GPU örnekleri, genellikle bağlı depolama alanı ve rezerve edilmiş IP adresi için faturalandırılmaya devam eder. Fiyatlandırma sayfasını değil, faturanın kendisini inceleyin.

Self-hosting'in maliyet dışındaki avantajları

Hesaplamanın belirleyici faktör olmadığı dört durum.

  • Kontrolünüzden çıkmaması gereken veriler. Bir uyumluluk kuralı metnin üçüncü bir tarafa gönderilmesini yasaklıyorsa, token başına maliyet sorulması gereken soru değildir.
  • Belirli bir takvime bağlı, sürekli yüksek hacimli işler. Her gece altı saat çalışan bir toplu sınıflandırma işi, yapısı gereği yüzde 25 görev döngüsünde kalır ve fatura konusunda sizi asla şaşırtmaz.
  • Hız sınırları. Kendi kartınızın tek bir kuyruğu vardır ve bu kuyruk size aittir.
  • Hiçbir API'nin sunmadığı bir model. Özel bir fine-tune işlemine ihtiyacınız varsa, karşılaştırabileceğiniz bir seçenek yoktur.

Önce ucuz versiyonu test etmek isterseniz, bir VPS üzerinde Ollama ile küçük bir model çalıştırmak bir öğleden sonranızı alır ve açık kaynaklı bir modeli kiralayacağınız karta göre boyutlandırmak, aslında hangi GPU'ya ihtiyacınız olduğunu gösterir. Bir aylık GPU kiralamaya imza atmadan önce ölçümü orada yapın.

FAQ

Hangi aylık token hacminde GPU VPS, API fiyatlandırmasından daha avantajlı hale gelir?

GPU'nun aylık maliyetini, milyon çıktı tokeni başına düşen API fiyatına bölün. Aylık 365 dolar kira bedeli olan bir kart, 15.00 dolar/milyon fiyatlı bir öncü API ile karşılaştırıldığında, ayda 24.3 milyon çıktı tokeninde başa baş noktasına ulaşır. 5.00 dolar fiyatlı küçük bir ticari model ile bu değer 73 milyondur. 0.20 dolar fiyatlı barındırılan açık ağırlıklı bir model karşısında ise orta seviye bir kart, ay içerisinde başa baş noktasına ulaşacak kadar token üretemez.

Barındırılan açık ağırlıklı bir API neden kendi GPU'mdan daha ucuz?

Çünkü fiyatı tam kapasite çalışan bir GPU'nun maliyetine yakın belirlenmiştir, sizin kartınız ise tam kapasite çalışmamaktadır. Binlerce eşzamanlı isteğe hizmet veren bir sağlayıcı, filosunu sürekli doygunluk noktasında tutar; böylece tokenleri üretim marjinal maliyetine yakın fiyatlarla satabilir. Sizin kartınız günün büyük bölümünde boştadır ve siz bu boş saatlerin de bedelini ödersiniz. %10 kullanım oranında maliyetiniz milyon çıktı tokeni başına 3.47 dolar iken, onların maliyeti 0.20 dolardır.

Girdi tokenlerini de çıktı tokenleri kadar hesaba katmalı mıyım?

İstemleriniz (prompt) uzunsa onları da hesaba katın. Buradaki karşılaştırma yalnızca çıktı tokenlerini kullanır; bu da sohbet ve ajan tabanlı işler için baskın olan kalemdir. Girdi tokenlerini eklemek her iki tarafı da değiştirir. API tarafında bu, faturada ayrı ve daha düşük fiyatlı bir kalemdir. Kendi kartınızda ise ön dolum (prefill) GPU süresi tüketir, dolayısıyla maliyet zaten ölçtüğünüz toplam saniye başına token değerinin içindedir. Kendi gerçek istem uzunluklarınızla ölçüm yaparsanız iki taraf karşılaştırılabilir kalır.

Formülün ihtiyaç duyduğu saniye başına token değerini nasıl ölçerim?

Modeli kullanacağınız şekilde servis edin, ardından gerçek eşzamanlılık altındaki toplam üretim hızını okuyun. Ollama ile ollama run <model> --verbose, saniye başına token cinsinden bir eval rate çıktısı verir ancak bu tek bir akıştır ve toplu işleme (batch) yapan bir sunucunun kapasitesini düşük gösterir. vLLM ile çalışan sunucu, istekler işlenirken Avg generation throughput günlük kaydını tutar; kullanmanız gereken değer budur. Aynı zamanda nvidia-smi değerini izleyin. Üretim sırasında GPU kullanımı %100'e yakın değilse, henüz üst sınıra ulaşmamışsınız demektir.

%10'un altında kullanım oranında GPU VPS kiralamaya değer mi?

Fiyat açısından hayır. %10 kullanım oranında milyon çıktı tokeni başına 3.47 dolar, %2 kullanım oranında ise 17.36 dolar ödersiniz. Her iki değer de, öncü katman hariç, bu karşılaştırmadaki tüm ücretli API'lerden daha yüksektir. Bu sınırın altında kiralama işlemini yalnızca gizlilik veya hiçbir API'nin sunmadığı bir model için ödeme yapıyorsanız tercih edin.