GPU VPS mi API mi: Başa baş noktası nasıl hesaplanır?
GPU VPS kiralama ile token bazlı API maliyetlerini karşılaştırın. Aylık sabit maliyetin API faturalarıyla kesiştiği kritik token hacmini ve hesaplama formülünü öğrenin.
Başa baş noktasının gerçek konumu
Bir GPU VPS, token başına ücretlendirme yapan API modellerine karşı şu noktada avantaj sağlar: Aylık sabit kira bedelinin, o ay ürettiğiniz toplam çıktı token sayısına bölünmesiyle elde edilen birim maliyet, API'nin aynı token miktarı için talep ettiği ücretin altına düştüğünde. Kira bedeli sabittir. API faturası ise her istekte artar. Bu nedenle cevap, basit bir evet veya hayır değil, her zaman aylık bir hacim değeridir.
Saati 0.50 dolardan, 730 saatlik bir ay için 365 dolara mal olan orta seviye bir GPU VPS üzerinden hesaplama yapalım. Üst düzey bir model API'sine kıyasla, ayda 24.3 milyon çıktı tokeninde başa baş noktasına ulaşırsınız. Küçük bir ticari modele kıyasla bu değer 73 milyondur. Aynı boyuttaki barındırılan açık ağırlıklı (open-weight) bir modele kıyasla ise asla başa baş noktasına ulaşamazsınız; çünkü tek bir kart, bir ay içinde kesişim noktasına ulaşacak kadar token üretemez.
Yayınlanmış başa baş analizleri bu soruya yanıt vermemektedir. 2026 yılının başlarında yapılan iki çalışma, kesişim noktasını H200 üzerinde %72 sürekli kullanımda, MI300X üzerinde ise %22 ile %48 görev döngüsü (duty cycle) arasında konumlandırmıştır. Her iki çalışma da aynı sağlayıcının kendi sunucusuz (serverless) ürünüyle kıyaslama yapmakta ve saatlik maliyeti, buradaki okuyucuların çoğunun aylık harcamasından daha yüksek olan hızlandırıcıları fiyatlandırmaktadır. Aritmetik aynıdır. Aşağıdaki bölüm, bu hesabı tek bir kart, 7B ile 30B aralığında tek bir açık model ve standart metrikli API faturalandırması için yeniden yapmaktadır.
Aşağıdaki her sayı bir sonuç değil, bir girdidir. Hepsini kendi verilerinizle değiştirin.
Kendi değerlerinizi yerleştirebilmeniz için formül
cost_per_million = (hourly_rate * 1000000) / (tokens_per_second * 3600 * duty_cycle)
breakeven_millions_per_month = (hourly_rate * hours_per_month) / api_price_per_million
capacity_millions_per_month = (tokens_per_second * 3600 * hours_per_month) / 1000000
required_duty_cycle = breakeven_millions_per_month / capacity_millions_per_monthDört adet girdi bulunmaktadır; bunların tamamını ölçebilir veya ilgili kaynaklardan bakabilirsiniz.
hourly_rate, GPU VPS'in saatlik maliyetidir; boşta kaldığı saatler de buna dahildir. Aylık ödeme yapıyorsanız, aylık fiyatı 730'a bölün.tokens_per_second, sunucunuzun gerçek eşzamanlılık altında sürdürdüğü toplam çıktı hızıdır. Bu, bir satıcı tablosundaki tek akışlı (single-stream) değer değildir.duty_cycle, GPU'nun ay boyunca token üretmekle geçirdiği sürenin oranıdır. Tüm ay kiraladığınız ve günde iki saat kullandığınız bir sunucu için bu oran %8.3'tür.api_price_per_million, karşılaştırma yaptığınız, ölçümlenmiş çıktı token fiyatıdır.
Örnek, her iki taraftaki çıktı tokenlerini fiyatlandırmaktadır; çünkü sohbet ve aracı (agent) işlerinde fatura kalemine çıktı hakimdir. İstemi (prompt) uzun olan işleriniz varsa, her iki tarafa da girdi maliyetini ekleyin. API tarafında bu, faturada ayrı bir satırdır. Kendi kartınızda ise ön dolum (prefill) GPU süresi tükettiği için, bu durum zaten daha düşük bir ölçümlenmiş tokens_per_second değerine yansır.
Aritmetiğe güvenmeden önce saniye başına token sayısı nasıl ölçülür
Yukarıdaki her şey tek bir ölçülen sayıya dayanır. Bu sayıyı üç kat hatalı ölçerseniz, sonuç da üç kat hatalı olur. Ölçümü, kiraladığınız kart üzerinde, gerçekten çalıştıracağınız model ve kuantizasyon (quantisation) ile yapın.
Ollama, tek akışlı (single-stream) değeri tek bir komutla verir:
ollama run qwen3:8b --verbose "Write 400 words about disk latency."--verbose, yanıtın ardından bir zamanlama bloğu yazdırır. Önemli olan satır, yalnızca üretimi sayan saniye başına token cinsinden eval rate değeridir. prompt eval rate, ön dolum (prefill) hızıdır ve genellikle çok daha yüksektir. Sizin sayılarınız bunlardan farklı olacaktır:
eval count: 412 token(s)
eval duration: 9.612s
eval rate: 42.86 tokens/sTek akış, bir maliyet modeli için yanlış sayıdır; çünkü aynı anda birçok isteğe hizmet verebilen bir kartta tek seferde yalnızca bir isteği ölçer. Toplam değer için modeli vLLM ile sunun ve sunucunun kendisi hakkında raporladığı iş hacmini (throughput) okuyun:
pip install vllm
vllm serve Qwen/Qwen3-8B --max-model-len 8192İstekler işlenirken sunucu, her raporlama aralığında bir durum satırı günlüğe kaydeder. Tam alanlar vLLM sürümleri arasında değiştiğinden, benimkini değil kendinizinkini okuyun:
Avg prompt throughput: 812.4 tokens/s, Avg generation throughput: 396.1 tokens/s, Running: 16 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.7%Avg generation throughput, formülün ihtiyaç duyduğu sayıdır. Eş zamanlı istekler ekledikçe bu sayı yükselir; KV cache (vLLM'in VRAM'de tuttuğu istek başına dikkat durumu olan key-value cache) dolana kadar artmaya devam eder ve ardından durur. Bunun ötesine geçerseniz istekler hızlanmak yerine kuyruğa girer; bunu da artan Waiting sayısından görebilirsiniz. vLLM ayrıca bir yük oluşturucu olan vllm bench serve ile birlikte gelir. Bunun bayrakları sürümler arasında değiştiğinden, bir blog gönderisinden komut kopyalamak yerine yüklediğiniz sürümde vllm bench serve --help komutunu çalıştırın.
Test çalışırken kartı izleyin:
nvidia-smi --query-gpu=utilization.gpu,memory.used,power.draw --format=csv -l 5Eğer utilization.gpu üretim sırasında %100 civarında seyrediyorsa, iş hacmi sınırındasınızdır ve ölçtüğünüz sayı gerçek üst sınırdır. Eğer düşük kalıyorsa, sınır başka bir şeydir: çok az eş zamanlı istek, yavaş bir istemci veya VRAM'e sığmayan ve kısmen sistem RAM'ine aktarılan bir model. Ollama ve vLLM burada çok farklı ödünleşimler (trade-off) yapar ve aynı kart üzerindeki aralarındaki fark, başa baş noktanızı birkaç kat değiştirecek kadar büyüktür.
Bir ay boyunca fatura görünümü
Bu örnekte saatlik 0.50 dolar maliyetli 24 GB GPU VPS, vLLM ile sunulan 8B açık kaynaklı bir model ve 16 eşzamanlı istek ile saniyede 400 çıktı tokeni toplam kapasite ele alınmaktadır. Kartı kullansanız da kullanmasanız da kira bedeli sabittir. Bu hızdaki kapasite, kart hiç durmadan çalışırsa ayda 1,051 milyon çıktı tokenidir.
The data behind this chart
[
{
"output_tokens_millions": 5,
"gpu_vps_usd": 365,
"open_api_usd": 1,
"small_api_usd": 25,
"frontier_api_usd": 75
},
{
"output_tokens_millions": 10,
"gpu_vps_usd": 365,
"open_api_usd": 2,
"small_api_usd": 50,
"frontier_api_usd": 150
},
{
"output_tokens_millions": 25,
"gpu_vps_usd": 365,
"open_api_usd": 5,
"small_api_usd": 125,
"frontier_api_usd": 375
},
{
"output_tokens_millions": 50,
"gpu_vps_usd": 365,
"open_api_usd": 10,
"small_api_usd": 250,
"frontier_api_usd": 750
},
{
"output_tokens_millions": 100,
"gpu_vps_usd": 365,
"open_api_usd": 20,
"small_api_usd": 500,
"frontier_api_usd": 1500
},
{
"output_tokens_millions": 250,
"gpu_vps_usd": 365,
"open_api_usd": 50,
"small_api_usd": 1250,
"frontier_api_usd": 3750
},
{
"output_tokens_millions": 500,
"gpu_vps_usd": 365,
"open_api_usd": 100,
"small_api_usd": 2500,
"frontier_api_usd": 7500
},
{
"output_tokens_millions": 1000,
"gpu_vps_usd": 365,
"open_api_usd": 200,
"small_api_usd": 5000,
"frontier_api_usd": 15000
}
]GPU satırı 365 dolar seviyesinde düz bir çizgidir çünkü kira bedeli kartı nasıl kullandığınızla ilgilenmez. Her API satırı sıfır noktasından geçen düz bir çizgidir. Her çift tam olarak bir kez kesişir.
Ayda 25 milyon çıktı tokeninde frontier API 375 dolar fatura çıkarır, yani iki taraf arasındaki fark on doların altındadır. 50 milyon token seviyesinde küçük ticari model 250 dolar fatura çıkarır ve hala daha ucuz olan seçenektir. Kartın ayın %95'inde meşgul olmasını gerektiren 1000 milyon çıktı tokeninde, barındırılan açık ağırlıklı API aynı kira bedeline karşılık 200 dolar fatura çıkarır. Kart, en yoğun çalıştığı hacimde bile neredeyse iki kat daha maliyetli hale gelir.
Bu son sonuç insanları şaşırtır ancak bu bir tesadüf değildir. Barındırılan açık ağırlıklı bir uç nokta, yüksek kullanım oranında çalışan bir GPU filosudur; bu nedenle fiyatı, tam kapasite çalışan bir kartın maliyetine yakındır. Tek bir kart kiralayıp onu tam yükün altında çalıştırarak, tam kapasite çalışan bir filoyu maliyet açısından geçemezsiniz. Geçebileceğiniz şey, silikon süresinden ziyade yetenek bazlı belirlenen frontier fiyatlandırmasıdır.
Her görev döngüsünde milyon çıktı token'ı başına maliyet
Hacim ve görev döngüsü, aynı gerçeğin iki farklı açıdan görünümüdür. Kiralama, saatleri satın alır. Boşta geçen saatler hiçbir şey üretmez ancak yine de maliyet yaratır.
The data behind this chart
[
{
"label": "100% duty",
"self_host_usd_per_million": "0.35",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "50% duty",
"self_host_usd_per_million": "0.69",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "25% duty",
"self_host_usd_per_million": "1.39",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "10% duty",
"self_host_usd_per_million": "3.47",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "5% duty",
"self_host_usd_per_million": "6.94",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "2% duty",
"self_host_usd_per_million": "17.36",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
}
]Üç API sütunu, Ağustos 2026 itibarıyla yayınlanan tipik liste fiyatlarıdır: Barındırılan 8B açık ağırlıklı bir model için milyon çıktı token'ı başına 0.20 dolar, küçük bir ticari model için 5.00 dolar ve öncü bir model için 15.00 dolar. Bunlar örnek niteliğindedir. Herhangi bir karar vermeden önce güncel fiyat sayfasına bakın; eğer karşılaştırmanız token bazlı ücretlendirme yerine sabit bir aylık plan üzerinden yapılıyorsa, abonelik aritmetiği farklı işler ve başa baş noktası tekrar değişir.
Kartı tam kapasite çalıştırdığınızda bir milyon çıktı token'ının maliyeti 0.35 dolardır ve bu gerçekten ucuzdur. %10 görev döngüsünde aynı milyon token'ın maliyeti 3.47 dolara çıkar. %2 görev döngüsünde ise maliyet 17.36 dolar olur; bu rakam, barındırılan açık bir modelin aynı çıktı için talep ettiği 0.20 dolarlık fiyat aralığında değildir.
Yaklaşık %10 görev döngüsünün altında, bir GPU kiralamak pahalı bir tercihtir. 0.20 dolara satılan bir çıktı için milyon token başına 3.47 dolar ödüyorsunuz; aradaki farkla satın aldığınız şey ise gizlilik ve değişmeyen bir faturadır. Bunlar gerçek anlamda değerli olabilir. Ancak bunlar bir fiyat avantajı değildir, bu nedenle onları bu şekilde sınıflandırmayın.
Her API katmanı için başabaş hacmi
The data behind this chart
[
{
"label": "Hosted open 8B API",
"breakeven_tokens_millions": 1825,
"required_duty_pct": 174
},
{
"label": "Small commercial model",
"breakeven_tokens_millions": 73,
"required_duty_pct": 6.9
},
{
"label": "Frontier model",
"breakeven_tokens_millions": 24.3,
"required_duty_pct": 2.3
}
]Frontier katmanına karşı ayda 24.3 milyon çıktı token'ına ihtiyacınız vardır; bu da kartın kapasitesinin yalnızca 2.3%'idir. Bu düşük bir eşiktir. Kodlama ajanlarını mesai saatleri boyunca çalıştıran küçük bir ekip bu sınırı aşar.
Küçük ticari katmana karşı ayda 73 milyon token'a veya 6.9% görev döngüsüne ihtiyacınız vardır. Barındırılan açık ağırlıklı (open-weight) katmana karşı gereken görev döngüsü 174%'dir. 100%'ün üzerindeki herhangi bir değer tanım gereği ulaşılamazdır: kartın bir ayın içerdiği toplam saatten daha fazla çalışması gerekir. Bu saatlik ücretle orta seviye bir kart bu karşılaştırmayı kazanamaz; dolayısıyla sonucu değiştirmenin tek yolu daha ucuz bir kart, daha hızlı bir kart veya fiyat dışındaki bir nedendir.
Formülün gizledikleri
Formül, GPU saatlerini ve tokenları fiyatlandırır. Ancak birçok gerçek maliyet bu formülün dışındadır.
Soğuk başlatmalar (Cold starts). 16-bit ağırlıklara sahip 8B bir model yaklaşık 16 GB yer kaplar ve bu modelin yerel diskten VRAM'e yüklenmesi onlarca saniye sürer. Kira maliyetinden tasarruf etmek için kutuyu kullanımlar arasında durdurursanız, her seferinde ilk istekte bu bekleme süresini ödersiniz. Beklemeyi önlemek için çalışır durumda bırakırsanız görev döngünüz düşer ve bu da token başına maliyeti artırır. İşte bu denge, serverless çıkarımın var olma nedenidir.
Depolama ve indirme. Ağırlıklar büyüktür. 16-bit 8B bir model yaklaşık 16 GB, 4-bit kuantize edilmiş 30B bir model yaklaşık 18 GB yer kaplar; 16-bit 30B bir model ise 24 GB'lık bir karta sığmaz. Üst seviyede sınır hızla belirginleşir; Kimi K3 gibi trilyon parametreli açık bir modeli çalıştırmak, ağırlıkların tek başına saatlik kiralayabileceğiniz herhangi bir kartın kapasitesini aşması anlamına gelir. Bu disk için her ay ödeme yaparsınız ve her yeniden oluşturma işleminde zaman kaybedersiniz. Bir haftalık deneylerden sonra du -sh ~/.cache/huggingface/hub komutunu çalıştırın. Disk kullanımı beklediğinizden daha hızlı büyür, çünkü denediğiniz her kuantizasyon orada durmaya devam eder.
Kendi zamanınız. Sürücü ve CUDA sürümleri, dün çalışan bir bağlam uzunluğunda (context length) alınan bellek yetersizliği (out-of-memory) hataları, sohbet şablonunu değiştiren bir model güncellemesi. Bunların hiçbiri token başına maliyet rakamında görünmez, ancak hepsi akşamlarınızdan çalınır. Eğer daha önce bu kutulardan birini boyutlandırmadıysanız, bir GPU VPS'in size gerçekte ne sunduğunu aylık kiralamaya karar vermeden önce okumanızda fayda var.
Kalite farkı. Bu, en büyük gizli maliyettir ve fiyatlandırılması en zor olanıdır. 8B açık kaynaklı bir model, sınır teknolojisi (frontier) bir model değildir. Eğer sınır modelin tek seferde yaptığı bir iş için üç deneme gerektiriyorsa, faydalı yanıt başına gerçek fiyatı tablodaki değerin üç katıdır ve yine de görevde başarısız olabilir. Fiyat karşılaştırması yapmadan önce kendi istemlerinizle (prompts) karşılaştırma yapın. Ajan iş yükleri için genel çözüm, zorluğa göre yönlendirme yapmak ve toplu işler için ucuz yerel tokenları kullanmaktır; bir VPS üzerinde ajan harcamalarını kontrol etmenin özü de büyük oranda buna dayanır.
Unuttuğunuz faturalar. Durdurduğunuz saatlik bir GPU örneği, genellikle bağlı depolama alanı ve rezerve edilmiş IP adresi için faturalandırılmaya devam eder. Fiyat sayfasını değil, faturanın kendisini inceleyin.
Self-hosting'in maliyet dışındaki avantajları
Hesaplamanın belirleyici faktör olmadığı dört durum.
- Kontrolünüzden çıkmaması gereken veriler. Bir uyumluluk kuralı metnin üçüncü bir tarafa gönderilmesini yasaklıyorsa, token başına maliyet sorulması gereken soru değildir.
- Belirli bir takvime bağlı, sürekli yüksek hacimli işler. Her gece altı saat çalışan bir toplu sınıflandırma işi, yapısı gereği yüzde 25 görev döngüsünde kalır ve fatura konusunda sizi asla şaşırtmaz.
- Hız sınırları (Rate limits). Kendi kartınızın tek bir kuyruğu vardır ve bu kuyruk size aittir.
- Hiçbir API'nin sunmadığı bir model. Özel bir ince ayara (fine-tune) ihtiyacınız varsa, karşılaştırabileceğiniz bir alternatif yoktur.
Önce ucuz versiyonu test etmek istiyorsanız, bir VPS üzerinde Ollama ile küçük bir model çalıştırmak bir öğleden sonranızı alır ve açık kaynaklı bir modeli kiralayacağınız karta göre boyutlandırmak, aslında hangi GPU'ya ihtiyacınız olduğunu gösterir. Bir aylık GPU kiralamaya imza atmadan önce ölçümü orada yapın.
FAQ
Hangi aylık token hacminde GPU VPS, API fiyatlandırmasından daha avantajlı hale gelir?
GPU'nun aylık maliyetini, milyon çıktı token'ı başına düşen API fiyatına bölün. Aylık 15.00 dolar maliyetli bir öncü API'ye kıyasla, aylık 365 dolara kiralanan bir kart, 24.3 milyon çıktı token'ında başa baş noktasına ulaşır. 5.00 dolar maliyetli küçük bir ticari modele kıyasla bu rakam 73 milyondur. 0.20 dolar maliyetli barındırılan açık ağırlıklı (open-weight) bir modele kıyasla ise, orta seviye bir kartın bir ayda üretebileceği token miktarı başa baş noktasına ulaşmak için yeterli değildir.
Barındırılan açık ağırlıklı bir API neden kendi GPU'mdan daha ucuza gelir?
Çünkü fiyatı tam kapasite çalışan bir GPU'nun maliyetine yakın belirlenmiştir, sizin kartınız ise tam kapasite çalışmamaktadır. Binlerce eşzamanlı isteğe hizmet veren bir sağlayıcı, filosunu sürekli doygunluk noktasında tutar; böylece token'ları üretimlerinin marjinal maliyetine yakın bir fiyata satabilir. Sizin kartınız günün büyük bölümünde boştadır ve siz bu boş saatlerin maliyetini de ödersiniz. %10 kullanım oranında, sizin maliyetiniz milyon çıktı token'ı başına 3.47 dolar iken, onların maliyeti 0.20 dolardır.
Girdi token'larını da çıktı token'ları kadar hesaba katmalı mıyım?
İstemleriniz (prompt) uzunsa bunları hesaba katın. Buradaki karşılaştırma yalnızca çıktı token'larını baz almaktadır; bu da sohbet ve ajan tabanlı işler için baskın olan kalemdir. Girdi token'larını eklemek her iki tarafı da değiştirir. API tarafında bu, faturada ayrı ve daha düşük fiyatlı bir kalemdir. Kendi kartınızda ise prefill işlemi GPU süresi tüketir, dolayısıyla maliyet zaten ölçtüğünüz toplam saniye başına token değerinin içindedir. Ölçümü gerçek istem uzunluklarınızla yaparsanız, iki taraf karşılaştırılabilir kalır.
Formülün ihtiyaç duyduğu saniye başına token değerini nasıl ölçerim?
Modeli kullanacağınız şekilde servis edin ve gerçek eşzamanlılık altındaki toplam üretim hızını okuyun. Ollama ile ollama run <model> --verbose, saniye başına token cinsinden bir eval rate çıktısı verir; ancak bu tek bir akıştır ve toplu (batched) işleme yapan bir sunucunun kapasitesini düşük gösterir. vLLM ile çalışan sunucu, istekler işlenirken Avg generation throughput loglarını tutar; kullanılması gereken değer budur. Aynı zamanda nvidia-smi değerini izleyin. Üretim sırasında GPU kullanımı %100'e yakın değilse, henüz üst sınıra ulaşmamışsınız demektir.
%10 kullanımın altında GPU VPS kiralamaya değer mi?
Fiyat açısından hayır. %10 kullanım oranında milyon çıktı token'ı başına 3.47 dolar, %2 kullanım oranında ise 17.36 dolar ödersiniz. Her iki değer de, öncü katman hariç, bu karşılaştırmadaki tüm ücretli API'lerden daha yüksektir. Bu sınırın altında kiralama işlemini yalnızca gizlilik veya hiçbir API'nin sunmadığı bir model için ödeme yapıyorsanız tercih edin.