Hangi Claude modelini seçmeliyim? Maliyet
Opus 4.8, Sonnet 5 ve Haiku 4.5 modellerinin Temmuz 2026 fiyatlarını karşılaştırın. 100.000 görev üzerinden yapılan maliyet analizini inceleyin.
Hangi Claude modelini kullanmalıyım?
Hangi Claude modelinin kullanılacağına dair kısa cevap şudur: Claude Opus 4.8 ile başlayın ve yalnızca somut bir nedeniniz varsa başka bir modele geçin. Anthropic'in yönlendirmesi de aynıdır. "Hangi modeli kullanacağınızdan emin değilseniz, karmaşık agentic kodlama ve kurumsal işler için Claude Opus 4.8 ile başlayın." Görev net bir şekilde tanımlandığında ve günde birçok kez çalıştırıldığında Claude Sonnet 5 modeline geçin. Doğru cevabın neye benzediği zaten bilinen, mekanik ve yüksek hacimli işler için Claude Haiku 4.5 modeline geçin. Claude Fable 5, uzun süreli agentlar için tüm bu modellerin üzerinde yer alır.
Bu seçimin bir maliyeti vardır. Aşağıdaki değerler, 23 July 2026 itibarıyla Claude API (application programming interface) üzerinden, dokümantasyonda MTok olarak belirtilen milyon token başına ücretlerdir.
- Claude Fable 5 (
claude-fable-5): Giriş için $10 / MTok, çıkış için $50 / MTok. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): Giriş için $5, çıkış için $25. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): Giriş için $5, çıkış için $25. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): 31 August 2026 tarihine kadar tanıtım fiyatı olarak $2 giriş, $10 çıkış. Standart $3 giriş, $15 çıkış fiyatı 1 September 2026 tarihinde yürürlüğe girecektir. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): Giriş için $1, çıkış için $5. 200K context.
Bu tanımlayıcılar yazıldığı haliyle tamdır. Sonlarına herhangi bir ekleme yapılmaz.
1M-token modellerinde boyutun kendisi ek bir maliyet getirmez: "900k-tokenlık bir istek, 9k-tokenlık bir istek ile aynı token başına ücret üzerinden faturalandırılır."
Her bir modelin asıl kullanım amacı
Anthropic, her model için tek satırlık açıklamalar sunmaktadır; bu açıklamalar herhangi bir sıralama tablosundan daha açıklayıcıdır.
- Claude Fable 5: "Uzun süreli çalışan agent'lar için yeni nesil zeka." Gecikme süresi (latency) bakımından dört model arasında en yavaşı olarak derecelendirilmiştir.
- Claude Opus 4.8: "Karmaşık agentic kodlama ve kurumsal işler için." Orta düzeyde gecikme süresi.
- Claude Sonnet 5: "Hız ve zekanın en iyi kombinasyonu." Hızlı.
- Claude Haiku 4.5: "Sınır seviyesindeki zekaya sahip en hızlı model."
Haiku 4.5, fiyattan önce iş uygunluğunu belirleyen sınırlamalara da sahiptir. Bağlam penceresi (context window) 1M yerine 200K token'dır; bu nedenle büyük bir depo (repository) veya uzun bir agent transkripti sığmayacaktır. Senkron Messages API üzerindeki maksimum çıktı kapasitesi 64K token'dır (diğerlerinde 128K token'dır) ve güvenilir bilgi kesilme tarihi (knowledge cutoff) Şubat 2025'tir; diğer üç modelin bilgi kesilme tarihi ise Ocak 2026'dır.
Seçim yapmak gerçek bir iş yükünde ne kadara mal olur?
Serideki her model, çıktı fiyatlandırmasını girdi fiyatının beş katı olarak belirler. Opus 4.8 için girdi 5$, çıktı 25$'dır. Haiku 4.5 için girdi 1$, çıktı 5$'dır. Bu oran tüm seri boyunca geçerlidir; bu nedenle seçilen model, çok fazla çıktı üreten işlerde en kritik faktördür.
Agentic işler bu tür işlere girer; çünkü düşünme tokenları çıktı tokenları olarak faturalandırılır ve metin size ulaşmasa bile max_tokens kapsamında değerlendirilir. Fable 5, Opus 4.8, Opus 4.7 ve Sonnet 5 modellerinde akıl yürütme özeti varsayılan olarak çıkarılır, bu nedenle thinking alanı boş döner. Faturalandırma değişmez: "Her iki durumda da blok aynı şekilde faturalandırılır ve çok aşamalı konuşmalarda aynı şekilde geri iletilir." Claude token faturasını aslında ne doldurur konusu bu süreci detaylıca incelemektedir.
Düşünme işleminin çalışıp çalışmaması karşılaştırılan modeller arasında farklılık gösterir; bu durum gözden kaçırılırsa maliyet testini bozacaktır. Sonnet 5 ve Fable 5 modellerinde düşünme özelliği zaten açıktır ve yapılandırma gerektirmez. Opus 4.8 ve Opus 4.7 modellerinde ise istek içerisinde thinking: {type: "adaptive"} ayarlanana kadar bu özellik kapalıdır. Sayıları analiz etmeden önce her iki taraftaki yapılandırmanın eşleştiğinden emin olun.
En ucuz model neden en pahalısı olabilir
Bağımsız bir kodlama görevi ele alınmalıdır. İstek 60,000 tokenlık bağlam içerir ve model, düşünme süreci dahil 8,000 tokenlık çıktı üretir. Caching kullanılmadığı için hesaplama net bir şekilde görülür.
Opus 4.8 üzerinde: 5$ fiyatla 0.06 MTok girdi 0.30$ eder, 25$ fiyatla 0.008 MTok çıktı ise 0.20$ eder. Deneme toplam 0.50$ tutar. Haiku 4.5 üzerinde aynı deneme 0.06$ artı 0.04$ olup toplam 0.10$ tutar.
Haiku, deneme başına beş kat daha ucuzdur; bu durum, hatalı bir denemenin sonuçları görülene kadar büyük bir tasarruf gibi görünür. Yanlış cevabı okumak zaman kaybına yol açar. Yeniden deneme sırasında bu cevabı bağlam olarak tekrar gönderdiğiniz için her deneme bir öncekinden daha büyük olur. Üçüncü deneme de başarısız olduğunda yine üst modele geçilir: 0.30$ Haiku artı 0.50$ Opus toplam 0.80$ eder; bu da Opus'u bir kez çalıştırmaktan %60 daha pahalıdır.
Bu nedenle belirleyici soru, cevabın ne kadar ucuza kontrol edilebileceğidir. Yanlış cevap bir saniye içinde anlaşılabiliyorsa, küçük model avantajlıdır. Yanlış cevabı tespit etmek dikkatli bir diff incelemesi gerektiriyorsa, küçük model faturaya yansımayan bir zaman maliyeti oluşturur.
Küçük modellerin doğrudan üstünlük sağladığı durumlar
Aşağıdaki durumlarda Haiku 4.5 doğru tercihtir:
- Mekanik alt ajan işleri. Dosya yeniden adlandıran veya arama çıktısı toplayan bir alt ajanın ileri düzey muhakemeye ihtiyacı yoktur. Claude ile bir AI ajanı oluşturulduğunda ve ajana yardımcı araçlar verildiğinde standart desen budur.
- Log ayıklama. Bir satırın gürültü mü yoksa bir insanın dikkatini çekmeye değer mi olduğuna karar vermek, hata payı belirgin olan dar kapsamlı bir yargılamadır.
- Sabit bir etiket seti ile sınıflandırma. Çıktı kısadır ve doğruluk bir örneklem üzerinde ölçülebilir.
- Yüksek hacimli üretim çağrıları. Günde 100,000 çalıştırma yapıldığında, token başına maliyet farkı artık ihmal edilebilir bir hata olmaktan çıkar. Bu, n8n içine entegre edilmiş AI iş akışlarının tipik yapısıdır.
- Yanıt hızının kullanıcı için önemli olduğu her durum. Haiku 4.5, serideki en hızlı model olarak derecelendirilmiştir.
Haiku'ya özgü bir kısıtlama mevcuttur. Minimum önbelleklenebilir (cacheable) istem boyutu 4,096 tokendır; Opus 4.8 ve Sonnet 5'te bu değer 1,024'tür. Bu değerin altındaki talepler için "bu sayıdan daha az token içeren tüm istekler önbellekleme yapılmadan işlenecek ve hata döndürülmeyecektir". Sonnet 5 üzerinde sessizce önbelleğe alınan 1,500 tokenlık bir talimat bloğu, Haiku 4.5 üzerinde önbelleğe alınmaz. Bunun belirtisi, sürekli çalışan bir ajanın maliyetlerini düşürmek için kullanılan diğer yöntemlerin yanı sıra, cache_creation_input_tokens ve cache_read_input_tokens değerlerinin her ikisinin de sıfır olmasıdır.
Yanıtı değiştiren parametreler
Bu parametrelerin her biri, model isminden daha fazla maliyet farkı yaratır.
Effort. output_config.effort, modelin yanıt vermeden önce ne kadar iş yapacağını kontrol eder. Seviyeler low, medium, high, xhigh ve max şeklindedir; varsayılan değer ise high'dir: "effort parametresini high olarak ayarlamak, effort parametresini tamamen devre dışı bırakmakla tamamen aynı davranışı sergiler." Bu parametre, isteğin en üst seviyesinde değil, output_config içinde yer alır:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort, yanıttaki her bir token'ı etkiler: "Tool call işlemleri dahil olmak üzere tüm token harcamasını etkileyebilir. Örneğin, düşük effort değeri, Claude'un daha az tool call yapması anlamına gelir." Bu durum, agentic döngülerde kümülatif bir etki yaratır. Bu bir token sınırı değildir: "Effort bir davranış sinyalidir, katı bir token bütçesi değildir." Anthropic her seviye için bir maliyet çarpanı yayınlamaz; bunun yerine kendi kullanım durumunuzu test etmenizi önerir. Bu nedenle, high seviyesindeki bir Sonnet 5 çalışması ile low seviyesindeki bir Opus 4.8 çalışması, bugün yapabileceğiniz gerçek bir karşılaştırmadır. Haiku 4.5, effort destekleyen modeller listesinde yer almamaktadır.
Prompt caching. Bir cache okuma işlemi, temel giriş oranının 0.1x'i kadar maliyetlendirilir; model seçimini belirleyen unsur, bu değerin katmanlar arasındaki etkisidir. Opus 4.8 üzerinde bir cache hit işlemi $0.50 / MTok tutarken, Haiku 4.5 üzerinde önbelleğe alınmamış bir giriş $1 / MTok tutar. Bu nedenle, iyi önbelleğe alınmış bir Opus prefix'i, giriş token başına maliyette soğuk bir Haiku prompt'undan daha ucuzdur. Büyük ve sabit bir prefix'i tekrar gönderen her türlü iş yükünde, oturum hijyeni model seçiminden daha avantajlıdır.
Batches. Yanıtın hemen alınması gerekmiyorsa, Message Batches API aynı modelleri "hem giriş hem de çıkış token'larında %50 indirimle" çalıştırır. Bu, aşağıdaki karşılaştırmadaki her bir satırı yarı yarıya düşürür ve tüm katmanlarda geçerlidir: 1 Eylül 2026 tarihinden itibaren, batched bir Opus 4.8 işi, standart fiyattaki senkron bir Sonnet 5 işinden daha ucuzdur; bu, aynı maliyetle yetenek yerine gecikme süresini (latency) tercih etmektir.
Tek bir iş için maliyet karşılaştırması
İş yükü: 100,000 destek e-postasını sınıflandırmak. Her çağrı için 2,000 input token ve 300 output token kullanılmaktadır. Bu, 200 MTok input ve 30 MTok output demektir.
- Haiku 4.5: 200 x $1 = $200 input, 30 x $5 = $150 output. Toplam $350.
- Sonnet 5, tanıtım fiyatı: 200 x $2 = $400 input, 30 x $10 = $300 output. Toplam $700.
- Sonnet 5, 1 Eylül 2026 itibarıyla: 200 x $3 = $600 input, 30 x $15 = $450 output. Toplam $1,050.
- Opus 4.8: 200 x $5 = $1,000 input, 30 x $25 = $750 output. Toplam $1,750.
Yarınki fiyatlarla hesaplama yapmak için dört sayıyı değiştirin. Aşağıdaki düzenlemeler sonucu model isminden daha fazla etkilemektedir:
- Batching her satırı yarıya indirir: $175, $350, $525 ve $875. Gece yapılan sınıflandırma işlemlerinde bekleme süresi yoktur, bu nedenle batching kullanılabilir.
- Paylaşılan prefix'in önbelleğe alınması (Caching). 2,000 input token'ın 1,200 token'ının her seferinde aynı talimat bloğu olduğunu varsayalım. Sonnet 5'in tanıtım fiyatında, bu tokenlar $2 / MTok yerine cache hit olarak $0.20 / MTok maliyetindedir. Bu durumda 120 MTok, $240 yerine $24 tutar. $2 üzerinden 80 MTok yeni input ($160) ve $300 output eklenirse, Sonnet 5 maliyeti $700 yerine $484 civarına düşer. Aynı yöntem Haiku 4.5'te işe yaramaz, çünkü 1,200 token, 4,096 token olan minimum sınırın altındadır.
- Yeniden denemeler (Retries). E-postaların %8'inde Haiku'nun cevabını reddettiğinizi ve bunları Opus 4.8 ile tekrar çalıştırdığınızı varsayalım. $350'ye 0.08 x $1,750 = $140 ekleyin, sonuç $490 olur. Benim oranımı kullanmak yerine kendi reddetme oranınızı ölçün.
- İş yükü araç tanımlarını (tool definitions) kullanıyorsa.
tool_choicedeğeriautoolarak ayarlandığında, Opus 4.8 için oluşturulan sistem promptu 290 token, Sonnet 5 için 354 token ve Haiku 4.5 için 496 token tutar. En ucuz model, en yüksek sabit maliyete sahiptir.
$490 maliyetli bir eskalasyon yoluyla Haiku ve $484 maliyetli önbelleğe alınmış Sonnet 5 aynı maliyettedir; modellerden biri işi tek geçişte tamamlar. Sorun sadece model seçimi değildir.
Oturum ortasında model değiştirmek tasarruf sağlar mı?
Etiket fiyatlarının aksine bu işlem nadiren tasarruf sağlar; çünkü tasarruf token başına hesaplanır ve risk altına alınan şey tüm önbelleğe alınmış (cached) prefix'tir.
Anthropic, bir önbelleği (cache) neyin geçersiz kıldığını belgelemektedir. Prefix'ler tools, ardından system ve ardından messages sırasıyla oluşturulur; "Her seviyedeki değişiklik, o seviyeyi ve sonraki tüm seviyeleri geçersiz kılar." İki istek ayarı da bu listededir: "Düşünme yapılandırması (thinking configuration) ve çözümlenmiş effort seviyesi doğrudan prompt içine işlenir, bu nedenle bunlardan herhangi birini değiştirmek yeni bir cache prefix'i başlatır." Dokümantasyon, çaba (effort) konusunda daha ileri gider: "Cache hit'lere dayanan bir konuşma içinde değil, iş yükleri arasında çaba düzeyini değiştirin."
Model bu belgelenmiş listede yer almamaktadır, bu nedenle her iki yönde de varsayımda bulunmayın. Bir geçişten sonraki ilk istekte cache_read_input_tokens değerini okuyun ve sonucu rakamlar belirlesin. 150,000 tokenlık bir Opus 4.8 prefix'inde, bir cache okuma işlemi yaklaşık 0.08$, yeni bir yazma işlemi ise yaklaşık 0.94$ tutar; bu tutar, hedeflediğiniz token başına farktan elde edilecek birkaç turdan daha fazladır.
Bu nedenle, bu değişiklikleri bir konuşma içinde değil, görevler arasında yapın. Claude Code'da bu, önbelleğin zaten atıldığı /clear işlemini önce, ardından /model veya /effort işlemini yapmanız gerektiği anlamına gelir.
Kendi iş yükünüz üzerinde yanıtın nasıl test edileceği
Bir istemi, farklı bir modelden alınan sayımla boyutlandırmayın. Token sayma uç noktası ücretsizdir ve belirttiğiniz modelin tokenizer'ını kullanarak sayım yapar; bu nedenle kullanmayı planladığınız modeli belirtin. Opus 4.7 ve sonrası ile Fable 5 ve Sonnet 5, "aynı metin için yaklaşık %30 daha fazla token üreten" yeni bir tokenizer kullanır; bu nedenle eski bir model üzerinde ölçülen bütçe, değişmeyen token başına ücret oranında yeni bir modelde düşük kalır.
Ardından dönen sonucu inceleyin. input_tokens sadece önbelleğe alınmamış (uncached) kalandır; bu nedenle gerçek istem boyutu, bu alan artı cache_creation_input_tokens artı cache_read_input_tokens toplamıdır. Bir VPS üzerinde ilk Claude API uygulaması bu ölçümü yapmak için en küçük dürüst ortamdır ve hangi Claude planının kullanımınıza uygun olduğu token başına ödeme yapıp yapmama konusundaki ayrı bir karardır.
FAQ
Kodlama için en iyi Claude modeli hangisidir?
Temmuz 2026 itibarıyla, karmaşık agentic kodlama için dökümante edilmiş başlangıç noktası, milyon token başına 5 $ giriş ve 25 $ çıkış maliyetiyle Claude Opus 4.8'dir. Claude Sonnet 5, hız ve zeka açısından en iyi kombinasyon olarak konumlandırılmıştır; 31 Ağustos 2026'ya kadar geçerli olan 2 $/10 $ fiyatlandırmasıyla maliyeti yarıdan azdır. Aynı görevi her iki modelde de düşünme (thinking) konfigürasyonu sabit tutularak çalıştırın ve response.usage üzerinden toplam token harcamasını karşılaştırın.
Claude Haiku 4.5, Sonnet 5'in yerini alacak kadar ucuz mudur?
Token başına maliyet açısından evet: Tanıtım fiyatlandırmasıyla Sonnet 5'in 2 $/10 $ maliyetine karşılık 1 $/5 $ maliyeti vardır veya 1 Eylül 2026'dan itibaren 3 $/15 $ olacaktır. Kararı limitler belirler. Haiku 4.5, 1M yerine 200K token bağlam penceresine, senkron Messages API üzerinde 64K maksimum çıktıya, Şubat 2025 tarihli güvenilir bilgi kesintisine, output_config.effort desteği olmamasına ve kısa sistem istemlerinde önbelleğe almayı devre dışı bırakan 4,096 tokenlık minimum önbelleklenebilir isteme sahiptir.
Oturum ortasında daha ucuz bir Claude modeline geçmek tasarruf sağlar mı?
Göründüğünden daha nadir sağlar. Anthropic, önbellek geçersiz kılaraklarını (cache invalidators) tools, system veya messages öneki değişiklikleri, düşünme konfigürasyonu değişiklikleri ve output_config.effort değişiklikleri olarak dökümante etmiştir. Bir model değişiminin mevcut önbellek üzerinde ne etkisi olduğu dökümante edilmemiştir; bu nedenle durumu bilinmez olarak kabul edin ve sonraki ilk istekte cache_read_input_tokenscache_read_input_tokens içeriğini okuyun. Bu durum önemlidir: 150,000 tokenlık bir Opus 4.8 öneki için bir önbellek okuma maliyeti yaklaşık 0.08 $ iken, yeni bir yazma maliyeti yaklaşık 0.94 $'dır; bu da token başına sağlanan tasarrufun birkaç turdan daha fazlasına eşittir. Görevler arasında, Claude Code içindeki /clear işleminden sonra, önbellek zaten siliniyorken geçiş yapın.
output_config.effort faturamı nasıl etkiler?
Modelin metin, araç çağrıları (tool calls) ve düşünme süreçlerinde harcadığı token miktarını değiştirir. Düşük efor (effort), daha az araç çağrısı yapılmasını sağlar; bu durum, her araç sonucunun sonraki turlarda tekrar gönderilmesi nedeniyle agentic döngülerde maliyeti artırır. Seviyeler low, medium, high, xhigh ve max şeklindedir; varsayılan değer ise high'dir. Anthropic, eforu bir token bütçesinden ziyade davranışsal bir sinyal olarak tanımladığı için seviye başına bir maliyet çarpanı yayınlamaz; bu nedenle kendi görevinizde ölçüm yapın.
Claude Batches API ne kadar tasarruf sağlar?
Asenkron teslimat karşılığında hem giriş hem de çıkış tokenlarında %50 tasarruf sağlar. Temmuz 2026 itibarıyla bu durum; Opus 4.8'i 2.50 $ giriş / 12.50 $ çıkış, Sonnet 5'i tanıtım fiyatıyla 1 $ / 5 $, Haiku 4.5'i ise 0.50 $ / 2.50 $ maliyetine getirir. Dikkat çekici karşılaştırma katmanlar arasında gerçekleşmektedir: 1 Eylül 2026'dan itibaren bir toplu (batched) Opus 4.8 işi, standart orandaki senkron bir Sonnet 5 işinden daha az maliyetlidir; dolayısıyla toplu işlem kullanımı, aynı paraya daha güçlü bir model sağlar.