SSD Nodes Learn 🎉 VPS $4.99/aydan başlayan
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-07

Claude API maliyetleri neden bu kadar yüksek?

Claude API faturalarındaki gizli maliyetleri hesaplayın. Çıktı token fiyatı, bağlam penceresi tekrarı ve aracı kullanımı ile maliyetleri düşürmenin dört etkili yolunu öğrenin.

Claude neden pahalı? Kısa yanıt

Claude, birbirini tetikleyen dört temel nedenden dolayı pahalıdır. Çıktı token'ları, girdi token'larının beş katı fiyatlandırılır. API, konuşmanızın hafızasını tutmaz; bu nedenle her adımda tüm geçmiş tekrar gönderilir ve tekrar faturalandırılır. Bir aracı (agent), tek bir soruyu onlarca API çağrısına dönüştürür ve her çağrı, giderek büyüyen bu geçmişi beraberinde taşır. Tüm bunların üzerine, en gelişmiş model (frontier model), küçük bir modeli çalıştırmanın maliyetine göre değil, yaptığı işin zorluk derecesine göre fiyatlandırılır.

Token, bir metin parçasıdır. Kaba bir hesapla, bir token yaklaşık dört karakter veya İngilizce olarak 0.75 kelimeye denk gelir. Fiyatlar, MTok (milyon token) başına belirtilir. Aşağıdaki her oran, Ağustos 2026 itibarıyla yayınlanan Claude API fiyatıdır.

Beklenmedik faturaların çoğu, listedeki ikinci ve üçüncü nedenlerden kaynaklanır. Kullanıcılar genellikle sadece Claude'un yazdığı yanıtların maliyet oluşturduğuna inanarak işe başlar. Bir aracı oturumunda, yazma işlemi genellikle faturanın onda birinden daha azını oluşturur.

Yayınlanan ücretler, böylece rakamlar üzerinde mutabık kalıyoruz

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

Mutlak rakamlardan ziyade genel yapıya odaklanın. Her model, çıktı için girdi maliyetinin tam olarak beş katını ücretlendirir. Opus 5, milyon girdi token'ı başına 5 dolar, milyon çıktı token'ı başına ise 25 dolar maliyete sahiptir. Haiku 4.5 ise 1 ve 5 maliyetindedir. Dolayısıyla en ucuz model ile en pahalı model arasındaki fark beş kattır; okuma ve yazma arasındaki fark da aynı şekilde beş kattır.

Sonnet 5, 31 Ağustos 2026 tarihine kadar milyon token başına 2 ve 10 dolar tutarındaki tanıtım fiyatlandırmasıyla sunulmaktadır. 1 Eylül 2026 tarihinden itibaren bu fiyatlar 3 ve 15 seviyesine çekilecektir. Ücretler yeni model sürümleriyle birlikte değişebileceğinden, bütçe planlaması yapmadan önce güncel oranları kontrol edin.

Son sütun önbellek okuma (cache read) oranını gösterir. Fatura tutarlarının büyük kısmını bu belirler. Aritmetik hesaplamalardan sonra bu konuya tekrar dönün.

Çıktı token'ları neden girdi token'larından beş kat daha maliyetlidir?

Okuma ve yazma işlemleri aynı miktarda iş yükü gerektirmez. Girdi token'ları tek geçişte işlenir. Model, tüm istemi bir kerede okur ve iş yükü bu istem üzerinde paralel olarak yürütülür; 60.000 token'lık bir istemin 1.000 token'lık bir istemden 60.000 kat daha uzun sürede okunmamasının nedeni budur.

Çıktı token'ları ise tek tek üretilir. Her yeni token'ın model üzerinden kendi geçişini yapması gerekir ve bağlam olarak kendisinden önceki her token'a ihtiyaç duyar. 1.000 token yazmak, art arda 1.000 geçiş anlamına gelir. Bu seri iş yükü, okuma işleminde olduğu gibi dağıtılamaz; bu nedenle her çıktı token'ı donanımı daha uzun süre meşgul eder.

"Cevabı daha kısa tut" komutunun beklenenden daha zayıf bir tasarruf aracı olmasının nedeni budur. Bu yöntem, bir aracı faturasının daha küçük olan yarısı üzerinde etkilidir.

Neden tüm konuşmam her adımda tekrar faturalandırılıyor?

Claude API durum bilgisizdir (stateless). Anthropic tarafında üzerinde işlem yaptığınız veya ekleme yaptığınız bir konuşma oturumu tutulmaz. Her istek tüm mesaj geçmişini içerir ve model, herhangi bir çıktı üretmeden önce bu geçmişin tamamını okur. Bu nedenle 30. adımda, 1'den 29'a kadar olan adımlar için de ücretlendirilirsiniz.

Bu durum, bir konuşmanın maliyetinin uzunluğundan daha hızlı arttığı anlamına gelir. 1. adımda küçük bir bağlam (context) için ücret ödenirken, 40. adımda büyük bir bağlam için ödeme yapılır. Kırk adımın tamamını topladığınızda, aslında yazılan toplam token sayısının çok daha fazlası için ödeme yapmış olursunuz.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

Yukarıdaki oturum, sistem istemi (system prompt), araç tanımları ve ajanın açtığı ilk dosyaları içeren 20,000 token ile başlar. 40. adıma gelindiğinde bağlam 100,000 token değerine ulaşır. Bu değeri kırk adımın tamamına yaydığınızda, istek başına ortalama 60.000 token okunduğu sonucuna varırsınız.

Bir aracı (agent) neden bir sohbetten çok daha maliyetlidir?

Bir sohbet, soru başına tek bir istektir. Bir aracı ise adım başına tek bir istektir. Bir dosyayı okumak bir adımdır. Bir test çalıştırmak bir adımdır. Test çıktısını okumak bir adımdır. Dosyayı düzenlemek bir adımdır. Bir kodlama aracısı için tek bir görevi tamamlamak adına kırk adım atmak olağan bir durumdur.

Araç kullanımıyla birlikte iki ek maliyet ortaya çıkar. Modelin her seferinde hangi araçların mevcut olduğunu bilmesi gerektiğinden, araç tanımları her bir istekte girdi belirteci (input token) olarak işlenir. Anthropic bu ek yükü açıklamıştır: Araç kullanım sistemi istemi, tool_choice değeri auto olarak ayarlandığında Opus 5 üzerinde 286 belirteçtir; buna kendi araç şemalarınızın belirteçleri de eklenir. Bazı sunucu tarafı araçların ayrıca ayrı bir ücreti vardır. Web araması, sonuçların tükettiği belirteçlere ek olarak her 1.000 arama için 10 dolar üzerinden ücretlendirilir.

Her araç sonucu aynı zamanda kalıcı bağlamdır. 3.000 satır yazdıran bir komut, bu 3.000 satırı oturumun geri kalanındaki her isteğe dahil eder. Claude Code tarafından raporlanan oturum bazlı belirteç kullanımı bunu görünür kılar: gürültülü bir komuttan hemen sonra girdi sayısının nasıl yükseldiğini izleyin.

Tek bir gerçek oturum üzerindeki aritmetik

İşte Opus 5 üzerinde gerçekleştirilen, temsilci tabanlı kodlamaya dair gerçekçi bir saatlik çalışma. Kırk adet API isteği. Bağlam 20.000 token'dan 100.000 token'a kadar büyür, bu da istek başına ortalama 60.000 token anlamına gelir. Model, kısa araç çağrıları ve birkaç uzun kod bloğunun karışımı olacak şekilde, istek başına yaklaşık 700 token yazar.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

Dağılıma bakın. Okuma maliyeti 12.00 dolar, yazma maliyeti ise 0.70 dolardır; dolayısıyla aslında okuduğunuz çıktı faturanın yaklaşık yüzde beşidir. Model 28,000 token yazdı ve 2,400,000 token okuma için faturalandırıldı. Kimse 2,4 milyon token yazmadı. Aynı 100.000 token tekrar tekrar okundu.

Seviye 1: En büyük tasarruf yöntemi olan prompt caching

Prompt caching, prompt'unuzun sabit bir önekinin işlenmiş halini saklar. Bir sonraki istekte bu önek, yeniden işlenmek yerine önbellekten okunur. Önbelleğe yazma işlemi, beş dakikalık önbellek için giriş ücretinin 1,25 katına, bir saatlik önbellek için ise 2 katına mal olur. Önbellekten okuma maliyeti ise giriş ücretinin 0,1 katıdır. Opus 5 modelinde bu, milyon token başına 5 dolar yerine 0.50 dolara denk gelir.

Bunu yukarıdaki oturuma uygulayın. Konuşma ilerledikçe 100.000 token'ın her biri bir kez önbelleğe yazılır. Diğer 2.300.000 giriş token'ı ise önbellek okuması haline gelir.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

Önbelleğe alınabilir kısmı bir cache_control alanı ile işaretleyin. Kesme noktasını (breakpoint), turlar arasında değişmeyen içeriğin (sistem prompt'u ve araç tanımları) sonrasına yerleştirin. Sürekli başvurduğunuz uzun bir belge de aynı sabit blok içinde yer almalıdır.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

Prompt'unuzun sırası artık maliyeti belirler. Önbellek isabeti (cache hit), prompt'un en başından itibaren tam eşleşme gerektirir; bu nedenle her istekte değişen her şey, değişmeyen her şeyden sonra gelmelidir. Sistem prompt'unuzun en üstüne bir zaman damgası koyarsanız, her turda önbelleği bozarsınız: tüm önek bir isabetsizlik (miss) haline gelir ve onu tekrar yazmak için giriş ücretinin 1,25 katını ödersiniz.

Yanıt, işlemin başarılı olup olmadığını size bildirir. Bir istek gönderin ve kullanım bloğunu okuyun.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Her yanıt, aşağıdakine benzer bir usage nesnesi taşır:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

cache_read_input_tokens içinde hala 0 değerini gösteren bir tekrar isteği, önbelleğe isabet edilmediği anlamına gelir. Bunun yaygın nedeni, kesme noktanızdan önce bir şeyin değişmiş olmasıdır. Beş dakikalık önbellek süresi de dolabilir; bu nedenle altı dakika sonra gönderilen bir istek, isabetsizlik ve ardından yeni bir yazma işlemi ile sonuçlanır.

Seviye 2: basit işlemleri daha küçük bir modele yönlendirin

Bir aracı oturumundaki işlemlerin çoğu zor değildir. Bir dosyayı açmak, bir biçimlendiriciyi çalıştırmak, bir farkı okumak. Bunlar için en gelişmiş modele gerek yoktur. Bu işlemleri Haiku 4.5 modeline yönlendirmek, girdi maliyetini milyon token başına 5 dolar seviyesinden 1 dolar seviyesine düşürür.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

Aynı oturumun maliyeti; önbellekleme olmadan Opus 5 üzerinde 12.70 dolar, önbellekleme ile 2.48 dolar, önbellekleme ile Sonnet 5 üzerinde 0.99 dolar ve önbellekleme ile Haiku 4.5 üzerinde 0.50 dolardır. Sadece önbellekleme kullanımı fatura tutarının yaklaşık yüzde seksenini düşürür. Model seçimi ise geriye kalanın büyük kısmını eler.

İşte dürüst bir uyarı: Yanlış cevap veren daha ucuz bir model, size tüm oturumu tekrar ettirir ve buna ek olarak zamanınızı kaybettirir. Yönlendirmeyi fiyata göre değil, görevin zorluk derecesine göre yapın. Opus, Sonnet ve Haiku arasında seçim yapma rehberi, her bir modelin hangi durumlarda yeterli olduğunu detaylandırır.

Seviye 3: bağlam hijyeni

Bağlamda bıraktığınız her bir token, sonraki her adımda faturalandırılır; bu nedenle bir token'ı erken aşamada kaldırmak, geç aşamada kaldırmaktan çok daha değerlidir. 40 adımlık bir oturumun 5. adımında sisteme yüklenen 5.000 token'lık bir dosya, 35 kez daha okunur. Bu, dikkatsizce yapılan tek bir yapıştırma işlemi için Opus 5 modelinde neredeyse bir dolara denk gelen 175.000 fazladan girdi token'ı demektir.

Bu sayıyı etkileyen dört alışkanlık:

  • Dünkü oturumu devam ettirmek yerine, yeni bir görev için temiz bir oturum başlatın.
  • Çıktı modele ulaşmadan önce, head -50 gibi araçlarla gürültülü komutları filtreleyin; bunu çıktıdan sonra yapmayın.
  • Tüm dosyayı değil, yalnızca ilgilendiğiniz tek bir fonksiyonu isteyin.
  • Uzun bir oturumda ilerleme durduğunda, bir özet isteyin ve oturuma bu özetle yeniden başlayın. Özet birkaç yüz token tutar. Tam döküm ise yüz binlerce token olabilir.

Seviye 4: Etkileşimli olmayan her şeyi toplu işleyin

Batch API, istekleri eşzamansız olarak işler ve hem girdi hem de çıktı maliyetlerinde yüzde 50 oranında tasarruf sağlar. Bir işin yanıtının bir sonraki saniye içinde alınması gerekmiyorsa, bu işi toplu işleme (batch) dahil edin. Sınıflandırma, veri çıkarma, birikmiş işlerin özetlenmesi ve değerlendirme çalıştırmaları bu kapsama girer. Toplu işleme indirimi, prompt caching ile birlikte uygulanabilir. Etkileşimli oturumlar için herhangi bir bekleme süreci söz konusu olmadığından, bu indirim etkileşimli oturumlara uygulanmaz.

Dolandırılıyor muyum?

"Claude neden pahalı" sorusunun altında yatan asıl soru budur, bu yüzden işte net bir cevap. Ücretler yayınlanmıştır, standart katmanlardaki herkes için aynıdır ve token başına ücretlendirilir. Faturadaki hiçbir kalem isteğe bağlı değildir. Fiyat listesinin size söyleyemeyeceği şey, karşılığını alıp almadığınızdır; çünkü liste token'ları fiyatlandırır, siz ise sonuçlarla ilgilenirsiniz.

Bu yüzden sonucu fiyatlandırın. Yukarıdaki oturum, önbelleğe alınmamış halde 12.70 dolara mal oldu. Eğer bu oturum size bir saat kazandıracak bir özelliği kullanıma sunduysa, bu ucuzdur. Eğer kırk tur boyunca aynı daire içinde döndüyse, aynı 12.70 dolar hiçbir şey satın almamış demektir ve sorun hiçbir zaman tarife olmamıştır.

Hatırlanması gereken kısım budur. Faturanız değerle değil, token miktarıyla ölçeklenir. Verimli bir oturum ile boşa harcanan bir oturum, aynı uzunlukta olduklarında aynı maliyete sahiptir. Dört kaldıraçın fiyat listesinden daha önemli olmasının nedeni budur: token başına fiyatı müzakere edemezsiniz, ancak işin kaç token alacağına siz karar verirsiniz.

Bu nedenle aylık dolar bazında değil, tamamlanan görev başına dolar bazında takip yapın. Önbelleğe alma ve yönlendirme ayarlarını optimize ederken bu sayı düşüyorsa, aylık toplam yükselse bile kurulumunuz gelişiyor demektir; çünkü toplam tutar daha fazla iş yapıldığı için artıyordur.

Faturayı düşürmeyen etkenler

Bazı popüler tavsiyelerin etkisi oldukça sınırlıdır. Modele "özlü ol" talimatı vermek çıktıyı kısaltır, ancak çıktı örnek faturanın yalnızca yüzde beşini oluşturmaktadır. Kendi sorunuzu kısaltmak, 60.000 token'lık bir bağlamda sadece birkaç yüz token tasarruf sağlar. Genişletilmiş düşünme (extended thinking) özelliğini kapatmak, yalnızca düşünme token'larının toplam çıktı içinde ciddi bir payı olduğu durumlarda işe yarar; kullanım bloğu bunu tahmin etmenize gerek kalmadan size bildirir.

Daha geniş bir bağlam penceresi (context window) kendi başına bir maliyet kalemi değildir. Claude 4.6 ve sonraki sürümlerde, bir milyon token'lık tam pencere standart token başına ücret üzerinden faturalandırılır; dolayısıyla 900.000 token'lık bir istek, 9.000 token'lık bir istekle aynı birim fiyata sahiptir. Pencere boyutu fiyatı belirlemez; pencerenin içine ne koymayı seçtiğiniz fiyatı belirler.

İki konu daha tek bir oturumdan ziyade planlama aşamasına aittir. Kullanımınız günlük ve etkileşimli ise, token başına ödeme ile sabit planı karşılaştırın: API ve abonelik maliyet karşılaştırması bu hesabı yapar. Eğer bir aracı (agent) bir sunucuda gözetimsiz çalışıyorsa, başka hiçbir şeyi optimize etmeden önce katı bir harcama limiti belirleyin; bir VPS üzerinde yapay zeka aracı için maliyet kontrolleri bu konuyu ele alır. Ölçek hakkında net bir fikir edinmek için bir milyon Claude token'ı gerçekte ne satın alır başlıklı yazı, fiyat listesini metin sayfalarına dönüştürür.

FAQ

Bir ajan kullanmaya başladığımda Claude faturam neden yükseldi?

Çünkü bir ajan, her soru için birçok istek gönderir ve her istek, o ana kadarki tüm konuşmayı içerir. Bir sohbet arayüzü, her soru için tek bir istek gönderir. Bir kodlama ajanı ise her adım için bir istek gönderir ve tek bir görev için kırk adım atılması normaldir. Bu isteklerin her biri tam bağlam üzerinden ücretlendirilir; bu nedenle 100.000 token ile biten bir oturum, toplamda iki milyonun üzerinde girdi token'ı üzerinden faturalandırılabilir. Bunu doğrudan görmek için API yanıtındaki input_tokens ve cache_read_input_tokens kısımlarını inceleyin.

Prompt önbellekleme (prompt caching) faturayı gerçekten bu kadar düşürür mü?

Verilen örnekte oturum maliyeti 12.70 dolardan 2.48 dolara düşmüştür, çünkü bir önbellek okuma işlemi, girdi ücretinin onda biri kadardır. Tasarruf tamamen isabet oranınıza bağlıdır. Beş dakikalık önbellek süresiyle, tek bir okumadan sonra kendini amorti eder; çünkü yazma işlemi girdi ücretinin 1.25 katı, okuma işlemi ise 0.1 katıdır. Eğer prompt'unuz her istekte başlangıca yakın bir yerde değişiyorsa, hiçbir isabet alamazsınız ve yazma primi için boşuna ödeme yapmış olursunuz. Çalıştığından emin olmak için cache_read_input_tokens ile doğrulama yapın.

Her şey için sadece Haiku mu kullanmalıyım?

Hayır. Haiku 4.5, milyon girdi token'ı başına 1 dolar maliyete sahipken, Opus 5 için bu rakam 5 dolardır; bu nedenle sınıflandırma ve yönlendirme gibi basit ve yüksek hacimli işlerde tasarruf gerçektir. Zor bir görevde alınan yanlış bir cevap, modelin sağladığı tasarruftan daha pahalıya mal olur; çünkü hem yeniden deneme maliyetini hem de harcadığınız zamanın maliyetini ödersiniz. Geçerli olan yöntem karma kullanımdır: mekanik işlemler için küçük model, muhakeme gerektiren işlemler için ise en gelişmiş model tercih edilmelidir.

API, Claude aboneliğinden daha mı ucuz?

Bu, kullanımınızın ne kadar düzenli olduğuna bağlıdır. Abonelik, kullanım limitleri olan sabit bir aylık ücrettir. API ise tavan fiyatı olmayan, token başına ödeme yöntemidir; kullanımınız düşük olduğunda veya ani artışlar gösterdiğinde daha ucuz, her iş günü yoğun bir şekilde kullandığınızda ise daha pahalıdır. Kullanım bloğundan günlük ortalama token sayınızı alın, bunu modelinizin fiyatı üzerinden hesaplayın ve çıkan rakamı plan fiyatıyla karşılaştırın.