Claude token nedir ve kod oturumu maliyeti nasıl
Claude token birimi yaklaşık 3,5 karaktere denk gelir. Claude Code kullanımında 80.000 token sınırının neden aşıldığını ve 5 dakikalık boşta kalma süresinin maliyeti nasıl 5 kat
Claude'da token nedir?
Token, Claude'un okuduğu ve yazdığı metin birimidir; bir kelimenin parçası olup yaklaşık 3,5 İngilizce karakterine denk gelir. Bu rakam Anthropic'in kendi sözlüğünden alınmıştır ve boşluklar ile noktalama işaretleri hesaba katıldığında kelime başına bir tokendan fazlasına tekabül eder; dolayısıyla bin kelimelik bir düz yazı rahatlıkla 1.300 tokenin üzerindedir. Kod satırları daha yoğundur: parantezler, operatörler, alt çizgiler ve girintiler İngilizceye kıyasla karakter başına daha fazla tokene bölünür; birkaç yüz satırlık bir kaynak dosyası genellikle birkaç bin token ağırlığındadır. Bir ajanın okumaya karar verdiği 2.000 satırlık bir dosya, henüz tek bir satır yeni kod yazılmadan beş haneli bir token maliyeti oluşturur.
Token oluşturucular (tokenizer) hakkında iki husus kullanıcıları yanıltmaktadır. Birincisi, bunlar modele özeldir. Temmuz 2026 itibarıyla Opus 4.7 ve sonrası, Sonnet 5 ve Fable 5, önceki Claude modellerine göre aynı metin için yaklaşık %30 daha fazla token üreten daha yeni bir tokenizer kullanmaktadır (tam artış içeriğe göre değişir); bu durum, token başına fiyatlar artmamış olsa bile token bütçenizi etkiler. İkincisi, her blog yazısında başvurulan kütüphane olan tiktoken, OpenAI'ın tokenizer'ıdır ve normal metinlerde Claude'un token sayısını yaklaşık %15-20, kodlarda ise daha fazla eksik hesaplar. Tek güvenilir sayım yöntemi, aşağıda ele alınan count_tokens uç noktasıdır.
Kodlama oturumunuzun maliyeti neden bu şekildedir
Her Claude faturası, ister bir API faturası ister bir abonelik limiti olsun, tek bir ölçüme dayanır: giriş token'ları ve çıkış token'ları. Fiyatlandırma sayfası bunu basit gösterir: milyon giriş token'ı başına şu kadar dolar, milyon çıkış token'ı başına şu kadar dolar. Size söylenmeyen şey, bir yapay zeka destekli kodlama oturumunda giriş tarafındaki sayacın sezgilerin öngördüğünden çok daha hızlı çalıştığıdır; çünkü tüm konuşma her bir adımda yeniden gönderilir. On beş yıldır ölçümlü altyapı satıyorum ve token'lar, çoğu müşterinin neyin tükettiğini tam olarak söyleyemediği ilk ölçüm birimidir. Bu, sayaç okuma dersidir: bir yapay zeka oturumunda neyin giriş ve çıkış olarak sayıldığı, yeniden gönderme döngüsünün neden bu kadar maliyetli olduğu, prompt caching özelliğinin aritmetiği nasıl değiştirdiği ve hangi kaldıraçların rakamları gerçekten etkilediği.
Her şey girdidir: sayacın gerçekte neyi saydığı
İnsanlar, Claude tarafından yazılan kod için ödeme yaptıklarını varsayar. Agent tabanlı bir oturumda bu, maliyet kaleminin küçük bir kısmıdır. Daha düşük birim fiyatına sahip olmasına rağmen hacmi çok daha yüksek olan input token'ları şunları içerir:
- Sistem istemi (system prompt). Claude Code'un kendi çalışma yönergeleri ile birlikte
CLAUDE.mdve bellek dosyalarınız, oturum başlangıcında yüklenir ve sonraki her istekte bağlamda yer alır. - Araç tanımları. Agent'ın çağırabileceği her aracın şeması. Bağladığınız her MCP sunucusu bu sabit ek yükü artırır. Claude Code artık tam MCP araç tanımlarını varsayılan olarak ertelediği için, bir araç ilk kez kullanılana kadar bağlamda yalnızca araç isimleri yer alır; bu durum maliyeti hafifletse de tamamen ortadan kaldırmaz.
- Agent'ın okuduğu her dosya. Bir kaynak dosyasının
Readişlemi, dosyanın tamamını bağlama ekler ve dosya orada kalmaya devam eder. - Her araç sonucu. Test çalıştırmaları, grep çıktıları, terminal akışları, derleme günlükleri; bunların tamamı input token olarak geri döner. 8.000 satır çıktı veren başarısız bir test paketi, size küçük bir kitap bedeli kadar fatura çıkarır.
- Sohbetin tamamı, her adımda yeniden gönderilir. Bu madde kendi başına bir bölümü hak ediyor.
Yeniden gönderim maliyetleri
Claude API durumsuzdur (stateless). İstekler arasında oturumunuzu hatırlamaz, hiçbir şey hatırlamaz. Bu nedenle 2. turda istemci, 1. turu, buna verilen yanıtı ve yeni mesajınızı gönderir. 50. turda ise 1'den 49'a kadar olan tüm turları, okunan her dosyayı, her araç sonucunu, her farkı (diff) ve 50. turu yeniden gönderir. Model, her seferinde tüm transkripti yeniden okur ve bu yeniden okunan her bir token, girdi (input) olarak faturalandırılır.
Bunun sonucu olarak: tur başına maliyet oturum uzunluğuyla kabaca doğrusal oranda artar ve toplam oturum maliyeti kabaca karesel oranda büyür. 3. turda yarım cent maliyeti olan bir mesaj, 60. turda aynı tek satırlık soru için yirmi katına mal olabilir; çünkü altmış turluk bir yükü taşımaktadır. "Faturam neden bu kadar yüksek geldi" şeklindeki destek taleplerinin çoğunu açıklayan tek gerçek budur. Bu bir Claude tuhaflığı değildir; durum bilgisi tutuyormuş gibi görünen her LLM ürünü, arka planda bir yeniden gönderim döngüsü çalıştıran durumsuz bir API'dir.
Çıktı: gördükleriniz ve görmediğiniz düşünme süreci
Çıktı token'ları maliyetli olanlardır; Temmuz 2026 itibarıyla mevcut ürün yelpazesinde giriş ücretinin beş katıdır (Opus 4.8 için $5/$25, Sonnet 5 için $3/$15, Haiku 4.5 için $1/$5). Çıktı, Claude tarafından üretilen metin ve kodun yanı sıra düşünme token'larını da içerir: modelin yanıt vermeden önce yaptığı içsel muhakeme. Burada iki gerçek önem taşır. Düşünme süreci çıktı oranları üzerinden faturalandırılır ve max_tokens limitine karşı sayılır; stop_reason: "max_tokens" ile sonlanan bir API yanıtı ve kesilmiş bir cevap, genellikle düşünme sürecinin yanıt öncesinde bütçeyi tükettiği anlamına gelir. Mevcut modellerde muhakeme özeti hiç görüntülenmeyebilir; Opus 4.8, Sonnet 5 ve Fable 5 bunu varsayılan olarak gizler ancak düşünme süreci yine de gerçekleşir ve faturalandırılır. Görünmez olması ücretsiz olduğu anlamına gelmez.
Claude Code, çok adımlı çalışmalarda ölçülebilir bir iyileşme sağladığı için genişletilmiş düşünme sürecini varsayılan olarak etkinleştirir ve varsayılan bütçe, istek başına on binlerce token'a ulaşabilir. Daha basit görevlerde bu seviyeyi düşürebilirsiniz: /effort ile veya /model içinde çaba seviyesini azaltın ya da /config içindeki düşünme ayarlarını yapılandırın. Bu, bir batıl inanç değil, gerçek bir maliyet kontrol mekanizmasıdır.
Prompt caching matematiksel yapıyı değiştiriyor
Prompt caching, yeniden gönderme döngüsünün herkesi iflas ettirmemesinin temel nedenidir. API; prompt'unuzun sabit bir önekini, sistem prompt'unu, araç tanımlarını ve konuşma geçmişini önbelleğe alabilir; sonraki isteklerde ise bunu maliyetin çok küçük bir kısmına sunabilir. Temmuz 2026 itibarıyla çarpanlar şu şekildedir: Önbelleğe yazma işlemi, temel girdi oranının 1.25 katına (1 saatlik varyant için 2 katına), önbellekten okuma işlemi ise 0.1 katına mal olur. Yazma işlemleri ek maliyetlidir; okuma işlemleri ise yüzde 90 indirim sağlar. Tek bir okuma işlemi, 5 dakikalık yazma ek maliyetini fazlasıyla karşılar.
Claude Code, önbelleğe alma işlemlerini sizin yerinize yönetir ve sağlıklı bir oturumda, o devasa yeniden gönderme verisinin neredeyse tamamı önbellekten karşılanır. Ancak varsayılan önbellek süresi, son kullanımdan itibaren beş dakika ile sınırlıdır. Uzun süren bir kahve molasına çıkıp döndüğünüzde bir mesaj gönderirseniz, önbellek süresi dolmuş olur ve birikmiş tüm önek, 0.1 katı maliyetle okunmak yerine 1.25 katı maliyetle yeniden yazılır. 150K token'lık bir oturumda, bu tek soğuk başlangıç, bir düzine sıcak başlangıçtan daha maliyetlidir. Bu, içselleştirilmesi gereken sezgisel olmayan sonuçtur: Boşta kalıp devam etme ritmi, sürekli çalışmaktan daha maliyetli olabilir, çünkü TTL süresini aşan her boşluk, bir sonraki işleminizi ucuz bir okumadan pahalı bir yeniden yazmaya dönüştürür. Çalışmalarınızı bloklar halinde yapın; devasa bir oturumu on dakikada bir mesaj göndererek parça parça ilerletmeyin.
API'yi VPS üzerindeki kendi uygulamanızdan çağırıyorsanız, bu özelliklerin hiçbirinden ücretsiz yararlanamazsınız. Bu durumda sıkça yapılan hata, sistem prompt'una zaman damgası veya istek kimliği (request ID) eklemektir; bu, her istekte önek baytlarını değiştirir ve önbelleğe almayı sessizce devre dışı bırakır. Bunun göstergesi, birbirine benzeyen çağrılar boyunca usage.cache_read_input_tokens değerinin sıfırda kalmasıdır.
Formül ve örnek hesaplama
"Bir oturumun maliyeti X dolardır" diyenlere itibar etmeyin. Oturum maliyetleri iki büyüklük derecesi kadar değişkenlik gösterebilir. Geçerli olan formül şudur:
turn cost = (uncached input x base input price)
+ (cache writes x 1.25 x base input price)
+ (cache reads x 0.10 x base input price)
+ (output incl. thinking x output price)
session cost = sum over all turnsTemmuz 2026 itibarıyla 1 milyon girdi token'ı için 5 dolar, 1 milyon çıktı token'ı için 25 dolar maliyeti olan Claude Opus 4.8 üzerinde bir örnek hesaplama yapalım. Birikmiş bağlamda 80.000 token taşıyan orta ölçekli bir oturum turu: 75.000'i önbellekten okunan, 3.000'i yeni yazılan, 2.000'i önbelleğe alınmamış taze girdi ve 1.500'ü düşünme süreci dahil çıktı token'ı.
- Önbellek okumaları: 75.000 × 0,50 dolar/M = 0,0375 dolar
- Önbellek yazmaları: 3.000 × 6,25 dolar/M = 0,019 dolar
- Önbelleğe alınmamış girdi: 2.000 × 5 dolar/M = 0,010 dolar
- Çıktı: 1.500 × 25 dolar/M = 0,0375 dolar
Tur başına yaklaşık 0,10 dolar; bu şekilde elli tur yaklaşık 5 dolar eder. Şimdi aynı turun önbellek süresi dolduktan sonraki halini düşünelim: 80.000 token'ın tamamının 6,25 dolar/M üzerinden yeniden yazılması, çıktı hariç 0,50 dolara denk gelir; bu da aynı iş için sıcak önbellekli turun yaklaşık beş katıdır. Bu fark, önbellekleme hikayesinin tek bir rakamdaki özetidir. Bu dört satır, tedarikçileri karşılaştırmanın tek dürüst yoludur; çünkü liste fiyatları önbellek okumalarını ve düşünme sürecini tamamen göz ardı eder. Bu hesaplamayı üç gerçek iş üzerinde çalıştırmak, Claude faturasının OpenAI faturasının neresinde kaldığını net bir şekilde gösterir.
Tek bir turdan ziyade faturalandırma biriminin kendisine dair bir fikir edinmek isterseniz, bir milyon token'ın sayfa, dosya ve dolar bazında neye denk geldiği aynı aritmetiği bir üst seviyede açıklar. Tahmin yerine kalibrasyon için: Anthropic'in Temmuz 2026 itibarıyla kurumsal Claude Code dağıtımları için yayınladığı rakamlar, aktif gün başına geliştirici başına ortalama 13 dolar, aylık 150–250 dolar civarındadır ve kullanıcıların %90'ı günlük 30 doların altında kalmaktadır. Sonuçlarınız model seçimi, oturum hijyeni ve kod tabanı boyutuna bağlıdır; aşağıdaki kaldıraçların önemli olmasının nedeni tam olarak budur.
Kendi kullanımınızı görme
Claude Code içerisinde komut /usage şeklindedir (/cost de bir takma ad olarak çalışmaya devam eder). En üstteki Session bloğu, mevcut oturum için token istatistiklerini ve yerel olarak hesaplanmış tahmini maliyeti gösterir; abonelik planlarında aynı ekran, plan limit çubuklarınızı ve son kullanımların yeteneklere, alt aracılara, eklentilere ve bireysel MCP sunucularına göre dağılımını gösterir. API hesaplarındaki kesin faturalandırma için Claude Console üzerindeki kullanım sayfası temel alınmalıdır, CLI üzerindeki rakam yalnızca bir tahmindir. /context komutu, bağlam penceresini neyin doldurduğuna dair renkli bir ızgara çizer; sistem istemi, araçlar, MCP tanımları, dosyalar ve geçmişi gösterir. Bu, şişmiş bir CLAUDE.md veya çok fazla veri gönderen bir MCP sunucusunu tespit etmenin en hızlı yoludur; öğe bazında tam dökümü genişletmek için all bayrağını kullanın.
API tarafından sağlanan her yanıt, tam olarak ne olduğunu size bildirir:
response = client.messages.create(model="claude-sonnet-5", max_tokens=2048,
messages=messages)
u = response.usage
total_prompt = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens
print(f"uncached={u.input_tokens} written={u.cache_creation_input_tokens} "
f"read={u.cache_read_input_tokens} output={u.output_tokens}")input_tokens değerinin yalnızca önbelleğe alınmamış kısım olduğunu unutmayın; gerçek istem boyutu, üç giriş alanının toplamıdır. Bir saat boyunca çalışan ve input_tokens: 4000 değerini gösteren bir aracı ucuz değildir; diğer 200.000 token önbellekten sunulmuştur. Gönderim yapmadan önce tahmin yürütmek için token sayma uç noktasını kullanın; bu uç noktayı çağırmak ücretsizdir, kendi hız sınırına sahiptir ve belirttiğiniz modelin tokenizer'ı ile sayım yapar (sonucu yakın bir tahmin olarak değerlendirin; faturalandırma gerçek isteği yansıtır):
count = client.messages.count_tokens(model="claude-sonnet-5",
messages=[{"role": "user", "content": big_file}])
print(count.input_tokens)Yukarıdaki nedenden dolayı asla tiktoken komutunu kullanmayın.
Abonelik planları ile kullandıkça öde modeli
Bu kılavuzdaki mekanikler her yerde aynıdır; yalnızca ödeme yöntemi farklılık gösterir. Bir API anahtarı ile Anthropic, kullandıkça öde modeli üzerinden token başına, yayınlanan tarifeler üzerinden faturalandırma yapar; yukarıdaki her sayı gerçek para değerini ifade eder. Bu sayaç çoğu kişinin beklediğinden daha erken çalışmaya başlar, çünkü geri dönülebilecek ücretsiz bir katman yoktur; yalnızca kayıt sırasında verilen küçük bir kredi ve faturalandırılmayan birkaç uç nokta bulunur. Bunlar, kart bilgilerinizi sisteme girmeden önce yeni bir API hesabının sahip olduğu haklardır. Claude aboneliğinde (Pro, Max, Team, Enterprise) ise Claude Code kullanımı, planınızın sunduğu kullanım hakkından düşülür: Temmuz 2026 itibarıyla bu, modeller ve claude.ai sohbeti arasında paylaşılan, beş saatlik kayan bir oturum penceresi ve haftalık bir pencereden oluşur; /usage dolar tutarı ise bir fatura değil, bilgilendirme amaçlıdır. Bir pencereyi tükettiğinizde "You've hit your session limit" veya "You've hit your weekly limit" uyarısını ve bir sıfırlama süresi görürsünüz; /model ile modeller arasında geçiş yapmak erişimi geri getirmez, çünkü pencereler tüm modeller için ortaktır. Bu pencereler, kullandığınız istemciden ziyade hesabınızı takip eder; bu durum Linux üzerinde nelerin yerel olarak çalıştığını ve hangi planın hangi arayüzü kapsadığını anlamaya çalışıyorsanız önemlidir. Tükettiğiniz iki pencereden hangisi olduğunu bilmek, bekleme süresini ve bu sırada ne yapabileceğinizi belirler; bu nedenle limitlere takıldığınızda seçeneklerinizi bilmek faydalıdır. Planlar, üst sınırı aşan kullanımlar için /usage-credits ile yönetilen kullanım kredilerini isteğe bağlı olarak etkinleştirebilir. Plan kotalarını bilerek buraya yazmıyorum: bunlar bu konudaki en değişken sayılardır; bu yüzden claude.com/pricing adresini ve kendi /usage çubuklarınızı kontrol edin. Token mekanikleri abonelikte de önemini korur; verimsiz bir oturum, dolar harcayacağınız gibi kullanım pencerenizi de aynı şekilde tüketir. Abonelik tarafı için hangi Claude planının kullanımınıza uygun olduğuna bakın.
Gerçekten işe yarayan kaldıraçlar
- Ajanın okuduğu kapsamı sınırlandırın. "
auth.pyiçindeki doğrulama hatasını düzelt" komutu tek bir dosyayı okur; "bu kod tabanını iyileştir" komutu ise kırk dosyayı okur.CLAUDE.mddosyasını yalın tutun; her oturuma yüklendiği için sadece temel bilgileri barındırın ve iş akışına özel talimatları talep üzerine yüklenen yeteneklere taşıyın. - Net ve kompakt olun. Birbiriyle ilgisiz görevler arasında
/clearyapın; eski bağlam her mesajda yeniden gönderilir ve yeniden ücretlendirilir. Uzun bir görev içerisinde,/compact Focus on the failing tests and the diffile geçmişi özetleyerek karesel maliyet eğrisinden kaçının. - Modeli doğru boyutlandırın. Sonnet çoğu kodlama işini halleder; Temmuz 2026 itibarıyla giriş fiyatlandırmasında milyon token başına $2/$10 (liste fiyatı $3/$15, Opus ise $5/$25) maliyeti vardır. Haiku ise $1/$5 fiyatıyla log incelemesi gibi mekanik alt görevler için doğru araçtır. Fable 5, $10/$50 fiyatıyla listenin diğer ucundadır; Opus'un iki katı maliyeti olduğu için, rutin işlerde seçili bırakmadan önce hangi işlerin bu maliyeti gerçekten hak ettiğini bilmek önemlidir.
/modelile oturum ortasında geçiş yapabilirsiniz. - Ayrıntılı çıktıları önceden filtreleyin. Bir test çalışmasını Claude görmeden önce hatalara indirgeyen bir grep kancası, 20.000 tokenlik araç sonucunu 300 tokene düşürür ve bu işlem, ilgili adımın her yeniden gönderiminde tasarruf sağlar.
- Etkileşimli olmayan işleri toplu hale getirin. Kendi API hatlarınız, sınıflandırma, toplu inceleme ve gece çalışan işleriniz için Batches API, asenkron teslimat karşılığında aynı modelleri %50 indirimle çalıştırır.
- Önbellek süresine dikkat edin. Kesintisiz çalışma süreleri ile ilerleyin. Bir VPS üzerinde tmux içinde çalışan bir Claude Code oturumu boşta kaldığında hiçbir maliyet oluşturmaz; tokenlar yalnızca bir işlem gerçekleştiğinde harcanır. Ancak boşta geçen süre önbelleğin soğumasına neden olur ve bir sonraki işlemde yeniden yazma maliyeti ödenir.
FAQ
Claude Code ile yapılan bir kodlama oturumu kaç token kullanır?
Sabit bir sayı yoktur; dosyalar ve geçmiş biriktikçe tek bir oturum sırası genellikle on binlerce istem token'ı taşır ve çalışma oturumu milyonlara ulaşabilir; bunların çoğu temel ücretin onda biri oranında önbellekten karşılanır. Kalibrasyon için, Anthropic'in Temmuz 2026 itibarıyla yayınladığı kurumsal veriler, aktif bir geliştirici başına günlük ortalama 13 dolar civarındadır ve kullanıcıların %90'ı 30 doların altındadır. Kendi oturumunuzda /usage komutunu çalıştırın; beş dakika izlemek, yayınlanan herhangi bir ortalamadan daha iyi fikir verir.
Göremediğim zamanlarda bile düşünme (thinking) token'ları ücretlendirilir mi?
Evet. Düşünme token'ları, çıktı token'ları olarak, yani yüksek fiyatlı tarife üzerinden faturalandırılır ve max_tokens limitine dahil edilir; mevcut modeller, arayüz mantık özetini görüntülemekten çıkarsa bile bunları faturalandırır. Eğer bir yanıt, görünür cevap tamamlanmadan stop_reason: "max_tokens" ile kesilirse, büyük olasılıkla bütçe düşünme süreci tarafından tüketilmiştir. Claude Code içerisinde, derin mantık yürütme gerektirmeyen görevler için /effort ile çaba seviyesini düşürün.
Uzun bir Claude Code oturumu neden mesaj başına daha pahalı hale gelir?
Çünkü API durumsuzdur (stateless): her tur, tüm konuşmayı, okunan her dosyayı, araç sonucunu ve önceki alışverişi faturalandırılabilir girdi olarak yeniden gönderir; bu nedenle 50. tur, 1'den 49'a kadar olan turları yük olarak taşır. İstem önbelleğe alma (prompt caching), tekrarlanan öneki temel girdi fiyatının yaklaşık onda birine sunar, ancak önekin kendisi büyümeye devam eder ve önbellek TTL süresini aşan herhangi bir boşluk, bir sonraki turu tam fiyatlı bir yeniden yazıma dönüştürür. /compact geçmişi daraltır; /clear ise sıfırlar.
Claude token kullanımımı ve maliyetimi nasıl kontrol ederim?
Claude Code içerisinde, /usage oturum token istatistiklerini, tahmini yerel maliyeti ve aboneliklerdeki plan limiti çubuklarını gösterir (/cost bunun bir kısayoludur); /context ise pencereyi neyin doldurduğunu gösterir. Yetkili API faturalandırması için Claude Console üzerindeki kullanım sayfasını kullanın. Kendi kodunuzda response.usage değerini okuyun; input_tokens, cache_creation_input_tokens ve cache_read_input_tokens değerlerini toplamak gerçek istem boyutunu verir ve önceden tahminleme yapmak için tiktoken yerine count_tokens uç noktasını kullanın.