Claude Modellerinde Girdi ve Çıktı Token Maliyet Farkı
Claude modellerinde çıktı token maliyeti girdi token fiyatının beş katıdır. Prefill ve decoding süreçlerindeki hesaplama farklarını ve faturalara etkisini inceleyin.
Çıktı token'larının girdi token'larından daha maliyetli olmasının nedeni
Mevcut katalogdaki tüm Claude modellerinde çıktı token'larının maliyeti, girdi token'larının beş katıdır. Bunun nedeni hesaplama biçimidir. Bir istemi okumak, model üzerinde tek bir geçiş gerektirir. Bir yanıtı yazmak ise her token için ayrı bir geçiş gerektirir ve her geçiş kendinden öncekini beklemek zorundadır.
Bu oran fiyat listesindeki her satırda aynıdır, bu nedenle seçtiğiniz model faturanızın ne kadarının çıktıdan kaynaklandığını değiştirmez. Bunu iş yükünüzün yapısı belirler. 60,000 token okuyup 800 token ile yanıt veren bir aracı adımı, çıktı için neredeyse hiçbir maliyet oluşturmaz. 2,000 token okuyup 12,000 token yazan bir taslak oluşturma işi ise girdi için neredeyse hiçbir maliyet oluşturmaz. Her iki durum da aşağıda Anthropic'in Ağustos 2026 tarihli yayınlanmış fiyatları üzerinden hesaplanmıştır.
Prefill bir kez çalışır, decoding ise her token için bir kez çalışır
Bir çıkarım (inference) sunucusu, bir isteği birbirinden çok farklı maliyetlere sahip iki aşamada işler. Prefill aşaması istemi (prompt) okur. Decoding aşaması ise yanıtı yazar.
Prefill, istemin tamamını bir kerede alır. Her istem token'ı ağa aynı ileri geçiş (forward pass) ile girer; bu nedenle dikkat (attention) ve ileri besleme (feed-forward) işlemleri, bir seferde binlerce token'ı kapsayan az sayıda büyük matris çarpımına dönüşür. Model ağırlıklarının bellekten bir kez okunması, tüm istemi karşılar. Hızlandırıcının matris birimleri meşgul kalır; bu da prefill aşamasının hesaplama sınırlı (compute-bound) olduğu anlamına gelir: sınır, çipin ne kadar hızlı çarpma yapabildiğidir.
Decoding bu şekilde çalışamaz, çünkü 2. token 1. token'a bağlıdır. Modelin az önce ürettiği token, bir sonraki adımın girdisinin bir parçası haline gelir; bu nedenle adımlar aynı anda çalışamaz. Her çıktı token'ı kendi ileri geçişini alır ve bu geçişlerin her biri, tek bir token üretmek için model ağırlıklarının tamamını yüksek bant genişlikli bellekten okur. Bu durum decoding aşamasını bellek sınırlı (memory-bound) hale getirir: sınır, çarpma hızı değil, ağırlıkların ne kadar hızlı taşınabildiğidir. Prefill sırasında tüm bir istemi işleyen aynı ağırlık trafiği, decoding sırasında size yalnızca bir token kazandırır.
Sunum sistemleri, toplu işleme (batching) yaparak buna karşı koyar. Birçok istek birlikte decode edilir; böylece ağırlıkların bir kez okunması, gruptaki her istek için bir token üretilmesini sağlar. Decoding'in makul maliyetli olmasının nedeni budur. Tavan yine bellektir. İşlemdeki her istek bir KV cache (key/value cache, şimdiye kadar üretilen her token için saklanan dikkat durumu) tutar; bu önbellek üretilen her token ile büyür ve hızlandırıcıyı doldurduğunda grup daha fazla büyüyemez.
Bunların hiçbiri size kesin bir sayı vermez ve 5x oranını ölçülmüş bir donanım oranı olarak okumamalıyız. Bu, Anthropic tarafından belirlenen ve bu asimetriye dayanan bir fiyattır. Kendi başınıza kontrol edebileceğiniz şey ise yönelimdir ve bu yaklaşık bir dakika sürer.
Giriş ve çıkış boşluğunu kendiniz ölçün
Araçları herhangi bir Ubuntu makinesine kurun:
sudo apt update && sudo apt install -y curl jq moreutilsŞimdi uzun bir yanıt gerektiren kısa bir istemi akışa alın ve her satıra ulaştığı zamanı damgalayın.
curl -sN https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":1000,"stream":true,
"messages":[{"role":"user","content":"Count from 1 to 300, one number per line."}]}' \
| ts -s '%.s'ts -s, her satırın başına komutun başlamasından itibaren geçen saniyeyi ekler. Bu çıktıdan okunması gereken iki husus vardır. İlk content_block_delta satırı, ilk token'a ulaşma sürenizdir ve tüm prefill işlemi bu süre içinde gerçekleşmiştir. Bundan sonraki her satır, kod çözme işleminin küçük bir adımıdır ve damgalar message_stop gelene kadar artmaya devam eder.
Şimdi şekli tersine çevirin. İstem içine uzun bir belge koyun ve yanıtı birkaç token ile sınırlayın.
curl -sN https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d "$(jq -n --rawfile doc ./long-document.txt \
'{model:"claude-sonnet-5", max_tokens:16, stream:true,
messages:[{role:"user", content:("Answer in one word. Is this document about networking?\n\n" + $doc)}]}')" \
| ts -s '%.s'İlk delta, kısa istemde olduğundan daha uzun sürer çünkü prefill işleminin okuması gereken çok daha fazla metin vardır. İlk yanıt geldikten sonra süreç neredeyse anında biter çünkü kod çözülecek sadece birkaç token kalmıştır. On binlerce token içeri girmiş ve saat neredeyse hiç ilerlememiştir. Birkaç yüz token çıkmış ve saat tüm süre boyunca çalışmıştır.
Akış içermeyen her yanıt, faturalandırıldığınız sayıları içerir.
{
"usage": {
"input_tokens": 41283,
"output_tokens": 6,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
}Her istek için dört alanı da kaydedin. output_tokens genişletilmiş düşünme sürecini içerir; bu nedenle yanıt vermeden önce düşünen bir model, bu düşünme sürecini çıkış hızı üzerinden faturalandırır. Bir istemi göndermeden önce fiyatlandırmak için POST /v1/messages/count_tokens, aynı istek gövdesini kabul eder, modeli çalıştırmadan {"input_tokens": N} değerini döndürür ve ücretsizdir. API'nin ücret alınmayan tek kısmı bu değildir ve Claude API'sinin hangi kısımlarından asla ücret alınmadığı bilgisi, ilk projenizi bütçelendirmeden önce kontrol edilmeye değerdir.
Ağustos 2026 itibarıyla Claude'un milyon token başına ücretlendirmesi
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"output_multiple": 5
},
{
"label": "Sonnet 5 (to 31 Aug)",
"input_usd": 2,
"output_usd": 10,
"output_multiple": 5
},
{
"label": "Sonnet 5 (from 1 Sep)",
"input_usd": 3,
"output_usd": 15,
"output_multiple": 5
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"output_multiple": 5
},
{
"label": "Fable 5",
"input_usd": 10,
"output_usd": 50,
"output_multiple": 5
}
]Son sütun, çıktının girdiye bölünmesiyle elde edilir ve her satırda 5 değerini gösterir. Haiku 4.5, giriş için $1, çıkış için $5 faturalandırır. Opus 5, $5 ve $25 ücret alır. En maliyetli model olan Fable 5, $10 giriş ve $50 çıkış ücretine sahiptir; üst satırı göz ardı etmeden önce Fable 5 fiyatlarının size neler kazandırdığına göz atmanız önerilir. Ürün gamında yukarı çıkıldıkça her iki taraf da aynı katsayı ile çarpılır; bu durum toplam maliyeti değiştirse de giriş-çıkış oranını sabit tutar.
Sonnet 5, giriş fiyatı süreli olduğu için listede iki kez yer alır. 31 Ağustos 2026 tarihine kadar $2 giriş ve $10 çıkış ücreti uygulanır. 1 Eylül 2026 tarihinden itibaren ise her iki tarafta da %50 artışla $3 giriş ve $15 standart ücreti geçerli olur. Aşağıdaki tüm örnek hesaplamalarda Ağustos ayı fiyatları kullanılmıştır.
Fiyatlar değişebilir; bu nedenle güncel bilgileri buradan takip etmemelisiniz. claude.com/pricing tek doğru kaynaktır. Fiyat değişikliğinden etkilenmeyen tek şey yöntemdir.
Fiyat listesinde yer almayan bir uyarı mevcuttur. Anthropic belgelerine göre, Claude 4.7 ve sonraki modeller, Sonnet 4.6 ve önceki modellerdeki tokenizer'a kıyasla aynı metin için yaklaşık %30 daha fazla token üreten yeni bir tokenizer kullanır. Sadece milyon token başına maliyete bakarak iki modeli karşılaştırmak, yeni modelin lehine yanıltıcı bir sonuç doğurur; çünkü aynı belge yeni modelde daha fazla token olarak hesaplanır. Karşılaştırmayı tamamlanmış görev başına maliyet üzerinden yapın ve gerçek istemlerinizi kullanmayı planladığınız model üzerinde test edin. Aynı tuzak, tokenizer'ları birbirinden daha fazla farklılık gösteren sağlayıcılar arasında da mevcuttur; bu yüzden gerçek bir işin maliyetini hem Claude hem de ChatGPT üzerinde hesaplamak, iki fiyat listesini yan yana koymaktan daha fazla bilgi sağlar. Bir milyon Claude token'ının gerçek metin karşılığı, bu hacmin pratikte neye denk geldiğini açıklar.
Çıktı maliyeti faturanızda ne zaman baskın hale gelir?
Çıktı fiyatı, girdi fiyatının 5 katı olarak belirlendiğinde, başa baş noktasını zihinden hesaplamak kolaydır. Girdi token'larını I, çıktı token'larını O olarak adlandırın. Girdi maliyeti I'dır. Çıktı maliyeti ise 5 çarpı O'dur. 5 çarpı O, I'dan büyük olduğunda, yani 5 girdi token'ına karşılık 1 çıktı token'ı oranında, çıktı harcamalarınızın yarısından fazlasını oluşturur.
Dolayısıyla, isteminiz yanıtınızdan beş kat daha uzunsa, girdi daha büyük bir maliyet kalemidir. Bu oranın altında ise çıktı daha baskındır.
The data behind this chart
[
{
"label": "100:1",
"input_share_pct": 95.2,
"output_share_pct": 4.8
},
{
"label": "75:1",
"input_share_pct": 93.75,
"output_share_pct": 6.25
},
{
"label": "20:1",
"input_share_pct": 80,
"output_share_pct": 20
},
{
"label": "10:1",
"input_share_pct": 66.7,
"output_share_pct": 33.3
},
{
"label": "5:1",
"input_share_pct": 50,
"output_share_pct": 50
},
{
"label": "1:1",
"input_share_pct": 16.7,
"output_share_pct": 83.3
},
{
"label": "1:6",
"input_share_pct": 3.2,
"output_share_pct": 96.8
}
]100'e 1 oranında, çıktı harcamanın 4.8%'ini oluşturur ve bu durumda sadece istemi kısaltmak üzerinde çalışmaya değer. 5'e 1 oranında iki taraf eşittir. 1'e 6 oranında ise çıktı 96.8%'dir ve istem ihmal edilebilir bir hata payı haline gelir. Çoğu kişi kendi oranını yanlış tahmin eder, bu nedenle herhangi bir optimizasyon yapmadan önce bu veriyi loglarınızdan çekin.
Bir aracı iş yükü: uzun bağlam girişi, kısa yanıt çıkışı
Bir aracı (agent) adımını ele alalım: getirilen belgeler ve konuşma geçmişinden oluşan 60.000 girdi token'ı ve 800 token'lık bir yanıt. Bu, yazmadan önce okuma yapan her işlem için normal kabul edilen 75'e 1 oranına denk gelir.
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_cost": 0.06,
"output_cost": 0.004,
"total_cost": 0.064
},
{
"label": "Sonnet 5 (Aug)",
"input_cost": 0.12,
"output_cost": 0.008,
"total_cost": 0.128
},
{
"label": "Opus 5",
"input_cost": 0.3,
"output_cost": 0.02,
"total_cost": 0.32
},
{
"label": "Fable 5",
"input_cost": 0.6,
"output_cost": 0.04,
"total_cost": 0.64
}
]Çıktı, her modeldeki çağrının 6.25%'ini oluşturur; çünkü bu oran tüm fiyat listesi boyunca sabittir. Bu çağrı Opus 5 üzerinde $0.32, Ağustos tarifesiyle Sonnet 5 üzerinde $0.128 ve Haiku 4.5 üzerinde $0.064 maliyete sahiptir. Opus 5 üzerinde günde iki yüz adet bu tür adımın maliyeti günlük 64 dolardır.
Ayrımı gördüğünüzde kaldıraç etkisi netleşir. Yanıtı 800 token'dan 400 token'a düşürmek, çağrı maliyetinin yaklaşık %3'ünü tasarruf ettirir. İstemin içinden 20.000 token'lık eski bağlamı çıkarmak ise maliyetin yaklaşık üçte birini tasarruf ettirir. Okuma ağırlıklı bir araçta çıktı uzunluğunu kısıtlamak, neredeyse boşa harcanmış bir çabadır. bir kodlama aracının token'larının aslında nereye gittiği, istemi ilk etapta neyin doldurduğunu detaylandırır.
İş yükü oluşturma: kısa istem, uzun taslak
Şimdi bu yapıyı tersine çevirelim. 2.000 token'lık bir özet, 12.000 token'lık bir taslak, yani 1'e 6 oranında bir yapı.
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_cost": 0.002,
"output_cost": 0.06,
"total_cost": 0.062,
"batch_total_cost": 0.031
},
{
"label": "Sonnet 5 (Aug)",
"input_cost": 0.004,
"output_cost": 0.12,
"total_cost": 0.124,
"batch_total_cost": 0.062
},
{
"label": "Opus 5",
"input_cost": 0.01,
"output_cost": 0.3,
"total_cost": 0.31,
"batch_total_cost": 0.155
},
{
"label": "Fable 5",
"input_cost": 0.02,
"output_cost": 0.6,
"total_cost": 0.62,
"batch_total_cost": 0.31
}
]Çıktı, bu faturanın 96.8% oranını oluşturmaktadır. Opus 5 ile taslak başına maliyet $0.31 iken, Haiku 4.5 ile bu maliyet $0.062 seviyesindedir. Beş katlık bu fark neredeyse tamamen çıktı tarafındaki maliyetten kaynaklanmaktadır; daha ucuz bir modelin size en çok tasarruf sağladığı nokta tam olarak burasıdır.
Son sütun, girdi ve çıktı maliyetlerini %50 oranında düşüren Batch API üzerinden gerçekleştirilen aynı işi göstermektedir. Opus 5 ile taslak başına maliyet $0.155 seviyesine geriler. Batch, sonuçları anlık olarak değil 24 saat içinde döndürür; bu nedenle gece raporu oluşturma ve toplu sınıflandırma işlemleri için uygundur. Bir kullanıcının başında beklediği işler için uygun değildir.
Model yönlendirme (routing), ajan adımında asla sağlamadığı bir tasarrufu burada sağlar. İşin uzun ve detaylı kısmı mekanikse, yani metni yeniden biçimlendirmek veya onayladığınız bir taslağı genişletmekten ibaretse, ucuz model bu token'ları beş kat daha düşük bir maliyetle üretir. Opus, Sonnet ve Haiku arasında seçim yapma rehberi, kalite sınırının gerçekte nerede durduğunu açıklamaktadır.
İstem önbellekleme yalnızca girişi indirimli hale getirir
İstem önbellekleme (prompt caching), isteminizin bir ön ekini sunucuda saklar ve bu veriyi tekrar okumak için giriş ücretinin bir kısmını tahsil eder. Ağustos 2026 itibarıyla çarpanlar; 5 dakikalık bir önbellek yazmak için temel giriş ücretinin 1.25 katı, 1 saatlik önbellek yazmak için 2 katı ve bir isabet (hit) okumak için 0.1 katıdır.
Çıktı bu anlaşmaya dahil değildir. Önbelleğe alınmış bir çıktı yoktur. Modelin yazdığı her token, istemin ne kadarı önbellek isabeti olarak dönmüş olursa olsun, her seferinde tam çıktı ücreti üzerinden faturalandırılır.
Opus 5 üzerinde aynı aracı adımını ele alalım; 60.000 giriş token'ının 55.000'i hazır bir önbellekten sağlansın.
The data behind this chart
[
{
"label": "No cache",
"input_cost": 0.3,
"output_cost": 0.02,
"total_cost": 0.32
},
{
"label": "55k prefix cache read",
"input_cost": 0.0525,
"output_cost": 0.02,
"total_cost": 0.0725
}
]Çağrı maliyeti $0.32 tutarından $0.0725 tutarına düşer. Çıktı satırı değişmez: Öncesinde $0.32, sonrasında $0.0725. Önbellekleme faturayı düşürür ve yapısını değiştirir. Çıktı, bu çağrının %6.25'ini oluşturuyordu. Şimdi ise dörtte birinden fazlasını oluşturuyor; bu da bir sonraki aşamada hangi optimizasyonun daha değerli olduğunu değiştirir.
İlk çağrı yazma işleminin ücretini öder. 5 dakikalık bir önbellek yazma işlemi temel giriş ücretinin 1.25 katına mal olur, bu nedenle tek bir isabetten sonra kendini amorti eder. 1 saatlik yazma işlemi 2 katına mal olur, bu yüzden iki isabet gerekir. yazma ve okuma çarpanları ile önbelleklemenin avantaj sağlamayı bıraktığı noktalar bu hesaplamayı detaylandırır.
Kontrol edebileceğiniz dört kaldıraç
max_tokensdeğerini modelin maksimum kapasitesine değil, p95 çıktı uzunluğunuza göre ayarlayın.- Uzun adımları daha düşük maliyetli bir modele yönlendirin.
- Kimsenin beklemediği her şeyi toplu işleme (batch) dahil edin.
- Yanıtları gereksiz uzatan talimatları silin.
max_tokens katı bir üst sınırdır; bu değeri yüksek tutmanın tek başına bir maliyeti yoktur çünkü ücretlendirme üretilen token miktarı üzerinden yapılır, sınırın kendisi üzerinden değil. Cömert bir üst sınırın sağladığı avantaj, hatalı bir yanıtta limitin sizi kısıtlamasını önlemektir. Loglarınızdan output_tokens dağılımını çıkarın, sınırı 95. yüzdelik dilimin biraz üzerine ayarlayın ve stop_reason: "max_tokens" durumlarını kod tarafında yanıtı devam ettirerek veya yeniden deneyerek yönetin. Tespit ettiğiniz bir kesilme, ödeyip çöpe attığınız 4.000 token'lık gereksiz bir açıklamadan daha ucuza mal olur. Genişletilmiş düşünme süreçleri de output_tokens içine dahil edilir, bu nedenle bütçeyi aynı veriler ışığında belirleyin.
Yönlendirme (routing), bir adımın maliyetli kısmı muhakeme değil de hacim olduğunda işe yarar. Karar verme aşamasında güçlü modeli tutun, yazma işini ise daha ucuz bir modele devredin. Yönlendirilmiş sürümü önce kendi değerlendirme setinizde ölçün; çünkü iki deneme gerektiren ucuz bir model, tek bir pahalı denemeden daha maliyetli olabilir.
Toplu işleme (batching), çıktı maliyetini düşüren tek kaldıraçtır. Her iki tarafta yüzde 50 indirim sağlar, sonuçlar 24 saat içinde gelir ve zamanlanmış her türlü iş bu kapsama girer.
Son kaldıraç ise insanların genellikle göz ardı ettiği kısımdır. "Kapsamlı ol" veya "gerekçeni açıkla" gibi ifadeler, yapacağınız her çağrıda çıktı uzunluğunuzu belirler. Bunları istediğiniz formatla değiştirin: "En fazla üç cümleyle yanıtla" veya "Önsöz olmadan sadece JSON nesnesini döndür". Her yanıta 300 token ekleyen bir sistem istemi, aynı 300 token'ın istem içinde kapladığı maliyetin beş katına mal olur. çalışan bir ajanın maliyetlerini kontrol altında tutmak, izleme tarafını kapsar; API kullanımının mı yoksa sabit aboneliğin mi kullanım şekliniz için daha ucuz olduğu konusu ise, aboneliğin karşılayabileceği bir token maliyeti üzerinde bir hafta boyunca ince ayar yapmadan önce netleştirilmelidir. Tek bir geliştirici için bu durum genellikle Claude Pro'nun aylık 20 doları ve beraberinde gelen kullanım limitlerinin yapacağınız işi karşılayıp karşılamadığına bağlıdır. Eğer bu limitlere oturum ortasında ulaşıyorsanız, hangi pencerede beklediğinizi belirlemek ilk adımdır; çünkü buradaki çözüm daha küçük bir model, daha hafif bir bağlam, ek kullanım kredileri veya bu işi ücretli API üzerine taşımaktır. Eğer ücretli API bu iş için daha ucuz bir seçenekse, daha küçük bir plana geçmek veya aboneliği iptal etmek, halihazırda ödediğiniz ayı etkilemez, dolayısıyla geçiş yapmanın size bir maliyeti olmaz. Pro planını kıyasladığınız şey ücretli API değil de ChatGPT ise, iki abonelik modelinin yan yana fiyatlandırılması, kodlama işleri için hangisinin daha ekonomik olduğunu gösterir. Bu soru tek bir geliştirici için değil de bir ekip için soruluyorsa, Claude Enterprise'ın koltuk başına ücret ile bu API oranlarında ücretlendirilen token'ları birleştirdiğini, dolayısıyla bu sayfadaki her kaldıracın faturanın ücretli kısmı için geçerli olduğunu unutmayın.
FAQ
Çıktı token'ları neden girdi token'larından daha maliyetlidir?
Bunların üretilmesi, token başına çok daha fazla hızlandırıcı süresi gerektirir. Bir istem (prompt), tamamı üzerinden tek bir ileri geçişte işlenir; dolayısıyla model ağırlıklarının tek bir okuması binlerce token'ı kapsar ve donanım, çarpma verimi ile sınırlanır. Bir yanıt ise her seferinde tek bir token olarak üretilir; her token, tüm model ağırlıklarını tekrar okuyan kendi ileri geçişine ihtiyaç duyar, bu nedenle donanım bellek bant genişliği ile sınırlanır. Anthropic, mevcut kataloğun tamamında (Haiku 4.5'ten Fable 5'e kadar) çıktı fiyatını girdi fiyatının beş katı olarak belirlemiştir.
İstem önbellekleme (prompt caching) çıktı token'larını ucuzlatır mı?
Hayır. İstem önbellekleme yalnızca girdi için geçerlidir. Ağustos 2026 itibarıyla bir önbellek okuması, temel girdi oranının 0.1 katına mal olur; önbellek yazmaları ise 5 dakikalık süre için 1.25 kat, 1 saatlik süre için 2 kat maliyetlidir. Çıktı, önbelleğin ne yaptığına bakılmaksızın her çağrıda tam oran üzerinden faturalandırılır. Önbelleklemenin faturanızın boyutunun yanı sıra şeklini de değiştirmesinin nedeni budur: girdi tarafı küçüldüğünde, maliyetin ana kaynağı çıktı haline gelir.
Yüksek bir max_tokens değeri, yanıt kısa gelirse bana para kaybettirir mi?
Hayır. Yalnızca modelin fiilen ürettiği token'lar için faturalandırılırsınız, bu nedenle max_tokens bir rezervasyon değil, bir üst sınırdır. Yine de önemlidir, çünkü kontrolden çıkan bir yanıta konulabilecek tek kesin sınırdır. Bu değeri, gözlemlediğiniz output_tokens değerlerinin yüzde 95'lik diliminin biraz üzerine ayarlayın ve ardından sessizce kesilmiş bir yanıt göndermek yerine stop_reason: "max_tokens" durumunu kod içerisinde yönetin.
Kendi girdi/çıktı token oranımı nasıl bulabilirim?
Her yanıtın usage nesnesinden input_tokens, output_tokens, cache_read_input_tokens ve cache_creation_input_tokens değerlerini kaydedin, ardından bir hafta boyunca toplamları birbirine bölün. 5 girdi/1 çıktı oranının üzerindeyseniz, paranız istemin içindedir; bu nedenle kararlı kısmı önbelleğe alın ve geri kalanını kırpın. Bunun altındaysanız, paranız yanıtın içindedir; bu nedenle yanıt uzunluğunu sınırlayın ve en çok çıktı üreten adımları daha ucuz bir modele veya Batch API'ye taşıyın.