Claude bellek özellikleri ek ücrete tabi mi?
Claude bellek kullanımı için sabit bir ücret yoktur. Hatırlanan veriler girdi token'ı olarak faturalandırılır. Maliyet, metin boyutuna ve prompt caching durumuna bağlıdır.
Claude'un bellek özellikleri ek ücrete tabi mi?
Claude'un bellek özellikleri için ayrıca bir ücret alınmaz. Anthropic'in yayınladığı fiyatlar, milyon girdi ve milyon çıktı token'ı başına belirlenmiştir; prompt caching için ek ücretler mevcuttur ve bunların hiçbiri bellek token'ı olarak adlandırılmaz. Belleğin kendisini depolamak Claude API (uygulama programlama arayüzü) üzerinde herhangi bir maliyet oluşturmaz, çünkü bellek aracı istemci tarafında çalışır ve dosya sizin sahip olduğunuz depolama alanında barındırılır.
Bellek kullanımı yine de faturanıza yansır, çünkü hatırlanan bir bilgi ancak Claude'un okuduğu istek içerisine dahil edildiğinde yanıtı değiştirir. Hatırlama işlemi, verinin yeniden gönderilmesi anlamına gelir. Bu metin girdi token'ı olarak ulaşır ve modelin standart girdi fiyatı üzerinden ücretlendirilir. Maliyeti iki değer belirler: her turda yeniden gönderdiğiniz hatırlanan metnin kaç token olduğu ve bu metnin prompt cache üzerinden sunulup sunulamayacağı.
Pro veya Max aboneliğinde token başına ücretlendirilmezsiniz, bu nedenle bellek kullanımı paranızdan değil, kullanım kotanızdan düşer. Aşağıdaki mekanizma aynıdır. Yalnızca birim değişir. Bu kota sınırlı olduğu için, her turda ne kadar bellek taşınacağına karar vermeden önce Claude Pro maliyetini ve limitlerin sizi durdurduğu noktayı bilmek faydalıdır. Claude Enterprise ise farklı bir yapıdadır; koltuk ücretinin yanı sıra her token'ı API fiyatları üzerinden ölçer, bu nedenle aşırı büyük bir bellek bloğu kota yerine doğrudan paraya dönüşür. Belleği budamak, kullanımınızı daha küçük bir planın tavanının altına rahatça çekiyorsa, Max'ten Pro'ya geçiş yapılması gereken mantıklı bir adımdır ve değişiklik, halihazırda ödemesini yaptığınız dönemin sonunda gerçekleşir. Eğer yaptığınız karşılaştırma Anthropic'in kendi katmanları arasında değil de sağlayıcılar arasındaysa, Claude'un planlarını güncel fiyatlarla ChatGPT'nin yanında görmek başlamanız gereken yerdir.
Her bir Claude arayüzünde "bellek" ne anlama gelir
Üç farklı ürün aynı kelimeyi paylaşmaktadır ve bunların birbirine karıştırılması, bu sorunun kafa karıştırıcı bulunmasının temel nedenidir.
Claude API üzerindeki bellek aracı. tools dizisine bir girdi ekler ve dosya işlemlerini kendi kodunuzda uygularsınız.
{"type": "memory_20250818", "name": "memory"}Ağustos 2026 itibarıyla bu araç, Claude 4 ve sonraki modellerde, herhangi bir beta başlığı olmaksızın Messages API üzerinde genel kullanıma sunulmuştur. Bu araç istemci taraflıdır: Claude, view /memories gibi bir işlem talep eder, işleyiciniz bunu sizin kontrolünüzdeki depolama alanında çalıştırır ve sonucu bir tool_result bloğu içinde döndürürsünüz. Anthropic dosyayı tutmaz, bu nedenle aktarılacak bir depolama ücreti yoktur. Bunun yerine gidiş-dönüş süresi için ödeme yaparsınız. Araç tanımı her istekte gönderilir ve geri dönen dosya içeriği, o noktadan itibaren konuşma içinde kalır.
Anthropic, bu ek yükün sabit kısmını yayınlar. Claude Opus 5 üzerinde auto araç seçimi ile, Ağustos 2026'da belgelendiği üzere, araç kullanım sistem istemi 286 tokendır. Bu, bellek veya başka bir araç olsun, herhangi bir araç mevcut olduğunda her istek için bir kez ödenir.
Claude Code. Her oturumun başında iki mekanizma yüklenir. CLAUDE.md dosyaları sizin yazdığınız talimatları içerir. Otomatik bellek ise Claude'un ~/.claude/projects/<project>/memory/ altında kendisi için yazdığı notları tutar. MEMORY.md dosyasının yalnızca ilk 200 satırı veya 25KB'lık kısmı (hangisi önce dolarsa) yüklenir; yanındaki konu dosyaları ise başlangıçta değil, talep edildikçe okunur. Başlangıçta yüklenen her şey, o oturumdaki sonraki her isteğin taşıdığı önekin bir parçası haline gelir. Claude Code'un oturumlar arasında belleği nasıl geri çağırdığı konusu, dosya dosya yükleme sırasını açıklar.
Web üzerinde Claude. claude.ai üzerinde bellek, siz sohbet ettikçe Claude'un yazdığı ve güncellediği bir dizi girdidir; her proje için ayrı bir bellek alanı bulunur. Settings > Memory menüsü nelerin depolandığını listeler ve buradaki anahtar, belleği duraklatma (Pause memory) veya sıfırlama (Reset memory) seçenekleri sunar. Bu arayüz abonelik üzerinden ücretlendirilir, bu nedenle buradaki bellek kullanımı, kullanım limitlerinizden düşer.
Hatırlanan metin neden girdi belirteci olarak ücretlendirilir
Messages API durum bilgisizdir (stateless). Çağrılar arasında hiçbir veri tutmaz; bu nedenle istemciniz her adımda tüm konuşmayı gönderir ve model bunun tamamını yeniden okur. Bellek (memory) bu kuralın bir istisnası değildir. Bellek, aynı istek içerisindeki bir başka metin bloğundan ibarettir.
Bu ayrım, herhangi bir yanıttaki usage nesnesinde görülebilir.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens yalnızca önbellekten okunmayan veya önbellek oluşturmak için kullanılmayan belirteçleri sayar; bu da pratikte son önbellek kesme noktasından sonraki belirteçler anlamına gelir. İstek için toplam girdi cache_read_input_tokens artı cache_creation_input_tokens artı input_tokens değeridir. Claude'un üç tur önce açtığı bir bellek dosyası, o günden bu yana her turda bu toplamın içinde yer alır. Önbelleklenen önek geçerli olduğu sürece cache_read_input_tokens altında, geçerli olmadığı durumlarda ise input_tokens altında yer alır. Aynı metin, iki çok farklı fiyat. Girdi ve çıktı belirteçleri farklı fiyatlara tabidir ve bellek her zaman girdi tarafında yer alır.
Bu sayıları kendi kullanımınızda nerede görebilirsiniz
Bu yazı da dahil olmak üzere herhangi bir blog gönderisindeki rakamı esas almayın. Kendi bellek bloğunuzu ölçün. Token sayımı ücretsizdir ve kendi hız sınırına sahiptir, bu nedenle ölçüm yapmanın bir maliyeti yoktur.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'Yanıt, { "input_tokens": 14 } gibi tek bir sayıdır. Bellek metninizi system alanına yapıştırarak bir kez, yapıştırmadan bir kez çalıştırın; aradaki fark, bu belleğin size her turda maliyetidir. İki uyarı dikkate alınmalıdır. Sayım bir tahmindir ve Anthropic'in kendi sistem optimizasyonları için eklediği fazladan tokenlar size faturalandırılmaz. Ayrıca, ölçümü gerçekten çalıştıracağınız model üzerinde yapın; çünkü Claude 4.7 ve sonraki sürümler, aynı metin için yaklaşık yüzde 30 daha fazla token üreten daha yeni bir tokenizer kullanır.
Claude Code içinde aynı soru, herhangi bir curl komutuna gerek kalmadan yanıtlanır.
/context, bellek dosyaları dahil olmak üzere şu anda nelerin yüklü olduğunu gösterir; böylece siz bir şey yazmadan önce bunların penceredeki payını görebilirsiniz./memory, CLAUDE.md dosyalarınızı listeler ve otomatik bellek klasörünü açar./usage, oturum toplamlarını, bunlar arasındaki önbellek okumalarını ve önbellek yazmalarını yazdırır.- Durum satırı, bağlam penceresi kullanımını sürekli olarak görüntüleyebilir, böylece büyüme gerçekleştiği anda görülebilir.
/usage oturum bloğu şu şekilde görünür:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Son satırı dikkatlice okuyun. 940.0k önbellek okuma rakamı, konuşmanın, belleğin ve her şeyin her turda önbellek oranından tekrar gönderildiğini ifade eder. 1.2k giriş rakamı ise yalnızca yeni olan kısımdır. Claude Code, bu dolar tutarını liste fiyatları üzerinden yerel olarak hesaplar; bu nedenle sahip olduğunuz indirimleri göz ardı eder ve faturanızdan farklılık gösterebilir. Claude Console üzerindeki Kullanım (Usage) sayfası, kesin rakamı veren kaynaktır.
Ardından karşılaştırmayı doğrudan çalıştırın. Biri normal, diğeri otomatik bellek kapalı olacak şekilde iki yeni oturumda aynı açılış sorusunu sorun.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeHer birinde /context komutunu çalıştırın ve bellek dosyaları girişini karşılaştırın. Aradaki fark, birikmiş belleğinizin herhangi bir işlem başlamadan önce her oturumun başında size olan maliyetidir. Claude Code token kullanımının nereye gittiğine dair tam bir döküm bu iki sayıyla birlikte okunmalıdır.
Bellek tekrar oynatmanın milyon token başına maliyeti nedir?
Prompt caching, aynı bellek bloğunun bir turda diğerine göre on kat daha maliyetli olmasının nedenidir. Anthropic, önbellek oranlarını her modelin temel girdi fiyatının katları olarak yayınlar; bu sayede dolar bazlı fiyatlar değişse bile oranlar sabit kalır.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Bir önbellek okuma işlemi, temel girdi fiyatının 0.1 katına mal olur. 5 dakikalık ömre sahip bir girdi yazmak temel fiyatın 1.25 katına, 1 saatlik ömre sahip bir girdi yazmak ise 2 katına mal olur. Anthropic başa baş noktasını net bir şekilde belirtir: önbelleğe alma, 5 dakikalık sürede bir önbellek okumasından sonra veya 1 saatlik sürede iki önbellek okumasından sonra maliyetini çıkarır. Prompt caching için başa baş noktası, belleğin nerede tutulacağına karar vermeden önce yapılması gereken hesaplamadır.
Bu çarpanlar, tekrar oynatma sayısını aritmetik bir işleme dönüştürür. Aşağıdaki blok, canlı bir iş yükünün ölçümü değil, yukarıda yayınlanan çarpanların aritmetik sonucudur. 100 turluk bir oturum boyunca bir bellek bloğunu, düz temel girdi oranından ücretlendirilen eşdeğer token sayısı olarak ifade ederek üç farklı şekilde fiyatlandırır.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]100 turun tamamında önbelleği ıskalayan 4.000 token'lık bir bellek bloğu, 400,000 adet temel oranlı token gibi faturalandırılır. Aynı bloğun bir adet 5 dakikalık önbellek yazma ve 99 adet önbellek okuma ile kullanılması, 44,600 adet token gibi faturalandırılır. Bloğu boyutunun dörtte birine indirip önbelleğe almaya devam ederseniz, 11,150 adet token gibi faturalandırılır. Özellik, bu 3 satır boyunca değişmemiştir. Yalnızca tekrar oynatma davranışı değişmiştir. Bunlar hala para değil token sayılarıdır ve token sayısını aylık faturanızdaki bir tutara dönüştürmek, modelinizin milyon başına oranı ile yapılacak tek bir çarpma işlemidir. Bu oran, çalıştırdığınız model tarafından belirlenir; bu nedenle ajan Claude Fable 5 üzerinde çalışacaksa, yayınlanan milyon başına oranlarından ve uygun olduğu işlerden başlayın. Eğer sağlayıcı, modelden bağımsız olarak hala bir soru işaretiyse, Claude API ve ChatGPT üzerinde fiyatlandırılan aynı işler, bu çarpma işleminin nasıl farklı sonuçlar verdiğini gösterir ve bellek yoğunluklu bir ajan, maliyetin girdi tarafına ciddi şekilde yüklenir.
İkinci satır, sonraki 99 isteğin her birinin, bir önbellek girdisi hala aktifken geldiğini varsayar. Çoğu gerçek faturadaki hatalar bu varsayımdan kaynaklanır.
Neden aynı soru bir aradan sonra daha maliyetli oluyor?
Bir önbellek girdisinin bir ömrü vardır ve bu süre, girdinin yazıldığı veya okunduğu istek anında başlar. Varsayılan süre 5 dakikadır. 1 saatlik seçenek, yukarıda gösterilen 2 kat yazma maliyetine neden olur. Claude Code üzerinde aboneliklerde bu ömür bir saattir; kullanım kredileri üzerinden işlem yapmaya başladığınızda ise beş dakikaya düşer. API anahtarı veya bulut sağlayıcı kullanımında varsayılan süre beş dakikadır. ENABLE_PROMPT_CACHING_1H=1 ayarını yapmak, kullanım kredileri üzerindeyken bile bir saatlik ömrü korumanızı sağlar.
Öğle yemeği için açık bıraktığınız bir oturuma yazdığınız tek satırlık bir soru, siz yokken önbellek girdisinin süresi dolduğu için pahalıya mal olur. Bellek dahil tüm önek (prefix), temel giriş oranından tekrar işlenir ve önbelleğe yeniden yazılır. Verilen aranın uzunluğu bu fiyatı belirler.
Buna inanmak yerine doğrulayabilirsiniz. Pro, Max, Team veya Enterprise planlarında, /usage dökümü, son kullanımların yüzde 10 veya daha fazlasından sorumlu olan her türlü davranışı işaretler; hem uzun bağlam hem de önbellek isabetsizlikleri (cache misses) burada isimleriyle görünür. API tarafında, sessiz bir dönemden sonraki ilk istekte cache_creation_input_tokens değerinin önekinizin tam boyutuna geri sıçradığını izleyebilirsiniz.
Önbelleği sessizce geçersiz kılan nedir
Önbelleğe alınan önek şu sırayla düzenlenir: araçlar, ardından sistem, ardından mesajlar. Bir seviyedeki değişiklik, o seviyeyi ve ondan sonra gelen her şeyi geçersiz kılar. Bir araç tanımını düzenlemek, tüm önbelleği siler. Sistem istemini düzenlemek, sistem ve mesaj önbelleğini siler.
Bu, hafızayı sistem isteminde tutan ve ajan öğrendikçe onu yeniden yazan herkes için bir tuzaktır. Her yeniden yazma işlemi, arkasındaki her şeyin önbelleğe alınmış kopyasını atar, bu nedenle bir sonraki istek tekrar tam bir yazma maliyeti doğurur. Sabit materyali en başta tutun ve sabit kalmasını sağlayın; değişken materyalin ise mesaj listesinin sonlarında yer almasına izin verin, böylece geçersiz kılınması düşük maliyetli olur.
İkinci ve daha sessiz bir hata türü daha vardır. Her modelin minimum önbelleğe alınabilir önek değeri bulunur: Ağustos 2026'da yayınlandığı üzere Claude Opus 5 için 512 token, Claude Sonnet 5 için 1.024 token, Claude Haiku 4.5 için 4.096 token. Anthropic'in dokümantasyonu, bu değerin altında ne olacağı konusunda nettir: "Bu sayıdan daha az token önbelleğe alma istekleri, önbelleğe alma işlemi yapılmadan işlenecek ve herhangi bir hata döndürülmeyecektir." Bu nedenle, cache_control ile işaretlenmiş küçük bir hafıza dosyası hiçbir işe yaramaz ve sessiz kalır. Gözlemleyebileceğiniz belirti, isteminizde açıkça bir kesme noktası bulunmasına rağmen cache_creation_input_tokens değerinin 0'da kalmasıdır.
Artık yerini hak etmeyen bellekleri temizleyin
Her bellek satırı, onu taşıyan her turda token maliyeti oluşturur; bu nedenle her satır için sorulması gereken soru, yakın zamanda bir yanıtı değiştirip değiştirmediğidir. Claude Code, sınırları somut hale getirir. CLAUDE.md dosyasını 200 satırın altında tutmayı hedefleyin; çünkü daha uzun dosyalar daha fazla bağlam tüketir ve Claude'un bu talimatları takip etme güvenilirliğini azaltır. MEMORY.md yükleme sırasında ilk 200 satır veya 25KB ile sınırlandırılmıştır ve bu sınırın ötesindeki her şey bir sonraki oturum başlangıcında atılır; dolayısıyla gereğinden büyük bir dizin, token harcamanıza rağmen hiçbir şey öğretmez.
İki alışkanlık dosyanın küçük kalmasını sağlar. Detayları dizinden çıkarıp Claude'un başlangıçta değil, ihtiyaç duyduğunda okuduğu konu dosyalarına taşıyın. İş akışı talimatlarını CLAUDE.md dosyasından çıkarıp yalnızca çağrıldıklarında yüklenen yeteneklere (skills) aktarın. Hali hazırda ön bilgi (frontmatter) ile başlayan bellek dosyaları için Claude Code, 2.1.214 veya sonraki sürümlerde yazma zamanını ISO 8601 zaman damgası olarak bir modified alanına kaydeder; bu zaman damgası, geçerliliğini yitirmiş bir bilgiyi tespit etmenin en hızlı yoludur. Eski aracı belleklerinin temizlenmesi süreci, inceleme aşamasını daha derinlemesine ele almaktadır.
Veri çekme işleminin her şeyi bağlama yüklemekten daha verimli olduğu durumlar
Bellek aracı, tam zamanında (just-in-time) veri çekme işlemini desteklemek için mevcuttur. Temsilci, her şeyi en başta yüklemek yerine öğrendiklerini kaydeder ve bir dosyayı yalnızca bir görev ihtiyaç duyduğunda okur. Bu durum hesaplamayı değiştirir; çünkü bir dosya okuma işlemi token maliyetini bir kez oluşturur ve ardından önbelleğe alınmış önek (cached prefix) içinde kalır, oysa kalıcı olarak yüklenen bir blok her turda maliyet yaratır.
Yukarıdaki iki grafikten basit bir kural çıkarılabilir. Neredeyse her turda kullanılan metin, kararlı önbelleğe alınmış önek içinde yer almalıdır. Yirmi turda bir kullanılan metin ise bir view çağrısının arkasında durmalıdır. Başabaş noktası, Anthropic'in ücretlendirmesinden ziyade sizin yeniden oynatma (replay) sayınıza göre değişir.
API üzerinde ayrıca platformun konuşmayı kırpmasına izin verebilirsiniz. Bağlam düzenleme (context editing), konuşma belirlediğiniz bir eşiği aştığında eski araç sonuçlarını temizler.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}Varsayılan değerler, 100.000 giriş token'ı tetikleyicisi ve tutulan 3 araç kullanımıdır. Etkinleştirmeden önce önbelleğe alma ile olan etkileşimi okuyun: içeriği temizlemek, temizleme noktasındaki önbelleğe alınmış öneki geçersiz kılar, bu nedenle bir sonraki istekte önbellek yazma maliyeti ödersiniz. clear_at_least bunun içindir. Tasarruf, yazma işlemini haklı çıkaracak kadar büyük olana kadar temizlemeyi erteler. Yanıt, context_management altında cleared_tool_uses ve cleared_input_tokens ile tam olarak ne olduğunu raporlar, böylece takas teorik değil ölçülebilir olur. Claude Code içinde bağlam penceresini yönetme aynı mantığı bir kodlama oturumuna uygular.
Nelerin kendi satır kalemi vardır
Belleğin kendine ait bir ücreti yoktur, ancak bazı özelliklerin gerçekten ücreti vardır ve hangilerinin olduğunu bilmekte fayda vardır. Bunlar, Ağustos 2026 itibarıyla yayınlanan Claude API ücretleridir. Bazı işlemler hiçbir maliyet getirmez, ancak Claude API üzerinde ücretsiz bir katman bulunmamaktadır, yalnızca kayıt sırasında verilen küçük bir kredi vardır; bu nedenle aşağıdaki her şey ilk isteğinizden itibaren gerçek harcamadır.
- Web araması: 1.000 arama başına 10 dolar, artı aramanın bağlama eklediği her şeyin standart token maliyeti.
- Kod yürütme: Her organizasyon için aylık 1.550 ücretsiz saat, sonrasında konteyner başına saatlik 0,05 dolar. Web araması veya web getirme (web fetch) ile birlikte kullanıldığında ücretsizdir.
- Claude Yönetilen Ajanlar: Normal token ücretlerine ek olarak, oturum çalışma süresi için oturum-saati başına 0,08 dolar.
- Web getirme: Ek ücret yoktur, yalnızca getirilen içeriğin token maliyeti vardır.
Bellek bu satırların hiçbirinde yer almaz. Bellek, giriş token sayınızda görünür; tam olarak ölçebileceğiniz ve budama (pruning) ile önbelleğe almanın (caching) azaltabileceği yer burasıdır. Bir sanal özel sunucuda (VPS) gözetimsiz çalışan bir ajanın bütçesini yapıyorsanız, bir VPS üzerindeki yapay zeka ajanı için maliyet kontrolleri uygulanması gereken bir sonraki adımdır; çünkü büyüyen bir bellek dosyasına sahip ve budama yapılmayan bir ajan, hiçbir uyarı vermeden her hafta daha maliyetli hale gelir.
FAQ
Claude'un bellek özellikleri için ayrı bir ücret alınıyor mu?
Hayır. Anthropic'in fiyat listesinde milyon girdi token'ı, milyon çıktı token'ı ve prompt önbelleğe alma çarpanları için oranlar bulunur; bellek için ayrı bir kalem yoktur. Claude API üzerinde bellek aracı istemci tarafında çalışır, bu nedenle dosyalar zaten ödemesini yaptığınız depolama alanında tutulur. Belleğin eklediği şey girdi token'larıdır ve bunlar, belleği taşıyan her işlem sırasında modelin normal girdi oranından faturalandırılır.
Belleği kapatmak Claude'u daha ucuz hale getirir mi?
Her isteğin token sayısını düşürür, bu da her isteğin maliyetini azaltır. Bunun genel olarak tasarruf sağlayıp sağlamayacağı bir sonraki adıma bağlıdır. Eğer Claude, belleğin halihazırda tuttuğu bilgileri yeniden oluşturmak için üç dosyayı tekrar okumak ve size iki soru sormak zorunda kalırsa, bu token'lar belleğin maliyetinden daha pahalıya gelir. Tahmin etmek yerine ölçüm yapın: /context komutunu otomatik bellek açıkken ve CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 ile başlatılan bir oturumda çalıştırın, ardından aynı görev için harcanan toplam token miktarını karşılaştırın.
Hiçbir şeyi değiştirmediğim halde kullanımım neden arttı?
En yaygın neden, bir duraksamadan sonra önbellek isabeti (cache miss) yaşanmasıdır. Önbellek girdileri varsayılan olarak 5 dakika, genişletilmiş ayarda ise bir saat boyunca canlı kalır; bu nedenle bir aradan sonraki ilk istek, tüm önekinizi temel girdi oranından yeniden işler ve tekrar yazar. İkinci yaygın neden ise önek düzenlemesidir: bir araç tanımını değiştirmek tüm önbelleği geçersiz kılar, sistem istemini (system prompt) değiştirmek ise sistem ve mesaj önbelleğini geçersiz kılar. Bir abonelik planında, /usage dökümü, bu davranış son kullanımların yüzde 10'unu veya daha fazlasını oluşturduğunda durumu belirtir.
Bellek, sistem isteminde mi yoksa bir araç çağrısının arkasında mı yer almalı?
Neredeyse her işlemde kullanılıyorsa sistem istemine yerleştirin; çünkü bu durumda önbelleğe alınmış önekte kalır ve önbellek okuma oranından ücretlendirilir. Yalnızca bazı görevler için gerekiyorsa bir view çağrısının arkasına koyun; çünkü bir kez okunan bir dosya, token maliyetini her işlemde değil, yalnızca bir kez oluşturur. Karar verici sayı tekrar oynatma (replay) sayınızdır ve usage nesnesi size bu sayıyı doğrudan verir.
Bellek özellikleri abonelik kullanım limitlerine dahil mi?
Evet, dolaylı olarak; çünkü abonelik limitleri her isteğin taşıdığı token'lar tarafından tüketilir. Anthropic'in yardım belgeleri, otomatik bağlam yönetimini tetikleyen daha uzun konuşmaların kullanım limitinizi daha fazla tükettiğini belirtir. Bellek, her isteği biraz daha uzatır ve uzun bir oturum, bu uzunluğu her işlemde tekrar oynatır. Claude'un kullanım limitleri gerçekte nasıl çalışır başlıklı bölüm, nelerin ne zaman sıfırlandığını açıklar.