Claude bellek özellikleri ek ücrete tabi mi?
Claude bellek kullanımı için sabit bir ücret yoktur. Hatırlanan bilgiler girdi token'ı olarak faturalandırılır. Maliyet, verinin önbelleğe alınıp alınmadığına bağlıdır.
Claude'un bellek özellikleri ek ücrete tabi mi?
Claude'un bellek özellikleri için ayrıca bir ücret alınmaz. Anthropic'in yayınladığı fiyatlar, milyon girdi token'ı ve milyon çıktı token'ı başına belirlenmiştir; prompt önbelleğe alma (prompt caching) için ek ücretler bulunur ve bunların hiçbiri bellek token'ı olarak adlandırılmaz. Belleğin kendisini depolamak Claude API (uygulama programlama arayüzü) üzerinde herhangi bir maliyet oluşturmaz, çünkü bellek aracı istemci tarafında çalışır ve dosya sizin sahip olduğunuz depolama alanında barındırılır.
Bellek kullanımı yine de faturanıza yansır, çünkü hatırlanan bir bilgi yalnızca Claude'un okuduğu isteğin içine dahil edildiğinde yanıtı değiştirir. Hatırlama işlemi, verinin yeniden gönderilmesi anlamına gelir. Bu metin girdi token'ı olarak ulaşır ve modelin standart girdi fiyatı üzerinden ücretlendirilir. Maliyeti iki sayı belirler: her turda kaç token'lık hatırlanan metni tekrar gönderdiğiniz ve bu metnin prompt önbelleğinden karşılanıp karşılanamadığı.
Pro veya Max aboneliğinde token başına ücretlendirilmezsiniz; bu nedenle bellek, paranızdan ziyade kullanım kotanızdan harcar. Aşağıdaki mekanizma aynıdır, yalnızca birim değişir. Bu kota sınırlı olduğundan, her turda ne kadar bellek taşıyacağınıza karar vermeden önce Claude Pro'nun maliyetini ve limitlerin sizi durduracağı noktayı bilmek faydalıdır. Claude Enterprise ise farklı bir yapıdadır; koltuk ücretinin yanı sıra her token'ı API fiyatları üzerinden ölçer, bu nedenle aşırı büyük bir bellek bloğu kota yerine doğrudan paraya dönüşür. Eğer bellek miktarını azaltmak kullanımınızı daha düşük bir planın tavanının altına çekiyorsa, Max'ten Pro'ya geçiş yapılması gereken mantıklı bir adımdır ve bu değişiklik, halihazırda ödemesini yaptığınız dönemin sonunda gerçekleşir. Eğer Anthropic'in kendi planları yerine farklı sağlayıcılar arasında bir karşılaştırma yapıyorsanız, Claude'un planlarını güncel fiyatlarla ChatGPT'nin yanında görmek başlamanız gereken yerdir.
Her bir Claude arayüzünde "bellek" ne anlama gelir
Üç farklı ürün aynı kelimeyi paylaşmaktadır ve bunların birbirine karıştırılması, bu sorunun kafa karıştırıcı bulunmasının temel nedenidir.
Claude API üzerindeki bellek aracı. tools dizisine bir girdi ekler ve dosya işlemlerini kendi kodunuzda uygularsınız.
{"type": "memory_20250818", "name": "memory"}Ağustos 2026 itibarıyla bu araç, Claude 4 ve sonraki modellerde, herhangi bir beta başlığı olmaksızın Messages API üzerinde genel kullanıma açıktır. Bu araç istemci taraflıdır: Claude, view /memories gibi bir işlem talep eder, işleyiciniz bunu sizin kontrolünüzdeki depolama alanında çalıştırır ve sonucu bir tool_result bloğu içinde döndürürsünüz. Anthropic dosyayı tutmaz, bu nedenle yansıtılacak bir depolama ücreti yoktur. Bunun yerine gidiş-dönüş süresi için ödeme yaparsınız. Araç tanımı her istekte gönderilir ve geri dönen dosya içeriği, o noktadan itibaren konuşma içinde kalır.
Anthropic, bu ek yükün sabit kısmını yayınlar. Claude Opus 5 üzerinde auto araç seçimi ile, Ağustos 2026'da belgelendiği üzere, araç kullanımı sistem istemi 286 tokendır. Bu, bellek veya başka bir araç, herhangi bir araç mevcut olduğunda her istek için bir kez ödenir.
Claude Code. Her oturumun başında iki mekanizma yüklenir. CLAUDE.md dosyaları, sizin yazdığınız talimatları içerir. Otomatik bellek ise Claude'un ~/.claude/projects/<project>/memory/ altında kendisi için yazdığı notları tutar. MEMORY.md dosyasının yalnızca ilk 200 satırı veya 25KB'lık kısmı (hangisi önce dolarsa) yüklenir; yanındaki konu dosyaları ise başlangıçta değil, talep edildikçe okunur. Başlangıçta yüklenen her şey, o oturumdaki sonraki her isteğin taşıdığı önekin bir parçası haline gelir. Claude Code oturumlar arasında belleği nasıl hatırlar bölümü, dosya dosya yükleme sırasını ele alır.
Web üzerinde Claude. claude.ai üzerinde bellek, Claude'un siz sohbet ettikçe yazdığı ve güncellediği bir dizi girdidir; her proje için ayrı bir bellek alanı bulunur. Ayarlar > Bellek (Settings > Memory) menüsü nelerin saklandığını listeler ve buradaki anahtar, Belleği duraklat (Pause memory) veya Belleği sıfırla (Reset memory) seçeneklerini sunar. Bu arayüz abonelik üzerinden ücretlendirilir, bu nedenle buradaki bellek kullanımı, kullanım limitlerinizden düşer.
Hatırlanan metin neden girdi token'ı olarak ücretlendirilir
Messages API durum bilgisizdir (stateless). Çağrılar arasında hiçbir veri tutmaz; bu nedenle istemciniz her adımda tüm konuşmayı gönderir ve model bunun tamamını yeniden okur. Bellek (memory) bu kuralın bir istisnası değildir. Bellek, aynı istek içerisindeki bir başka metin bloğundan ibarettir.
Bu ayrım, herhangi bir yanıttaki usage nesnesinde görülebilir.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens yalnızca önbellekten okunmayan veya önbellek oluşturmak için kullanılmayan token'ları sayar; bu da pratikte son önbellek kesme noktasından (cache breakpoint) sonraki token'lar anlamına gelir. İstek için toplam girdi cache_read_input_tokens artı cache_creation_input_tokens artı input_tokens değeridir. Claude'un üç adım önce açtığı bir bellek dosyası, o andan itibaren her adımda bu toplamın içinde yer alır. Önbelleklenen önek (prefix) geçerli olduğu sürece cache_read_input_tokens altında, geçerli olmadığı durumlarda ise input_tokens altında sınıflandırılır. Aynı metin, iki çok farklı fiyatlandırma. Girdi ve çıktı token'ları farklı fiyatlara tabidir ve bellek her zaman girdi tarafında yer alır.
Kendi kullanımınızdaki bu sayıları nerede görebilirsiniz
Bu yazı da dahil olmak üzere, herhangi bir blog gönderisindeki rakamı esas almayın. Kendi bellek bloğunuzu ölçün. Token sayımı ücretsizdir ve kendi hız sınırına sahiptir; dolayısıyla ölçüm yapmanın bir maliyeti yoktur.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'Yanıt, { "input_tokens": 14 } gibi tek bir sayıdır. İşlemi, bellek metninizi system alanına yapıştırarak bir kez, yapıştırmadan da bir kez çalıştırın; aradaki fark, bu belleğin size her turda maliyetidir. İki hususa dikkat edilmelidir. Sayım bir tahmindir ve Anthropic'in kendi sistem optimizasyonları için eklediği fazladan token'lar size faturalandırılmaz. Ayrıca sayımı gerçekten çalıştıracağınız model üzerinde yapın; çünkü Claude 4.7 ve sonraki sürümler, aynı metin için yaklaşık yüzde 30 daha fazla token üreten daha yeni bir tokenizer kullanır.
Claude Code içerisinde aynı soru, herhangi bir curl komutuna gerek kalmadan yanıtlanır.
/context, bellek dosyaları dahil olmak üzere şu anda nelerin yüklü olduğunu gösterir; böylece siz bir şey yazmadan önce bunların penceredeki payını görebilirsiniz./memory, CLAUDE.md dosyalarınızı listeler ve otomatik bellek klasörünü açar./usage, oturum toplamlarını, bunlar arasındaki önbellek okumalarını ve önbellek yazmalarını yazdırır.- Durum satırı, bağlam penceresi kullanımını sürekli olarak görüntüleyebilir; böylece büyüme gerçekleştiği anda görünür hale gelir.
/usage oturum bloğu şu şekilde görünür:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Son satırı dikkatlice okuyun. 940.0k önbellek okuma rakamı, konuşmanın, belleğin ve her şeyin, her turda önbellek oranından tekrar gönderildiğini ifade eder. 1.2k giriş rakamı ise yalnızca yeni olan kısımdır. Claude Code, bu dolar tutarını liste fiyatları üzerinden yerel olarak hesaplar; bu nedenle sahip olduğunuz indirimleri göz ardı eder ve faturanızdan farklılık gösterebilir. Claude Console üzerindeki Kullanım (Usage) sayfası, kesin rakamı veren kaynaktır.
Ardından karşılaştırmayı doğrudan çalıştırın. Biri normal, diğeri otomatik bellek kapalı olacak şekilde iki yeni oturumda aynı açılış sorusunu sorun.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeHer birinde /context komutunu çalıştırın ve bellek dosyaları girişini karşılaştırın. Aradaki fark, birikmiş belleğinizin her oturumun başında, herhangi bir işlem gerçekleşmeden önce size olan maliyetidir. Claude Code token kullanımının nereye gittiğine dair tam döküm başlıklı içeriği bu iki sayıyla birlikte okumak faydalı olacaktır.
Milyon token başına bellek tekrar oynatma maliyeti nedir?
Prompt caching, aynı bellek bloğunun bir turda diğerine göre on kat daha maliyetli olmasının nedenidir. Anthropic, önbellek oranlarını her modelin temel giriş fiyatının katları olarak yayınlar; bu sayede dolar bazlı fiyatlar değişse bile oranlar sabit kalır.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Bir önbellek okuma işlemi, temel giriş fiyatının 0.1 katına mal olur. 5 dakikalık ömre sahip bir girdi yazmak temel fiyatın 1.25 katına, 1 saatlik ömre sahip bir girdi yazmak ise 2 katına mal olur. Anthropic, başa baş noktasını net bir şekilde belirtir: önbelleğe alma işlemi, 5 dakikalık sürede bir önbellek okumasından sonra veya 1 saatlik sürede iki önbellek okumasından sonra maliyetini çıkarır. Prompt caching için başa baş noktası, belleğin nerede tutulacağına karar vermeden önce yapılması gereken hesaplamadır.
Bu çarpanlar, tekrar oynatma sayısını aritmetik bir işleme dönüştürür. Bir sonraki blok, canlı bir iş yükünün ölçümü değil, yukarıda yayınlanan çarpanlardan elde edilen aritmetik bir sonuçtur. 100 turluk bir oturum boyunca bir bellek bloğunu, düz temel giriş oranından ücretlendirilen eşdeğer token sayısı cinsinden üç farklı şekilde fiyatlandırır.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]100 turun tamamında önbelleği ıskalayan 4.000 tokenlık bir bellek bloğu, 400,000 adet temel oranlı token gibi faturalandırılır. Bir adet 5 dakikalık önbellek yazma ve 99 adet önbellek okuma işlemi arkasındaki aynı blok, 44,600 gibi faturalandırılır. Bloğu boyutunun dörtte birine indirip önbelleğe almaya devam ederseniz, 11,150 gibi faturalandırılır. Bu 3 satır boyunca özellik değişmemiştir. Yalnızca tekrar oynatma davranışı değişmiştir. Bunlar hala para değil token sayılarıdır ve bir token sayısını aylık faturanızdaki bir rakama dönüştürmek, modelinizin milyon başına düşen oranıyla yapılacak tek bir çarpma işlemidir. Bu oran çalıştırdığınız model tarafından belirlenir; bu nedenle eğer ajan Claude Fable 5 üzerinde çalışacaksa, yayınlanan milyon başına oranlar ve uygun olduğu işler kısmından başlayın.
İkinci satır, sonraki 99 isteğin her birinin, bir önbellek girdisi hala aktifken geldiğini varsayar. Çoğu gerçek faturadaki hataların kaynağı bu varsayımdır.
Neden bir aradan sonra aynı soru daha maliyetli oluyor?
Bir önbellek girdisinin bir ömrü vardır ve bu süre, girdiyi yazan veya okuyan istek ile başlar. Varsayılan süre 5 dakikadır. 1 saatlik seçenek, yukarıda gösterilen 2x yazma maliyetine neden olur. Claude Code üzerinde ömür, aboneliklerde bir saattir; kullanım kredileri üzerinden harcama yapmaya başladığınızda bu süre beş dakikaya düşer. API anahtarı veya bulut sağlayıcısı kullanıldığında ise varsayılan süre beş dakikadır. ENABLE_PROMPT_CACHING_1H=1 ayarını yapmak, kullanım kredileri üzerindeyken bir saatlik ömrü korur.
Öğle yemeği için açık bıraktığınız bir oturuma yazdığınız tek satırlık bir soru pahalıdır çünkü siz yokken önbellek girdisinin süresi dolmuştur. Bellek dahil tüm önek, temel giriş oranından tekrar işlenir ve önbelleğe yeniden yazılır. Bu fiyatı belirleyen şey, verilen aranın uzunluğudur.
Buna inanmak yerine doğrulayabilirsiniz. Pro, Max, Team veya Enterprise planlarında, /usage dökümü, son kullanımların yüzde 10'undan fazlasından sorumlu olan her türlü davranışı işaretler; hem uzun bağlam hem de önbellek ıskalamaları (cache misses) burada isimleriyle görünür. API tarafında, sessiz bir dönemden sonraki ilk istekte cache_creation_input_tokens değerinin önekinizin tam boyutuna geri sıçradığını izleyin.
Önbelleği sessizce geçersiz kılan durumlar
Önbelleğe alınan önek şu sırayla düzenlenir: araçlar, ardından sistem ve son olarak mesajlar. Bir seviyedeki değişiklik, o seviyeyi ve ondan sonra gelen her şeyi geçersiz kılar. Bir araç tanımını düzenlemek, tüm önbelleği siler. Sistem istemini düzenlemek ise sistem ve mesaj önbelleğini siler.
Bu durum, belleği sistem isteminde tutan ve ajan öğrendikçe bu istemi yeniden yazan herkes için bir tuzaktır. Her yeniden yazma işlemi, arkasındaki her şeyin önbelleğe alınmış kopyasını atar; bu nedenle bir sonraki istek, tam bir yazma maliyetine tekrar katlanır. Sabit materyali en başta tutun ve değiştirmeyin; değişken materyalin ise mesaj listesinin sonlarında yer almasını sağlayın, böylece geçersiz kılınması düşük maliyetli olur.
İkinci ve daha sessiz bir hata türü daha mevcuttur. Her modelin minimum önbelleğe alınabilir önek değeri vardır: Ağustos 2026'da yayınlandığı üzere Claude Opus 5 için 512 token, Claude Sonnet 5 için 1.024 token ve Claude Haiku 4.5 için 4.096 token. Anthropic'in belgeleri, bu değerin altındaki durumlar için oldukça nettir: "Bu sayıdan daha az token önbelleğe alma istekleri, önbellekleme yapılmadan işlenir ve herhangi bir hata döndürülmez." Bu nedenle, cache_control ile işaretlenmiş küçük bir bellek dosyası hiçbir işe yaramaz ve sessiz kalır. Gözlemleyebileceğiniz belirti, isteminizde açıkça bir kesme noktası bulunmasına rağmen cache_creation_input_tokens değerinin 0'da kalmasıdır.
Artık değer yaratmayan bellekleri temizleyin
Her bellek satırı, onu taşıyan her turda token maliyeti oluşturur; bu nedenle her satır için sorulması gereken soru, yakın zamanda bir yanıtı değiştirip değiştirmediğidir. Claude Code bu sınırları somutlaştırır. CLAUDE.md dosyasını 200 satırın altında tutmayı hedefleyin; çünkü daha uzun dosyalar daha fazla bağlam tüketir ve Claude'un bu talimatları takip etme güvenilirliğini azaltır. MEMORY.md yükleme sırasında ilk 200 satır veya 25KB ile sınırlandırılmıştır ve bu sınırın ötesindeki her şey bir sonraki oturum başlangıcında atılır; dolayısıyla gereğinden büyük bir dizin hem token harcar hem de hiçbir işe yaramaz.
İki alışkanlık dosyanın küçük kalmasını sağlar. Detayları dizinden çıkarıp, Claude'un başlangıçta değil, talep edildiğinde okuduğu konu dosyalarına taşıyın. İş akışı talimatlarını CLAUDE.md dosyasından çıkarıp, yalnızca çağrıldıklarında yüklenen yeteneklere (skills) aktarın. Halihazırda ön bilgi (frontmatter) ile başlayan bellek dosyaları için Claude Code, 2.1.214 veya sonraki sürümlerde yazma zamanını bir modified alanında ISO 8601 zaman damgası olarak kaydeder; bu zaman damgası, güncelliğini yitirmiş bir bilgiyi tespit etmenin en hızlı yoludur. Eski aracı belleğinin temizlenmesi süreci, inceleme aşamasını daha derinlemesine ele alır.
Her şeyi bağlama yüklemek yerine geri almanın avantajlı olduğu durumlar
Memory aracı, tam zamanında (just-in-time) veri geri alımını desteklemek için tasarlanmıştır. Temsilci, her şeyi en başta yüklemek yerine öğrendiklerini kaydeder ve bir dosyayı yalnızca bir görev gerektirdiğinde okur. Bu durum hesaplamayı değiştirir; çünkü bir dosya okuma işlemi token maliyetini bir kez oluşturur ve ardından önbelleğe alınmış önek (cached prefix) içinde kalır, oysa kalıcı olarak yüklenen bir blok her turda maliyet yaratır.
Yukarıdaki iki grafikten basit bir kural çıkarılabilir. Neredeyse her turda kullanılan metinler, kararlı önbelleğe alınmış önek içinde yer almalıdır. Yirmi turda bir kullanılan metinler ise bir view çağrısının arkasında tutulmalıdır. Başabaş noktası, Anthropic'in ücretlendirmesinden ziyade sizin tekrar (replay) sayınıza göre değişir.
API üzerinde ayrıca platformun konuşmayı kırpmasına izin verebilirsiniz. Context editing, konuşma belirlediğiniz bir eşiği aştığında eski araç sonuçlarını temizler.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}Varsayılan ayarlar 100.000 giriş token'ı ve tutulan 3 araç kullanımıdır. Etkinleştirmeden önce önbelleğe alma ile etkileşimi okuyun: içerik temizleme işlemi, temizleme noktasındaki önbelleğe alınmış öneki geçersiz kılar, bu nedenle bir sonraki istekte önbellek yazma maliyeti ödersiniz. clear_at_least bunun içindir. Tasarruf, yazma işlemini haklı çıkaracak kadar büyük olana kadar temizlemeyi erteler. Yanıt, context_management altında cleared_tool_uses ve cleared_input_tokens ile tam olarak ne olduğunu raporlar, böylece bu takas teorik olmaktan çıkıp ölçülebilir hale gelir. Claude Code içinde bağlam penceresini yönetme aynı mantığı bir kodlama oturumuna uygular.
Hangi özelliklerin kendi satır kalemi bulunur
Belleğin kendine ait bir ücreti yoktur, ancak bazı özelliklerin gerçekten vardır ve hangileri olduğunu bilmek önemlidir. Bunlar, Ağustos 2026 itibarıyla yayınlanan Claude API ücretleridir. Bazı işlemler hiçbir maliyet getirmez, ancak Claude API üzerinde ücretsiz bir katman bulunmamaktadır; yalnızca kayıt sırasında küçük bir kredi verilir, bu nedenle aşağıdaki her şey ilk isteğinizden itibaren doğrudan harcamadır.
- Web araması: 1.000 arama başına 10 dolar, artı aramanın bağlama eklediği her şeyin standart token maliyeti.
- Kod yürütme: Her organizasyon için aylık 1.550 ücretsiz saat, sonrasında container başına saatlik 0,05 dolar. Web araması veya web fetch ile birlikte kullanıldığında ücretsizdir.
- Claude Managed Agents: Olağan token ücretlerine ek olarak, oturum çalışma süresi için oturum-saati başına 0,08 dolar.
- Web fetch: Ek ücret yoktur, yalnızca getirilen içeriğin token maliyeti yansıtılır.
Bellek bu satırlardan hiçbirinde yer almaz. Bellek, giriş token sayınızda görünür; burası tam olarak onu ölçebileceğiniz, budama (pruning) ve önbelleğe alma (caching) ile maliyetini düşürebileceğiniz yerdir. Bir sanal özel sunucu (VPS) üzerinde gözetimsiz çalışan bir aracı için bütçe planlıyorsanız, VPS üzerinde bir yapay zeka aracısı için maliyet kontrolleri uygulanması gereken bir sonraki adımdır; çünkü büyüyen bir bellek dosyasına sahip ve budama yapılmayan bir aracı, herhangi bir uyarı vermeden her hafta daha maliyetli hale gelir.
FAQ
Claude'un bellek özellikleri için ayrı bir ücret alınıyor mu?
Hayır. Anthropic'in fiyat listesinde milyon girdi token'ı, milyon çıktı token'ı ve prompt önbelleğe alma çarpanları için oranlar bulunur; bellek için ayrı bir kalem yoktur. Claude API üzerinde bellek aracı istemci tarafında çalışır, bu nedenle dosyalar zaten ödemesini yaptığınız depolama alanında tutulur. Bellek özelliğinin eklediği şey girdi token'larıdır ve bunlar, bellek verilerini taşıyan her turda modelin normal girdi oranından faturalandırılır.
Belleği kapatmak Claude'u daha ucuz hale getirir mi?
Her isteğin token sayısını düşürür, bu da her isteğin maliyetini azaltır. Bunun genel olarak tasarruf sağlayıp sağlamayacağı bir sonraki adımda ne olduğuna bağlıdır. Eğer Claude, belleğin halihazırda tuttuğu bilgileri yeniden oluşturmak için üç dosyayı tekrar okumak ve size iki soru sormak zorunda kalırsa, bu token'lar belleğin maliyetinden daha pahalıya gelir. Tahmin etmek yerine ölçüm yapın: /context komutunu otomatik bellek açıkken ve bir oturumu CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 ile başlatarak çalıştırın, ardından aynı görev için harcanan toplam token miktarını karşılaştırın.
Hiçbir şeyi değiştirmediğim halde kullanımım neden arttı?
En yaygın neden, bir duraksamadan sonra önbellek isabeti (cache miss) yaşanmasıdır. Önbellek girişleri varsayılan olarak 5 dakika, genişletilmiş ayarda ise bir saat boyunca yaşar; bu nedenle aradan sonraki ilk istek, tüm önekinizi (prefix) temel girdi oranından yeniden işler ve tekrar yazar. İkinci yaygın neden önek düzenlemesidir: bir araç tanımını değiştirmek tüm önbelleği geçersiz kılar, sistem istemini (system prompt) değiştirmek ise sistem ve mesaj önbelleğini geçersiz kılar. Bir abonelik planında, /usage dökümü, bu davranış son kullanımların yüzde 10'unu veya daha fazlasını oluşturduğunda durumu belirtir.
Bellek, sistem isteminde mi yoksa bir araç çağrısının arkasında mı yer almalı?
Neredeyse her turda kullanılıyorsa sistem istemine yerleştirin; çünkü bu durumda önbelleğe alınmış önekte kalır ve önbellek okuma oranından ücretlendirilir. Yalnızca bazı görevler için gerekiyorsa bir view çağrısının arkasına koyun; çünkü bir kez okunan bir dosya, token maliyetini her turda değil, yalnızca bir kez oluşturur. Karar verici sayı tekrar oynatma (replay) sayınızdır ve usage nesnesi size bu sayıyı doğrudan verir.
Bellek özellikleri abonelik kullanım limitlerine dahil mi?
Evet, dolaylı olarak; çünkü abonelik limitleri, her isteğin taşıdığı token'lar tarafından tüketilir. Anthropic'in yardım belgeleri, otomatik bağlam yönetimini tetikleyen daha uzun konuşmaların kullanım limitinizi daha fazla tükettiğini belirtir. Bellek, her isteği biraz daha uzatır ve uzun bir oturum, bu uzunluğu her turda tekrar oynatır. Claude'un kullanım limitleri gerçekte nasıl çalışır başlıklı bölüm, nelerin ne zaman sıfırlandığını açıklar.