Czy funkcje pamięci Claude generują dodatkowe koszty?
Funkcje pamięci Claude nie posiadają osobnego cennika. Koszt zależy od liczby tokenów wejściowych przesyłanych w każdej turze oraz możliwości wykorzystania mechanizmu prompt caching.
Czy funkcje pamięci Claude wiążą się z dodatkowymi kosztami?
Funkcje pamięci Claude nie posiadają własnego cennika. Publikowane przez Anthropic stawki dotyczą miliona tokenów wejściowych oraz miliona tokenów wyjściowych, z uwzględnieniem dodatkowych opłat za prompt caching; żadna z nich nie jest określana jako token pamięci. Przechowywanie samej pamięci w Claude API (application programming interface) jest bezpłatne, ponieważ narzędzie pamięci działa po stronie klienta, a plik znajduje się w pamięci masowej użytkownika.
Pamięć nadal wpływa na wysokość rachunku, ponieważ zapamiętany fakt zmienia odpowiedź tylko wtedy, gdy znajduje się w żądaniu odczytywanym przez Claude. Zapamiętywanie oznacza ponowne przesyłanie danych. Tekst ten dociera jako tokeny wejściowe i jest rozliczany według standardowej stawki wejściowej modelu. O wysokości opłaty decydują dwie wartości: liczba tokenów zapamiętanego tekstu przesyłanych w każdej turze oraz to, czy ten tekst może zostać obsłużony z pamięci podręcznej promptu (prompt cache).
W ramach subskrypcji Pro lub Max użytkownik nie jest rozliczany za tokeny, więc pamięć zużywa limit wykorzystania, a nie środki pieniężne. Mechanizm działania pozostaje identyczny, zmienia się jedynie jednostka rozliczeniowa. Limit ten jest skończony, dlatego warto sprawdzić ile kosztuje Claude Pro i przy jakim poziomie wykorzystania limity stają się blokujące, zanim zapadnie decyzja o tym, jak duży zasób pamięci ma być przesyłany w każdej turze. Claude Enterprise działa inaczej, ponieważ każdy token jest rozliczany według stawek API niezależnie od opłaty za stanowisko, więc zbyt duży blok pamięci przekłada się bezpośrednio na koszty, a nie na zużycie limitu. Jeśli ograniczenie pamięci pozwala na powrót do limitów niższego planu, warto rozważyć przejście z planu Max na Pro, a zmiana nastąpi z końcem opłaconego okresu rozliczeniowego. Jeśli porównanie dotyczy różnych dostawców, a nie poszczególnych planów Anthropic, punktem wyjścia jest zestawienie planów Claude z ofertą ChatGPT według aktualnych cen.
Co oznacza "pamięć" w poszczególnych interfejsach Claude
Trzy odrębne produkty używają tego samego określenia, a ich mylenie jest główną przyczyną niejasności związanych z tym pytaniem.
Narzędzie memory w API Claude. Dodajesz jeden wpis do tablicy tools i implementujesz operacje na plikach we własnym kodzie.
{"type": "memory_20250818", "name": "memory"}Według stanu na sierpień 2026 r. narzędzie to jest ogólnie dostępne w Messages API bez nagłówka beta, w modelach Claude 4 i nowszych. Działa ono po stronie klienta: Claude żąda operacji, takiej jak view /memories, Twój program obsługi wykonuje ją na pamięci masowej, którą kontrolujesz, a Ty zwracasz wynik w bloku tool_result. Anthropic nigdy nie przechowuje pliku, więc nie ma opłat za przechowywanie danych. Zamiast tego płacisz za pełny cykl żądanie-odpowiedź. Definicja narzędzia jest wysyłana w każdym żądaniu, a zwrócona zawartość pliku pozostaje w konwersacji od tego momentu.
Anthropic publikuje stałą część tego narzutu. W modelu Claude Opus 5 przy wyborze narzędzia auto, systemowy prompt narzędzia zajmuje 286 tokenów, zgodnie z dokumentacją z sierpnia 2026 r. Jest to opłata naliczana raz na żądanie, gdy obecne jest jakiekolwiek narzędzie, niezależnie od tego, czy jest to pamięć, czy inne.
Claude Code. Dwa mechanizmy ładowane są na początku każdej sesji. Pliki CLAUDE.md zawierają instrukcje, które sam tworzysz. Automatyczna pamięć przechowuje notatki, które Claude zapisuje dla siebie w ~/.claude/projects/<project>/memory/. Ładowane jest tylko pierwsze 200 linii lub 25KB pliku MEMORY.md, w zależności od tego, który limit zostanie osiągnięty jako pierwszy, a pliki tematyczne obok niego są odczytywane na żądanie, a nie podczas uruchamiania. Wszystko, co zostało załadowane przy starcie, staje się częścią prefiksu, który zawiera każde kolejne żądanie w tej sesji. W jaki sposób Claude Code przywołuje pamięć między sesjami opisuje kolejność ładowania plików.
Claude w przeglądarce. W serwisie claude.ai pamięć to zestaw wpisów, które Claude zapisuje i aktualizuje w trakcie czatu, z oddzielną przestrzenią pamięci dla każdego projektu. Sekcja Settings > Memory wyświetla listę przechowywanych informacji, a przełącznik w tym miejscu pozwala na wstrzymanie (Pause memory) lub zresetowanie pamięci (Reset memory). Ten interfejs jest rozliczany w ramach subskrypcji, więc korzystanie z pamięci zużywa limity użycia.
Dlaczego zapamiętany tekst jest rozliczany jako tokeny wejściowe
Messages API jest bezstanowe. Nie przechowuje żadnych danych pomiędzy wywołaniami, dlatego klient przesyła całą konwersację przy każdym kroku, a model odczytuje ją ponownie w całości. Pamięć nie stanowi wyjątku od tej zasady. Jest to kolejny blok tekstu w tym samym żądaniu.
Podział jest widoczny w obiekcie usage w każdej odpowiedzi.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens zlicza tylko te tokeny, które nie zostały odczytane z pamięci podręcznej ani użyte do jej utworzenia, co w praktyce oznacza tokeny znajdujące się po ostatnim punkcie przerwania cache. Całkowite wejście dla żądania to suma cache_read_input_tokens, cache_creation_input_tokens oraz input_tokens. Plik pamięci, który Claude otworzył trzy tury temu, znajduje się w tej sumie przy każdym kolejnym kroku. Trafia on do cache_read_input_tokens, dopóki prefiks w pamięci podręcznej jest utrzymywany, oraz do input_tokens, gdy tak nie jest. Ten sam tekst, dwie bardzo różne ceny. Tokeny wejściowe i wyjściowe mają różne ceny, a pamięć zawsze jest rozliczana po stronie wejściowej.
Gdzie sprawdzić te wartości w ramach własnego użytkowania
Nie należy polegać na liczbach z wpisów na blogach, w tym z niniejszego. Należy zmierzyć własny blok pamięci. Liczenie tokenów jest bezpłatne i posiada własny limit zapytań, więc pomiar nie generuje żadnych kosztów.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'Odpowiedzią jest jedna liczba, taka jak { "input_tokens": 14 }. Należy uruchomić test raz z wklejonym tekstem pamięci w polu system, a raz bez niego; różnica stanowi koszt pamięci w każdej turze. Należy uwzględnić dwa zastrzeżenia. Wynik jest szacunkowy, a dodatkowe tokeny dodawane przez Anthropic na potrzeby optymalizacji systemowych nie są doliczane do rachunku. Należy również wykonać pomiar dla modelu, który będzie faktycznie używany, ponieważ Claude 4.7 i nowsze wersje korzystają z nowszego tokenizera, który generuje o około 30 procent więcej tokenów dla tego samego tekstu.
Wewnątrz Claude Code na to samo pytanie można odpowiedzieć bez użycia curl.
/contextpokazuje, co jest aktualnie załadowane, w tym pliki pamięci, dzięki czemu można sprawdzić ich udział w oknie kontekstowym przed wpisaniem czegokolwiek./memorywyświetla listę plików CLAUDE.md i otwiera folder automatycznej pamięci./usagedrukuje sumy sesji, w tym odczyty i zapisy z pamięci podręcznej.- Pasek stanu może wyświetlać użycie okna kontekstowego w sposób ciągły, dzięki czemu wzrost jest widoczny w czasie rzeczywistym.
Blok sesji /usage wygląda następująco:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Należy uważnie przeczytać ostatnią linię. Wartość 940.0k cache read oznacza, że konwersacja wraz z pamięcią jest przesyłana ponownie w każdej turze według stawki dla pamięci podręcznej. Wartość 1.2k input dotyczy tylko nowej części danych. Claude Code oblicza tę kwotę lokalnie na podstawie cennika, więc ignoruje ewentualne rabaty i może różnić się od kwoty na fakturze. Wiążącą wartością jest ta widoczna na stronie Usage w Claude Console.
Następnie należy przeprowadzić bezpośrednie porównanie. Należy zadać to samo pytanie otwierające w dwóch nowych sesjach: jednej standardowej i jednej z wyłączoną funkcją automatycznej pamięci.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeNależy uruchomić /context w każdej z nich i porównać wpis dotyczący plików pamięci. Różnica stanowi koszt zgromadzonej pamięci na początku każdej sesji, zanim zostaną podjęte jakiekolwiek działania. Warto zapoznać się z pełnym zestawieniem zużycia tokenów w Claude Code, analizując te dwie wartości.
Jaki jest koszt odtwarzania pamięci na milion tokenów?
Prompt caching jest powodem, dla którego ten sam blok pamięci może kosztować dziesięć razy więcej w jednej turze niż w innej. Anthropic publikuje stawki cache jako wielokrotności podstawowej ceny wejściowej każdego modelu, dzięki czemu relacja ta pozostaje stała nawet przy zmianach cen w dolarach.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Odczyt z cache kosztuje 0.1 razy więcej niż podstawowa cena wejściowa. Zapis wpisu z 5-minutowym czasem życia kosztuje 1.25 razy więcej niż cena podstawowa, a z 1-godzinnym czasem życia 2 razy więcej. Anthropic jasno określa próg opłacalności: cacheowanie zwraca się po jednym odczycie przy czasie 5 minut lub po dwóch odczytach przy czasie 1 godziny. Próg opłacalności dla prompt caching to obliczenie, które należy wykonać przed podjęciem decyzji o miejscu przechowywania pamięci.
Te mnożniki zamieniają liczbę odtworzeń w proste działanie arytmetyczne. Poniższy blok jest wynikiem obliczeń na podstawie opublikowanych powyżej mnożników, a nie pomiarem rzeczywistego obciążenia. Przedstawia wycenę bloku pamięci na trzy sposoby w sesji obejmującej 100 tur, wyrażoną jako równoważna liczba tokenów rozliczana według standardowej podstawowej stawki wejściowej.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]Blok pamięci o rozmiarze 4 000 tokenów, który nie trafia do cache we wszystkich 100 turach, jest rozliczany jak 400,000 tokenów według stawki podstawowej. Ten sam blok przy jednym zapisie do cache 5-minutowego i 99 odczytach jest rozliczany jak 44,600. Po zmniejszeniu rozmiaru do jednej czwartej przy zachowaniu cacheowania, rozliczany jest jak 11,150. Funkcjonalność nie zmieniła się w tych 3 wierszach. Zmienił się jedynie sposób odtwarzania. Są to nadal liczby tokenów, a nie kwoty pieniężne, a przeliczenie liczby tokenów na kwotę na miesięcznej fakturze wymaga jednego mnożenia przez stawkę modelu za milion tokenów. Stawka ta jest ustalana przez używany model, więc jeśli agent będzie korzystał z Claude Fable 5, należy zacząć od jego opublikowanych stawek za milion tokenów i zastosowań, do których jest przeznaczony.
Drugi wiersz zakłada, że każde z 99 kolejnych żądań dociera w czasie, gdy wpis w cache jest jeszcze aktywny. To założenie jest miejscem, w którym większość rzeczywistych rachunków okazuje się błędna.
Dlaczego to samo pytanie kosztuje więcej po przerwie?
Wpis w pamięci podręcznej ma określony czas życia, a licznik uruchamia się w momencie żądania zapisu lub odczytu. Domyślna wartość to 5 minut. Opcja 1 godziny kosztuje dwukrotność stawki zapisu wskazanej powyżej. W Claude Code czas życia wynosi godzinę w ramach subskrypcji i skraca się do pięciu minut po przejściu na wykorzystanie kredytów; w przypadku klucza API lub dostawcy chmurowego domyślną wartością jest pięć minut. Ustawienie ENABLE_PROMPT_CACHING_1H=1 pozwala zachować godzinny czas życia podczas korzystania z kredytów.
Zatem pytanie jednowierszowe wpisane w sesji pozostawionej otwartej na czas przerwy obiadowej jest kosztowne, ponieważ wpis w pamięci podręcznej wygasł podczas nieobecności użytkownika. Cały prefiks, włącznie z pamięcią, jest przetwarzany ponownie według podstawowej stawki wejściowej i zapisywany w pamięci podręcznej od nowa. Długość przerwy determinuje ten koszt.
Można to zweryfikować zamiast przyjmować na wiarę. W planach Pro, Max, Team lub Enterprise flaga /usage wskazuje każde zachowanie odpowiadające za 10 procent lub więcej niedawnego zużycia, a zarówno długi kontekst, jak i chybienia pamięci podręcznej (cache misses) pojawiają się tam z nazwy. W przypadku API należy obserwować, jak cache_creation_input_tokens wraca do pełnego rozmiaru prefiksu przy pierwszym żądaniu po okresie bezczynności.
Co powoduje ciche unieważnienie pamięci podręcznej
Buforowany prefiks jest uporządkowany: narzędzia, następnie system, a na końcu komunikaty. Zmiana na jednym poziomie unieważnia ten poziom oraz wszystko, co po nim następuje. Edycja definicji narzędzia powoduje odrzucenie całej pamięci podręcznej. Edycja promptu systemowego powoduje odrzucenie pamięci podręcznej systemu oraz komunikatów.
Jest to pułapka dla osób przechowujących pamięć w prompcie systemowym i modyfikujących ją w miarę uczenia się agenta. Każde nadpisanie odrzuca buforowaną kopię wszystkiego, co znajduje się za nim, więc kolejne żądanie ponownie generuje pełny koszt zapisu. Należy umieszczać stabilne elementy na początku i dbać o ich niezmienność, a zmienne dane pozostawiać na końcu listy komunikatów, gdzie ich unieważnienie jest mało kosztowne.
Istnieje drugi, mniej oczywisty błąd. Każdy model posiada minimalny buforowalny prefiks: 512 tokenów dla Claude Opus 5, 1024 dla Claude Sonnet 5, 4096 dla Claude Haiku 4.5, zgodnie z danymi opublikowanymi w sierpniu 2026 roku. Dokumentacja Anthropic jasno określa, co dzieje się poniżej tej wartości: "Wszelkie żądania buforowania mniejszej liczby tokenów zostaną przetworzone bez użycia pamięci podręcznej, bez zwracania błędu". Mały plik pamięci oznaczony jako cache_control nie przynosi zatem żadnego efektu, działając w sposób niezauważalny. Objawem tego stanu jest wartość cache_creation_input_tokens utrzymująca się na poziomie 0, mimo że prompt wyraźnie zawiera punkt przerwania.
Usuwanie pamięci, która przestała być przydatna
Każda linia pamięci kosztuje tokeny w każdej turze, w której jest przesyłana, dlatego w przypadku każdej linii należy ocenić, czy w ostatnim czasie wpłynęła ona na odpowiedź. Claude Code konkretyzuje te limity. Należy dążyć do utrzymania pliku CLAUDE.md poniżej 200 linii, ponieważ dłuższe pliki zużywają więcej kontekstu i zmniejszają niezawodność, z jaką Claude stosuje się do zawartych w nich instrukcji. MEMORY.md jest ograniczony do pierwszych 200 linii lub 25KB w momencie ładowania, a wszystko powyżej tego limitu jest odrzucane przy starcie kolejnej sesji, więc zbyt duży indeks generuje koszty w tokenach, nie wnosząc żadnej wartości.
Dwa nawyki pozwalają utrzymać mały rozmiar. Przenoś szczegóły z indeksu do plików tematycznych, które Claude odczytuje na żądanie, zamiast przy starcie. Przenoś instrukcje dotyczące przepływu pracy z CLAUDE.md do umiejętności (skills), które ładują się tylko po wywołaniu. W przypadku plików pamięci, które zaczynają się od metadanych (frontmatter), Claude Code zapisuje czas zapisu w polu modified jako znacznik czasu ISO 8601 (w wersji 2.1.214 lub nowszej), a ten znacznik czasu jest najszybszym sposobem na wykrycie nieaktualnych informacji. Usuwanie nieaktualnej pamięci agenta szczegółowo omawia proces weryfikacji.
Kiedy pobieranie danych przewyższa ładowanie wszystkiego do kontekstu
Narzędzie pamięci istnieje, aby wspierać pobieranie danych w czasie rzeczywistym (just-in-time). Zamiast ładować wszystko na początku, agent zapisuje to, czego się nauczył, i odczytuje plik tylko wtedy, gdy wymaga tego zadanie. Zmienia to rachunek kosztów, ponieważ odczyt pliku kosztuje tokeny tylko raz, a następnie pozostaje w buforowanym prefiksie, podczas gdy stale załadowany blok generuje koszty w każdej turze.
Z powyższych dwóch wykresów wynika prosta zasada. Tekst używany w niemal każdej turze powinien znajdować się w stabilnym buforowanym prefiksie. Tekst używany raz na dwadzieścia tur powinien znajdować się za wywołaniem view. Punkt opłacalności przesuwa się wraz z liczbą powtórzeń, a nie z cennikiem Anthropic.
W API można również pozwolić platformie na przycinanie konwersacji. Edycja kontekstu usuwa stare wyniki narzędzi, gdy konwersacja przekroczy ustawiony próg.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}Domyślne ustawienia to próg 100 000 tokenów wejściowych i zachowanie 3 użyć narzędzi. Przed włączeniem tej funkcji należy zapoznać się z zasadami buforowania: usuwanie zawartości unieważnia buforowany prefiks w punkcie usunięcia, więc przy następnym żądaniu nastąpi opłata za zapis w pamięci podręcznej. Do tego służy clear_at_least. Wstrzymuje ono usuwanie do momentu, aż oszczędność będzie wystarczająco duża, aby uzasadnić zapis. Odpowiedź raportuje dokładnie, co się wydarzyło w sekcji context_management, za pomocą cleared_tool_uses i cleared_input_tokens, dzięki czemu bilans jest mierzalny, a nie teoretyczny. Zarządzanie oknem kontekstu w Claude Code stosuje tę samą zasadę w sesji programistycznej.
Co posiada własną pozycję kosztową
Pamięć nie generuje własnych opłat, jednak niektóre funkcje są płatne i warto wiedzieć, które z nich. Poniżej przedstawiono opublikowane stawki Claude API obowiązujące w sierpniu 2026 roku. Niektóre operacje są bezpłatne, jednak w Claude API nie istnieje darmowy plan, a jedynie niewielki kredyt przy rejestracji, więc każda poniższa pozycja oznacza rzeczywiste wydatki od pierwszego zapytania.
- Wyszukiwanie w sieci: 10 USD za 1000 wyszukiwań, plus standardowy koszt tokenów za całą treść dodaną przez wyszukiwanie do kontekstu.
- Wykonywanie kodu: 1550 darmowych godzin na organizację miesięcznie, następnie 0,05 USD za godzinę pracy kontenera. Usługa jest bezpłatna, gdy jest używana wraz z wyszukiwaniem lub pobieraniem danych z sieci.
- Claude Managed Agents: czas działania sesji w cenie 0,08 USD za godzinę sesji, doliczany do standardowych opłat za tokeny.
- Pobieranie danych z sieci (Web fetch): brak dodatkowych opłat, naliczany jest jedynie koszt tokenów za pobraną treść.
Pamięć nie widnieje w żadnej z tych pozycji. Pojawia się ona w liczniku tokenów wejściowych, gdzie można ją dokładnie zmierzyć oraz zredukować za pomocą przycinania (pruning) i buforowania (caching). W przypadku budżetowania agenta działającego bez nadzoru na serwerze VPS, kontrola kosztów agenta AI na VPS jest kolejnym krokiem, który należy wdrożyć, ponieważ agent z rosnącym plikiem pamięci bez mechanizmu przycinania staje się z każdym tygodniem droższy, bez żadnych powiadomień o tym fakcie.
FAQ
Czy za funkcje pamięci Claude pobierana jest osobna opłata?
Nie. Cennik Anthropic zawiera stawki za milion tokenów wejściowych, milion tokenów wyjściowych oraz mnożniki prompt caching, bez wyszczególnionej pozycji dla pamięci. W API Claude narzędzie pamięci działa po stronie klienta, więc pliki znajdują się w pamięci masowej, za którą już płacisz. Pamięć zwiększa liczbę tokenów wejściowych, które są rozliczane według standardowej stawki wejściowej modelu przy każdym wywołaniu, w którym są przesyłane.
Czy wyłączenie pamięci czyni Claude tańszym?
Zmniejsza to liczbę tokenów w każdym żądaniu, co obniża koszt pojedynczego zapytania. To, czy przyniesie to oszczędności w ogólnym rozrachunku, zależy od dalszego przebiegu pracy. Jeśli Claude musi ponownie odczytać trzy pliki i zadać dwa pytania, aby odtworzyć informacje, które już znajdowały się w pamięci, tokeny te kosztują więcej niż sama pamięć. Zamiast zgadywać, należy dokonać pomiaru: uruchom /context w sesji z włączoną automatyczną pamięcią oraz w sesji rozpoczętej za pomocą CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, a następnie porównaj całkowitą liczbę tokenów zużytych na to samo zadanie.
Dlaczego moje zużycie wzrosło, mimo że niczego nie zmieniałem?
Najczęstszą przyczyną jest brak trafienia w pamięci podręcznej (cache miss) po przerwie. Wpisy w pamięci podręcznej żyją domyślnie 5 minut lub godzinę przy ustawieniu rozszerzonym, więc pierwsze żądanie po przerwie przetwarza cały prefiks według podstawowej stawki wejściowej i zapisuje go ponownie. Drugą częstą przyczyną jest edycja prefiksu: zmiana definicji narzędzia unieważnia całą pamięć podręczną, a zmiana systemowego promptu unieważnia pamięć podręczną systemu i wiadomości. W planie subskrypcyjnym zestawienie /usage wskazuje to zachowanie, gdy odpowiada ono za 10 procent lub więcej ostatniego zużycia.
Czy pamięć powinna znajdować się w systemowym prompcie, czy za wywołaniem narzędzia?
Umieść ją w systemowym prompcie, gdy prawie każda tura z niej korzysta, ponieważ wtedy znajduje się ona w zbuforowanym prefiksie i jest rozliczana według stawki odczytu z pamięci podręcznej. Umieść ją za wywołaniem view, gdy tylko niektóre zadania jej wymagają, ponieważ plik odczytany raz kosztuje swoje tokeny tylko raz, a nie przy każdej turze. Decydującą liczbą jest liczba powtórzeń (replay count), a obiekt usage podaje tę wartość bezpośrednio.
Czy funkcje pamięci wliczają się do limitów zużycia subskrypcji?
Tak, pośrednio, ponieważ limity subskrypcji są zużywane przez tokeny, które niesie ze sobą każde żądanie. Dokumentacja pomocy Anthropic stwierdza, że dłuższe konwersacje, które wyzwalają automatyczne zarządzanie kontekstem, zużywają więcej limitu. Pamięć sprawia, że każde żądanie jest nieco dłuższe, a długa sesja powtarza tę długość przy każdej turze. Jak faktycznie działają limity zużycia Claude opisuje, co i kiedy ulega resetowaniu.