SSD Nodes Learn Hosting plans →
Przewodniki Matt ConnorAutor: Matt Connor · Zaktualizowano 2026-08-28

Czy funkcje pamięci Claude kosztują dodatkowo?

Funkcje pamięci Claude nie mają osobnego cennika. Koszty wynikają z przesyłania zapamiętanych danych jako tokeny wejściowe oraz zależy od wykorzystania mechanizmu prompt caching.

Czy funkcje pamięci Claude wiążą się z dodatkowymi kosztami?

Funkcje pamięci Claude nie posiadają własnego cennika. Publikowane stawki Anthropic dotyczą miliona tokenów wejściowych oraz miliona tokenów wyjściowych, z uwzględnieniem dodatkowych opłat za prompt caching; żadna z tych pozycji nie jest określana jako token pamięci. Przechowywanie samej pamięci w Claude API (application programming interface) jest bezpłatne, ponieważ narzędzie pamięci działa po stronie klienta, a plik znajduje się na nośniku danych użytkownika.

Pamięć nadal wpływa na wysokość rachunku, ponieważ zapamiętany fakt zmienia odpowiedź tylko wtedy, gdy znajduje się w żądaniu odczytywanym przez Claude. Zapamiętywanie oznacza ponowne przesyłanie danych. Tekst ten dociera jako tokeny wejściowe i jest rozliczany według standardowej stawki wejściowej modelu. O wysokości opłaty decydują dwie wartości: liczba tokenów zapamiętanego tekstu przesyłanych w każdej turze oraz to, czy ten tekst może zostać obsłużony z pamięci podręcznej promptu (prompt cache).

W ramach subskrypcji Pro lub Max użytkownik nie jest rozliczany za każdy token, więc pamięć zużywa limit wykorzystania, a nie środki pieniężne. Mechanizm działania pozostaje identyczny, zmienia się jedynie jednostka rozliczeniowa. Limit ten jest skończony, dlatego warto sprawdzić ile kosztuje Claude Pro i przy jakim poziomie limity blokują dostęp, zanim zapadnie decyzja, jak duży blok pamięci ma być przesyłany w każdej turze. Sytuacja w Claude Enterprise wygląda inaczej, ponieważ każdy token jest mierzony według stawek API niezależnie od opłaty za stanowisko, więc zbyt duży blok pamięci przekłada się bezpośrednio na koszty, a nie na zużycie limitu. Jeśli ograniczenie pamięci pozwala na powrót do limitów niższego planu, warto rozważyć przejście z planu Max na Pro, a zmiana nastąpi z końcem okresu, za który opłacono subskrypcję. Jeśli porównanie dotyczy ofert różnych dostawców, a nie poszczególnych planów Anthropic, punktem wyjścia jest zestawienie planów Claude z ofertą ChatGPT według aktualnych cen.

Co oznacza „pamięć” w poszczególnych interfejsach Claude

Trzy odrębne produkty używają tego samego określenia, a ich mylenie jest główną przyczyną niejasności związanych z tym pytaniem.

Narzędzie memory w API Claude. Dodaje się jeden wpis do tablicy tools i implementuje operacje na plikach we własnym kodzie.

{"type": "memory_20250818", "name": "memory"}

Według stanu na sierpień 2026 r. narzędzie to jest ogólnie dostępne w Messages API bez nagłówka beta, w modelach Claude 4 i nowszych. Działa ono po stronie klienta: Claude żąda operacji, takiej jak view /memories, procedura obsługi wykonuje ją w pamięci masowej kontrolowanej przez użytkownika, a wynik zwracany jest w bloku tool_result. Anthropic nie przechowuje pliku, więc nie ma opłat za składowanie. Zamiast tego płaci się za pełny cykl zapytania. Definicja narzędzia jest przesyłana w każdym żądaniu, a treść pliku, która wraca, pozostaje w konwersacji od tego momentu.

Anthropic publikuje stałą część tego narzutu. W modelu Claude Opus 5 przy wyborze narzędzia auto, systemowy prompt dotyczący użycia narzędzi zajmuje 286 tokenów, zgodnie z dokumentacją z sierpnia 2026 r. Jest to opłata naliczana raz na żądanie, gdy obecne jest jakiekolwiek narzędzie, niezależnie od tego, czy jest to pamięć, czy inne.

Claude Code. Dwa mechanizmy ładowane są na początku każdej sesji. Pliki CLAUDE.md zawierają instrukcje tworzone przez użytkownika. Automatyczna pamięć przechowuje notatki, które Claude tworzy dla siebie w ~/.claude/projects/<project>/memory/. Ładowane jest tylko pierwsze 200 linii lub 25KB pliku MEMORY.md, w zależności od tego, który limit zostanie osiągnięty jako pierwszy, a pliki tematyczne obok niego są odczytywane na żądanie, a nie przy starcie. Wszystko, co zostało załadowane przy starcie, staje się częścią prefiksu, który zawiera każde kolejne żądanie w tej sesji. Jak Claude Code przywołuje pamięć między sesjami opisuje kolejność ładowania plik po pliku.

Claude w przeglądarce. W serwisie claude.ai pamięć to zestaw wpisów, które Claude tworzy i aktualizuje w trakcie rozmowy, z oddzielną przestrzenią pamięci dla każdego projektu. Ustawienia > Memory (Pamięć) wyświetlają listę przechowywanych danych, a przełącznik pozwala na wstrzymanie (Pause memory) lub zresetowanie pamięci (Reset memory). Ten interfejs jest rozliczany w ramach subskrypcji, więc korzystanie z pamięci zużywa limity użycia.

Dlaczego zapamiętany tekst jest rozliczany jako tokeny wejściowe

Messages API jest bezstanowe. Nie przechowuje żadnych danych między wywołaniami, dlatego klient wysyła całą konwersację przy każdym zapytaniu, a model odczytuje ją ponownie w całości. Pamięć nie stanowi wyjątku od tej zasady. Jest to kolejny blok tekstu w tym samym żądaniu.

Podział jest widoczny w obiekcie usage w każdej odpowiedzi.

"usage": {
  "input_tokens": 412,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 18240,
  "output_tokens": 236
}

input_tokens zlicza tylko te tokeny, które nie zostały odczytane z pamięci podręcznej ani użyte do jej utworzenia, co w praktyce oznacza tokeny znajdujące się po ostatnim punkcie przerwania cache. Całkowite wejście dla żądania to cache_read_input_tokens plus cache_creation_input_tokens plus input_tokens. Plik pamięci otwarty przez Claude trzy tury temu znajduje się w tej sumie przy każdym kolejnym zapytaniu. Trafia on do cache_read_input_tokens, dopóki prefiks w cache jest utrzymywany, oraz do input_tokens, gdy tak nie jest. Ten sam tekst, dwie bardzo różne ceny. Tokeny wejściowe i wyjściowe mają różne ceny, a pamięć zawsze obciąża stronę wejściową.

Gdzie sprawdzić te liczby we własnym użyciu

Nie należy polegać na wartościach z wpisów na blogach, w tym z niniejszego. Należy zmierzyć własny blok pamięci. Liczenie tokenów jest bezpłatne i posiada własny limit zapytań, więc pomiar nie generuje kosztów.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{"role": "user", "content": "Hello, Claude"}]
  }'

Odpowiedź stanowi pojedyncza liczba, taka jak { "input_tokens": 14 }. Należy uruchomić to polecenie raz, wklejając tekst pamięci w pole system, a następnie raz bez niego; różnica wskazuje koszt pamięci w każdej turze. Należy uwzględnić dwa zastrzeżenia. Wynik jest szacunkowy, a dodatkowe tokeny dodawane przez Anthropic na potrzeby optymalizacji systemowych nie są doliczane do rachunku. Należy również wykonać pomiar dla modelu, który będzie faktycznie używany, ponieważ Claude 4.7 i nowsze wersje korzystają z nowszego tokenizera, który generuje o około 30 procent więcej tokenów dla tego samego tekstu.

Wewnątrz Claude Code na to samo pytanie można uzyskać odpowiedź bez użycia curl.

  • /context wyświetla aktualnie załadowane dane, w tym pliki pamięci, co pozwala sprawdzić ich udział w oknie kontekstowym przed wpisaniem czegokolwiek.
  • /memory wyświetla listę plików CLAUDE.md i otwiera folder pamięci automatycznej.
  • /usage drukuje sumy sesji, w tym odczyty i zapisy z pamięci podręcznej.
  • Wiersz stanu może wyświetlać użycie okna kontekstowego w sposób ciągły, dzięki czemu wzrost jest widoczny w czasie rzeczywistym.

Blok sesji /usage wygląda następująco:

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Należy uważnie przeczytać ostatnią linię. Wartość 940.0k cache read oznacza, że konwersacja wraz z pamięcią jest przesyłana ponownie w każdej turze z uwzględnieniem stawki za pamięć podręczną. Wartość 1.2k input dotyczy tylko nowej części danych. Claude Code oblicza tę kwotę lokalnie na podstawie cennika, więc pomija ewentualne rabaty i może różnić się od kwoty na fakturze. Strona Usage w Claude Console zawiera wiążące dane.

Następnie należy przeprowadzić bezpośrednie porównanie. Należy zadać to samo pytanie otwierające w dwóch nowych sesjach: jednej standardowej i jednej z wyłączoną pamięcią automatyczną.

CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claude

Należy uruchomić /context w każdej z nich i porównać wpis dotyczący plików pamięci. Różnica stanowi koszt zgromadzonej pamięci na początku każdej sesji, zanim rozpocznie się właściwa praca. Warto zapoznać się z pełnym zestawieniem zużycia tokenów w Claude Code w odniesieniu do tych dwóch liczb.

Jaki jest koszt ponownego odczytu pamięci na milion tokenów?

Prompt caching jest powodem, dla którego ten sam blok pamięci może kosztować dziesięciokrotnie więcej w jednej turze niż w innej. Anthropic publikuje stawki cache jako wielokrotności podstawowej ceny wejściowej każdego modelu, dzięki czemu relacja ta pozostaje stała nawet przy zmianach cen w dolarach.

ChartAnthropic's published prompt caching rates, as a multiple of base input price
The data behind this chart
[
  {
    "label": "Base input",
    "price_multiple": 1
  },
  {
    "label": "5 minute cache write",
    "price_multiple": 1.25
  },
  {
    "label": "1 hour cache write",
    "price_multiple": 2
  },
  {
    "label": "Cache read",
    "price_multiple": 0.1
  }
]

Odczyt z cache kosztuje 0.1 razy więcej niż podstawowa cena wejściowa. Zapis wpisu z 5-minutowym czasem życia kosztuje 1.25 razy więcej niż cena podstawowa, a z 1-godzinnym czasem życia 2 razy więcej. Anthropic jasno określa próg opłacalności: caching zwraca się po jednym odczycie z cache przy czasie 5 minut lub po dwóch odczytach przy czasie 1 godziny. Próg opłacalności dla prompt caching to obliczenie, które należy wykonać przed podjęciem decyzji o umiejscowieniu pamięci.

Te mnożniki zamieniają liczbę odczytów w proste działanie arytmetyczne. Poniższy blok stanowi wyliczenie oparte na opublikowanych powyżej mnożnikach, a nie pomiar rzeczywistego obciążenia. Wycenia on blok pamięci na trzy sposoby w trakcie sesji składającej się ze 100 tur, wyrażając koszt jako równoważną liczbę tokenów rozliczaną według standardowej podstawowej stawki wejściowej.

ChartA memory block over 100 turns, expressed as base-rate input tokens
The data behind this chart
[
  {
    "label": "4,000 tokens, never cached",
    "base_rate_equivalent_tokens": "400,000"
  },
  {
    "label": "4,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "44,600"
  },
  {
    "label": "1,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "11,150"
  }
]

Blok pamięci o rozmiarze 4000 tokenów, który w każdej ze 100 tur nie trafia do cache, jest rozliczany jak 400,000 tokenów według stawki podstawowej. Ten sam blok z jednym zapisem do cache (5 minut) i 99 odczytami jest rozliczany jak 44,600. Zredukowanie go do jednej czwartej rozmiaru przy zachowaniu cachingu daje rozliczenie jak 11,150. Funkcja nie zmieniła się w tych 3 wierszach. Zmienił się tylko sposób ponownego odczytu. Są to nadal liczby tokenów, a nie kwoty pieniężne, a przeliczenie liczby tokenów na kwotę na miesięcznej fakturze wymaga jednego mnożenia przez stawkę modelu za milion tokenów. Stawka ta zależy od używanego modelu, więc jeśli agent ma korzystać z Claude Fable 5, należy zacząć od opublikowanych stawek za milion tokenów i zastosowań tego modelu. Jeśli wybór dostawcy pozostaje kwestią otwartą, porównanie kosztów tych samych zadań w API Claude oraz ChatGPT pokazuje, jak różnie kształtują się te koszty, przy czym agenty intensywnie korzystające z pamięci mocno obciążają stronę wejściową rachunku.

Drugi wiersz zakłada, że każde z 99 kolejnych żądań dociera w czasie, gdy wpis w cache jest nadal aktywny. To założenie jest miejscem, w którym większość rzeczywistych rachunków okazuje się błędna.

Dlaczego to samo pytanie kosztuje więcej po przerwie?

Wpis w pamięci podręcznej ma określony czas życia, a licznik startuje w momencie żądania zapisu lub odczytu. Domyślna wartość to 5 minut. Opcja 1 godziny kosztuje dwukrotność opłaty za zapis, jak pokazano powyżej. W Claude Code czas życia wynosi godzinę w ramach subskrypcji i skraca się do pięciu minut po przejściu na wykorzystanie kredytów; w przypadku klucza API lub dostawcy chmurowego domyślną wartością jest pięć minut. Ustawienie ENABLE_PROMPT_CACHING_1H=1 pozwala zachować godzinny czas życia podczas korzystania z kredytów.

Zatem pytanie składające się z jednej linii, wpisane w sesji pozostawionej otwartej na czas przerwy obiadowej, jest kosztowne, ponieważ wpis w pamięci podręcznej wygasł podczas nieobecności. Cały prefiks, włącznie z pamięcią, jest przetwarzany ponownie według podstawowej stawki wejściowej i zapisywany w pamięci podręcznej od nowa. Długość przerwy wpłynęła na tę cenę.

Można to zweryfikować zamiast przyjmować na wiarę. W planach Pro, Max, Team lub Enterprise, zestawienie /usage wskazuje każde zachowanie odpowiedzialne za 10 procent lub więcej niedawnego zużycia, a zarówno długi kontekst, jak i chybienia pamięci podręcznej (cache misses) pojawiają się tam z nazwy. W przypadku API należy obserwować, jak cache_creation_input_tokens skacze z powrotem do pełnego rozmiaru prefiksu przy pierwszym żądaniu po okresie bezczynności.

Co powoduje ciche unieważnienie pamięci podręcznej

Buforowany prefiks jest uporządkowany: narzędzia, następnie system, a na końcu komunikaty. Zmiana na dowolnym poziomie unieważnia ten poziom oraz wszystko, co po nim następuje. Edycja definicji narzędzia powoduje odrzucenie całej pamięci podręcznej. Edycja promptu systemowego powoduje odrzucenie pamięci podręcznej systemu oraz komunikatów.

Jest to pułapka dla osób, które przechowują pamięć w prompcie systemowym i nadpisują ją w miarę uczenia się agenta. Każde nadpisanie odrzuca zbuforowaną kopię wszystkiego, co znajduje się za nim, więc kolejne żądanie ponownie wiąże się z pełnym kosztem zapisu. Należy umieszczać stabilne elementy na początku i dbać o ich niezmienność, a zmienne dane pozostawiać na końcu listy komunikatów, gdzie ich unieważnienie jest mało kosztowne.

Istnieje druga, mniej oczywista przyczyna awarii. Każdy model posiada minimalny buforowalny prefiks: 512 tokenów dla Claude Opus 5, 1024 dla Claude Sonnet 5, 4096 dla Claude Haiku 4.5, zgodnie z danymi opublikowanymi w sierpniu 2026 roku. Dokumentacja Anthropic jasno określa, co dzieje się poniżej tej wartości: „Wszelkie żądania buforowania mniejszej liczby tokenów zostaną przetworzone bez użycia pamięci podręcznej, bez zwracania błędu”. Mały plik pamięci oznaczony jako cache_control nie przynosi zatem żadnego efektu, działając w sposób niezauważalny. Objawem, który można zaobserwować, jest utrzymywanie się wartości cache_creation_input_tokens na poziomie 0, mimo że prompt wyraźnie zawiera punkt przerwania.

Usuwanie pamięci, która przestała być przydatna

Każda linia pamięci kosztuje tokeny w każdej turze, w której jest przenoszona, dlatego w przypadku każdej linii należy zadać pytanie, czy w ostatnim czasie wpłynęła ona na zmianę odpowiedzi. Claude Code nadaje tym limitom konkretny wymiar. Należy dążyć do utrzymania pliku CLAUDE.md poniżej 200 linii, ponieważ dłuższe pliki zużywają więcej kontekstu i zmniejszają niezawodność, z jaką Claude stosuje się do zawartych w nich instrukcji. MEMORY.md jest ograniczony do pierwszych 200 linii lub 25KB w momencie ładowania, a wszystko, co przekracza ten limit, jest odrzucane przy starcie następnej sesji, więc zbyt duży indeks generuje koszty w tokenach, nie wnosząc żadnej wartości.

Dwa nawyki pozwalają utrzymać mały rozmiar. Przenieś szczegóły z indeksu do plików tematycznych, które Claude odczytuje na żądanie, a nie przy starcie. Przenieś instrukcje dotyczące przepływu pracy z CLAUDE.md do umiejętności (skills), które ładują się tylko po wywołaniu. W przypadku plików pamięci, które już zaczynają się od metadanych (frontmatter), Claude Code zapisuje czas zapisu w polu modified jako znacznik czasu ISO 8601 (w wersji 2.1.214 lub nowszej), a ten znacznik czasu jest najszybszym sposobem na wykrycie nieaktualnych informacji. Usuwanie nieaktualnej pamięci agenta szczegółowo omawia proces weryfikacji.

Kiedy pobieranie danych przewyższa ładowanie wszystkiego do kontekstu

Narzędzie pamięci istnieje, aby wspierać pobieranie danych w trybie just-in-time. Zamiast ładować wszystko na początku, agent zapisuje to, czego się nauczył, i odczytuje plik tylko wtedy, gdy wymaga tego zadanie. Zmienia to rachunek kosztów, ponieważ odczyt pliku kosztuje tokeny tylko raz, a następnie pozostaje w buforowanym prefiksie, podczas gdy stale załadowany blok kosztuje przy każdej pojedynczej turze.

Z powyższych dwóch wykresów wynika prosta zasada. Tekst, którego używa niemal każda tura, powinien znajdować się w stabilnym buforowanym prefiksie. Tekst, którego używa jedna na dwadzieścia tur, powinien znajdować się za wywołaniem view. Punkt opłacalności przesuwa się wraz z liczbą powtórzeń, a nie z cennikiem Anthropic.

W API można również pozwolić platformie na przycinanie konwersacji. Edycja kontekstu usuwa stare wyniki narzędzi, gdy konwersacja przekroczy ustawiony próg.

{
  "edits": [
    {
      "type": "clear_tool_uses_20250919",
      "trigger": {"type": "input_tokens", "value": 30000},
      "keep": {"type": "tool_uses", "value": 3},
      "clear_at_least": {"type": "input_tokens", "value": 5000}
    }
  ]
}

Wartości domyślne to próg 100,000 tokenów wejściowych i zachowanie 3 użyć narzędzi. Przed włączeniem tej funkcji należy zapoznać się z interakcją z buforowaniem: usuwanie zawartości unieważnia buforowany prefiks w punkcie usunięcia, więc przy następnym żądaniu płaci się za zapis do pamięci podręcznej. Do tego służy clear_at_least. Wstrzymuje ono usuwanie do momentu, aż oszczędność będzie wystarczająco duża, aby uzasadnić zapis. Odpowiedź raportuje dokładnie, co się wydarzyło w ramach context_management, przy użyciu cleared_tool_uses oraz cleared_input_tokens, dzięki czemu bilans jest mierzalny, a nie teoretyczny. Zarządzanie oknem kontekstu w Claude Code stosuje tę samą zasadę w sesji programistycznej.

Co posiada własną pozycję kosztową

Pamięć nie wiąże się z własną opłatą, jednak niektóre funkcje generują rzeczywiste koszty i warto wiedzieć, które z nich. Poniżej przedstawiono opublikowane stawki Claude API obowiązujące w sierpniu 2026 roku. Niektóre operacje są całkowicie bezpłatne, jednak w Claude API nie istnieje darmowy plan, a jedynie niewielki kredyt przy rejestracji, więc każda poniższa pozycja oznacza realne wydatki od pierwszego zapytania.

  • Wyszukiwanie w sieci: 10 USD za 1000 wyszukiwań, plus standardowy koszt tokenów za całą treść dodaną przez wyszukiwanie do kontekstu.
  • Wykonywanie kodu: 1550 darmowych godzin na organizację miesięcznie, następnie 0,05 USD za godzinę pracy kontenera. Usługa jest bezpłatna, gdy jest używana wraz z wyszukiwaniem lub pobieraniem danych z sieci.
  • Claude Managed Agents: czas działania sesji w cenie 0,08 USD za godzinę sesji, doliczany do standardowych opłat za tokeny.
  • Pobieranie danych z sieci (Web fetch): brak dodatkowych opłat, naliczany jest jedynie koszt tokenów za pobraną treść.

Pamięć nie figuruje w żadnej z powyższych pozycji. Pojawia się ona w liczbie tokenów wejściowych, gdzie można ją dokładnie zmierzyć oraz gdzie przycinanie i buforowanie pozwalają na redukcję kosztów. Jeśli planowany jest budżet dla agenta działającego bez nadzoru na serwerze VPS, kontrola kosztów agenta AI na VPS jest kolejnym krokiem, który należy wdrożyć. Agent z rosnącym plikiem pamięci bez mechanizmu przycinania staje się z każdym tygodniem coraz droższy, a proces ten odbywa się bez żadnych powiadomień.

FAQ

Czy za funkcje pamięci Claude pobierana jest osobna opłata?

Nie. Cennik Anthropic zawiera stawki za milion tokenów wejściowych, milion tokenów wyjściowych oraz mnożniki prompt caching, bez osobnej pozycji dla pamięci. W API Claude narzędzie pamięci działa po stronie klienta, więc pliki znajdują się w pamięci masowej, za którą użytkownik już płaci. Pamięć zwiększa liczbę tokenów wejściowych, które są rozliczane według standardowej stawki wejściowej modelu przy każdym wywołaniu, które je zawiera.

Czy wyłączenie pamięci obniża koszty korzystania z Claude?

Zmniejsza to liczbę tokenów w każdym żądaniu, co obniża koszt pojedynczego zapytania. To, czy przyniesie to ogólne oszczędności, zależy od dalszego przebiegu pracy. Jeśli Claude musi ponownie odczytać trzy pliki i zadać dwa pytania, aby odtworzyć informacje, które już znajdowały się w pamięci, koszt tych tokenów będzie wyższy niż koszt samej pamięci. Zamiast zgadywać, należy przeprowadzić pomiary: uruchom /context w sesji z włączoną automatyczną pamięcią oraz w sesji rozpoczętej za pomocą CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, a następnie porównaj całkowitą liczbę tokenów zużytych na to samo zadanie.

Dlaczego zużycie wzrosło, mimo że nic nie zostało zmienione?

Najczęstszą przyczyną jest brak trafienia w pamięć podręczną (cache miss) po przerwie. Wpisy w pamięci podręcznej są domyślnie przechowywane przez 5 minut lub przez jedną godzinę w ustawieniu rozszerzonym, więc pierwsze żądanie po przerwie przetwarza cały prefiks według podstawowej stawki wejściowej i zapisuje go ponownie. Drugą częstą przyczyną jest edycja prefiksu: zmiana definicji narzędzia unieważnia całą pamięć podręczną, a zmiana systemowego promptu unieważnia pamięć podręczną systemu i wiadomości. W planie subskrypcyjnym zestawienie /usage wskazuje to zachowanie, gdy odpowiada ono za 10 procent lub więcej ostatniego zużycia.

Czy pamięć powinna znajdować się w systemowym prompcie, czy za wywołaniem narzędzia?

Umieść ją w systemowym prompcie, gdy jest używana w niemal każdej turze, ponieważ wtedy znajduje się w zbuforowanym prefiksie i jest rozliczana według stawki odczytu pamięci podręcznej. Umieść ją za wywołaniem view, gdy jest potrzebna tylko w niektórych zadaniach, ponieważ plik odczytany raz generuje koszt tokenów tylko raz, a nie w każdej turze. Decydującą wartością jest liczba powtórzeń, a obiekt usage podaje tę liczbę bezpośrednio.

Czy funkcje pamięci wliczają się do limitów zużycia subskrypcji?

Tak, pośrednio, ponieważ limity subskrypcji są zużywane przez tokeny zawarte w każdym żądaniu. Dokumentacja pomocy Anthropic stwierdza, że dłuższe konwersacje, które wyzwalają automatyczne zarządzanie kontekstem, zużywają więcej limitu. Pamięć sprawia, że każde żądanie jest nieco dłuższe, a długa sesja powtarza tę długość w każdej turze. Jak faktycznie działają limity zużycia Claude opisuje, co i kiedy ulega zresetowaniu.