Чи потрібно доплачувати за пам’ять Claude?
Anthropic не публікує окрему ціну memory token. Збережений текст повторно надсилається як вхідні токени, а вартість залежить від обсягу та кешування.
Чи коштують функції пам’яті Claude додатково?
Функції пам’яті Claude не мають окремої вартості. Опубліковані тарифи Anthropic розраховуються за мільйон вхідних токенів і за мільйон вихідних токенів, а також містять окремі тарифи для кешування промптів. Жоден із них не називається токеном пам’яті. Зберігання самої пам’яті в Claude API (application programming interface) нічого не коштує, оскільки memory tool працює на стороні клієнта, а файл зберігається у вашому сховищі.
Пам’ять усе одно впливає на рахунок, оскільки збережений факт змінює відповідь лише тоді, коли він міститься в запиті, який читає Claude. Використання пам’яті означає повторне надсилання тексту. Цей текст надходить як вхідні токени й оплачується за звичайним тарифом моделі для вхідних даних. Вартість визначають 2 показники: скільки токенів збереженого тексту ви повторно передаєте під час кожного запиту і чи можна обробити цей повторно переданий текст через кеш промптів.
За підпискою Pro або Max оплата за токени не стягується, тому пам’ять витрачає ваш ліміт використання, а не кошти. Механізм залишається таким самим. Змінюється лише одиниця обліку. Цей ліміт не є необмеженим, тому перед вибором обсягу пам’яті для кожного запиту варто знати скільки коштує Claude Pro і на якому етапі його ліміти починають вас обмежувати. Claude Enterprise працює інакше: він обліковує кожен токен за тарифами API додатково до вартості місця, тому завеликий блок пам’яті знову перетворюється на витрати, а не на використання ліміту. Якщо скорочення пам’яті дає змогу впевнено залишатися в межах ліміту дешевшого плану, наступним кроком варто розглянути перехід із Max на Pro. Зміна набуде чинності наприкінці вже оплаченого періоду. Якщо ви насправді порівнюєте різних постачальників, а не тарифні рівні Anthropic, почніть із матеріалу порівняння тарифів Claude і ChatGPT за поточними цінами.
Що означає «пам’ять» у кожному інтерфейсі Claude
Це слово використовують для трьох окремих продуктів. Саме через їх змішування це питання здається заплутаним.
Інструмент пам’яті в Claude API. Ви додаєте один запис до масиву tools і реалізуєте файлові операції у власному коді.
{"type": "memory_20250818", "name": "memory"}Станом на August 2026 цей інструмент загальнодоступний у Messages API без beta-заголовка, у моделях Claude 4 і новіших. Він працює на стороні клієнта: Claude запитує операцію, наприклад view /memories, ваш обробник виконує її зі сховищем під вашим контролем, а ви повертаєте результат у блоці tool_result. Anthropic не зберігає файл, тому вам не потрібно оплачувати витрати на його зберігання. Ви платите за обмін запитами та відповідями. Визначення інструмента надсилається в кожному запиті, а вміст файлу, який повертається, від цього моменту залишається в контексті розмови.
Anthropic публікує фіксовану частину цих накладних витрат. Для Claude Opus 5 із вибором інструмента auto системний prompt для використання інструментів становить 286 токенів, згідно з документацією станом на August 2026. Ця кількість оплачується один раз за запит, якщо в ньому присутній будь-який інструмент, незалежно від того, чи це пам’ять.
Claude Code. На початку кожної сесії завантажуються два механізми. Файли CLAUDE.md містять інструкції, які ви пишете. Auto memory містить нотатки, які Claude записує для себе, у ~/.claude/projects/<project>/memory/. Завантажуються лише перші 200 рядків або 25KB із MEMORY.md — залежно від того, яке обмеження буде досягнуто раніше. Файли тем поруч із ним читаються за потреби, а не під час запуску. Усе, що завантажується під час запуску, стає частиною префікса, який надсилається з кожним наступним запитом у цій сесії. У матеріалі Як Claude Code відновлює пам’ять між сесіями описано порядок завантаження для кожного файлу.
Claude у вебінтерфейсі. На claude.ai пам’ять — це набір записів, які Claude створює та оновлює під час спілкування. Для кожного проєкту використовується окремий простір пам’яті. У Settings > Memory відображається список збережених даних, а перемикач у цьому розділі дає змогу вибрати Pause memory або Reset memory. У цьому інтерфейсі оплата здійснюється за підпискою, тому пам’ять використовує доступні ліміти.
Чому збережений текст тарифікується як вхідні токени
Messages API не зберігає стан. Він нічого не зберігає між викликами, тому клієнт надсилає весь діалог під час кожного ходу, а модель знову читає його повністю. Пам’ять не є винятком із цього правила. Це ще один блок тексту в тому самому запиті.
Розподіл видно в об’єкті usage у будь-якій відповіді.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens враховує лише токени, які не було прочитано з кешу та не використано для його створення. На практиці це токени після останньої точки кешування. Загальна кількість вхідних токенів для запиту — це cache_read_input_tokens плюс cache_creation_input_tokens плюс input_tokens. Файл пам’яті, який Claude відкрив три ходи тому, входить до цього підсумку під час кожного наступного ходу. Він потрапляє до cache_read_input_tokens, доки префікс залишається в кеші, і до input_tokens, коли префікс не кешується. Той самий текст має дві дуже різні ціни. Вхідні та вихідні токени мають різні ціни, а пам’ять завжди належить до вхідної частини.
Де переглянути ці показники у власному використанні
Не використовуйте показник із допису в блозі, зокрема з цього. Виміряйте власний блок пам’яті. Підрахунок токенів безкоштовний і має власний ліміт частоти запитів, тому вимірювання нічого не коштує.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'Результатом буде одне число, наприклад { "input_tokens": 14 }. Виконайте команду один раз, вставивши текст пам’яті в поле system, а потім ще раз без нього. Різниця показує, скільки коштує ця пам’ять під час кожного запиту. Є два застереження. Підрахунок є приблизним, а додаткові токени, які Anthropic додає для власної оптимізації системи, не тарифікуються. Також використовуйте модель, яку ви фактично запускатимете, оскільки Claude 4.7 і новіші версії використовують новіший токенізатор, що створює приблизно на 30 відсотків більше токенів для того самого тексту.
У Claude Code на це саме запитання можна отримати відповідь без жодного curl.
/contextпоказує, що зараз завантажено, включно з файлами пам’яті, тому ви можете побачити їхню частку у вікні контексту ще до введення тексту./memoryперелічує ваші файли CLAUDE.md і відкриває папку автоматичної пам’яті./usageвиводить загальні показники сеансу, зокрема читання та записування кешу.- У рядку стану можна постійно відображати використання вікна контексту, тому його зростання буде видно в реальному часі.
Блок сеансу /usage має такий вигляд:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Уважно прочитайте останній рядок. Показник читання кешу 940.0k означає, що розмова, включно з пам’яттю, повторно надсилається під час кожного запиту за тарифом кешу. Показник вхідних даних 1.2k охоплює лише нову частину. Claude Code локально обчислює цю суму в доларах за тарифами зі списку, тому не враховує надану вам знижку й може відрізнятися від суми у вашому рахунку. Авторитетним джерелом є сторінка Usage у Claude Console.
Потім виконайте порівняння безпосередньо. Поставте те саме початкове запитання у двох нових сеансах: в одному зі звичайними налаштуваннями, а в іншому з вимкненою автоматичною пам’яттю.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeВиконайте /context у кожному сеансі та порівняйте запис про файли пам’яті. Різниця показує, скільки коштує накопичена пам’ять на початку кожного сеансу, ще до початку роботи. Повний розбір використання токенів Claude Code варто прочитати разом із цими двома показниками.
Скільки коштує повторне передавання контексту на мільйон токенів?
Кешування промптів пояснює, чому той самий блок пам’яті в одному запиті може коштувати вдесятеро дорожче, ніж в іншому. Anthropic публікує тарифи кешу як коефіцієнти від базової ціни вхідних даних кожної моделі, тому це співвідношення зберігається навіть тоді, коли ціни в доларах змінюються.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Читання з кешу коштує 0.1 базової ціни вхідних даних. Запис запису зі строком зберігання 5 хвилин коштує 1.25 базової ціни, а зі строком зберігання 1 година — 2 базової ціни. Anthropic прямо вказує точку беззбитковості: кешування окупається після одного читання з кешу для тривалості 5 хвилин або після двох читань з кешу для тривалості 1 година. Точка беззбитковості для кешування промптів — це розрахунок, який потрібно виконати перед тим, як визначити, де зберігати пам’ять.
Ці коефіцієнти дають змогу розрахувати кількість повторних передавань. Наступний блок містить арифметичний розрахунок на основі наведених вище опублікованих коефіцієнтів, а не вимірювання реального робочого навантаження. У ньому вартість блока пам’яті за сесію зі 100 запитами наведено у трьох варіантах як еквівалентну кількість токенів, нарахованих за звичайною базовою ціною вхідних даних.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]Блок пам’яті на 4,000 токенів, який не використав кеш у всіх 100 запитах, тарифікується як 400,000 токенів за базовою ціною. Той самий блок з одним записом у кеш зі строком зберігання 5 хвилин і 99 читаннями з кешу тарифікується як 44,600. Якщо зменшити його до чверті початкового розміру та залишити кешування, він тарифікується як 11,150. Функція не змінювалася в цих 3 рядках. Змінилася лише поведінка повторного передавання. Це все ще кількість токенів, а не сума в грошах. Перетворення кількості токенів на суму у вашому щомісячному рахунку — це множення на тариф вашої моделі за мільйон токенів. Цей тариф визначається моделлю, яку ви використовуєте. Тому якщо агент працюватиме на Claude Fable 5, почніть із опублікованих тарифів за мільйон токенів для цієї моделі та відповідних робочих навантажень.
У другому рядку передбачається, що кожен із 99 наступних запитів надходить, поки запис у кеші ще чинний. Саме це припущення найчастіше спричиняє помилки в реальних рахунках.
Чому те саме запитання коштує дорожче після перерви?
Запис у кеші має термін дії. Відлік починається із запиту, який записує або читає цей запис. Типове значення — 5 хвилин. Варіант на 1 годину коштує в 2 рази дорожче за запис, як показано вище. У Claude Code термін дії становить одну годину для підписки та скорочується до п’яти хвилин, коли використовуються кредити на основі обсягу використання. Для ключа API або хмарного провайдера типовим значенням є п’ять хвилин. Параметр ENABLE_PROMPT_CACHING_1H=1 зберігає термін дії в одну годину під час використання кредитів.
Тому однорядкове запитання, введене в сесію, яку ви залишили відкритою на час обіду, коштує дорого: запис у кеші втратив чинність, поки вас не було. Увесь префікс, включно з пам’яттю, обробляється повторно за базовою ставкою для вхідних даних і знову записується в кеш. Ціну визначає тривалість перерви.
Це можна перевірити, а не просто припускати. У планах Pro, Max, Team або Enterprise розділ /usage позначає будь-яку поведінку, яка відповідає за 10 відсотків або більше нещодавнього використання. Там окремо відображаються довгий контекст і промахи кешу. В API відстежуйте, як cache_creation_input_tokens після періоду бездіяльності знову збільшується до повного розміру вашого префікса під час першого запиту.
Що непомітно робить кеш недійсним
Кешований префікс має визначений порядок: інструменти, потім system, потім повідомлення. Зміна на одному рівні робить недійсним цей рівень і все, що йде після нього. Редагування визначення інструмента видаляє весь кеш. Редагування system prompt видаляє кеш system і повідомлень.
Це пастка для тих, хто зберігає пам’ять у system prompt і переписує її в міру навчання агента. Кожне переписування видаляє кешовану копію всього, що розташовано після неї, тому наступний запит знову повністю записує ці дані. Розміщуйте стабільний матеріал на початку та не змінюйте його. Нестабільний матеріал розміщуйте ближче до кінця списку повідомлень, де його інвалідація коштує дешевше.
Є ще одна, менш очевидна проблема. Кожна модель має мінімальний кешований префікс: 512 токенів у Claude Opus 5, 1,024 у Claude Sonnet 5 і 4,096 у Claude Haiku 4.5, згідно з даними, опублікованими в серпні 2026 року. У документації Anthropic прямо зазначено, що відбувається, якщо префікс коротший: "Any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned." Невеликий файл пам’яті, позначений cache_control, тому взагалі нічого не робить — і це відбувається непомітно. Ознака, яку можна побачити, — cache_creation_input_tokens залишається рівним 0, хоча prompt явно містить точку кешування.
Видаляйте застарілі записи пам’яті
Кожен рядок пам’яті витрачає токени під час кожного сеансу, у якому його враховано. Тому для кожного рядка потрібно перевірити, чи змінив він нещодавню відповідь. Claude Code дає конкретні обмеження. Намагайтеся, щоб файл CLAUDE.md містив менше ніж 200 рядків, оскільки довші файли споживають більше контексту й знижують надійність дотримання Claude цих інструкцій. Під час завантаження MEMORY.md обмежується першими 200 рядками або 25KB. Усе після цього обмеження відкидається під час запуску наступного сеансу. Тому завеликий індекс витрачає токени, але не додає корисної інформації.
Два підходи допомагають зберігати файл невеликим. Переносьте докладну інформацію з індексу до тематичних файлів. Claude читає їх за потреби, а не під час запуску. Переносьте інструкції щодо робочих процесів із CLAUDE.md до skills. Вони завантажуються лише після виклику. Для файлів пам’яті, які вже починаються з frontmatter, Claude Code у версії 2.1.214 або новішій записує час створення або змінення у поле modified як мітку часу ISO 8601. Це найшвидший спосіб виявити факт, який застарів. У матеріалі Очищення пам’яті агента від застарілих записів докладніше описано процес перевірки.
Коли отримання даних ефективніше за завантаження всього в контекст
Інструмент memory призначений для отримання даних саме в потрібний момент. Замість попереднього завантаження всього агент записує отриману інформацію, а потім читає файл лише тоді, коли цього потребує завдання. Це змінює розрахунок, оскільки читання файлу один раз витрачає його токени, після чого файл залишається в кешованому префіксі. Постійно завантажений блок витрачає токени під час кожного ходу.
Із двох наведених вище графіків випливає просте правило. Текст, який використовується майже в кожному ході, має належати до стабільного кешованого префікса. Текст, який використовується один раз на двадцять ходів, слід отримувати через виклик view. Точка беззбитковості залежить від кількості повторних відтворень, а не від тарифів Anthropic.
В API також можна дозволити платформі скорочувати діалог. Редагування контексту видаляє старі результати інструментів, коли діалог перевищує встановлений вами поріг.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}Типові параметри: поріг у 100,000 вхідних токенів і збереження результатів 3 викликів інструментів. Перед увімкненням прочитайте, як це взаємодіє з кешуванням: видалення вмісту анулює кешований префікс у точці видалення, тому наступний запит потребує запису в кеш. Саме для цього призначений clear_at_least. Він відкладає видалення, доки економія не стане достатньою, щоб виправдати запис. Відповідь точно повідомляє, що відбулося, у межах context_management, разом із cleared_tool_uses і cleared_input_tokens, тому компроміс можна виміряти, а не лише оцінювати теоретично. Керування вікном контексту в Claude Code застосовує ту саму ідею до сеансу розробки.
Що має окремий пункт у тарифах
Пам’ять не має окремої плати, але деякі функції справді тарифікуються окремо, і варто знати, які саме. Нижче наведено опубліковані тарифи Claude API станом на August 2026. Деякі операції взагалі нічого не коштують, але у Claude API немає безкоштовного тарифу, лише невеликий кредит після реєстрації, тому всі наведені нижче операції починають списувати кошти вже з першого запиту.
- Web search: $10 за 1,000 пошукових запитів, плюс звичайна плата за токени всього, що пошук додає до контексту.
- Code execution: 1,550 безкоштовних годин на організацію щомісяця, потім $0.05 за годину для кожного контейнера. Функція безкоштовна, якщо використовується разом із web search або web fetch.
- Claude Managed Agents: час роботи сесії — $0.08 за годину сесії, додатково до звичайної плати за токени.
- Web fetch: без додаткової плати, лише плата за токени отриманого вмісту.
Пам’ять не зазначена в жодному з цих пунктів. Вона враховується в кількості вхідних токенів. Саме там її можна виміряти, а pruning і caching дають змогу зменшити цю кількість. Якщо ви плануєте бюджет для агента, який працює без нагляду на virtual private server (VPS), наступним кроком мають стати засоби контролю витрат для AI-агента на VPS, оскільки агент зі зростаючим файлом пам’яті без pruning щотижня коштуватиме дорожче, а жодних повідомлень про це не надходитиме.
FAQ
Чи стягується окрема плата за функції пам’яті Claude?
Ні. У прайс-листі Anthropic указано тарифи за мільйон вхідних токенів, за мільйон вихідних токенів і множники для prompt caching; окремого рядка для пам’яті немає. У Claude API інструмент пам’яті працює на стороні клієнта, тому файли зберігаються в сховищі, за яке ви вже платите. Пам’ять додає вхідні токени, які тарифікуються за звичайною ставкою моделі для вхідних даних у кожному запиті, що їх містить.
Чи стане Claude дешевшим, якщо вимкнути пам’ять?
Кількість токенів у кожному запиті зменшиться, тому знизиться вартість кожного запиту. Чи дасть це загальну економію, залежить від подальших дій. Якщо Claude має повторно прочитати три файли й поставити вам два запитання, щоб відновити дані, які вже зберігала пам’ять, ці токени коштуватимуть дорожче, ніж сама пам’ять. Не здогадуйтеся, а виміряйте: запустіть /context у сеансі з увімкненою автоматичною пам’яттю та в сеансі, запущеному з CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, а потім порівняйте загальну кількість витрачених токенів для того самого завдання.
Чому моє використання зросло, хоча я нічого не змінював?
Найпоширеніша причина — промах кешу після паузи. За замовчуванням записи кешу зберігаються 5 хвилин, а в разі розширеного налаштування — одну годину. Тому перший запит після перерви повторно обробляє весь префікс за базовою ставкою для вхідних даних і знову записує його в кеш. Друга поширена причина — редагування префікса: зміна визначення інструмента робить недійсним увесь кеш, а зміна системного prompt — кеш системних даних і повідомлень. У плані підписки розділ /usage називає цю поведінку, якщо на неї припадає 10 відсотків або більше нещодавнього використання.
Пам’ять має зберігатися в system prompt чи викликатися через інструмент?
Розміщуйте її в system prompt, якщо вона потрібна майже в кожному запиті. У такому разі вона перебуває в кешованому префіксі й тарифікується за ставкою читання кешу. Використовуйте виклик view, якщо пам’ять потрібна лише для окремих завдань. Файл, прочитаний один раз, тоді оплачується за його токени один раз, а не в кожному запиті. Вирішальним показником є кількість повторних відтворень, і об’єкт usage безпосередньо надає це число.
Чи враховуються функції пам’яті в лімітах використання підписки?
Так, опосередковано, оскільки ліміти підписки витрачаються на токени, які містить кожен запит. У довідковій документації Anthropic зазначено, що довші розмови, які запускають автоматичне керування контекстом, споживають більшу частину ліміту використання. Пам’ять трохи збільшує довжину кожного запиту, а довгий сеанс повторно передає цю довжину в кожному запиті. У розділі Як насправді працюють ліміти використання Claude пояснено, що саме скидається і коли.