Чи потрібно доплачувати за пам’ять Claude?
Anthropic не публікує окрему ціну токенів пам’яті: збережений текст повторно надсилається як вхідні токени, а витрати залежать від кешування.
Чи коштують функції пам’яті Claude додатково?
Функції пам’яті Claude не мають окремої вартості. Опубліковані тарифи Anthropic розраховуються за мільйон вхідних токенів і за мільйон вихідних токенів. Для prompt caching діють додаткові тарифи. Жоден із них не називається токеном пам’яті. Зберігання самої пам’яті в Claude API (application programming interface) нічого не коштує, оскільки memory tool працює на стороні клієнта, а файл зберігається в сховищі, яким ви керуєте.
Пам’ять усе одно впливає на рахунок, оскільки збережений факт змінює відповідь лише тоді, коли він міститься в запиті, який читає Claude. Використання пам’яті означає повторне надсилання. Цей текст надходить як вхідні токени, і за нього стягується плата за звичайним тарифом моделі для вхідних даних. Розмір витрат визначають два показники: скільки токенів збереженого тексту ви повторно передаєте в кожному запиті та чи можна обробити цей повторно переданий текст через prompt cache.
За підписки Pro або Max плата за токени взагалі не стягується, тому пам’ять витрачає ваш доступний ліміт використання, а не кошти. Механізм нижче такий самий. Змінюється лише одиниця обліку. Цей ліміт є обмеженим, тому перед тим, як вирішити, який обсяг пам’яті передавати в кожному запиті, варто дізнатися скільки коштує Claude Pro і на якому етапі його ліміти вас обмежують. Claude Enterprise працює інакше, оскільки обліковує кожен токен за тарифами API додатково до вартості місця, тому надмірно великий блок пам’яті знову перетворюється на грошові витрати, а не на використання ліміту. Якщо скорочення пам’яті дає змогу впевнено залишатися в межах ліміту меншого плану, наступним кроком варто розглянути перехід з Max на Pro, а зміна набуде чинності наприкінці вже оплаченого періоду. Якщо ви насправді порівнюєте плани різних постачальників, а не рівні підписок Anthropic, почніть із матеріалу де тарифи Claude за поточними цінами зіставлено з ChatGPT.
Що означає «пам’ять» у кожному інтерфейсі Claude
Це слово використовують для трьох окремих продуктів. Саме через їх змішування це питання здається заплутаним.
Інструмент memory в Claude API. Ви додаєте один запис до масиву tools і реалізуєте файлові операції у власному коді.
{"type": "memory_20250818", "name": "memory"}Станом на August 2026 цей інструмент загальнодоступний у Messages API без beta-заголовка для моделей Claude 4 і новіших. Він працює на стороні клієнта: Claude запитує операцію, наприклад view /memories, ваш обробник виконує її зі сховищем під вашим контролем, а ви повертаєте результат у блоці tool_result. Anthropic не зберігає файл, тому вам не потрібно оплачувати витрати на сховище. Ви платите за обмін запитами й відповідями. Визначення інструмента надсилається в кожному запиті, а вміст файлу у відповіді від цього моменту залишається в контексті розмови.
Anthropic публікує фіксовану частину цих накладних витрат. Для Claude Opus 5 із вибором інструмента auto системний prompt для використання інструментів становить 286 токенів, згідно з документацією за August 2026. Ця кількість оплачується один раз за запит, якщо в ньому присутній будь-який інструмент, незалежно від того, memory це чи інший інструмент.
Claude Code. На початку кожної сесії завантажуються два механізми. Файли CLAUDE.md містять написані вами інструкції. Auto memory містить нотатки, які Claude створює для себе, у ~/.claude/projects/<project>/memory/. Завантажуються лише перші 200 рядків або 25KB із MEMORY.md — залежно від того, який ліміт настане раніше. Файли тем поруч із ним читаються за потреби, а не під час запуску. Усе, що завантажується під час запуску, стає частиною префікса, який передається в кожному наступному запиті цієї сесії. У розділі Як Claude Code відновлює пам’ять між сесіями описано порядок завантаження кожного файлу.
Claude у вебінтерфейсі. На claude.ai memory — це набір записів, які Claude створює та оновлює під час спілкування. Для кожного проєкту використовується окремий простір memory. У розділі Settings > Memory відображається збережена інформація, а перемикач у цьому розділі дає змогу вибрати Pause memory або Reset memory. У цьому інтерфейсі оплата здійснюється за підпискою, тому memory використовує доступні ліміти.
Чому збережений текст тарифікується як вхідні токени
Messages API не зберігає стан. Він нічого не зберігає між викликами, тому клієнт надсилає всю розмову під час кожного запиту, а модель щоразу читає її повторно. Пам’ять не є винятком із цього правила. Це ще один блок тексту в тому самому запиті.
Розподіл видно в об’єкті usage у будь-якій відповіді.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens враховує лише токени, які не було прочитано з кешу і не використано для його створення. На практиці це означає токени після останньої точки кешування. Загальна кількість вхідних токенів для запиту дорівнює cache_read_input_tokens плюс cache_creation_input_tokens плюс input_tokens. Файл пам’яті, який Claude відкрив три ходи тому, входить до цього підсумку під час кожного наступного ходу. Він враховується в cache_read_input_tokens, доки префікс залишається в кеші, і в input_tokens, коли це не так. Той самий текст має дві дуже різні ціни. Вхідні та вихідні токени мають різні ціни, а пам’ять завжди належить лише до вхідної частини.
Де побачити ці числа у власному використанні
Не беріть показник із допису в блозі, зокрема й із цього. Виміряйте власний блок пам’яті. Підрахунок токенів безкоштовний і має окремий ліміт швидкості, тому вимірювання нічого не коштує.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'Результат — одне число, наприклад { "input_tokens": 14 }. Виконайте команду один раз, вставивши текст пам’яті в поле system, і один раз без нього. Різниця показує, скільки ця пам’ять коштує вам під час кожного запиту. Врахуйте два моменти. Підрахунок є приблизним, а додаткові токени, які Anthropic додає для власних оптимізацій системи, не виставляються вам у рахунок. Також виконуйте підрахунок для моделі, яку фактично використовуватимете, оскільки Claude 4.7 і новіші версії використовують новішу токенізацію, що створює приблизно на 30 відсотків більше токенів для того самого тексту.
У Claude Code на це саме запитання можна отримати відповідь без curl.
/contextпоказує, що завантажено зараз, включно з файлами пам’яті, тому ви можете побачити їхню частку контекстного вікна ще до введення тексту./memoryперелічує ваші файлиCLAUDE.mdі відкриває папку автоматичної пам’яті./usageвиводить підсумки сеансу, зокрема читання та запис кешу.- Рядок стану може безперервно показувати використання контекстного вікна, тому його зростання видно в реальному часі.
Блок сеансу /usage має такий вигляд:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Уважно прочитайте останній рядок. Показник читання кешу 940.0k — це весь діалог разом із пам’яттю, який повторно надсилається під час кожного запиту за тарифом кешу. Показник вхідних даних 1.2k — це лише нова частина. Claude Code локально обчислює цю суму в доларах за роздрібними цінами, тому не враховує надану вам знижку й може відрізнятися від рахунка. Авторитетним показником є сторінка Usage у Claude Console.
Потім виконайте порівняння безпосередньо. Поставте те саме початкове запитання у двох нових сеансах: в одному зі звичайними параметрами, а в іншому з вимкненою автоматичною пам’яттю.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeВиконайте /context у кожному сеансі та порівняйте запис про файли пам’яті. Різниця показує, скільки накопичена пам’ять коштує вам на початку кожного сеансу, ще до виконання будь-якої роботи. Повний розбір використання токенів у Claude Code варто прочитати разом із цими двома числами.
Скільки коштує повторне передавання пам’яті на мільйон токенів?
Кешування промптів пояснює, чому той самий блок пам’яті в одному запиті може коштувати вдесятеро дорожче, ніж в іншому. Anthropic публікує тарифи кешу як кратні базовій ціні вхідних даних кожної моделі, тому це співвідношення зберігається навіть у разі зміни цін у доларах.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Читання з кешу коштує 0.1 базової ціни вхідних даних. Запис елемента зі строком дії 5 хвилин коштує 1.25 базової ціни, а зі строком дії 1 година — 2 базової ціни. Anthropic чітко визначає точку беззбитковості: кешування окупається після одного читання кешу для строку 5 хвилин або після двох читань кешу для строку 1 година. Точка беззбитковості для кешування промптів — це розрахунок, який слід виконати перед вибором місця для пам’яті.
Ці коефіцієнти дають змогу розрахувати кількість повторних передавань. Наступний блок містить арифметичний розрахунок на основі наведених вище опублікованих коефіцієнтів, а не вимірювання реального робочого навантаження. У ньому вартість блока пам’яті розраховано трьома способами для сеансу зі 100 запитами та виражено як еквівалентну кількість токенів, тарифікованих за звичайною базовою ціною вхідних даних.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]Блок пам’яті на 4,000 токенів, який не потрапляє до кешу в усіх 100 запитах, тарифікується як 400,000 токенів за базовим тарифом. Такий самий блок з одним записом у кеш із 5-хвилинним строком дії та 99 читаннями з кешу тарифікується як 44,600 токенів. Якщо зменшити його до чверті початкового розміру та зберегти кешування, він тарифікується як 11,150 токенів. Функція не змінювалася в цих 3 рядках. Змінювалася лише поведінка під час повторного передавання. Це все ще кількість токенів, а не сума в грошах. Перетворення кількості токенів на суму у вашому щомісячному рахунку — це множення на тариф вашої моделі за мільйон токенів. Цей тариф визначається моделлю, яку ви використовуєте. Тому якщо агент працюватиме на Claude Fable 5, почніть із опублікованих тарифів за мільйон токенів і типів роботи, для яких вона підходить. Якщо постачальник ще не визначений і вибір залежить не лише від моделі, у матеріалі Вартість тих самих завдань через API Claude і ChatGPT показано, як цей множник дає різні результати. Для агента з великим обсягом пам’яті особливо важлива вартість вхідних даних.
Другий рядок передбачає, що кожен із наступних 99 запитів надходить, поки запис у кеші ще дійсний. Саме це припущення найчастіше призводить до помилок у реальних рахунках.
Чому те саме запитання коштує дорожче після перерви?
Запис кешу має певний час життя, а відлік починається із запиту, який записує або читає цей запис. Значення за замовчуванням — 5 хвилин. Варіант на 1 годину коштує 2x від вартості запису, наведеної вище. У Claude Code час життя становить одну годину для subscription і скорочується до 5 хвилин, коли використовуються usage credits; для API key або cloud provider за замовчуванням використовується 5 хвилин. Параметр ENABLE_PROMPT_CACHING_1H=1 зберігає час життя в одну годину під час використання usage credits.
Тому однорядкове запитання, введене в сесію, яку ви залишили відкритою до обіду, коштує дорого: за час вашої відсутності запис кешу протермінувався. Увесь prefix, включно з memory, обробляється повторно за базовою ставкою для input і знову записується в кеш. Ціну визначає тривалість перерви.
Це можна перевірити, а не просто припускати. У планах Pro, Max, Team або Enterprise розділ /usage позначає будь-яку поведінку, яка відповідає за 10 відсотків або більше недавнього використання; там окремо названо і довгий context, і cache misses. В API стежте, як cache_creation_input_tokens після періоду бездіяльності знову збільшується до повного розміру вашого prefix під час першого запиту.
Що непомітно робить кеш недійсним
Кешований префікс має визначений порядок: інструменти, потім system, потім повідомлення. Зміна на одному рівні робить недійсним кеш цього рівня та всіх наступних рівнів. Редагування визначення інструмента видаляє весь кеш. Редагування system prompt видаляє кеш system і повідомлень.
Це проблема для тих, хто зберігає пам’ять у system prompt і переписує її в міру навчання агента. Кожне переписування видаляє кешовану копію всього, що розташовано після нього, тому наступний запит знову повністю оплачує запис. Розміщуйте стабільний матеріал на початку та не змінюйте його. Мінливий матеріал розміщуйте ближче до кінця списку повідомлень, де його інвалідація коштує дешевше.
Є ще одна, менш очевидна проблема. Кожна модель має мінімальний кешований префікс: 512 токенів у Claude Opus 5, 1,024 у Claude Sonnet 5 і 4,096 у Claude Haiku 4.5, згідно з даними, опублікованими в August 2026. У документації Anthropic прямо зазначено, що відбувається, якщо префікс коротший: "Any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned." Тому невеликий файл пам’яті, позначений cache_control, взагалі нічого не робить — і це відбувається непомітно. Ознака, яку можна побачити, — cache_creation_input_tokens залишається на рівні 0, хоча у вашому prompt явно є точка кешування.
Звільняйте пам’ять, яка більше не виправдовує своє місце
Кожен рядок пам’яті витрачає токени в кожному запиті, який її містить. Тому для кожного рядка потрібно перевіряти, чи змінив він нещодавно якусь відповідь. Claude Code встановлює конкретні обмеження. Намагайтеся, щоб файл CLAUDE.md містив менше ніж 200 рядків, оскільки довші файли споживають більше контексту та знижують надійність дотримання Claude цих інструкцій. Під час завантаження MEMORY.md обмежується першими 200 рядками або 25KB. Усе після цього обмеження відкидається під час наступного запуску сеансу. Тому надмірно великий індекс витрачає токени, але не додає корисної інформації.
Два підходи допомагають зберігати файл компактним. Переносьте докладну інформацію з індексу до тематичних файлів. Claude читає їх за потреби, а не під час запуску. Переносьте інструкції щодо робочих процесів із CLAUDE.md до skills. Вони завантажуються лише після виклику. Для файлів пам’яті, які вже починаються з frontmatter, Claude Code записує час створення або оновлення у поле modified як мітку часу ISO 8601 у версії 2.1.214 або новішій. Ця мітка часу є найшвидшим способом виявити факт, який застарів. Докладніше про процес перевірки описано в розділі Очищення застарілої пам’яті агента.
Коли пошук випереджає завантаження всього в контекст
Інструмент пам’яті призначений для отримання даних саме в потрібний момент. Замість попереднього завантаження всього агент записує отримані відомості, а потім читає файл лише тоді, коли цього потребує завдання. Це змінює розрахунок: читання файлу одноразово витрачає його токени, після чого вони залишаються в кешованому префіксі, тоді як постійно завантажений блок витрачається на кожному ході.
Із двох наведених вище графіків випливає просте правило. Текст, який використовується майже на кожному ході, має належати до стабільного кешованого префікса. Текст, який використовується один раз із двадцяти, слід розмістити за викликом view. Точка беззбитковості залежить від кількості повторних відтворень, а не від будь-яких тарифів Anthropic.
В API також можна дозволити платформі скорочувати розмову. Редагування контексту видаляє старі результати інструментів, коли розмова перетинає заданий вами поріг.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}Типові значення — поріг у 100,000 вхідних токенів і 3 збережені використання інструментів. Перед увімкненням прочитайте опис взаємодії з кешуванням: очищення вмісту робить кешований префікс недійсним у точці очищення, тому наступний запит спричиняє оплату запису в кеш. Для цього призначено clear_at_least. Він відкладає очищення, доки економія не стане достатньою, щоб виправдати цей запис. Відповідь точно повідомляє, що сталося під час виконання context_management, разом із cleared_tool_uses і cleared_input_tokens, тому компроміс можна виміряти, а не лише теоретично оцінити. Керування вікном контексту в Claude Code застосовує ту саму ідею до сеансу програмування.
Що має окремий рядок тарифікації
Пам’ять не тарифікується окремо, але деякі функції справді мають окрему плату, і варто знати, які саме. Нижче наведено опубліковані тарифи Claude API станом на August 2026. Деякі операції взагалі нічого не коштують, але у Claude API немає безкоштовного рівня, лише невеликий кредит під час реєстрації, тому всі наведені нижче операції створюють реальні витрати вже з першого запиту.
- Web search: $10 за 1,000 пошукових запитів плюс звичайна плата за токени всього, що пошук додає до контексту.
- Code execution: 1,550 безкоштовних годин на організацію щомісяця, потім $0.05 за годину для кожного контейнера. Використання разом із web search або web fetch безкоштовне.
- Claude Managed Agents: час роботи сесії — $0.08 за сесію-годину на додаток до звичайної плати за токени.
- Web fetch: додаткової плати немає, оплачується лише кількість токенів отриманого вмісту.
Пам’ять не зазначена в жодному з цих рядків. Вона входить до кількості вхідних токенів. Саме там її можна виміряти, а pruning і caching можуть зменшити ці витрати. Якщо ви плануєте бюджет для агента, який працює без нагляду на virtual private server (VPS), наступним кроком мають стати засоби контролю витрат AI-агента на VPS, оскільки агент зі зростаючим файлом пам’яті та без pruning щотижня стає дорожчим, а жоден компонент не повідомляє про це.
FAQ
Чи стягується окрема плата за функції пам’яті Claude?
Ні. У тарифах Anthropic указано ставки за мільйон вхідних токенів, за мільйон вихідних токенів і множники кешування prompt, але окремої позиції для пам’яті немає. У Claude API інструмент пам’яті працює на стороні клієнта, тому файли зберігаються у сховищі, за яке ви вже платите. Пам’ять додає вхідні токени, які тарифікуються за звичайною ставкою моделі для вхідних даних у кожному запиті, що їх містить.
Чи стане Claude дешевшим, якщо вимкнути пам’ять?
Це зменшує кількість токенів у кожному запиті, а отже, і вартість кожного запиту. Чи дасть це економію загалом, залежить від подальших дій. Якщо Claude доведеться повторно прочитати три файли та поставити вам два запитання, щоб відновити дані, які вже зберігалися в пам’яті, ці токени коштуватимуть дорожче, ніж сама пам’ять. Не здогадуйтеся, а виміряйте: запустіть /context у сеансі з увімкненою автоматичною пам’яттю та в сеансі, запущеному з CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, а потім порівняйте загальну кількість витрачених токенів для того самого завдання.
Чому моє використання зросло, хоча я нічого не змінював?
Найпоширеніша причина — промах кешу після паузи. За замовчуванням записи кешу зберігаються 5 хвилин, а в разі розширеного налаштування — одну годину. Тому перший запит після перерви повторно обробляє весь префікс за базовою ставкою для вхідних даних і знову записує його. Друга поширена причина — редагування префікса: зміна визначення інструмента робить увесь кеш недійсним, а зміна системного prompt робить недійсними кеш системи та повідомлень. У плані підписки розділ /usage називає цю поведінку, якщо на неї припадає 10 відсотків або більше недавнього використання.
Пам’ять має зберігатися в системному prompt чи викликатися через інструмент?
Розміщуйте її в системному prompt, якщо вона потрібна майже в кожному запиті, оскільки тоді вона перебуває в кешованому префіксі й оплачується за ставкою читання кешу. Розміщуйте її за викликом view, якщо вона потрібна лише для окремих завдань, оскільки файл, прочитаний один раз, оплачується за свої токени один раз, а не в кожному запиті. Визначальним показником є кількість повторних відтворень, і об’єкт usage безпосередньо надає це число.
Чи враховуються функції пам’яті в лімітах використання підписки?
Так, опосередковано, оскільки ліміти підписки витрачаються на токени, які містить кожен запит. У довідковій документації Anthropic зазначено, що довші розмови, які запускають автоматичне керування контекстом, використовують більшу частину ліміту. Пам’ять трохи збільшує розмір кожного запиту, а тривалий сеанс повторно передає цей обсяг у кожному запиті. У статті Як насправді працюють ліміти використання Claude описано, що саме і коли скидається.