SSD Nodes Learn 🎉 VPS от $5.50/мес
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-14

Сколько стоит использование памяти в Claude?

Функция памяти в Claude не имеет отдельной цены. Расходы зависят от объема повторно отправляемых токенов и использования кэширования промптов. Узнайте, как именно память влияет на счет.

Взимается ли дополнительная плата за функции памяти Claude?

Функции памяти Claude не имеют отдельной стоимости. Опубликованные тарифы Anthropic рассчитываются за миллион токенов входных данных и за миллион токенов выходных данных, с дополнительными ставками за кэширование промптов; ни один из этих пунктов не относится к «токенам памяти». Хранение самой памяти в Claude API (интерфейс прикладного программирования) ничего не стоит, так как инструмент памяти работает на стороне клиента, а файл находится в вашем собственном хранилище.

Память всё же влияет на ваш счет, так как запомненный факт меняет ответ только тогда, когда он находится внутри запроса, который считывает Claude. Запоминание означает повторную отправку. Этот текст поступает как входные токены и оплачивается по стандартному тарифу модели для входных данных. Итоговая сумма зависит от двух показателей: количества токенов запомненного текста, которые вы воспроизводите на каждом шаге, и возможности обработки этого текста из кэша промптов.

При использовании подписки Pro или Max вы не платите за каждый токен, поэтому память расходует ваш лимит использования, а не деньги. Механизм, описанный ниже, идентичен. Меняется только единица измерения. Этот лимит ограничен, поэтому стоит ознакомиться с тем, сколько стоит Claude Pro и при каких ограничениях он перестает работать, прежде чем решать, какой объем памяти должен содержать каждый запрос. Условия Claude Enterprise отличаются, так как в дополнение к стоимости места каждый токен тарифицируется по ценам API, поэтому чрезмерно большой блок памяти снова превращается в расходы, а не в расходование лимита. Если сокращение объема памяти позволяет комфортно уложиться в лимиты более дешевого тарифного плана, стоит рассмотреть переход с Max на Pro, при этом изменения вступят в силу в конце уже оплаченного периода. Если вы сравниваете предложения разных провайдеров, а не тарифные планы Anthropic, начните с сравнения текущих цен на планы Claude и ChatGPT.

Что означает «память» в разных интерфейсах Claude

Три различных продукта используют этот термин, и путаница между ними — основная причина, по которой этот вопрос кажется сложным.

Инструмент memory в Claude API. Вы добавляете одну запись в массив tools и реализуете файловые операции в собственном коде.

{"type": "memory_20250818", "name": "memory"}

По состоянию на август 2026 года этот инструмент является общедоступным в Messages API без заголовка beta для моделей Claude 4 и более поздних версий. Он работает на стороне клиента: Claude запрашивает операцию, например view /memories, ваш обработчик выполняет её в хранилище, которое вы контролируете, и вы возвращаете результат в блоке tool_result. Anthropic не хранит файл, поэтому плата за хранение не взимается. Вместо этого вы платите за каждый цикл обмена данными. Определение инструмента отправляется в каждом запросе, а возвращаемое содержимое файла остается в контексте диалога с этого момента.

Anthropic публикует фиксированную часть этих накладных расходов. Для Claude Opus 5 при выборе инструмента auto системный промпт использования инструментов составляет 286 токенов, согласно документации от августа 2026 года. Эта сумма оплачивается один раз за запрос при наличии любого инструмента, будь то memory или другой.

Claude Code. Два механизма загружаются в начале каждой сессии. Файлы CLAUDE.md содержат инструкции, которые вы пишете сами. Автоматическая память (auto memory) хранит заметки, которые Claude пишет для себя в ~/.claude/projects/<project>/memory/. Загружаются только первые 200 строк или 25KB файла MEMORY.md (в зависимости от того, какой лимит будет достигнут первым), а тематические файлы рядом с ним считываются по запросу, а не при запуске. Всё, что загружено при старте, становится частью префикса, который несет в себе каждый последующий запрос в этой сессии. В Как Claude Code восстанавливает память между сессиями описан порядок загрузки файлов.

Claude в веб-интерфейсе. На сайте claude.ai память представляет собой набор записей, которые Claude создает и обновляет в процессе общения, при этом для каждого проекта выделяется отдельное пространство памяти. В разделе Settings > Memory перечислены сохраненные данные, а переключатель позволяет приостановить (Pause memory) или сбросить (Reset memory) память. Этот интерфейс оплачивается по подписке, поэтому использование памяти расходует лимиты на использование.

Почему запомненный текст тарифицируется как входные токены

Messages API не сохраняет состояние. Он не хранит данные между вызовами, поэтому клиент отправляет всю историю переписки при каждом запросе, а модель каждый раз считывает её заново. Память не является исключением из этого правила. Это еще один блок текста в составе того же запроса.

Разделение отображается в объекте usage в любом ответе.

"usage": {
  "input_tokens": 412,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 18240,
  "output_tokens": 236
}

input_tokens учитывает только те токены, которые не были считаны из кэша и не использовались для его создания; на практике это означает токены, идущие после последней точки кэширования. Общий объем входных данных для запроса равен cache_read_input_tokens плюс cache_creation_input_tokens плюс input_tokens. Файл памяти, открытый Claude три шага назад, при каждом последующем запросе входит в этот общий объем. Он попадает в cache_read_input_tokens, пока действует кэшированный префикс, и в input_tokens, когда он перестает действовать. Один и тот же текст, но две разные стоимости. Входные и выходные токены имеют разную стоимость, и память всегда относится к входным данным.

Где увидеть эти показатели в вашем собственном использовании

Не берите цифры из публикаций в блогах, включая эту. Измерьте объем своей памяти самостоятельно. Подсчет токенов бесплатен и имеет собственный лимит запросов, поэтому измерение ничего не стоит.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{"role": "user", "content": "Hello, Claude"}]
  }'

Ответом будет одно число, например { "input_tokens": 14 }. Запустите его один раз, вставив текст вашей памяти в поле system, и один раз без него — разница и будет стоимостью этой памяти на каждом шаге. Учтите два предостережения. Подсчет является оценочным, а дополнительные токены, которые Anthropic добавляет для собственных системных оптимизаций, вам не тарифицируются. Также выполняйте подсчет для той модели, которую планируете использовать, поскольку Claude 4.7 и более поздние версии используют новый токенизатор, который генерирует примерно на 30 процентов больше токенов для того же текста.

В Claude Code на этот же вопрос можно ответить без использования curl.

  • /context показывает, что загружено прямо сейчас, включая файлы памяти, поэтому вы можете увидеть их долю в контекстном окне до того, как начнете вводить текст.
  • /memory выводит список ваших файлов CLAUDE.md и открывает папку автоматической памяти.
  • /usage выводит итоговые показатели сессии, включая чтение и запись в кэш.
  • Строка состояния может отображать использование контекстного окна в режиме реального времени, поэтому рост потребления виден по мере его возникновения.

Блок сессии /usage выглядит следующим образом:

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Внимательно прочитайте последнюю строку. Показатель 940.0k cache read означает, что вся переписка, включая память, повторно отправляется на каждом шаге по тарифу кэширования. Показатель 1.2k input относится только к новой части данных. Claude Code вычисляет эту сумму в долларах локально на основе прейскурантных цен, поэтому он не учитывает ваши скидки и может отличаться от счета. Авторитетным источником является страница Usage в Claude Console.

Затем выполните прямое сравнение. Задайте один и тот же начальный вопрос в двух новых сессиях: одной обычной и одной с отключенной функцией автоматической памяти.

CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claude

Выполните /context в каждой из них и сравните запись о файлах памяти. Разница — это стоимость вашей накопленной памяти в начале каждой сессии, еще до начала какой-либо работы. Полный разбор того, на что расходуются токены в Claude Code стоит прочитать параллельно с этими двумя показателями.

Сколько стоит повторное использование памяти на миллион токенов?

Кэширование промптов — причина, по которой один и тот же блок памяти может стоить в десять раз дороже на одном этапе диалога, чем на другом. Anthropic публикует коэффициенты кэширования как множители базовой стоимости входных данных для каждой модели, поэтому соотношение сохраняется даже при изменении долларовых цен.

ChartAnthropic's published prompt caching rates, as a multiple of base input price
The data behind this chart
[
  {
    "label": "Base input",
    "price_multiple": 1
  },
  {
    "label": "5 minute cache write",
    "price_multiple": 1.25
  },
  {
    "label": "1 hour cache write",
    "price_multiple": 2
  },
  {
    "label": "Cache read",
    "price_multiple": 0.1
  }
]

Чтение из кэша стоит 0.1 от базовой цены за входные данные. Запись записи с временем жизни 5 минут стоит 1.25 от базовой цены, а с временем жизни 1 час — 2 от базовой. Anthropic прямо указывает точку окупаемости: кэширование становится выгодным после одного чтения из кэша при 5-минутном сроке хранения или после двух чтений при 1-часовом сроке. Точка окупаемости кэширования промптов — это расчет, который нужно выполнить перед тем, как решать, где размещать память.

Эти множители превращают повторное использование в арифметическую задачу. Следующий блок основан на арифметике опубликованных выше множителей, а не на измерениях реальной рабочей нагрузки. Он оценивает блок памяти тремя способами для сессии из 100 этапов, выражая стоимость в эквивалентном количестве токенов по обычному базовому тарифу за входные данные.

ChartA memory block over 100 turns, expressed as base-rate input tokens
The data behind this chart
[
  {
    "label": "4,000 tokens, never cached",
    "base_rate_equivalent_tokens": "400,000"
  },
  {
    "label": "4,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "44,600"
  },
  {
    "label": "1,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "11,150"
  }
]

Блок памяти объемом 4,000 токенов, который не попадает в кэш на всех 100 этапах, тарифицируется как 400,000 токенов по базовому тарифу. Тот же блок при одной записи в 5-минутный кэш и 99 чтениях из него тарифицируется как 44,600. Сократите его размер до четверти и сохраните кэширование — он будет стоить как 11,150. Функциональность не менялась на протяжении этих 3 строк. Изменилось только поведение при повторном использовании. Это все еще количество токенов, а не деньги, и преобразование количества токенов в сумму в ежемесячном счете — это одно умножение на тариф вашей модели за миллион токенов. Этот тариф определяется используемой моделью, поэтому, если агент будет работать на Claude Fable 5, начните с опубликованных тарифов за миллион токенов и задач, для которых она подходит.

Вторая строка предполагает, что каждый из 99 последующих запросов поступает, пока запись в кэше еще активна. Именно на этом допущении основывается большинство ошибок в реальных счетах.

Почему один и тот же вопрос стоит дороже после перерыва?

У записи в кэше есть время жизни, отсчет которого начинается с момента запроса, записывающего или считывающего её. По умолчанию оно составляет 5 минут. Опция на 1 час требует двойной записи, как показано выше. В Claude Code время жизни составляет один час при наличии подписки, но сокращается до пяти минут, как только вы начинаете расходовать кредиты использования; при использовании API key или облачного провайдера по умолчанию установлено пять минут. Настройка ENABLE_PROMPT_CACHING_1H=1 позволяет сохранить время жизни в один час при работе с кредитами использования.

Таким образом, короткий вопрос, введенный в сессию, которую вы оставили открытой на время обеда, обходится дорого, так как срок действия записи в кэше истек, пока вас не было. Весь префикс, включая память, обрабатывается заново по базовой ставке ввода и снова записывается в кэш. Длительность паузы и определяет эту цену.

Вы можете проверить это, а не просто полагаться на слова. В планах Pro, Max, Team или Enterprise детализация /usage отмечает любое поведение, ответственное за 10 процентов или более недавнего использования, и там по названию отображаются как длинный контекст, так и промахи кэша. При работе с API наблюдайте, как cache_creation_input_tokens снова возрастает до полного размера вашего префикса при первом запросе после периода бездействия.

Что незаметно делает кэш недействительным

Кэшируемый префикс упорядочен: сначала инструменты, затем системные инструкции, затем сообщения. Изменение на одном уровне делает недействительным этот уровень и всё, что следует за ним. Редактирование определения инструмента отбрасывает весь кэш целиком. Редактирование системного промпта отбрасывает кэш системных инструкций и сообщений.

Это ловушка для тех, кто хранит память в системном промпте и переписывает её по мере обучения агента. Каждая перезапись отбрасывает кэшированную копию всего, что находится после неё, поэтому следующий запрос снова требует полной записи. Держите стабильные данные в начале и не меняйте их, а изменчивые данные размещайте в конце списка сообщений, где их инвалидация обходится дешево.

Существует вторая, менее очевидная проблема. У каждой модели есть минимальный кэшируемый префикс: 512 токенов для Claude Opus 5, 1024 для Claude Sonnet 5, 4096 для Claude Haiku 4.5, согласно данным на август 2026 года. Документация Anthropic прямо указывает, что происходит при меньшем объёме: «Любые запросы на кэширование меньшего количества токенов будут обрабатываться без кэширования, при этом ошибка не возвращается». Таким образом, небольшой файл памяти, помеченный cache_control, не делает абсолютно ничего, работая без уведомлений. Симптомом этого является то, что cache_creation_input_tokens остаётся на значении 0, хотя ваш промпт явно содержит точку прерывания.

Очистка памяти, которая больше не приносит пользы

Каждая строка памяти расходует токены на каждом этапе взаимодействия, поэтому для каждой строки важно определить, влияла ли она на ответ в последнее время. Claude Code делает ограничения конкретными. Старайтесь поддерживать размер CLAUDE.md в пределах 200 строк, так как более длинные файлы потребляют больше контекста и снижают надежность следования инструкциям со стороны Claude. MEMORY.md ограничивается первыми 200 строками или 25KB при загрузке, и всё, что превышает этот лимит, отбрасывается при начале следующего сеанса, поэтому избыточный индекс лишь расходует токены, не принося пользы.

Две привычки помогут сохранить компактность. Переносите детали из индекса в тематические файлы, которые Claude читает по запросу, а не при запуске. Переносите инструкции по рабочим процессам из CLAUDE.md в навыки (skills), которые загружаются только при вызове. Для файлов памяти, которые уже начинаются с метаданных (frontmatter), Claude Code записывает время записи в поле modified в формате ISO 8601 (начиная с версии 2.1.214 и выше), и эта метка времени — самый быстрый способ обнаружить устаревшие данные. В Очистка устаревшей памяти агента процесс проверки описан более подробно.

Когда извлечение данных эффективнее загрузки всего в контекст

Инструмент memory предназначен для поддержки извлечения данных по требованию. Вместо того чтобы загружать всё сразу, агент записывает полученную информацию и считывает файл только тогда, когда это необходимо для задачи. Это меняет расчеты: чтение файла оплачивается токенами один раз, после чего данные остаются в кэшированном префиксе, тогда как постоянно загруженный блок расходует токены на каждом шаге.

Из двух приведенных выше графиков следует простое правило. Текст, который используется почти на каждом шаге, должен находиться в стабильном кэшированном префиксе. Текст, который используется один раз из двадцати, должен вызываться через view. Точка окупаемости зависит от количества повторных обращений, а не от тарифов Anthropic.

В API вы также можете позволить платформе сокращать историю диалога. Редактирование контекста очищает результаты старых инструментов, как только диалог превышает установленный вами порог.

{
  "edits": [
    {
      "type": "clear_tool_uses_20250919",
      "trigger": {"type": "input_tokens", "value": 30000},
      "keep": {"type": "tool_uses", "value": 3},
      "clear_at_least": {"type": "input_tokens", "value": 5000}
    }
  ]
}

По умолчанию установлено ограничение в 100,000 входных токенов и сохранение результатов 3 вызовов инструментов. Ознакомьтесь с принципами работы кэширования перед его включением: очистка содержимого делает недействительным кэшированный префикс в точке очистки, поэтому при следующем запросе вы оплатите запись в кэш. Именно для этого предназначен clear_at_least. Он откладывает очистку до тех пор, пока экономия не станет достаточно значительной, чтобы оправдать затраты на запись. Ответ содержит точный отчет о произошедшем в поле context_management, с использованием cleared_tool_uses и cleared_input_tokens, поэтому выгоду можно измерить, а не просто предполагать. Управление контекстным окном в Claude Code применяет тот же подход к сеансу программирования.

Что тарифицируется отдельно

Память не имеет собственной стоимости, однако некоторые функции оплачиваются отдельно, и важно понимать, какие именно. Ниже приведены опубликованные тарифы Claude API по состоянию на август 2026 года. Некоторые операции бесплатны, но в Claude API отсутствует бесплатный уровень доступа, предоставляется лишь небольшой кредит при регистрации, поэтому все указанные ниже операции оплачиваются с момента первого запроса.

  • Поиск в интернете: $10 за 1 000 поисковых запросов плюс обычная стоимость токенов за весь объем данных, добавленных поиском в контекст.
  • Выполнение кода: 1 550 бесплатных часов на организацию в месяц, далее $0.05 в час за контейнер. Использование бесплатно при работе совместно с поиском в интернете или получением данных с веб-страниц.
  • Claude Managed Agents: время работы сессии оплачивается по тарифу $0.08 за сессионный час сверх обычной стоимости токенов.
  • Получение данных с веб-страниц (Web fetch): дополнительная плата отсутствует, оплачивается только стоимость токенов полученного контента.

Память не упоминается ни в одном из этих пунктов. Она учитывается в общем количестве входных токенов, где её можно отследить и где методы очистки (pruning) и кэширования позволяют снизить расходы. Если вы планируете работу агента, который функционирует без присмотра на виртуальном выделенном сервере (VPS), настройка контроля расходов для AI-агента на VPS — это следующий необходимый шаг, так как агент с постоянно растущим файлом памяти без механизмов очистки будет обходиться всё дороже с каждой неделей, при этом уведомления о росте затрат могут отсутствовать.

FAQ

Взимается ли отдельная плата за функции памяти Claude?

Нет. В прайс-листе Anthropic указаны тарифы за миллион входных токенов, миллион выходных токенов и коэффициенты кэширования промптов; отдельной строки для памяти нет. В Claude API инструмент памяти работает на стороне клиента, поэтому файлы хранятся в вашем хранилище, за которое вы уже платите. Память добавляет входные токены, которые тарифицируются по стандартной ставке модели для входных данных при каждом обращении, содержащем эти токены.

Становится ли Claude дешевле, если отключить память?

Это уменьшает количество токенов в каждом запросе, что снижает стоимость каждого отдельного запроса. Будет ли это экономить средства в целом, зависит от дальнейших действий. Если Claude приходится повторно считывать три файла и задавать вам два вопроса, чтобы восстановить данные, которые уже содержались в памяти, эти токены обойдутся дороже, чем использование памяти. Не гадайте, а измеряйте: выполните /context в сессии с включенной автоматической памятью и в сессии, запущенной с CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, а затем сравните общее количество токенов, затраченных на одну и ту же задачу.

Почему мое потребление выросло, хотя я ничего не менял?

Самая частая причина — промах кэша (cache miss) после паузы. Записи в кэше живут по умолчанию 5 минут или один час при расширенных настройках, поэтому первый запрос после перерыва повторно обрабатывает весь ваш префикс по базовой ставке входных токенов и записывает его снова. Вторая частая причина — редактирование префикса: изменение определения инструмента делает весь кэш недействительным, а изменение системного промпта делает недействительными кэши системы и сообщений. В рамках подписки в детализации /usage указывается это поведение, если оно составляет 10 процентов или более от недавнего использования.

Где должна находиться память: в системном промпте или за вызовом инструмента?

Помещайте данные в системный промпт, если они используются почти в каждом обращении, так как они будут находиться в кэшированном префиксе и оплачиваться по ставке чтения из кэша. Помещайте их за вызовом view, если они нужны только для некоторых задач, так как файл, прочитанный один раз, оплачивается своими токенами один раз, а не при каждом обращении. Решающим числом является количество повторов (replay count), и объект usage предоставляет это число напрямую.

Учитываются ли функции памяти в лимитах использования по подписке?

Да, косвенно, так как лимиты подписки расходуются токенами, которые содержит каждый запрос. В справочной документации Anthropic указано, что длинные диалоги, запускающие автоматическое управление контекстом, потребляют больше вашего лимита использования. Память делает каждый запрос немного длиннее, а в рамках длинной сессии эта длина воспроизводится при каждом обращении. Как на самом деле работают лимиты использования Claude описывает, что и когда сбрасывается.