SSD Nodes Learn 🎉 VPS от $4.99/мес
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-13

Почему API Claude стоит дорого: расчет стоимости токенов

Стоимость выходных токенов в пять раз выше входных, а повторная отправка всей истории диалога быстро увеличивает счет. Разберите реальный пример затрат и четыре способа экономии.

Почему Claude стоит дорого? Краткий ответ

Claude стоит дорого по четырем причинам, которые суммируются друг с другом. Стоимость выходных токенов в пять раз выше стоимости входных. API не сохраняет историю диалога, поэтому при каждом новом запросе вся история отправляется заново и оплачивается повторно. Агент превращает один вопрос в десятки вызовов API, и каждый такой вызов содержит растущий объем истории. Кроме того, цена передовой модели определяется сложностью выполняемой задачи, а не стоимостью запуска небольшой модели.

Токен — это фрагмент текста. В качестве грубого ориентира: один токен составляет около четырех символов или примерно 0.75 английского слова. Тарифы указываются за миллион токенов, сокращенно MTok (million tokens). Все приведенные ниже тарифы соответствуют официальным расценкам Claude API по состоянию на август 2026 года.

Большинство неожиданных счетов возникают из-за второй и третьей причин в этом списке. Пользователи обычно полагают, что деньги списываются за ответы, которые пишет Claude. В сессии с агентом написание текста часто составляет менее одной десятой части счета.

Опубликованные тарифы: согласование цифр

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

Смотрите на соотношение, а не на абсолютные значения. Каждая модель стоит ровно в пять раз дороже при генерации вывода, чем при обработке ввода. Opus 5 стоит 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Haiku 4.5 стоит 1 и 5. Таким образом, разница в цене между самой дешевой и самой дорогой моделью составляет пять раз, и разница между чтением и записью также составляет пять раз.

Для Sonnet 5 установлены вводные цены: 2 и 10 долларов за миллион токенов до 31 августа 2026 года. С 1 сентября 2026 года цена изменится на 3 и 15. Тарифы меняются с выходом новых версий моделей, поэтому проверяйте актуальные данные перед планированием бюджета. Бесплатного уровня ниже этой таблицы также не предусмотрено, хотя новые учетные записи получают небольшой кредит, а некоторые части API предоставляются бесплатно.

Последний столбец — это тариф на чтение из кэша. Он определяет большую часть расходов. Вернитесь к нему после расчетов.

Почему выходные токены стоят в пять раз дороже входных?

Чтение и запись требуют разного объема вычислительных ресурсов. Входные токены обрабатываются за один проход. Модель считывает весь промпт целиком, и работа выполняется параллельно, поэтому промпт на 60,000 токенов не обрабатывается в 60,000 раз дольше, чем промпт на 1,000 токенов.

Выходные токены генерируются по одному за раз. Каждый новый токен требует отдельного прохода через модель, при этом в качестве контекста используются все предыдущие токены. Запись 1,000 токенов означает 1,000 последовательных проходов. Эту последовательную работу невозможно распараллелить так же, как чтение, поэтому каждый выходной токен дольше занимает аппаратные ресурсы.

Именно поэтому требование «сделать ответ короче» влияет на стоимость меньше, чем ожидают пользователи. Оно воздействует на меньшую часть счета за использование агента.

Почему вся история переписки оплачивается при каждом запросе?

API Claude не сохраняет состояние. На стороне Anthropic нет хранилища диалогов, к которому вы просто добавляете новое сообщение. Каждый запрос содержит всю историю переписки, и модель считывает её целиком перед тем, как сгенерировать ответ. Поэтому за 30-й шаг вы платите также и за шаги с 1 по 29.

Это означает, что стоимость диалога растёт быстрее, чем его фактическая длина. На 1-м шаге оплачивается небольшой контекст. На 40-м шаге оплачивается уже большой объём данных. Если сложить все сорок шагов, вы заплатите за количество токенов, многократно превышающее объём написанного текста.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

Сессия, приведённая выше, начинается с 20,000 токенов — это системный промпт, определения инструментов и первые файлы, открытые агентом. К шагу 40 контекст содержит 100,000 токенов. Если усреднить это значение для всех сорока шагов, получится примерно 60,000 токенов, считываемых за один запрос.

Почему агент стоит значительно дороже, чем чат?

Чат — это один запрос на один вопрос. Агент — это один запрос на каждый шаг. Чтение файла — это шаг. Запуск теста — это шаг. Чтение вывода теста — это шаг. Редактирование файла — это шаг. Сорок шагов для выполнения одной задачи — обычное дело для агента, работающего с кодом.

Использование инструментов влечет за собой два дополнительных расхода. Определения инструментов являются входными токенами для каждого отдельного запроса, так как модели необходимо каждый раз сообщать, какие инструменты доступны. Anthropic публикует данные о накладных расходах: системный промпт для использования инструментов составляет 286 токенов на Opus 5 при tool_choice, установленном в auto, плюс токены ваших собственных схем инструментов. Некоторые серверные инструменты также имеют отдельную плату. Поиск в Интернете оплачивается по тарифу $10 за 1 000 поисковых запросов сверх токенов, которые потребляют результаты поиска.

Каждый результат работы инструмента также становится постоянным контекстом. Команда, которая выводит 3 000 строк, помещает эти 3 000 строк в каждый последующий запрос до конца сессии. Потребление токенов за сессию, которое отображает Claude Code делает это наглядным: следите за тем, как число входных токенов растет сразу после выполнения «шумной» команды.

Расчеты для одной реальной сессии

Ниже приведен пример одного часа работы агента на базе Opus 5. Выполнено 40 API-запросов. Объем контекста увеличивается с 20,000 до 100,000 токенов, в среднем составляя около 60,000 токенов на запрос. Модель генерирует около 700 токенов за запрос, что включает в себя как короткие вызовы инструментов, так и несколько объемных блоков кода.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

Посмотрите на распределение затрат. Стоимость чтения составила 12.00 долларов, а стоимость записи — 0.70 долларов; таким образом, объем выходных данных, которые вы непосредственно читаете, составляет около пяти процентов от общего счета. Модель записала 28,000 токенов, а оплата за чтение была начислена за 2,400,000 токенов. Никто не вводил 2.4 миллиона токенов вручную. Одни и те же 100,000 токенов считывались многократно.

Рычаг 1: кэширование промптов, самый значимый из них

Кэширование промптов сохраняет обработанную форму стабильного префикса вашего промпта. При следующем запросе этот префикс считывается из кэша, а не обрабатывается заново. Запись в кэш стоит в 1.25 раза дороже базовой стоимости входных токенов для пятиминутного кэша или в 2 раза для часового кэша. Чтение из кэша стоит 0.1 от стоимости входных токенов. Для Opus 5 это составляет 0.50 долларов за миллион токенов вместо 5 долларов.

Примените это к сессии, описанной выше. Каждый из 100,000 токенов записывается в кэш один раз по мере развития диалога. Остальные 2,300,000 входных токенов становятся операциями чтения из кэша.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

Вы отмечаете кэшируемую часть с помощью поля cache_control. Размещайте точку прерывания после контента, который не меняется между итерациями: системного промпта и определений инструментов. Длинный документ, к которому вы постоянно обращаетесь, также следует поместить в этот стабильный блок.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

Теперь порядок вашего промпта напрямую влияет на расходы. Для попадания в кэш (cache hit) требуется точное совпадение с самого начала промпта, поэтому всё, что меняется в каждом запросе, должно находиться после неизменяемых данных. Если вы поместите временную метку в начало системного промпта, вы будете нарушать кэш на каждом шаге: весь префикс станет промахом (miss), и вам придётся снова платить 1.25 от стоимости входных токенов за его повторную запись.

Ответ системы покажет, сработало ли кэширование. Отправьте запрос и изучите блок использования (usage block).

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Каждый ответ содержит объект usage, подобный этому:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

Повторный запрос, который всё ещё показывает 0 в поле cache_read_input_tokens, означает, что попадания в кэш не происходит. Частая причина — изменение чего-либо перед вашей точкой прерывания. Пятиминутный кэш также имеет срок действия, поэтому запрос, отправленный через шесть минут, будет считаться промахом с последующей новой записью.

Уровень 2: перенос простых запросов на менее мощную модель

Большинство запросов в сессии агента не являются сложными. Открытие файла, запуск форматировщика, чтение diff — для этого не нужна передовая модель. Перенаправление таких задач на Haiku 4.5 снижает стоимость входных данных с 5 долларов за миллион токенов до 1.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

Та же сессия стоит 12.70 долларов при использовании Opus 5 без кэширования, 2.48 с кэшированием, 0.99 на Sonnet 5 с кэшированием и 0.50 на Haiku 4.5 с кэшированием. Одно только кэширование сокращает счет примерно на восемьдесят процентов. Выбор модели устраняет большую часть оставшихся расходов.

Важное предостережение: если дешевая модель выдаст неверный ответ, вам придется оплачивать всю сессию заново, не говоря уже о затраченном времени. Выбирайте модель исходя из сложности задачи, а не цены. Это правило работает и в обратную сторону: Claude Fable 5 стоит дороже, чем Opus 5 — 10 и 50 долларов за миллион токенов соответственно, поэтому ознакомьтесь с тем, что вы получаете за эти тарифы, прежде чем отправлять туда запрос. В руководстве Выбор между Opus, Sonnet и Haiku подробно описаны области применения каждой модели.

Уровень 3: гигиена контекста

Каждый токен, оставленный в контексте, оплачивается на каждом последующем шаге, поэтому удаление лишних данных на раннем этапе значительно выгоднее, чем на позднем. Файл объемом 5000 токенов, добавленный на 5-м шаге 40-шаговой сессии, будет прочитан еще 35 раз. Это 175 000 дополнительных входных токенов, что при использовании Opus 5 почти равно одному доллару за одну неосторожную вставку.

Четыре привычки, которые помогут оптимизировать расходы:

  • Начинайте новую сессию для каждой новой задачи, вместо того чтобы продолжать вчерашнюю.
  • Фильтруйте «шумные» команды до того, как вывод попадет в модель, используя инструменты вроде head -50, а не после.
  • Запрашивайте только ту функцию, которая вам нужна, а не весь файл целиком.
  • Если в длинной сессии прогресс остановился, запросите краткое резюме и начните новую сессию на его основе. Резюме занимает несколько сотен токенов, в то время как полная история переписки — сотни тысяч.

Уровень 4: пакетная обработка для всех неинтерактивных задач

Batch API выполняет запросы асинхронно и снижает стоимость входных и выходных данных на 50 процентов. Если для выполнения задачи не требуется мгновенный ответ, используйте пакетную обработку. Это применимо к классификации, извлечению данных, суммаризации накопленных очередей и запуску оценочных тестов. Скидка на пакетную обработку суммируется с prompt caching. Она не применяется к интерактивным сессиям, так как в них нет ожидания завершения фоновой задачи.

Меня обманывают?

Это главный вопрос, скрывающийся за фразой «почему Claude стоит дорого», поэтому вот прямой ответ. Тарифы опубликованы, они одинаковы для всех пользователей стандартных уровней и рассчитываются за токен. Исключение составляют договорные условия, но даже там ценообразование Claude Enterprise предполагает оплату за рабочее место в дополнение к тем же тарифам за использование токенов, а не вместо них. В счете нет произвольных начислений. Тарифная сетка не может подсказать, получаете ли вы выгоду, потому что она оценивает токены, а вас интересует результат.

Поэтому оценивайте стоимость результата. Сессия, описанная выше, стоила 12.70 долларов без использования кэширования. Если в результате была выпущена функция, на которую у вас ушел бы час, это дешево. Если модель сорок раз ходила по кругу, те же 12.70 долларов не принесли ничего, и проблема была вовсе не в тарифе.

Это важно запомнить. Ваш счет растет пропорционально количеству токенов, а не ценности. Продуктивная сессия и бесполезная сессия одинаковой длины стоят одинаково. Именно поэтому четыре рычага управления важнее тарифной сетки: вы не можете договориться о цене за токен, но вы решаете, сколько токенов потребуется для выполнения задачи.

Следите за расходами на одну завершенную задачу, а не за долларами в месяц. Если этот показатель снижается по мере настройки кэширования и маршрутизации, ваша конфигурация становится эффективнее, даже если общая месячная сумма растет — ведь она растет из-за того, что выполняется больше работы.

Что не снижает ваш счет

Некоторые популярные советы почти бесполезны. Указание модели «быть лаконичной» сокращает объем вывода, а вывод составлял пять процентов от типичного счета. Сокращение собственного вопроса экономит несколько сотен токенов при контексте в 60,000 токенов. Отключение расширенного мышления помогает только в том случае, если токены мышления составляли существенную долю вывода, и блок использования сообщает об этом напрямую, избавляя вас от догадок.

Большое окно контекста само по себе не является статьей расходов. В Claude 4.6 и более поздних версиях полное окно в один миллион токенов тарифицируется по стандартной ставке за токен, поэтому запрос на 900,000 токенов стоит столько же за токен, сколько и запрос на 9,000. Размер окна не определяет цену. Ее определяет то, что вы решили поместить в это окно.

Еще два аспекта относятся скорее к планированию, чем к отдельной сессии. Если вы используете сервис ежедневно и в интерактивном режиме, сравните оплату за токен с фиксированным тарифным планом: сравнение стоимости API и подписки выполняет этот расчет. Если фиксированный план выгоднее, а вы одновременно рассматриваете предложение другого вендора, сравнение цен на планы Claude и ChatGPT проводит аналогичное сопоставление для обоих. Если агент работает на сервере без присмотра, установите жесткий лимит расходов, прежде чем приступать к какой-либо оптимизации — именно это описывает контроль затрат для AI-агента на VPS. Для общего понимания масштаба, что на самом деле можно купить на один миллион токенов Claude переводит прайс-лист в страницы текста.

FAQ

Почему мой счет за Claude вырос после начала использования агента?

Потому что агент отправляет множество запросов на один вопрос, и каждый запрос содержит всю историю переписки на текущий момент. Обычный чат отправляет один запрос на вопрос. Агент для написания кода отправляет один запрос на каждый шаг, а сорок шагов для одной задачи — это норма. Каждый из этих запросов тарифицируется по полному контексту, поэтому сессия, которая заканчивается на 100,000 токенов, может в сумме стоить более двух миллионов входных токенов. Изучите input_tokens и cache_read_input_tokens в ответе API, чтобы увидеть это напрямую.

Действительно ли кэширование промптов так сильно снижает расходы?

В приведенном примере стоимость сессии снизилась с 12.70 долларов до 2.48 долларов, так как чтение из кэша стоит одну десятую от стоимости входных токенов. Экономия полностью зависит от частоты попаданий в кэш. При пятиминутном кэше он окупается после первого же чтения, поскольку запись стоит в 1.25 раза больше входных данных, а чтение — 0.1 от них. Если ваш промпт меняется в начале при каждом запросе, вы не получаете попаданий и платите надбавку за запись впустую. Проверьте cache_read_input_tokens, прежде чем делать вывод о том, что кэширование работает.

Стоит ли мне использовать Haiku для всего?

Нет. Haiku 4.5 стоит 1 долларов за миллион входных токенов против 5 для Opus 5, поэтому экономия реальна при простых задачах с большим объемом данных, таких как классификация и маршрутизация. Неверный ответ в сложной задаче стоит дороже, чем сэкономленные на модели средства, так как вы платите за повторный запрос и за свое собственное время. Эффективная стратегия — комбинированный подход: маленькая модель для механических операций, передовая модель для задач, требующих суждения.

Дешевле ли API, чем подписка на Claude?

Это зависит от стабильности вашего использования. Подписка — это фиксированная ежемесячная плата с установленными лимитами использования. API предполагает оплату за токен без верхнего предела, что дешевле при редком использовании или работе «рывками», и дороже при интенсивном использовании каждый рабочий день. Возьмите среднее количество токенов в день из блока статистики использования, рассчитайте их стоимость по тарифу вашей модели, а затем сравните полученную сумму с ценой плана, которая для начального уровня указана в сколько стоит Claude Pro и где заканчиваются его лимиты использования. Если расчеты показывают выгоду в пользу API, отмена плана или переход на более низкий уровень не приведет к потере уже оплаченного месяца, так как доступ сохраняется до конца текущего расчетного периода.