SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-27

Какую модель Claude выбрать: сравнение цен и API

Сравнение стоимости Claude Opus 4.8, Sonnet 5 и Haiku 4.5 на июль 2026 года. Узнайте актуальные тарифы за миллион токенов и расчет затрат на 100 000 API запросов.

Какую модель Claude выбрать?

Короткий ответ на вопрос о том, какую модель Claude использовать: начните с Claude Opus 4.8 и переходите на другие только при наличии обоснованной причины. Рекомендация Anthropic аналогична: «Если вы не уверены, какую модель выбрать, начните с Claude Opus 4.8 для сложных агентских задач по программированию и корпоративной работы». Переходите на Claude Sonnet 5, если задача четко определена и вы выполняете её многократно в течение дня. Переходите на Claude Haiku 4.5 для механической высоконагруженной работы, где вы заранее знаете, как выглядит правильный ответ. Claude Fable 5 стоит выше всех остальных и предназначен для долгоживущих агентов.

Выбор имеет свою цену. Ниже приведены тарифы Claude API (application programming interface) по состоянию на 23 июля 2026 года за миллион токенов, которые в документации обозначаются как MTok.

  • Claude Fable 5 (claude-fable-5): $10 / MTok на входе, $50 / MTok на выходе. Контекст 1M.
  • Claude Opus 4.8 (claude-opus-4-8): $5 на входе, $25 на выходе. Контекст 1M.
  • Claude Opus 4.7 (claude-opus-4-7): $5 на входе, $25 на выходе. Контекст 1M.
  • Claude Sonnet 5 (claude-sonnet-5): $2 на входе, $10 на выходе по вводным тарифам до 31 августа 2026 года. Стандартные тарифы $3 на входе, $15 на выходе вступают в силу 1 сентября 2026 года. Контекст 1M.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 на входе, $5 на выходе. Контекст 200K.

Эти идентификаторы являются полными в том виде, в котором они написаны. К ним ничего не добавляется.

Для моделей с окном в 1M токенов сам размер запроса не увеличивает стоимость: «Запрос на 900k токенов тарифицируется по той же ставке за токен, что и запрос на 9k токенов». Эти ставки применимы не только к API: Claude Enterprise учитывает использование по тарифам API сверх стоимости места, поэтому ниже приведён тот же расчёт для команды на тарифе с оплатой мест. Подписка с фиксированной оплатой меняет способ учёта, но не это решение, поскольку обе версии Claude Max используют одни и те же модели и различаются только объёмом доступного использования. На следующем уровне этой линейки Claude Pro за $20 в месяц предоставляет лимит использования, а не тариф за токен, поэтому вас ограничивает сброс лимита, а не счёт. Если сейчас вы пользуетесь именно этим тарифом, сначала определите, какого сброса лимита вы ожидаете, и только потом переходите к приведённым ниже расчётам: решение заключается в выборе меньшей модели, уменьшении контекста или переходе на API, а не в поиске более низкой ставки. Если вы ещё не начали платить, сначала определите, оправдывает ли Claude Pro стоимость $20, исходя из того, как часто бесплатный лимит останавливает вашу работу, а не из приведённых выше ставок.

Назначение каждой модели

Anthropic описывает линейку моделей одной строкой для каждой, и эти описания помогают лучше, чем любые рейтинги.

  • Claude Fable 5: «Интеллект следующего поколения для долгоживущих агентов». Самая медленная из четырех моделей по задержке отклика.
  • Claude Opus 4.8: «Для сложного агентного программирования и корпоративных задач». Средняя задержка.
  • Claude Sonnet 5: «Лучшее сочетание скорости и интеллекта». Быстрая модель.
  • Claude Haiku 4.5: «Самая быстрая модель с интеллектом, близким к передовому».

Fable 5 — единственная из четырех моделей, для которой в данном сравнении не приводится стоимость рабочей нагрузки. Учитывая цену в 5 раз выше, чем у Opus 4.8, вопрос о том, какие задачи окупают 10 долларов на входе и 50 на выходе, заслуживает отдельного рассмотрения.

Haiku 4.5 также имеет ограничения, которые определяют пригодность для задачи еще до оценки стоимости. Объем контекстного окна составляет 200K токенов вместо 1M, поэтому крупный репозиторий или длинная история работы агента в него не поместятся. Максимальный объем вывода через синхронный Messages API ограничен 64K токенов против 128K у остальных моделей, а дата отсечки знаний — февраль 2025 года, тогда как у трех других моделей она установлена на январь 2026 года.

Во что мне обойдётся этот выбор при реальной нагрузке?

Каждая модель в линейке оценивает выходные данные в пять раз дороже входных. Opus 4.8 стоит 5 долларов за вход и 25 долларов за выход. Haiku 4.5 стоит 1 доллар за вход и 5 долларов за выход. Это соотношение сохраняется во всей линейке, поэтому выбор модели наиболее важен для задач, генерирующих большой объём выходных данных.

Агентная работа относится именно к таким задачам, поскольку токены «мышления» (thinking tokens) тарифицируются как выходные и учитываются в max_tokens, даже если текст не доходит до вас. В Fable 5, Opus 4.8, Opus 4.7 и Sonnet 5 сводка рассуждений по умолчанию скрыта, поэтому поле thinking возвращается пустым. Тарификация при этом не меняется: «В любом случае блок оплачивается одинаково и передаётся обратно в неизменном виде в многоходовых диалогах». В Из чего на самом деле складывается счёт за токены Claude этот механизм расчёта разобран полностью.

Запускается ли процесс «мышления» вообще — зависит от сравниваемых моделей, и если упустить этот момент, результаты теста стоимости будут неверными. В Sonnet 5 и Fable 5 «мышление» включено по умолчанию и не требует настройки. В Opus 4.8 и Opus 4.7 оно отключено, пока вы не зададите thinking: {type: "adaptive"} в запросе. Приведите конфигурацию к единообразию с обеих сторон, прежде чем делать какие-либо выводы на основе цифр.

Почему самая дешевая модель может оказаться самой дорогой

Возьмем одну изолированную задачу по программированию. Запрос содержит 60,000 токенов контекста, а модель выдает 8,000 токенов результата, включая процесс мышления. Кэширование не используется, поэтому расчеты остаются прозрачными.

Для Opus 4.8: 0.06 млн токенов на входе по цене $5 составляют $0.30, а 0.008 млн токенов на выходе по цене $25 — $0.20. Попытка обходится в $0.50. Для Haiku 4.5 та же попытка стоит $0.06 плюс $0.04, то есть $0.10.

Haiku в пять раз дешевле за попытку, что выглядит как значительная экономия, пока вы не оцените последствия неудачной попытки. Вы читаете неверный ответ, что стоит вам времени. Вы отправляете его повторно в составе контекста при следующей попытке, поэтому каждая последующая итерация становится объемнее предыдущей. А когда третья попытка снова оказывается неудачной, вы все равно переходите на более мощную модель: $0.30 за Haiku плюс $0.50 за Opus дают $0.80, что на 60% дороже, чем однократный запуск Opus.

Таким образом, решающий вопрос заключается в том, насколько дешево вы можете проверить ответ. Если неверный ответ очевиден за одну секунду, маленькая модель — это выгодное решение. Если же для его обнаружения требуется внимательное изучение diff, маленькая модель отнимает у вас время, которое никогда не появится в счете. Оценка этого времени в денежном эквиваленте — это та же арифметика, что и расчет окупаемости подписки Claude Code, и как только ваша собственная почасовая ставка включается в расчет, более дешевая модель часто перестает казаться выгодной.

В каких случаях компактная модель выигрывает

Haiku 4.5 — оптимальный выбор в следующих ситуациях:

  • Выполнение задач вспомогательными агентами. Вспомогательному агенту, который переименовывает файлы или собирает результаты поиска, не требуются возможности моделей пограничного уровня. Это стандартный шаблон, как только вы создаете AI-агента с помощью Claude и добавляете ему помощников.
  • Анализ логов. Определение того, является ли строка «шумом» или требует внимания человека, — это узкая задача с очевидным критерием ошибки.
  • Классификация по фиксированному набору меток. Вывод данных краток, а точность легко измерить на выборке.
  • Высокочастотные производственные вызовы. При 100,000 запусков в день разница в стоимости токенов перестает быть погрешностью округления. Это типичный сценарий для AI-процессов, интегрированных в n8n.
  • Любые задачи, где пользователю важна скорость отклика. Haiku 4.5 считается самой быстрой моделью в линейке.

Существует ограничение, характерное именно для Haiku. Минимальный размер кэшируемого промпта составляет 4,096 токенов, в то время как для Opus 4.8 и Sonnet 5 этот порог равен 1,024. Если объем меньше этого минимума, «любые запросы на кэширование меньшего количества токенов будут обработаны без использования кэша, при этом ошибка не возвращается». Блок инструкций объемом 1,500 токенов, который успешно кэшируется в Sonnet 5, в Haiku 4.5 кэшироваться не будет, причем без уведомления. Признаком этого являются значения cache_creation_input_tokens и cache_read_input_tokens, которые остаются равными нулю, что подробно описано в разделе оптимизация расходов постоянно работающего агента наряду с другими причинами потери кэша.

Рычаги управления ответом

Каждый из этих параметров влияет на результат сильнее, чем название модели.

Effort. output_config.effort определяет объем работы, которую выполняет модель перед формированием ответа. Доступные уровни: low, medium, high, xhigh и max, при этом high является значением по умолчанию: «Установка effort в high дает точно такой же результат, как и полное отсутствие параметра effort». Этот параметр вкладывается внутрь output_config, а не располагается на верхнем уровне запроса:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Параметр Effort влияет на каждый токен в ответе: «Он может затрагивать все расходы токенов, включая вызовы инструментов. Например, меньшее значение Effort означает, что Claude будет делать меньше вызовов инструментов». Это оказывает накопительный эффект в агентских циклах. Это не ограничение количества токенов: «Effort — это поведенческий сигнал, а не строгий лимит токенов». Anthropic не публикует множитель стоимости для каждого уровня и рекомендует тестировать параметры для конкретных задач. Таким образом, запуск Sonnet 5 с параметром high в сравнении с Opus 4.8 с параметром low — это реальный тест, который можно провести сегодня. Модель Haiku 4.5 отсутствует в списке моделей, поддерживающих параметр Effort.

Prompt caching. Чтение из кэша стоит 0.1 от базовой стоимости входных токенов, и именно этот показатель определяет выбор модели при работе с различными уровнями. Попадание в кэш для Opus 4.8 стоит $0.50 / MTok, тогда как стоимость входных токенов без кэширования для Haiku 4.5 составляет $1 / MTok. Следовательно, кэшированный префикс для Opus дешевле в пересчете на входной токен, чем «холодный» запрос для Haiku. Гигиена сессий важнее выбора модели для любой нагрузки, требующей повторной отправки больших стабильных префиксов.

Batches. Если ответ не требуется немедленно, API Message Batches позволяет запускать те же модели с «скидкой 50% как на входные, так и на выходные токены». Это сокращает вдвое каждую строку в приведенном ниже сравнении и работает для всех уровней: пакетное задание для Opus 4.8 стоит дешевле, чем синхронное задание для Sonnet 5 по стандартной цене, действующей с 1 сентября 2026 года, позволяя обменять задержку ответа на более высокие возможности при тех же затратах.

Сравнение стоимости выполнения задачи

Рабочая нагрузка: классификация 100 000 писем техподдержки, по одному вызову на каждое, 2 000 входных токенов и 300 выходных токенов на вызов. Итого: 200 млн токенов на входе и 30 млн токенов на выходе.

  • Haiku 4.5: 200 x $1 = $200 на входе, 30 x $5 = $150 на выходе. Итого $350.
  • Sonnet 5, вводный тариф: 200 x $2 = $400 на входе, 30 x $10 = $300 на выходе. Итого $700.
  • Sonnet 5, с 1 сентября 2026: 200 x $3 = $600 на входе, 30 x $15 = $450 на выходе. Итого $1 050.
  • Opus 4.8: 200 x $5 = $1 000 на входе, 30 x $25 = $750 на выходе. Итого $1 750.

Измените четыре числа, чтобы пересчитать стоимость по актуальным ценам. Приведенные ниже корректировки влияют на результат сильнее, чем выбор модели:

  • Пакетная обработка (batching) делит каждую строку пополам: $175, $350, $525 и $875. Поскольку ночная классификация не требует мгновенного ответа, нет причин отказываться от этого метода.
  • Кэширование общего префикса. Допустим, 1 200 из 2 000 входных токенов — это неизменный блок инструкций. Для Sonnet 5 по вводному тарифу стоимость попадания в кэш составляет $0,20 за млн токенов вместо $2 за млн токенов. Таким образом, 120 млн токенов стоят $24 вместо $240. Добавьте 80 млн токенов уникального ввода по $2 ($160) и $300 за вывод — и стоимость Sonnet 5 составит около $484 вместо $700. Этот метод не работает для Haiku 4.5, так как 1 200 токенов меньше минимального порога в 4 096 токенов.
  • Повторные попытки. Предположим, вы отклоняете 8% ответов Haiku и перенаправляете их в Opus 4.8. Добавьте 0,08 x $1 750 = $140 к $350, что даст $490. Измеряйте собственный процент отклонений, а не используйте оценочные данные.
  • Определения инструментов, если задача их использует. Системный промпт, который они генерируют, составляет 290 токенов для Opus 4.8 при tool_choice установленном в auto, 354 токена для Sonnet 5 и 496 токенов для Haiku 4.5. Самая дешевая модель несет наибольшие фиксированные накладные расходы.

Haiku с эскалацией до Opus за $490 и кэшированный Sonnet 5 за $484 стоят одинаково, при этом один из вариантов выполняет задачу за один проход. Выбор модели никогда не был единственным фактором.

Экономит ли деньги переключение моделей во время сессии?

Реже, чем кажется исходя из цен, так как экономия происходит на уровне токенов, а риску вы подвергаете весь кэшированный префикс.

Anthropic документирует условия, при которых кэш становится недействительным. Префиксы строятся в порядке tools, затем system, затем messages, и «изменения на каждом уровне делают недействительным этот уровень и все последующие». В этом списке также присутствуют две настройки запроса: «Конфигурация мышления и разрешенный уровень effort включаются непосредственно в промпт, поэтому изменение любого из них запускает создание нового префикса кэша». В отношении параметра effort документация идет еще дальше: «варьируйте effort в зависимости от рабочих нагрузок, а не внутри диалога, который опирается на попадания в кэш».

Модель в этом списке не указана, поэтому не стоит делать предположений в ту или иную сторону. Изучите cache_read_input_tokens в первом запросе после переключения и позвольте цифрам дать ответ. Для префикса Opus объемом 150 000 токенов чтение из кэша стоит около $0.08, а запись с нуля — около $0.94, что превышает выгоду от разницы в стоимости токенов за несколько итераций, ради которой вы это затеяли.

Поэтому меняйте эти параметры между задачами, а не внутри одной. В Claude Code это означает сначала /clear, когда кэш в любом случае сбрасывается, а затем /model или /effort. Оба этих параметра вводятся в CLI, поэтому, если вы работаете в Linux, стоит установить терминальную версию, так как то, что Anthropic поставляет для Linux, сочетает стабильный CLI с настольным приложением, которое все еще находится в стадии бета-тестирования. Отразится ли замена на счете, зависит от того, как вы оплачиваете сессию, поскольку Claude Code работает либо по фиксированному ежемесячному тарифу, либо через API-кредиты за токены, и только во втором случае смена модели оценивается в долларах. При фиксированном тарифе цена использования более тяжелой модели — это ваш лимит использования, а не счет, и Claude Code включен в тарифы от Pro и выше и расходует тот же лимит, что и чат-приложения, поэтому час работы Opus в терминале — это час, который вы не проводите в браузере.

Как протестировать ответ на собственной рабочей нагрузке

Не рассчитывайте размер промпта, основываясь на количестве токенов для другой модели. Эндпоинт для подсчета токенов бесплатен и использует токенизатор той модели, которую вы укажете, поэтому выбирайте именно ту, которую планируете использовать. Этот эндпоинт — одна из немногих частей платформы, за которую не взимается плата, и стоит изучить что еще можно запустить бесплатно, прежде чем тратить реальные кредиты на сравнение. Opus 4.7 и более поздние версии, Fable 5 и Sonnet 5 используют новый токенизатор, который «генерирует примерно на 30% больше токенов для того же текста», поэтому бюджет, рассчитанный для старой модели, будет выглядеть заниженным для новой при неизменной стоимости за токен.

Затем изучите полученный результат. input_tokens содержит только некэшированный остаток, поэтому истинный размер промпта равен сумме этого поля, cache_creation_input_tokens и cache_read_input_tokens. Первое приложение Claude API на VPS — это наиболее подходящее место для проведения таких измерений, а какой тариф Claude подходит для вашего использования — это отдельный вопрос о том, стоит ли вообще платить за каждый токен. Если в итоге выбор стоит между тем, какую подписку выбрать, а не стоит ли её оформлять вовсе, сравнение тарифов Claude и ChatGPT поможет понять, во сколько обойдется та же работа по программированию у другого провайдера. Если после измерений вы решите окончательно перейти на API, понижение уровня подписки или её отмена позволит вам использовать оплаченный период до конца, поэтому вы ничем не рискуете, принимая решение после получения точных цифр. Проведите те же измерения для команды, а не для одного пользователя, и итоговые показатели изменятся, так как стоимость места в Team или Enterprise должна быть выгоднее, чем расходы этого же человека при оплате за токен, чтобы покупка имела смысл.

FAQ

Какая модель Claude лучше всего подходит для программирования?

Claude Opus 4.8 — это рекомендуемая отправная точка для сложных агентных задач по программированию. По состоянию на июль 2026 года стоимость составляет $5 за миллион входных токенов и $25 за миллион выходных. Claude Sonnet 5 позиционируется как оптимальное сочетание скорости и интеллекта, а при цене $2 / $10 до 31 августа 2026 года она обходится более чем в два раза дешевле. Запустите одну и ту же задачу на обеих моделях, сохраняя одинаковую конфигурацию мышления, и сравните общие затраты токенов согласно response.usage.

Достаточно ли дешёвая модель Claude Haiku 4.5, чтобы заменить Sonnet 5?

В пересчёте на токен — безусловно: $1 / $5 против $2 / $10 у Sonnet 5 по вводным тарифам или $3 / $15 с 1 сентября 2026 года. Решающим фактором являются ограничения. У Haiku 4.5 контекстное окно составляет 200K токенов вместо 1M, максимальный объём вывода в синхронном Messages API ограничен 64K, дата отсечки знаний — февраль 2025 года, отсутствует поддержка output_config.effort, а минимальный размер кэшируемого промпта составляет 4,096 токенов, что автоматически отключает кэширование для коротких системных промптов.

Позволяет ли переключение на более дешёвую модель Claude в середине сессии сэкономить деньги?

Реже, чем кажется. Anthropic определяет инвалидаторы кэша как изменения в tools, system или messages префиксе, изменения в конфигурации мышления и изменения в output_config.effort. Влияние смены модели на существующий кэш не задокументировано, поэтому считайте его непредсказуемым и проверяйте cache_read_input_tokens при первом же запросе после переключения. Важно понимать масштаб: для префикса в 150,000 токенов в Opus 4.8 чтение из кэша стоит около $0.08, а полная запись — около $0.94, что перекрывает экономию на токенах за несколько итераций. Переключайтесь между задачами, после /clear в Claude Code, когда кэш в любом случае будет сброшен.

Как параметр output_config.effort влияет на счёт?

Он меняет количество токенов, которые модель тратит на текст, вызовы инструментов и мышление. Низкий уровень усилий приводит к меньшему количеству вызовов инструментов, что накапливается в агентных циклах, так как каждый результат работы инструмента повторно отправляется на последующих этапах. Доступные уровни: low, medium, high, xhigh и max, где high является значением по умолчанию. Anthropic не публикует множитель стоимости для каждого уровня, называя effort поведенческим сигналом, а не бюджетом токенов, поэтому оценивайте его влияние на своей задаче самостоятельно.

Сколько позволяет сэкономить Claude Batches API?

50% на входных и выходных токенах в обмен на асинхронную доставку. По состоянию на июль 2026 года это делает стоимость Opus 4.8 равной $2.50 на входе / $12.50 на выходе, Sonnet 5 — $1 / $5 по вводным тарифам, а Haiku 4.5 — $0.50 / $2.50. Важно заметить следующее сравнение между уровнями: пакетное задание для Opus 4.8 стоит дешевле, чем синхронное задание для Sonnet 5 по стандартному тарифу с 1 сентября 2026 года, поэтому использование пакетной обработки позволяет получить более мощную модель за те же деньги.