Какую модель Claude выбрать? Сравнение цен
Сравните тарифы Claude Opus 4.8, Sonnet 5 и Haiku 4.5 на июль 2026 года. Расчет стоимости 100 000 запросов и анализ влияния настроек на ваш бюджет API.
Какую модель Claude следует использовать?
Краткий ответ на вопрос о выборе модели Claude: начните с Claude Opus 4.8 и переходите на другие модели только при наличии конкретной причины. Рекомендации Anthropic совпадают: «Если вы не уверены, какую модель выбрать, используйте Claude Opus 4.8 для сложного агентного программирования и корпоративных задач». Переходите на Claude Sonnet 5, когда задача четко определена и вы выполняете ее многократно в день. Переходите на Claude Haiku 4.5 для механической высокообъемной работы, где ожидаемый результат вам уже известен. Claude Fable 5 является наиболее мощной моделью и предназначена для долгоживущих агентов.
Выбор модели влияет на стоимость. Ниже приведены тарифы Claude API (application programming interface) по состоянию на 23 июля 2026 года за один миллион токенов (в документации обозначается как MTok).
- Claude Fable 5 (
claude-fable-5): $10 / MTok (входящие), $50 / MTok (исходящие). Контекст 1M. - Claude Opus 4.8 (
claude-opus-4-8): $5 (входящие), $25 (исходящие). Контекст 1M. - Claude Opus 4.7 (
claude-opus-4-7): $5 (входящие), $25 (исходящие). Контекст 1M. - Claude Sonnet 5 (
claude-sonnet-5): $2 (входящие), $10 (исходящие) по ознакомительным ценам до 31 августа 2026 года. Стандартные тарифы $3 (входящие) и $15 (исходящие) вступают в силу 1 сентября 2026 года. Контекст 1M. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 (входящие), $5 (исходящие). Контекст 200K.
Данные идентификаторы являются полными. Дополнительные символы к ним не добавляются.
Для моделей с контекстом 1M дополнительная плата за объем не взимается: «Запрос на 900k-токенов тарифицируется по той же ставке за токен, что и запрос на 9k-токенов».
Назначение каждой модели
Anthropic дает описание каждой модели одной фразой. Эти описания точнее любых рейтингов.
- Claude Fable 5: «Интеллект следующего поколения для длительных сессий агентов». Имеет самую высокую задержку (latency) среди четырех моделей.
- Claude Opus 4.8: «Для сложного агентного программирования и корпоративных задач». Умеренная задержка.
- Claude Sonnet 5: «Лучшее сочетание скорости и интеллекта». Высокая скорость.
- Claude Haiku 4.5: «Самая быстрая модель с уровнем интеллекта, близким к передовым решениям».
Ограничения Haiku 4.5 определяют применимость модели раньше, чем цена. Размер контекстного окна составляет 200K токенов вместо 1M; поэтому большой репозиторий или длинный лог работы агента не поместятся. Максимальный объем выходных данных в синхронном Messages API составляет 64K токенов, в то время как у остальных моделей этот показатель равен 128K. Актуальность знаний (knowledge cutoff) у Haiku ограничена февралем 2025 года, тогда как у остальных трех моделей — январем 2026 года.
Как выбор модели влияет на стоимость реальной рабочей нагрузки?
В данной линейке стоимость выходных токенов в пять раз выше стоимости входных. Для Opus 4.8 цена составляет $5 за вход и $25 за выход. Для Haiku 4.5 — $1 за вход и $5 за выход. Это соотношение сохраняется для всех моделей, поэтому выбор модели критичен при задачах с большим объемом выходных данных.
Агентная работа относится к такому типу задач, так как токены рассуждения (thinking tokens) тарифицируются как выходные токены и учитываются в max_tokens, даже если текст не передается пользователю. В моделях Fable 5, Opus 4.8, Opus 4.7 и Sonnet 5 резюме рассуждений по умолчанию отсутствует, поэтому поле thinking возвращается пустым. Тарификация не меняется: «В обоих случаях блок тарифицируется и передается одинаково в многошаговых диалогах». Что на самом деле формирует счет за токены Claude подробно разбирает этот механизм.
Наличие функции thinking различается у сравниваемых моделей; пропуск этого факта приведет к неверным результатам теста стоимости. В Sonnet 5 и Fable 5 функция thinking включена по умолчанию и не требует настройки. В Opus 4.8 и Opus 4.7 она выключена, пока вы не установите thinking: {type: "adaptive"} в запросе. Перед анализом полученных данных убедитесь, что конфигурации на обеих сторонах идентичны.
Почему самая дешевая модель может оказаться самой дорогой
Рассмотрим одну изолированную задачу по написанию кода. Запрос содержит 60,000 токенов контекста, а модель генерирует 8,000 токенов ответа, включая процесс рассуждения (thinking). Кэширование не используется, поэтому стоимость вычислений очевидна.
На Opus 4.8: 0.06 MTok входных данных по цене $5 составляет $0.30, а 0.008 MTok выходных данных по цене $25 составляет $0.20. Одна попытка стоит $0.50. На Haiku 4.5 та же попытка стоит $0.06 плюс $0.04, итого $0.10.
Haiku в пять раз дешевле за одну попытку. Это кажется выгодным, пока вы не проанализируете последствия неудачной попытки. Вы получаете неверный ответ, что тратит ваше время. При повторной попытке вы отправляете этот ответ как контекст, поэтому объем каждой последующей попытки увеличивается. Если третья попытка также не удалась, вам все равно придется перейти на более мощную модель: $0.30 за Haiku плюс $0.50 за Opus составляют $0.80, что на 60% дороже, чем один запуск Opus.
Таким образом, решающим фактором является стоимость проверки ответа. Если неверный ответ очевиден за одну секунду, использование малой модели выгодно. Если же для обнаружения ошибки требуется тщательное изучение diff, малая модель тратит ваше время, которое не отображается в счете.
Когда малая модель выигрывает вчистую
Haiku 4.5 является оптимальным выбором в следующих случаях:
- Механическая работа субагента. Субагенту, который переименовывает файлы или собирает результаты поиска, не требуется сложное логическое рассуждение. Это стандартный сценарий после того, как вы создадите AI agent с помощью Claude и предоставите ему вспомогательные инструменты.
- Сортировка логов. Определение того, является ли строка шумом или заслуживает внимания человека, — это узкая задача с очевидным сценарием ошибки.
- Классификация по фиксированному набору меток. Выходные данные коротки, а точность можно измерить на выборке.
- Высокообъемные производственные вызовы. При 100,000 запусках в день разница в стоимости токенов перестает быть незначительной. Это типичный формат AI workflows, интегрированных в n8n.
- Любые задачи, где пользователю важна скорость ответа. Haiku 4.5 является самой быстрой моделью в линейке.
У Haiku есть одно специфическое ограничение. Минимальный размер промпта для кэширования составляет 4,096 токенов, в то время как у Opus 4.8 и Sonnet 5 этот порог равен 1,024. Если размер промпта меньше этого минимума, «все запросы с количеством токенов меньше указанного будут обрабатываться без кэширования, ошибка не возвращается». Блок инструкций из 1,500 токенов, который кэшируется в Sonnet 5, не будет кэшироваться в Haiku 4.5. Признаком этого являются показатели cache_creation_input_tokens и cache_read_input_tokens, равные нулю, что помогает снизить затраты на постоянно работающего агента наряду с другими причинами отсутствия кэширования.
Параметры, влияющие на результат
Каждый из этих параметров оказывает большее влияние на стоимость, чем название модели.
Effort. Параметр output_config.effort определяет объем работы модели перед выдачей ответа. Доступны уровни low, medium, high, xhigh и max; значение по умолчанию — high: «Установка effort в значение high дает тот же результат, что и полное отсутствие параметра effort». Этот параметр является вложенным по отношению к output_config и не находится на верхнем уровне запроса:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Параметр Effort влияет на каждый токен в ответе: «Он может влиять на расход всех токенов, включая вызовы инструментов (tool calls). Например, при низком значении effort модель Claude будет совершать меньше вызовов инструментов». Это создает кумулятивный эффект в агентных циклах (agentic loops). Это не ограничение по токенам: «Effort — это сигнал для изменения поведения, а не жесткий лимит токенов». Anthropic не публикует коэффициенты стоимости для каждого уровня и рекомендует тестировать собственные сценарии использования. Таким образом, сравнение работы Sonnet 5 на уровне high и Opus 4.8 на уровне low является корректным и доступным для тестирования. Модель Haiku 4.5 не входит в список моделей с поддержкой параметра effort.
Prompt caching. Чтение из кэша стоит 0.1x от базовой стоимости входных данных; итоговая стоимость зависит от уровня модели. Кэш-хит (cache hit) для Opus 4.8 стоит $0.50 / MTok, а некэшированные входные данные для Haiku 4.5 стоят $1 / MTok. Следовательно, использование кэшированного префикса в Opus дешевле за один входной токен, чем запрос к Haiku без кэша. Для рабочих нагрузок, которые повторно отправляют большой стабильный префикс, оптимизация сессии важнее выбора модели.
Batches. Если ответ не требуется немедленно, Message Batches API позволяет использовать те же модели с «50% скидкой как на входные, так и на выходные токены». Это снижает стоимость каждой строки в сравнении ниже в два раза; функция работает для всех уровней: пакетная задача (batched job) для Opus 4.8 будет стоить дешевле, чем синхронная задача для Sonnet 5 по стандартному тарифу с 1 сентября 2026 года, позволяя заменить задержку (latency) на более высокую производительность за те же деньги.
Сравнение стоимости одной рабочей нагрузки
Рабочая нагрузка: классификация 100,000 электронных писем службы поддержки. На каждый запрос приходится один вызов, 2,000 входных токенов и 300 выходных токенов. Итого: 200 MTok входных данных и 30 MTok выходных данных.
- Haiku 4.5: 200 x $1 = $200 (вход), 30 x $5 = $150 (выход). Итого $350.
- Sonnet 5, ознакомительный тариф: 200 x $2 = $400 (вход), 30 x $10 = $300 (выход). Итого $700.
- Sonnet 5, с 1 сентября 2026: 200 x $3 = $600 (вход), 30 x $15 = $450 (выход). Итого $1,050.
- Opus 4.8: 200 x $5 = $1,000 (вход), 30 x $25 = $750 (выход). Итого $1,750.
Измените четыре числа, чтобы пересчитать стоимость по тарифам завтрашнего дня. Приведенные ниже корректировки влияют на результат сильнее, чем название модели:
- Batching сокращает стоимость каждой строки вдвое: $175, $350, $525 и $875. При ночном запуске классификации задержки не критичны, поэтому этот метод использовать целесообразно.
- Кэширование общего префикса. Допустим, 1,200 из 2,000 входных токенов — это один и тот же блок инструкций. При использовании Sonnet 5 по ознакомительному тарифу стоимость кэшированных токенов составляет $0.20 / MTok вместо $2 / MTok. Таким образом, 120 MTok стоят $24 вместо $240. Добавьте 80 MTok новых входных токенов по цене $2 (это $160) и $300 за выходные данные. Итоговая стоимость Sonnet 5 составит около $484 вместо $700. Для Haiku 4.5 этот метод не применим, так как 1,200 токенов меньше минимального порога в 4,096 токенов.
- Повторные попытки (Retries). Предположим, вы отклоняете ответ Haiku в 8% случаев и повторно запускаете эти запросы на Opus 4.8. Прибавьте 0.08 x $1,750 = $140 к $350, что даст $490. Измеряйте собственный коэффициент отклонения, а не используйте мои данные.
- Определения инструментов (Tool definitions), если задача их использует. Системный промпт, который они генерируют, составляет 290 токенов на Opus 4.8 при установленном значении
tool_choiceвauto, 354 токена на Sonnet 5 и 496 токенов на Haiku 4.5. Самая дешевая модель имеет самые высокие фиксированные накладные расходы.
Haiku с путем эскалации за $490 и Sonnet 5 с кэшированием за $484 стоят одинаково, при этом одна из моделей выполняет задачу за один проход. Выбор модели не является единственным фактором.
Экономит ли смена моделей во время сессии деньги?
Редко, вопреки заявленным ценам, так как экономия рассчитывается за каждый token, а под угрозой оказывается весь кэшированный prefix.
Anthropic описывает условия, которые аннулируют кэш. Префиксы строятся в порядке tools, затем system, затем messages, и «Изменения на каждом уровне аннулируют этот уровень и все последующие уровни». В этот список также входят две настройки запроса: «Конфигурация thinking и разрешенный уровень effort встраиваются непосредственно в prompt, поэтому изменение любого из них инициирует создание нового кэш-префикса». В документации по оптимизации ресурсов указано: «Меняйте effort между рабочими задачами, а не внутри одного диалога, который полагается на попадания в кэш (cache hits)».
Модель не входит в этот список, поэтому не делайте предположений. Проверьте cache_read_input_tokens при первом запросе после смены модели и используйте полученное число для оценки. Для префикса Opus объемом 150,000 token чтение из кэша стоит около $0.08, а новая запись — около $0.94. Это больше, чем разница в цене за несколько ходов, которую вы пытались сэкономить.
Меняйте эти параметры между задачами, а не внутри одной. В Claude Code это означает сначала /clear, когда кэш все равно будет удален, а затем /model или /effort.
Как протестировать ответ на ваших рабочих нагрузках
Не оценивайте размер промпта на основе данных другой модели. Использование эндпоинта подсчета токенов бесплатно. Он использует токенизатор указанной вами модели, поэтому указывайте именно ту модель, которую планируете вызывать. Opus 4.7 и более поздние версии, а также Fable 5 и Sonnet 5 используют новый токенизатор. Он «генерирует примерно на 30% больше токенов для того же текста». Если вы измерите бюджет на старой модели, он окажется заниженным для новой модели при той же стоимости за токен.
Затем проанализируйте полученные данные. Значение input_tokens содержит только остаток без кэширования. Истинный размер промпта равен значению этого поля плюс cache_creation_input_tokens плюс cache_read_input_tokens. Первое приложение Claude API на VPS — это наиболее точный способ провести такие измерения. Какой тарифный план Claude подходит для ваших задач — это отдельный вопрос о том, стоит ли вам вообще платить за каждый токен.
FAQ
Какая модель Claude лучше всего подходит для программирования?
Claude Opus 4.8 является рекомендованной отправной точкой для сложного агентного программирования. По состоянию на июль 2026 года стоимость составляет $5 за миллион входных токенов и $25 за миллион выходных токенов. Claude Sonnet 5 позиционируется как оптимальное сочетание скорости и интеллекта. До 31 августа 2026 года ее стоимость составляет $2 / $10, что меньше половины стоимости Opus 4.8. Выполните одну и ту же задачу на обеих моделях, сохраняйте конфигурацию thinking неизменной и сравните общие затраты токенов по данным из response.usage.
Достаточно ли дешев Claude Haiku 4.5, чтобы заменить Sonnet 5?
В пересчете на токен — да: $1 / $5 против $2 / $10 для Sonnet 5 при ознакомительных ценах, или $3 / $15 с 1 сентября 2026 года. Решение принимается на основе лимитов. Контекстное окно Haiku 4.5 составляет 200K токенов вместо 1M. Максимальный объем выходных данных в синхронном Messages API составляет 64K. Актуальность знаний ограничена февралем 2025 года. Модель не поддерживает output_config.effort. Минимальный кэшируемый промпт составляет 4,096 токенов, что фактически отключает кэширование для коротких системных промптов.
Экономит ли деньги переключение на более дешевую модель Claude в середине сессии?
Это происходит реже, чем кажется. Anthropic классифицирует инвалидаторы кэша как изменения в префиксах tools, system или messages, изменения в конфигурации thinking и изменения в output_config.effort. Влияние смены модели на существующий кэш не документировано, поэтому считайте это неизвестным фактором и проверьте cache_read_input_tokensданные при первом последующем запросе. Это важно знать: при префиксе Opus 4.8 в 150,000 токенов чтение из кэша стоит около $0.08, а новая запись — около $0.94. Это перекрывает экономию на нескольких ходах диалога. Переключайтесь между задачами только после /clear в Claude Code, когда кэш все равно будет удален.
Как параметр output_config.effort влияет на счет?
Он изменяет количество токенов, которые модель расходует на текст, вызовы инструментов (tool calls) и процесс мышления (thinking). Низкий уровень effort (low effort) приводит к меньшему количеству вызовов инструментов. Это увеличивает расходы в агентных циклах, так как каждый результат работы инструмента повторно отправляется в последующих ходах. Доступны уровни low, medium, high, xhigh и max, по умолчанию используется high. Anthropic не публикует коэффициент стоимости для каждого уровня. Параметр effort является сигналом поведения, а не фиксированным бюджетом токенов, поэтому оценивайте его на своих задачах.
Какую экономию дает Claude Batches API?
Экономия составляет 50% как на входных, так и на выходных токенах в обмен на асинхронную доставку. По состоянию на июль 2026 года стоимость составляет: Opus 4.8 — $2.50 (вход) / $12.50 (выход), Sonnet 5 — $1 / $5 (ознакомительные цены), Haiku 4.5 — $0.50 / $2.50. Важное сравнение по уровням: пакетная задача (batch) для Opus 4.8 стоит дешевле, чем синхронная задача для Sonnet 5 по стандартному тарифу с 1 сентября 2026 года. Таким образом, пакетная обработка позволяет использовать более мощную модель за те же деньги.