SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-26

Сколько стоит 1 миллион токенов в Claude API

Узнайте актуальную стоимость 1M токенов для моделей Claude Haiku, Sonnet и Opus. Разбираем разницу в тарифах на ввод и вывод данных, чтобы точно рассчитать бюджет вашего проекта.

Сколько стоит 1M токенов в Claude?

1M токенов означает один миллион токенов, и это единица измерения, в которой указывается цена любого API (application programming interface) Claude. Единой цены не существует, так как ввод и вывод тарифицируются по разным ставкам, и для каждой модели предусмотрена своя пара цен. По состоянию на август 2026 года один миллион входных токенов стоит $1 в Claude Haiku 4.5, $2 в Claude Sonnet 5 и $5 в Claude Opus 5.

Вывод — это более дорогая часть. Во всех текущих моделях стоимость вывода в пять раз превышает стоимость ввода, поэтому соотношение между ними влияет на ваш счет сильнее, чем общая цифра. Приложение, которое отправляет длинные документы и получает короткие ответы, работает иначе, чем то, которое пишет длинные ответы на основе короткого запроса.

Эта страница посвящена юнит-экономике: стоимости токена и способам оценки счета перед началом разработки. О том, куда именно расходуются токены во время работы, читайте в куда уходят токены в сессии Claude Code.

Как выглядят 1M токенов

Токен — это фрагмент текста, который модель считывает или записывает. Согласно примерным оценкам Anthropic, один токен соответствует 4 символам или примерно 0.75 слова английского языка. Таким образом, один миллион токенов — это около 750 000 слов или примерно 4 MB обычного текста.

Опубликованные оценки для типичных входных данных позволяют лучше представить этот масштаб.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Исходя из этих показателей, 1M токенов — это примерно 400 средних веб-страниц, прочитанных один раз, или восемь научных статей такого же объема. Это один проход по кодовой базе среднего размера или месяц неинтенсивного использования чата одним пользователем.

Воспринимайте всё это как приблизительную оценку. Код, JSON и текст на языках, отличных от английского, содержат меньше слов в одном токене, поэтому коэффициент 0.75 является оптимистичным пределом. Есть еще один фактор, влияющий на подсчет: Claude Opus 4.7 и более поздние версии, включая Opus 5 и Sonnet 5, используют новый токенизатор, который генерирует примерно на 30 процентов больше токенов для того же текста, чем Sonnet 4.6 и более ранние версии. Claude Haiku 4.5 использует старый токенизатор. Поэтому количество токенов, измеренное на Haiku 4.5, будет занижать результат для Sonnet 5 при идентичных входных данных, что делает прямое сравнение цены за миллион токенов между этими моделями некорректным. Перед принятием решения подсчитайте количество токенов для одного и того же промпта на обеих моделях.

Стоимость Claude за миллион токенов

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

На модель Claude Sonnet 5 до 31 августа 2026 года действует ознакомительная цена: $2 за входные токены и $10 за выходные. С 1 сентября 2026 года вступает в силу стандартный тариф: $3 за входные и $15 за выходные токены. Стоимость Claude Opus 5 составляет $5 и $25 соответственно. Модель Claude Fable 5 стоит особняком: $10 за входные и $50 за выходные токены, поэтому оправданность таких затрат зависит от задач, для которых вы её используете.

Тарифы меняются. Рассматривайте все цифры на этой странице как примеры расчётов по состоянию на август 2026 года. Перед утверждением бюджета обязательно уточняйте актуальные данные на официальной странице цен.

Эти тарифы показывают стоимость Claude, но не гарантируют, что он будет дешевле для вашей рабочей нагрузки. В разделе сравнение стоимости трёх задач для Claude и ChatGPT показано, какая API-платформа выгоднее в каждом конкретном случае.

Размер контекста не влияет на тариф. Начиная с Claude 4.6, полное окно контекста в 1M токенов тарифицируется по стандартным расценкам. Таким образом, стоимость одного токена в запросе на 900 000 токенов такая же, как и в запросе на 9 000 токенов. Длинный промпт обходится дороже только из-за большего количества токенов; отдельных повышенных тарифов для длинного контекста не существует.

Арифметика, которая сохраняется при изменении цены

Любой счет состоит из двух операций умножения и одной операции сложения.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Записано в виде кода, который можно запустить:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Этот код выведет 0.0126. Запрос, который отправляет 4,300 входных токенов и получает 400 выходных токенов, стоит около 1.3 цента при использовании Sonnet 5. Храните оба тарифа в одном месте вашего кода. При изменении цены вы редактируете две строки, и все расчеты в вашей системе обновляются автоматически.

Реалистичная оценка для работающего приложения

Представьте помощника службы поддержки. Его системный промпт и документация по продукту занимают 4 000 токенов. Они отправляются с каждым запросом, так как Messages API не хранит состояние, и модель ничего не помнит между вызовами. Вопрос пользователя добавляет около 300 токенов. Ответ составляет примерно 400 токенов. Итого: 4 300 токенов на вход и 400 на выход за один запрос.

Один миллион входных токенов покрывает около 232 таких запросов. При 1 000 запросов в день приложение потребляет 4,3 миллиона входных токенов ежедневно, поэтому «1 млн токенов» — это менее шести часов работы при таком трафике.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

Для Claude Opus 5 такой трафик стоит $31.50 за 1 000 запросов. Для Sonnet 5 стоимость составляет $12.60. Переход на Claude Haiku 4.5 снижает цену до $6.30, а использование прогретого кеша промптов (prompt cache) на Sonnet 5 позволяет снизить её ещё сильнее — до $5.40.

Умножьте эти цифры на 30, чтобы получить стоимость месяца работы. При стандартных тарифах Sonnet 5 обойдётся примерно в $378 в месяц. То же приложение с прогретым кешем будет стоить около $162. Выбор модели и решение об использовании кеширования влияют на бюджет сильнее, чем любые скидки, которые вы сможете согласовать при таком объёме. Выбор модели — это отдельный вопрос, и побеждает самая дешёвая из тех, что проходят ваши тесты: выбор между Opus, Sonnet и Haiku содержит руководство по правильному тестированию.

Кэширование промптов сокращает повторяющуюся часть

Этот префикс из 4,000 токенов идентичен в каждом запросе, и каждый раз вы платите полную стоимость за входные данные. Кэширование промптов сохраняет обработанный префикс и позволяет использовать его повторно по сниженной ставке.

Чтение из кэша стоит 0.1 от базовой ставки за входные данные. Запись в кэш стоит 1.25 от базовой ставки при времени жизни 5 минут или 2 от базовой ставки при времени жизни 1 час. Таким образом, 5-минутный кэш окупается после одного чтения, так как запись стоит на 0.25 больше, а каждое чтение экономит 0.9. Для окупаемости 1-часового кэша требуется два чтения.

Самый простой способ включить эту функцию — добавить одно поле верхнего уровня:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Затем прочитайте блок usage, который вернётся в ответе:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Эти три счётчика входных данных тарифицируются по трём разным ставкам, и их сумма составляет ваш реальный объём входных данных: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Оценка стоимости, учитывающая только input_tokens, будет сильно неверной после включения кэширования.

Две причины мешают кэшу стать выгодным, и обе они приводят к ошибкам без уведомления.

Префикс должен быть идентичен побайтово. Поиск в кэше выполняется по совпадению префикса, поэтому временная метка или имя пользователя в начале системного промпта меняют его в каждом запросе. В этом случае вы каждый раз платите 1.25 от базовой стоимости и ни разу не используете кэш. Симптомом является высокое значение cache_creation_input_tokens при значении cache_read_input_tokens, равном 0. Размещайте cache_control после последнего блока, содержимое которого остаётся неизменным во всех запросах, а всё, что меняется, помещайте после него. Изменение определений tools делает недействительным весь кэш ниже них, так как проверка недействительности выполняется в порядке: инструменты, затем системные инструкции, затем сообщения.

Префикс должен быть достаточно длинным. Минимальная длина для кэширования составляет 512 токенов для Opus 5, 1,024 для Sonnet 5 и 4,096 для Haiku 4.5. Более короткий промпт не кэшируется, при этом ошибка не возвращается. Префикс из 4,000 токенов в примере выше кэшируется на Sonnet 5, но не кэшируется на Haiku 4.5, так как 4,000 меньше минимального порога этой модели. Если оба счётчика показывают 0, значит, ничего не было кэшировано.

Пакетная обработка снижает стоимость вдвое

Batch API обрабатывает запросы асинхронно со скидкой 50 процентов как на входные, так и на выходные данные. В приведенном выше примере это превращает $12.60 за 1 000 запросов в $6.30. Скидка суммируется с кэшированием промптов, поэтому кэшированное пакетное задание — самый дешевый способ выполнения массовых задач.

Вы жертвуете задержкой, что делает пакетную обработку непригодной для задач, где пользователь ожидает ответа в реальном времени. Она подходит для классификации данных в ночное время и обработки больших объемов накопленных документов.

Почему стоимость чата растет в рамках одного диалога

Поскольку API не сохраняет состояние, ваш клиент при каждом запросе отправляет всю историю переписки целиком. Поэтому потребление токенов в одном чате растет пропорционально квадрату его длины, а не линейно.

Предположим, что средний объем сообщения составляет 500 токенов. На 1-м шаге отправляется 500 входных токенов. На 2-м — 1 000. На 20-м — 10 000. Если суммировать это по формуле n(n+1)/2, то за 20 шагов диалога будет отправлено около 105 000 входных токенов, хотя сам текст переписки составляет всего 10 000 токенов.

Именно поэтому функция чата обходится дороже, чем кажется исходя из объема текста, и именно поэтому кэширование стабильного префикса или суммаризация старых сообщений окупаются в длинных ветках диалога. Агент, который выполняет циклы вызовов инструментов, ведет себя так же, но еще хуже: каждый результат работы инструмента остается в истории и повторно отправляется при каждом последующем запросе. Установка жесткого лимита расходов для агента, который вы запускаете самостоятельно здесь критически важна, так как этот рост происходит автоматически и за ним никто не следит.

Подсчет токенов перед выполнением запроса

Перестаньте вычислять количество токенов на основе количества слов. API делает это за вас бесплатно, используя лимит запросов, отдельный от лимита создания сообщений.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

Ответ содержит одно поле:

{ "input_tokens": 14 }

Передайте в него ваш реальный системный промпт и определения инструментов вместе с типичным сообщением пользователя, а затем подставьте полученное число в функцию расчета стоимости выше. Эндпоинт принимает тот же формат тела запроса, что и запрос к модели, поэтому изображения и PDF-файлы также учитываются корректно. Следует учитывать два нюанса. Полученное значение является оценочным и может незначительно отличаться от фактической суммы в счете. Кроме того, расчет производится с помощью токенизатора той модели, которую вы указываете, поэтому передавайте именно ту модель, которую планируете использовать.

Количество выходных токенов невозможно подсчитать заранее, так как они еще не существуют. Ограничьте их с помощью max_tokens, а затем оцените реальное распределение на основе usage.output_tokens при работе с реальным трафиком.

Из чего еще складывается счет

Токены составляют основную часть счета. Однако есть несколько позиций, которые не являются токенами, и они часто становятся неожиданностью для пользователей.

  • Описания инструментов (tool definitions) становятся входными токенами при каждом запросе. Один только системный промпт для использования инструментов добавляет от 286 до 406 токенов в Opus 5, еще до учета ваших собственных схем. Десять подробных описаний инструментов могут удвоить объем небольшого промпта.
  • Веб-поиск оплачивается по тарифу $10 за 1000 поисковых запросов, сверх тех токенов, которые потребляют результаты при попадании в контекст.
  • Веб-запросы (web fetch) не имеют отдельной комиссии, но загруженная страница преобразуется во входные токены. Страница документации размером 100 кБ — это примерно 25,000 токенов.
  • Запрос на выполнение инференса только в США с использованием inference_geo в Claude 4.6 и более поздних версиях применяет множитель 1.1 к каждой категории токенов, включая чтение и запись в кэш.

Целесообразность покупки API зависит от ваших объемов. Обычно этот вопрос возникает при достижении лимита использования по тарифному плану, а варианты выхода за пределы лимита варьируются от ожидания обновления периода до переноса нагрузки на API с оплатой по факту использования. При определенном уровне потребления фиксированный ежемесячный план оказывается выгоднее, и сравнение API с подпиской Claude позволяет оценить это на реальных цифрах.

FAQ

Сколько стоит 1 млн токенов в Claude?

Это зависит от модели, а также от того, являются ли токены входными или выходными. По состоянию на август 2026 года один миллион входных токенов стоит $1 для Claude Haiku 4.5, $2 для Claude Sonnet 5 по вводным тарифам и $5 для Claude Opus 5. Стоимость выходных токенов в пять раз выше стоимости входных для каждой из этих моделей. С 1 сентября 2026 года стоимость для Sonnet 5 изменится до $3 за входные и $15 за выходные токены. Тарифы меняются, поэтому уточняйте их на официальной странице цен, прежде чем закладывать сумму в бюджет.

Равен ли 1 млн токенов 1 млн слов?

Нет. Один токен — это примерно 4 символа английского текста или около 0,75 слова, поэтому один миллион токенов составляет примерно 750 000 слов. Это соотношение является лишь ориентиром. Код, JSON и языки, отличные от английского, требуют большего количества токенов на слово. Claude Opus 4.7 и более поздние версии также используют новый токенизатор, который генерирует примерно на 30 процентов больше токенов для того же текста, чем Claude Sonnet 4.6 и более ранние версии, поэтому показатели нельзя переносить между поколениями моделей. Выполняйте замеры с помощью бесплатного эндпоинта /v1/messages/count_tokens, передавая в него модель, которую планируете использовать.

Всегда ли кэширование промптов экономит деньги?

Нет. Запись в кэш длительностью 5 минут стоит в 1,25 раза больше базовой ставки за входные токены, поэтому префикс, который был записан, но ни разу не прочитан, обходится на 25 процентов дороже, чем обычная отправка. Затраты окупаются с первого чтения. Кэширование может не сработать в двух случаях, причём оба происходят без вывода ошибок. Если кэшированный префикс меняется между запросами, поиск не даст совпадений, так как требуется точное соответствие префикса. Если префикс короче минимальной длины, поддерживаемой моделью (1 024 токена для Sonnet 5 и 4 096 для Haiku 4.5), данные не кэшируются, а ошибка не возвращается. Если cache_creation_input_tokens и cache_read_input_tokens оба возвращают 0, значит, кэш не используется.

Почему мой счёт растёт быстрее, чем количество сообщений?

Потому что весь диалог отправляется заново на каждом шаге. Messages API не хранит состояние, поэтому 20-й шаг чата снова включает в себя все 19 предыдущих шагов в качестве входных данных. Если средний размер шага составляет 500 токенов, то диалог из 20 шагов потребует отправки около 105 000 входных токенов, хотя длина самой переписки составляет всего 10 000 токенов. Циклы агентов работают аналогично, так как каждый результат выполнения инструмента остаётся в истории. Кэшируйте стабильный префикс или суммируйте старые шаги и удаляйте их из запроса.