Скільки коштує 1M токенів у Claude
Ціна 1M токенів у Claude залежить від моделі та типу даних. Розберімо окремі ставки для вхідних і вихідних токенів та розрахунок рахунку.
Скільки коштує 1M токенів у Claude?
1M токенів означає один мільйон токенів. Це одиниця, у якій зазначають ціни для кожного Claude API (інтерфейсу програмування застосунків). Єдиної ціни немає, оскільки вхідні та вихідні дані тарифікуються за різними ставками, а для кожної моделі діє власна пара ставок. Станом на August 2026 один мільйон вхідних токенів коштує $1 у Claude Haiku 4.5, $2 у Claude Sonnet 5 і $5 у Claude Opus 5.
Вихідні дані коштують дорожче. У кожній актуальній моделі ставка для вихідних даних у п’ять разів вища за ставку для вхідних даних. Тому саме співвідношення між ними сильніше впливає на рахунок, ніж заголовкова ціна. Застосунок, який надсилає довгі документи та повертає короткі відповіді, працює з витратами зовсім інакше, ніж застосунок, який формує довгі відповіді на короткий запит.
Ця сторінка присвячена економіці використання: скільки коштує токен і як оцінити рахунок до початку розроблення. Щоб дізнатися, куди фактично витрачаються токени під час роботи, перегляньте куди потрапляють токени під час сеансу Claude Code.
Як виглядає 1M токенів
Токен — це фрагмент тексту, який модель читає або створює. За приблизною оцінкою Anthropic, один токен припадає на 4 символи, або приблизно на 0.75 англійського слова. Отже, 1 мільйон токенів — це близько 750,000 слів, або приблизно 4 MB звичайного тексту.
Опубліковані оцінки для поширених типів вхідних даних краще показують масштаб.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]За таких показників 1M токенів — це приблизно 400 середніх вебсторінок, прочитаних один раз, або вісім наукових статей такого обсягу. Це один прохід по кодовій базі середнього розміру або місяць помірного використання чату однією людиною.
Усе це слід сприймати як оцінку. Код, JSON і тексти іншими мовами, крім англійської, містять менше слів на один токен, тому співвідношення 0.75 є оптимістичною верхньою межею. Є ще один чинник, який змінює кількість токенів: Claude Opus 4.7 і новіші версії, зокрема Opus 5 і Sonnet 5, використовують новіший токенізатор, який створює приблизно на 30 відсотків більше токенів для того самого тексту, ніж Sonnet 4.6 і попередні версії. Claude Haiku 4.5 використовує старіший токенізатор. Тому кількість, виміряна для Haiku 4.5, буде меншою за кількість для Sonnet 5 за ідентичних вхідних даних. Через це пряме порівняння ціни за мільйон токенів між цими версіями некоректне. Перш ніж ухвалювати рішення, підрахуйте кількість токенів для того самого запиту в обох моделях.
Скільки Claude стягує за мільйон токенів
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Для Claude Sonnet 5 діють вступні тарифи: $2 за вхідні дані та $10 за вихідні дані до 31 August 2026. З 1 September 2026 застосовуватиметься стандартний тариф: $3 за вхідні дані та $15 за вихідні дані. Для Claude Opus 5 тарифи становлять $5 і $25.
Тарифи змінюються. Розглядайте кожне число на цій сторінці як приклад розрахунку станом на August 2026 і перевіряйте актуальні значення на офіційній сторінці тарифів, перш ніж затверджувати бюджет.
Довжина контексту не змінює тариф. У Claude 4.6 і новіших версіях повне контекстне вікно на 1M токенів оплачується за стандартним тарифом, тому запит на 900,000 токенів має таку саму вартість за токен, як і запит на 9,000 токенів. Довгий запит коштує дорожче, оскільки містить більше токенів. Окремий тариф для довгого контексту не застосовується.
Арифметика, яка не змінюється разом із ціною
Кожен рахунок складається з двох операцій множення та однієї операції додавання.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateУ вигляді коду, який можна виконати:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")Виводиться значення 0.0126. Запит із 4,300 вхідними токенами та 400 вихідними токенами коштує приблизно 1.3 цента в Sonnet 5. Зберігайте обидві ставки в одному місці коду. Якщо ціна змінюється, відредагуйте два рядки, і всі розрахунки у вашій системі оновляться відповідно.
Розрахунок для реального застосунку
Розглянемо асистента служби підтримки. Системний промпт і документація продукту містять 4,000 токенів. Вони надсилаються в кожному запиті, оскільки Messages API не зберігає стан, а модель нічого не пам’ятає між викликами. Запит користувача додає приблизно 300 токенів. Відповідь містить приблизно 400 токенів. Отже, на один запит припадає 4,300 вхідних і 400 вихідних токенів.
За 1 мільйон вхідних токенів можна виконати приблизно 232 таких запити. Якщо застосунок обробляє 1,000 запитів на день, він щодня споживає 4.3 мільйона вхідних токенів. Отже, «1M токенів» — це менше ніж шість годин трафіку.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]У Claude Opus 5 такий трафік коштує $31.50 за 1,000 запитів. У Sonnet 5 він коштує $12.60. Перехід на Claude Haiku 4.5 знижує вартість до $6.30, а прогрітий кеш промптів у Sonnet 5 знижує її ще більше — до $5.40.
Помножте цю суму на 30, щоб отримати вартість місяця за такого трафіку. Sonnet 5 за стандартними тарифами коштує приблизно $378 на місяць. Той самий застосунок із прогрітим кешем коштує приблизно $162. Вибір моделі та рішення щодо кешування кожне окремо мають більший вплив, ніж будь-яка ставка, яку ви зможете погодити за такого обсягу. Вибір моделі — окреме питання. Перевагу слід надати найдешевшій моделі, яка успішно проходить ваші оцінювання: у матеріалі вибір між Opus, Sonnet і Haiku описано, як правильно це перевірити.
Кешування промптів скорочує повторювану частину
Префікс із 4,000 токенів однаковий у кожному запиті, і щоразу за нього стягується повна ціна вхідних даних. Кешування промптів зберігає оброблений префікс і стягує знижену плату за його повторне використання.
Читання з кешу коштує 0.1 базової ставки для вхідних даних. Запис у кеш коштує 1.25 базової ставки для терміну дії 5 хвилин або 2 базові ставки для терміну дії 1 година. Тому кеш на 5 хвилин окупається після одного читання: запис коштує на 0.25 більше, а кожне читання заощаджує 0.9. Для кешу на 1 годину потрібно два читання, щоб вийти в точку беззбитковості.
Найпростіше увімкнути його одним полем верхнього рівня:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'Потім прочитайте блок usage, який повертається у відповіді:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}За ці три лічильники вхідних даних стягується плата за трьома різними ставками, і разом вони становлять фактичний обсяг вхідних даних: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Оцінка вартості, яка враховує лише input_tokens, буде суттєво неправильною після ввімкнення кешування.
Кеш може не окупитися з двох причин, і обидві не спричиняють помилок.
Префікс має бути ідентичним на рівні байтів. Пошук у кеші зіставляє префікс, тому мітка часу або ім’я користувача на початку системного промпту змінює його в кожному запиті. У такому разі щоразу стягується 1.25 базової ставки за вхідні дані, а читання з кешу не виконується. Ознака проблеми — cache_creation_input_tokens залишається високим, а cache_read_input_tokens — 0. Розмістіть cache_control на останньому блоці, вміст якого однаковий у всіх запитах, а все змінне розмістіть після нього. Зміна визначень tools робить недійсним увесь кеш нижче них, оскільки інвалідація виконується в такому порядку: tools, потім system, потім messages.
Префікс має бути достатньо довгим. Мінімальна довжина для кешування становить 512 токенів у Opus 5, 1,024 у Sonnet 5 і 4,096 у Haiku 4.5. Коротший промпт не кешується, і помилка не повертається. Префікс із 4,000 токенів у наведеному вище прикладі кешується в Sonnet 5 і не кешується в Haiku 4.5, оскільки 4,000 менше за мінімальний поріг цієї моделі. Якщо обидва лічильники мають значення 0, кешування не виконувалося.
Пакетна обробка зменшує тариф удвічі
Batch API асинхронно обробляє запити зі знижкою 50 відсотків на вхідні та вихідні дані. У наведеному вище прикладі це зменшує вартість 1,000 запитів з $12.60 до $6.30. Знижка поєднується з кешуванням промптів, тому пакетне завдання з кешуванням є найдешевшим способом виконувати масові операції.
Недоліком є затримка. Тому Batch не підходить для операцій, результату яких людина чекає в реальному часі. Він підходить для нічної класифікації та дозаповнення документів.
Чому витрати на чат зростають у межах однієї розмови
Оскільки API не зберігає стан, клієнт надсилає всю розмову повторно під час кожного кроку. Тому використання токенів в одному чаті зростає пропорційно квадрату його довжини, а не лінійно.
Нехай середня довжина кроку становить 500 токенів. На кроці 1 надсилається 500 вхідних токенів. На кроці 2 — 1,000. На кроці 20 — 10,000. За формулою n(n+1)/2 розмова з 20 кроків загалом надсилає приблизно 105,000 вхідних токенів, хоча сам транскрипт містить лише 10,000 токенів.
Тому функція чату коштує дорожче, ніж випливає з обсягу її транскрипту. Саме тому кешування стабільного префікса або узагальнення старих кроків окупається в довгих ланцюжках. Агент, який циклічно виконує виклики інструментів, має таку саму структуру, але ситуація ще гірша: кожен результат інструмента залишається в історії та повторно надсилається під час кожного наступного кроку. Встановлення жорсткого ліміту витрат для агента, якого ви запускаєте самостійно особливо важливе в цьому випадку, оскільки зростання відбувається автоматично, а ніхто за ним не стежить.
Порахуйте токени, перш ніж робити припущення
Не виводьте кількість токенів із кількості слів. API рахує їх для вас без додаткової плати, використовуючи окремий ліміт запитів, не пов’язаний зі створенням повідомлень.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'Відповідь містить одне поле:
{ "input_tokens": 14 }Передайте туди свій фактичний системний prompt і визначення інструментів разом із репрезентативним повідомленням користувача, а потім підставте отримане число у наведену вище функцію вартості. Endpoint приймає те саме тіло запиту, що й запит повідомлення, тому зображення та PDF-файли також враховуються правильно. Важливі два застереження. Це оцінка, яка може трохи відрізнятися від значення, за яким виставляється рахунок. Крім того, підрахунок виконується токенізатором переданої моделі, тому передавайте саме ту модель, яку фактично використовуватимете.
Кількість вихідних токенів неможливо порахувати заздалегідь, оскільки їх ще не існує. Обмежте її за допомогою max_tokens, а потім виміряйте фактичний розподіл за даними usage.output_tokens у робочому трафіку.
Що ще входить до рахунку
Токени становлять більшу частину рахунку. Деякі витрати не пов’язані з токенами й можуть здивувати.
- Визначення інструментів перетворюються на вхідні токени під час кожного запиту. Лише системний промпт для використання інструментів додає від 286 до 406 токенів у Opus 5, ще до врахування ваших власних схем. Десять докладних описів інструментів можуть подвоїти невеликий промпт.
- Пошук у мережі тарифікується за ставкою $10 за 1,000 пошукових запитів. Це стягується додатково до вартості токенів, які споживають результати після додавання до контексту.
- Web fetch не має окремої плати, але отримана сторінка перетворюється на вхідні токени. Сторінка документації розміром 100 kB містить приблизно 25,000 таких токенів.
- Запит на виконання інференсу лише у США за допомогою
inference_geoу Claude 4.6 і новіших версіях застосовує множник 1.1 до кожної категорії токенів, зокрема до операцій читання та запису кешу.
Чи варто взагалі купувати API, залежить від обсягу використання. За невеликого обсягу фіксований місячний план однозначно вигідніший, а порівняння API з підпискою Claude виконує це порівняння на основі реальних чисел.
FAQ
Скільки коштує 1M токенів у Claude?
Це залежить від моделі та від того, чи є токени вхідними або вихідними. Станом на серпень 2026 року один мільйон вхідних токенів коштує $1 у Claude Haiku 4.5, $2 у Claude Sonnet 5 за початковою ціною та $5 у Claude Opus 5. Для кожної з цих моделей вихідні токени коштують у 5 разів дорожче за вхідні. 1 вересня 2026 року ціна вхідних токенів для Sonnet 5 зросте до $3, а вихідних — до $15. Тарифи змінюються, тому перевірте їх на офіційній сторінці з цінами, перш ніж закладати конкретну суму до бюджету.
Чи дорівнює 1M токенів 1M слів?
Ні. Один токен — це приблизно 4 символи англійського тексту або близько 0.75 слова, тому один мільйон токенів — це приблизно 750,000 слів. Це співвідношення є лише орієнтовним. Код, JSON і мови, відмінні від англійської, використовують більше токенів на слово. Claude Opus 4.7 і новіші моделі також використовують новий токенізатор, який створює приблизно на 30 відсотків більше токенів для ідентичного тексту, ніж Claude Sonnet 4.6 і старіші моделі, тому кількість токенів не можна безпосередньо порівнювати між поколіннями моделей. Виконайте вимірювання за допомогою безкоштовного endpoint /v1/messages/count_tokens, передавши модель, яку плануєте запускати.
Чи завжди кешування запитів заощаджує кошти?
Ні. Запис у кеш на 5 хвилин коштує 1.25 базової ставки для вхідних токенів, тому префікс, який записали, але жодного разу не прочитали, коштує на 25 відсотків дорожче, ніж його звичайне надсилання. Кешування стає вигідним уже після першого читання. Воно може не спрацювати з 2 причин, причому без повідомлення про помилку. Якщо кешований префікс змінюється між запитами, пошук не знаходить відповідність, оскільки порівнюється точний префікс. Якщо префікс коротший за мінімальну довжину, яку модель може кешувати, — 1,024 токени для Sonnet 5 і 4,096 для Haiku 4.5, — нічого не кешується, і помилка не повертається. Якщо cache_creation_input_tokens і cache_read_input_tokens обидва мають значення 0, кеш не використовується.
Чому мій рахунок зростав швидше, ніж кількість повідомлень?
Тому що весь діалог надсилається повторно під час кожного кроку. Messages API не зберігає стан, тому 20-й крок діалогу містить усі 19 попередніх кроків як вхідні дані. Якщо в середньому один крок містить 500 токенів, діалог із 20 кроків надсилає приблизно 105,000 вхідних токенів, хоча довжина стенограми становить лише 10,000 токенів. Цикли агентів працюють так само, оскільки кожен результат інструмента залишається в історії. Кешуйте стабільний префікс або узагальнюйте старі кроки й вилучайте їх із запиту.