Чому Claude такий дорогий: математика токенів
Вихідні токени коштують у 5 разів дорожче за вхідні, а кожен запит повторно читає весь контекст. Розбір одного сеансу та 4 способи зменшити витрати.
Чому Claude дорогий? Коротка відповідь
Claude дорогий з чотирьох причин, які підсилюють одна одну. Токени виведення тарифікуються за ставкою, що у п’ять разів вища за ставку для токенів введення. API не зберігає історію вашої розмови, тому всю історію надсилають повторно й повторно тарифікують під час кожного обміну. Агент перетворює одне запитання на десятки викликів API, і кожен виклик містить історію, що постійно збільшується. Крім того, frontier model тарифікується відповідно до складності виконуваної роботи, а не до вартості запуску малої моделі.
Токен — це фрагмент тексту. Для приблизної оцінки можна вважати, що один токен містить близько чотирьох символів або близько 0.75 англійського слова. Тарифи вказують за мільйон токенів у форматі MTok (million tokens). Усі наведені нижче тарифи — опубліковані тарифи Claude API станом на August 2026.
Більшість несподіваних рахунків виникає через другу й третю причини з цього списку. Зазвичай користувачі вважають, що грошей коштують відповіді, які пише Claude. Під час сеансу агента написання тексту часто становить менше однієї десятої рахунку.
Опубліковані тарифи, щоб узгодити цифри
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]Звертайте увагу на співвідношення, а не на абсолютні значення. Кожна модель стягує рівно вп’ятеро більше за вихідні дані, ніж за вхідні. Opus 5 коштує 5 доларів за мільйон вхідних токенів і 25 доларів за мільйон вихідних токенів. Haiku 4.5 коштує 1 і 5 відповідно. Отже, різниця між найдешевшою та найдорожчою моделями становить п’ять разів, а різниця між читанням і записом також становить п’ять разів.
Sonnet 5 має початкові тарифи 2 і 10 доларів за мільйон до 31 серпня 2026 року включно. З 1 вересня 2026 року тарифи становитимуть 3 і 15. Тарифи змінюються разом із випуском нових версій моделей, тому перевірте актуальні значення, перш ніж складати на їх основі бюджет. Безкоштовного рівня нижче цієї таблиці також немає, хоча нові облікові записи отримують невеликий кредит, а деякі частини API взагалі нічого не коштують.
Останній стовпчик містить тариф на читання з кешу. Саме він найбільше впливає на більшість рахунків. Повернімося до нього після арифметичних розрахунків.
Чому вихідні токени коштують у п’ять разів дорожче за вхідні?
Читання та запис потребують різного обсягу обчислень. Вхідні токени обробляються за один прохід. Модель читає весь prompt одразу, а обчислення виконуються паралельно для всього prompt. Тому prompt на 60,000 токенів не потребує для читання у 60,000 разів більше часу, ніж prompt на 1,000 токенів.
Вихідні токени генеруються по одному. Для кожного нового токена потрібен окремий прохід через модель, причому модель використовує як контекст усі попередні токени. Запис 1,000 токенів означає 1,000 проходів один за одним. Таку послідовну роботу не можна розподілити так само, як читання, тому кожен вихідний токен довше займає апаратні ресурси.
Тому вказівка «зробіть відповідь коротшою» дає менший ефект, ніж можна очікувати. Вона впливає на меншу частину рахунку агента.
Чому всю мою розмову знову оплачують під час кожного запиту?
Claude API не зберігає стан. На стороні Anthropic немає розмови, до якої додається ще одне повідомлення. Кожен запит містить усю історію повідомлень, і модель читає її повністю, перш ніж сформувати відповідь. Тому під час 30-го запиту оплачуються також запити з 1-го по 29-й.
Через це вартість розмови зростає швидше, ніж її довжина. Під час 1-го запиту обробляється невеликий контекст. Під час 40-го — великий. Якщо підсумувати всі 40 запитів, виявиться, що ви заплатили за обсяг токенів, у багато разів більший за кількість токенів, які фактично було написано.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]Наведена вище сесія починається з 20,000 токенів. Це системний промпт, визначення інструментів і перші файли, які відкрив агент. На момент 40-го запиту контекст містить 100,000 токенів. Якщо усереднити цей показник для всіх 40 запитів, вийде приблизно 60 000 токенів, прочитаних під час кожного запиту.
Чому агент коштує значно дорожче за чат?
Чат — це один запит на одне запитання. Агент — це один запит на кожен крок. Читання файлу — це крок. Запуск тесту — це крок. Читання результату тесту — це крок. Редагування файлу — це крок. Для coding agent сорок кроків, щоб виконати одне завдання, — звичайна ситуація.
Використання інструментів створює ще дві додаткові статті витрат. Опис інструментів — це вхідні токени в кожному запиті, оскільки модель щоразу має отримувати інформацію про доступні інструменти. Anthropic публікує ці накладні витрати: system prompt для використання інструментів в Opus 5 із tool_choice, встановленим у auto, містить 286 токенів, не враховуючи токени власних схем інструментів. За деякі серверні інструменти також стягується окрема плата. Вебпошук тарифікується як $10 за 1,000 пошуків додатково до токенів, які споживають результати.
Кожен результат роботи інструмента також назавжди залишається в контексті. Команда, яка виводить 3,000 рядків, додає ці 3,000 рядків до кожного наступного запиту в межах сеансу. Використання токенів за сеанс, яке показує Claude Code, робить це видимим: стежте, як значення вхідних токенів зростає одразу після команди з великим обсягом виводу.
Арифметика одного реального сеансу
Ось реалістична година агентного програмування на Opus 5. Виконано сорок API-запитів. Контекст збільшується з 20,000 до 100,000 токенів, тому в середньому на один запит припадає близько 60,000 токенів. Модель записує близько 700 токенів на запит. Це поєднання коротких викликів інструментів і кількох довших блоків коду.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]Погляньте на розподіл. Читання коштувало 12.00 доларів, а запис — 0.70 доларів, тому фактично прочитаний вами результат становить близько п’яти відсотків рахунку. Модель записала 28,000 токенів, а за читання їй нарахували плату за 2,400,000 токенів. Ніхто не вводив 2.4 мільйона токенів. Ті самі 100,000 токенів читалися знову й знову.
Рівень 1: кешування промптів — найбільший чинник економії
Кешування промптів зберігає оброблену форму стабільного префікса промпту. У наступному запиті цей префікс зчитується з кешу, а не обробляється повторно. Запис у кеш коштує 1.25 від тарифу на вхідні дані для кешу на п’ять хвилин або 2 від тарифу для кешу на одну годину. Зчитування з кешу коштує 0.1 від тарифу на вхідні дані. Для Opus 5 це 0.50 доларів за мільйон замість 5 доларів.
Застосуймо це до наведеної вище сесії. Кожен із 100,000 токенів записується в кеш один раз у міру зростання розмови. Решта 2,300,000 вхідних токенів стають операціями зчитування з кешу.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48Позначте частину, яку можна кешувати, полем cache_control. Розмістіть точку переривання після вмісту, який не змінюється між ходами: системного промпту та визначень інструментів. Довгий документ, до якого ви постійно звертаєтеся, також має належати до цього стабільного блока.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}Тепер порядок промпту визначає витрати. Для влучання в кеш потрібен точний збіг від самого початку промпту, тому все, що змінюється в кожному запиті, має розташовуватися після всього незмінного вмісту. Якщо розмістити часову мітку на початку системного промпту, кеш порушуватиметься на кожному ході: увесь префікс стане промахом, і ви знову заплатите 1.25 від тарифу на вхідні дані за його запис.
Відповідь покаже, чи спрацювало кешування. Надішліть запит і перегляньте блок статистики використання.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'Кожна відповідь містить об’єкт usage такого вигляду:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Якщо повторний запит і далі показує 0 у cache_read_input_tokens, це означає, що кеш не використовується. Зазвичай причина полягає в тому, що щось перед точкою переривання змінилося. Кеш на п’ять хвилин також завершує строк дії, тому запит, надісланий через шість хвилин, дає промах, після якого виконується новий запис.
Важіль 2: передавайте прості кроки меншій моделі
Більшість кроків у сеансі агента не є складними. Відкрити файл, запустити форматування, прочитати diff. Для цього не потрібна frontier model. Передавання таких кроків до Haiku 4.5 зменшує ставку за вхідні дані з 5 доларів за мільйон до 1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]Той самий сеанс коштує 12.70 доларів на Opus 5 без кешування, 2.48 з кешуванням, 0.99 на Sonnet 5 з кешуванням і 0.50 на Haiku 4.5 з кешуванням. Саме кешування усуває приблизно вісімдесят відсотків витрат. Вибір моделі усуває більшість решти витрат.
Є важливе застереження. Якщо дешевша модель дасть неправильну відповідь, вам доведеться повторно оплатити весь сеанс, а також витратити власний час. Вибирайте модель за складністю завдання, а не за ціною. Це правило працює і в інший бік: Claude Fable 5 коштує дорожче за Opus 5 — $10 і $50 за мільйон відповідно, тому перед передаванням кроку цій моделі прочитайте що дають вам ці ставки. У матеріалі Вибір між Opus, Sonnet і Haiku описано, у яких завданнях кожна з них працює надійно.
Рівень 3: гігієна контексту
За кожен токен, який залишається в контексті, ви платите на кожному наступному ході. Тому раннє видалення токена набагато вигідніше за пізнє. Файл на 5,000 токенів, доданий на 5-му ході сесії з 40 ходів, буде прочитано ще 35 разів. Це 175,000 додаткових вхідних токенів, що для Opus 5 коштує майже долар через одну необережну вставку.
Чотири звички, які допомагають зменшити це число:
- Починайте нову сесію для нового завдання, а не продовжуйте вчорашню.
- Фільтруйте шумний вивід команд до того, як він потрапить у модель, наприклад за допомогою
head -50, а не після цього. - Запитуйте лише потрібну функцію, а не весь файл.
- Якщо довга сесія перестала просуватися, попросіть створити підсумок і почніть з нього нову сесію. Підсумок містить кілька сотень токенів. Транскрипт — сотню тисяч.
Важіль 4: об’єднуйте в пакет усе, що не потребує інтерактивної взаємодії
Batch API обробляє запити асинхронно та зменшує вартість і вхідних, і вихідних даних на 50 відсотків. Якщо для завдання не потрібна відповідь протягом наступної секунди, обробляйте його пакетно. Це стосується класифікації, вилучення даних, узагальнення накопичених матеріалів і запусків оцінювання. Знижка за пакетну обробку додається до знижки за кешування промптів. Вона не застосовується до інтерактивного сеансу, оскільки в такому разі чекати немає на що.
Чи не переплачую я?
Саме це питання насправді стоїть за запитом «чому Claude дорогий», тому ось пряма відповідь. Тарифи опубліковані, для всіх вони однакові на стандартних рівнях і розраховуються за токенами. Винятком є контракт за індивідуальними умовами. Навіть у такому разі тарифи Claude Enterprise додають плату за кожне місце до вартості тих самих токенів, що обліковуються за використанням, а не замінюють її. У рахунку немає довільних нарахувань. Тарифна таблиця не показує лише одного: чи отримуєте ви належну цінність. Вона визначає ціну токенів, а вас цікавить результат.
Тому оцінюйте ціну результату. Наведена вище сесія без кешування коштувала 12.70 доларів. Якщо завдяки їй було реалізовано функцію, на яку у вас пішла б година, це дешево. Якщо вона витратила сорок ходів на безрезультатне повторення одного й того самого, ті самі 12.70 доларів не дали нічого, і проблема була не в тарифі.
Ось що варто запам’ятати. Ваш рахунок зростає пропорційно до кількості токенів, а не до цінності результату. Продуктивна й марна сесії однакової тривалості коштують однаково. Саме тому чотири важелі важливіші за тарифну таблицю: домовитися про ціну токена ви не можете, але кількість токенів, потрібних для виконання завдання, визначаєте ви.
Тому відстежуйте витрати на виконане завдання, а не витрати на місяць. Якщо це значення зменшується під час налаштування кешування та маршрутизації, ваша конфігурація покращується, навіть якщо місячна сума зростає. Загальна сума зростає тому, що ви виконуєте більше роботи.
Що не зменшує ваш рахунок
Деякі популярні поради майже не допомагають. Вказівка моделі «бути лаконічною» скорочує обсяг відповіді, але відповіді становили лише п’ять відсотків у прикладі рахунку. Скорочення власного запиту заощаджує кількасот токенів у контексті на 60,000 токенів. Вимкнення розширеного міркування допомагає лише тоді, коли токени міркування справді становили значну частину відповіді. Блок usage показує це, тому вам не потрібно здогадуватися.
Більше контекстне вікно саме по собі також не збільшує вартість. У Claude 4.6 і новіших версіях повне вікно на один мільйон токенів тарифікується за стандартною ціною за токен. Тому запит на 900,000 токенів має таку саму ціну за токен, як і запит на 9,000 токенів. Розмір вікна не визначає ціну. Її визначає вміст, який ви додаєте у вікно.
Ще два питання належать до планування, а не до окремого сеансу. Якщо ви користуєтеся сервісом щодня в інтерактивному режимі, порівняйте оплату за токени з фіксованим планом: у порівнянні вартості API та підписки виконано такий розрахунок. Якщо фіксований план вигідніший і ви одночасно розглядаєте іншого постачальника, у порівнянні планів Claude і ChatGPT з цінами поруч виконано такий самий розрахунок для обох сервісів. Якщо агент працює без нагляду на сервері, спочатку встановіть жорсткий ліміт витрат, а вже потім змінюйте інші налаштування. Саме це описано в матеріалі керування витратами AI-агента на VPS. Для загального розуміння масштабу матеріал що насправді можна отримати за один мільйон токенів Claude перетворює тарифну сітку на обсяг тексту в сторінках.
FAQ
Чому мій рахунок за Claude різко зріс після початку використання агента?
Тому що агент надсилає багато запитів на одне запитання, і кожен запит містить увесь попередній контекст розмови. Чат надсилає один запит на одне запитання. Coding agent надсилає один запит на кожен крок, а 40 кроків для одного завдання — це нормально. Кожен із цих запитів тарифікується за повний контекст, тому сесія, яка завершується на 100,000 токенах, загалом може бути тарифікована як понад два мільйони вхідних токенів. Перегляньте input_tokens і cache_read_input_tokens у відповіді API, щоб побачити це безпосередньо.
Чи справді кешування промптів настільки зменшує рахунок?
У розглянутому прикладі воно зменшило вартість сесії з 12.70 доларів до 2.48 доларів, оскільки читання з кешу коштує одну десяту від тарифу на вхідні токени. Економія повністю залежить від частоти влучань у кеш. За використання кешу на 5 хвилин він окупається після одного читання, оскільки запис коштує 1.25 від тарифу на вхідні токени, а читання — 0.1. Якщо ваш промпт змінюється на початку кожного запиту, влучань не буде, і ви даремно платитимете додаткову вартість запису. Перш ніж вважати, що кешування працює, перевірте це за допомогою cache_read_input_tokens.
Чи варто просто використовувати Haiku для всіх завдань?
Ні. Haiku 4.5 коштує 1 доларів за мільйон вхідних токенів проти 5 для Opus 5, тому економія справді відчутна для простих завдань із великим обсягом, таких як класифікація та маршрутизація. Неправильна відповідь у складному завданні коштує дорожче за заощадження на моделі, оскільки додатково доводиться платити за повторний запит і витрачати власний час. Практичний підхід — комбінований: малу модель використовують для механічних операцій, а frontier model — для кроків, що потребують оцінювання.
Чи дешевший API за підписку Claude?
Це залежить від стабільності вашого використання. Підписка має фіксовану місячну ціну та пов’язані з нею ліміти використання. API тарифікується за токен без верхньої межі, тому він дешевший за невеликого або нерегулярного використання та дорожчий, якщо ви активно використовуєте його щодня. Візьміть середню кількість токенів на день із блоку статистики використання, розрахуйте вартість за тарифом вашої моделі, а потім порівняйте її з ціною плану. Для початкового рівня цю ціну наведено в розділі скільки коштує Claude Pro і де закінчуються його ліміти використання. Якщо підсумок на користь API, скасування плану або перехід на нижчий рівень не анулює вже оплачений місяць, оскільки доступ зберігається до кінця поточного розрахункового періоду.