SSD Nodes Learn Hosting plans →
Посібники Matt ConnorВід Matt Connor · Оновлено 2026-08-28

Що таке токени Claude і скільки коштує сесія Code

Токен Claude має близько 3.5 символа. Дізнайтеся, чому один запит Claude Code списує 80,000 токенів, а 5 хвилин простою збільшують ціну в 5 разів.

Що таке токени в Claude?

Токен — це одиниця тексту, яку Claude читає та генерує: фрагмент слова, приблизно 3.5 символа англійською мовою. Це значення наведено у власному глосарії Anthropic. З урахуванням пробілів і розділових знаків на одне слово припадає помітно більше ніж один токен, тому тисяча слів звичайного тексту — це понад 1,300 токенів. Код має більшу токенізацію на рядок: фігурні дужки, оператори, символи підкреслення та відступи створюють більше токенів на символ, ніж англійський текст. Файл із кількома сотнями рядків коду зазвичай містить кілька тисяч токенів. Файл на 2,000 рядків, який агент вирішить прочитати, може вимагати п’ятизначної кількості токенів ще до генерації нового рядка коду.

Є два моменти, які часто спричиняють плутанину щодо токенізаторів. По-перше, вони залежать від моделі. Станом на July 2026 Opus 4.7 і новіші версії, Sonnet 5 та Fable 5 використовують новий токенізатор. Для того самого тексту він створює приблизно на 30% більше токенів, ніж токенізатори попередніх моделей Claude. Точне збільшення залежить від вмісту. Через це змінюються оцінки, які ви робите в токенах, хоча ціна одного токена не зросла. По-друге, tiktoken, бібліотека, до якої звертаються майже всі дописи в блогах, є токенізатором OpenAI. Для звичайного тексту він занижує кількість токенів Claude приблизно на 15–20%, а для коду — ще більше. Єдиний надійний підрахунок надає endpoint count_tokens, описаний нижче.

Чому coding-сесія коштує саме стільки

Кожен рахунок Claude — чи то інвойс за API, чи то ліміт підписки — зводиться до одного лічильника: вхідні токени та вихідні токени. На сторінці з цінами все виглядає просто: певна сума в доларах за мільйон вхідних токенів і певна сума за мільйон вихідних. Але там не пояснюється, що в agentic coding-сесії вхідний лічильник працює значно інтенсивніше, ніж можна припустити, оскільки вся розмова повторно надсилається під час кожного окремого ходу. Я 15 років продавав інфраструктуру з тарифікацією за використанням і ще не бачив іншого лічильника, щодо якого більшість клієнтів справді не могли б сказати, що саме його розкручує. Це інструкція з читання лічильника: що в agentic-сесії зараховується як вхідні та вихідні дані, чому цикл повторного надсилання такий дорогий, як prompt caching змінює розрахунок і які важелі справді впливають на підсумкове значення.

Усе є вхідними даними: що насправді підраховує лічильник

Користувачі вважають, що платять за код, який пише Claude. В агентному сеансі це невелика стаття витрат. Вхідні токени мають нижчу ціну, але їхній обсяг значно більший. До них належать:

  • Системний prompt. Власні інструкції Claude Code для harness, а також ваші CLAUDE.md і файли memory, завантажені на початку сеансу та присутні в кожному наступному запиті.
  • Визначення інструментів. Схеми всіх інструментів, які може викликати агент. Кожен MCP server, до якого ви підключаєтеся, збільшує ці накладні витрати, хоча Claude Code тепер за замовчуванням відкладає завантаження повних визначень інструментів MCP. Тому до першого використання інструмента в контексті зберігаються лише назви інструментів. Це зменшує витрати, але не усуває їх.
  • Кожен файл, який читає агент. Read файлу вихідного коду додає весь файл до контексту, де він і залишається.
  • Кожен результат інструмента. Результати тестів, вивід grep, вивід термінала, журнали збірки — усе це повертається як вхідні токени. Якщо набір тестів із помилкою виводить 8,000 рядків, вам виставляють рахунок за невелику книгу.
  • Уся попередня розмова, яка надсилається повторно під час кожного запиту. Цьому питанню присвячено окремий розділ.

Повторне надсилання, вартість якого ніхто не враховує

Claude API не зберігає стан. Він не пам’ятає вашу сесію між запитами — фактично цього не робить жоден компонент. Тому під час ходу 2 клієнт надсилає хід 1, відповідь на нього та ваше нове повідомлення. Під час ходу 50 він повторно надсилає ходи від 1 до 49, кожен прочитаний файл, кожен результат інструмента, кожен diff і додає хід 50. Модель щоразу повторно читає весь транскрипт, а всі ці повторно прочитані токени тарифікуються як вхідні.

Наслідок такий: вартість одного ходу приблизно лінійно зростає разом із тривалістю сесії, а загальна вартість сесії зростає приблизно квадратично. Повідомлення, яке на ході 3 коштувало півцента, на ході 60 може коштувати в 20 разів дорожче навіть за те саме однорядкове запитання, оскільки воно містить дані всіх 60 ходів. Це основний факт, який пояснює більшість звернень «чому мій рахунок виявився таким високим». І це не особливість Claude: кожен LLM-продукт, який створює враження збереження стану, фактично працює на stateless API з циклом повторного надсилання.

Вивід: що ви бачите, а також приховане обмірковування

Вивідні токени є найдорожчими: їхня вартість у поточній лінійці в п’ять разів вища за вхідні ($5/$25 для Opus 4.8, $3/$15 для Sonnet 5, $1/$5 для Haiku 4.5 станом на July 2026). До виводу належать текст і код, які генерує Claude, а також токени обмірковування: внутрішні міркування моделі перед відповіддю. Тут важливі два факти. Обмірковування оплачується за тарифами для виводу та враховується в max_tokens. Якщо відповідь API завершується з stop_reason: "max_tokens", а відповідь обрізана, це часто означає, що модель витратила бюджет на обмірковування до формування відповіді. Крім того, у поточних моделях підсумок міркувань може взагалі не відображатися: Opus 4.8, Sonnet 5 і Fable 5 не показують його за замовчуванням, але обмірковування все одно відбулося і за нього все одно стягується плата. Невидиме не означає безкоштовне.

Claude Code за замовчуванням вмикає розширене обмірковування, оскільки воно помітно покращує виконання багатокрокових завдань, а стандартний бюджет може сягати десятків тисяч токенів на один запит. Для простіших завдань його можна зменшити: знизьте рівень зусиль за допомогою /effort або в /model чи змініть параметри обмірковування в /config. Це реальний спосіб контролювати витрати, а не забобон.

Кешування промптів змінює розрахунки

Кешування промптів не дає циклу повторного надсилання зробити використання API непомірно дорогим. API може кешувати стабільний префікс вашого промпту, системний промпт, визначення інструментів і історію діалогу, а в наступному запиті обслуговувати їх за частину базової ціни. Станом на July 2026 множники такі: запис у кеш коштує 1.25× базової ставки для вхідних даних (2× для варіанта на 1 годину), а читання з кешу коштує 0.1×. Записи оплачуються дорожче; читання дає знижку 90%. Одне читання вже з лишком компенсує додаткову вартість запису на 5 хвилин.

Claude Code керує кешуванням автоматично, і в нормальній сесії майже весь цей великий повторно надісланий обсяг обслуговується з кешу. Але кеш за замовчуванням зберігається п’ять хвилин від останнього використання. Якщо надовго відійти на каву, повернутися й надіслати повідомлення, кеш уже буде прострочений, а весь накопичений префікс буде записано повторно за тарифом 1.25× замість читання за 0.1×. У сесії на 150K токенів один такий запит після простою коштує більше, ніж десяток запитів із теплим кешем. Це суперечливий, але важливий висновок: ритм «простій — відновлення роботи» може коштувати дорожче за безперервну роботу, оскільки кожна перерва довша за TTL перетворює наступний запит із дешевого читання на дорогий повторний запис. Працюйте окремими відрізками, а не надсилайте по одному повідомленню кожні десять хвилин у межах великої сесії.

Якщо ви викликаєте API з власного застосунку на VPS, це не працює автоматично, а типовою помилкою є вставлення timestamp або request ID у системний промпт. Через це байти префікса змінюються в кожному запиті, і кешування непомітно вимикається. Ознака проблеми — usage.cache_read_input_tokens залишається на нульовому значенні в зовні однакових викликах.

Формула на практичному прикладі

Не орієнтуйтеся на твердження, що «сесія коштує $X». Вартість сесій може відрізнятися у 100 разів. Правильно використовувати таку формулу:

turn cost = (uncached input      x base input price)
          + (cache writes        x 1.25 x base input price)
          + (cache reads         x 0.10 x base input price)
          + (output incl. thinking x output price)

session cost = sum over all turns

Практичний приклад для Claude Opus 4.8, який станом на July 2026 коштує $5 за мільйон вхідних токенів і $25 за мільйон вихідних. Розглянемо проміжний хід у сесії з 80,000 токенами накопиченого контексту: 75,000 зчитано з кешу, 3,000 записано в кеш, 2,000 — нові вхідні токени без кешування, 1,500 — вихідні токени, включно з токенами міркування.

  • Зчитування з кешу: 75,000 × $0.50/M = $0.0375
  • Запис у кеш: 3,000 × $6.25/M = $0.019
  • Вхідні токени без кешування: 2,000 × $5/M = $0.010
  • Вихідні токени: 1,500 × $25/M = $0.0375

Приблизно $0.10 за хід; 50 таких ходів коштуватимуть близько $5. Тепер розглянемо той самий хід після завершення терміну дії кешу: повторний запис усіх 80,000 токенів за ціною $6.25/M коштує $0.50 ще до врахування вихідних токенів. Це приблизно у 5 разів більше, ніж уся сесія з активним кешем, хоча виконувана робота ідентична. Ця різниця в одному числі показує весь ефект кешування. Ті самі чотири рядки — також єдиний коректний спосіб порівнювати постачальників, оскільки опубліковані тарифи не враховують зчитування з кешу й токени міркування. Якщо застосувати їх до трьох реальних завдань, стане зрозуміло, коли рахунок за Claude вищий або нижчий за рахунок OpenAI.

Якщо вам потрібно зрозуміти не вартість окремого ходу, а саму одиницю тарифікації, скільки мільйон токенів становить у сторінках, файлах і доларах — це той самий розрахунок на рівень вище. Для орієнтиру, а не прогнозування: згідно з опублікованими Anthropic показниками для корпоративних розгортань Claude Code, станом на July 2026 середня вартість становить близько $13 на одного розробника за активний день і $150–250 на місяць, а 90% користувачів витрачають менше ніж $30 на день. Ваші витрати залежать від вибору моделі, правил роботи із сесіями та розміру кодової бази. Саме тому важливі наведені нижче параметри.

Перегляд власного використання

У Claude Code для цього використовується команда /usage (/cost також працює, це alias). Блок Session угорі показує статистику токенів і локально обчислену оцінку вартості поточної сесії. На subscription plans цей самий екран показує індикатори лімітів плану та деталізацію, яка розподіляє нещодавнє використання між skills, subagents, plugins і окремими MCP servers. Для точних даних про білінг в API accounts джерелом достовірної інформації є usage page у Claude Console; значення в CLI є оцінкою. /context відображає кольорову сітку того, що займає context window: system prompt, tools, MCP definitions, files і history. Це найшвидший спосіб виявити надмірно великий CLAUDE.md або надто балакучий MCP server. Передайте all, щоб розгорнути повну деталізацію за окремими елементами.

В API кожна відповідь точно показує, що відбулося:

response = client.messages.create(model="claude-sonnet-5", max_tokens=2048,
                                  messages=messages)
u = response.usage
total_prompt = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens
print(f"uncached={u.input_tokens} written={u.cache_creation_input_tokens} "
      f"read={u.cache_read_input_tokens} output={u.output_tokens}")

Зверніть увагу: input_tokens — це лише uncached remainder. Фактичний розмір prompt дорівнює сумі всіх трьох полів input. Agent, який працював протягом години і показує input_tokens: 4000, не є дешевим: інші 200,000 токенів було отримано з cache. Щоб оцінити розмір до надсилання, використовуйте token-counting endpoint. Виклик цього endpoint безкоштовний, він має власний rate limit і використовує tokenizer тієї моделі, яку ви вкажете. Вважайте результат приблизною оцінкою; білінг враховує фактичний request:

count = client.messages.count_tokens(model="claude-sonnet-5",
                                     messages=[{"role": "user", "content": big_file}])
print(count.input_tokens)

Ніколи не tiktoken з наведеної вище причини.

Плани підписки та оплата за фактичне використання

Механіка в цьому посібнику всюди однакова; відрізняється лише спосіб оплати. За API key Anthropic стягує плату за фактичне використання — за кожен token відповідно до опублікованих тарифів. Усі наведені вище числа означають реальні витрати. Оплата починається раніше, ніж очікує більшість користувачів, оскільки безкоштовного рівня немає. Доступні лише невеликий кредит під час реєстрації та кілька endpoint-ів, за які плата не стягується. Докладніше про це див. у матеріалі що фактично отримує новий API-акаунт до додавання платіжної картки. У підписці Claude (Pro, Max, Team, Enterprise) використання Claude Code списується з включеного в план ліміту. Станом на July 2026 це змінне п’ятигодинне вікно сеансу та тижневе вікно, спільні для всіх моделей і чату claude.ai. Сума в доларах /usage має довідковий характер і не є рахунком до оплати. Коли вікно вичерпано, з’являється повідомлення "You've hit your session limit" або "You've hit your weekly limit" із часом скидання ліміту. Перемикання моделей за допомогою /model не відновить доступ, оскільки вікна спільні для всіх моделей. Ці вікна прив’язані до акаунта, а не до клієнта, у якому ви працюєте. Це важливо знати, якщо ви ще з’ясовуєте що працює нативно в Linux і який план охоплює кожен інтерфейс. Від того, яке саме з двох вікон ви вичерпали, залежить тривалість очікування та доцільні дії на цей час. Тому варто знати що робити, якщо ліміт вичерпано посеред завдання. У планах можна додатково ввімкнути кредити на використання. Ними керують за допомогою /usage-credits, щоб оплачувати використання понад ліміт. Я навмисно не наводжу квоти планів: це наймінливіші числа в усьому матеріалі. Натомість перевірте claude.com/pricing і власні індикатори /usage. Механіка роботи з token залишається важливою і для підписки. Неефективний сеанс так само швидко вичерпує ваше вікно, як і витрачає кошти. Щодо підписок див. який план Claude відповідає вашим потребам.

Важелі, які справді працюють

  • Обмежуйте область читання агента. «Виправ помилку валідації у auth.py» означає прочитати один файл; «покращ цей код» — сорок. Стежте, щоб CLAUDE.md залишався компактним: він завантажується в кожен сеанс, тому залишайте в ньому лише основне, а специфічні для робочого процесу інструкції переносіть у skills, які завантажуються за потреби.
  • Пишіть чітко й стисло. /clear між непов’язаними завданнями: застарілий контекст повторно надсилається й оплачується в кожному наступному повідомленні. У межах одного тривалого завдання /compact Focus on the failing tests and the diff стискає історію та не дає витратам зростати квадратично.
  • Добирайте модель відповідно до завдання. Sonnet виконує більшість завдань із програмування за $2/$10 за мільйон токенів за вступною ціною станом на July 2026 ($3/$15 за стандартною ціною, тоді як Opus коштує $5/$25), а Haiku за $1/$5 добре підходить для механічної роботи субагентів, наприклад сортування журналів. Fable 5 перебуває на іншому кінці діапазону — $10/$50, тобто вдвічі дорожче за Opus за обома тарифами, тому варто знати які завдання справді виправдовують таку ціну, перш ніж залишати цю модель вибраною для рутинної роботи. /model перемикає модель у середині сеансу.
  • Попередньо фільтруйте докладний вивід. hook, який відбирає за допомогою grep лише помилки з результатів тестового запуску до того, як Claude їх побачить, скорочує результат інструмента з 20,000 токенів до 300. Це відбувається під час кожного наступного повторного надсилання цього кроку.
  • Пакетно обробляйте неінтерактивні завдання. Для власних API pipelines, класифікації, масового review і нічних завдань Batches API запускає ті самі моделі зі знижкою 50% в обмін на асинхронне отримання результатів.
  • Враховуйте час дії кешу. Працюйте без тривалих перерв. Від’єднаний сеанс Claude Code у tmux на VPS не споживає коштів у режимі очікування: токени витрачаються лише під час виконання запиту, але період бездіяльності вичерпує теплий кеш, і наступний запит знову оплачує повторне записування контексту.

FAQ

Скільки токенів використовує сеанс програмування в Claude Code?

Фіксованої кількості немає. Один обмін посеред сеансу часто містить десятки тисяч prompt-токенів, коли накопичуються файли та історія, а робочий сеанс сягає мільйонів токенів. Більшість із них обслуговується з кешу за десятою частиною базової ціни. Для орієнтиру: за опублікованими Anthropic корпоративними показниками станом на July 2026, середні витрати становлять близько $13 на розробника за активний день, а для 90% користувачів — менше $30. Запустіть /usage у власному сеансі. П’ять хвилин спостереження корисніші за будь-яке опубліковане середнє значення.

Чи тарифікуються thinking-токени, навіть якщо я їх не бачу?

Так. Thinking-токени тарифікуються як output-токени за вищою ставкою та враховуються в max_tokens. Поточні моделі тарифікують їх навіть тоді, коли інтерфейс не показує підсумок міркувань. Якщо відповідь обривається з stop_reason: "max_tokens" до завершення видимої частини, найімовірніше, thinking-токени вичерпали доступний бюджет. У Claude Code зменште рівень effort за допомогою /effort для завдань, які не потребують глибокого міркування.

Чому довгий сеанс Claude Code стає дорожчим для кожного повідомлення?

Тому що API не зберігає стан. Кожен обмін повторно надсилає всю розмову, кожен прочитаний файл, результат інструменту та попередній обмін як вхідні дані, тому обмін 50 містить обміни з 1 до 49. Кешування prompt обслуговує повторюваний префікс приблизно за десяту частину базової ціни input, але сам префікс постійно збільшується. Якщо перерва перевищує cache TTL, наступний обмін повторно надсилається за повною ціною. /compact скорочує історію, а /clear починає її заново.

Як перевірити використання токенів і витрати Claude?

У Claude Code команда /usage показує статистику токенів сеансу, локальну оцінку вартості та індикатори лімітів плану для підписок (/cost — це псевдонім). Команда /context показує, що саме заповнює вікно контексту. Для отримання точних даних про тарифікацію API використовуйте сторінку usage у Claude Console. У власному коді прочитайте response.usage. Сума input_tokens, cache_creation_input_tokens і cache_read_input_tokens дає фактичний розмір prompt. Для попередньої оцінки використовуйте endpoint count_tokens, а не tiktoken.