Яку модель Claude обрати: порівняння вартості
Порівняння тарифів Claude Opus 4.8, Sonnet 5 та Haiku 4.5 станом на липень 2026 року. Розрахунок витрат на 100 000 запитів та аналіз ціни за MTok.
Яку модель Claude мені використовувати?
Коротка відповідь на питання щодо вибору моделі Claude: починайте з Claude Opus 4.8 і переходьте на інші моделі лише за наявності конкретної причини. Рекомендації Anthropic збігаються з цим: «Якщо ви не впевнені, яку модель обрати, використовуйте Claude Opus 4.8 для складного агентного програмування та корпоративних завдань». Переходьте на Claude Sonnet 5, коли завдання чітко визначене і ви виконуєте його багато разів на день. Знову переходьте на Claude Haiku 4.5 для механічної, великої за обсягом роботи, де ви вже знаєте, як має виглядати правильна відповідь. Claude Fable 5 є найпотужнішою моделлю для довготривалих агентів.
Вибір моделі впливає на вартість. Нижче наведено тарифи Claude API (application programming interface) станом на 23 липня 2026 року за мільйон токенів (у документації — MTok).
- Claude Fable 5 (
claude-fable-5): $10 / MTok вхідні, $50 / MTok вихідні. Контекст 1M. - Claude Opus 4.8 (
claude-opus-4-8): $5 вхідні, $25 вихідні. Контекст 1M. - Claude Opus 4.7 (
claude-opus-4-7): $5 вхідні, $25 вихідні. Контекст 1M. - Claude Sonnet 5 (
claude-sonnet-5): $2 вхідні, $10 вихідні за ознайомчою ціною до 31 серпня 2026 року. Стандартний тариф $3 вхідні, $15 вихідні діятиме з 1 вересня 2026 року. Контекст 1M. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 вхідні, $5 вихідні. Контекст 200K.
Ці ідентифікатори є повними у такому вигляді. До них нічого не додається.
Обсяг запиту не впливає на вартість моделей з контекстом 1M: «Запит на 900k токенів тарифікується за тією ж ставкою за токен, що і запит на 9k токенів».
Призначення кожної моделі
Anthropic описує лінійку одним реченням для кожної моделі. Ці описи є надійнішими за будь-які рейтинги.
- Claude Fable 5: "Інтелект наступного покоління для тривалих агентів." Найповільніша модель серед чотирьох за показником latency.
- Claude Opus 4.8: "Для складного агентного програмування та корпоративних завдань." Помірний latency.
- Claude Sonnet 5: "Найкраще поєднання швидкості та інтелекту." Швидка.
- Claude Haiku 4.5: "Найшвидша модель з інтелектом рівня frontier."
Haiku 4.5 також має обмеження, які визначають придатність для завдань швидше за ціну. Її context window становить 200K tokens замість 1M, тому великий репозиторій або довгий транскрипт агента не поміститься. Максимальний output через synchronous Messages API становить 64K tokens, тоді як у інших моделей — 128K. Дата актуальності знань (knowledge cutoff) для цієї моделі — лютий 2025 року, тоді як у трьох інших — січень 2026 року.
Як вибір моделі впливає на вартість реального навантаження?
У всій лінійці ціна вихідних токенів у п'ять разів вища за ціну вхідних. Для Opus 4.8 це $5 за вхід і $25 за вихід. Для Haiku 4.5 це $1 за вхід і $5 за вихід. Співвідношення залишається незмінним для всіх моделей, тому вибір моделі критично впливає на вартість завдань із великим обсягом вихідних даних.
Агентна робота належить саме до такого типу завдань, оскільки токени роздумів (thinking tokens) тарифікуються як вихідні токени і враховуються в max_tokens, навіть якщо текст не передається користувачеві. У Fable 5, Opus 4.8, Opus 4.7 та Sonnet 5 резюме роздумів за замовчуванням відсутнє, тому поле thinking повертається порожнім. Тарифікація не змінюється: "У будь-якому випадку блок тарифікується однаково і повертається однаково у багатоходових діалогах". Що насправді формує рахунок за Claude детально розбирає цей механізм.
Наявність процесу роздумів відрізняється у моделях, які ви порівнюєте; пропуск цього фактора призведе до помилкових результатів тестування витрат. У Sonnet 5 та Fable 5 функція thinking увімкнена за замовчуванням і не потребує налаштування. В Opus 4.8 та Opus 4.7 вона вимкнена, доки ви не встановите thinking: {type: "adaptive"} у запиті. Перед аналізом показників переконайтеся, що конфігурація на обох сторонах збігається.
Чому найдешевша модель може виявитися найдорожчою
Візьмемо одне окреме завдання з програмування. Запит містить 60,000 токенів контексту, а модель генерує 8,000 токенів відповіді, включаючи процес роздумів (thinking). Без використання кешування сума витрат розраховується прямо.
На Opus 4.8: 0.06 MTok вхідних даних за $5 становить $0.30, а 0.008 MTok вихідних даних за $25 становить $0.20. Одна спроба коштує $0.50. На Haiku 4.5 та сама спроба коштує $0.06 плюс $0.04, тобто $0.10.
Haiku у п'ять разів дешевша за одну спробу. Це здається значною економією, доки ви не проаналізуєте наслідки невдалої спроби. Ви отримуєте неправильну відповідь, що витрачає ваш час. При повторному запиті ви додаєте цю відповідь як контекст, тому кожна наступна спроба стає більшою за попередню. Якщо третя спроба також не дала результату, ви переходите на дорожчу модель: $0.30 за Haiku плюс $0.50 за Opus становить $0.80, що на 60% дорожче за один запуск Opus.
Отже, ключове питання полягає в тому, наскільки дешево ви можете перевірити відповідь. Якщо помилку в відповіді можна помітити за одну секунду, маленька модель є вигідною. Якщо для виявлення помилки потрібно ретельно переглядати diff, маленька модель витрачає ваш час, який не відображається у рахунку.
Випадки, коли менша модель є безумовним лідером
Haiku 4.5 є оптимальним вибором у таких ситуаціях:
- Механічна робота суб-агента. Суб-агенту, який перейменовує файли або збирає результати пошуку, не потрібне складне логічне мислення. Це стандартний сценарій після того, як ви створюєте AI agent за допомогою Claude та надаєте йому допоміжні інструменти.
- Сортування логів. Визначення того, чи є рядок шумом, чи він потребує уваги людини, — це вузьке завдання з очевидним сценарієм помилки.
- Класифікація за фіксованим набором міток. Вихідні дані короткі, а точність можна виміряти на вибірці.
- Високооб'ємні виробничі запити. При 100,000 запусках на день різниця в ціні за токен стає суттєвою. Це типовий вигляд AI workflows, інтегрованих в n8n.
- Будь-які завдання, де користувачеві важлива швидкість відповіді. Haiku 4.5 є найшвидшою моделлю в лінійці.
Haiku має одне специфічне обмеження. Мінімальний розмір промпту для кешування становить 4,096 tokens, тоді як у Opus 4.8 та Sonnet 5 цей показник дорівнює 1,024. Якщо кількість токенів менша за цей мінімум, "будь-які запити на кешування менше ніж ця кількість токенів будуть оброблятися без кешування, і помилка не повертається". Блок інструкцій у 1,500 tokens, який кешується в Sonnet 5, безпомітно не кешується в Haiku 4.5. Ознакою є те, що cache_creation_input_tokens та cache_read_input_tokens дорівнюють нулю, що допомагає знизити витрати на постійно активного агента наряду з іншими причинами втрати кешу.
Параметри, що змінюють результат
Кожен із цих факторів впливає на вартість значно сильніше, ніж назва моделі.
Effort. output_config.effort визначає обсяг обчислень, які виконує модель перед наданням відповіді. Доступні рівні: low, medium, high, xhigh та max; за замовчуванням встановлено high: "Встановлення effort на high дає точно таку ж поведінку, як повне видалення параметра effort." Цей параметр є вкладеним у output_config, а не знаходиться на верхньому рівні запиту:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Параметр Effort впливає на кожен токен у відповіді: "Він може впливати на витрати всіх токенів, включаючи виклики інструментів (tool calls). Наприклад, низький рівень effort означає, що Claude робитиме менше викликів інструментів." Це створює ефект накопичення в агентних циклах. Це не обмеження кількості токенів: "Effort — це сигнал поведінки, а не жорсткий бюджет токенів." Anthropic не публікує коефіцієнт вартості для кожного рівня і рекомендує тестувати власні сценарії використання. Отже, порівняння роботи Sonnet 5 на рівні high та Opus 4.8 на рівні low є актуальним для проведення вже сьогодні. Модель Haiku 4.5 не входить до списку моделей, що підтримують параметр effort.
Prompt caching. Читання з кешу коштує 0.1x від базової вартості вхідних даних; саме цей коефіцієнт визначає вибір моделі залежно від тарифного плану. Кеш-потрапляння (cache hit) для Opus 4.8 коштує $0.50 / MTok, тоді як вхідні дані без кешування для Haiku 4.5 коштують $1 / MTok. Отже, добре кешований префікс Opus коштує дешевше за вхідний токен, ніж "холодний" промпт Haiku. Оптимізація сесії (session hygiene) є ефективнішою за вибір моделі для будь-якого навантаження, що повторно надсилає великий стабільний префікс.
Batches. Якщо відповідь не є терміновою, Message Batches API виконує ті самі моделі з "50% знижкою як на вхідні, так і на вихідні токени". Це зменшує вартість кожного рядка у наведеному нижче порівнянні вдвічі; це працює для всіх рівнів: пакетне завдання Opus 4.8 коштує менше, ніж синхронне завдання Sonnet 5 за стандартною ціною станом на 1 вересня 2026 року, дозволяючи замінити затримку (latency) на вищу якість за ті ж самі гроші.
Порівняння вартості одного робочого навантаження
Робоче навантаження: класифікація 100,000 службових електронних листів. Один запит на кожен лист, 2,000 вхідних токенів та 300 вихідних токенів на запит. Це 200 MTok вхідних даних та 30 MTok вихідних даних.
- Haiku 4.5: 200 x $1 = $200 вхід, 30 x $5 = $150 вихід. Разом $350.
- Sonnet 5, вступна ставка: 200 x $2 = $400 вхід, 30 x $10 = $300 вихід. Разом $700.
- Sonnet 5, з 1 вересня 2026: 200 x $3 = $600 вхід, 30 x $15 = $450 вихід. Разом $1,050.
- Opus 4.8: 200 x $5 = $1,000 вхід, 30 x $25 = $750 вихід. Разом $1,750.
Змініть чотири числа, щоб перерахувати вартість за завтрашніми цінами. Наведені нижче коригування змінюють результат сильніше, ніж назва моделі:
- Batching зменшує вартість кожного рядка вдвічі: $175, $350, $525 та $875. При нічному запуску класифікації затримки відсутні, тому немає причин відмовлятися від цього методу.
- Кешування спільного префікса. Припустимо, 1,200 з 2,000 вхідних токенів — це один і той самий блок інструкцій для кожного запиту. Для Sonnet 5 за вступною ставкою вартість кешованих токенів становить $0.20 / MTok замість $2 / MTok. Отже, 120 MTok коштуватимуть $24 замість $240. Додайте 80 MTok нових вхідних даних за $2 ($160) та $300 на вихідні дані. Тоді вартість Sonnet 5 становитиме близько $484 замість $700. Цей метод не працює для Haiku 4.5, оскільки 1,200 токенів менше за мінімальний поріг у 4,096 токенів.
- Повторні спроби (Retries). Припустимо, ви відхиляєте відповідь Haiku у 8% випадків і запускаєте ці запити знову на Opus 4.8. Додайте 0.08 x $1,750 = $140 до $350, що дасть $490. Вимірюйте власний рівень відхилень, а не використовуйте мої дані.
- Визначення інструментів (Tool definitions), якщо завдання їх використовує. Системний промпт, який вони генерують, становить 290 токенів на Opus 4.8 при
tool_choiceвстановленому наauto, 354 токени на Sonnet 5 та 496 токенів на Haiku 4.5. Найдешевша модель має найбільші фіксовані витрати.
Haiku зі шляхом ескалації за $490 та Sonnet 5 з кешуванням за $484 коштують однаково, при цьому одна з моделей виконує завдання за один прохід. Вибір моделі не є єдиним фактором.
Чи заощаджує зміна моделі під час сесії кошти?
Рідше, ніж вказують ціни, оскільки економія розраховується за кожен token, а під загрозою опиняється весь кешований prefix.
Anthropic описує умови, що роблять кеш недійсним. Prefixes створюються у порядку tools, потім system, потім messages, і «Зміни на кожному рівні роблять недійсними цей рівень та всі наступні рівні». Два налаштування запитів також є у цьому списку: «Конфігурація thinking та розрахований рівень effort вбудовуються безпосередньо в prompt, тому зміна будь-якого з них створює новий кеш prefix». У документації щодо effort наведено додаткову пораду: «змінюйте effort між робочими навантаженнями, а не в межах одного діалогу, що залежить від cache hits».
Модель не входить до цього переліку, тому не робіть припущень. Перевірте cache_read_input_tokens під час першого запиту після зміни моделі, щоб отримати точний результат. Для prefix Opus обсягом 150,000 token читання з кешу коштує близько $0.08, а новий запис — близько $0.94, що перевищує різницю в ціні за token за кілька ходів, яку ви намагалися отримати.
Змінюйте ці параметри між завданнями, а не всередині одного. У Claude Code це означає спочатку /clear, коли кеш і так видаляється, а потім /model або /effort.
Як протестувати відповідь на власному робочому навантаженні
Не розраховуйте розмір prompt на основі даних іншої моделі. Використання endpoint для підрахунку токенів є безкоштовним. Він використовує tokenizer тієї моделі, яку ви вкажете, тому вказуйте саме ту модель, яку плануєте викликати. Opus 4.7 та пізніші, Fable 5 та Sonnet 5 використовують новий tokenizer, який «генерує приблизно на 30% більше токенів для того самого тексту». Через це бюджет, розрахований для старої моделі, буде заниженим для нової при тій самій вартості за токен.
Потім проаналізуйте отримані дані. input_tokens — це лише залишок без кешування, тому реальний розмір prompt складається з цього поля, плюс cache_creation_input_tokens, плюс cache_read_input_tokens. Перший Claude API додаток на VPS — це найпростіший спосіб провести це вимірювання, а вибір Claude плану під ваше використання — це окреме рішення щодо того, чи потрібно взагалі платити за кожен токен.
FAQ
Яка модель Claude найкраща для програмування?
Claude Opus 4.8 є рекомендованою базовою моделлю для складного агентного програмування; станом на липень 2026 року вартість становить $5 за мільйон вхідних токенів та $25 за мільйон вихідних. Claude Sonnet 5 вважається найкращим поєднанням швидкості та інтелекту; до 31 серпня 2026 року за ціною $2 / $10 вона коштує менше ніж у два рази. Виконайте одне й те саме завдання на обох моделях, залиште конфігурацію thinking незмінною та порівняйте загальні витрати токенів за допомогою response.usage.
Чи достатньо дешева Claude Haiku 4.5, щоб замінити Sonnet 5?
За ціною за токен — так: $1 / $5 проти $2 / $10 для Sonnet 5 за вступною ціною, або $3 / $15 з 1 вересня 2026 року. Рішення приймають ліміти. Haiku 4.5 має контекстне вікно у 200K токенів замість 1M, максимальний вихід 64K через синхронний Messages API, дату актуальності знань (knowledge cutoff) на лютий 2025 року, відсутність підтримки output_config.effort та мінімальний кешований промпт у 4,096 токенів, що вимикає кешування для коротких системних промптів.
Чи заощаджує гроші перехід на дешевшу модель Claude під час сесії?
Рідше, ніж здається. Anthropic визначає інвалідатори кешу як зміни в префіксах tools, system або messages, зміни в конфігурації thinking та зміни в output_config.effort. Вплив зміни моделі на існуючий кеш не задокументований, тому вважайте це невідомим параметром і перевірте cache_read_input_tokens під час першого наступного запиту. Це важливо: для префікса Opus 4.8 обсягом 150,000 токенів читання з кешу коштує близько $0.08, а новий запис — близько $0.94, що перевищує економію від кількох ходів. Перемикайтеся між завданнями лише після /clear у Claude Code, коли кеш все одно видаляється.
Як параметр output_config.effort впливає на рахунок?
Він змінює кількість токенів, які модель витрачає на текст, виклики інструментів (tool calls) та thinking. Низький рівень effort зменшує кількість викликів інструментів, що накопичується в агентних циклах, оскільки кожен результат інструмента надсилається повторно на наступних ходах. Доступні рівні: low, medium, high, xhigh та max, за замовчуванням — high. Anthropic не публікує коефіцієнт вартості для кожного рівня, називаючи effort поведінковим сигналом, а не бюджетом токенів, тому тестуйте його на власних завданнях.
Скільки дозволяє заощадити Claude Batches API?
50% на вхідних та вихідних токенах в обмін на асинхронну доставку. Станом на липень 2026 року вартість становить: Opus 4.8 — $2.50 (вхід) / $12.50 (вихід), Sonnet 5 — $1 / $5 (вступна ціна), Haiku 4.5 — $0.50 / $2.50. Варто помітити порівняння між рівнями: пакетне завдання Opus 4.8 коштує менше, ніж синхронне завдання Sonnet 5 за стандартною ставкою з 1 вересня 2026 року, тому пакетна обробка дозволяє використовувати потужнішу модель за ті ж гроші.