Ліміти Claude: що робити при вичерпанні
Різниця між лімітами підписки та помилкою HTTP 429 в API. Дізнайтеся, чому зміна моделі не допомагає та як працюють обмеження Claude Pro та Team.
Які ліміти використання Claude?
Ліміти використання Claude поділяються на дві окремі системи. Спочатку потрібно визначити, яка саме система обмежила доступ. Підписка Claude (Pro, Max, Team або Enterprise) надає скользячий ліміт використання. Цей ліміт спільний для всіх моделей та чату Claude, тому при його вичерпання з'являється повідомлення типу You've hit your session limit · resets 3:45pm. Claude API використовує інший показник: швидкість надсилання запитів та токенів, що розраховується за хвилину. При перевищенні ліміту виникає помилка HTTP 429 типу rate_limit_error та заголовок retry-after, який вказує час очікування у секундах.
Методи вирішення цих проблем відрізняються. Ліміт підписки залежить від обсягу використання за певний період, тому потрібно дочекатися скидання ліміту або придбати додатковий обсяг. Ліміт швидкості (rate limit) API залежить від поточної швидкості запитів; він знімається за кілька секунд після зниження частоти запитів.
Значення лімітів для тарифних планів та рівнів rate limit часто змінюються. Неправильне значення може призвести до помилок, тому тут не наведено конкретних цифр. Перевірте власні показники за допомогою команд, наведених нижче.
Яке обмеження ви перевищили? Прочитайте точне повідомлення
Claude Code вказує назву системи в тексті повідомлення. Перевірте свій варіант, перш ніж щось змінювати.
You've hit your session limit · resets 3:45pm— це ліміт підписки. Ви вичерпали доступний обсяг для вашого тарифного плану у поточному періоді.You've hit your weekly limit · resets Mon 12:00am— та сама система, але для тривалішого періоду.You've hit your Opus limit · resets 3:45pm— це ліміт підписки, який застосовується лише до запитів Opus. Це єдиний випадок, коли перемикання моделі допоможе.API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com.— це ліміт частоти запитів (API rate limit). Ви перевищили ліміт, встановлений для вашого API key або для вашого проекту в Amazon Bedrock або Google Cloud.API Error: Server is temporarily limiting requests (not your usage limit)— це тимчасове обмеження швидкості (throttle), яке не пов'язане з квотою вашого тарифного плану. Claude Code автоматично повторює запит із затримкою (backoff) перед тим, як показати це повідомлення.
Ліміти підписки: сесійні, щотижневі та вікно Opus
План підписки включає скользячий ліміт використання. Коли ліміт вичерпано, Claude Code блокує подальші запити до часу скидання, вказаного в повідомленні. Більшість труднощів викликають дві властивості цього ліміту.
- Ліміт спільний для Claude chat. Робота на claude.ai використовує той самий ліміт, що і робота в terminal, тому активне використання чату вдень зменшує доступний ресурс на вечір кодування.
- Ліміт спільний для різних моделей. Сесійні та щотижневі ліміти не мають окремих квот для кожної моделі, за винятком ліміту Opus.
Для Claude for Teams та Enterprise встановлено ліміт на кожне робоче місце. Ліміт скидається за скользячим п'ятигодинним вікном та щотижневим вікном. Він спільний для Claude chat та Cowork і залежить від рівня підписки (Standard або Premium). У планах Pro та Max орієнтуйтеся на час скидання у повідомленні та власні індикатори /usage, а не на дані з блогів. Якщо ви ще обираєте тариф, який план Claude вам потрібен порівнює обмеження кожного з них.
Чому перемикання моделі за допомогою /model не відновлює доступ
Це найпоширеніша помилка. Документація чітко це зазначає: ліміти сесії та тижневі ліміти є спільними для всіх моделей, тому перемикання моделей не відновлює доступ. Вибір меншої моделі після вичерпання сесійного вікна лише змінює модель, яка буде надавати відповідь. Це не змінює залишок доступного ліміту, оскільки ліміт не прив'язаний до конкретної моделі, тому перемикання не звільняє ресурси.
Винятком є ліміт Opus — це окремий ліміт для цієї моделі. Якщо ви бачите повідомлення You've hit your Opus limit, то правильним рішенням буде /model. Перейдіть на іншу модель і продовжуйте роботу, оскільки заблоковано лише запити до Opus.
Вважати обмеження помилкою — це друга поширена помилка. Перевстановлення або повторна автентифікація нічого не змінять. Ліміт буде відновлено після скидання вікна або після купівлі кредитів використання.
Що робити при досягненні ліміту підписки
- Перевірте час скидання лімітів. Сесійне вікно коротке. Тижневе вікно не потребує очікування за робочим столом.
- Якщо досягнуто ліміту Opus, запустіть
/modelі виберіть іншу модель. - Запустіть
/usage, щоб переглянути ліміти вашого плану, кількість доступних запитів та час їхнього скидання./cost— це аліас для того самого екрана. - Запустіть
/usage-credits, щоб продовжити роботу після досягнення ліміту. На тарифах Pro та Max відкриваються налаштування оплати. На тарифах Team та Enterprise відкриваються налаштування використання організації або надсилається запит адміністраторам, якщо у вас немає доступу до оплати. - Якщо ви щотижня стикаєтеся з однією і тією ж проблемою, ваш план не відповідає вашому обсягу роботи.
Для роботи /usage-credits потрібна підписка claude.ai, оформлена через /login. Функція недоступна при автентифікації через API key, оскільки API key не має лімітів плану для розширення.
Використання кредитів має один важливий побічний ефект. Час життя кешу промптів (prompt cache) становить одну годину при наявності підписки, але скорочується до п'яти хвилин після початку використання кредитів. Через це нові запити виконуються без кешу, і використання токенів Claude Code зростає при тому самому обсязі роботи.
Повідомлення, які схожі на ліміти використання, але не є ними
Чотири помилки Claude Code помилково класифікуються як ліміти використання, хоча це не так.
- Попередження про context або auto-compact не є лімітом використання.
/contextвиводить рядок на кшталтContext exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue., коли діалог перевищує context window моделі. Стара історія стискається для звільнення місця, а ваш ліміт за планом не змінюється. Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again.означає, що/compactне вдалося виконати, оскільки не залишилося достатньо вільного context для створення резюме.Credit balance is too lowозначає, що у вашій організації Console закінчилися передоплачені кредити. Додайте кредити на platform.claude.com/settings/billing, де також доступна функція auto-reload.API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context— це перевірка прав доступу (entitlement check), а не вичерпана квота. Виберіть варіант моделі без суфікса[1m]або встановітьCLAUDE_CODE_DISABLE_1M_CONTEXT=1.
Ще одне повідомлення надходить від API. Помилка 413 request_too_large — це ліміт розміру одного запиту, а не rate limit.
API rate limits: що насправді означає помилка 429
Messages API відстежує три окремі показники для кожного класу моделей:
- кількість запитів за хвилину (RPM)
- кількість вхідних токенів за хвилину (ITPM)
- кількість вихідних токенів за хвилину (OTPM)
Ваша організація також має ліміт витрат (spend limit). Це окремий параметр: максимальна місячна вартість використання API. Коли ви досягаєте ліміту витрат вашого рівня (tier), використання API припиняється до наступного місяця, якщо ви не запитаєте збільшення ліміту. Цикл повторних спроб (retry loop) не допоможе вирішити цю проблему.
Помилка 429 виникає через чотири механізми:
- Ліміти діють для кожного класу моделей окремо. Вони застосовуються до кожної моделі окремо, тому ви можете одночасно використовувати різні моделі в межах їхніх відповідних лімітів. Деякі сімейства моделей використовують спільний ліміт: ліміт для Opus є сумарним для Claude Opus 4.8, Opus 4.7, Opus 4.6 та Opus 4.5, тоді як Claude Sonnet 5 має власний ліміт.
- Поповнення є безперервним. API використовує алгоритм token bucket, тому ємність відновлюється безперервно, а не скидається в фіксований момент часу. Ліміт у 60 запитів на хвилину може бути реалізований як 1 запит на секунду, тому 60 запитів, надісланих одночасно, все одно призведуть до помилки.
- Для більшості моделей у ITPM враховуються лише некешовані вхідні дані.
input_tokensтаcache_creation_input_tokensвраховуються.cache_read_input_tokensдля більшості моделей Claude не враховується, за винятком Claude Haiku 3.5. Таким чином, кешування забезпечує не лише знижку, а й додатковий запас для лімітів. Що стосується вихідних даних, високийmax_tokensне впливає на OTPM, оскільки OTPM враховує лише фактично згенеровані токени. - Ліміти діють на рівні організації. Для робочого простору (workspace) можна встановити нижчий ліміт, але загальноорганізаційні ліміти діють завжди, навіть якщо сума лімітів робочих просторів більша. Якщо ви не перевизначили ліміт для робочого простору, він успадковується від організації, а не стає необмеженим.
Числові значення встановлюються рівнями Start, Build, Scale та Custom. Вони призначаються автоматично на основі історії вашого використання та стану облікового запису. Нові організації можуть мати ліміти нижче стандартних опублікованих значень, тому перша помилка 429 може виникнути раніше, ніж передбачено в таблиці. Різке зростання використання активує ліміти прискорення (acceleration limits), які повертають 429, навіть якщо ви все ще перебуваєте в межах свого рівня. Збільшуйте трафік поступово. Кожне опубліковане значення є верхньою межею: встановлені ліміти — це максимально дозволене використання, а не гарантований мінімум. Щоб попросити більше, скористайтеся елементом керування "Request rate limit increase" на сторінці Limits у Claude Console.
Читання 429: retry-after, заголовки та повторні спроби SDK
Кожна помилка API повертає однаковий контейнер: вкладений об'єкт error з типом та повідомленням, а також верхній рівень request_id.
{
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "<names the rate limit you exceeded>"
},
"request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}Заголовки містять решту даних.
retry-after— це кількість секунд очікування перед наступною спробою запиту. Ранні спроби будуть невдалими.anthropic-ratelimit-requests-limit,anthropic-ratelimit-requests-remainingтаanthropic-ratelimit-requests-resetописують ваш ліміт запитів (request budget).anthropic-ratelimit-input-tokens-*таanthropic-ratelimit-output-tokens-*виконують те саме для ITPM та OTPM, використовуючи ті самі суфікси limit, remaining та reset.anthropic-ratelimit-tokens-*відображає значення для найбільш жорсткого ліміту, що діє на даний момент.
Заголовки reset є часовими мітками формату RFC 3339. Заголовки remaining округлюються до найближчого тисячного значення, тому використовуйте їх як приблизний показник. Fast mode має власний пул та власні заголовки anthropic-fast-*. Зчитуйте всі ці заголовки з будь-якого успішного виклику:
curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
| grep -i 'ratelimit\|retry-after\|request-id'Кожна відповідь також містить унікальний заголовок request-id, наприклад req_018EeWyXxfu5pfWkrYcMdjWG. Він відображається як request_id у тілі помилки та як _request_id у відповідях Python та TypeScript SDK. Наводьте його при зверненні до служби підтримки.
Перевірте, чи дійсно вам потрібен цикл повторних спроб (backoff loop), перш ніж його писати. Офіційні SDK автоматично повторюють тимчасові помилки, включаючи помилки з'єднання, ліміти запитів та помилки сервера 5xx, використовуючи експоненціальний backoff. За замовчуванням виконується дві спроби з урахуванням заголовка retry-after, якщо він присутній. Кожен клієнт підтримує опцію maximum-retries для зміни або вимкнення цієї поведінки.
import anthropic
client = anthropic.Anthropic(max_retries=5) # the SDK default is 2
try:
msg = client.messages.create(
model="claude-sonnet-5",
max_tokens=1024,
messages=[{"role": "user", "content": "hello"}],
)
except anthropic.RateLimitError as err:
headers = err.response.headers
print("still limited after retries; wait", headers.get("retry-after"), "seconds")
print("request id:", headers.get("request-id"))529 overloaded_error не є вашою помилкою
Помилка 429 означає, що ви робите занадто багато запитів. Помилка 529 overloaded_error означає, що API тимчасово перевантажено; це трапляється через високий трафік серед усіх користувачів. Ваші ключ або код не є причиною цієї помилки. Використовуйте повторні спроби з експоненціальною затримкою (exponential backoff) — SDK вже виконують це для відповідей 5xx. Якщо проблема не зникає, перевірте status.claude.com. Помилка 500 api_error є внутрішньою помилкою, яку слід обробляти так само, як і 529. Жодна з цих помилок не є обмеженням частоти запитів (rate limit).
Перевіряйте власні ліміти замість використання таблиць
Для підписки важливим є екран /usage. Він відображає індикатори використання плану та деталізацію витрачених ресурсів. Перемикачі d або w дозволяють вибрати період: останні 24 години або останні 7 днів. Є два зауваження. Блок Session відображає використання API-токенів і призначений для користувачів API, тому підписникам можна ігнорувати суму в доларах. Дані базуються на історії локальних сесій на цій машині, тому використання з інших пристроїв або з claude.ai не враховується.
В частині API сторінка Usage у Claude Console містить два графіки: "Rate Limit - Input Tokens" та "Rate Limit - Output Tokens". Графік input відображає погодинний максимум невкешованих вхідних токенів за хвилину порівняно з вашим поточним лімітом ITPM. Поруч відображається рівень кешування (cache rate), що дозволяє відстежувати наближення до ліміту, а не факт його досягнення у робочому режимі.
Щоб отримати налаштовані ліміти програмно:
curl -s https://api.anthropic.com/v1/organizations/rate_limits \
-H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
-H "anthropic-version: 2023-06-01"Для цього потрібен Admin API key; GET /v1/organizations/workspaces/{workspace_id}/rate_limits виконує те саме для кожного workspace. Обидва методи мають лише режим читання: щоб змінити ліміт, використовуйте вкладку Limits у Console.
Використання less, щоб зменшити кількість обмежень
Обидві системи використовують однакові метрики, тому ці методи діють для обох варіантів.
- Витрачайте менше токенів за один запит. Послідовне виконання завдань підтримує кеш у робочому стані, а
/clearміж непов'язаними завданнями не потребує додаткових витрат. Використання токенів у Claude Code детально описує ці методи. - Зменште рівень навантаження. Доступні рівні:
low,medium,high,xhighтаmax. Меню/effortтакож пропонуєultracode, що збільшує витрати замість їх зменшення. Глибоке обмірковування (deep reasoning) для простої перейменування файлів не є доцільним. - Зменште кількість паралельних запитів після помилки 429. Знизьте
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCYта уникайте використання багатьох паралельних субагентів. Також використовуйте/status: випадковийANTHROPIC_API_KEYспрямовує запити через ключ низького рівня замість вашої підписки. - Перенесіть неінтерактивні завдання у Message Batches API. Цей інструмент виконує великі обсяги даних асинхронно з 50% знижкою на вхідні та вихідні токени. Він має власні ліміти частоти запитів, тому нічні завдання не заважатимуть вашій поточній сесії.
Роботу, що виконується програмою, а не людиною, слід одразу переводити на використання API key. Ваш перший Claude API додаток на VPS містить інформацію про роботу з ключами та повторними спробами. Тривале виконання агента не перерветься при розриві з'єднання, якщо використовувати Claude Code у tmux на VPS.
FAQ
Чому зміна моделі не вирішує проблему з лімітом використання Claude?
Ліміти сесії та тижня є спільними для всіх моделей. Ліміт належить тарифному плану, а не конкретній моделі, тому /model змінює лише модель відповіді, а не залишок доступного обсягу. Єдиний виняток — You've hit your Opus limit, що стосується лише запитів до Opus. У цьому випадку зміна моделі є офіційним способом вирішення.
Що означає помилка 429 rate_limit_error і скільки потрібно чекати?
Це означає, що ваш акаунт досяг ліміту запитів для цього класу моделей: кількість запитів за хвилину, кількість вхідних токенів за хвилину або кількість вихідних токенів за хвилину. Відповідь містить заголовок retry-after із кількістю секунд очікування; повторні спроби до закінчення цього часу призведуть до помилки. Офіційні SDK вже мають вбудований механізм повторних спроб для rate limits та помилок 5xx з використанням exponential backoff (за замовчуванням двічі), враховуючи цей заголовок. Якщо помилка 429 виникає при дотриманні лімітів вашого рівня, це свідчить про обмеження через раптове зростання навантаження.
Як переглянути ліміти використання Claude та час їхнього оновлення?
У Claude Code виконайте /usage, щоб побачити графіки тарифного плану, час оновлення та деталізацію використання; /cost є аліасом, а d або w дозволяють перемикатися між даними за останні 24 години та останні 7 днів. Ці дані базуються на локальній історії сесій, тому вони не враховують використання на інших пристроях або на сайті claude.ai. В API Console відображає графіки ваших rate limits, а GET /v1/organizations/rate_limits повертає ваші налаштовані ліміти за допомогою Admin API key.
Чи можу я продовжувати роботу після досягнення ліміту тарифного плану Claude?
Іноді так. Виконайте /usage-credits, щоб докупити обсяг використання понад ліміт на тарифах Pro та Max, або щоб надіслати запит адміністратору на тарифах Team та Enterprise; для цього потрібен вхід у claude.ai через /login, функція недоступна при автентифікації через API key. В іншому випадку зачекайте на час оновлення лімітів, змініть модель (якщо було досягнуто ліміту Opus) або перенесіть роботу на API key, де ліміти розраховуються за хвилину, а не за часовий інтервал.