SSD Nodes Learn Hosting plans →
Посібники Matt ConnorВід Matt Connor · Оновлено 2026-08-28

Ліміти Claude: що робити після їх вичерпання

Заміна моделі не відновить доступ. Дізнайтеся різницю між лімітами сесії та тижня Claude і помилкою API 429, а також наступні кроки.

Які обмеження використання Claude?

Обмеження використання Claude поділяються на дві окремі системи. Спочатку потрібно визначити, яка саме з них вас зупинила. Підписка Claude (Pro, Max, Team або Enterprise) надає ковзний ліміт використання, спільний для всіх моделей і чату Claude. Після його вичерпання з’являється повідомлення на кшталт You've hit your session limit · resets 3:45pm. Claude API використовує інший показник: швидкість надсилання запитів і токенів, яку обчислюють за хвилину. У разі перевищення API повертає помилку HTTP 429 типу rate_limit_error і заголовок retry-after із кількістю секунд до наступної спроби.

Способи усунення цих обмежень не пов’язані між собою. Ліміт підписки залежить від обсягу використання протягом певного періоду. Потрібно дочекатися скидання ліміту або придбати додатковий обсяг використання. Ліміт швидкості API залежить від поточної швидкості запитів. Він зникає за кілька секунд після зменшення швидкості.

Доступні обсяги для планів і номери рівнів лімітів швидкості часто змінюються. Неправильне число гірше за відсутність числа, тому тут їх не наведено. Перевірте власні значення за допомогою команд нижче.

Яку саме межу ви досягли? Прочитайте точне повідомлення

Claude Code називає систему в тексті, який виводить. Визначте свою систему, перш ніж щось змінювати.

  • You've hit your session limit · resets 3:45pm — це ліміт підписки. Доступний для вашого плану ковзний ліміт на цей період вичерпано.
  • You've hit your weekly limit · resets Mon 12:00am — це той самий ліміт у довшому часовому вікні.
  • You've hit your Opus limit · resets 3:45pm — це ліміт підписки, який застосовується лише до запитів Opus. Це єдиний випадок, коли зміна моделі допомагає.
  • API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com. — це ліміт швидкості API. Ви досягли ліміту, налаштованого для вашого API key, або для вашого проєкту Amazon Bedrock чи Google Cloud. Застосовний варіант залежить від способу автентифікації клієнта, оскільки для клієнта Bedrock або Vertex використовується квота вашого cloud-проєкту, а не організації Anthropic.
  • API Error: Server is temporarily limiting requests (not your usage limit) — це короткочасне обмеження швидкості, не пов’язане з квотою вашого плану. Claude Code автоматично повторює запит із поступовим збільшенням інтервалу перед тим, як показати цей рядок.

Ліміти підписки: сесія, тиждень і вікно Opus

План підписки включає динамічний ліміт використання. Коли його вичерпано, Claude Code блокує подальші запити до часу скидання, зазначеного в повідомленні. Найбільше плутанини спричиняють дві властивості цього ліміту.

  • Ліміт спільний для Claude chat. Робота на claude.ai використовує той самий ліміт, що й робота в терміналі, тому активна робота в чаті вдень скорочує доступний час для програмування ввечері. Усі інтерфейси, у яких ви входите за допомогою цього облікового запису, використовують один спільний ліміт. Отже, у Linux бета-версія desktop app і CLI Claude Code витрачають один спільний ліміт, а не по одному кожен.
  • Ліміт спільний для моделей. Ліміти сесії та тижня не мають окремого бюджету для кожної моделі. Єдиний виняток — ліміт Opus.

У Claude for Teams і Enterprise документована модель передбачає ліміт для кожного seat, який скидається за динамічним п’ятигодинним і тижневим вікнами. Цей ліміт спільний для Claude chat і Cowork, а його обсяг залежить від рівня seat (Standard або Premium). У Pro і Max орієнтуйтеся на час скидання, надрукований у повідомленні, і власні смуги /usage, а не на значення, скопійоване з допису в блозі. Якщо ви ще обираєте рівень, у матеріалі який план Claude вам потрібен порівнюється, які можливості обмежує кожен із них.

Чому перемикання моделі через /model не відновлює доступ

Це найпоширеніша помилка. Документація прямо зазначає: ліміти сеансу та тижневі ліміти спільні для всіх моделей, тому перемикання моделі не відновлює доступ. Вибір меншої моделі після вичерпання ліміту сеансу змінює лише модель, яка відповідатиме на запит. Обсяг доступного використання не змінюється, оскільки ліміт ніколи не був окремим для кожної моделі. Тому перемикання нічого не вивільняє.

Винятком є ліміт Opus — справді окремий ліміт для конкретної моделі. Якщо повідомлення має вигляд You've hit your Opus limit, правильне рішення — /model. Перемкніться на іншу модель і продовжуйте роботу, оскільки заблоковано лише запити до Opus.

Вважати ліміт помилкою — друга поширена помилка. Перевстановлення або повторна автентифікація нічого не змінюють. Доступний обсяг відновлюється після скидання ліміту у визначений момент або після придбання кредитів на використання.

Що робити після досягнення ліміту підписки

  1. Перевірте час скидання ліміту. Вікно сесії коротке. Тижневого скидання не варто чекати, не відходячи від робочого місця.
  2. Якщо досягнуто ліміту Opus, виконайте /model і виберіть іншу модель.
  3. Виконайте /usage, щоб переглянути ліміти свого плану, індикатори використання та час їх скидання. /cost є псевдонімом для того самого екрана.
  4. Виконайте /usage-credits, щоб продовжити роботу після досягнення ліміту. У планах Pro і Max відкриваються налаштування оплати. У планах Team і Enterprise відкриваються налаштування використання організації або надсилається запит адміністраторам, якщо у вас немає доступу до оплати.
  5. Якщо щотижня ви досягаєте того самого ліміту, план не відповідає вашому способу роботи. Доступні способи обійти ліміт використання варто оцінити один раз, а не під час кожного скидання.

Для /usage-credits потрібна активна підписка claude.ai, виконаний вхід через /login. Ця можливість недоступна за автентифікації за допомогою API key, оскільки API key не має ліміту плану, який можна розширити.

Кредити на використання мають один важливий побічний ефект. Час життя кешу prompt становить одну годину для підписки та скорочується до п’яти хвилин, коли ви використовуєте кредити. Через це більше запитів починаються без прогрітого кешу, а використання токенів Claude Code зростає для тієї самої роботи.

Повідомлення, які виглядають як ліміти використання, але ними не є

Чотири помилки Claude Code сприймають як ліміти використання, хоча жодна з них такою не є.

  • Попередження про контекст або автоматичне стиснення не є лімітом використання. /context виводить рядок на кшталт Context exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue. після того, як розмір розмови перевищує контекстне вікно моделі. Старіша історія стискається, щоб звільнити місце, а доступний за вашим планом обсяг не змінюється.
  • Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again. означає, що сама операція /compact завершилася помилкою, оскільки вільного контексту недостатньо для збереження створеного нею підсумку.
  • Credit balance is too low означає, що в організації Console закінчилися передплачені кредити. Додайте кредити на platform.claude.com/settings/billing. Там також можна налаштувати автоматичне поповнення.
  • API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context — це перевірка доступу, а не вичерпана квота. Виберіть варіант моделі без суфікса [1m] або задайте CLAUDE_CODE_DISABLE_1M_CONTEXT=1.

Ще одна помилка надходить від API. Помилка 413 request_too_large означає перевищення обмеження розміру одного запиту, а не ліміту швидкості.

Обмеження швидкості API: що насправді підраховує 429

Messages API окремо для кожного класу моделей вимірює три показники.

  • кількість запитів за хвилину (RPM)
  • кількість вхідних токенів за хвилину (ITPM)
  • кількість вихідних токенів за хвилину (OTPM)

Для вашої організації також установлено ліміт витрат. Це інший показник: максимальна місячна вартість використання API. Після досягнення ліміту витрат для вашого рівня використання API призупиняється до початку наступного місяця, якщо ви не подасте запит на збільшення ліміту. Цикл повторних спроб цього не вирішить.

Чотири механізми визначають, коли надходить відповідь 429.

  • Обмеження діють для кожного класу моделей. Вони застосовуються окремо до кожної моделі, тому ви можете одночасно використовувати різні моделі в межах відповідних для них лімітів. Деякі сімейства моделей використовують спільний ліміт: ліміт швидкості Opus є сумарним для Claude Opus 4.8, Opus 4.7, Opus 4.6 і Opus 4.5, тоді як Claude Sonnet 5 має власний ліміт.
  • Ємність поповнюється безперервно. API використовує алгоритм token bucket, тому ємність поповнюється постійно, а не скидається в певний момент. Ліміт у 60 запитів за хвилину може фактично застосовуватися як один запит за секунду, тому 60 одночасно надісланих запитів усе одно завершаться помилкою.
  • У більшості моделей до ITPM зараховуються лише некешовані вхідні дані. input_tokens і cache_creation_input_tokens зараховуються. cache_read_input_tokens не зараховується для більшості моделей Claude; задокументований виняток — Claude Haiku 3.5. Тому кешування не лише зменшує вартість, а й збільшує доступний запас до обмеження швидкості. Для вихідних даних високе значення max_tokens не зараховується до OTPM, оскільки OTPM враховує лише фактично згенеровані токени.
  • Обмеження діють на рівні організації. Для робочого простору можна встановити нижчий ліміт, але загальноорганізаційні ліміти діють завжди, навіть якщо сума лімітів робочих просторів є більшою. Якщо для робочого простору ліміт не перевизначено, він успадковується від організації, а не вважається необмеженим.

Рівні Start, Build, Scale і Custom визначають фактичні значення. Їх призначають автоматично на основі історії використання та стану облікового запису. Для нових організацій початкові ліміти можуть бути нижчими за стандартні опубліковані значення, тому перша відповідь 429 може надійти раніше, ніж передбачає таблиця. Різке збільшення використання активує acceleration limits. У такому разі API повертає 429, навіть якщо ви ще не вийшли за межі свого рівня. Тому збільшуйте навантаження поступово. Кожне опубліковане значення є верхньою межею: задокументовані ліміти визначають максимально дозволене використання, а не гарантований мінімум. Щоб подати запит на збільшення, скористайтеся елементом керування "Request rate limit increase" на сторінці Limits у Claude Console.

Обробка відповіді 429: retry-after, заголовки та повторні спроби в SDK

Кожна помилка API повертає однакову оболонку: вкладений об’єкт error, що містить тип і повідомлення, а також кореневе поле request_id.

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "<names the rate limit you exceeded>"
  },
  "request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}

Решту даних містять заголовки.

  • retry-after — кількість секунд до повторної спроби запиту. Раніші повторні спроби завершаться помилкою.
  • anthropic-ratelimit-requests-limit, anthropic-ratelimit-requests-remaining і anthropic-ratelimit-requests-reset описують доступний бюджет запитів.
  • anthropic-ratelimit-input-tokens-* і anthropic-ratelimit-output-tokens-* містять такі самі дані для ITPM і OTPM із суфіксами limit, remaining і reset.
  • anthropic-ratelimit-tokens-* показує значення для найжорсткішого обмеження, яке діє зараз.

Заголовки reset містять часові позначки у форматі RFC 3339. Заголовки з кількістю доступних токенів округлюються до найближчої тисячі, тому сприймайте їх як індикатор. Fast mode має окремий пул і власні заголовки anthropic-fast-*. Читайте всі ці заголовки з будь-якої успішної відповіді:

curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
  | grep -i 'ratelimit\|retry-after\|request-id'

Кожна відповідь також містить унікальний заголовок request-id, наприклад req_018EeWyXxfu5pfWkrYcMdjWG. У тілах помилок він передається як request_id, а у відповідях Python і TypeScript SDK — як _request_id. Повідомляйте його службі підтримки під час звернення.

Перш ніж писати цикл із затримкою, перевірте, чи він узагалі потрібен. Офіційні SDK автоматично повторюють тимчасові помилкові запити, зокрема через помилки підключення, перевищення ліміту запитів і помилки сервера 5xx, застосовуючи експоненційну затримку. За замовчуванням виконується дві повторні спроби. Якщо присутній заголовок retry-after, SDK враховує його. Кожен клієнт приймає параметр максимальної кількості повторних спроб, щоб змінити або вимкнути цю поведінку.

import anthropic

client = anthropic.Anthropic(max_retries=5)  # the SDK default is 2

try:
    msg = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": "hello"}],
    )
except anthropic.RateLimitError as err:
    headers = err.response.headers
    print("still limited after retries; wait", headers.get("retry-after"), "seconds")
    print("request id:", headers.get("request-id"))

529 overloaded_error — це не ваша помилка

Код 429 означає, що ви надсилали запити надто швидко. Код 529 overloaded_error означає, що API тимчасово перевантажений. Це може статися через високий рівень трафіку для всіх користувачів. Причина не у вашому ключі та не у вашому коді. Повторіть запит із експоненційною затримкою. SDK уже роблять це для відповідей 5xx. Якщо проблема не зникає, перевірте status.claude.com. Код 500 api_error означає внутрішню помилку. Повторюйте запит у такий самий спосіб. Жоден із цих кодів не означає перевищення ліміту запитів.

Перевіряйте власні ліміти, а не таблицю

Для підписки потрібним екраном є /usage. На ньому відображаються індикатори використання вашого плану та деталізація того, що саме їх використало. d або w перемикає період між останніми 24 годинами та останніми 7 днями. Є 2 важливі застереження. Блок Session показує використання API-токенів і призначений для користувачів API, тому підписники можуть не зважати на вказану в ньому суму в доларах. Дані надходять з локальної історії сеансів на цьому комп’ютері, тому використання на іншому пристрої або в claude.ai не враховується.

У частині API сторінка Usage у Claude Console містить 2 графіки: "Rate Limit - Input Tokens" і "Rate Limit - Output Tokens". На графіку вхідних токенів погодинний максимум некешованих вхідних токенів за хвилину порівнюється з поточним лімітом ITPM. Поруч показано коефіцієнт використання кешу. Так можна відстежувати наближення до ліміту, а не чекати його досягнення в production.

Щоб програмно переглянути налаштовані ліміти:

curl -s https://api.anthropic.com/v1/organizations/rate_limits \
  -H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
  -H "anthropic-version: 2023-06-01"

Для цього потрібен ключ Admin API. GET /v1/organizations/workspaces/{workspace_id}/rate_limits виконує те саме для окремого workspace. Обидві операції доступні лише для читання. Щоб змінити ліміт, відкрийте вкладку Limits у Console.

Використовуйте менше, щоб рідше впиратися в ліміти

В основі обидві системи враховують один і той самий показник, тому ці способи працюють у будь-якій із них.

  • Витрачайте менше токенів за один крок. Тривалі безперервні сеанси зберігають кеш прогрітим, а /clear між непов’язаними завданнями нічого не коштує. У матеріалі Використання токенів Claude Code ці способи описано повністю.
  • Зменште рівень зусиль. Доступні рівні low, medium, high, xhigh і max. Меню /effort також пропонує ultracode, але цей режим збільшує витрати, а не зменшує їх. Глибоке міркування не дає користі під час механічного перейменування.
  • Зменште паралельність після помилки 429. Знизьте CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY і не запускайте багато паралельних субагентів. Також виконайте /status: сторонній ANTHROPIC_API_KEY спрямовує запити через ключ нижчого рівня замість вашої підписки.
  • Перенесіть неінтерактивні завдання до Message Batches API. API асинхронно обробляє великі обсяги даних зі знижкою 50% на вхідні та вихідні токени й використовує власні ліміти швидкості. Нічне завдання не конкуруватиме за ресурси з вашим сеансом.

Найсильніше це відчувається під час роботи, яка завантажує дані в контекст: якщо ви аналізуєте акції та опціони на основі актуальних ринкових даних, вибірка лише потрібного для кожного запитання фрагмента коштує набагато менше, ніж вставлення повних таблиць котирувань і ланцюжків опціонів. Переривчасті завдання, якими керує програма, а не людина, від початку мають працювати через API key. Це змінює не лише спосіб обліку, а й спосіб оплати, оскільки Claude API не має безкоштовного тарифу за межами невеликого кредиту, наданого під час реєстрації. Матеріал Ваш перший застосунок Claude API на VPS описує роботу з ключами та повторні спроби, а тривалий запуск агента переживе розрив з’єднання, якщо ви запустите Claude Code на VPS усередині tmux.

FAQ

Чому перемикання моделей не усуває ліміт використання Claude?

Тому що сеансові та тижневі ліміти спільні для всіх моделей. Доступний обсяг визначається планом, а не моделлю, тому /model змінює модель, яка відповідатиме, але не залишок доступного обсягу. Єдиний виняток — You've hit your Opus limit, який застосовується лише до запитів Opus. У цьому випадку перемикання моделі є рекомендованим способом вирішення проблеми.

Що означає 429 rate_limit_error і скільки потрібно чекати?

Це означає, що для цього класу моделей обліковий запис досяг обмеження швидкості: кількості запитів за хвилину, кількості вхідних токенів за хвилину або кількості вихідних токенів за хвилину. Відповідь містить заголовок retry-after із кількістю секунд очікування, а повторні запити, виконані раніше, завершуються помилкою. Офіційні SDK уже повторюють запити після обмежень швидкості та помилок 5xx із експоненційною затримкою, за замовчуванням двічі, враховуючи значення цього заголовка. Відповідь 429, отримана попри те, що ви ще не перевищили ліміти свого рівня, вказує на обмеження прискорення через раптове збільшення навантаження.

Як переглянути ліміти використання Claude і час їх скидання?

У Claude Code виконайте /usage, щоб переглянути індикатори плану, час скидання та розподіл використання; /cost є псевдонімом, а d або w перемикає період між останніми 24 годинами та останніми 7 днями. Ці показники отримуються з локальної історії сеансів, тому не враховують використання на інших пристроях і в claude.ai. Для API Console показує графіки обмежень швидкості, а GET /v1/organizations/rate_limits повертає налаштовані ліміти за допомогою Admin API key.

Чи можна продовжити роботу після досягнення ліміту плану Claude?

Іноді. Виконайте /usage-credits, щоб придбати додаткове використання після досягнення ліміту в планах Pro і Max або надіслати запит адміністратору в планах Team і Enterprise; для цього потрібен вхід до claude.ai через /login, і ця можливість недоступна для автентифікації за допомогою API key. В іншому разі дочекайтеся часу скидання, перемкніть модель, якщо було досягнуто ліміту Opus, або перенесіть роботу на API key, де облік ведеться за хвилинами, а не за періодами.