SSD Nodes Learn
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-07-24

Почему Claude выдает лимиты и что делать

Различия между подпиской и API. Как исправить ошибку HTTP 429 и почему смена моделей не помогает при исчерпании квоты Claude Pro или Team.

Каковы лимиты использования Claude?

Лимиты использования Claude разделены на две разные системы. Сначала необходимо определить, какая из них ограничила ваш доступ. Подписка Claude (Pro, Max, Team или Enterprise) предоставляет скользящий лимит использования. Этот лимит является общим для всех моделей и чата Claude, поэтому при исчерпании вы получите сообщение вида You've hit your session limit · resets 3:45pm. Claude API использует другой параметр: скорость отправки запросов и токенов, которая рассчитывается в минуту. В этом случае вы получите ошибку HTTP 429 типа rate_limit_error и заголовок retry-after, указывающий количество секунд ожидания.

Методы решения этих проблем различаются. Лимит подписки зависит от объема использования за определенный период; необходимо дождаться сброса лимита или приобрести дополнительный объем. Лимит скорости (rate limit) API зависит от текущей скорости запросов; он снимается через несколько секунд после снижения интенсивности запросов.

Значения лимитов тарифных планов и уровней rate limit часто меняются. Неверное число может ввести в заблуждение, поэтому здесь они не указаны. Вы можете узнать свои актуальные значения с помощью команд, приведенных ниже.

Какой лимит был превышен? Прочитайте точное сообщение

Claude Code указывает название системы в тексте сообщения. Определите ваше значение, прежде чем вносить изменения.

  • You've hit your session limit · resets 3:45pm — это лимит подписки. Исчерпан текущий объем квоты вашего тарифного плана.
  • You've hit your weekly limit · resets Mon 12:00am — тот же лимит, но для более длительного периода.
  • You've hit your Opus limit · resets 3:45pm — лимит подписки, который применяется только к запросам к модели Opus. В этом случае смена модели поможет решить проблему.
  • API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com. — лимит частоты запросов API (rate limit). Вы достигли ограничения, установленного для вашего API key, либо для вашего проекта в Amazon Bedrock или Google Cloud.
  • API Error: Server is temporarily limiting requests (not your usage limit) — кратковременное ограничение скорости (throttle), не связанное с квотой вашего тарифного плана. Claude Code автоматически повторит запрос с задержкой (backoff), прежде чем выведет эту строку.

Лимиты подписки: сессионные, недельные и окно Opus

План подписки включает скользящий лимит использования. Когда лимит исчерпан, Claude Code блокирует дальнейшие запросы до времени сброса, указанного в сообщении. Основную путаницу вызывают два свойства этого лимита.

  • Лимит общий для Claude chat. Работа на claude.ai расходует те же квоты, что и работа в терминале. Интенсивная работа в чате сокращает доступное время для кодинга вечером.
  • Лимит общий для всех моделей. Сессионные и недельные лимиты не имеют разделения по моделям, за исключением лимита Opus.

В планах Claude for Teams и Enterprise лимит установлен на каждое рабочее место. Он сбрасывается в рамках скользящего пятичасового окна и недельного окна. Лимит общий для Claude chat и Cowork и зависит от уровня подписки (Standard или Premium). В планах Pro и Max ориентируйтесь на время сброса в сообщении и на ваши собственные индикаторы /usage, а не на данные из блога. Если вы еще выбираете тариф, сравнение ограничений в разных планах Claude поможет определить необходимый вариант.

Почему переключение модели через /model не восстанавливает доступ

Это самая частая ошибка. Документация дает однозначный ответ: лимиты сессии и недели являются общими для всех моделей. Переключение модели не восстанавливает доступ. Выбор модели меньшего размера после исчерпания сессионного окна лишь меняет модель, которая будет отвечать. Это не меняет остаток доступного объема, так как лимит не привязан к конкретной модели. Переключение не освобождает квоту.

Исключением является лимит Opus — это единственный лимит, привязанный к конкретной модели. Если вы видите сообщение You've hit your Opus limit, то решение — /model. Переключитесь на другую модель и продолжайте работу, так как блокировка касается только запросов к Opus.

Считать лимит ошибкой — вторая частая ошибка. Переустановка или повторная аутентификация не помогут. Лимит восстановится после сброса окна или после покупки кредитов использования.

Что делать при достижении лимита подписки

  1. Проверьте время сброса лимитов. Сессионное окно ограничено по времени. Не стоит ждать окончания недельного окна за рабочим столом.
  2. Если достигнут лимит Opus, выполните команду /model и выберите другую модель.
  3. Выполните команду /usage, чтобы увидеть лимиты вашего тарифного плана, текущее использование и время сброса. /cost является псевдонимом для того же экрана.
  4. Выполните команду /usage-credits, чтобы продолжить работу после исчерпания лимита. В планах Pro и Max открываются настройки оплаты. В планах Team и Enterprise открываются настройки использования организации или отправляется запрос администраторам, если у вас нет прав доступа к оплате.
  5. Если вы еженедельно сталкиваетесь с одними и теми же ограничениями, текущий тарифный план не соответствует вашему рабочему процессу.

Для работы /usage-credits требуется подписка claude.ai, выполненная через учетную запись /login. Функция недоступна при аутентификации через API key, так как у API key нет тарифного лимита, который можно расширить.

У кредитов на использование есть один важный побочный эффект. Время жизни кэша промптов (prompt cache) составляет один час при наличии подписки, но сокращается до пяти минут, когда вы начинаете использовать кредиты. Из-за этого новые итерации запросов выполняются без кэша, и расход токенов Claude Code растет при том же объеме работы.

Сообщения, которые ошибочно принимают за лимиты использования

Четыре ошибки Claude Code классифицируются как лимиты использования, но это не так.

  • Предупреждение о контексте или auto-compact не является лимитом использования. /context выводит строку вида Context exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue., когда объем диалога превышает окно контекста модели. Старая история резюмируется для освобождения места; ваш лимит по тарифному плану не расходуется.
  • Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again. означает, что /compact не удалось выполнить операцию, так как в контексте недостаточно свободного места для создания резюме.
  • Credit balance is too low означает, что у вашей организации в Console закончились предоплаченные кредиты. Добавьте кредиты на странице platform.claude.com/settings/billing, где также доступна функция автопополнения.
  • API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context — это проверка прав доступа, а не исчерпанная квота. Выберите вариант модели без суффикса [1m] или установите CLAUDE_CODE_DISABLE_1M_CONTEXT=1.

Еще одно сообщение поступает от API. Ошибка 413 request_too_large означает ограничение размера одного запроса, а не ограничение частоты запросов (rate limit).

Лимиты API: что на самом деле учитывает ошибка 429

Messages API отслеживает три параметра отдельно для каждого класса моделей.

  • количество запросов в минуту (RPM)
  • количество входных токенов в минуту (ITPM)
  • количество выходных токенов в минуту (OTPM)

У вашей организации также есть лимит расходов. Это отдельный параметр: максимальная ежемесячная стоимость использования API. Как только вы достигнете порога расходов вашего уровня, использование API приостановится до следующего месяца, если вы не запросите увеличение лимита. Циклы повторных попыток (retry loops) не решат эту проблему.

Возникновение ошибки 429 определяется четырьмя механизмами.

  • Лимиты применяются к классу моделей. Они действуют отдельно для каждой модели. Вы можете одновременно использовать разные модели в пределах их соответствующих лимитов. Некоторые семейства используют общий пул: лимит запросов для Opus является суммарным для Claude Opus 4.8, Opus 4.7, Opus 4.6 и Opus 4.5, в то время как у Claude Sonnet 5 есть собственный лимит.
  • Емкость пополняется непрерывно. API использует алгоритм token bucket, поэтому емкость восполняется постоянно, а не сбрасывается в фиксированный момент времени. Лимит в 60 запросов в минуту может применяться как 1 запрос в секунду; поэтому 60 одновременных запросов все равно приведут к ошибке.
  • Для ITPM на большинстве моделей учитываются только некешированные входные данные. input_tokens и cache_creation_input_tokens учитываются. cache_read_input_tokens на большинстве моделей Claude не учитывается, за исключением Claude Haiku 3.5. Таким образом, кэширование обеспечивает не только скидку, но и дополнительный запас по лимитам. Что касается выходных данных, высокий max_tokens не учитывается в OTPM, так как OTPM считает только фактически сгенерированные токены.
  • Лимиты действуют на уровне организации. Для рабочей области (workspace) может быть установлен более низкий лимит; общеорганизационные лимиты действуют всегда, даже если сумма лимитов рабочих областей выше. Если вы не переопределили лимит для рабочей области, он наследуется от организации, а не становится неограниченным.

Фактические значения устанавливаются уровнями (tiers): Start, Build, Scale и Custom. Они назначаются автоматически на основе истории вашего использования и состояния аккаунта. Новые организации могут иметь лимиты ниже стандартных опубликованных значений, поэтому первая ошибка 429 может возникнуть раньше, чем предсказывает таблица. Резкое увеличение нагрузки активирует лимиты ускорения (acceleration limits), которые возвращают 429, даже если вы не вышли за пределы своего уровня; поэтому увеличивайте трафик постепенно. Все опубликованные данные являются верхним пределом: указанные лимиты — это максимально допустимое использование, а не гарантированный минимум. Чтобы запросить увеличение, используйте функцию "Request rate limit increase" на странице Limits в Claude Console.

Чтение ошибки 429: retry-after, заголовки и повторные попытки в SDK

Каждая ошибка API возвращает одинаковую структуру: вложенный объект error с типом и сообщением, а также верхнеуровневый request_id.

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "<names the rate limit you exceeded>"
  },
  "request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}

Остальные данные содержатся в заголовках.

  • retry-after — количество секунд ожидания перед повторной попыткой запроса. Ранние повторные попытки будут неудачными.
  • anthropic-ratelimit-requests-limit, anthropic-ratelimit-requests-remaining и anthropic-ratelimit-requests-reset описывают ваш лимит запросов (request budget).
  • anthropic-ratelimit-input-tokens-* и anthropic-ratelimit-output-tokens-* выполняют те же функции для ITPM и OTPM с аналогичными суффиксами limit, remaining и reset.
  • anthropic-ratelimit-tokens-* отображает значения для самого строгого действующего лимита.

Заголовки reset используют временные метки формата RFC 3339. Значения в заголовках remaining округляются до ближайшей тысячи, поэтому используйте их как примерный индикатор. Режим Fast mode имеет собственный пул и собственные заголовки anthropic-fast-*. Считывайте все эти заголовки из любого успешного вызова:

curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
  | grep -i 'ratelimit\|retry-after\|request-id'

Каждый ответ также содержит уникальный заголовок request-id, например req_018EeWyXxfu5pfWkrYcMdjWG. Он отображается как request_id в телах ошибок и как _request_id в ответах SDK для Python и TypeScript. Указывайте его при обращении в службу поддержки.

Прежде чем реализовывать цикл повторных попыток (backoff loop), проверьте, действительно ли он вам необходим. Официальные SDK автоматически выполняют повторные попытки при временных сбоях, включая ошибки соединения, превышение лимитов (rate limits) и ошибки сервера 5xx. По умолчанию используется экспоненциальный backoff (две попытки), с учетом заголовка retry-after при его наличии. Каждый клиент поддерживает опцию maximum-retries для изменения или отключения этого поведения.

import anthropic

client = anthropic.Anthropic(max_retries=5)  # the SDK default is 2

try:
    msg = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": "hello"}],
    )
except anthropic.RateLimitError as err:
    headers = err.response.headers
    print("still limited after retries; wait", headers.get("retry-after"), "seconds")
    print("request id:", headers.get("request-id"))

529 overloaded_error не является вашей ошибкой

Ошибка 429 означает, что вы отправляете запросы слишком часто. Ошибка 529 overloaded_error означает, что API временно перегружен; это происходит при высоком трафике среди всех пользователей. Ваша учетная запись или код не являются причиной этой ошибки. Повторите запрос, используя экспоненциальную задержку (exponential backoff) — SDK уже выполняют это для ответов 5xx — и проверьте status.claude.com, если проблема не исчезнет. Ошибка 500 api_error является внутренней ошибкой, которую также следует обрабатывать повторными запросами с задержкой; ни одна из этих ошибок не является ограничением частоты запросов (rate limit).

Получайте свои лимиты напрямую, а не из таблицы

Для подписчиков важным является экран /usage. На нем отображаются индикаторы использования вашего тарифного плана и детализация потребления ресурсов. Переключатели d или w позволяют выбрать период: последние 24 часа или последние 7 дней. Есть два нюанса. Блок Session показывает использование API-токенов и предназначен для пользователей API, поэтому подписчикам можно игнорировать указанную там сумму в долларах. Данные берутся из локальной истории сессий на текущем устройстве, поэтому данные об использовании с других устройств или через claude.ai не учитываются.

В части API на странице Usage в Claude Console построены два графика: "Rate Limit - Input Tokens" и "Rate Limit - Output Tokens". График входных данных (input) отображает почасовой максимум несэшированных (uncached) входных токенов в минуту в сравнении с вашим текущим лимитом ITPM. Рядом отображается коэффициент использования кэша. Это позволяет отслеживать приближение к лимиту, чтобы не столкнуться с ним в рабочей среде (production).

Чтобы программно получить ваши настроенные лимиты:

curl -s https://api.anthropic.com/v1/organizations/rate_limits \
  -H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
  -H "anthropic-version: 2023-06-01"

Для этого требуется ключ Admin API; GET /v1/organizations/workspaces/{workspace_id}/rate_limits выполняет то же самое для каждого workspace. Оба метода работают только на чтение: чтобы изменить лимит, используйте вкладку Limits в Console.

Используйте less, чтобы не превышать лимиты

Обе системы используют одни и те же метрики, поэтому данные методы применимы к любой из них.

  • Тратьте меньше токенов за один запрос. Длительные сессии позволяют поддерживать кэш в актуальном состоянии; /clear между несвязанными задачами не требует дополнительных затрат. Использование токенов в Claude Code подробно описывает эти механизмы.
  • Снижайте уровень сложности. Доступны уровни max, xhigh, high, medium и low. Меню /effort также включает ultracode, который увеличивает расход токенов, а не снижает его. Глубокое рассуждение (deep reasoning) при простом переименовании файлов нецелесообразно.
  • Снижайте уровень параллелизма после ошибки 429. Уменьшите CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY и избегайте большого количества параллельных субагентов. Также используйте /status: случайный ANTHROPIC_API_KEY может направить запросы через ключ с низким приоритетом вместо вашей подписки.
  • Переносите неинтерактивные задачи в Message Batches API. Этот инструмент обрабатывает большие объемы данных асинхронно со скидкой 50% на входные и выходные токены. У него свои лимиты частоты запросов, поэтому ночные задания не будут мешать вашей текущей сессии.

Задачи, выполняемые программой, а не человеком, следует сразу переводить на использование API-ключа. Ваше первое приложение Claude API на VPS содержит инструкции по управлению ключами и повторным попыткам. Длительная работа агента не прервется при разрыве соединения, если вы используете Claude Code в tmux на VPS.

FAQ

Почему смена модели не снимает ограничение использования Claude?

Лимиты сессии и недели являются общими для всех моделей. Квота привязана к тарифному плану, а не к конкретной модели, поэтому /model меняет только модель ответа, но не остаток квоты. Единственное исключение — You've hit your Opus limit, которое относится только к запросам Opus. В этом случае смена модели является рекомендованным способом решения.

Что означает ошибка 429 rate_limit_error и сколько нужно ждать?

Это означает, что ваш аккаунт достиг лимита запросов для данного класса моделей: количество запросов в минуту, количество входных токенов в минуту или количество выходных токенов в минуту. Ответ содержит заголовок retry-after с указанием секунд ожидания; повторные попытки до этого времени будут неудачными. Официальные SDK уже содержат механизмы повторных попыток при ошибках rate limits и 5xx с использованием экспоненциальной задержки (по умолчанию дважды) с учетом этого заголовка. Если ошибка 429 возникает при соблюдении лимитов вашего тарифного плана, это указывает на ограничение скорости из-за резкого скачка нагрузки.

Как посмотреть лимиты использования Claude и время их сброса?

В Claude Code выполните /usage, чтобы увидеть полосы загрузки вашего плана, время сброса и детализацию использования; /cost является псевдонимом, а d или w переключает отображение между последними 24 часами и последними 7 днями. Эти данные берутся из локальной истории сессий, поэтому они не учитывают использование на других устройствах или на сайте claude.ai. В API Console отображает графики ваших лимитов, а GET /v1/organizations/rate_limits возвращает настроенные лимиты при использовании Admin API key.

Могу ли я продолжать работу после достижения лимита плана Claude?

Иногда. Выполните /usage-credits, чтобы докупить объем использования сверх лимита на планах Pro и Max, или чтобы отправить запрос администратору на планах Team и Enterprise; для этого требуется вход в claude.ai через /login, функция недоступна при аутентификации через API key. В противном случае дождитесь времени сброса, смените модель (если было достигнуто ограничение Opus) или перенесите работу на API key, где учет идет за минуту, а не за временное окно.