SSD Nodes Learn
Mga Gabay Matt ConnorNi Matt Connor · Na-update 2026-07-26

Claude usage limit: ano ang gagawin kapag na-hit mo

Hindi na babalik ang access kapag lumipat ng model. Alamin kung paano magkaiba ang session at weekly limit ng Claude subscription sa 429 rate limit ng API, at ano susunod.

Ano ang mga usage limit ni Claude?

Ang mga usage limit ni Claude ay nahahati sa dalawang magkahiwalay na sistema, at ang unang hakbang ay alamin kung alin ang pumigil sa iyo. Ang Claude subscription (Pro, Max, Team, o Enterprise) ay nagbibigay sa iyo ng rolling usage allowance na shared sa lahat ng models at shared din sa Claude chat, kaya pinipigilan ka nito ng mensahe na tulad ng You've hit your session limit · resets 3:45pm. Ang Claude API naman ay sumusukat ng ibang bagay: kung gaano kabilis mo ipinapadala ang mga request at token, kada minuto. Pinipigilan ka nito ng HTTP 429 error na may uri na rate_limit_error at isang retry-after header na nagsasabi kung ilang segundo ang dapat mong hintayin.

Walang pagkakatulad ang mga remedyo. Ang subscription limit ay tungkol sa kung gaano karami ang nagamit mo sa loob ng isang window, kaya kailangan mong maghintay sa reset o bumili ng karagdagang usage. Ang API rate limit naman ay tungkol sa bilis mo sa ngayon, at nawawala ito sa loob ng ilang segundo kapag binagalan mo na ang pagpapadala.

Madalas magbago ang mga numero ng plan allowance at rate-limit tier, at ang maling numero ay mas masahol pa kaysa sa kawalan nito, kaya walang nakalagay dito. Basahin ang sarili mo gamit ang mga command sa ibaba.

Aling limit ang na-hit? Basahin ang eksaktong mensahe

Tinutukoy ng Claude Code ang system sa text na ini-print nito. Tugmaan mo muna ang sa iyo bago baguhin ang kahit ano.

  • You've hit your session limit · resets 3:45pm ay isang subscription limit. Naubos na ang rolling allowance ng iyong plan para sa time window na ito.
  • You've hit your weekly limit · resets Mon 12:00am ay ang parehong system pero sa mas mahabang time window.
  • You've hit your Opus limit · resets 3:45pm ay isang subscription limit na para lang sa mga Opus na request. Ito ang tanging kaso kung saan nakakatulong ang pagpapalit ng model.
  • API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com. ay isang API rate limit. Na-hit mo ang limit na naka-configure para sa iyong API key, o para sa iyong Amazon Bedrock o Google Cloud project.
  • API Error: Server is temporarily limiting requests (not your usage limit) ay isang panandaliang throttle na walang kinalaman sa iyong plan quota. Automatic na sinusubukan ulit ito ng Claude Code gamit ang backoff bago nito ipakita sa iyo ang linyang iyon.

Subscription limits: session, weekly, at ang Opus window

Kasama sa subscription plan ang isang rolling usage allowance. Kapag naubos na ito, hinaharangan ng Claude Code ang mga sususnod na request hanggang sa reset time na ipinapakita sa mensahe. Dalawang katangian ng allowance na ito ang dahilan ng karamihan ng pagkalito.

  • Ito ay shared sa Claude chat. Ang trabaho mong gawin sa claude.ai ay kumakain sa parehong allowance na ginagamit sa terminal, kaya ang mabigat na hapon sa chat ay nagpapaliit sa coding evening mo.
  • Ito ay shared sa lahat ng modelo. Ang session at weekly limits ay walang per-model budget, na may iisang exception lang: ang Opus limit.

Sa Claude for Teams at Enterprise, ang dokumentadong hugis ay isang per-seat allowance na nag-reset sa isang rolling five-hour window at isang weekly window, ay shared sa Claude chat at Cowork, at ang laki ay batay sa seat tier (Standard o Premium). Sa Pro at Max, ang reset time na nakasulat sa mensahe at ang iyong sariling /usage bars ang mga mapagkakatiwalaang numero, hindi ang numero na kinopya mula sa isang blog post. Kung pinipili mo pa lang ng tier, alin sa mga Claude plan ang kailangan mo ay nagko-compara ng kung ano ang iginagated ng bawat isa.

Bakit hindi nagbabalik ng access ang pagpapalit ng modelo sa /model

Ito ang pinakakaraniwang maling galaw, at malinaw ang dokumentasyon tungkol dito: shared ang mga limit ng session at weekly sa lahat ng modelo, kaya hindi nagbabalik ng access ang pagpapalit ng modelo. Ang pagpili ng mas maliit na modelo pagkatapos maubos ang session window ay nagbabago lang kung aling modelo ang sasagot. Hindi nito binabago kung magkano ang allowance na natitira, dahil ang allowance ay hindi kailanman naka-hold kada modelo, kaya wala nang ilalabas ang switch.

Ang exception ay ang limit ng Opus, isang tunay na model-specific na ceiling. Kung ang mensahe ay You've hit your Opus limit, tama ang fix na /model. Lumipat sa ibang modelo at magpatuloy sa trabaho, dahil ang mga Opus request lang ang na-block.

Ang pagtrato sa limit bilang bug ay ang pangalawang maling galaw. Walang silbi ang mag-reinstall o mag-authenticate ulit. Babalik ang allowance kapag nag-reset ang window, o kapag bumili ka ng usage credits.

Ano ang gagawin kapag tumama ka sa subscription limit

  1. Basahin ang oras ng pag-reset. Maikli ang session window. Ang weekly window ay hindi bagay na hintayin habang nakaupo sa desk.
  2. Kung ito ang Opus limit, patakbuhin ang /model at pumili ng ibang model.
  3. Patakbuhin ang /usage para makita ang mga limit ng iyong plan, ang iyong mga bar, at kung kailan sila magre-reset. Ang /cost ay alias para sa parehong screen.
  4. Patakbuhin ang /usage-credits para magpatuloy sa pagtatrabaho kahit lumampas na sa ceiling. Sa Pro at Max, binubuksan nito ang iyong billing settings. Sa Team at Enterprise, binubuksan nito ang usage settings ng iyong organisasyon, o nagpapadala ng kahilingan sa iyong mga admin kung wala kang access sa billing.
  5. Kung tumama ka sa parehong pader tuwing linggo, mali ang laki ng plan para sa paraan ng iyong pagtatrabaho.

Nangangailangan ang /usage-credits ng claude.ai subscription na naka-sign in sa pamamagitan ng /login. Hindi ito available gamit ang API key authentication, dahil walang plan allowance ang API key na maaaring i-extend.

May isang side effect ang usage credits na dapat malaman muna. Ang prompt cache lifetime ay isang oras sa subscription at bumababa sa limang minuto kapag gumagamit ka na ng credits, kaya mas maraming turns ang nagsisimula nang cold at umaakyat ang token usage ng Claude Code para sa parehong trabaho.

Ang mga mensahe na mukhang usage limits pero hindi naman

Apat na error sa Claude Code ang iniuulat bilang usage limits at wala sa kanila ang talagang usage limit.

  • Hindi usage limit ang context o auto-compact warning. Nagpi-print ang /context ng linya katulad ng Context exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue. kapag lumampas na ang usapan sa context window ng modelo. Isinasagawa ang buod ng lumang history para magbakante ng espasyo, at hindi nahahawakan ang allowance ng iyong plano.
  • Ang Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again. ay nangangahulugang nabigo ang /compact mismo, dahil walang sapat na libreng context na natitira para ilagay ang buod na gagawin nito.
  • Ang Credit balance is too low ay nangangahulugang ubos na ang prepaid credits ng iyong Console organization. Magdagdag ng credits sa platform.claude.com/settings/billing, na nag-aalok din ng auto-reload.
  • Ang API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context ay entitlement check, hindi ubos na quota. Pumili ng variant ng modelo na walang [1m] suffix, o i-set ang CLAUDE_CODE_DISABLE_1M_CONTEXT=1.

Isa pang mensahe ay mula sa API. Ang 413 request_too_large ay size limit sa isang kahilingan, hindi rate limit.

API rate limits: ano talaga ang binibilang ng 429

Ang Messages API ay nagsusukat ng tatlong bagay, nang hiwalay para sa bawat model class.

  • requests per minute (RPM)
  • input tokens per minute (ITPM)
  • output tokens per minute (OTPM)

Mayroon ding spend limit ang inyong organisasyon, na ibang usapan na: pinakamataas na buwanang gastos para sa API usage. Kapag naabot na ninyo ang spend cap ng inyong tier, mag-pause ang API usage hanggang sa susunod na buwan maliban kung mag-request kayo ng mas mataas na limit. Walang retry loop ang makakaresolba niyan.

Apat na mekanika ang nagdedetermina kung kailan dumarating ang 429.

  • Per model class ang mga limit. Magkakahiwalay ang paggamit ng mga ito sa bawat model, kaya maaari kayong gumamit ng iba't ibang model hanggang sa kani-kanilang limit nang sabay. May ilang pamilyang nagbabahagi ng iisang bucket: ang rate limit para sa Opus ay kabuuan sa lahat ng Claude Opus 4.8, Opus 4.7, Opus 4.6 at Opus 4.5, samantalang may sariling limit ang Claude Sonnet 5.
  • Patuloy ang pag-replenish ng capacity. Gumagamit ang API ng token bucket algorithm, kaya patuloy ang pagdagdag ng capacity imbis na mag-reset ito sa isang takdang sandali. Ang isang limit na 60 requests per minute ay maaaring ipatupad bilang isang request per second, kaya ang 60 requests na pinapadalang sabay-sabay ay babagsak pa rin.
  • Ang uncached input lang ang bumababa sa ITPM sa karamihan ng model. input_tokens at cache_creation_input_tokens ay bumababa. Hindi bumababa ang cache_read_input_tokens sa karamihan ng Claude model, kung saan ang Claude Haiku 3.5 ang nakadokumentong exception. Dahil dito, ang caching ay nagbibigay hindi lang ng diskwento kundi pati ng rate-limit headroom. Sa output naman, ang mataas na max_tokens ay hindi bumababa sa OTPM, dahil ang binibilang lang ng OTPM ay ang mga token talagang nailabas.
  • Nasa organization level ang mga limit. Maaaring bigyan ang isang workspace ng mas mababang limit, at ang mga limit sa buong organisasyon ay palaging umiiral kahit pa mas mataas ang kabuuan ng mga workspace limit. Ang isang limit na hindi ninyo na-override sa isang workspace ay minamana mula sa organisasyon, hindi naiiwan na unlimited.

Ang mga tier na pinangalanang Start, Build, Scale at Custom ang nagse-set ng aktwal na mga numero, at ito ay awtomatikong ina-assign batay sa inyong usage history at account standing. Ang mga bagong organisasyon ay maaaring magsimula sa ibaba kaysa sa karaniwang inilathalang limit, kaya ang unang 429 ay maaaring dumating nang mas maaga kaysa sa hinuhula ng isang talahanayan. Ang matalas na pagtaas ng usage ay nagti-trigger ng acceleration limits, na nagbabalik ng 429 kahit nasa loob pa kayo ng inyong tier, kaya dahan-dahang i-ramp ang traffic. Ang bawat inilathalang numero ay ceiling: ang mga dokumentadong limit ay pinakamataas na pinapayagang usage, hindi garantisadong minimum. Upang humingi ng karagdagan, gamitin ang "Request rate limit increase" na kontrol sa Limits page ng Claude Console.

Pagbasa ng 429: retry-after, ang mga header, at mga SDK retry

Bawat API error ay nagbabalik ng parehong envelope: isang nested na error object na nagdadala ng type at message, kasama ang isang top-level na request_id.

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "<names the rate limit you exceeded>"
  },
  "request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}

Ang mga header ang nagdadala ng natitira.

  • retry-after ay ang bilang ng mga segundo na dapat hintayin bago mo ma-retry ang request. Ang mga naunang retry ay mabibigo.
  • anthropic-ratelimit-requests-limit, anthropic-ratelimit-requests-remaining at anthropic-ratelimit-requests-reset ay naglalarawan sa budget ng iyong request.
  • anthropic-ratelimit-input-tokens-* at anthropic-ratelimit-output-tokens-* ay gumagawa ng pareho para sa ITPM at OTPM, na may parehong limit, remaining at reset na mga suffix.
  • anthropic-ratelimit-tokens-* ay nagpapakita ng mga value para sa pinaka-restrictive na limit na kasalukuyang may bisa.

Ang mga reset header ay RFC 3339 timestamps. Ang mga natitirang token header ay ni-round off sa pinakamalapit na libo, kaya basahin ang mga ito bilang isang gauge. Ang fast mode ay may sariling pool at sarili nitong anthropic-fast-* na mga header. Basahin ang lahat ng mga ito mula sa anumang matagumpay na tawag:

curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
  | grep -i 'ratelimit\|retry-after\|request-id'

Ang bawat tugon ay mayroon ding natatanging request-id header, tulad ng req_018EeWyXxfu5pfWkrYcMdjWG. Lumalabas ito bilang request_id sa mga error body at bilang _request_id sa mga tugon ng Python at TypeScript SDK. I-quote ito kapag nakipag-ugnayan ka sa support.

Tingnan muna kung kailangan mo ba talaga ng backoff loop bago ka magsulat ng isa. Ang mga opisyal na SDK ay awtomatikong nag-retry ng mga pansamantalang pagkabigo, kabilang ang mga connection error, rate limit at 5xx server error, na may exponential backoff, dalawang beses bilang default, na sinusunod ang retry-after header kapag ito ay naroroon. Ang bawat client ay tumatanggap ng isang maximum-retries na opsyon upang baguhin o huwag paganahin ang gawaing iyon.

import anthropic

client = anthropic.Anthropic(max_retries=5)  # the SDK default is 2

try:
    msg = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": "hello"}],
    )
except anthropic.RateLimitError as err:
    headers = err.response.headers
    print("still limited after retries; wait", headers.get("retry-after"), "seconds")
    print("request id:", headers.get("request-id"))

529 overloaded_error hindi mo kasalanan

Ang 429 ay nagsasabing masyadong mabilis ka. Ang 529 overloaded_error ay nagsasabing pansamantalang overloaded ang API, at maaari itong mangyari kapag mataas ang traffic ng API para sa lahat ng user. Walang kinalaman ang iyong key o iyong code dito. Subukang muli gamit ang exponential backoff, na ginagawa na ng mga SDK para sa 5xx na mga tugon, at tingnan ang status.claude.com kung hindi ito nawawala. Ang 500 api_error ay internal na error na ini-retry mo sa parehong paraan, at walang isa sa dalawa ang rate limit.

Basahin ang sarili mong mga limit sa halip na isang talahanayan

Sa isang subscription, /usage ang screen na mahalaga. Nagpapakita ito ng mga bar ng paggamit ng plan mo at ng breakdown ng kung ano ang kumonsumo sa mga ito. Ang d o w naman ang lumilipat sa pagitan ng huling 24 na oras at huling 7 araw. Dalawang caveat. Ang Session block ay nagpapakita ng paggamit ng API token at para sa mga API user, kaya maaaring balewalain ng mga subscriber ang dollar figure nito. Ang mga numero ay mula sa lokal na history ng session sa machine na iyon, kaya nawawala ang paggamit mula sa ibang device o mula sa claude.ai.

Sa side ng API, ang Usage page sa Claude Console ay nagdadrawing ng dalawang chart, "Rate Limit - Input Tokens" at "Rate Limit - Output Tokens". Ang input chart ay nag-plot ng pinakamataas na oras-oras na uncached input tokens bawat minuto laban sa kasalukuyan mong ITPM limit, kasama ang cache rate mo sa tabi nito. Kaya pinapanood mo ang isang limit na lumalapit sa halip na makatagpo ito sa production.

Para basahin ang mga naka-configure na limit mo sa programmatic na paraan:

curl -s https://api.anthropic.com/v1/organizations/rate_limits \
  -H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
  -H "anthropic-version: 2023-06-01"

Kailangan nito ng Admin API key, at GET /v1/organizations/workspaces/{workspace_id}/rate_limits ang gumagawa ng pareho bawat workspace. Read-only ang dalawa: para baguhin ang isang limit, gamitin ang Limits tab sa Console.

Pag-iwas sa mga limit, gamit ang less

Pareho ang sinusukat ng dalawang sistema sa ilalim, kaya gumagana ang mga lever na ito sa alinman.

  • Magtipid ng mas kaunting token kada turn. Tuloy-tuloy na stint ang nagpapainit sa cache, at ang /clear sa pagitan ng mga hindi magkakaugnay na gawain ay walang bayad. Tinalakay ng Paggamit ng token sa Claude Code ang mga lever na iyon nang buo.
  • Bawasan ang effort. Ang mga level ay low, medium, high, xhigh at max. Nag-aalok din ang /effort menu ng ultracode, na nagpapataas ng gastos sa halip na bawasan ito. Walang silbi ang malalim na reasoning sa simpleng rename.
  • Bawasan ang concurrency pagkatapos ng 429. Ibaba ang CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY at iwasan ang maraming parallel na subagent. Patakbuhin din ang /status: ang isang stray na ANTHROPIC_API_KEY ay nireroute ang mga request sa mababang-tier na key sa halip na sa iyong subscription.
  • Ilipat ang non-interactive na trabaho sa Message Batches API. Patakbuhin nito ang malalaking volume asynchronously na may 50% diskwento sa input at output token, sa sarili nitong rate limit, kaya ang isang gabi-gabing job ay tumitigil sa pag-compete sa iyong session.

Ang bursty na trabaho na pinapatakbo ng isang programa sa halip na isang tao ay dapat nasa API key mula pa lang. Tinalakay ng Ang iyong unang Claude API app sa VPS ang paghawak ng key at mga retry, at ang isang mahabang agent run ay nakakaraos sa nawawalang connection kapag pinapanatili mo ang Claude Code na tumatakbo sa VPS sa loob ng tmux.

FAQ

Bakit hindi naaayos ng paglipat ng modelo ang limitasyon sa paggamit ko sa Claude?

Dahil shared ang mga session at weekly limits sa lahat ng modelo. Ang allowance ay nakatali sa plano, hindi sa modelo, kaya /model ay nagpapalit lang kung anong modelo ang sasagot at hindi kung magkano pa ang allowance na natitira. Ang isang exception ay You've hit your Opus limit, na umaaplay lang sa mga Opus request. Doon, ang paglipat ng modelo ay ang dokumentadong solusyon.

Ano ang ibig sabihin ng 429 rate_limit_error, at gaano katagal dapat maghintay?

Ibig sabihin nito na na-hit ng account mo ang rate limit para sa model class na iyon: requests per minute, input tokens per minute, o output tokens per minute. Ang response ay may kasamang retry-after header na may mga segundo ng paghihintay, at ang mga naunang retry ay mabibigo. Ang mga opisyal na SDK ay nag-re-retry na ng mga rate limit at 5xx error na may exponential backoff, dalawang beses by default, na sinusunod ang header na iyon. Ang 429 na dumating habang nasa loob ka pa ng limits ng tier mo ay tumuturo sa acceleration limit mula sa biglaang ramp.

Paano makikita ang aking mga limitasyon sa paggamit sa Claude at kailan sila magre-reset?

Sa Claude Code, patakbuhin ang /usage para sa mga plan bar mo, mga oras ng reset at isang usage breakdown; ang /cost ay isang alias, at ang d o w ay lumilipat sa pagitan ng huling 24 na oras at huling 7 araw. Ang mga numerong iyon ay galing sa local session history, kaya nawawalan sila ng usage mula sa ibang device at mula sa claude.ai. Sa API, ang Console ay nagko-chart ng iyong rate limits, at ang GET /v1/organizations/rate_limits ay nagbabalik ng iyong mga naka-configure na limits na may Admin API key.

Maaari ba akong magpatuloy sa pagtatrabaho pagkatapos ma-hit ang limitasyon ng aking Claude plan?

Minsan. Patakbuhin ang /usage-credits para bumili ng usage na lagpas sa ceiling sa Pro at Max, o para hingin ito sa isang admin sa Team at Enterprise; kailangan nito ng claude.ai login sa pamamagitan ng /login at hindi available sa API key authentication. Kung hindi, maghintay para sa oras ng reset, magpalit ng modelo kung ito ay Opus limit, o ilipat ang trabaho sa isang API key, na nagme-meter per minute sa halip na per window.