Cara atasi had penggunaan Claude
Ketahui perbezaan had kuota langganan dan ralat HTTP 429 API. Ketahui mengapa menukar model tidak memulihkan akses dan cara menguruskan had penggunaan anda.
Apakah had penggunaan Claude?
Had penggunaan Claude terdiri daripada dua sistem berbeza. Langkah pertama adalah mengenal pasti sistem mana yang menghalang anda. Langganan Claude (Pro, Max, Team, atau Enterprise) memberikan kuota penggunaan berayun yang dikongsi antara model dan dikongsi dengan sembang Claude, jadi ia akan menghentikan anda dengan mesej seperti You've hit your session limit · resets 3:45pm. Claude API mengukur perkara lain: kepantasan anda menghantar permintaan dan token, yang dikira setiap minit. Ia akan menghentikan anda dengan ralat HTTP 429 jenis rate_limit_error dan pengepala retry-after yang menyatakan berapa saat perlu menunggu.
Cara penyelesaiannya adalah berbeza sama sekali. Had langganan adalah tentang jumlah penggunaan dalam satu tempoh, jadi anda perlu menunggu tetapan semula atau membeli lebih banyak penggunaan. Had kadar API adalah tentang kelajuan anda pada masa ini, dan ia akan pulih dalam masa beberapa saat sebaik sahaja anda memperlahankan kelajuan.
Nombor kuota pelan dan tahap had kadar kerap berubah, dan nombor yang salah adalah lebih buruk daripada tiada nombor langsung, jadi tiada nombor dicetak di sini. Baca maklumat anda sendiri dengan arahan di bawah.
Had limit mana yang anda capai? Baca mesej yang tepat
Claude Code menyatakan nama sistem dalam teks yang dicetak. Padankan mesej anda sebelum anda menukar apa-apa.
You've hit your session limit · resets 3:45pmialah had langganan. Kuota berputar pelan anda untuk tempoh ini telah habis digunakan.You've hit your weekly limit · resets Mon 12:00amialah sistem yang sama tetapi untuk tempoh yang lebih panjang.You've hit your Opus limit · resets 3:45pmialah had langganan yang hanya terpakai untuk permintaan Opus. Ini adalah satu-satunya keadaan di mana menukar model dapat membantu.API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com.ialah had kadar API. Anda telah mencapai had yang ditetapkan untuk API key anda, atau untuk projek Amazon Bedrock atau Google Cloud anda.API Error: Server is temporarily limiting requests (not your usage limit)ialah sekatan jangka pendek yang tidak berkaitan dengan kuota pelan anda. Claude Code akan mencuba semula secara automatik dengan kaedah backoff sebelum memaparkan baris tersebut kepada anda.
Had langganan: sesi, mingguan, dan tetingkap Opus
Pelan langganan merangkumi kuota penggunaan beransur-ansur. Apabila kuota habis, Claude Code akan menyekat permintaan seterusnya sehingga masa tetapan semula yang dipaparkan dalam mesej. Dua sifat kuota tersebut menyebabkan kebanyakan kekeliruan.
- Ia dikongsi dengan sembang Claude. Kerja yang anda lakukan di claude.ai menggunakan kuota yang sama dengan kerja di terminal, jadi penggunaan tinggi pada waktu petang dalam sembang akan memendekkan waktu pengekodan anda.
- Ia dikongsi merentasi model. Had sesi dan mingguan tidak mempunyai bajet bagi setiap model, kecuali had Opus.
Pada Claude for Teams dan Enterprise, struktur yang didokumentasikan adalah kuota bagi setiap tempat duduk yang ditetapkan semula dalam tetingkap lima jam beransur-ansur dan tetingkap mingguan, dikongsi dengan sembang Claude dan Cowork, serta saiznya ditentukan oleh tahap tempat duduk (Standard atau Premium). Pada Pro dan Max, masa tetapan semula yang dicetak dalam mesej dan bar /usage anda adalah angka yang tepat, bukan angka yang disalin daripada hantaran blog. Jika anda masih memilih tahap, pelan Claude mana yang anda perlukan membandingkan sekatan bagi setiap pelan.
Mengapa menukar model dengan /model tidak memulihkan akses
Ini adalah kesilapan yang paling kerap berlaku, dan dokumentasi menyatakan perkara ini dengan jelas: had sesi dan mingguan dikongsi merentasi semua model, jadi menukar model tidak memulihkan akses. Memilih model yang lebih kecil selepas tempoh sesi tamat hanya menukar model yang akan menjawab. Ia tidak mengubah baki kuota, kerana kuota tidak disimpan mengikut model, maka pertukaran tersebut tidak melepaskan apa-apa had.
Pengecualian adalah had Opus, iaitu had khusus untuk model tersebut. Jika mesej memaparkan You've hit your Opus limit, maka /model adalah penyelesaian yang betul. Tukar ke model lain dan teruskan kerja, kerana hanya permintaan Opus yang disekat.
Menganggap had ini sebagai pepijat adalah kesilapan kedua. Memasang semula atau melakukan pengesahan semula tidak mengubah apa-apa. Kuota akan kembali apabila tempoh masa ditetapkan semula, atau apabila anda membeli kredit penggunaan.
Apa yang perlu dilakukan apabila anda mencapai had langganan
- Semak masa tetapan semula. Tetingkap sesi adalah singkat. Tetingkap mingguan bukanlah sesuatu yang perlu anda tunggu di meja kerja.
- Jika ia adalah had Opus, jalankan
/modeldan pilih model lain. - Jalankan
/usageuntuk melihat had pelan anda, bar penggunaan anda, dan bila ia akan ditetapkan semula./costadalah alias untuk skrin yang sama. - Jalankan
/usage-creditsuntuk terus bekerja melampaui had tersebut. Pada Pro dan Max, ia membuka tetapan pengebilan anda. Pada Team dan Enterprise, ia membuka tetapan penggunaan organisasi anda, atau menghantar permintaan kepada admin anda jika anda tiada akses pengebilan. - Jika anda menghadapi masalah yang sama setiap minggu, pelan tersebut tidak sesuai dengan cara kerja anda.
/usage-credits memerlukan langganan claude.ai yang log masuk melalui /login. Ia tidak tersedia dengan pengesahan kunci API, kerana kunci API tidak mempunyai kuota pelan untuk ditambah.
Kredit penggunaan mempunyai satu kesan sampingan yang perlu diketahui terlebih dahulu. Jangka hayat cache prompt adalah satu jam bagi langganan dan menurun kepada lima minit sebaik sahaja anda menggunakan kredit, jadi lebih banyak pusingan bermula dari sifar dan penggunaan token Claude Code meningkat untuk kerja yang sama.
The messages that look like usage limits and are not
Four Claude Code errors get reported as usage limits and are none of them.
- A context or auto-compact warning is not a usage limit.
/contextprints a line such asContext exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue.once the conversation has grown past the model's context window. Older history is summarized to free space, and your plan allowance is untouched. Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again.means/compactitself failed, because there is not enough free context left to hold the summary it would produce.Credit balance is too lowmeans your Console organization has run out of prepaid credits. Add credits at platform.claude.com/settings/billing, which also offers auto-reload.API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard contextis an entitlement check, not an exhausted quota. Pick the model variant without the[1m]suffix, or setCLAUDE_CODE_DISABLE_1M_CONTEXT=1.
One more comes from the API. A 413 request_too_large is a size limit on a single request, not a rate limit.
Had kadar API: apa yang sebenarnya dikira oleh 429
Messages API mengukur tiga perkara, secara berasingan bagi setiap kelas model.
- permintaan seminit (RPM)
- token input seminit (ITPM)
- token output seminit (OTPM)
Organisasi anda juga mempunyai had perbelanjaan, yang merupakan perkara berbeza: kos bulanan maksimum untuk penggunaan API. Sebaik sahaja anda mencapai had perbelanjaan tier anda, penggunaan API akan dihentikan sehingga bulan berikutnya kecuali jika anda meminta had yang lebih tinggi. Tiada kitaran cubaan semula (retry loop) dapat menyelesaikan masalah ini.
Empat mekanik menentukan bila ralat 429 berlaku.
- Had adalah mengikut kelas model. Had ini terpakai secara berasingan untuk setiap model, jadi anda boleh menggunakan model yang berbeza sehingga had masing-masing pada masa yang sama. Sesetengah keluarga berkongsi satu bekas: had kadar Opus adalah jumlah keseluruhan bagi Claude Opus 4.8, Opus 4.7, Opus 4.6 dan Opus 4.5, manakala Claude Sonnet 5 mempunyai hadnya sendiri.
- Kapasiti diisi semula secara berterusan. API menggunakan algoritma token bucket, jadi kapasiti diisi semula secara berterusan dan bukannya ditetapkan semula pada waktu yang tetap. Had 60 permintaan seminit mungkin dikuatkuasakan sebagai satu permintaan sesaat, jadi 60 permintaan yang dihantar serentak tetap akan gagal.
- Hanya input tanpa cache dikira untuk ITPM pada kebanyakan model.
input_tokensdancache_creation_input_tokensdikira.cache_read_input_tokenstidak dikira pada kebanyakan model Claude, dengan Claude Haiku 3.5 sebagai pengecualian yang didokumentasikan. Oleh itu, penggunaan cache memberikan ruang tambahan untuk had kadar serta diskaun. Bagi bahagian output,max_tokensyang tinggi tidak dikira terhadap OTPM, kerana OTPM hanya mengira token yang dihasilkan secara nyata. - Had ditetapkan pada peringkat organisasi. Sesuatu workspace boleh diberikan had yang lebih rendah, dan had peringkat organisasi sentiasa terpakai walaupun jumlah had workspace adalah lebih tinggi. Had yang tidak anda ubah suai pada workspace akan diwarisi daripada organisasi, bukannya dibiarkan tanpa had.
Tier bernama Start, Build, Scale dan Custom menetapkan angka sebenar, yang diberikan secara automatik berdasarkan sejarah penggunaan dan status akaun anda. Organisasi baharu mungkin bermula di bawah had standard yang diterbitkan, jadi ralat 429 pertama boleh berlaku lebih awal daripada yang diramalkan dalam jadual. Peningkatan penggunaan yang mendadak akan mencetuskan had pecutan, yang mengembalikan ralat 429 walaupun anda masih dalam tier anda, jadi tingkatkan trafik secara beransur-ansur. Setiap angka yang diterbitkan adalah siling: had yang didokumentasikan adalah penggunaan maksimum yang dibenarkan, bukan minimum yang dijamin. Untuk meminta lebih, gunakan kawalan "Request rate limit increase" pada halaman Limits di Claude Console.
Membaca 429: retry-after, pengepala, dan percubaan semula SDK
Setiap ralat API mengembalikan sampul yang sama: objek error bersarang yang mengandungi jenis dan mesej, serta request_id pada peringkat teratas.
{
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "<names the rate limit you exceeded>"
},
"request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}Pengepala mengandungi maklumat selebihnya.
retry-afterialah bilangan saat untuk menunggu sebelum anda boleh mencuba semula permintaan tersebut. Percubaan semula yang terlalu awal akan gagal.anthropic-ratelimit-requests-limit,anthropic-ratelimit-requests-remainingdananthropic-ratelimit-requests-resetmenerangkan bajet permintaan anda.anthropic-ratelimit-input-tokens-*dananthropic-ratelimit-output-tokens-*melakukan perkara yang sama untuk ITPM dan OTPM, dengan akhiran limit, remaining dan reset yang sama.anthropic-ratelimit-tokens-*memaparkan nilai untuk had paling ketat yang sedang berkuat kuasa.
Pengepala reset adalah cap masa RFC 3339. Pengepala token remaining dibundarkan kepada ribu terdekat, jadi baca ia sebagai penunjuk. Mod pantas mempunyai kolamnya sendiri dan pengepala anthropic-fast-* sendiri. Baca kesemuanya daripada mana-mana panggilan yang berjaya:
curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
| grep -i 'ratelimit\|retry-after\|request-id'Setiap respons juga mengandungi pengepala request-id yang unik, seperti req_018EeWyXxfu5pfWkrYcMdjWG. Ia muncul sebagai request_id dalam badan ralat dan sebagai _request_id pada respons SDK Python dan TypeScript. Sertakan pengepala ini apabila anda menghubungi sokongan.
Semak sama ada anda memerlukan gelung backoff sebelum anda menulisnya. SDK rasmi akan mencuba semula kegagalan sementara secara automatik, termasuk ralat sambungan, had kadar dan ralat pelayan 5xx, dengan exponential backoff, sebanyak dua kali secara lalai, dengan mematuhi pengepala retry-after jika ia wujud. Setiap klien menerima pilihan maximum-retries untuk mengubah atau mematikan tingkah laku tersebut.
import anthropic
client = anthropic.Anthropic(max_retries=5) # the SDK default is 2
try:
msg = client.messages.create(
model="claude-sonnet-5",
max_tokens=1024,
messages=[{"role": "user", "content": "hello"}],
)
except anthropic.RateLimitError as err:
headers = err.response.headers
print("still limited after retries; wait", headers.get("retry-after"), "seconds")
print("request id:", headers.get("request-id"))529 overloaded_error bukan kesalahan anda
Ralat 429 bermaksud anda menghantar permintaan terlalu pantas. Ralat 529 overloaded_error bermaksud API sedang mengalami bebanan melampau buat sementara waktu, dan ini boleh berlaku apabila API menerima trafik tinggi daripada semua pengguna. Masalah ini bukan disebabkan oleh kunci atau kod anda. Cuba semula menggunakan kaedah exponential backoff, yang sudah tersedia dalam SDK untuk respons 5xx, dan semak status.claude.com jika ralat berterusan. Ralat 500 api_error adalah ralat dalaman yang perlu dicuba semula dengan cara yang sama, dan kedua-duanya bukan merupakan had kadar (rate limit).
Baca had anda sendiri berbanding menggunakan jadual
Bagi langganan, /usage adalah skrin yang penting. Ia memaparkan bar penggunaan pelan anda dan pecahan penggunaan tersebut, manakala d atau w menukar paparan antara 24 jam terakhir dan 7 hari terakhir. Dua perkara perlu diperhatikan. Blok Session menunjukkan penggunaan token API dan bertujuan untuk pengguna API, jadi pelanggan boleh mengabaikan nilai dolar tersebut. Nombor tersebut diambil daripada sejarah sesi tempatan pada mesin tersebut, jadi penggunaan daripada peranti lain atau daripada claude.ai tidak disertakan.
Bagi bahagian API, halaman Usage dalam Claude Console memaparkan dua carta, "Rate Limit - Input Tokens" dan "Rate Limit - Output Tokens". Carta input memplot had maksimum sejam bagi token input tanpa cache setiap minit berbanding had ITPM semasa anda, dengan kadar cache anda di sebelahnya, supaya anda boleh memantau had tersebut sebelum ia dicapai semasa produksi.
Untuk membaca had yang telah dikonfigurasi secara pengaturcaraan:
curl -s https://api.anthropic.com/v1/organizations/rate_limits \
-H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
-H "anthropic-version: 2023-06-01"Ia memerlukan kunci Admin API, dan GET /v1/organizations/workspaces/{workspace_id}/rate_limits melakukan perkara yang sama bagi setiap workspace. Kedua-duanya adalah mod baca sahaja: untuk mengubah had, gunakan tab Limits dalam Console.
Menggunakan less, supaya anda menghadapi kurang had
Kedua-dua sistem mengukur perkara yang sama, jadi tetapan ini berfungsi untuk kedua-duanya.
- Gunakan kurang token bagi setiap pusingan. Sesi berterusan mengekalkan cache yang hangat, dan
/clearantara tugasan yang tidak berkaitan tidak melibatkan kos. Penggunaan token Claude Code menjelaskan semua tetapan tersebut secara terperinci. - Kurangkan usaha. Tahap yang tersedia adalah
low,medium,high,xhighdanmax. Menu/effortjuga menawarkanultracode, yang meningkatkan penggunaan berbanding mengurangkannya. Penaakulan mendalam untuk penamaan semula mekanikal tidak memberikan nilai tambahan. - Kurangkan konkurensi selepas ralat 429. Rendahkan
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCYdan elakkan penggunaan banyak subagent secara selari. Jalankan/statusjuga:ANTHROPIC_API_KEYyang tersilap akan menghantar permintaan melalui kunci tahap rendah dan bukannya langganan anda. - Pindahkan kerja bukan interaktif ke Message Batches API. Ia menjalankan volum besar secara asinkronus dengan diskaun 50% pada token input dan output, di bawah had kadar tersendiri, supaya tugasan waktu malam tidak bersaing dengan sesi anda.
Kerja berbentuk lonjakan yang dipacu oleh program dan bukannya manusia sepatutnya menggunakan kunci API dari awal. Aplikasi Claude API pertama anda pada VPS merangkumi pengendalian kunci dan percubaan semula, manakala sesi ejen yang lama akan kekal berjalan walaupun sambungan terputus jika anda mengekalkan Claude Code berjalan pada VPS di dalam tmux.
FAQ
Mengapa menukar model tidak membaiki had penggunaan Claude saya?
Ini kerana had sesi dan mingguan dikongsi merentasi semua model. Had tersebut terikat pada pelan, bukan pada model, jadi /model hanya menukar model yang menjawab dan bukan jumlah baki had yang ada. Satu-satunya pengecualian ialah You've hit your Opus limit, yang hanya terpakai untuk permintaan Opus. Bagi kes tersebut, menukar model adalah penyelesaian yang didokumentasikan.
Apakah maksud ralat 429 rate_limit_error, dan berapa lama saya perlu menunggu?
Ini bermaksud akaun anda telah mencapai had kadar untuk kelas model tersebut: permintaan seminit, token input seminit, atau token output seminit. Respons tersebut mengandungi pengepala retry-after yang menyatakan jumlah saat untuk menunggu, dan percubaan awal akan gagal. SDK rasmi sudah melakukan percubaan semula bagi had kadar dan ralat 5xx dengan exponential backoff, sebanyak dua kali secara lalai, dengan mematuhi pengepala tersebut. Ralat 429 yang muncul semasa anda masih dalam had tier anda menunjukkan had pecutan daripada lonjakan mendadak.
Bagaimanakah saya boleh melihat had penggunaan Claude saya dan bila ia akan ditetapkan semula?
Dalam Claude Code, jalankan /usage untuk melihat bar pelan, masa penetapan semula dan pecahan penggunaan; /cost adalah alias, manakala d atau w menukar antara 24 jam terakhir dan 7 hari terakhir. Data tersebut diambil daripada sejarah sesi tempatan, jadi ia tidak merangkumi penggunaan daripada peranti lain dan daripada claude.ai. Pada API, Console memaparkan carta had kadar anda, dan GET /v1/organizations/rate_limits memulangkan had yang telah dikonfigurasi dengan kunci Admin API.
Bolehkah saya terus bekerja selepas mencapai had pelan Claude saya?
Kadangkala. Jalankan /usage-credits untuk membeli penggunaan melebihi had pada pelan Pro dan Max, atau untuk memintanya daripada admin pada pelan Team dan Enterprise; ia memerlukan log masuk claude.ai melalui /login dan tidak tersedia dengan pengesahan kunci API. Jika tidak, tunggu sehingga masa penetapan semula, tukar model jika ia adalah had Opus, atau pindahkan kerja ke kunci API, yang mengira penggunaan mengikut minit dan bukannya mengikut jendela masa.