Cara mengatasi had penggunaan Claude yang disekat
Ketahui perbezaan antara had mesej langganan Claude dan ralat HTTP 429 API. Tukar model tidak akan memulihkan akses anda. Baca panduan ini untuk cara penyelesaian yang tepat.
Apakah had penggunaan Claude?
Had penggunaan Claude terdiri daripada dua sistem berasingan, dan langkah pertama adalah menentukan sistem mana yang menyekat anda. Langganan Claude (Pro, Max, Team, atau Enterprise) memberikan anda kuota penggunaan berputar yang dikongsi merentasi model dan dikongsi dengan sembang Claude, jadi ia akan menyekat anda dengan mesej seperti You've hit your session limit · resets 3:45pm. API Claude pula mengukur perkara lain: kelajuan anda menghantar permintaan dan token, yang dikira setiap minit. Ia akan menyekat anda dengan ralat HTTP 429 jenis rate_limit_error serta pengepala retry-after yang menyatakan berapa saat anda perlu menunggu.
Penyelesaian bagi kedua-duanya tidak sama. Had langganan adalah mengenai jumlah penggunaan anda dalam satu tempoh masa, jadi anda perlu menunggu sehingga ia ditetapkan semula atau membeli lebih banyak kuota. Had kadar API pula adalah mengenai kelajuan anda pada masa sekarang, dan ia akan hilang dalam beberapa saat sebaik sahaja anda memperlahankan kadar permintaan.
Peruntukan pelan dan nombor tahap had kadar sering berubah, dan nombor yang salah adalah lebih buruk daripada tiada maklumat langsung, oleh itu tiada nombor yang dicetak di sini. Baca had anda sendiri dengan arahan di bawah.
Had yang mana telah anda capai? Baca mesej yang tepat
Claude Code menamakan sistem tersebut dalam teks yang dicetaknya. Padankan dengan sistem anda sebelum anda mengubah apa-apa.
You've hit your session limit · resets 3:45pmialah had langganan. Peruntukan pusingan pelan anda untuk tempoh ini telah habis digunakan.You've hit your weekly limit · resets Mon 12:00amialah sistem yang sama bagi tempoh yang lebih panjang.You've hit your Opus limit · resets 3:45pmialah had langganan yang hanya terpakai untuk permintaan Opus. Ini adalah satu-satunya keadaan di mana menukar model dapat membantu.API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com.ialah had kadar API. Anda telah mencapai had yang dikonfigurasikan untuk kunci API anda, atau untuk projek Amazon Bedrock atau Google Cloud anda. Mana satu yang terpakai bergantung pada cara klien mengesahkan diri, memandangkan klien Bedrock atau Vertex diukur berdasarkan kuota projek awan anda dan bukannya organisasi Anthropic.API Error: Server is temporarily limiting requests (not your usage limit)ialah pendikit jangka pendek yang tidak berkaitan dengan kuota pelan anda. Claude Code mencuba semula secara automatik dengan backoff sebelum ia menunjukkan baris tersebut kepada anda.
Had langganan: sesi, mingguan, dan tetingkap Opus
Pelan langganan merangkumi peruntukan penggunaan yang sentiasa dikemas kini. Apabila peruntukan ini habis, Claude Code akan menyekat permintaan seterusnya sehingga waktu set semula yang dipaparkan dalam mesej. Dua sifat peruntukan ini sering menimbulkan kekeliruan.
- Ia dikongsi dengan sembang Claude. Kerja yang anda lakukan di claude.ai menggunakan peruntukan yang sama dengan kerja di terminal, jadi sesi sembang yang intensif pada waktu petang akan memendekkan masa pengekodan anda pada waktu malam. Setiap platform yang anda log masuk dengan akaun tersebut menggunakan kumpulan peruntukan yang sama, jadi pada Linux aplikasi desktop beta dan CLI Claude Code berkongsi satu peruntukan yang sama, bukan satu peruntukan bagi setiap satu.
- Ia dikongsi merentas model. Had sesi dan mingguan tidak mempunyai bajet khusus bagi setiap model, kecuali had bagi Opus.
Bagi Claude untuk Teams dan Enterprise, bentuk peruntukan yang didokumenkan adalah peruntukan bagi setiap tempat duduk yang ditetapkan semula dalam tetingkap lima jam yang sentiasa dikemas kini dan tetingkap mingguan, dikongsi dengan sembang Claude dan Cowork, serta ditentukan mengikut peringkat tempat duduk (Standard atau Premium). Bagi Pro dan Max, waktu set semula yang dicetak dalam mesej dan bar /usage anda sendiri adalah angka yang boleh dipercayai, bukannya angka yang disalin daripada catatan blog. Jika anda masih memilih peringkat, pelan Claude yang anda perlukan membandingkan perkara yang dihadkan oleh setiap pelan.
Mengapa menukar model dengan /model tidak memulihkan akses
Ini adalah langkah silap yang paling kerap berlaku, dan dokumentasi menyatakan perkara ini dengan jelas: had sesi dan had mingguan dikongsi merentasi semua model, jadi menukar model tidak akan memulihkan akses. Memilih model yang lebih kecil selepas tempoh sesi anda tamat hanya menukar model yang akan menjawab permintaan anda. Ia tidak mengubah jumlah kuota yang berbaki, kerana kuota tersebut tidak pernah ditetapkan mengikut model, jadi pertukaran tersebut tidak membebaskan apa-apa.
Pengecualiannya ialah had Opus, iaitu had yang benar-benar khusus untuk model tersebut. Jika mesej memaparkan You've hit your Opus limit, maka /model adalah penyelesaian yang betul. Tukar kepada model lain dan teruskan bekerja, kerana hanya permintaan Opus yang disekat.
Menganggap had tersebut sebagai pepijat adalah langkah silap yang kedua. Memasang semula atau mengesahkan semula identiti tidak akan mengubah apa-apa. Kuota akan kembali apabila tempoh masa ditetapkan semula, atau apabila anda membeli kredit penggunaan.
Tindakan apabila anda mencapai had langganan
- Semak waktu set semula. Tetingkap sesi adalah singkat. Tetingkap mingguan bukanlah sesuatu yang perlu anda tunggu di meja kerja.
- Jika ia adalah had Opus, jalankan
/modeldan pilih model lain. - Jalankan
/usageuntuk melihat had pelan, bar penggunaan, dan waktu ia ditetapkan semula./costialah alias untuk skrin yang sama. - Jalankan
/usage-creditsuntuk terus bekerja selepas mencapai had. Pada pelan Pro dan Max, ia membuka tetapan pengebilan anda. Pada pelan Team dan Enterprise, ia membuka tetapan penggunaan organisasi anda, atau menghantar permintaan kepada pentadbir anda jika anda tidak mempunyai akses pengebilan. - Jika anda mencapai had yang sama setiap minggu, pelan tersebut tidak sesuai dengan cara kerja anda, dan laluan keluar daripada had penggunaan wajar dipertimbangkan sekali sahaja berbanding setiap kali ia ditetapkan semula.
/usage-credits memerlukan langganan claude.ai yang dilog masuk melalui /login. Ia tidak tersedia dengan pengesahan API key, kerana API key tidak mempunyai peruntukan pelan untuk dilanjutkan.
Kredit penggunaan mempunyai satu kesan sampingan yang perlu diketahui terlebih dahulu. Jangka hayat cache prompt adalah satu jam pada langganan dan berkurangan kepada lima minit sebaik sahaja anda menggunakan kredit, jadi lebih banyak pusingan bermula dari awal dan penggunaan token Claude Code meningkat untuk kerja yang sama.
Mesej yang kelihatan seperti had penggunaan tetapi sebenarnya bukan
Empat ralat Claude Code dilaporkan sebagai had penggunaan sedangkan ia bukan had penggunaan.
- Amaran konteks atau auto-compact bukanlah had penggunaan.
/contextmencetak baris sepertiContext exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue.sebaik sahaja perbualan melebihi tetingkap konteks model. Sejarah lama diringkaskan untuk mengosongkan ruang, dan peruntukan pelan anda tidak terjejas. Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again.bermaksud/compactitu sendiri gagal, kerana tidak cukup ruang konteks bebas untuk memuatkan ringkasan yang sepatutnya dihasilkan.Credit balance is too lowbermaksud organisasi Console anda telah kehabisan kredit prabayar. Tambah kredit di platform.claude.com/settings/billing, yang turut menawarkan fungsi tambah nilai automatik.API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard contextialah semakan kelayakan, bukan kuota yang habis. Pilih varian model tanpa akhiran[1m], atau tetapkanCLAUDE_CODE_DISABLE_1M_CONTEXT=1.
Satu lagi ralat datang daripada API. Ralat 413 request_too_large ialah had saiz bagi satu permintaan tunggal, bukan had kadar.
Had laju API: apa yang sebenarnya dikira oleh ralat 429
Messages API mengukur tiga perkara, secara berasingan bagi setiap kelas model.
- permintaan seminit (RPM)
- token input seminit (ITPM)
- token output seminit (OTPM)
Organisasi anda juga mempunyai had perbelanjaan, yang merupakan perkara berbeza: kos bulanan maksimum untuk penggunaan API. Sebaik sahaja anda mencapai had perbelanjaan peringkat anda, penggunaan API akan berhenti sehingga bulan berikutnya melainkan anda meminta had yang lebih tinggi. Tiada gelung cuba semula (retry loop) yang dapat menyelesaikan masalah ini.
Empat mekanik menentukan bila ralat 429 berlaku.
- Had adalah mengikut kelas model. Ia terpakai secara berasingan bagi setiap model, jadi anda boleh menggunakan model yang berbeza sehingga had masing-masing pada masa yang sama. Sesetengah keluarga model berkongsi baldi (bucket) yang sama: had laju Opus adalah jumlah keseluruhan merentasi Claude Opus 4.8, Opus 4.7, Opus 4.6 dan Opus 4.5, manakala Claude Sonnet 5 mempunyai hadnya sendiri.
- Kapasiti diisi semula secara berterusan. API menggunakan algoritma token bucket, jadi kapasiti diisi semula secara berterusan dan bukannya ditetapkan semula pada waktu tertentu. Had 60 permintaan seminit mungkin dikuatkuasakan sebagai satu permintaan sesaat, jadi 60 permintaan yang dihantar serentak masih akan gagal.
- Hanya input yang tidak dicache dikira ke arah ITPM pada kebanyakan model.
input_tokensdancache_creation_input_tokensdikira.cache_read_input_tokenstidak dikira pada kebanyakan model Claude, dengan Claude Haiku 3.5 sebagai pengecualian yang didokumenkan. Oleh itu, caching memberikan ruang had laju tambahan selain daripada diskaun. Dari segi output,max_tokensyang tinggi tidak dikira terhadap OTPM, kerana OTPM hanya mengira token yang benar-benar dihasilkan. - Had ditetapkan pada peringkat organisasi. Ruang kerja (workspace) boleh diberikan had yang lebih rendah, dan had seluruh organisasi sentiasa terpakai walaupun jumlah had ruang kerja melebihi had tersebut. Had yang tidak anda ubah suai pada ruang kerja akan diwarisi daripada organisasi, bukannya dibiarkan tanpa had.
Peringkat yang dinamakan Start, Build, Scale dan Custom menetapkan angka sebenar, yang diberikan secara automatik berdasarkan sejarah penggunaan dan status akaun anda. Organisasi baharu mungkin bermula di bawah had standard yang diterbitkan, jadi ralat 429 pertama boleh berlaku lebih awal daripada yang dijangkakan dalam jadual. Peningkatan penggunaan yang mendadak akan mencetuskan had pecutan, yang mengembalikan ralat 429 walaupun anda masih berada dalam peringkat anda, jadi tingkatkan trafik secara beransur-ansur. Setiap angka yang diterbitkan adalah siling: had yang didokumenkan adalah penggunaan maksimum yang dibenarkan, bukan minimum yang dijamin. Untuk meminta lebih, gunakan kawalan "Request rate limit increase" pada halaman Limits dalam Claude Console.
Membaca ralat 429: retry-after, pengepala, dan percubaan semula SDK
Setiap ralat API mengembalikan sampul yang sama: objek error bersarang yang membawa jenis dan mesej, serta request_id pada peringkat atas.
{
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "<names the rate limit you exceeded>"
},
"request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}Pengepala membawa maklumat selebihnya.
retry-afterialah bilangan saat untuk menunggu sebelum anda boleh mencuba semula permintaan tersebut. Percubaan semula yang lebih awal akan gagal.anthropic-ratelimit-requests-limit,anthropic-ratelimit-requests-remainingdananthropic-ratelimit-requests-resetmenerangkan belanjawan permintaan anda.anthropic-ratelimit-input-tokens-*dananthropic-ratelimit-output-tokens-*melakukan perkara yang sama untuk ITPM dan OTPM, dengan akhiran limit, remaining dan reset yang serupa.anthropic-ratelimit-tokens-*memaparkan nilai untuk had paling ketat yang sedang berkuat kuasa.
Pengepala reset adalah dalam format cap masa RFC 3339. Pengepala baki token dibundarkan kepada ribu yang terdekat, jadi bacanya sebagai penunjuk aras. Mod pantas mempunyai kumpulan (pool) sendiri dan pengepala anthropic-fast-* sendiri. Baca kesemuanya daripada mana-mana panggilan yang berjaya:
curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
| grep -i 'ratelimit\|retry-after\|request-id'Setiap respons juga membawa pengepala request-id yang unik, seperti req_018EeWyXxfu5pfWkrYcMdjWG. Ia muncul sebagai request_id dalam badan ralat dan sebagai _request_id pada respons SDK Python dan TypeScript. Petik pengepala ini apabila anda menghubungi sokongan.
Semak sama ada anda benar-benar memerlukan gelung backoff sebelum anda menulisnya. SDK rasmi secara automatik mencuba semula kegagalan sementara, termasuk ralat sambungan, had kadar dan ralat pelayan 5xx, dengan backoff eksponen, secara lalai sebanyak dua kali, dengan mematuhi pengepala retry-after apabila ia hadir. Setiap klien menerima pilihan maximum-retries untuk mengubah atau melumpuhkan gelagat tersebut.
import anthropic
client = anthropic.Anthropic(max_retries=5) # the SDK default is 2
try:
msg = client.messages.create(
model="claude-sonnet-5",
max_tokens=1024,
messages=[{"role": "user", "content": "hello"}],
)
except anthropic.RateLimitError as err:
headers = err.response.headers
print("still limited after retries; wait", headers.get("retry-after"), "seconds")
print("request id:", headers.get("request-id"))529 ralat beban lampau bukan salah anda
Kod 429 bermaksud anda membuat permintaan terlalu pantas. Kod 529 overloaded_error bermaksud API mengalami beban lampau buat sementara waktu, dan ia boleh berlaku apabila API menerima trafik yang tinggi daripada semua pengguna. Tiada kaitan dengan kunci atau kod anda yang menyebabkan perkara ini. Cuba semula dengan exponential backoff, yang sudah pun dilakukan oleh SDK untuk respons 5xx, dan semak status.claude.com jika masalah tidak selesai. Kod 500 api_error ialah ralat dalaman yang perlu dicuba semula dengan cara yang sama, dan kedua-duanya bukanlah had kadar (rate limit).
Baca had anda sendiri dan bukannya jadual
Bagi langganan, /usage ialah skrin yang penting. Ia memaparkan bar penggunaan pelan anda serta perincian perkara yang menggunakannya, manakala d atau w menukar paparan antara 24 jam terakhir dan 7 hari terakhir. Terdapat dua perkara yang perlu diberi perhatian. Blok Session menunjukkan penggunaan token API dan ditujukan untuk pengguna API, jadi pelanggan boleh mengabaikan angka dolar di situ. Angka tersebut diperoleh daripada sejarah sesi setempat pada mesin tersebut, jadi penggunaan daripada peranti lain atau daripada claude.ai tidak disertakan.
Bagi bahagian API, halaman Usage dalam Claude Console memaparkan dua carta, "Rate Limit - Input Tokens" dan "Rate Limit - Output Tokens". Carta input memplotkan maksimum setiap jam bagi token input yang tidak dicache seminit berbanding had ITPM semasa anda, dengan kadar cache anda di sebelahnya, supaya anda dapat memantau had yang hampir dicapai dan bukannya menemuinya semasa pengeluaran (production).
Untuk membaca had yang dikonfigurasikan secara programatik:
curl -s https://api.anthropic.com/v1/organizations/rate_limits \
-H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
-H "anthropic-version: 2023-06-01"Ia memerlukan kunci Admin API, dan GET /v1/organizations/workspaces/{workspace_id}/rate_limits melakukan perkara yang sama bagi setiap ruang kerja (workspace). Kedua-duanya adalah baca sahaja: untuk menukar had, gunakan tab Limits dalam Console.
Menggunakan less, supaya anda menghadapi lebih sedikit had
Kedua-dua sistem mengukur perkara yang sama di bawahnya, jadi tuil ini berfungsi pada mana-mana sistem.
- Gunakan lebih sedikit token bagi setiap giliran. Tugasan berterusan memastikan cache sentiasa hangat, dan
/clearantara tugasan yang tidak berkaitan tidak menelan sebarang kos. Penggunaan token Claude Code merangkumi tuil tersebut sepenuhnya. - Kurangkan usaha. Tahapnya ialah
low,medium,high,xhighdanmax. Menu/effortjuga menawarkanultracode, yang meningkatkan perbelanjaan dan bukannya mengurangkannya. Penaakulan mendalam terhadap penamaan semula mekanikal tidak memberikan sebarang hasil. - Kurangkan konkurensi selepas ralat 429. Rendahkan
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCYdan elakkan terlalu banyak subejen selari. Jalankan/statusjuga:ANTHROPIC_API_KEYyang tersasar akan menghalakan permintaan melalui kunci peringkat rendah dan bukannya langganan anda. - Alihkan kerja bukan interaktif ke Message Batches API. Ia menjalankan volum besar secara tak segerak pada diskaun 50% untuk token input dan output, di bawah had kadarnya sendiri, supaya kerja malam tidak bersaing dengan sesi anda.
Kerja yang memasukkan data ke dalam konteks paling terasa kesannya: jika anda menganalisis saham dan opsyen berbanding data pasaran langsung, menarik bahagian kecil yang diperlukan oleh setiap soalan menelan kos yang jauh lebih rendah berbanding menampal keseluruhan jadual sebut harga dan rantaian. Kerja secara berkala yang dipacu oleh program dan bukannya orang harus menggunakan kunci API sejak awal lagi. Peralihan ke sana mengubah cara anda membayar serta cara anda diukur, memandangkan Claude API tidak mempunyai peringkat percuma selain kredit kecil yang diberikan semasa pendaftaran. Aplikasi Claude API pertama anda pada VPS merangkumi pengendalian kunci dan percubaan semula, dan ejen yang berjalan lama akan bertahan daripada sambungan yang terputus apabila anda memastikan Claude Code berjalan pada VPS di dalam tmux.
FAQ
Mengapa menukar model tidak menyelesaikan had penggunaan Claude saya?
Kerana had sesi dan mingguan dikongsi merentasi semua model. Kuota tersebut terikat pada pelan, bukan pada model, jadi /model hanya menukar model yang akan menjawab dan bukannya menambah baki kuota yang tinggal. Satu-satunya pengecualian ialah You've hit your Opus limit, yang hanya terpakai untuk permintaan Opus. Dalam kes itu, menukar model adalah penyelesaian yang didokumentasikan.
Apakah maksud ralat 429 rate_limit_error, dan berapa lama saya perlu menunggu?
Ini bermakna akaun anda telah mencapai had kadar untuk kelas model tersebut: permintaan seminit, token input seminit, atau token output seminit. Respons tersebut membawa header retry-after yang menyatakan saat untuk menunggu, dan percubaan semula yang dilakukan lebih awal akan gagal. SDK rasmi sudah pun melakukan percubaan semula untuk had kadar dan ralat 5xx dengan exponential backoff, secara lalai sebanyak dua kali, dengan mematuhi header tersebut. Ralat 429 yang muncul semasa anda masih berada dalam had pelan anda menunjukkan had pecutan akibat peningkatan trafik secara tiba-tiba.
Bagaimanakah cara untuk melihat had penggunaan Claude saya dan bila ia ditetapkan semula?
Dalam Claude Code, jalankan /usage untuk melihat bar pelan anda, waktu tetapan semula dan pecahan penggunaan; /cost ialah alias, dan d atau w menukar paparan antara 24 jam terakhir dan 7 hari terakhir. Angka tersebut diperoleh daripada sejarah sesi setempat, jadi ia tidak merangkumi penggunaan daripada peranti lain dan daripada claude.ai. Pada API, Konsol memaparkan carta had kadar anda, dan GET /v1/organizations/rate_limits mengembalikan had yang dikonfigurasikan dengan kunci Admin API.
Bolehkah saya terus bekerja selepas mencapai had pelan Claude saya?
Kadangkala boleh. Jalankan /usage-credits untuk membeli penggunaan melebihi had bagi pelan Pro dan Max, atau untuk memohon daripada pentadbir bagi pelan Team dan Enterprise; ia memerlukan log masuk claude.ai melalui /login dan tidak tersedia dengan pengesahan kunci API. Jika tidak, tunggu sehingga waktu tetapan semula, tukar model jika ia adalah had Opus, atau pindahkan kerja ke kunci API, yang mengira penggunaan setiap minit dan bukannya setiap tetingkap masa.