SSD Nodes Learn
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-07-24

Cara atasi had penggunaan Claude

Ketahui perbezaan had kuota langganan dan ralat HTTP 429 API. Ketahui mengapa menukar model tidak memulihkan akses dan cara menguruskan had penggunaan anda.

Apakah had penggunaan Claude?

Had penggunaan Claude terdiri daripada dua sistem berbeza. Langkah pertama adalah mengenal pasti sistem mana yang menghalang anda. Langganan Claude (Pro, Max, Team, atau Enterprise) memberikan kuota penggunaan berayun yang dikongsi antara model dan dikongsi dengan sembang Claude, jadi ia akan menghentikan anda dengan mesej seperti You've hit your session limit · resets 3:45pm. Claude API mengukur perkara lain: kepantasan anda menghantar permintaan dan token, yang dikira setiap minit. Ia akan menghentikan anda dengan ralat HTTP 429 jenis rate_limit_error dan pengepala retry-after yang menyatakan berapa saat perlu menunggu.

Cara penyelesaiannya adalah berbeza sama sekali. Had langganan adalah tentang jumlah penggunaan dalam satu tempoh, jadi anda perlu menunggu tetapan semula atau membeli lebih banyak penggunaan. Had kadar API adalah tentang kelajuan anda pada masa ini, dan ia akan pulih dalam masa beberapa saat sebaik sahaja anda memperlahankan kelajuan.

Nombor kuota pelan dan tahap had kadar kerap berubah, dan nombor yang salah adalah lebih buruk daripada tiada nombor langsung, jadi tiada nombor dicetak di sini. Baca maklumat anda sendiri dengan arahan di bawah.

Had limit mana yang anda capai? Baca mesej yang tepat

Claude Code menyatakan nama sistem dalam teks yang dicetak. Padankan mesej anda sebelum anda menukar apa-apa.

  • You've hit your session limit · resets 3:45pm ialah had langganan. Kuota berputar pelan anda untuk tempoh ini telah habis digunakan.
  • You've hit your weekly limit · resets Mon 12:00am ialah sistem yang sama tetapi untuk tempoh yang lebih panjang.
  • You've hit your Opus limit · resets 3:45pm ialah had langganan yang hanya terpakai untuk permintaan Opus. Ini adalah satu-satunya keadaan di mana menukar model dapat membantu.
  • API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com. ialah had kadar API. Anda telah mencapai had yang ditetapkan untuk API key anda, atau untuk projek Amazon Bedrock atau Google Cloud anda.
  • API Error: Server is temporarily limiting requests (not your usage limit) ialah sekatan jangka pendek yang tidak berkaitan dengan kuota pelan anda. Claude Code akan mencuba semula secara automatik dengan kaedah backoff sebelum memaparkan baris tersebut kepada anda.

Had langganan: sesi, mingguan, dan tetingkap Opus

Pelan langganan merangkumi kuota penggunaan beransur-ansur. Apabila kuota habis, Claude Code akan menyekat permintaan seterusnya sehingga masa tetapan semula yang dipaparkan dalam mesej. Dua sifat kuota tersebut menyebabkan kebanyakan kekeliruan.

  • Ia dikongsi dengan sembang Claude. Kerja yang anda lakukan di claude.ai menggunakan kuota yang sama dengan kerja di terminal, jadi penggunaan tinggi pada waktu petang dalam sembang akan memendekkan waktu pengekodan anda.
  • Ia dikongsi merentasi model. Had sesi dan mingguan tidak mempunyai bajet bagi setiap model, kecuali had Opus.

Pada Claude for Teams dan Enterprise, struktur yang didokumentasikan adalah kuota bagi setiap tempat duduk yang ditetapkan semula dalam tetingkap lima jam beransur-ansur dan tetingkap mingguan, dikongsi dengan sembang Claude dan Cowork, serta saiznya ditentukan oleh tahap tempat duduk (Standard atau Premium). Pada Pro dan Max, masa tetapan semula yang dicetak dalam mesej dan bar /usage anda adalah angka yang tepat, bukan angka yang disalin daripada hantaran blog. Jika anda masih memilih tahap, pelan Claude mana yang anda perlukan membandingkan sekatan bagi setiap pelan.

Mengapa menukar model dengan /model tidak memulihkan akses

Ini adalah kesilapan yang paling kerap berlaku, dan dokumentasi menyatakan perkara ini dengan jelas: had sesi dan mingguan dikongsi merentasi semua model, jadi menukar model tidak memulihkan akses. Memilih model yang lebih kecil selepas tempoh sesi tamat hanya menukar model yang akan menjawab. Ia tidak mengubah baki kuota, kerana kuota tidak disimpan mengikut model, maka pertukaran tersebut tidak melepaskan apa-apa had.

Pengecualian adalah had Opus, iaitu had khusus untuk model tersebut. Jika mesej memaparkan You've hit your Opus limit, maka /model adalah penyelesaian yang betul. Tukar ke model lain dan teruskan kerja, kerana hanya permintaan Opus yang disekat.

Menganggap had ini sebagai pepijat adalah kesilapan kedua. Memasang semula atau melakukan pengesahan semula tidak mengubah apa-apa. Kuota akan kembali apabila tempoh masa ditetapkan semula, atau apabila anda membeli kredit penggunaan.

Apa yang perlu dilakukan apabila anda mencapai had langganan

  1. Semak masa tetapan semula. Tetingkap sesi adalah singkat. Tetingkap mingguan bukanlah sesuatu yang perlu anda tunggu di meja kerja.
  2. Jika ia adalah had Opus, jalankan /model dan pilih model lain.
  3. Jalankan /usage untuk melihat had pelan anda, bar penggunaan anda, dan bila ia akan ditetapkan semula. /cost adalah alias untuk skrin yang sama.
  4. Jalankan /usage-credits untuk terus bekerja melampaui had tersebut. Pada Pro dan Max, ia membuka tetapan pengebilan anda. Pada Team dan Enterprise, ia membuka tetapan penggunaan organisasi anda, atau menghantar permintaan kepada admin anda jika anda tiada akses pengebilan.
  5. Jika anda menghadapi masalah yang sama setiap minggu, pelan tersebut tidak sesuai dengan cara kerja anda.

/usage-credits memerlukan langganan claude.ai yang log masuk melalui /login. Ia tidak tersedia dengan pengesahan kunci API, kerana kunci API tidak mempunyai kuota pelan untuk ditambah.

Kredit penggunaan mempunyai satu kesan sampingan yang perlu diketahui terlebih dahulu. Jangka hayat cache prompt adalah satu jam bagi langganan dan menurun kepada lima minit sebaik sahaja anda menggunakan kredit, jadi lebih banyak pusingan bermula dari sifar dan penggunaan token Claude Code meningkat untuk kerja yang sama.

The messages that look like usage limits and are not

Four Claude Code errors get reported as usage limits and are none of them.

  • A context or auto-compact warning is not a usage limit. /context prints a line such as Context exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue. once the conversation has grown past the model's context window. Older history is summarized to free space, and your plan allowance is untouched.
  • Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again. means /compact itself failed, because there is not enough free context left to hold the summary it would produce.
  • Credit balance is too low means your Console organization has run out of prepaid credits. Add credits at platform.claude.com/settings/billing, which also offers auto-reload.
  • API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context is an entitlement check, not an exhausted quota. Pick the model variant without the [1m] suffix, or set CLAUDE_CODE_DISABLE_1M_CONTEXT=1.

One more comes from the API. A 413 request_too_large is a size limit on a single request, not a rate limit.

Had kadar API: apa yang sebenarnya dikira oleh 429

Messages API mengukur tiga perkara, secara berasingan bagi setiap kelas model.

  • permintaan seminit (RPM)
  • token input seminit (ITPM)
  • token output seminit (OTPM)

Organisasi anda juga mempunyai had perbelanjaan, yang merupakan perkara berbeza: kos bulanan maksimum untuk penggunaan API. Sebaik sahaja anda mencapai had perbelanjaan tier anda, penggunaan API akan dihentikan sehingga bulan berikutnya kecuali jika anda meminta had yang lebih tinggi. Tiada kitaran cubaan semula (retry loop) dapat menyelesaikan masalah ini.

Empat mekanik menentukan bila ralat 429 berlaku.

  • Had adalah mengikut kelas model. Had ini terpakai secara berasingan untuk setiap model, jadi anda boleh menggunakan model yang berbeza sehingga had masing-masing pada masa yang sama. Sesetengah keluarga berkongsi satu bekas: had kadar Opus adalah jumlah keseluruhan bagi Claude Opus 4.8, Opus 4.7, Opus 4.6 dan Opus 4.5, manakala Claude Sonnet 5 mempunyai hadnya sendiri.
  • Kapasiti diisi semula secara berterusan. API menggunakan algoritma token bucket, jadi kapasiti diisi semula secara berterusan dan bukannya ditetapkan semula pada waktu yang tetap. Had 60 permintaan seminit mungkin dikuatkuasakan sebagai satu permintaan sesaat, jadi 60 permintaan yang dihantar serentak tetap akan gagal.
  • Hanya input tanpa cache dikira untuk ITPM pada kebanyakan model. input_tokens dan cache_creation_input_tokens dikira. cache_read_input_tokens tidak dikira pada kebanyakan model Claude, dengan Claude Haiku 3.5 sebagai pengecualian yang didokumentasikan. Oleh itu, penggunaan cache memberikan ruang tambahan untuk had kadar serta diskaun. Bagi bahagian output, max_tokens yang tinggi tidak dikira terhadap OTPM, kerana OTPM hanya mengira token yang dihasilkan secara nyata.
  • Had ditetapkan pada peringkat organisasi. Sesuatu workspace boleh diberikan had yang lebih rendah, dan had peringkat organisasi sentiasa terpakai walaupun jumlah had workspace adalah lebih tinggi. Had yang tidak anda ubah suai pada workspace akan diwarisi daripada organisasi, bukannya dibiarkan tanpa had.

Tier bernama Start, Build, Scale dan Custom menetapkan angka sebenar, yang diberikan secara automatik berdasarkan sejarah penggunaan dan status akaun anda. Organisasi baharu mungkin bermula di bawah had standard yang diterbitkan, jadi ralat 429 pertama boleh berlaku lebih awal daripada yang diramalkan dalam jadual. Peningkatan penggunaan yang mendadak akan mencetuskan had pecutan, yang mengembalikan ralat 429 walaupun anda masih dalam tier anda, jadi tingkatkan trafik secara beransur-ansur. Setiap angka yang diterbitkan adalah siling: had yang didokumentasikan adalah penggunaan maksimum yang dibenarkan, bukan minimum yang dijamin. Untuk meminta lebih, gunakan kawalan "Request rate limit increase" pada halaman Limits di Claude Console.

Membaca 429: retry-after, pengepala, dan percubaan semula SDK

Setiap ralat API mengembalikan sampul yang sama: objek error bersarang yang mengandungi jenis dan mesej, serta request_id pada peringkat teratas.

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "<names the rate limit you exceeded>"
  },
  "request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}

Pengepala mengandungi maklumat selebihnya.

  • retry-after ialah bilangan saat untuk menunggu sebelum anda boleh mencuba semula permintaan tersebut. Percubaan semula yang terlalu awal akan gagal.
  • anthropic-ratelimit-requests-limit, anthropic-ratelimit-requests-remaining dan anthropic-ratelimit-requests-reset menerangkan bajet permintaan anda.
  • anthropic-ratelimit-input-tokens-* dan anthropic-ratelimit-output-tokens-* melakukan perkara yang sama untuk ITPM dan OTPM, dengan akhiran limit, remaining dan reset yang sama.
  • anthropic-ratelimit-tokens-* memaparkan nilai untuk had paling ketat yang sedang berkuat kuasa.

Pengepala reset adalah cap masa RFC 3339. Pengepala token remaining dibundarkan kepada ribu terdekat, jadi baca ia sebagai penunjuk. Mod pantas mempunyai kolamnya sendiri dan pengepala anthropic-fast-* sendiri. Baca kesemuanya daripada mana-mana panggilan yang berjaya:

curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
  | grep -i 'ratelimit\|retry-after\|request-id'

Setiap respons juga mengandungi pengepala request-id yang unik, seperti req_018EeWyXxfu5pfWkrYcMdjWG. Ia muncul sebagai request_id dalam badan ralat dan sebagai _request_id pada respons SDK Python dan TypeScript. Sertakan pengepala ini apabila anda menghubungi sokongan.

Semak sama ada anda memerlukan gelung backoff sebelum anda menulisnya. SDK rasmi akan mencuba semula kegagalan sementara secara automatik, termasuk ralat sambungan, had kadar dan ralat pelayan 5xx, dengan exponential backoff, sebanyak dua kali secara lalai, dengan mematuhi pengepala retry-after jika ia wujud. Setiap klien menerima pilihan maximum-retries untuk mengubah atau mematikan tingkah laku tersebut.

import anthropic

client = anthropic.Anthropic(max_retries=5)  # the SDK default is 2

try:
    msg = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": "hello"}],
    )
except anthropic.RateLimitError as err:
    headers = err.response.headers
    print("still limited after retries; wait", headers.get("retry-after"), "seconds")
    print("request id:", headers.get("request-id"))

529 overloaded_error bukan kesalahan anda

Ralat 429 bermaksud anda menghantar permintaan terlalu pantas. Ralat 529 overloaded_error bermaksud API sedang mengalami bebanan melampau buat sementara waktu, dan ini boleh berlaku apabila API menerima trafik tinggi daripada semua pengguna. Masalah ini bukan disebabkan oleh kunci atau kod anda. Cuba semula menggunakan kaedah exponential backoff, yang sudah tersedia dalam SDK untuk respons 5xx, dan semak status.claude.com jika ralat berterusan. Ralat 500 api_error adalah ralat dalaman yang perlu dicuba semula dengan cara yang sama, dan kedua-duanya bukan merupakan had kadar (rate limit).

Baca had anda sendiri berbanding menggunakan jadual

Bagi langganan, /usage adalah skrin yang penting. Ia memaparkan bar penggunaan pelan anda dan pecahan penggunaan tersebut, manakala d atau w menukar paparan antara 24 jam terakhir dan 7 hari terakhir. Dua perkara perlu diperhatikan. Blok Session menunjukkan penggunaan token API dan bertujuan untuk pengguna API, jadi pelanggan boleh mengabaikan nilai dolar tersebut. Nombor tersebut diambil daripada sejarah sesi tempatan pada mesin tersebut, jadi penggunaan daripada peranti lain atau daripada claude.ai tidak disertakan.

Bagi bahagian API, halaman Usage dalam Claude Console memaparkan dua carta, "Rate Limit - Input Tokens" dan "Rate Limit - Output Tokens". Carta input memplot had maksimum sejam bagi token input tanpa cache setiap minit berbanding had ITPM semasa anda, dengan kadar cache anda di sebelahnya, supaya anda boleh memantau had tersebut sebelum ia dicapai semasa produksi.

Untuk membaca had yang telah dikonfigurasi secara pengaturcaraan:

curl -s https://api.anthropic.com/v1/organizations/rate_limits \
  -H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
  -H "anthropic-version: 2023-06-01"

Ia memerlukan kunci Admin API, dan GET /v1/organizations/workspaces/{workspace_id}/rate_limits melakukan perkara yang sama bagi setiap workspace. Kedua-duanya adalah mod baca sahaja: untuk mengubah had, gunakan tab Limits dalam Console.

Menggunakan less, supaya anda menghadapi kurang had

Kedua-dua sistem mengukur perkara yang sama, jadi tetapan ini berfungsi untuk kedua-duanya.

  • Gunakan kurang token bagi setiap pusingan. Sesi berterusan mengekalkan cache yang hangat, dan /clear antara tugasan yang tidak berkaitan tidak melibatkan kos. Penggunaan token Claude Code menjelaskan semua tetapan tersebut secara terperinci.
  • Kurangkan usaha. Tahap yang tersedia adalah low, medium, high, xhigh dan max. Menu /effort juga menawarkan ultracode, yang meningkatkan penggunaan berbanding mengurangkannya. Penaakulan mendalam untuk penamaan semula mekanikal tidak memberikan nilai tambahan.
  • Kurangkan konkurensi selepas ralat 429. Rendahkan CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY dan elakkan penggunaan banyak subagent secara selari. Jalankan /status juga: ANTHROPIC_API_KEY yang tersilap akan menghantar permintaan melalui kunci tahap rendah dan bukannya langganan anda.
  • Pindahkan kerja bukan interaktif ke Message Batches API. Ia menjalankan volum besar secara asinkronus dengan diskaun 50% pada token input dan output, di bawah had kadar tersendiri, supaya tugasan waktu malam tidak bersaing dengan sesi anda.

Kerja berbentuk lonjakan yang dipacu oleh program dan bukannya manusia sepatutnya menggunakan kunci API dari awal. Aplikasi Claude API pertama anda pada VPS merangkumi pengendalian kunci dan percubaan semula, manakala sesi ejen yang lama akan kekal berjalan walaupun sambungan terputus jika anda mengekalkan Claude Code berjalan pada VPS di dalam tmux.

FAQ

Mengapa menukar model tidak membaiki had penggunaan Claude saya?

Ini kerana had sesi dan mingguan dikongsi merentasi semua model. Had tersebut terikat pada pelan, bukan pada model, jadi /model hanya menukar model yang menjawab dan bukan jumlah baki had yang ada. Satu-satunya pengecualian ialah You've hit your Opus limit, yang hanya terpakai untuk permintaan Opus. Bagi kes tersebut, menukar model adalah penyelesaian yang didokumentasikan.

Apakah maksud ralat 429 rate_limit_error, dan berapa lama saya perlu menunggu?

Ini bermaksud akaun anda telah mencapai had kadar untuk kelas model tersebut: permintaan seminit, token input seminit, atau token output seminit. Respons tersebut mengandungi pengepala retry-after yang menyatakan jumlah saat untuk menunggu, dan percubaan awal akan gagal. SDK rasmi sudah melakukan percubaan semula bagi had kadar dan ralat 5xx dengan exponential backoff, sebanyak dua kali secara lalai, dengan mematuhi pengepala tersebut. Ralat 429 yang muncul semasa anda masih dalam had tier anda menunjukkan had pecutan daripada lonjakan mendadak.

Bagaimanakah saya boleh melihat had penggunaan Claude saya dan bila ia akan ditetapkan semula?

Dalam Claude Code, jalankan /usage untuk melihat bar pelan, masa penetapan semula dan pecahan penggunaan; /cost adalah alias, manakala d atau w menukar antara 24 jam terakhir dan 7 hari terakhir. Data tersebut diambil daripada sejarah sesi tempatan, jadi ia tidak merangkumi penggunaan daripada peranti lain dan daripada claude.ai. Pada API, Console memaparkan carta had kadar anda, dan GET /v1/organizations/rate_limits memulangkan had yang telah dikonfigurasi dengan kunci Admin API.

Bolehkah saya terus bekerja selepas mencapai had pelan Claude saya?

Kadangkala. Jalankan /usage-credits untuk membeli penggunaan melebihi had pada pelan Pro dan Max, atau untuk memintanya daripada admin pada pelan Team dan Enterprise; ia memerlukan log masuk claude.ai melalui /login dan tidak tersedia dengan pengesahan kunci API. Jika tidak, tunggu sehingga masa penetapan semula, tukar model jika ia adalah had Opus, atau pindahkan kerja ke kunci API, yang mengira penggunaan mengikut minit dan bukannya mengikut jendela masa.