SSD Nodes Learn
מדריכים Matt Connorמאת Matt Connor · עודכן 2026-07-24

מגבלות שימוש ב-Claude: מה לעשות כשנגמר המכסה

ההבדל בין מגבלות מנוי לבין שגיאת HTTP 429 ב-API. למדו מדוע החלפת מודלים לא תעזור וכיצד לפתור בעיות של rolling usage allowance ב-Claude.

מהם מגבלות השימוש של Claude?

מגבלות השימוש של Claude מורכbras משתי מערכות נפרדות. המשימה הראשונה היא לזהות איזו מערכת עצרה את הפעולה. מנוי Claude (מסוג Pro, Max, Team, או Enterprise) מעניק מכסה משתנה (rolling usage allowance) המשותפת למודלים ול-Claude chat, ולכן המערכת תציג הודעה מסוג You've hit your session limit · resets 3:45pm. ה-Claude API מודד מדד אחר: את המהירות שבה נשלחות בקשות ו-tokens, בחישוב לדקה. המערכת תציג שגיאת HTTP 429 מסוג rate_limit_error עם header מסוג retry-after המציין כמה שניות יש להמתין.

לפתרונות אין מאפCommon משותף. מגבלת מנוי קשורה לכמות השימוש בתוך חלון זמן מסוים, ולכן יש להמתין לאיפוס או לרכוש מכסה נוספת. מגבלת קצב (rate limit) ב-API קשורה למהירות הנוכחית, והיא מתאפסת תוך שניות ברגע שמפחיתים את קצב הבקשות.

מספרי המכסות והדרגות (tiers) של ה-Plan וה-rate-limit משתנים לעיתים קרובות. מספר שגוי עלול להטעות יותר מאפס נתונים, לכן לא מופיעים כאן ערכים קבועים. ניתן לבדוק את הערכים האישיים באמצעות הפקודות המופיעות בהמשך.

באיזה מגבלה נתקלת? קרא את ההודעה המדויקת

Claude Code מציין את שם המערכת בטקסט המודפס. בדוק את ההודעה שלך לפני שתבצע שינויים כלשהם.

  • You've hit your session limit · resets 3:45pm היא מגבלת מנוי. מכסת השימוש המשתנה (rolling allowance) של התוכנית שלך עבור תקופה זו נוצלה במלואה.
  • You've hit your weekly limit · resets Mon 12:00am היא אותה מערכת אך עבור תקופה ארוכה יותר.
  • You've hit your Opus limit · resets 3:45pm היא מגבלת מנוי החלה רק על בקשות Opus. זהו המקרה היחיד שבו החלפת המודל תסייע.
  • API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com. היא מגבלת קצב (rate limit) של ה-API. נתקלת במגבלה המוגדרת עבור ה-API key שלך, או עבור פרויקט ה-Amazon Bedrock או ה-Google Cloud שלך.
  • API Error: Server is temporarily limiting requests (not your usage limit) היא הגבלה זמנית (throttle) שאינה קשורה למכסת התוכנית שלך. Claude Code ינסה שוב באופן אוטומטי עם השהיה (backoff) לפני שהוא יציג לך את השורה הזו.

מגבלות מנוי: סשן, שבוע וחלון ה-Opus

תוכנית מנוי כוללת מכסה שימוש מתמשכת (rolling usage allowance). כאשר המכסה נגמרת, Claude Code חוסם בקשות נוספות עד לזמן האיפוס המופיע בהודעה. שתי תכונות של המכסה הזו גורמות לרוב הבלבול:

  • המכסה משותפת עם Claude chat. עבודה ב-claude.ai צורכת מכסה זו בדיוק כמו עבודה ב-terminal; לכן, שימוש אינטנסיבי בצ'אט יקצר את זמן הפיתוח בערב.
  • המכסה משותפת בין מודלים שונים. למגבלות ה-session והשבועיות אין תקציב נפרד לכל מודל, למעט במקרה של מגבלת ה-Opus.

בתוכניות Claude for Teams ו-Enterprise, המבנה המתועד הוא מכסה לכל משתמש (per-seat). המכסה מתאפסת בחלון זמן מתמשך של חמש שעות ובחלון זמן שבועי. היא משותפת עם Claude chat ו-Cowork, וגודלה נקבע לפי רמת המנוי (Standard או Premium). בתוכניות Pro ו-Max, זמן האיפוס המופיע בהודעה ופס ה-/usage שלך הם הנתונים המהימנים, ולא נתונים מפוסט בבלוג. אם אתם עדיין בוחרים רמה, איזה מנוי Claude אתם צריכים משווה בין המגבלות של כל תוכנית.

מדוע מעבר למודל באמצעות /model אינו מחזיר את הגישה

זוהי הטעות הנפוצה ביותר, והתיעוד ברור בנושא: מגבלות הסשן (session) והמגבלות השבועיות משותפות לכל המודלים, לכן מעבר בין מודלים אינו מחזיר את הגישה. בחירה במודל קטן יותר לאחר ניצול חלון הסשן משנה רק את המודל שיענה. היא אינה משנה את כמות המכסה שנותרה, מכיוון שהמכסה אינה מוקצית לכל מודל בנפרד; לכן למעבר אין מה לשחרר.

החריג הוא מגבלת Opus, שהיא תקרת מגבלה ספציפית למודל זה בלבד. אם ההודעה היא You've hit your Opus limit, אז /model הוא הפתרון הנכון. עברו למודל אחר והמשיכו לעבוד, מכיוון שרק בקשות Opus נחסמו.

התייחסות למגבלה כאל באג היא הטעות השנייה. התקנה מחדש או התחברות מחדש (re-authentication) אינן משנות דבר. המכסה תחזור כאשר חלון הזמן יתאפס, או כאשר תרכשו קרדיטים לשימוש.

מה לעשות במקרה של הגעה למגבלת מנוי

  1. בדקו את זמן איפוס המגבלה. חלון זמן של Session הוא קצר. חלון זמן שבועי אינו משהו שמחכים לו ליד המחשב.
  2. אם הגעתם למגבלת Opus, הריצו את /model ובחרו מודל אחר.
  3. הריצו את /usage כדי לראות את מגבלות התוכנית שלכם, את המכסות שלכם ואת מועד האיפוס. /cost הוא קיצור דרך לאותו מסך.
  4. הריצו את /usage-credits כדי להמשיך לעבוד מעבר למגבלה. בתוכניות Pro ו-Max הפקודה פותחת את הגדרות התשלום. בתוכניות Team ו-Enterprise היא פותחת את הגדרות השימוש של הארגון, או שולחת בקשה למנהלי המערכת אם אין לכם הרשאות תשלום.
  5. אם אתם נתקלים באותה מגבלה בכל שבוע, התוכנית אינה מתאימה לאופי העבודה שלכם.

/usage-credits דורש מנוי claude.ai המחובר דרך /login. השירות אינו זמין עם אימות באמצעות API key, מכיוון של-API key אין מכסת תוכנית להרחבה.

לקרדיטים של שימוש (Usage credits) יש השלכה אחת שחשוב להכיר. חיי הפרומפט בזיכרון המטמון (Prompt cache lifetime) הם שעה אחת במנוי, ויורדים לחמש דקות ברגע שמתחילים להשתמש בקרדיטים. לכן, יותר הודעות יתחילו ללא זיכרון מוקדם ו-Claude Code token usage יעלה עבור אותה כמות עבודה.

הודעות שנראות כמו מגבלות שימוש אך אינן כאלה

ארבע שגיאות של Claude Code מדווחות כחריגה ממגבלת שימוש, אך אף אחת מהן אינה כזו.

  • אזהרת context או auto-compact אינה מגבלת שימוש. /context מדפיס שורה כגון Context exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue. ברגע שהשיחה גדלה מעבר לחלון ה-context של המודל. ההיסטוריה הישנה מסוכמת כדי לפנות מקום, והמכסה של התוכנית שלך אינה נפגעת.
  • Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again. פירושו ש-/compact נכשל, מכיוון שאין מספיק context פנוי כדי להכיל את הסיכום שהוא אמור לייצר.
  • Credit balance is too low פירושו שארגון ה-Console שלך סיים את יתרת הקרדיטים המראש. ניתן להוסיף קרדיטים בכתובת platform.claude.com/settings/billing, המציעה גם אפשרות לטעינה אוטומטית.
  • API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context הוא בדיקת הרשאה (entitlement check), ולא מכסה שנוצלה במלואה. בחר בגרסת מודל ללא הסיומת [1m], או הגדר את CLAUDE_CODE_DISABLE_1M_CONTEXT=1.

שגיאה נוספת מגיעה מה-API. שגיאת 413 request_too_large היא מגבלת גודל עבור בקשה בודדת, ולא מגבלת קצב (rate limit).

API rate limits: מה ה-429 באמת סופר

ה-Messages API מודד שלושה מדדים, בנפרד עבור כל מחלקת מודל.

  • בקשות לדקה (RPM)
  • input tokens לדקה (ITPM)
  • output tokens לדקה (OTPM)

לארגון שלך יש גם מגבלת הוצאות, שהיא דבר שונה: עלות חודשית מקסימלית לשימוש ב-API. ברגע שתגיע לתקרת ההוצאות של ה-tier שלך, השימוש ב-API ייעצר עד החודש הבא, אלא אם תבקש מגבלה גבוהה יותר. שום לולאת ניסוי חוזר (retry loop) לא תפתור זאת.

ארבעה מנגנונים קובעים מתי מופיע שגיאת 429.

  • הגבלות הן לפי מחלקת מודל. הן חלות בנפרד על כל מודל, כך שניתן להשתמש במודלים שונים בו-זמנית עד למגבלות הספציפיות שלהם. משפחות מסוימות חולקות "דלי" משותף: מגבלת ה-rate limit של Opus היא סכום מצטבר עבור Claude Opus 4.8, Opus 4.7, Opus 4.6 ו-Opus 4.5, בעוד של Claude Sonnet 5 יש מגבלה משלו.
  • הקיבולת מתחדשת באופן רציף. ה-API משתמש באלגוריתם token bucket, לכן הקיבולת מתחדשת ללא הרף במקום להתאפס ברגע קבוע. מגבלה של 60 בקשות לדקה עשויה להיות מופעלת כבקשה אחת בשנייה, ולכן 60 בקשות שנשלחות בבת אחת עדיין ייכשלו.
  • ברוב המודלים, רק input לא שמור ב-cache נספר לטובת ITPM. input_tokens ו-cache_creation_input_tokens נספרים. cache_read_input_tokens אינו נספר ברוב מודלי Claude, כאשר Claude Haiku 3.5 הוא החריג המתועד. לכן, שימוש ב-caching מעניק מרווח נשימה עבור ה-rate limit בנוסף להנחה. בצד ה-output, ערך max_tokens גבוה אינו נספר כנגד OTPM, מכיוון ש-OTPM סופר רק את ה-tokens שנוצרו בפועל.
  • הגבלות פועלות ברמת הארגון. ניתן להחיל מגבלה נמוכה יותר על workspace מסוים, אך הגבלות ברמת הארגון חלות תמיד גם אם סכום מגבלות ה-workspaces גבוה יותר. מגבלה שלא בוטלה ב-workspace מסוים עוברת בירושה מהארגון, ואינה נשארת ללא הגבלה.

ה-tiers בשמות Start, Build, Scale ו-Custom קובעים את המספרים בפועל, והם מוקצים אוטומטית על בסיס היסטוריית השימוש ומצב החשבון שלך. ארגונים חדשים עשויים להתחיל מתחת למגבלות הסטנדרטיות המפורסמות, ולכן שגיאת 429 ראשונה עשויה להופיע מוקדם יותר ממה שמתوقع בטבלה. עלייה חדה בשימוש מפעילה מגבלות האצה (acceleration limits), שמחזירות 429 גם כשאתה עדיין בתוך ה-tier שלך, לכן יש להעלות את נפח התעבורה בהדרגה. כל נתון שפורסם הוא תקרה: המגבלות המתועדות הן השימוש המקסימלי המותר, ולא מינימום מובטח. כדי לבקש יותר, השתמש בכפתור "Request rate limit increase" בדף Limits ב-Claude Console.

קריאת 429: retry-after, ה-headers, ו-retries של ה-SDK

כל שגיאת API מחזירה את אותו מעטפת: אובייקט error מקונן המכיל את ה-type ואת ה-message, בנוסף ל-request_id ברמה העליונה.

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "<names the rate limit you exceeded>"
  },
  "request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}

ה-headers מכילים את שאר המידע.

  • retry-after הוא מספר השניות שעליך להמתין לפני שתוכל לבצע retry לבקשה. ניסיונות מוקדמים יותר ייכשלו.
  • anthropic-ratelimit-requests-limit, anthropic-ratelimit-requests-remaining ו-anthropic-ratelimit-requests-reset מתארים את ה-request budget שלך.
  • anthropic-ratelimit-input-tokens-* ו-anthropic-ratelimit-output-tokens-* עושים את אותו הדבר עבור ITPM ו-OTPM, עם אותם סיומות: limit, remaining ו-reset.
  • anthropic-ratelimit-tokens-* מציג את הערכים עבור המגבלה המחמירה ביותר שפעילה כעת.

headers של reset הם timestamps בפורמט RFC 3339. headers של remaining token מעוגלים לאלף הקרוב, לכן יש לקרוא אותם כמדד (gauge). ל-fast mode יש pool משלו ו-anthropic-fast-* headers משלו. יש לקרוא את כולם מכל קריאה ناجחת:

curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
  | grep -i 'ratelimit\|retry-after\|request-id'

כל תגובה מכילה גם header ייחודי מסוג request-id, כגון req_018EeWyXxfu5pfWkrYcMdjWG. הוא מופיע כ-request_id בגוף השגיאה וכ-_request_id בתגובות של ה-SDK ב-Python וב-TypeScript. יש לצטט אותו בעת הפנייה לתמיכה.

בדוק אם בכלל יש צורך ב-backoff loop לפני שתכתוב אחד. ה-SDKs הרשמיים מבצעים retry אוטומטי לכשלים זמניים, כולל שגיאות חיבור, מגבלות קצב (rate limits) ושגיאות שרת מסוג 5xx, עם exponential backoff, פעמיים כברירת מחדל, תוך כיבוד ה-header של retry-after כאשר הוא קיים. כל client מקבל אפשרות maximum-retries כדי לשנות או לבטל התנהגות זו.

import anthropic

client = anthropic.Anthropic(max_retries=5)  # the SDK default is 2

try:
    msg = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": "hello"}],
    )
except anthropic.RateLimitError as err:
    headers = err.response.headers
    print("still limited after retries; wait", headers.get("retry-after"), "seconds")
    print("request id:", headers.get("request-id"))

529 overloaded_error אינו באשמתך

שגיאה 429 מעידה על קצב בקשות גבוה מדי. שגיאה 529 overloaded_error מעידה על עומס זמני ב-API, וזה יכול לקרות כאשר ה-API חווה עומס גבוה מכלל המשתמשים. הקוד או המפתח שלך אינם הגורם לכך. יש לנסות שוב בשיטת exponential backoff, פעולה ש-SDKs כבר מבצעים עבור תגובות 5xx, ולבדוק את status.claude.com אם הבעיה לא נפתרת. שגיאה 500 api_error היא שגיאה פנימית שיש לנסות שוב באותו אופן, ו אף אחת מהן אינה מגבלת קצב (rate limit).

קרא את המגבלות שלך במקום להשתמש בטבלה

במסלול מנוי, /usage הוא המסך הרלוונטי. הוא מציג את מדדי השימוש בתוכנית ואת פירוט הצריכה, ו-d או w מאפשרים לעבור בין 24 השעות האחרונות ל-7 הימים האחרונים. שתי הערות: בלוק ה-Session מציג את השימוש ב-API token והוא מיועד למשתמשי API, לכן מנויים יכולים להתעלם מהסכום הכספי המוצג בו. הנתונים מגיעים מהיסטוריית ה-session המקומית באותו מכשיר, ולכן צריכה ממכשיר אחר או מ-claude.ai אינה מופיעה.

בצד ה-API, דף ה-Usage ב-Claude Console מציג שני גרפים: "Rate Limit - Input Tokens" ו-"Rate Limit - Output Tokens". גרף ה-input מציג את המקסימום השעתי של input tokens ללא cache לכל דקה מול מגבלת ה-ITPM הנוכחית שלך, עם שיעור ה-cache بجانبו. כך ניתן לעקוב אחר התקרבות למגבלה לפני שהיא נדרשת בסביבת ה-production.

כדי לקרוא את המגבלות המוגדרות שלך באופן תכנותי:

curl -s https://api.anthropic.com/v1/organizations/rate_limits \
  -H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
  -H "anthropic-version: 2023-06-01"

נדרש מפתח Admin API, ו-GET /v1/organizations/workspaces/{workspace_id}/rate_limits מבצע פעולה דומה עבור כל workspace. שניהם במצב קריאה בלבד (read-only): כדי לשנות מגבלה, השתמש בלשונית Limits ב-Console.

שימוש ב-less, כדי לעמוד בפחות מגבלות

שתי המערכות מודדות את אותו הדבר, לכן מנגנונים אלו תקפים עבור שתיהן.

  • הוצא את פחות tokens בכל turn. עבודה רציפה שומרת על ה-cache חם, ו-/clear בין משימות לא קשורות אינו עולה דבר. שימוש ב-Claude Code tokens מסביר את המנגנונים הללו בהרחבה.
  • הורד את רמת המאמץ. הרמות הן low, medium, high, xhigh ו-max. תפריט ה-/effort מציע גם את ultracode, שמגדיל את ההוצאה במקום להפחית אותה. שימוש ב-Deep reasoning עבור שינוי שמות מכני אינו משתלם.
  • צמצם concurrency לאחר שגיאת 429. הורד את ה-CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY והימנע משימוש במספר רב של subagents במקביל. הרץ גם את /status: ANTHROPIC_API_KEY שגוי מפנה בקשות דרך מפתח בדרגה נמוכה במקום דרך המנוי שלך.
  • העבר עבודה לא-אינטראקטיבית ל-Message Batches API. ה-API מריץ נפחים גדולים באופן אסינכרוני בהנחה של 50% על input ו-output tokens, תחת מגבלות rate limits משלו, כך שפעולה לילית לא תתחרה על המשאבים של הסשן שלך.

עבודה בעצימות משתנה (Bursty) המופעלת על ידי תוכנית ולא על ידי אדם, צריכה להשתמש ב-API key מההתחלה. אפליקציית Claude API ראשונה שלך ב-VPS מסביר על ניהול מפתחות ו-retries, וריצה ארוכה של agent תישאר פעילה גם אם החיבור יתנתק אם תשתמש ב-Claude Code running on a VPS inside tmux.

FAQ

מדוע החלפת מודלים לא פותרת את מגבלת השימוש ב-Claude שלי?

מכיוון שמגבלות הסשן והמגבלות השבועיות משותפות לכל המודלים. המכסה שייכת לתוכנית (plan) ולא למודל ספציפי, לכן /model משנה רק את המודל שיענה ולא את כמות המכסה הנותרת. החריג היחיד הוא You've hit your Opus limit, החל על בקשות Opus בלבד. במקרה זה, החלפת המודל היא הפתרון המתועד.

מה המשמעות של השגיאה 429 rate_limit_error, וכמה זמן עלי לחכות?

המשמעות היא שחשבונך הגיע למגבלת קצב (rate limit) עבור סוג המודל הזה: מספר בקשות לדקה, מספר טוקנים (tokens) בכניסה לדקה, או מספר טוקנים במוצא לדקה. התגובה כוללת כותרת retry-after המציינת את מספר השניות להמתנה, וניסיונות חוזרים מוקדמים ייכשלו. ה-SDKs הרשמיים מבצעים כבר ניסיונות חוזרים (retries) עבור מגבלות קצב ושגיאות 5xx באמצעות exponential backoff, פעמיים כברירת מחדל, תוך כיבוד כותרת זו. שגיאת 429 המופיעה בזמן שאתם עדיין בתוך המגבלות של המסלול שלכם מעידה על מגבלת האצה עקב עלייה פתאומית בעומס.

כיצד אוכל לראות את מגבלות השימוש ב-Claude שלי ומתי הן מתאפסות?

ב-Claude Code, הרצו את /usage כדי לראות את מדדי התוכנית, זמני האיפוס ופירוט השימוש; /cost הוא קיצור (alias), ו-d או w מעברים בין 24 השעות האחרונות ל-7 הימים האחרונים. הנתונים הללו מגיעים מהיסטוריית הסשן המקומית, ולכן הם אינם כוללים שימוש ממכשירים אחרים ומאת claude.ai. ב-API, ה-Console מציג גרפים של מגבלות הקצב, ו-GET /v1/organizations/rate_limits מחזיר את המגבלות המוגדרות שלכם באמצעות מפתח Admin API.

האם אוכל להמשיך לעבוד לאחר הגעה למגבלת התוכנית של Claude?

לפעמים. הרצו את /usage-credits כדי לרכוש שימוש מעבר לתקרה במסלולי Pro ו-Max, או כדי לבקש זאת ממנהל (admin) במסלולי Team ו-Enterprise; הדבר דורש התחברות ל-claude.ai דרך /login ואינו זמין עם אימות באמצעות מפתח API. אחרת, יש להמתין לזמן האיפוס, להחליף מודל אם המגבלה הייתה של Opus, או להעביר את העבודה לשימוש עם מפתח API, המודד שימוש לפי דקה ולא לפי חלון זמן.