SSD Nodes Learn Hosting plans →
מדריכים Matt Connorמאת Matt Connor · עודכן 2026-08-31

הגעת למגבלת השימוש ב-Claude? כך תפתור את זה

נתקלת בשגיאת HTTP 429 או בהודעת חסימה ב-Claude? הסבר על ההבדל בין מכסות מנוי לבין מגבלות קצב ב-API ומה עליך לעשות כדי להחזיר את הגישה לשירות באופן מיידי.

מהן מגבלות השימוש של Claude?

מגבלות השימוש של Claude מבוססות על שתי מערכות נפרדות, והצעד הראשון הוא להבין איזו מהן חסמה אותך. מנוי Claude (במסלולי Pro, Max, Team או Enterprise) מעניק מכסת שימוש מתגלגלת המשותפת לכל המודלים ולצ'אט של Claude, ולכן הוא עוצר אותך עם הודעה כמו You've hit your session limit · resets 3:45pm. ה-API של Claude מודד מדד אחר: באיזו מהירות נשלחים בקשות ו-tokens, הנספרים לפי דקה. הוא עוצר אותך עם שגיאת HTTP 429 מסוג rate_limit_error ועם header מסוג retry-after המציין כמה שניות עליך להמתין.

הפתרונות לשני המקרים אינם דומים. מגבלת מנוי נוגעת לכמות השימוש שביצעת בתוך חלון זמן מסוים, ולכן עליך להמתין לאיפוס או לרכוש מכסה נוספת. מגבלת קצב (rate limit) ב-API נוגעת למהירות העבודה הנוכחית שלך, והיא מתאפסת תוך שניות ברגע שתאט את קצב הבקשות.

המכסות של התוכניות ומספרי הדרגות של מגבלות הקצב משתנים לעיתים קרובות, ומספר שגוי גרוע מחוסר מידע, לכן לא נפרט אותם כאן. ניתן לקרוא את הנתונים האישיים שלך באמצעות הפקודות בהמשך.

באיזו מגבלה נתקלת? קרא את ההודעה המדויקת

Claude Code מציין את המערכת בטקסט שהוא מציג. ודא התאמה למערכת שלך לפני שתבצע שינויים כלשהם.

  • You've hit your session limit · resets 3:45pm היא מגבלת מנוי. המכסה המתגלשת של התוכנית שלך לחלון זמן זה נוצלה.
  • You've hit your weekly limit · resets Mon 12:00am היא אותה מערכת בחלון זמן ארוך יותר.
  • You've hit your Opus limit · resets 3:45pm היא מגבלת מנוי החלה רק על בקשות Opus. זהו המקרה היחיד שבו החלפת מודל מסייעת.
  • API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com. היא מגבלת קצב (rate limit) של ה-API. הגעת למגבלה שהוגדרה עבור מפתח ה-API שלך, או עבור פרויקט Amazon Bedrock או Google Cloud שלך. מה מהם רלוונטי תלוי ב-אופן האימות של הלקוח, כיוון שלקוח Bedrock או Vertex נמדד מול המכסה של פרויקט הענן שלך ולא מול ארגון Anthropic.
  • API Error: Server is temporarily limiting requests (not your usage limit) היא השהיה (throttle) קצרת מועד שאינה קשורה למכסת התוכנית שלך. Claude Code מנסה לבצע את הפעולה שוב באופן אוטומטי עם מנגנון backoff לפני שהוא מציג לך שורה זו.

מגבלות מנוי: סשן, שבועי וחלון ה-Opus

תוכנית מנוי כוללת מכסת שימוש מתגלגלת. כאשר המכסה מנוצלת, Claude Code חוסם בקשות נוספות עד לזמן האיפוס המופיע בהודעה. שני מאפיינים של מכסה זו גורמים לרוב אי-ההבנות.

  • המכסה משותפת עם Claude chat. עבודה ב-claude.ai צורכת מאותה מכסה כמו עבודה בטרמינל, לכן פעילות אינטנסיבית בצ'אט במהלך היום תקצר את זמן העבודה שלכם בערב. כל ממשק שבו אתם מחוברים עם אותו חשבון מושך מאותו מאגר, כך שבלינוקס אפליקציית שולחן העבודה בגרסת בטא ו-Claude Code CLI משתמשים במכסה אחת משותפת, ולא במכסה נפרדת לכל אחד.
  • המכסה משותפת בין מודלים. למגבלות הסשן והמגבלות השבועיות אין תקציב נפרד לכל מודל, למעט החריג היחיד של מגבלת ה-Opus.

ב-Claude for Teams וב-Claude for Enterprise, המבנה המתועד הוא מכסה לכל מושב (seat) המתאפסת בחלון זמן מתגלגל של חמש שעות ובחלון שבועי. מכסה זו משותפת עם Claude chat ועם Cowork, וגודלה נקבע לפי דרגת המושב (Standard או Premium). בתוכניות Pro ו-Max, זמן האיפוס המופיע בהודעה וסרגלי ה-/usage שלכם הם הנתונים האמינים, ולא מספר שהועתק מפוסט בבלוג. אם אתם עדיין בוחרים דרגת מנוי, השוואת תוכניות Claude מפרטת מה כל תוכנית מגבילה.

מדוע החלפת מודל באמצעות /model אינה משחזרת את הגישה

זוהי טעות נפוצה, והתיעוד מבהיר זאת ללא כחל וסרק: מגבלות הסשן והמגבלות השבועיות משותפות לכל המודלים, לכן החלפת מודל אינה משחזרת את הגישה. בחירה במודל קטן יותר לאחר שחלון הסשן שלכם נוצל משנה רק את המודל שישיב לבקשות. היא אינה משנה את מכסת השימוש שנותרה, כיוון שהמכסה מעולם לא הוגדרה פר מודל, ולכן להחלפה אין מה לשחרר.

החריג הוא המגבלה של Opus, המהווה תקרה ספציפית למודל זה בלבד. אם ההודעה שמופיעה היא You've hit your Opus limit, אזי /model הוא הפתרון הנכון. עברו למודל אחר והמשיכו בעבודה, שכן רק בקשות ל-Opus נחסמו.

התייחסות למגבלה כאל תקלה (bug) היא הטעות השנייה הנפוצה. התקנה מחדש או אימות מחדש של החשבון לא ישנו דבר. המכסה מתאפסת כאשר חלון הזמן מתחדש, או כאשר רוכשים קרדיטים לשימוש.

מה לעשות כשמגיעים למכסת המנוי

  1. בדקו את זמן האיפוס. חלון זמן של סשן הוא קצר. חלון שבועי אינו משהו שממתינים לו ליד שולחן העבודה.
  2. אם מדובר במכסת Opus, הריצו את /model ובחרו מודל אחר.
  3. הריצו את /usage כדי לראות את מגבלות התוכנית שלכם, את מדדי השימוש ואת מועד האיפוס. /cost הוא כינוי (alias) לאותו מסך.
  4. הריצו את /usage-credits כדי להמשיך לעבוד מעבר לתקרה. בתוכניות Pro ו-Max הפקודה פותחת את הגדרות החיוב שלכם. בתוכניות Team ו-Enterprise היא פותחת את הגדרות השימוש של הארגון, או שולחת בקשה למנהלי המערכת אם אין לכם הרשאות גישה לחיוב.
  5. אם אתם נתקלים באותו מחסום מדי שבוע, התוכנית אינה מתאימה לאופן העבודה שלכם, וכדאי לשקול פעם אחת את הדרכים לעקיפת מגבלת שימוש במקום לעשות זאת בכל איפוס מחדש.

/usage-credits דורש מנוי ל-claude.ai המחובר דרך /login. השירות אינו זמין באימות באמצעות API key, כיוון של-API key אין הקצאת תוכנית שניתן להרחיב.

לקרדיטים של שימוש יש תופעת לוואי אחת שכדאי להכיר מראש. זמן החיים של ה-prompt cache הוא שעה במנוי רגיל, והוא יורד לחמש דקות ברגע שמתחילים להשתמש בקרדיטים; לכן, יותר סבבי שיחה מתחילים במצב "קר" ו-צריכת הטוקנים של Claude Code עולה עבור אותה עבודה.

הודעות שנראות כמו מגבלות שימוש אך אינן כאלה

ארבע שגיאות ב-Claude Code מדווחות כמגבלות שימוש, אך אף אחת מהן אינה כזו.

  • אזהרת הקשר (context) או דחיסה אוטומטית (auto-compact) אינה מגבלת שימוש. /context מדפיס שורה כגון Context exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue. ברגע שהשיחה חורגת מחלון ההקשר של המודל. היסטוריה ישנה מסוכמת כדי לפנות מקום, ומכסת התוכנית שלך נותרת ללא שינוי.
  • Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again. מציין ש-/compact עצמו נכשל, כיוון שלא נותר מספיק הקשר פנוי כדי להכיל את הסיכום שהוא אמור להפיק.
  • Credit balance is too low מציין שארגון ה-Console שלך סיים את יתרת הזיכויים ששולמו מראש. ניתן להוסיף זיכויים בכתובת platform.claude.com/settings/billing, המציעה גם טעינה אוטומטית.
  • API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context הוא בדיקת זכאות, לא מכסה שמוצתה. בחר את גרסת המודל ללא הסיומת [1m], או הגדר את CLAUDE_CODE_DISABLE_1M_CONTEXT=1.

שגיאה נוספת מגיעה מה-API. שגיאת 413 request_too_large היא מגבלת גודל על בקשה בודדת, ולא מגבלת קצב (rate limit).

מגבלות קצב של ה-API: מה נספר בפועל בשגיאת 429

ה-Messages API מודד שלושה מדדים, בנפרד עבור כל מחלקת מודל.

  • בקשות לדקה (RPM)
  • טוקני קלט לדקה (ITPM)
  • טוקני פלט לדקה (OTPM)

לארגון שלכם יש גם מגבלת הוצאות, שהיא עניין שונה: עלות חודשית מקסימלית לשימוש ב-API. ברגע שתגיעו לתקרת ההוצאות של השכבה שלכם, השימוש ב-API ייעצר עד לחודש הבא, אלא אם תבקשו הגדלה של המגבלה. שום לולאת ניסיון חוזר (retry loop) לא תפתור זאת.

ארבעה מנגנונים קובעים מתי תתקבל שגיאת 429.

  • המגבלות הן לפי מחלקת מודל. הן חלות בנפרד על כל מודל, כך שניתן להשתמש במודלים שונים עד למגבלות שלהם בו-זמנית. משפחות מסוימות חולקות "דלי" משותף: מגבלת הקצב של Opus היא מצטברת עבור Claude Opus 4.8, Opus 4.7, Opus 4.6 ו-Opus 4.5, בעוד של-Claude Sonnet 5 יש מגבלה משלו.
  • הקיבולת מתמלאת ברציפות. ה-API משתמש באלגוריתם "דלי טוקנים" (token bucket), כך שהקיבולת מתחדשת ברציפות במקום להתאפס ברגע קבוע. מגבלה של 60 בקשות לדקה עשויה להיאכף כבקשה אחת לשנייה, כך ש-60 בקשות שיישלחו בבת אחת עדיין ייכשלו.
  • רק קלט שלא עבר מטמון נספר ב-ITPM ברוב המודלים. input_tokens ו-cache_creation_input_tokens נספרים. cache_read_input_tokens אינו נספר ברוב מודלי Claude, כאשר Claude Haiku 3.5 הוא החריג המתועד. לכן, שימוש במטמון (caching) מעניק מרווח נשימה במגבלות הקצב בנוסף להנחה. בצד הפלט, max_tokens גבוה אינו נספר כנגד OTPM, כיוון ש-OTPM סופר רק את הטוקנים שיוצרו בפועל.
  • המגבלות חלות ברמת הארגון. ניתן להגדיר למרחב עבודה (workspace) מגבלה נמוכה יותר, ומגבלות כלל-ארגוניות תמיד תקפות גם אם סכום המגבלות של מרחבי העבודה גבוה מהן. מגבלה שלא דרסתם ברמת מרחב העבודה תורש מהארגון, ולא תישאר ללא הגבלה.

שכבות בשמות Start, Build, Scale ו-Custom קובעות את המספרים בפועל, ומוקצות אוטומטית על סמך היסטוריית השימוש ומצב החשבון שלכם. ארגונים חדשים עשויים להתחיל מתחת למגבלות המפורסמות הסטנדרטיות, לכן שגיאת 429 ראשונה עשויה להופיע מוקדם מהצפוי בטבלאות. עלייה חדה בשימוש מפעילה מגבלות האצה, שמחזירות 429 גם כשאתם עדיין בתוך השכבה שלכם, לכן הגדילו את התעבורה בהדרגה. כל נתון מפורסם הוא תקרה: המגבלות המתועדות הן השימוש המקסימלי המותר, לא מינימום מובטח. כדי לבקש יותר, השתמשו בבקרת "Request rate limit increase" בדף Limits ב-Claude Console.

קריאת שגיאת 429: retry-after, ה-headers וניסיונות חוזרים ב-SDK

כל שגיאת API מחזירה את אותה מעטפת: אובייקט error מקונן המכיל את הסוג ואת ההודעה, בתוספת request_id ברמה העליונה.

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "<names the rate limit you exceeded>"
  },
  "request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}

ה-headers נושאים את שאר המידע.

  • retry-after הוא מספר השניות שיש להמתין לפני ניסיון חוזר של הבקשה. ניסיונות מוקדמים יותר ייכשלו.
  • anthropic-ratelimit-requests-limit, anthropic-ratelimit-requests-remaining ו-anthropic-ratelimit-requests-reset מתארים את מכסת הבקשות שלכם.
  • anthropic-ratelimit-input-tokens-* ו-anthropic-ratelimit-output-tokens-* מבצעים את אותה פעולה עבור ITPM ו-OTPM, עם אותן סיומות של limit, remaining ו-reset.
  • anthropic-ratelimit-tokens-* מציג את הערכים עבור המגבלה המחמירה ביותר שבתוקף כרגע.

ה-headers של ה-reset הם חותמות זמן בתקן RFC 3339. ה-headers של ה-remaining מעוגלים לאלף הקרוב, לכן יש להתייחס אליהם כמדד הערכה. למצב Fast יש מאגר משלו ו-headers מסוג anthropic-fast-* משלו. קראו את כולם מכל קריאה מוצלחת:

curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
  | grep -i 'ratelimit\|retry-after\|request-id'

כל תגובה נושאת גם header ייחודי מסוג request-id, כגון req_018EeWyXxfu5pfWkrYcMdjWG. הוא מופיע כ-request_id בגופי שגיאה וכ-_request_id בתגובות של ה-SDK עבור Python ו-TypeScript. ציינו אותו בעת פנייה לתמיכה.

בדקו אם אתם זקוקים ללולאת backoff לפני שאתם כותבים אחת כזו. ה-SDK הרשמיים מבצעים ניסיונות חוזרים אוטומטיים לכשלים זמניים, כולל שגיאות חיבור, מגבלות קצב (rate limits) ושגיאות שרת מסוג 5xx, עם exponential backoff, פעמיים כברירת מחדל, תוך כיבוד ה-header מסוג retry-after כאשר הוא קיים. כל client מקבל אפשרות maximum-retries כדי לשנות או לבטל התנהגות זו.

import anthropic

client = anthropic.Anthropic(max_retries=5)  # the SDK default is 2

try:
    msg = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": "hello"}],
    )
except anthropic.RateLimitError as err:
    headers = err.response.headers
    print("still limited after retries; wait", headers.get("retry-after"), "seconds")
    print("request id:", headers.get("request-id"))

529 שגיאת עומס אינה באשמתך

שגיאת 429 מציינת שביצעת פעולות מהר מדי. שגיאת 529 overloaded_error מציינת שה-API עמוס באופן זמני, והיא עלולה להתרחש כאשר ה-API חווה עומס תעבורה גבוה מצד כלל המשתמשים. שום דבר במפתח ה-API שלך או בקוד שלך לא גרם לכך. בצע ניסיון חוזר עם exponential backoff, פעולה שה-SDKs כבר מבצעים עבור תגובות מסוג 5xx, ובדוק את status.claude.com אם המצב אינו מסתדר. שגיאת 500 api_error היא שגיאה פנימית שעבורה יש לבצע ניסיון חוזר באותו אופן, ואף אחת מהן אינה מהווה מגבלת קצב (rate limit).

קרא את המגבלות שלך ישירות במקום בטבלה

במנוי פעיל, /usage הוא המסך הרלוונטי. הוא מציג את פסי הניצול של התוכנית שלך ופירוט של הגורמים שצרכו אותם, וניתן להשתמש ב-d או ב-w כדי לעבור בין נתוני 24 השעות האחרונות לבין 7 הימים האחרונים. שים לב לשתי הסתייגויות. בלוק ה-Session מציג את השימוש ב-API token ומיועד למשתמשי API, לכן מנויים יכולים להתעלם מהערך הכספי המופיע בו. המספרים נגזרים מהיסטוריית ה-session המקומית באותו מכשיר, כך ששימוש ממכשיר אחר או מ-claude.ai אינו נכלם בחישוב.

בצד ה-API, דף ה-Usage ב-Claude Console מציג שני תרשימים: "Rate Limit - Input Tokens" ו-"Rate Limit - Output Tokens". תרשים ה-input משרטט את המקסימום השעתי של input tokens ללא cache לדקה מול מגבלת ה-ITPM הנוכחית שלך, לצד שיעור ה-cache שלך, כך שתוכל לנטר התקרבות למגבלה במקום להיתקל בה בזמן אמת ב-production.

כדי לקרוא את המגבלות המוגדרות שלך באופן תכנותי:

curl -s https://api.anthropic.com/v1/organizations/rate_limits \
  -H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
  -H "anthropic-version: 2023-06-01"

פעולה זו דורשת Admin API key, ו-GET /v1/organizations/workspaces/{workspace_id}/rate_limits מבצע פעולה דומה עבור כל workspace. שתי האפשרויות הן לקריאה בלבד: כדי לשנות מגבלה, השתמש בלשונית Limits ב-Console.

שימוש ב-less כדי לעמוד במגבלות

שתי המערכות מודדות את אותו הדבר בבסיסן, לכן מנופים אלו עובדים על שתיהן.

  • הוציאו פחות tokens בכל תור. רצפים מתמשכים שומרים על ה-cache חם, ו-/clear בין משימות לא קשורות אינו עולה דבר. שימוש ב-tokens ב-Claude Code מכסה את המנופים הללו במלואם.
  • הפחיתו את המאמץ. הרמות הן low, medium, high, xhigh ו-max. תפריט ה-/effort מציע גם את ultracode, שמעלה את ההוצאות במקום להפחיתן. הסקה מעמיקה על שינוי שם מכני אינה מועילה.
  • צמצמו את ה-concurrency לאחר שגיאת 429. הנמיכו את CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY והימנעו מהרצת סוכני משנה רבים במקביל. הריצו גם את /status: הגדרה שגויה של ANTHROPIC_API_KEY מנתבת בקשות דרך מפתח בדרג נמוך במקום דרך המנוי שלכם.
  • העבירו עבודה לא אינטראקטיבית ל-Message Batches API. הוא מריץ נפחים גדולים באופן אסינכרוני בהנחה של 50% על tokens של קלט ופלט, תחת מגבלות קצב משלו, כך שמשימה לילית לא תתחרה עם הסשן שלכם.

עבודה שדוחפת נתונים לתוך ה-context מרגישה זאת בצורה הקשה ביותר: אם אתם מנתחים מניות ואופציות מול נתוני שוק בזמן אמת, שליפת החלק הצר שכל שאלה דורשת עולה שבריר מהעלות של הדבקת טבלאות שלמות של ציטוטים ושרשראות. עבודה מתפרצת המונעת על ידי תוכנית ולא על ידי אדם צריכה להתבצע מול מפתח API מלכתחילה. מעבר לשם משנה את אופן התשלום ואת אופן המדידה, שכן ל-Claude API אין מסלול חינמי מעבר לזיכוי הקטן שניתן בעת ההרשמה. אפליקציית Claude API הראשונה שלכם על גבי VPS מכסה טיפול במפתחות וניסיונות חוזרים (retries), והרצה ארוכה של סוכן שורדת ניתוק חיבור כאשר אתם שומרים על Claude Code רץ על VPS בתוך tmux.

FAQ

מדוע החלפת מודלים לא פותרת את מגבלת השימוש שלי ב-Claude?

מכיוון שמגבלות הסשן והמגבלות השבועיות משותפות לכל המודלים. המכסה שייכת לתוכנית המנוי ולא למודל ספציפי, לכן /model משנה רק איזה מודל ישיב ולא את יתרת המכסה שנותרה. החריג היחיד הוא You've hit your Opus limit, שחל רק על בקשות Opus. במקרה זה, החלפת המודל היא הפתרון המתועד.

מה המשמעות של שגיאת 429 rate_limit_error, וכמה זמן עלי להמתין?

השגיאה מציינת שהחשבון שלך הגיע למגבלת קצב עבור סיווג המודל הזה: בקשות לדקה, טוקנים של קלט לדקה, או טוקנים של פלט לדקה. התגובה כוללת כותרת retry-after המציינת את מספר השניות להמתנה, וניסיונות חוזרים מוקדמים יותר ייכשלו. ה-SDK הרשמיים מבצעים כבר ניסיונות חוזרים לשגיאות rate limit ושגיאות 5xx באמצעות exponential backoff, פעמיים כברירת מחדל, תוך כיבוד הכותרת האמורה. שגיאת 429 שמתקבלת בעודך נמצא בתוך מגבלות השכבה שלך מעידה על מגבלת האצה עקב עלייה פתאומית בנפח הפעילות.

כיצד אוכל לראות את מגבלות השימוש שלי ב-Claude ומתי הן מתאפסות?

ב-Claude Code, הרץ את /usage כדי לראות את פסי המכסה של התוכנית שלך, זמני האיפוס ופירוט השימוש; /cost הוא כינוי (alias) לאותה פקודה, ו-d או w מאפשרים מעבר בין תצוגת 24 השעות האחרונות ל-7 הימים האחרונים. נתונים אלו מגיעים מהיסטוריית הסשן המקומית, לכן הם אינם כוללים שימוש ממכשירים אחרים או מ-claude.ai. ב-API, ה-Console מציג את מגבלות הקצב שלך, ו-GET /v1/organizations/rate_limits מחזיר את המגבלות שהוגדרו עבורך באמצעות מפתח Admin API.

האם אוכל להמשיך לעבוד לאחר הגעה למגבלת התוכנית שלי ב-Claude?

לעיתים. הרץ את /usage-credits כדי לרכוש מכסת שימוש מעבר לתקרה בתוכניות Pro ו-Max, או כדי לבקש זאת ממנהל מערכת בתוכניות Team ו-Enterprise; פעולה זו דורשת התחברות ל-claude.ai דרך /login ואינה זמינה בעת שימוש באימות מבוסס מפתח API. לחלופין, המתן לזמן האיפוס, החלף מודל אם מדובר במגבלת Opus, או העבר את העבודה למפתח API, אשר מחייב לפי דקה ולא לפי חלון זמן.