SSD Nodes Learn Hosting plans →
מדריכים Matt Connorמאת Matt Connor · עודכן 2026-09-08

כמה טוקנים כלולים במנוי Claude Pro?

ל-Claude Pro אין מכסת טוקנים מוגדרת. השימוש מוגבל לפי מספר הודעות בחלון זמן מתגלגל, ושיחות ארוכות מנצלות את המכסה מהר יותר. למדו איך לבדוק את מצב השימוש שלכם.

כמה טוקנים כולל Claude Pro?

ל-Claude Pro אין מכסת טוקנים, ונכון לספטמבר 2026, חברת Anthropic אינה מפרסמת מכסה כזו. מנוי Claude מוגבל לפי מספר הודעות בתוך חלון זמן מתגלגל, ולא לפי טוקנים הנגרעים מיתרה. אורך החלון תלוי במודל הנבחר, באורך השיחה ובכמות הטקסט שכל תור בשיחה כולל.

זו התשובה ששאלה זו מקבלת לעיתים רחוקות, כיוון שאנשים מצפים שתוכנית מנוי תעבוד כמו API key. מפתח API צורך יתרה הנספרת בטוקנים, כך שניתן לחשב את החשבונית באופן עצמאי. תוכנית מנוי מוכרת גישה למכסה ש-Anthropic קובעת ומתאימה, והמכסה מוגדרת במספר הודעות, לכן אין מספר טוקנים קבוע שאפשר לציין. כל מי שנותן לכם מספר כזה, פשוט המציא אותו.

לכן, כדאי לשאול שאלה אחרת: מה הופך את ההודעות שלי ליקרות? לשאלה זו יש תשובה ממשית, ואפשר לפעול לפיה כבר היום.

מדוע מנוי אינו יכול לתמחר מספר טוקנים

ה-API מחייב על כל בקשה לפי טוקנים. טוקני קלט מכסים את כל מה שאתם שולחים, טוקני פלט מכסים את כל מה שהמודל כותב בחזרה, ולשניים תעריפים שונים, וזו הסיבה ש-עלות טוקני קלט ופלט שונה לפני שאתם מבצעים הערכה כלשהי.

בתוכניות הצרכנים אין יתרה לניצול. Anthropic מגבילה את כמות ההודעות שניתן לשלוח בתוך חלון זמן מתגלגל, שנפתח עם ההודעה הראשונה שלכם ונסגר כעבור מספר שעות מוגדר; התוכניות בתשלום כוללות מגבלה שנייה, ארוכה יותר, הנמדדת לאורך שבוע. הודעה אינה בגודל קבוע, לכן אותו מספר הודעות מייצג כמות עבודה שונה מאוד עבור שני אנשים שונים. דפי העזרה של Anthropic מתארים את המגבלות לפי מספר הודעות משוער עבור שיחה קצרה, ומזהירים כי שיחות ארוכות וקבצים מצורפים גדולים מנצלים את המכסה מהר יותר. אזהרה זו היא כל הסיפור, והמנגנון שמאחוריה כמעט לעולם אינו מוסבר.

מדוע תור מספר 20 בצ'אט עולה הרבה יותר מתור מספר 1

המודל אינו שומר זיכרון בין בקשות. הוא חסר מצב (stateless), ולכן כל תור שולח מחדש את כל השיחה: את ה-system prompt, כל הודעה קודמת שכתבת, כל תשובה קודמת של Claude, וכל קובץ שצירפת. השאלה החדשה שלך עשויה להיות בת עשרים מילים, אך הבקשה שנושאת אותה מכילה את כל התמליל.

לפיכך, העלות של תור גדלה ככל שהצ'אט מתארך, והיא גדלה בצורה ליניארית. השורות להלן מציגות את החישוב הזה על סמך קבוצת הנחות עגולות: system prompt של כ-1,000 אסימונים (tokens), הודעות שלך של כ-1,000 אסימונים כל אחת, ותשובות של כ-1,200 אסימונים כל אחת. אלו מדגימות את המנגנון בלבד ואינן מהוות מדידה של החשבון שלך.

ChartInput tokens per turn as one conversation grows (illustration)
The data behind this chart
[
  {
    "label": "Turn 1",
    "sent_this_turn": "2,000",
    "cumulative_input": "2,000"
  },
  {
    "label": "Turn 5",
    "sent_this_turn": "10,800",
    "cumulative_input": "32,000"
  },
  {
    "label": "Turn 10",
    "sent_this_turn": "21,800",
    "cumulative_input": "119,000"
  },
  {
    "label": "Turn 20",
    "sent_this_turn": "43,800",
    "cumulative_input": "458,000"
  }
]

בתור הראשון נשלחים 2,000 אסימוני קלט. בתור ה-20, אותה שאלה קצרה שולחת 43,800, פי יותר מעשרים, עבור אותה כמות הקלדה מצדך. לאורך כל השיחה שלחת בסך הכל 458,000 אסימוני קלט, כאשר רובם הם אותו טקסט שנשלח שוב ושוב.

עשרים צ'אטים נפרדים של תור אחד היו שולחים פי עשרים מהשורה הראשונה לעיל ולא יותר מכך. אלו אותן שאלות, אך בשבריר מהעומס. קבצים מצורפים מגדילים את הפער, כיוון שקובץ PDF שצירפת בתור השני נשלח מחדש בתור השלישי, בתור הרביעי, ובכל תור שלאחריו, ללא קשר לשאלה אם השיחה עדיין עוסקת בו.

זו הסיבה ששני אנשים באותה תוכנית מדווחים על ניצול שונה לחלוטין. האחד משאיר שרשור אחד פתוח לאורך כל השבוע ומגיע למכסה ביום רביעי. השני פותח צ'אט חדש עבור כל משימה ולעיתים רחוקות נתקל במגבלה. אף אחד מהם לא עושה משהו לא כשורה. הוצאת האסימונים שלהם שונה בסדרי גודל כי הרגלי העבודה שלהם שונים.

ב-API ניתן להפחית את עלות החזרתיות באמצעות prompt caching, המאחסן את החלק הקדמי של הבקשה שאינו משתנה, כך שקריאות מאוחרות יותר מחויבות בתעריף קלט מופחת עבור חלק זה. במנוי רגיל אין לך שליטה על ה-caching, לכן אורך השיחה הוא המנוף האמיתי שבידיך. אותו מנגנון שולט בסשנים של תכנות, שבהם תוכן קבצים והגדרות כלים נגררים בכל תור, לכן שמירה על הקשר (context) של סשן תכנות קטן תורמת למגבלות שלך יותר מכל הגדרה, ומומלץ לקרוא לאן באמת הולכים האסימונים בסשן של Claude Code לפני שמטילים אשמה על התוכנית.

מה מקבלים בכל רמת מנוי, במונחים יחסיים

אף רמת מנוי אינה מפרסמת מכסה מוחלטת. הנתונים המפורסמים הם יחסיים, והתמונה היחסית מספיקה כדי לבצע בחירה מושכלת. המנוי החינמי נמצא בתחתית, והקיבולת שלו עלולה להצטמצם כאשר העומס על השירות גבוה. מנוי Pro נמצא מעליו. מנוי Max נמכר בשני גדלים, המתוארים כמכפלות של השימוש ב-Pro, בערך פי חמישה ופי עשרים. המנויים Team ו-Enterprise מתומחרים לפי מושב (seat) וכוללים מכסות משלהם.

יש להתייחס למכפילים אלו כהצהרת כוונות ולא כחוזה. Anthropic מכווננת את המכסות, והכוונון אינו מוכרז מראש; זו סיבה נוספת לכך שאף דף מידע מהימן לא יכול לספק לכם מספר אסימונים (tokens) מדויק. בנוגע להיבט הכספי של אותה השוואה, עלות מנוי Pro ומגבלותיו ו-הפער בין שתי רמות ה-Max מכסים את הנושא, ו-מה המנוי החינמי מאפשר בפועל מגדיר את רף המינימום.

בחירת המודל היא מכפיל שני שנוסף על רמת המנוי. אותה שאילתה תצרוך חלק גדול יותר מהמכסה שלכם במודל הגדול ביותר מאשר במודל הקטן ביותר, כיוון שמודל כבד יקר יותר להרצה לכל אסימון. העברת משימות שגרתיות מ-Opus ל-Sonnet או ל-Haiku לרוב קונה יותר זמן עבודה מאשר שדרוג המנוי, לכן התאמת המודל למשימה היא הדבר הראשון שכדאי לנסות כאשר המכסה שלכם ממשיכה להיגמר.

כיצד לצפות בשימוש האישי שלך במקום לנחש

החשבון האישי שלך הוא המקור המהימן היחיד, והוא נמצא במרחק של שתי לחיצות. ב-claude.ai פתחו את Settings ולאחר מכן את Usage. שם מוצג מה צרכת בחלון הנוכחי ומתי החלון הזה מתאפס. בדקו זאת פעם אחת כאשר מתחילות להתקבל סירובים למענה, ופעם נוספת לאחר סשן ארוך; כך תלמדו את דפוסי השימוש שלכם מהר יותר מכל נתון מפורסם.

ב-Claude Code שני פקודות slash מבצעות את אותה פעולה ישירות מהטרמינל. /usage מדווח על השימוש בתוכנית ועל זמן האיפוס. /context מפרט מה ממלא את חלון ההקשר (context window) כרגע, ומפריד בין ה-system prompt, הגדרות הכלים, הקבצים והיסטוריית השיחה. כאשר /context מראה ששיחה ישנה תופסת את רוב הנפח, /clear מתחיל סשן חדש והעלות לכל תור (turn) יורדת חזרה לכיוון השורה הראשונה בטבלה שלעיל.

ב-API הספירה מדויקת, וניתן לבקש אותה לפני שליחת כל בקשה:

curl https://api.anthropic.com/v1/messages/count_tokens \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-sonnet-5",
    "messages": [{"role": "user", "content": "Summarise the attached report."}]
  }'

תגובה תקינה מכילה שדה יחיד, וזהו המספר לפיו יתבצע החיוב:

{"input_tokens": 14}

כל בקשה שהושלמה מדווחת על אותו חישוב בסיומה:

{"usage": {"input_tokens": 21430, "output_tokens": 512}}

שלחו שאלה קצרה אחת כבקשה חדשה, לאחר מכן שלחו את אותה שאלה בסוף שרשור ארוך, והשוו בין שני ערכי ה-input_tokens. ההפרש הוא בדיוק האפקט שהמנוי שלכם מודד, כשהוא מתורגם למספר.

מה לעשות כאשר המכסה נגמרת באמצע משימה

  1. המתינו לחלון הזמן. היישום מציג את זמן האיפוס, ולעיתים קרובות ההמתנה קצרה יותר מהניסיון לעקוף את המגבלה. זהו הצעד הנכון כאשר אין דד-ליין דחוף.
  2. עברו למודל קל יותר. מודל קטן זול יותר לכל פנייה בכל תוכנית, ובחלק מהתוכניות הוא נגזר ממכסה נפרדת, כך שהעבודה נמשכת בזמן שהמודל הכבד נח.
  3. התחילו צ'אט חדש המכיל רק את מה שנדרש לשלב הבא. הדביקו את המסקנות, לא את כל התמליל. העלות לכל פנייה יורדת מיד, והתשובות בדרך כלל משתפרות, כיוון שהמודל אינו נדרש לשקלל אלפי טוקנים של דיון שכבר מוצה.
  4. העבירו את המשימה ל-API, שם הטוקנים נספרים לפי בקשה ומחויבים לפי טוקן. אין חלון זמן להמתין לו, וניתן לראות את המחיר של כל קריאה לפני ואחרי ביצועה.

האפשרות המתאימה תלויה בשאלה אם הבעיה שלכם היא השעון או עומס העבודה. עומס חד-פעמי הוא בעיית תזמון. קיר שנתקלים בו בכל יום רביעי הוא בעיית עומס עבודה, והפתרון עבורו הוא ה-API או תוכנית מורחבת, ולא שיפור התזמון. רשימת התיוג המלאה למקרה של הגעה למכסה באמצע משימה מפרטת את תהליך ההתאוששות צעד אחר צעד, ו-כיצד חלונות הזמן המתגלגלים נפתחים ומתאפסים מסביר מדוע השעון מתנהג כפי שהוא מתנהג. אם אתם בדרככם ל-API, בדקו תחילה את העלויות: השוואת ה-API מול מנוי עבור אותו עומס עבודה ו-מה העלות האמיתית של מיליון טוקנים יספקו לכם את החישובים הנדרשים לפני המעבר.

FAQ

כמה טוקנים כלולים ב-Claude Pro?

חברת Anthropic אינה מפרסמת מכסת טוקנים עבור מנוי Pro, ונכון לספטמבר 2026 אין מספר כזה שניתן לציין. המנוי מוגבל לפי מספר הודעות בתוך חלון זמן מתגלגל, עם מגבלה רחבה יותר הנמדדת לאורך שבוע. כמות ההודעות שניתן לשלוח משתנה בהתאם למודל ולאורך השיחה. כל דף המציין מספר טוקנים חודשי ספציפי עבור Pro מבוסס על השערות בלבד. פתחו את Settings ולאחר מכן את Usage ב-claude.ai כדי לראות את צריכת המשאבים האישית שלכם ואת זמן האיפוס.

האם פתיחת צ'אט חדש מאפסת את המכסה שלי?

לא. השימוש נספר עבור החשבון שלכם לאורך חלון הזמן, לכן צ'אט חדש אינו מחזיר את מה שכבר נוצל. מה שמשתנה הוא העלות של כל תור (turn) מרגע זה ואילך. בצ'אט חדש אין תמליל שיש לשלוח מחדש, לכן הוא מתחיל ברף הנמוך של הטבלה לעיל במקום להמשיך ולעלות. פתיחת צ'אט חדש בעת החלפת נושא היא ההרגל החסכוני ביותר בכל תוכנית מנוי.

מדוע הגעתי למגבלה מהר יותר היום מאשר אתמול?

בדרך כלל הסיבה היא שהעבודה של היום התרכזה בשרשור אחד ארוך. כל תור שולח מחדש את כל השיחה בתוספת קבצים מצורפים, כך שהעלות לכל הודעה עולה בהתמדה בעוד שמספר ההודעות נראה לכם ללא שינוי. סיבה נפוצה נוספת היא המודל: מודלים כבדים יותר מנצלים את המכסה מהר יותר בכל תור, לכן אחר צהריים של עבודה עם המודל הגדול ביותר יסתיים מוקדם יותר מאשר בוקר של עבודה עם מודל קטן יותר.

האם כדאי לעבור ל-API כדי לקבל ספירת טוקנים מדויקת?

עברו ל-API אם אתם זקוקים למספרים או ליכולת חיזוי. ה-API סופר טוקני קלט ופלט בכל קריאה, חושף נקודת קצה (endpoint) לספירת טוקנים שניתן להריץ לפני השליחה, ואין בו חלון זמן להמתנה. החיוב מתבצע לפי טוקן, לכן שימוש אינטנסיבי עולה יותר ממנוי קבוע, ושימוש קל עולה הרבה פחות. בדקו את עלות עומס העבודה האמיתי שלכם מול התוכנית הנוכחית לפני המעבר, כיוון שהתשובה משתנה בהתאם לכמות הטוקנים שאתם שולחים.