כמה עולה מיליון טוקנים ב-Claude? חישוב עלות
Claude מחייבת קלט ופלט בנפרד, והתעריף משתנה לפי המודל. כך מחשבים כמה עולים מיליון טוקנים ומה ההשפעה של יחס הקלט לפלט על החשבון החודשי.
כמה עולה 1M tokens ב-Claude?
1M tokens פירושם מיליון tokens, וזו היחידה שלפיה נקוב התמחור של כל Claude API (ממשק תכנות יישומים). אין מחיר יחיד ליחידה זו, מכיוון שקלט ופלט מחויבים בתעריפים שונים, ולכל מודל יש זוג תעריפים משלו. נכון ל-August 2026, מיליון input tokens עולים $1 ב-Claude Haiku 4.5, $2 ב-Claude Sonnet 5 ו-$5 ב-Claude Opus 5.
פלט הוא החלק היקר. בכל המודלים הנוכחיים, תעריף הפלט גבוה פי 5 מתעריף הקלט, ולכן היחס בין השניים משפיע על החשבון יותר מהמחיר המוצג. אפליקציה ששולחת מסמכים ארוכים ומחזירה תשובות קצרות מתנהגת באופן שונה מאוד מאפליקציה שכותבת תשובות ארוכות מתוך prompt קצר.
דף זה עוסק בכלכלת יחידה: כמה עולה token וכיצד להעריך את החשבון לפני שבונים את המערכת. כדי להבין לאן ה-tokens מגיעים בפועל במהלך העבודה, קראו לאן ה-tokens מגיעים בתוך סשן Claude Code.
איך נראים 1M טוקנים
טוקן הוא קטע טקסט שהמודל קורא או כותב. ההנחיה הכללית של Anthropic היא טוקן אחד לכל 4 תווים, או כ-0.75 מילים באנגלית. לכן מיליון טוקנים הם כ-750,000 מילים, או בערך 4 MB של טקסט רגיל.
הערכות שפורסמו עבור קלטים נפוצים ממחישות טוב יותר את קנה המידה.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]בקצב הזה, 1M טוקנים שקולים לכ-400 דפי אינטרנט ממוצעים שנקראו פעם אחת, או לשמונה מאמרי מחקר בהיקף כזה. הם מאפשרים מעבר יחיד על בסיס קוד בגודל בינוני, או חודש של שימוש קל בצ'אט עבור אדם אחד.
יש להתייחס לכל הנתונים האלה כהערכה. קוד, JSON וטקסט בשפות שאינן אנגלית מכילים פחות מילים בכל טוקן, ולכן היחס 0.75 מייצג את הקצה האופטימי. גורם נוסף משפיע על הספירה: Claude Opus 4.7 ואילך, כולל Opus 5 ו-Sonnet 5, משתמשים במפרק אסימונים חדש יותר שמפיק בערך 30 אחוזים יותר טוקנים עבור אותו טקסט בהשוואה ל-Sonnet 4.6 ולגרסאות קודמות. Claude Haiku 4.5 משתמש במפרק האסימונים הישן. לכן ספירה שמדדת ב-Haiku 4.5 נמוכה מהספירה ב-Sonnet 5 עבור קלט זהה, ולכן השוואה ישירה של המחיר למיליון טוקנים בין שתי הקבוצות אינה הוגנת. יש לספור את אותה בקשה מול שני המודלים לפני קבלת החלטה.
התעריפים של Claude למיליון טוקנים
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5 מתומחר בתעריף היכרות של $2 עבור קלט ושל $10 עבור פלט עד 31 באוגוסט 2026. החל מ-1 בספטמבר 2026 יחול התעריף הרגיל: $3 עבור קלט ו-$15 עבור פלט. התעריפים של Claude Opus 5 הם $5 ו-$25.
התעריפים עשויים להשתנות. יש להתייחס לכל נתון בדף הזה כדוגמה מחושבת המתוארכת לאוגוסט 2026, ולאשר את הנתונים העדכניים בדף התעריפים הרשמי לפני אישור תקציב.
אורך ההקשר אינו משנה את התעריף. ב-Claude 4.6 ובגרסאות מאוחרות יותר, חלון ההקשר המלא של 1M טוקנים מחויב לפי התעריף הרגיל. לכן בקשה של 900,000 טוקנים עולה אותו סכום לכל טוקן כמו בקשה של 9,000 טוקנים. הנחיה ארוכה עולה יותר משום שהיא מכילה יותר טוקנים, ולא חל תעריף נפרד להקשר ארוך.
החישוב שנשאר נכון לאחר שינוי מחיר
כל חשבון מורכב משתי פעולות כפל ומפעולת חיבור אחת.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateכך הוא נראה כקוד שאפשר להריץ:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")הפקודה מדפיסה 0.0126. בקשה ששולחת 4,300 טוקני קלט ומקבלת 400 טוקני פלט עולה כ-1.3 סנט ב-Sonnet 5. שמרו את שני התעריפים במקום אחד בקוד. כאשר המחיר משתנה, ערכו שתי שורות, וכל האומדנים במערכת יתעדכנו בהתאם.
אומדן מעשי עבור יישום אמיתי
נבחן עוזר תמיכה. הודעת המערכת והתיעוד של המוצר שלו מסתכמים ב-4,000 טוקנים, והם נשלחים בכל בקשה, משום שה-Messages API הוא חסר מצב והמודל אינו זוכר דבר בין קריאות. שאלת משתמש מוסיפה כ-300 טוקנים. תשובה כוללת כ-400 טוקנים. לכן כל בקשה כוללת 4,300 טוקני קלט ו-400 טוקני פלט.
מיליון טוקני קלט מספיקים לכ-232 בקשות במבנה הזה. בקצב של 1,000 בקשות ביום, היישום צורך 4.3 מיליון טוקני קלט ביום. לכן "1M tokens" מייצג פחות מ-6 שעות של תעבורה.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]ב-Claude Opus 5, תעבורה זו עולה $31.50 לכל 1,000 בקשות. ב-Sonnet 5 העלות היא $12.60. מעבר ל-Claude Haiku 4.5 מוריד את העלות ל-$6.30, ושימוש ב-Prompt Cache חם ב-Sonnet 5 מוריד אותה עוד יותר, ל-$5.40.
הכפילו את הסכום ב-30 כדי לחשב חודש של תעבורה כזו. Sonnet 5 במחירי המחירון עולה כ-$378 בחודש. אותו יישום עם מטמון חם עולה כ-$162. בחירת המודל וההחלטה על שמירת מטמון משפיעות כל אחת יותר מכל תעריף שתוכלו להשיג במשא ומתן בהיקף פעילות כזה. בחירת המודל להפעלה היא שאלה נפרדת. המודל הזול ביותר שעובר את הבדיקות שלכם הוא הבחירה המועדפת: בחירה בין Opus, Sonnet ו-Haiku מסביר כיצד לבדוק זאת כראוי.
אחסון במטמון של פרומפטים מפחית את עלות החלק החוזר
הקידומת באורך 4,000 טוקנים זהה בכל בקשה, ואתם משלמים עליה את מלוא מחיר הקלט בכל פעם. אחסון במטמון של פרומפטים שומר את הקידומת לאחר עיבודה וגובה תעריף מופחת בעת השימוש החוזר בה.
קריאת מטמון עולה 0.1 מתעריף הקלט הבסיסי. כתיבת המטמון עולה פי 1.25 מהתעריף הבסיסי למשך 5 דקות, או פי 2 מהתעריף הבסיסי למשך שעה אחת. לכן מטמון של 5 דקות מחזיר את עלותו לאחר קריאה אחת, מכיוון שהכתיבה עולה 0.25 נוספים, בעוד שכל קריאה חוסכת 0.9. מטמון של שעה אחת דורש שתי קריאות כדי להגיע לאיזון.
הדרך הפשוטה ביותר להפעיל זאת היא באמצעות שדה יחיד ברמה העליונה:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'לאחר מכן קראו את הבלוק usage שמוחזר:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}שלושת מוני הקלט האלה מחויבים לפי שלושה תעריפים שונים, וביחד הם מייצגים את נפח הקלט בפועל: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. אומדן עלות שקורא רק את input_tokens יהיה שגוי מאוד לאחר הפעלת האחסון במטמון.
שני דברים מונעים ממטמון להחזיר את עלותו, ובשניהם הכשל מתרחש ללא הודעה.
הקידומת חייבת להיות זהה ברמת הבתים. חיפוש מטמון מתבצע בהתאמת קידומת, ולכן חותמת זמן או שם המשתמש בתחילת פרומפט המערכת משנים אותה בכל בקשה. במקרה כזה תשלמו בכל פעם פי 1.25 מתעריף קלט הבסיס, ולעולם לא תתבצע קריאה מהמטמון. הסימן לכך הוא ש-cache_creation_input_tokens נשאר גבוה, בעוד cache_read_input_tokens נשאר 0. הציבו את cache_control בבלוק האחרון שהתוכן שלו זהה בין הבקשות, והוסיפו אחריו את כל מה שמשתנה. שינוי ההגדרות של tools מבטל את כל המטמון שמתחתיהן, מכיוון שהביטול מתבצע לפי סדר: כלים, לאחר מכן מערכת, ולאחר מכן הודעות.
הקידומת חייבת להיות ארוכה מספיק. אורך הקידומת המינימלי שניתן לשמור במטמון הוא 512 טוקנים ב-Opus 5, 1,024 ב-Sonnet 5 ו-4,096 ב-Haiku 4.5. פרומפט קצר יותר אינו נשמר במטמון, ולא מוחזרת שגיאה. הקידומת באורך 4,000 טוקנים בדוגמה שלעיל נשמרת במטמון ב-Sonnet 5, אך אינה נשמרת ב-Haiku 4.5, מכיוון ש-4,000 נמוך מסף המינימום של מודל זה. כאשר שני המונים מציגים 0, שום דבר לא נשמר במטמון.
עיבוד באצווה חוצה את התעריף
ה-API של Batch מעבד בקשות באופן אסינכרוני, בהנחה של 50 אחוז הן על הקלט והן על הפלט. בדוגמה שלמעלה, העלות יורדת מ-$12.60 לכל 1,000 בקשות ל-$6.30. ההנחה מצטברת עם שמירת הנחיות במטמון, ולכן משימת Batch שנשענת על נתונים שמורים במטמון היא הדרך הזולה ביותר להרצת עבודות בכמות גדולה.
המחיר הוא זמן ההשהיה, ולכן Batch אינו מתאים לפעולות שאדם ממתין להשלמתן. הוא מתאים לסיווג לילי ולהשלמת עיבוד חסר של מסמכים.
מדוע עלות הצ'אט גדלה בתוך שיחה אחת
מכיוון שה-API אינו שומר מצב, הלקוח שלך שולח מחדש את השיחה כולה בכל תור. לכן השימוש באסימונים בתוך צ'אט גדל ביחס ריבועי לאורך השיחה, ולא בקו ישר.
נניח שבכל תור נשלחים בממוצע 500 אסימונים. בתור 1 נשלחים 500 אסימוני קלט. בתור 2 נשלחים 1,000. בתור 20 נשלחים 10,000. סכימה לפי הנוסחה n(n+1)/2 מראה ששיחה בת 20 תורים שלחה כ-105,000 אסימוני קלט, אף שהתמליל עצמו מכיל רק 10,000 אסימונים.
לכן תכונת צ'אט עולה יותר מכפי שהתמליל שלה מרמז, ולכן שמירת הקידומת היציבה במטמון או סיכום של תורים ישנים משתלמים בשרשורים ארוכים. גם סוכן שחוזר על קריאות לכלים פועל לפי אותו דפוס, ואף בדפוס חמור יותר: כל תוצאת כלי נשארת בהיסטוריה ונשלחת מחדש בכל תור מאוחר יותר. הגדרת מגבלת הוצאה קשיחה לסוכן שאתה מריץ בעצמך חשובה במיוחד כאן, משום שהגידול הזה מתרחש באופן אוטומטי ואיש אינו עוקב אחריו.
ספרו את האסימונים לפני שאתם מנחשים
הפסיקו להסיק את מספר האסימונים ממספר המילים. ה-API סופר אותם עבורכם ללא עלות, במסגרת מגבלת קצב נפרדת מזו של יצירת הודעות.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'התשובה כוללת שדה אחד:
{ "input_tokens": 14 }העבירו אליו את ה-system prompt ואת הגדרות הכלים האמיתיים שלכם, יחד עם הודעת משתמש מייצגת, ולאחר מכן הזינו את המספר בפונקציית העלות שלמעלה. נקודת הקצה מקבלת את אותו גוף בקשה כמו בקשת הודעה, ולכן גם תמונות וקובצי PDF נספרים כראוי. יש שתי הסתייגויות חשובות. הספירה היא אומדן, והיא עשויה להיות שונה מעט מהנתון שעל פיו תחויבו. נוסף על כך, היא נמדדת באמצעות ה-tokenizer של המודל שאתם מעבירים, לכן העבירו את המודל שבו אתם מתכוונים להשתמש בפועל.
אי אפשר לספור מראש את אסימוני הפלט, משום שהם עדיין אינם קיימים. הגבילו אותם באמצעות max_tokens, ולאחר מכן מדדו את ההתפלגות בפועל באמצעות usage.output_tokens בתעבורת ייצור.
מה עוד נכלל בחשבון
רוב העלות נובעת מטוקנים. יש כמה פריטים שאינם טוקנים, והם מפתיעים משתמשים.
- הגדרות כלים הופכות לטוקני קלט בכל בקשה. הנחיית המערכת לשימוש בכלים לבדה מוסיפה 286 עד 406 טוקנים ב-Opus 5, לפני הסכמות שלכם. עשרה תיאורים מפורטים של כלים יכולים להכפיל פרומפט קטן.
- חיפוש באינטרנט מחויב בסך $10 לכל 1,000 חיפושים, בנוסף לטוקנים שהוצאות החיפוש צורכות כשהן נכנסות להקשר.
- שליפת תוכן מהאינטרנט אינה מוסיפה עמלה משלה, אך הדף שנשלף הופך לטוקני קלט. דף תיעוד בנפח 100 kB מכיל בערך 25,000 טוקנים כאלה.
- בקשה להסיק מסקנות בארה״ב בלבד באמצעות
inference_geoב-Claude 4.6 ובגרסאות מאוחרות יותר מחילה מכפיל של 1.1 על כל קטגוריית טוקנים, כולל קריאות וכתיבות למטמון.
השאלה אם ה-API הוא בכלל המוצר הנכון לרכישה תלויה בהיקף השימוש שלכם. מתחת לרמת שימוש מסוימת, תוכנית חודשית קבועה משתלמת יותר באופן חד-משמעי, וההשוואה בין ה-API למינוי Claude מבצעת את ההשוואה באמצעות מספרים אמיתיים.
FAQ
כמה עולה 1M טוקנים ב-Claude?
העלות תלויה במודל ובשאלה אם הטוקנים הם טוקני קלט או טוקני פלט. נכון ל-August 2026, מיליון טוקני קלט עולים $1 ב-Claude Haiku 4.5, $2 ב-Claude Sonnet 5 במסגרת תמחור ההשקה, ו-$5 ב-Claude Opus 5. עלות הפלט בכל אחד מהמודלים האלה גבוהה פי 5 מעלות הקלט. ב-1 September 2026 המחיר של Sonnet 5 יעבור ל-$3 עבור קלט ול-$15 עבור פלט. התעריפים עשויים להשתנות, לכן יש לאמת אותם בדף התמחור הרשמי לפני שמכניסים סכום לתקציב.
האם 1M טוקנים זהה ל-1M מילים?
לא. טוקן אחד הוא בערך 4 תווים באנגלית, או כ-0.75 מילים, ולכן מיליון טוקנים הם בערך 750,000 מילים. יחס זה הוא אומדן בלבד. קוד, JSON ושפות שאינן אנגלית משתמשים ביותר טוקנים לכל מילה. Claude Opus 4.7 ואילך משתמשים גם ב-tokenizer חדש יותר, שמייצר בערך 30 אחוז יותר טוקנים עבור טקסט זהה לעומת Claude Sonnet 4.6 ומוקדם יותר. לכן אי אפשר להעביר את הספירות ישירות בין דורות של מודלים. יש למדוד באמצעות נקודת הקצה החינמית /v1/messages/count_tokens, תוך העברת המודל שבו אתם מתכננים להשתמש.
האם אחסון מטמון של פרומפטים תמיד חוסך כסף?
לא. כתיבה למטמון למשך 5 דקות עולה פי 1.25 מתעריף הקלט הבסיסי. לכן קידומת שנכתבת למטמון אך לעולם אינה נקראת עולה 25 אחוז יותר משליחתה ללא מטמון. העלות מתקזזת כבר בקריאה הראשונה. הכשל מתרחש בשתי דרכים, ובשתיהן לא מתקבלת הודעה. אם הקידומת שבמטמון משתנה בין בקשות, החיפוש לעולם לא ימצא התאמה, משום שנדרשת התאמה מדויקת של הקידומת. אם הקידומת קצרה מאורך האחסון המינימלי של המודל, שהוא 1,024 טוקנים ב-Sonnet 5 ו-4,096 ב-Haiku 4.5, דבר אינו נשמר במטמון ולא מוחזרת שגיאה. כאשר cache_creation_input_tokens וגם cache_read_input_tokens מציגים 0, המטמון אינו עושה דבר.
מדוע החשבון שלי גדל מהר יותר ממספר ההודעות?
משום שכל השיחה נשלחת מחדש בכל תור. ה-Messages API אינו שומר מצב, ולכן תור 20 בשיחה כולל שוב את כל 19 התורות הקודמים כקלט. כאשר בכל תור יש בממוצע 500 טוקנים, שיחה בת 20 תורות שולחת בערך 105,000 טוקני קלט, אף שהתמליל מכיל רק 10,000 טוקנים. לולאות של סוכנים פועלות באותה דרך, משום שכל תוצאת כלי נשארת בהיסטוריה. יש לשמור את הקידומת היציבה במטמון, או לסכם תורות ישנים ולהסיר אותם מהבקשה.