למה Claude יקר? חשבון האסימונים והעלויות הנסתרות
אסימוני פלט עולים פי חמישה מאסימוני קלט, ובכל תור כל ההקשר נשלח מחדש. ראו חישוב מסשן אמיתי וארבעה מנופים שמפחיתים את העלות.
מדוע Claude יקר? התשובה הקצרה
Claude יקר מארבע סיבות שמצטברות זו על גבי זו. תמחור אסימוני הפלט גבוה פי חמישה מתמחור אסימוני הקלט. ה־API אינו שומר זיכרון של השיחה, ולכן כל ההיסטוריה נשלחת מחדש ומחויבת מחדש בכל תור. סוכן הופך שאלה אחת לעשרות קריאות API, וכל קריאה כוללת את ההיסטוריה ההולכת וגדלה. נוסף על כך, מודל הקצה מתומחר לפי מורכבות העבודה שהוא מבצע, ולא לפי עלות ההפעלה של מודל קטן.
אסימון הוא חלק מטקסט. ככלל אצבע, אסימון אחד הוא בערך ארבעה תווים, או כ־0.75 מילים באנגלית. התעריפים מצוינים לכל מיליון אסימונים, ומסומנים MTok (million tokens). כל התעריפים שלהלן הם תעריפי ה־API המפורסמים של Claude נכון ל־August 2026.
רוב החשבוניות המפתיעות נובעות מהסיבה השנייה ומהסיבה השלישית ברשימה. בדרך כלל אנשים מניחים שהטקסט ש־Claude כותב הוא הגורם לעלות. בסשן של סוכן, הכתיבה מהווה לעיתים פחות מעשירית מהחיוב.
המחירים שפורסמו, כדי שנסכים על המספרים
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]התמקדו ביחסים ולא במספרים המוחלטים. כל מודל גובה בדיוק פי 5 יותר על פלט מאשר על קלט. Opus 5 עולה 5 דולר למיליון אסימוני קלט ו־25 דולר למיליון אסימוני פלט. Haiku 4.5 עולה 1 ו־5. לכן הפער בין המודל הזול ביותר ליקר ביותר הוא פי 5, והפער בין קריאה לכתיבה הוא גם פי 5.
Sonnet 5 מוצע במחיר השקה של 2 ו־10 דולר למיליון עד 31 באוגוסט 2026. החל מ־1 בספטמבר 2026 המחיר יעבור ל־3 ו־15. המחירים משתנים עם שחרור גרסאות של המודלים, לכן בדקו את המחירים העדכניים לפני שאתם בונים עליהם תקציב.
העמודה האחרונה מציגה את מחיר קריאת המטמון. היא קובעת את רוב החשבוניות. חזרו אליה לאחר החישוב.
מדוע אסימוני פלט עולים פי חמישה מאסימוני קלט?
קריאה וכתיבה אינן דורשות אותה כמות עבודה. אסימוני קלט מעובדים במעבר אחד. המודל קורא את כל ההנחיה בבת אחת, והעבודה מתבצעת במקביל לכל אורכה. לכן קריאת הנחיה בת 60,000 אסימונים אינה אורכת פי 60,000 מקריאת הנחיה בת 1,000 אסימונים.
אסימוני פלט מופקים בזה אחר זה. כל אסימון חדש מחייב מעבר נפרד דרך המודל, והוא זקוק לכל האסימונים שלפניו כהקשר. כתיבה של 1,000 אסימונים משמעותה 1,000 מעברים, בזה אחר זה. אי אפשר לפזר את העבודה הסדרתית הזאת כפי שאפשר לפזר את עבודת הקריאה, ולכן כל אסימון פלט תופס את החומרה למשך זמן רב יותר.
לכן הקיצור של התשובה הוא מנוף חלש יותר מכפי שנהוג לחשוב. הוא משפיע על המחצית הקטנה יותר של חשבון הסוכן.
מדוע כל השיחה שלי מחויבת מחדש בכל תור?
ה־Claude API הוא חסר־מצב. אין בשרתים של Anthropic שיחה קיימת שאליה מוסיפים הודעה אחת. כל בקשה כוללת את היסטוריית ההודעות המלאה, והמודל קורא את כולה לפני שהוא כותב דבר. לכן תור 30 מחויב גם עבור תורים 1 עד 29.
המשמעות היא שעלות השיחה גדלה מהר יותר מאורכה. תור 1 מחויב עבור הקשר קטן. תור 40 מחויב עבור הקשר גדול. אם מחברים את כל ארבעים התורים, מתקבלת עלות עבור מספר טוקנים גדול פי כמה ממספר הטוקנים שנכתבו בפועל.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]הסשן שלמעלה מתחיל ב־20,000 טוקנים. אלה כוללים את ה־system prompt, את הגדרות הכלים ואת הקבצים הראשונים שה־agent פתח. עד תור 40, ההקשר כולל 100,000 טוקנים. אם מחשבים ממוצע על פני כל ארבעים התורים, מתקבלים בערך 60,000 טוקנים שנקראים בכל בקשה.
מדוע agent עולה הרבה יותר מ־chat?
chat הוא בקשה אחת לכל שאלה. agent הוא בקשה אחת לכל שלב. קריאת קובץ היא שלב. הרצת בדיקה היא שלב. קריאת פלט הבדיקה היא שלב. עריכת הקובץ היא שלב. 40 שלבים להשלמת משימה אחת הם דבר רגיל עבור coding agent.
שתי עלויות נוספות נלוות לשימוש בכלים. הגדרות הכלים הן input tokens בכל בקשה, משום שיש להודיע למודל בכל פעם אילו כלים זמינים. Anthropic מפרסמת את התקורה: system prompt לשימוש בכלים צורך 286 tokens ב־Opus 5 כאשר tool_choice מוגדר ל־auto, נוסף על ה־tokens של סכמות הכלים שלכם. חלק מהכלים בצד השרת מחויבים גם בתשלום נפרד. חיפוש באינטרנט מחויב בסך $10 לכל 1,000 חיפושים, נוסף על ה־tokens שצורכים התוצאות.
כל תוצאת כלי הופכת גם להקשר קבוע. פקודה שמדפיסה 3,000 שורות מוסיפה את 3,000 השורות האלה לכל בקשה בהמשך הסשן. השימוש ב־tokens לכל סשן ש־Claude Code מדווח עליו הופך זאת לנראה: עקבו אחר העלייה במספר ה־input מיד לאחר הרצת פקודה שמפיקה פלט רב.
החשבון במסך עבודה אמיתי
לפניכם שעה מציאותית של תכנות סוכני ב־Opus 5. בוצעו 40 בקשות API. ההקשר גדל מ־20,000 ל־100,000 טוקנים, ולכן הממוצע הוא כ־60,000 טוקנים לבקשה. המודל כותב כ־700 טוקנים לבקשה. אלה כוללים קריאות קצרות לכלים וכמה מקטעי קוד ארוכים יותר.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]שימו לב לחלוקה. עלות הקריאה היא 12.00 דולר, ועלות הכתיבה היא 0.70 דולר. לכן הפלט שקראתם בפועל מהווה כ־5% מהחשבון. המודל כתב 28,000 טוקנים, וחויב על קריאה של 2,400,000 טוקנים. איש לא הקליד 2.4 מיליון טוקנים. אותם 100,000 טוקנים נקראו שוב ושוב.
מנוף 1: שמירת prompt במטמון, שהוא המנוף המשמעותי ביותר
שמירת prompt במטמון מאחסנת את הצורה המעובדת של קידומת יציבה ב־prompt. בבקשה הבאה הקידומת נקראת מהמטמון במקום לעבור עיבוד מחדש. כתיבה למטמון עולה פי 1.25 מתעריף הקלט עבור מטמון לחמש דקות, או פי 2 עבור מטמון לשעה. קריאה ממנו עולה פי 0.1 מתעריף הקלט. ב־Opus 5 העלות היא 0.50 דולר למיליון, במקום 5 דולר.
החילו זאת על הסשן שלעיל. כל אחד מ־100,000 הטוקנים נכתב למטמון פעם אחת במהלך התארכות השיחה. יתרת 2,300,000 טוקני הקלט הופכים לקריאות מהמטמון.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48סמנו את החלק שניתן לשמור במטמון באמצעות שדה cache_control. מקמו את נקודת העצירה אחרי התוכן שאינו משתנה בין תורות: ה־system prompt והגדרות הכלים. מסמך ארוך שאתם ממשיכים להפנות אליו שייך לאותו בלוק יציב.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}סדר ה־prompt קובע כעת את העלות. פגיעה במטמון דורשת התאמה מדויקת מתחילת ה־prompt, לכן כל דבר שמשתנה בכל בקשה חייב להופיע אחרי כל מה שאינו משתנה. אם תציבו חותמת זמן בראש ה־system prompt, המטמון יישבר בכל תור: כל הקידומת תהפוך להחטאה, ותשלמו פי 1.25 מתעריף הקלט כדי לכתוב אותה מחדש.
התגובה מציינת אם הפעולה הצליחה. שלחו בקשה וקראו את בלוק השימוש.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'כל תגובה כוללת אובייקט usage כמו זה:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}בקשה חוזרת שעדיין מציגה 0 בתוך cache_read_input_tokens פירושה שלא הייתה פגיעה במטמון. הסיבה הרגילה היא שמשהו לפני נקודת העצירה השתנה. גם המטמון לחמש דקות פג, לכן בקשה שנשלחת לאחר שש דקות היא החטאה ולאחריה כתיבה מחדש.
מנוף 2: נתקבו את המשימות הפשוטות למודל קטן יותר
רוב הסבבים בסשן של סוכן אינם מורכבים. פתיחת קובץ, הפעלת formatter וקריאת diff. משימות אלה אינן דורשות את מודל החזית. ניתוב שלהן אל Haiku 4.5 מוריד את תעריף הקלט מ־5 דולר למיליון ל־1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]אותו סשן עולה 12.70 דולר ב־Opus 5 ללא caching, 2.48 עם caching, 0.99 ב־Sonnet 5 עם caching, ו־0.50 ב־Haiku 4.5 עם caching. caching לבדו מפחית את החשבון בכ־80 אחוז. בחירת המודל מבטלת את רוב העלות שנותרה.
הנה ההסתייגות החשובה. מודל זול יותר שנותן תשובה שגויה עולה לכם שוב במחיר של כל הסשן, נוסף על הזמן שלכם. נתקבו לפי מורכבות המשימה, ולא לפי המחיר. בחירה בין Opus, Sonnet ו־Haiku מסביר היכן כל אחד מהם מתפקד היטב.
מנוף 3: היגיינת ההקשר
כל אסימון שנשאר בהקשר מחויב בתשלום בכל תור שנותר, ולכן הסרה מוקדמת של אסימון משתלמת הרבה יותר מהסרתו בשלב מאוחר. קובץ של 5,000 אסימונים שהוזן בתור 5 מתוך פגישה בת 40 תורים ייקרא 35 פעמים נוספות. מדובר ב־175,000 אסימוני קלט נוספים, שהם כמעט דולר אחד ב־Opus 5 בגלל הדבקה לא זהירה.
ארבעה הרגלים שמשפיעים על המספר:
- התחילו פגישה חדשה עבור משימה חדשה, במקום להמשיך את הפגישה מאתמול.
- סננו פקודות רועשות לפני שהפלט מגיע למודל, באמצעות משהו כמו
head -50, ולא לאחר מכן. - בקשו את הפונקציה היחידה שבה אתם מתעניינים, ולא את הקובץ כולו.
- כאשר פגישה ארוכה מפסיקה להתקדם, בקשו סיכום והתחילו מחדש על בסיסו. הסיכום כולל כמה מאות אסימונים. התמליל כולל מאה אלף.
מנוף 4: עבדו באצווה על כל דבר שאינו אינטראקטיבי
ה־Batch API מעבד בקשות באופן אסינכרוני ומפחית 50 אחוז הן מעלות הקלט והן מעלות הפלט. אם משימה אינה דורשת תשובה בתוך השנייה הקרובה, עבדו איתה באצווה. הדבר כולל סיווג, חילוץ, סיכום של backlog והרצות הערכה. ההנחה עבור עיבוד באצווה מצטברת עם שמירת prompts במטמון. היא אינה חלה על סשן אינטראקטיבי, משום שאין בו זמן המתנה שאפשר לנצל.
האם גובים ממני מחיר מופרז?
זו השאלה האמיתית שמסתתרת מאחורי "למה Claude יקר", ולכן הנה תשובה ישירה. התעריפים מפורסמים, זהים לכולם ברמות התמחור הרגילות, והחיוב מתבצע לפי טוקן. שום רכיב בחשבון אינו נתון לשיקול דעת. טבלת התעריפים אינה יכולה לומר לכם אם אתם מקבלים תמורה, משום שהיא מתמחרת טוקנים, ואילו אתם מתעניינים בתוצאות.
לכן תמחרו את התוצאה. עלות הסשן לעיל הייתה 12.70 דולר, ללא שימוש ב־cache. אם הוא סיפק תכונה שפיתוחה היה אורך לכם שעה, זו עלות נמוכה. אם הוא השקיע 40 סבבים בחזרה על עצמו, אותם 12.70 דולר לא הניבו דבר, והתעריף מעולם לא היה הבעיה.
זה החלק שחשוב לזכור. החשבון שלכם גדל לפי מספר הטוקנים, ולא לפי הערך שהתקבל. סשן יעיל וסשן מבוזבז באותו אורך עולים אותו דבר. לכן ארבעת המנופים חשובים יותר מטבלת התעריפים: אינכם יכולים לנהל משא ומתן על המחיר לטוקן, אך אתם קובעים כמה טוקנים נדרשים למשימה.
לכן עקבו אחר עלות בדולרים לכל משימה שהושלמה, ולא אחר העלות החודשית. אם המספר הזה יורד בזמן שאתם מכווננים caching ו־routing, התצורה שלכם משתפרת גם כאשר הסכום החודשי עולה, משום שהסכום הכולל גדל בעקבות ביצוע עבודה רבה יותר.
מה אינו מפחית את החשבון
עצות נפוצות מסוימות כמעט שאינן מועילות. הוראה למודל "להיות תמציתי" מקצרת את הפלט, אך הפלט היווה חמישה אחוזים בלבד מהחשבון בדוגמה. קיצור השאלה שלכם חוסך כמה מאות טוקנים מתוך הקשר של 60,000 טוקנים. כיבוי החשיבה המורחבת עוזר רק כאשר טוקני החשיבה היו חלק משמעותי מהפלט שלכם, ובלוק השימוש מציג זאת כדי שלא תצטרכו לנחש.
חלון הקשר גדול יותר אינו מייקר את העלות בפני עצמו. ב־Claude 4.6 ובגרסאות מאוחרות יותר, חלון מלא של מיליון טוקנים מחויב לפי התעריף הרגיל לטוקן, ולכן בקשה של 900,000 טוקנים עולה אותו מחיר לטוקן כמו בקשה של 9,000 טוקנים. גודל החלון אינו קובע את המחיר. מה שקובע הוא התוכן שאתם בוחרים להכניס אליו.
שני נושאים נוספים שייכים לשלב התכנון, ולא למפגש יחיד. אם השימוש שלכם יומיומי ואינטראקטיבי, השוו בין תשלום לפי טוקן לבין תוכנית בתשלום קבוע: ההשוואה בין עלות ה־API לבין עלות המינוי מבצעת את החישוב הזה. אם agent פועל ללא השגחה בשרת, הגדירו תקרת הוצאה קשיחה לפני שתכוונו דבר אחר; בכך עוסק המדריך בקרות עלויות עבור agent ב־VPS. לקבלת תחושה כללית של קנה המידה, מה מיליון טוקנים של Claude קונים בפועל ממיר את טבלת התעריפים לעמודי טקסט.
FAQ
מדוע החשבון שלי עבור Claude קפץ כשהתחלתי להשתמש ב־agent?
משום ש־agent שולח בקשות רבות עבור כל שאלה, וכל בקשה כוללת את כל השיחה עד אותו שלב. צ'אט שולח בקשה אחת עבור כל שאלה. agent לתכנות שולח בקשה אחת עבור כל שלב, ו־40 שלבים עבור משימה אחת הם דבר רגיל. כל אחת מהבקשות מחויבת לפי מלוא ההקשר, ולכן סשן שמסתיים ב־100,000 טוקנים עשוי להיות מחויב בסך כולל של יותר מ־2 מיליון טוקני קלט. קראו את input_tokens ואת cache_read_input_tokens בתגובת ה־API כדי לראות זאת ישירות.
האם caching של prompt באמת מפחית את החשבון במידה כזאת?
בדוגמה המפורטת, העלות של הסשן ירדה מ־12.70 דולר ל־2.48 דולר, משום שקריאה מהמטמון עולה עשירית מתעריף הקלט. החיסכון תלוי לחלוטין בשיעור ההתאמות שלכם. במטמון לחמש דקות, השימוש משתלם כבר לאחר קריאה אחת, משום שכתיבה עולה פי 1.25 מתעריף הקלט וקריאה עולה פי 0.1 ממנו. אם ה־prompt משתנה סמוך להתחלה בכל בקשה, לא תקבלו התאמות כלל ותשלמו את תוספת הכתיבה ללא תמורה. אמתו זאת באמצעות cache_read_input_tokens לפני שאתם מניחים שהמנגנון פועל.
האם פשוט כדאי להשתמש ב־Haiku לכל דבר?
לא. Haiku 4.5 עולה 1 דולר לכל מיליון טוקני קלט, לעומת 5 דולר עבור Opus 5, ולכן החיסכון ממשי במשימות פשוטות בנפח גבוה, כגון סיווג וניתוב. תשובה שגויה במשימה מורכבת עולה יותר ממה שהמודל חסך, משום שעליכם לשלם גם עבור הניסיון החוזר וגם עבור הזמן שלכם. הדפוס שמוכיח את עצמו הוא שילוב: המודל הקטן עבור שלבים מכניים, ומודל החזית עבור השלב שדורש שיקול דעת.
האם ה־API זול יותר ממינוי Claude?
הדבר תלוי ביציבות השימוש שלכם. מינוי הוא מחיר חודשי קבוע עם מגבלות שימוש. ה־API מחויב לפי טוקן ללא תקרה, ולכן הוא זול יותר כאשר השימוש שלכם מועט או מתרחש בפרצי פעילות, ויקר יותר כאשר אתם משתמשים בו בהיקף גבוה בכל יום עבודה. קחו את ממוצע הטוקנים ליום מתוך בלוק השימוש, תמחורו לפי התעריף של המודל שלכם, ולאחר מכן השוו את הסכום למחיר המסלול.