איזה מודל Claude כדאי לבחור? מדריך מחירים
Opus 4.8, Sonnet 5 או Haiku 4.5? התעריפים לכל מודל נכון ל-July 2026, השוואת עלות על 100,000 משימות, וההגדרות שמשפיעות על החשבון יותר מכל.
איזה מודל Claude כדאי לבחור?
התשובה הקצרה לשאלה איזה מודל Claude כדאי לבחור: התחילו עם Claude Opus 4.8, ועברו ממנו רק מסיבה שתוכלו לנקוב בה. ההמלצה של Anthropic זהה. "אם אינכם בטוחים איזה מודל לבחור, התחילו עם Claude Opus 4.8 למשימות קידוד סוכניות מורכבות ולעבודה ארגונית." רדו ל-Claude Sonnet 5 כשהמשימה מוגדרת היטב ואתם מריצים אותה פעמים רבות ביום. רדו שוב ל-Claude Haiku 4.5 לעבודה מכנית בהיקף גבוה, כשאתם כבר יודעים כיצד נראית תשובה נכונה. Claude Fable 5 ניצב מעל כולם, לסוכנים שפועלים זמן רב.
לבחירה יש מחיר. אלו התעריפים ב-Claude API (ממשק תכנות יישומים) נכון ל-23 July 2026, למיליון טוקנים, אותם התיעוד מציין כ-MTok.
- Claude Fable 5 (
claude-fable-5): $10 / MTok קלט, $50 / MTok פלט. הקשר של 1M. - Claude Opus 4.8 (
claude-opus-4-8): $5 קלט, $25 פלט. הקשר של 1M. - Claude Opus 4.7 (
claude-opus-4-7): $5 קלט, $25 פלט. הקשר של 1M. - Claude Sonnet 5 (
claude-sonnet-5): $2 קלט, $10 פלט בתמחור מבצעי עד 31 August 2026. התמחור הרגיל של $3 קלט, $15 פלט ייכנס לתוקף ב-1 September 2026. הקשר של 1M. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 קלט, $5 פלט. הקשר של 200K.
המזהים הללו שלמים כפי שכתוב. לא מוסיפים להם דבר.
במודלים של 1M טוקנים אין תוספת תשלום על הגודל עצמו: "בקשה של 900k טוקנים מחויבת באותו תעריף לטוקן כמו בקשה של 9k טוקנים."
למה כל מודל מיועד בפועל
Anthropic מתארת את הסדרה בשורה אחת לכל מודל. התיאורים האלה מנחים טוב יותר מכל טבלת דירוג.
- Claude Fable 5: "בינה מהדור הבא לסוכנים שפועלים זמן רב." מדורג כאיטי ביותר מבין הארבעה בזמן תגובה.
- Claude Opus 4.8: "לתכנות סוכני מורכב ולמשימות ארגוניות." זמן תגובה בינוני.
- Claude Sonnet 5: "השילוב הטוב ביותר של מהירות ובינה." מהיר.
- Claude Haiku 4.5: "המודל המהיר ביותר עם בינה כמעט בחזית הטכנולוגית."
ל-Haiku 4.5 יש גם מגבלות שקובעות את התאמת המשימה לפני המחיר. חלון ההקשר שלו הוא 200K tokens במקום 1M, ולכן מאגר קוד גדול או תמליל סוכן ארוך לא יתאימו. הפלט המרבי ב-Messages API הסינכרוני הוא 64K tokens לעומת 128K אצל האחרים, ותאריך חתך הידע האמין שלו הוא February 2025, בעוד שלושת האחרים נמצאים ב-January 2026.
מה עולה לי הבחירה בעומס עבודה אמיתי?
כל מודל בסדרה מתמחר פלט בפי חמישה מתעריף הקלט. Opus 4.8 עולה $5 לקלט ו-$25 לפלט. Haiku 4.5 עולה $1 לקלט ו-$5 לפלט. היחס נשמר לאורך כל הסדרה, כך שהמודל שבוחרים משפיע ביותר על עבודה שמייצרת הרבה פלט.
עבודה סוכנת היא סוג כזה של עבודה, מכיוון שטוקנים של חשיבה מחויבים כטוקני פלט ונספרים לעבר max_tokens גם כשהטקסט מעולם לא מגיע אליך. ב-Fable 5, ב-Opus 4.8, ב-Opus 4.7 וב-Sonnet 5 תקציר ההיגיון מושמט כברירת מחדל, כך שהשדה thinking חוזר ריק. החיוב אינו משתנה: "בכל מקרה הבלוק מחויב באותו אופן ומוחזר באותו אופן בשיחות מרובות תורות." מה באמת ממלא חשבון טוקנים של Claude מפרק את המונה הזה במלואו.
השאלה אם חשיבה פועלת כלל משתנה בין המודלים שמשווים, דבר שיהרוס בדיקת עלות אם תפספס אותו. ב-Sonnet 5 וב-Fable 5 חשיבה כבר מופעלת ואינה דורשת הגדרה. ב-Opus 4.8 וב-Opus 4.7 היא כבויה עד שמגדירים thinking: {type: "adaptive"} בבקשה. התאם את ההגדרות בשני הצדדים לפני שמסיקים מסקנות מהמספרים.
למה המודל הזול ביותר יכול להיות היקר ביותר
ניקח משימת קידוד אחת ועצמאית. הבקשה נושאת 60,000 tokens של הקשר, והמודל מייצר 8,000 tokens של פלט כולל חשיבה. אין caching, כך שהחישוב נשאר גלוי.
ב-Opus 4.8: 0.06 MTok של קלט במחיר $5 הם $0.30, ו-0.008 MTok של פלט במחיר $25 הם $0.20. הניסיון עולה $0.50. ב-Haiku 4.5 אותו ניסיון הוא $0.06 בתוספת $0.04, כלומר $0.10.
Haiku זול פי חמישה לכל ניסיון. זה נראה כמו מרווח גדול, עד שעוקבים אחר מה שקורה בניסיון כושל. קוראים את התשובה השגויה, וזה עולה זמן. שולחים אותה מחדש כהקשר בניסיון החוזר, כך שכל ניסיון גדול מקודמו. וכשהניסיון השלישי עדיין מחטיא, מסלימים בכל זאת: $0.30 של Haiku בתוספת $0.50 של Opus הם $0.80, או 60% יותר מהרצת Opus פעם אחת.
השאלה המכריעה היא כמה זול אפשר לבדוק את התשובה. כשתשובה שגויה גלויה תוך שנייה אחת, המודל הקטן הוא עסקה. כשזיהוי שגיאה דורש קריאה זהירה של diff, המודל הקטן עולה זמן שאף פעם לא מופיע בחשבונית.
היכן שמודל קטן יותר מנצח באופן מוחלט
Haiku 4.5 הוא הבחירה הנכונה במקרים הבאים:
- עבודת תת-סוכן מכנית. תת-סוכן שמשנה שמות קבצים או אוסף פלט חיפוש אינו זקוק ליכולות חשיבה מתקדמות. זהו התבנית הסטנדרטית לאחר שמבצעים בניית סוכן AI עם Claude ומספקים לו עוזרים.
- מיון יומנים. ההחלטה אם שורה היא רעש או ראויה לתשומת לב אנושית היא שיקול דעת מצומצם עם מצב כשל ברור.
- סיווג מול קבוצת תוויות קבועה. הפלט קצר והדיוק ניתן למדידה על מדגם.
- קריאות ייצור בנפח גבוה. ב-100,000 הרצות ביום הפער לכל token מפסיק להיות שגיאת עיגול. זהו המבנה הרגיל של תהליכי עבודה של AI המחוברים ל-n8n.
- כל מקרה שבו מהירות התגובה חשובה למשתמש. Haiku 4.5 מדורג כמודל המהיר ביותר בסדרה.
מגבלה אחת שייכת ספציפית ל-Haiku. הפרומפט המינימלי הניתן לשמירה במטמון הוא 4,096 tokens, בהשוואה ל-1,024 ב-Opus 4.8 וב-Sonnet 5, ומתחת למינימום הזה "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". בלוק הוראות בן 1,500 tokens שנשמר במטמון ב-Sonnet 5 לא יישמר במטמון ב-Haiku 4.5 באופן שקט. הסימן המעיד על כך הוא ש-cache_creation_input_tokens ו-cache_read_input_tokens שניהם נותרים על אפס, מה שמכוסה ב-הורדת עלויות של סוכן פעיל תמיד לצד שאר הדרכים לאבד מטמון.
המנופים שמשנים את התשובה
כל אחד מאלה מזיז חשבון רחוק יותר ממה ששם המודל עושה.
מאמץ. output_config.effort שולט בכמות העבודה שהמודל מבצע לפני שהוא עונה. הרמות הן low, medium, high, xhigh ו-max, ו-high הוא ברירת המחדל: "Setting effort to high produces exactly the same behavior as omitting the effort parameter entirely." הוא מקונן בתוך output_config במקום לשבת ברמה העליונה של הבקשה:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)מאמץ נוגע בכל token בתגובה: "It can affect all token spend including tool calls. For example, lower effort would mean Claude makes fewer tool calls." ההשפעה הזו מצטברת בלולאה agentic. זהו אינו תקציב token: "Effort is a behavioral signal, not a strict token budget." Anthropic לא מפרסמת מכפיל עלות לכל רמה ומורה לך לבדוק את מקרה השימוש שלך, כך שהרצה של Sonnet 5 ב-high מול הרצה של Opus 4.8 ב-low היא השוואה אמיתית שאפשר להריץ היום אחר הצהריים. Haiku 4.5 נעדר מרשימת המודלים שתומכים במאמץ.
מטמון פרומפט. קריאה מהמטמון עולה 0.1x מתעריף הקלט הבסיסי, והמספר שמכריע בחירת מודל הוא מה הדבר הזה עושה בין רמות. פגיעה במטמון על Opus 4.8 עולה $0.50 / MTok, וקלט לא מטמון על Haiku 4.5 עולה $1 / MTok, כך שקידומת Opus מטומנת היטב זולה יותר לכל input token מאשר פרומפט Haiku קר. ניהול היגיינת סשנים מנצח את בחירת המודל בכל עומס עבודה ששולח מחדש קידומת גדולה ויציבה.
אצוות. אם שום דבר לא ממתין לתשובה, Message Batches API מריץ את אותם מודלים עם "a 50% discount on both input and output tokens". זה מחלק בשניים כל שורה בהשוואה שלמטה, וזה עובד בין רמות: עבודת אצווה של Opus 4.8 עולה פחות מעבודה סינכרונית של Sonnet 5 במחיר הסטנדרטי מ-1 September 2026, תוך ויתור על latency תמורת יכולת באותו תקציב.
השוואת עלות אחת מלאה
עומס העבודה: סיווג 100,000 הודעות תמיכה, קריאה אחת לכל הודעה, 2,000 טוקנים של קלט ו-300 טוקנים של פלט לכל קריאה. בסך הכל 200 MTok קלט ו-30 MTok פלט.
- Haiku 4.5: 200 x $1 = $200 קלט, 30 x $5 = $150 פלט. סה"כ $350.
- Sonnet 5, מחיר מבואי: 200 x $2 = $400 קלט, 30 x $10 = $300 פלט. סה"כ $700.
- Sonnet 5, החל מ-1 בספטמבר 2026: 200 x $3 = $600 קלט, 30 x $15 = $450 פלט. סה"כ $1,050.
- Opus 4.8: 200 x $5 = $1,000 קלט, 30 x $25 = $750 פלט. סה"כ $1,750.
החליפו ארבעה מספרים כדי לחשב מחדש עם מחירי מחר. ההתאמות להלן מזיזות את התוצאה יותר מששם הדגם עשה:
- עיבוד דחוס מוריד בחצי כל שורה: $175, $350, $525 ו-$875. שום דבר אינו ממתין לריצת סיוון לילית, לכן אין סיבה לדלג עליה.
- שמירת הקידומת המשותפת במטמון. נניח ש-1,200 מתוך 2,000 הטוקנים של הקלט הם אותו בלוק הוראות בכל פעם. ב-Sonnet 5 במחיר המבואי העלות שלהם היא $0.20 / MTok כפגיעות מטמון במקום $2 / MTok, כך ש-120 MTok עולים $24 במקום $240. הוסיפו 80 MTok של קלט חדש ב-$2, שהם $160, בתוספת $300 של פלט, ו-Sonnet 5 מגיע לכ-$484 במקום $700. אותה שיטה אינה עושה דבר ב-Haiku 4.5, משום ש-1,200 טוקנים הם מתחת למינימום של 4,096 טוקנים שלו.
- ניסיונות חוזרים. נניח שאתם דוחים את תשובת Haiku ב-8% מההודעות ומריצים אותן מחדש ב-Opus 4.8. הוסיפו 0.08 x $1,750 = $140 ל-$350, ומקבלים $490. מדדו את שיעור הדחייה שלכם במקום להסתמך על שלי.
- הגדרות כלים, אם המשימה משתמשת בהן. בקטע המערכת שהן מייצרות יש 290 טוקנים ב-Opus 4.8 כאשר
tool_choiceמוגדר ל-auto, 354 ב-Sonnet 5 ו-496 ב-Haiku 4.5. הדגם הזול ביותר נושא בתקורה הקבועה הגדולה ביותר.
-Haiku עם נתיב הסלמה ב-$490 ו-Sonnet 5 עם מטמון ב-$484 עולים אותו דבר, ואחד מהם מבצע את המשימה במעבר אחד. הדגם מעולם לא היה השאלה כולה.
האם החלפת מודל באמצע סשן חוסכת כסף?
לעתים רחוקות יותר ממה שהמחירון מרמז, כיוון שהחיסכון הוא לפי token ומה שנחשף לסיכון הוא כל ה-cached prefix.
Anthropic מתעדים מה מבטל את המטמון. ה-prefixes נבנים בסדר tools, ואז system, ואז messages, ו-"שינויים בכל רמה מבטלים את אותה רמה ואת כל הרמות שאחריה." שני הגדרות בקשה נמצאות גם הן ברשימה: "הגדרת ה-thinking וה-effort level שנפתרו מוטמעים ב-prompt עצמו, כך ששינוי של כל אחד מהם מתחיל cached prefix חדש." לגבי effort התיעוד מרחיק לכת: "שנה את ה-effort בין עומסי עבודה שונים ולא בתוך שיחה שמסתמכת על cache hits".
המודל לא נמצא ברשימה המתועדת הזו, לכן אל תניח הנחות לכאן או לכאן. קרא את cache_read_input_tokens בבקשה הראשונה אחרי החלפה ותן למספר לענות. על Opus 4.8 prefix בן 150,000 tokens, קריאה מהמטמון עולה כ-$0.08 וכתיבה חדשה כ-$0.94, שזה יותר ממספר תורות של הפער לפי token שעקבת אחריו.
לכן שנה את הדברים האלה בין משימות, לא בתוך משימה אחת. ב-Claude Code זה אומר /clear קודם, כשהמטמון מבוטל ממילא, ואז /model או /effort.
כיצד לבדוק את התשובה על עומס העבודה שלך
אל תקבע את גודל ה-prompt לפי מספר שנספר במודל אחר. נקודת הקצה לספירת טוקנים בחינם, והיא סופרת באמצעות ה-tokenizer של המודל שתציין, לכן ציין את המודל שברצונך לקרוא לו. Opus 4.7 ואילך, Fable 5 ו-Sonnet 5 משתמשים ב-tokenizer חדש יותר ש"מייצר בערך 30% יותר טוקנים לאותו טקסט", כך שתקציב שנמדד במודל ישן יותר ייראה נמוך במודל חדש יותר, במחיר לטוקן שלא השתנה.
לאחר מכן קרא את מה שחזר. input_tokens הוא רק השארית שלא נשמרה במטמון, כך שגודל ה-prompt האמיתי הוא שדה זה בתוספת cache_creation_input_tokens ובתוספת cache_read_input_tokens. אפליקציית Claude API ראשונה על VPS היא המקום הקטן והכן ביותר להריץ בו מדידה זו, ו-איזה תוכנית Claude מתאימה לשימוש שלך היא ההחלטה הנפרדת האם לשלם לפי טוקן כלל.
FAQ
איזה מודל Claude מתאים ביותר לתכנות?
Claude Opus 4.8 הוא נקודת ההתחלה המתועדת לתכנות סוכני מורכב, במחיר של $5 למיליון טוקני קלט ו־$25 למיליון טוקני פלט נכון ליולי 2026. Claude Sonnet 5 ממוצב כשילוב הטוב ביותר של מהירות ואינטליגנציה, ובמחיר של $2 / $10 עד 31 August 2026 הוא עולה פחות ממחצית. הריצו את אותה משימה על שניהם, השאירו את הגדרת החשיבה קבועה, והשוו את סך הוצאת הטוקנים מתוך response.usage.
האם Claude Haiku 4.5 זול מספיק כדי להחליף את Sonnet 5?
לפי טוקן, בקלות: $1 / $5 מול $2 / $10 ל־Sonnet 5 במחירון ההיכרות, או $3 / $15 החל מ־1 September 2026. המגבלות הן שקובעות. ל־Haiku 4.5 יש חלון הקשר של 200K טוקנים במקום 1M, פלט מרבי של 64K ב־Messages API הסינכרוני, תאריך קיצוב ידע אמין של February 2025, אין תמיכה ב־output_config.effort, ובקשה מטמינה מינימלית של 4,096 טוקנים שמשביתה בשקט את המטמון על system prompts קצרים.
האם מעבר למודל Claude זול יותר באמצע סשן חוסך כסף?
פחות ממה שנראה. Anthropic מתעדת את מבטלי המטמון כשינויים בקידומת tools, system או messages, שינויים בהגדרת החשיבה, ושינויים ב־output_config.effort. מה שמעבר מודל עושה למטמון קיים אינו מתועד, לכן יש להתייחס אליו כבלתי ידוע ולקרוא את cache_read_input_tokens בבקשה הראשונה לאחר מכן. הסכום כדאי להכיר: על קידומת של 150,000 טוקנים ב־Opus 4.8 קריאת מטמון עולה כ־$0.08 וכתיבה חדשה כ־$0.94, מה שעולה על חיסכון הטוקנים לכמה תורות. יש לעבור בין משימות, לאחר /clear ב־Claude Code, כשהמטמון נזרק בכל מקרה.
מה output_config.effort עושה לחשבון שלי?
הוא משנה כמה טוקנים המודל מוציא על טקסט, קריאות כלים וחשיבה. מאמץ נמוך יותר מייצר פחות קריאות כלים, מה שמצטבר בלולאות סוכניות כי כל תוצאת כלי נשלחת מחדש בתורות מאוחרים יותר. הרמות הן low, medium, high, xhigh ו־max, כאשר high היא ברירת המחדל. Anthropic אינה מפרסמת מכפיל עלות לכל רמה, ומכנה את המאמץ אות התנהגות ולא תקציב טוקנים, לכן יש למדוד אותו על המשימה שלכם.
כמה Claude Batches API חוסך?
50% על טוקני קלט ופלט כאחד, בתמורה למסירה אסינכרונית. נכון ליולי 2026 זה מעמיד את Opus 4.8 על $2.50 קלט / $12.50 פלט, את Sonnet 5 על $1 / $5 במחירון ההיכרות, ואת Haiku 4.5 על $0.50 / $2.50. ההשוואה שכדאי לשים לב אליה עוברת בין רמות: משימת Opus 4.8 במצב batch עולה פחות ממשימת Sonnet 5 סינכרונית בתעריף הסטנדרטי החל מ־1 September 2026, כך שמצב batch קונה מודל חזק יותר באותו כסף.