באיזה מודל Claude כדאי לבחור? מדריך עלויות מעודכן
מתלבטים בין Claude Opus 4.8, Sonnet 5 או Haiku 4.5? השוונו את תעריפי יולי 2026 למיליון טוקנים וחישבנו את העלות המדויקת עבור 100,000 הרצות כדי לחסוך לכם כסף ב-API.
באיזה מודל Claude כדאי להשתמש?
התשובה הקצרה לשאלה באיזה מודל Claude כדאי להשתמש היא: התחילו עם Claude Opus 4.8, ועברו ממנו רק אם יש לכם סיבה מוגדרת לכך. ההנחיה של Anthropic זהה: "אם אינכם בטוחים באיזה מודל להשתמש, התחילו עם Claude Opus 4.8 עבור עבודת תכנות מורכבת מבוססת סוכנים ועבור עבודה ארגונית". רדו ל-Claude Sonnet 5 כאשר המשימה מוגדרת היטב ואתם מריצים אותה פעמים רבות ביום. רדו ל-Claude Haiku 4.5 עבור עבודה מכנית ורחבת היקף שבה אתם כבר יודעים כיצד נראית תשובה נכונה. Claude Fable 5 ניצב מעל כולם, עבור סוכנים הפועלים לאורך זמן.
לבחירה יש מחיר. אלו התעריפים ב-Claude API (ממשק תכנות יישומים) נכון ל-23 ביולי 2026, לכל מיליון טוקנים, אשר מתועדים בתיעוד כ-MTok.
- Claude Fable 5 (
claude-fable-5): $10 ל-MTok נכנס, $50 ל-MTok יוצא. הקשר (context) של 1M. - Claude Opus 4.8 (
claude-opus-4-8): $5 נכנס, $25 יוצא. הקשר של 1M. - Claude Opus 4.7 (
claude-opus-4-7): $5 נכנס, $25 יוצא. הקשר של 1M. - Claude Sonnet 5 (
claude-sonnet-5): $2 נכנס, $10 יוצא לפי תמחור היכרות עד ה-31 באוגוסט 2026. התעריף הסטנדרטי של $3 נכנס, $15 יוצא ייכנס לתוקף ב-1 בספטמבר 2026. הקשר של 1M. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 נכנס, $5 יוצא. הקשר של 200K.
מזהים אלו מלאים כפי שהם כתובים. אין להוסיף להם דבר.
לגודל עצמו אין תוספת תשלום במודלים של 1M טוקנים: "בקשה בת 900k טוקנים מחויבת באותו תעריף לטוקן כמו בקשה בת 9k טוקנים." התעריפים האלה חלים גם מעבר ל־API, משום ש־Claude Enterprise מודד את השימוש לפי תעריפי ה־API בנוסף למחיר המושב, ולכן כל החישובים להלן זהים גם לצוות המשתמש בתוכנית מושבים. מנוי בתעריף קבוע משנה את אופן המדידה, אך לא את ההחלטה הזו, משום ש־בשתי הרמות של Claude Max כלולים אותם מודלים, וההבדל היחיד הוא היקף השימוש הזמין. בהמשך אותה מדרגה, התשלום החודשי של $20 עבור Claude Pro מקנה מכסת שימוש ולא תעריף לטוקן, ולכן מה שעוצר את השימוש הוא איפוס המכסה ולא חיוב. אם זהו המצב שלכם כרגע, בירור חלון הזמן שאתם ממתינים לו קודם לכל החישובים שלהלן, משום שהפתרון הוא מעבר למודל קטן יותר, להקשר קטן יותר או ל־API, ולא לתעריף זול יותר. ואם עדיין אינכם משלמים כלל, השאלה אם Claude Pro מצדיק את התשלום של $20 מלכתחילה נקבעת לפי התדירות שבה המכסה החינמית עוצרת אתכם, ולא לפי אחד מהתעריפים שלעיל.
למה מיועד כל מודל
Anthropic מתארת את סדרת המודלים שלה בשורה אחת לכל מודל, ותיאורים אלו מועילים יותר מכל טבלת דירוג.
- Claude Fable 5: "בינה מהדור הבא עבור סוכנים ארוכי-טווח." מדורג כאיטי ביותר מבין הארבעה מבחינת latency.
- Claude Opus 4.8: "עבור קידוד סוכן מורכב ועבודה ארגונית." latency בינוני.
- Claude Sonnet 5: "השילוב הטוב ביותר בין מהירות לבינה." מהיר.
- Claude Haiku 4.5: "המודל המהיר ביותר עם בינה קרובה לרמת החזית."
Fable 5 הוא היחיד מבין הארבעה שהשוואה זו לעולם אינה מתמחרת לפי עומס עבודה, ובמחיר כפול מזה של Opus 4.8, השאלה אילו משימות מצדיקות עלות של $10 בכניסה ו-$50 ביציאה ראויה לתשובה משל עצמה.
Haiku 4.5 כולל גם מגבלות שקובעות את התאמתו למשימה עוד לפני המחיר. חלון ההקשר שלו הוא 200K tokens במקום 1M, לכן מאגר קוד גדול או תמלול סוכן ארוך לא ייכנסו בו. הפלט המקסימלי שלו ב-Messages API הסינכרוני הוא 64K tokens לעומת 128K באחרים, ותאריך החיתוך של הידע המהימן שלו הוא פברואר 2025, בעוד השלושה האחרים עומדים על ינואר 2026.
מה העלות של הבחירה הזו בעומס עבודה אמיתי?
כל מודל בסדרה מתמחר פלט בפי חמישה מתעריף הקלט שלו. Opus 4.8 עולה 5$ לקלט ו-25$ לפלט. Haiku 4.5 עולה 1$ לקלט ו-5$ לפלט. היחס הזה נשמר לאורך כל הטווח, לכן המודל שתבחרו משמעותי ביותר בעבודות המייצרות כמות גדולה של פלט.
עבודה סוכנית (Agentic work) היא סוג כזה של עבודה, כיוון שאסימוני חשיבה (thinking tokens) מחויבים כאסימוני פלט ונספרים כחלק מ-max_tokens גם כאשר הטקסט לעולם אינו מגיע אליכם. ב-Fable 5, ב-Opus 4.8, ב-Opus 4.7 וב-Sonnet 5 סיכום החשיבה מושמט כברירת מחדל, ולכן השדה thinking חוזר ריק. החיוב נותר ללא שינוי: "כך או כך, הבלוק מחויב באותו אופן ומוחזר באותו אופן בשיחות מרובות סבבים." המאמר מה באמת מרכיב את חשבון האסימונים של Claude מפרק את המונה הזה במלואו.
השאלה האם החשיבה פועלת כלל משתנה בין המודלים שאתם משווים, מה שישבש בדיקת עלויות אם תפספסו זאת. ב-Sonnet 5 וב-Fable 5 החשיבה פעילה כברירת מחדל ואינה דורשת הגדרה. ב-Opus 4.8 וב-Opus 4.7 היא כבויה עד שתגדירו את thinking: {type: "adaptive"} בבקשה. התאימו את התצורה בשני הצדדים לפני שתסיקו מסקנות מהמספרים.
מדוע המודל הזול ביותר עלול להתברר כיקר ביותר
קחו משימת תכנות עצמאית. הבקשה כוללת 60,000 אסימונים (tokens) של הקשר, והמודל מפיק 8,000 אסימונים של פלט, כולל תהליך החשיבה. ללא שימוש ב-caching, החישוב נשאר גלוי.
במודל Opus 4.8: קלט של 0.06 מיליון אסימונים במחיר של $5 עולה $0.30, ופלט של 0.008 מיליון אסימונים במחיר של $25 עולה $0.20. הניסיון עולה $0.50. במודל Haiku 4.5 אותו ניסיון עולה $0.06 ועוד $0.04, כלומר $0.10.
מודל Haiku זול פי חמישה לכל ניסיון, מה שנראה כמרחב תמרון גדול עד שבוחנים מה קורה כשניסיון נכשל. אתם קוראים תשובה שגויה, מה שגוזל מזמנכם. אתם שולחים אותה מחדש כחלק מההקשר בניסיון הבא, כך שכל ניסיון הופך גדול מקודמו. וכאשר גם הניסיון השלישי נכשל, אתם ממילא מסלימים את המשימה למודל חזק יותר: $0.30 עבור Haiku ועוד $0.50 עבור Opus מסתכמים ב-$0.80, כלומר 60% יותר מאשר הרצת Opus פעם אחת.
לכן, שאלת המפתח היא באיזו זולות ניתן לבדוק את התשובה. כאשר תשובה שגויה ניכרת לעין תוך שנייה אחת, המודל הקטן הוא מציאה. כאשר זיהוי שגיאה דורש קריאה מדוקדקת של diff, המודל הקטן עולה לכם בזמן שלעולם לא יופיע בחשבונית.
מקרים שבהם מודל קטן עדיף באופן מוחלט
Haiku 4.5 הוא הבחירה הנכונה במקרים הבאים:
- עבודה של סוכן משנה (subagent) טכני. סוכן שתפקידו לשנות שמות קבצים או לאסוף פלטי חיפוש אינו זקוק ליכולות הסקה של מודל חזיתי. זהו הדפוס הסטנדרטי ברגע שאתם בונים סוכן AI עם Claude ומצמידים לו עוזרים.
- מיון לוגים (log triage). ההחלטה אם שורה מסוימת היא רעש או מידע שדורש תשומת לב אנושית היא שיפוט מצומצם עם דפוס כשל ברור.
- סיווג לפי קבוצת תוויות קבועה. הפלט קצר וניתן למדוד את רמת הדיוק על מדגם.
- קריאות בנפח גבוה בסביבת production. ב-100,000 הרצות ביום, הפער בעלות לכל token מפסיק להיות טעות עיגול. זהו המבנה המקובל של תהליכי עבודה של AI המחוברים ל-n8n.
- כל מקום שבו מהירות התגובה חשובה למשתמש. Haiku 4.5 מדורג כמודל המהיר ביותר בסדרה.
מגבלה אחת נוגעת ספציפית ל-Haiku. גודל ה-prompt המינימלי שניתן לשמירה ב-cache הוא 4,096 tokens, לעומת 1,024 ב-Opus 4.8 וב-Sonnet 5. מתחת למינימום זה, "כל בקשה לשמירה ב-cache של מספר tokens קטן מזה תעובד ללא שמירה, ולא תוחזר שגיאה". בלוק הוראות של 1,500 tokens שנשמר ב-cache ב-Sonnet 5, לא יישמר ב-cache ב-Haiku 4.5 ללא התראה. הסימן לכך הוא ש-cache_creation_input_tokens ו-cache_read_input_tokens שניהם עומדים על אפס, נושא ששמירה על עלויות של סוכן פעיל תמיד מכסה לצד דרכים אחרות לאובדן ה-cache.
המנופים שמשנים את התשובה
כל אחד מהגורמים הבאים משפיע על עלות החשבונית יותר מאשר שם המודל.
מאמץ (Effort). output_config.effort שולט בכמות העבודה שהמודל מבצע לפני שהוא משיב. הרמות הן low, medium, high, xhigh ו-max, כאשר high היא ברירת המחדל: "הגדרת effort ל-high מניבה בדיוק את אותה התנהגות כמו השמטת הפרמטר effort לחלוטין". הפרמטר מקונן בתוך output_config במקום להופיע ברמה העליונה של הבקשה:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)המאמץ משפיע על כל token בתגובה: "הוא יכול להשפיע על כל צריכת ה-tokens, כולל קריאות לכלים. לדוגמה, מאמץ נמוך יותר יגרום ל-Claude לבצע פחות קריאות לכלים". השפעה זו מצטברת בלולאות סוכנים (agentic loops). זה אינו מכסה (cap) על כמות ה-tokens: "מאמץ הוא אות התנהגותי, לא תקציב tokens קשיח". חברת Anthropic אינה מפרסמת מכפיל עלות לכל רמה וממליצה לבדוק את מקרה הבוחן שלכם; לכן, הרצת Sonnet 5 ברמת high מול הרצת Opus 4.8 ברמת low היא השוואה ממשית שניתן לבצע עוד היום. Haiku 4.5 אינו מופיע ברשימת המודלים התומכים במאמץ.
מטמון הנחיות (Prompt caching). קריאה מהמטמון עולה 0.1x מתעריף הקלט הבסיסי, והמספר שקובע את בחירת המודל הוא ההשפעה של נתון זה על פני שכבות התמחור. פגיעה במטמון (cache hit) ב-Opus 4.8 עולה $0.50 ל-MTok, בעוד שקלט ללא מטמון ב-Haiku 4.5 עולה $1 ל-MTok; לכן, קידומת Opus השמורה היטב במטמון זולה יותר לכל token קלט מאשר הנחיה (prompt) "קרה" ב-Haiku. היגיינת סשנים עדיפה על בחירת מודל בכל עומס עבודה ששולח מחדש קידומת גדולה ויציבה.
אצוות (Batches). אם אין צורך בהמתנה מיידית לתשובה, ה-API של Message Batches מריץ את אותם מודלים עם "הנחה של 50% על tokens של קלט ופלט כאחד". הדבר חוצה לשניים כל שורה בטבלת ההשוואה להלן, והוא עובד על פני כל שכבות התמחור: משימת Opus 4.8 באצווה עולה פחות ממשימת Sonnet 5 סינכרונית במחיר הרגיל החל מ-1 בספטמבר 2026, ובכך מאפשרת להמיר זמן תגובה (latency) ביכולת עיבוד באותו מחיר.
השוואת עלויות עבודה
העומס: סיווג של 100,000 הודעות תמיכה, קריאה אחת לכל הודעה, 2,000 טוקנים של קלט ו-300 טוקנים של פלט לכל קריאה. מדובר ב-200 MTok של קלט ו-30 MTok של פלט.
- Haiku 4.5: 200 x $1 = $200 קלט, 30 x $5 = $150 פלט. סה"כ $350.
- Sonnet 5, תעריף היכרות: 200 x $2 = $400 קלט, 30 x $10 = $300 פלט. סה"כ $700.
- Sonnet 5, החל מ-1 בספטמבר 2026: 200 x $3 = $600 קלט, 30 x $15 = $450 פלט. סה"כ $1,050.
- Opus 4.8: 200 x $5 = $1,000 קלט, 30 x $25 = $750 פלט. סה"כ $1,750.
החליפו ארבעה מספרים כדי לחשב מחדש לפי המחירים של מחר. ההתאמות להלן משפיעות על התוצאה יותר מאשר שם המודל:
- שימוש ב-Batching מקצץ כל שורה בחצי: $175, $350, $525 ו-$875. מאחר שאין תלות בזמן לביצוע סיווג לילי, אין סיבה לוותר על כך.
- שמירה ב-Cache של הקידומת המשותפת. נניח ש-1,200 מתוך 2,000 טוקני הקלט הם בלוק הוראות זהה בכל פעם. ב-Sonnet 5 בתעריף היכרות, עלותם היא $0.20 ל-MTok כפגיעות Cache במקום $2 ל-MTok, כך ש-120 MTok עולים $24 במקום $240. הוסיפו 80 MTok של קלט חדש ב-$2, שהם $160, בתוספת $300 עבור הפלט, ו-Sonnet 5 מגיע לאזור ה-$484 במקום $700. אותו טריק לא משפיע על Haiku 4.5, כיוון ש-1,200 טוקנים הם מתחת לרף המינימום שלו העומד על 4,096 טוקנים.
- ניסיונות חוזרים (Retries). נניח שאתם דוחים את התשובה של Haiku ב-8% מההודעות ומריצים אותן מחדש על Opus 4.8. הוסיפו 0.08 x $1,750 = $140 ל-$350, וקבלו $490. מדדו את שיעור הדחייה שלכם במקום להסתמך על הנתונים שלי.
- הגדרות כלים (Tool definitions), אם העבודה משתמשת בהם. ה-system prompt שהם מייצרים הוא באורך 290 טוקנים ב-Opus 4.8 כאשר
tool_choiceמוגדר ל-auto, 354 ב-Sonnet 5 ו-496 ב-Haiku 4.5. המודל הזול ביותר נושא בעלויות הקבועות הגבוהות ביותר.
Haiku עם מסלול הסלמה בעלות $490 ו-Sonnet 5 עם Cache בעלות $484 עולים אותו דבר, ואחד מהם מבצע את העבודה במעבר יחיד. המודל מעולם לא היה השאלה היחידה.
האם החלפת מודלים במהלך סשן חוסכת כסף?
פחות ממה שמרמזים המחירים הנקובים, כיוון שהחיסכון הוא לכל token, בעוד מה שאתם מסכנים הוא prefix שלם שנמצא ב-cache.
Anthropic מתעדת מה מבטל cache. ה-prefixes נבנים לפי הסדר tools, לאחר מכן system, ולבסוף messages, ו"שינויים בכל רמה מבטלים את אותה רמה ואת כל הרמות הבאות אחריה". שתי הגדרות בקשה נמצאות גם הן ברשימה זו: "הגדרת ה-thinking ורמת ה-effort המפוענחת מרונדרים לתוך ה-prompt עצמו, לכן שינוי של כל אחד מהם מתחיל prefix חדש ב-cache". בנוגע ל-effort, התיעוד מרחיק לכת: "שנו את ה-effort בין עומסי עבודה שונים במקום בתוך שיחה המסתמכת על פגיעות ב-cache".
המודל אינו מופיע ברשימה מתועדת זו, לכן אל תניחו דבר לכאן או לכאן. קראו את cache_read_input_tokens בבקשה הראשונה לאחר החלפה ותנו למספרים להשיב. ב-prefix של 150,000 tokens מסוג Opus 4.8, קריאת cache עולה כ-0.08$, בעוד כתיבה חדשה עולה כ-0.94$, שזה יותר מכמה סבבים של הפרש ה-token שחיפשתם.
לכן, בצעו שינויים כאלה בין משימות, לא בתוך משימה אחת. ב-Claude Code המשמעות היא /clear תחילה, כאשר ה-cache ממילא מושלך, ורק אז /model או /effort. שניהם מוקלדים ב-CLI, לכן אם אתם עובדים על Linux, ההתקנה שכדאי להחזיק היא זו של הטרמינל, שכן מה ש-Anthropic מפיצה באופן טבעי עבור Linux משדך CLI יציב לאפליקציית שולחן עבודה שעדיין נמצאת ב-beta. האם ההחלפה תופיע בחשבונית תלוי באופן שבו אתם משלמים על אותו סשן, שכן Claude Code פועל או על תוכנית חודשית קבועה או על בסיס קרדיטים של API לפי token ורק באפשרות השנייה שינוי מודל מתומחר בדולרים.
כיצד לבדוק את התשובה על עומס העבודה שלך
אל תגדיר גודל של prompt לפי ספירה שנלקחה ממודל אחר. נקודת הקצה (endpoint) לספירת טוקנים היא חינמית לשימוש ומבצעת את הספירה לפי ה-tokenizer של המודל שתציין, לכן ציין את המודל שאתה מתכנן להפעיל. נקודת קצה זו היא אחד החלקים הבודדים בפלטפורמה שלעולם אינם מחויבים בתשלום, וכדאי לבדוק מה עוד ניתן להריץ ללא עלות לפני שאתה מוציא קרדיט אמיתי על השוואה. Opus 4.7 ומעלה, Fable 5 ו-Sonnet 5 משתמשים ב-tokenizer חדש ש"מייצר כ-30% יותר טוקנים עבור אותו טקסט", לכן תקציב שנמדד לפי מודל ישן ייראה נמוך מדי במודל חדש, גם אם התעריף לטוקן נותר ללא שינוי.
לאחר מכן, קרא את מה שהתקבל בחזרה. input_tokens הוא רק השארית שלא אוחסנה ב-cache, לכן גודל ה-prompt האמיתי הוא שדה זה בתוספת cache_creation_input_tokens ובתוספת cache_read_input_tokens. אפליקציית Claude API ראשונה על גבי VPS היא המקום הקטן והאמין ביותר לבצע בו את המדידה הזו, ו-איזו תוכנית Claude מתאימה לשימוש שלך היא ההחלטה הנפרדת בשאלה האם בכלל לשלם לפי טוקן. אם מתברר שמדובר בשאלה של איזה מנוי להחזיק ולא האם להחזיק מנוי כלל, השוואת התמחור של שכבות Claude מול ChatGPT מפרטת כמה עולה אותה עבודת תכנות אצל ספק אחר. אם המדידה מעבירה את העבודה שלך ל-API לצמיתות, הורדת המנוי לשכבה נמוכה יותר או ביטולו לחלוטין עדיין מותירה אותך עם התקופה שכבר שילמת עליה, כך שאין קנס על קבלת החלטה לאחר שהמספרים בידיך.
FAQ
איזה מודל Claude הוא הטוב ביותר עבור תכנות?
Claude Opus 4.8 הוא נקודת ההתחלה המתועדת עבור תכנות סוכני מורכב, בעלות של $5 למיליון טוקנים של קלט ו-$25 למיליון טוקנים של פלט נכון ליולי 2026. Claude Sonnet 5 ממוצב כשילוב הטוב ביותר בין מהירות לאינטליגנציה, ובעלות של $2 / $10 עד ה-31 באוגוסט 2026 הוא עולה פחות מחצי. הריצו את אותה משימה על שניהם, שמרו על תצורת ה-thinking קבועה, והשוו את סך הוצאות הטוקנים מתוך response.usage.
האם Claude Haiku 4.5 זול מספיק כדי להחליף את Sonnet 5?
לפי טוקן, בקלות: $1 / $5 לעומת $2 / $10 עבור Sonnet 5 במחירי השקה, או $3 / $15 החל מה-1 בספטמבר 2026. המגבלות הן שקובעות. ל-Haiku 4.5 יש חלון הקשר של 200K טוקנים במקום 1M, פלט מרבי של 64K ב-Messages API סינכרוני, תאריך ניתוק ידע מהימן של פברואר 2025, ללא תמיכה ב-output_config.effort, ומינימום של 4,096 טוקנים להודעה ניתנת לשמירה במטמון (cacheable prompt), מה שמנטרל בשקט את ה-caching בהודעות מערכת קצרות.
האם מעבר למודל Claude זול יותר באמצע סשן חוסך כסף?
פחות ממה שזה נראה. Anthropic מתעדת את הגורמים לביטול ה-cache כשינויים ב-tools, ב-system או בקידומת messages, שינויים בתצורת ה-thinking, ושינויים ב-output_config.effort. מה מעבר מודל עושה ל-cache קיים אינו מתועד, לכן יש להתייחס לכך כאל נעלם ולקרוא את cache_read_input_tokens בבקשה הראשונה שלאחר מכן. כדאי לדעת מה עומד על הפרק: על קידומת של 150,000 טוקנים ב-Opus 4.8, קריאת cache עולה כ-$0.08 וכתיבה חדשה עולה כ-$0.94, מה שעולה על החיסכון של כמה סבבים לפי טוקן. בצעו מעבר בין משימות, לאחר /clear ב-Claude Code, כאשר ה-cache ממילא נזרק.
מה עושה output_config.effort לחשבונית שלי?
זה משנה כמה טוקנים המודל מוציא על טקסט, קריאות לכלים ו-thinking. מאמץ נמוך יותר גורם לפחות קריאות לכלים, מה שמצטבר בלולאות סוכניות מכיוון שכל תוצאה של כלי נשלחת מחדש בסבבים מאוחרים יותר. הרמות הן low, medium, high, xhigh ו-max, כאשר high היא ברירת המחדל. Anthropic אינה מפרסמת מכפיל עלות לכל רמה, ומגדירה את ה-effort כאות התנהגותי ולא כתקציב טוקנים, לכן מדדו זאת על המשימה שלכם.
כמה חוסך ה-Claude Batches API?
50% על טוקנים של קלט ופלט כאחד, בתמורה למסירה אסינכרונית. נכון ליולי 2026, זה מעמיד את Opus 4.8 על $2.50 בכניסה / $12.50 ביציאה, את Sonnet 5 על $1 / $5 במחירי השקה, ואת Haiku 4.5 על $0.50 / $2.50. ההשוואה שכדאי לשים לב אליה חוצה שכבות: משימת Opus 4.8 ב-batch עולה פחות ממשימת Sonnet 5 סינכרונית בתעריף הרגיל החל מה-1 בספטמבר 2026, כך ש-batching קונה מודל חזק יותר באותו מחיר.