SSD Nodes Learn Hosting plans →
מדריכים Matt Connorמאת Matt Connor · עודכן 2026-08-31

כמה עולים מיליון טוקנים ב-Claude? מדריך תמחור

רוצים לדעת כמה תשלמו על מיליון טוקנים ב-Claude? המדריך מסביר את ההבדל בין עלויות קלט לפלט, מציג את החישוב המדויק לכל מודל ומסייע להעריך את החשבונית החודשית שלכם ב-API.

כמה עולים מיליון טוקנים ב-Claude?

מיליון טוקנים (1M tokens) הם יחידת המידה שעל פיה נקבע התמחור של כל ממשק תכנות יישומים (API) של Claude. אין מחיר אחיד למיליון טוקנים, כיוון שקלט ופלט מתומחרים בתעריפים שונים, ולכל מודל יש זוג תעריפים משלו. נכון לאוגוסט 2026, עלות של מיליון טוקני קלט היא $1 ב-Claude Haiku 4.5, $2 ב-Claude Sonnet 5, ו-$5 ב-Claude Opus 5.

הפלט הוא החלק היקר יותר. בכל המודלים הנוכחיים, תעריף הפלט גבוה פי חמישה מתעריף הקלט, ולכן היחס בין השניים משפיע על החשבונית הסופית יותר מאשר הנתון הכללי. יישום ששולח מסמכים ארוכים ומקבל תשובות קצרות מתנהג באופן שונה מאוד מיישום שכותב תשובות ארוכות על סמך הנחיה (prompt) קצרה.

דף זה עוסק בכלכלה של יחידות המידה: מהי העלות של טוקן וכיצד להעריך את החשבונית לפני הפיתוח. למידע על המקום שאליו הטוקנים הולכים בפועל במהלך העבודה, קראו את לאן הולכים הטוקנים בתוך סשן של Claude Code.

איך נראה נפח של 1M טוקנים

טוקן הוא מקטע טקסט שהמודל קורא או כותב. ההערכה הגסה של Anthropic היא טוקן אחד לכל 4 תווים, או כ-0.75 מילים באנגלית. לכן, מיליון טוקנים הם כ-750,000 מילים, או בערך 4 MB של טקסט פשוט.

הערכות שפורסמו עבור קלטים נפוצים מספקות תחושה טובה יותר לגבי קנה המידה.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

לפי קצבים אלו, 1M טוקנים הם בערך 400 דפי אינטרנט ממוצעים שנקראו פעם אחת, או שמונה מאמרים מחקריים באותו גודל. זהו מעבר אחד על בסיס קוד בגודל בינוני, או חודש של שימוש קל בצ'אט עבור אדם אחד.

התייחסו לכל אלו כאל הערכה בלבד. קוד, JSON וטקסט בשפות שאינן אנגלית דוחסים פחות מילים לתוך טוקן, כך שהיחס של 0.75 הוא הצד האופטימי. גורם נוסף משנה את הספירה: Claude Opus 4.7 ומעלה, הכוללים את Opus 5 ו-Sonnet 5, משתמשים ב-tokenizer חדש יותר שמייצר בערך 30 אחוז יותר טוקנים עבור אותו טקסט בהשוואה ל-Sonnet 4.6 ומטה. Claude Haiku 4.5 משתמש ב-tokenizer הישן. לכן, ספירה שמדדתם ב-Haiku 4.5 תהיה נמוכה מהספירה ב-Sonnet 5 עבור קלט זהה, מה שאומר שהשוואת מחיר ישירה למיליון טוקנים מעבר לגבול הזה אינה הוגנת. בצעו ספירה של אותו prompt מול שני המודלים לפני שתחליטו.

מהן עלויות השימוש ב-Claude למיליון טוקנים

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

עבור Claude Sonnet 5 חל תמחור היכרות של $2 עבור קלט ו-$10 עבור פלט עד ה-31 באוגוסט 2026. החל מה-1 בספטמבר 2026 יחול התעריף הסטנדרטי: $3 עבור קלט ו-$15 עבור פלט. התעריף של Claude Opus 5 עומד על $5 לקלט ו-$25 לפלט. מודל אחד נמצא מחוץ לטבלה זו לחלוטין: Claude Fable 5 מתומחר ב-$10 לקלט ו-$50 לפלט, לכן השאלה האם תעריפים אלו משתלמים תלויה במשימות שעבורן תבחרו להשתמש בו.

התעריפים משתנים. התייחסו לכל נתון בדף זה כאל דוגמה מחושבת נכון לאוגוסט 2026, וודאו את המספרים העדכניים ב-דף התמחור הרשמי לפני אישור תקציב.

תעריפים אלו מציינים מה העלות של Claude, אך לא אם הוא האופציה הזולה ביותר עבור עומס העבודה שלכם. המאמר השוואת עלויות של שלוש משימות ב-Claude וב-ChatGPT מציג באילו מקרים כל API משתלם יותר.

אורך ההקשר (context length) אינו משנה את התעריף. ב-Claude 4.6 ובגרסאות מאוחרות יותר, מלוא חלון ההקשר של 1M טוקנים מחויב לפי התמחור הסטנדרטי; לכן, בקשה של 900,000 טוקנים עולה לכל טוקן בדיוק כמו בקשה של 9,000 טוקנים. prompt ארוך עולה יותר פשוט כי הוא מכיל יותר טוקנים, ולא חל עליו תעריף נפרד עבור הקשר ארוך.

החישוב האריתמטי ששורד שינוי מחיר

כל חשבונית מורכבת משתי פעולות כפל ופעולת חיבור אחת.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

כך זה נראה כקוד שניתן להריץ:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

הקוד מדפיס 0.0126. בקשה השולחת 4,300 אסימוני קלט (input tokens) ומקבלת בחזרה 400 אסימוני פלט (output tokens) עולה כ-1.3 סנט ב-Sonnet 5. שמרו את שני התעריפים במקום אחד בקוד שלכם. כאשר המחיר משתנה, עליכם לערוך שתי שורות בלבד, וכל הערכת עלות במערכת שלכם תתעדכן בהתאם.

הערכת עלויות עבור יישום אמיתי

נניח שקיים עוזר תמיכה. ה-system prompt והתיעוד הטכני של המוצר תופסים 4,000 טוקנים, והם נשלחים בכל בקשה, כיוון ש-Messages API הוא חסר מצב (stateless) והמודל אינו זוכר דבר בין קריאות. שאלת משתמש מוסיפה כ-300 טוקנים. תשובה אורכת כ-400 טוקנים. אלו הם 4,300 טוקנים של קלט ו-400 טוקנים של פלט לכל בקשה.

מיליון טוקני קלט מספיקים לכ-232 בקשות במבנה זה. בנפח של 1,000 בקשות ביום, היישום צורך 4.3 מיליון טוקני קלט מדי יום, כך ש-"1M tokens" מספיקים לפחות משש שעות של תעבורה.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

בשימוש ב-Claude Opus 5, תעבורה זו עולה $31.50 לכל 1,000 בקשות. ב-Sonnet 5 העלות היא $12.60. מעבר ל-Claude Haiku 4.5 מוריד את העלות ל-$6.30, ושימוש ב-prompt cache פעיל ב-Sonnet 5 מוריד את העלות עוד יותר ל-$5.40.

נכפיל ב-30 כדי לקבל עלות חודשית עבור תעבורה זו. העלות של Sonnet 5 לפי מחירון היא כ-$378 לחודש. אותו יישום עם cache פעיל יעלה כ-$162. בחירת המודל והחלטת ה-caching משפיעות על העלות יותר מכל תעריף שתנהלו בנפח זה. השאלה איזה מודל להריץ היא נושא בפני עצמו, והמודל הזול ביותר שעובר את הבדיקות שלכם הוא המנצח: בחירה בין Opus, Sonnet ו-Haiku מסביר כיצד לבצע בדיקה זו כראוי.

מטמון הנחיות (Prompt caching) מצמצם את החלק החוזר

אותו תחילית (prefix) של 4,000 אסימונים (tokens) זהה בכל בקשה, ואתם משלמים עליה מחיר קלט מלא בכל פעם. מטמון הנחיות שומר את התחילית המעובדת ומחייב בתעריף מופחת עבור שימוש חוזר בה.

קריאה מהמטמון עולה פי 0.1 מתעריף הקלט הבסיסי. כתיבה למטמון עולה פי 1.25 מהבסיס עבור זמן חיים של 5 דקות, או פי 2 מהבסיס עבור זמן חיים של שעה. לכן, המטמון ל-5 דקות מחזיר את עלותו כבר לאחר קריאה אחת, שכן הכתיבה עולה 0.25 נוספים בעוד כל קריאה חוסכת 0.9. המטמון לשעה זקוק לשתי קריאות כדי להגיע לנקודת איזון.

הדרך הפשוטה ביותר להפעיל זאת היא באמצעות שדה יחיד ברמה העליונה:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

לאחר מכן, קראו את בלוק ה-usage שחוזר:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

שלושת מוני הקלט הללו מחויבים בתעריפים שונים והסכום שלהם הוא נפח הקלט האמיתי שלכם: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. הערכת עלות שקוראת רק את input_tokens תהיה שגויה משמעותית ברגע שהמטמון פעיל.

שני גורמים מונעים מהמטמון להיות משתלם, ושניהם נכשלים ללא התרעה:

התחילית חייבת להיות זהה ברמת הבייט. חיפוש במטמון הוא התאמת תחילית, לכן חותמת זמן או שם המשתמש בראש הנחיית המערכת שלכם משנים אותה בכל בקשה. במקרה כזה תשלמו פי 1.25 מהקלט הבסיסי בכל פעם ולא תקראו מהמטמון אף פעם. הסימפטום לכך הוא ש-cache_creation_input_tokens נשאר גבוה בעוד cache_read_input_tokens נשאר 0. מקמו את cache_control בבלוק האחרון שהתוכן שלו זהה בין בקשות, ושימו את כל מה שמשתנה אחריו. שינוי הגדרות ה-tools שלכם מבטל את כל המטמון שמתחתיהן, כיוון שהביטול מתבצע לפי סדר: כלים, לאחר מכן מערכת, ולבסוף הודעות.

התחילית חייבת להיות ארוכה מספיק. האורך המינימלי שניתן לשמירה במטמון הוא 512 אסימונים ב-Opus 5, 1,024 ב-Sonnet 5 ו-4,096 ב-Haiku 4.5. הנחיה קצרה יותר לא נשמרת במטמון ולא מוחזרת שגיאה. תחילית של 4,000 אסימונים בדוגמה לעיל נשמרת במטמון ב-Sonnet 5 אך לא ב-Haiku 4.5, כיוון ש-4,000 נמוך מהרף של מודל זה. כאשר שני המונים מציגים 0, שום דבר לא נשמר במטמון.

עיבוד אצווה (Batch) מקצץ את התעריף בחצי

ה־Batch API מעבד בקשות באופן אסינכרוני בהנחה של 50 אחוז על עלויות הקלט והפלט כאחד. בדוגמה לעיל, הדבר הופך $12.60 לכל 1,000 בקשות ל-$6.30. ההנחה מצטברת עם prompt caching, כך שעבודת אצווה עם מטמון היא הדרך הזולה ביותר לביצוע עבודה בהיקף גדול.

הוויתור הוא על זמן תגובה (latency), מה שהופך את עיבוד האצווה ללא מתאים לכל תהליך שבו משתמש ממתין לתוצאה. הוא מתאים למשימות כמו סיווג לילי או השלמת נתונים (backfills) למסמכים.

מדוע עלויות הצ'אט גדלות בתוך שיחה אחת

מכיוון שה-API אינו שומר מצב (state), הלקוח שלכם שולח מחדש את כל היסטוריית השיחה בכל פנייה. לכן, צריכת ה-tokens בתוך שיחה אחת גדלה לפי ריבוע האורך שלה, ולא בקו ישר.

נניח שכל פנייה ממוצעת היא בת 500 tokens. פנייה 1 שולחת 500 tokens של קלט. פנייה 2 שולחת 1,000. פנייה 20 שולחת 10,000. אם נסכם זאת לפי הנוסחה n(n+1)/2, שיחה בת 20 פניות שלחה כ-105,000 tokens של קלט, בעוד שהתמליל עצמו באורך של 10,000 tokens בלבד.

זו הסיבה שתכונת צ'אט עולה יותר ממה שהתמליל מרמז, וזו הסיבה ששמירה ב-cache של הקידומת היציבה או סיכום פניות ישנות משתלמים בשרשורים ארוכים. סוכן (agent) שמבצע לולאות של קריאות לכלים (tool calls) סובל מאותה בעיה, ואף גרוע מכך: כל תוצאה של כלי נשארת בהיסטוריה ונשלחת מחדש בכל פנייה עוקבת. הגדרת מגבלת הוצאות קשיחה על סוכן שאתם מריצים בעצמכם היא קריטית במקרה זה, כיוון שהגידול הזה הוא אוטומטי ואף אחד לא מנטר אותו.

ספירת אסימונים לפני ביצוע הערכה

הפסיקו להסיק את מספר האסימונים (tokens) מתוך ספירת מילים. ה-API סופר אותם עבורכם, ללא עלות, במכסת קצב (rate limit) נפרדת מזו של יצירת הודעות.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

התגובה מכילה שדה אחד:

{ "input_tokens": 14 }

הזינו לתוכו את ה-system prompt ואת הגדרות ה-tools שלכם, בצירוף הודעת משתמש מייצגת, ולאחר מכן הזינו את המספר בפונקציית העלות שלעיל. ה-endpoint מקבל את אותו גוף הודעה כמו בקשת הודעה רגילה, כך שגם תמונות וקבצי PDF נספרים כראוי. יש לשים לב לשתי הסתייגויות. הספירה היא הערכה ועשויה להיות שונה במעט מהנתון לחיוב. כמו כן, הספירה מתבצעת באמצעות ה-tokenizer של המודל שאתם מעבירים, לכן הקפידו להעביר את המודל שבו תשתמשו בפועל.

לא ניתן לספור אסימוני פלט מראש, כיוון שהם עדיין לא קיימים. הגבילו אותם באמצעות max_tokens, ולאחר מכן מדדו את ההתפלגות האמיתית מתוך usage.output_tokens על תעבורה חיה.

מה עוד נכלל בחשבונית

אסימונים (tokens) מהווים את רוב החשבונית. כמה פריטים אינם אסימונים, והם נוטים להפתיע משתמשים.

  • הגדרות כלים הופכות לאסימוני קלט בכל בקשה. הנחיית המערכת (system prompt) לשימוש בכלים לבדה מוסיפה בין 286 ל-406 אסימונים ב-Opus 5, עוד לפני הוספת הסכימות שלכם. עשרה תיאורי כלים מפורטים יכולים להכפיל נפח של הנחיה קטנה.
  • חיפוש באינטרנט מחויב ב-$10 לכל 1,000 חיפושים, בנוסף לאסימונים שהתוצאות צורכות כאשר הן נכנסות להקשר (context).
  • שליפת דפי אינטרנט (Web fetch) אינה כרוכה בעמלה נוספת, אך הדף שנשלף הופך לאסימוני קלט. דף תיעוד בגודל 100 kB שווה בערך ל-25,000 אסימונים.
  • בקשה להסקה (inference) בארה"ב בלבד עם inference_geo ב-Claude 4.6 ומעלה מחילה מכפיל של 1.1 על כל קטגוריית אסימונים, כולל קריאות וכתיבות מהמטמון (cache).

השאלה האם ה-API הוא הרכישה הנכונה עבורכם תלויה בנפח השימוש שלכם. הגעה לתקרת שימוש בתוכנית מנוי היא בדרך כלל מה שמעורר את השאלה הזו, ו-הדרכים לעקיפת מגבלה נעות בין המתנה לסיום חלון הזמן לבין העברת העבודה לקריאות API לפי שימוש. מתחת לרמת שימוש מסוימת, תוכנית חודשית קבועה משתלמת יותר, ו-השוואת ה-API מול מנוי Claude מציגה את ההשוואה הזו עם מספרים אמיתיים.

FAQ

כמה עולה מיליון טוקנים ב-Claude?

העלות תלויה בדגם ובשאלה אם מדובר בטוקנים של קלט או פלט. נכון לאוגוסט 2026, מיליון טוקני קלט עולים $1 ב-Claude Haiku 4.5, $2 ב-Claude Sonnet 5 במסגרת תמחור היכרות, ו-$5 ב-Claude Opus 5. עלות הפלט גבוהה פי חמישה מעלות הקלט בכל אחד מהדגמים הללו. החל מה-1 בספטמבר 2026, המחיר ב-Sonnet 5 ישתנה ל-$3 עבור קלט ו-$15 עבור פלט. התעריפים משתנים, לכן יש לוודא אותם בדף התמחור הרשמי לפני שקובעים תקציב.

האם מיליון טוקנים שווים למיליון מילים?

לא. טוקן אחד הוא בערך 4 תווים באנגלית, או כ-0.75 מילה, כך שמיליון טוקנים הם בערך 750,000 מילים. יחס זה הוא הערכה בלבד. קוד, JSON ושפות שאינן אנגלית צורכים יותר טוקנים לכל מילה. Claude Opus 4.7 ומעלה משתמשים גם ב-tokenizer חדש יותר, המייצר כ-30 אחוז יותר טוקנים עבור אותו טקסט בהשוואה ל-Claude Sonnet 4.6 ומטה, לכן ספירת הטוקנים אינה ניתנת להשוואה בין דורות שונים של דגמים. יש לבצע מדידה באמצעות ה-endpoint החינמי /v1/messages/count_tokens, תוך העברת הדגם שבו אתם מתכננים להשתמש.

האם שמירה ב-cache של ה-prompt תמיד חוסכת כסף?

לא. כתיבה ל-cache למשך 5 דקות עולה פי 1.25 מתעריף הקלט הבסיסי, לכן קידומת שנכתבת אך לעולם אינה נקראת עולה 25 אחוז יותר מאשר שליחתה כטקסט רגיל. היא מחזירה את ההשקעה החל מהקריאה הראשונה. היא עלולה להיכשל בשתי דרכים, שתיהן ללא חיווי שגיאה. אם הקידומת השמורה משתנה בין בקשות, החיפוש לא ימצא התאמה, כיוון שמדובר בהתאמת קידומת מדויקת. אם הקידומת קצרה מהאורך המינימלי לשמירה ב-cache של הדגם (1,024 טוקנים ב-Sonnet 5 ו-4,096 ב-Haiku 4.5), דבר לא יישמר ולא תוחזר שגיאה. כאשר cache_creation_input_tokens ו-cache_read_input_tokens שניהם מציגים 0, ה-cache אינו מבצע דבר.

מדוע החשבון שלי גדל מהר יותר ממספר ההודעות?

מכיוון שכל השיחה נשלחת מחדש בכל תור. ה-Messages API אינו שומר מצב (stateless), לכן התור ה-20 בשיחה נושא עמו את כל 19 התורים הקודמים כקלט נוסף. כאשר ממוצע התורים הוא 500 טוקנים, שיחה של 20 תורים שולחת כ-105,000 טוקני קלט, בעוד שהתמליל עצמו מכיל רק 10,000 טוקנים. לולאות סוכנים (agent loops) מתנהגות באותו אופן, כיוון שכל תוצאה של כלי נשארת בהיסטוריה. מומלץ לשמור ב-cache את הקידומת הקבועה, או לסכם תורים ישנים ולהסיר אותם מהבקשה.