SSD Nodes Learn Hosting plans →
Anleitungen Matt ConnorVon Matt Connor · Aktualisiert 2026-08-25

Claude: Warum Ausgabetokens fünfmal mehr kosten

Claude berechnet Ausgabetokens fünfmal teurer als Eingabetokens. Erfahren Sie, warum Decoding langsamer als Prefill ist und wie sich das auf Agent-Kosten auswirkt.

Warum Ausgabetokens mehr kosten als Eingabetokens

Ausgabetokens kosten bei jedem Claude-Modell im aktuellen Katalog fünfmal so viel wie Eingabetokens. Der Grund liegt in der Form der Berechnung. Eine Eingabe wird in einem Durchlauf vom Modell gelesen. Eine Antwort wird Token für Token erzeugt. Jeder Durchlauf muss auf den vorherigen warten.

Dieses Verhältnis ist in jeder Zeile der Preisliste gleich. Das ausgewählte Modell verändert daher nicht, welcher Anteil Ihrer Rechnung auf die Ausgabe entfällt. Entscheidend ist die Struktur Ihrer Arbeitslast. Ein Agent-Schritt, der 60,000 Tokens liest und mit 800 Tokens antwortet, verursacht fast keine Ausgabekosten. Ein Entwurfsauftrag, der 2,000 Tokens liest und 12,000 Tokens schreibt, verursacht fast keine Eingabekosten. Beide Fälle werden im Folgenden anhand der von Anthropic veröffentlichten Preise für August 2026 berechnet.

Prefill wird einmal ausgeführt, Decoding einmal pro Token

Ein Inferenzserver verarbeitet eine Anfrage in zwei Phasen mit sehr unterschiedlichen Kosten. Prefill liest den Prompt ein. Decoding erzeugt die Antwort.

Prefill verarbeitet den gesamten Prompt auf einmal. Jedes Prompt-Token wird im selben Forward-Pass verarbeitet. Dadurch werden die Berechnungen für Attention und Feed-Forward zu wenigen großen Matrixmultiplikationen, die jeweils Tausende von Tokens abdecken. Einmaliges Lesen der Modellgewichte aus dem Speicher reicht für den gesamten Prompt. Die Matrixeinheiten des Beschleunigers bleiben ausgelastet. Prefill ist deshalb compute-bound: Maßgeblich ist, wie schnell der Chip multiplizieren kann.

Decoding kann nicht auf diese Weise arbeiten, weil Token 2 von Token 1 abhängt. Das gerade vom Modell erzeugte Token wird Teil der Eingabe für den nächsten Schritt. Deshalb können die einzelnen Schritte nicht gleichzeitig ausgeführt werden. Jedes Ausgabe-Token benötigt einen eigenen Forward-Pass. Jeder dieser Durchläufe liest den vollständigen Satz der Modellgewichte aus dem High-Bandwidth Memory, um ein einzelnes Token zu erzeugen. Decoding ist deshalb memory-bound: Maßgeblich ist, wie schnell die Gewichte übertragen werden können, nicht wie schnell sie multipliziert werden. Derselbe Gewichtsdatenverkehr, der beim Prefill einen vollständigen Prompt verarbeitet, erzeugt beim Decoding ein Token.

Serving-Systeme wirken dem durch Batching entgegen. Viele Anfragen werden gemeinsam decodiert. Ein Lesen der Gewichte erzeugt dadurch jeweils ein Token für jede Anfrage im Batch. Deshalb ist Decoding überhaupt bezahlbar. Die Obergrenze wird wieder durch den Speicher bestimmt. Jede aktive Anfrage benötigt einen KV-Cache (Key/Value-Cache, der gespeicherte Attention-Zustand für jedes bisher verarbeitete Token). Dieser Cache wächst mit jedem erzeugten Token. Wenn der Beschleuniger voll ist, kann der Batch nicht weiter wachsen.

Das ergibt keine exakte Zahl. Sie sollten 5x nicht als gemessenes Hardwareverhältnis verstehen. Es handelt sich um einen von Anthropic festgelegten Preis, der diese Asymmetrie berücksichtigt. Sie können jedoch die Richtung selbst überprüfen. Das dauert etwa eine Minute.

Messen Sie Eingabe- und Ausgabelücke selbst

Installieren Sie die Tools auf einem beliebigen Ubuntu-System:

sudo apt update && sudo apt install -y curl jq moreutils

Übergeben Sie nun einen kurzen Prompt, der eine lange Antwort anfordert, und versehen Sie jede Zeile mit dem Zeitpunkt ihres Eintreffens.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":1000,"stream":true,
       "messages":[{"role":"user","content":"Count from 1 to 300, one number per line."}]}' \
  | ts -s '%.s'

ts -s stellt jeder Zeile die seit dem Start des Befehls verstrichenen Sekunden voran. Aus dieser Ausgabe lassen sich zwei Werte direkt ablesen. Die erste Zeile mit content_block_delta ist Ihre Zeit bis zum ersten Token. Das gesamte Prefill ist darin enthalten. Jede folgende Zeile entspricht einem kleinen Decoding-Schritt. Die Zeitstempel steigen weiter an, bis message_stop eintrifft.

Drehen Sie nun das Verhältnis um. Übergeben Sie ein langes Dokument im Prompt und begrenzen Sie die Antwort auf wenige Tokens.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d "$(jq -n --rawfile doc ./long-document.txt \
       '{model:"claude-sonnet-5", max_tokens:16, stream:true,
         messages:[{role:"user", content:("Answer in one word. Is this document about networking?\n\n" + $doc)}]}')" \
  | ts -s '%.s'

Das erste Delta ist länger als beim kurzen Prompt, weil beim Prefill deutlich mehr Text gelesen werden muss. Danach ist die Antwort fast sofort beendet, weil nur wenige Tokens decodiert werden müssen. Zehntausende Tokens gehen hinein, während die Zeit kaum fortschreitet. Einige Hundert kommen heraus, und die Uhr läuft während der gesamten Ausgabe.

Jede Antwort ohne Streaming endet mit den Zahlen, nach denen Ihnen die Nutzung berechnet wird.

{
  "usage": {
    "input_tokens": 41283,
    "output_tokens": 6,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0
  }
}

Protokollieren Sie alle vier Felder für jede Anfrage. output_tokens umfasst erweitertes Thinking. Ein Modell, das vor seiner Antwort nachdenkt, berechnet diese Tokens daher zum Ausgabetarif. Um die Kosten eines Prompts vor dem Senden zu ermitteln, akzeptiert POST /v1/messages/count_tokens denselben Request-Body und gibt {"input_tokens": N} zurück, ohne das Modell auszuführen. Dieser Vorgang ist kostenlos. Das ist nicht der einzige kostenlose Teil der API. Prüfen Sie daher für welche Teile der Claude API Ihnen niemals Kosten berechnet werden, bevor Sie das Budget für Ihr erstes Projekt planen.

Was Claude pro 1 Million Tokens im August 2026 kostet

ChartClaude API list rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug)",
    "input_usd": 2,
    "output_usd": 10,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (from 1 Sep)",
    "input_usd": 3,
    "output_usd": 15,
    "output_multiple": 5
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "output_multiple": 5
  },
  {
    "label": "Fable 5",
    "input_usd": 10,
    "output_usd": 50,
    "output_multiple": 5
  }
]

Die letzte Spalte zeigt das Verhältnis von Ausgabe zu Eingabe. In jeder Zeile steht dort 5. Haiku 4.5 berechnet 1 $ für Eingaben und 5 $ für Ausgaben. Opus 5 berechnet 5 $ und 25 $. Fable 5 ist das teuerste Modell und berechnet 10 $ sowie 50 $. Was Sie mit diesen Fable-5-Tarifen erhalten sollten Sie lesen, bevor Sie die oberste Zeile verwerfen. Wenn Sie in der Preisspanne nach oben gehen, wird sowohl die Eingabe- als auch die Ausgabeseite mit demselben Faktor multipliziert. Dadurch ändern sich Ihre Gesamtkosten, aber das Verhältnis von Eingabe zu Ausgabe bleibt unverändert.

Sonnet 5 erscheint zweimal, weil der Einführungstarif ausläuft. Bis zum 31. August 2026 werden 2 $ für Eingaben und 10 $ für Ausgaben berechnet. Ab dem 1. September 2026 gilt der Standardtarif von 3 $ und 15 $, der auf beiden Seiten 50% höher ist. In allen folgenden Rechenbeispielen wird der August-Tarif verwendet.

Tarife ändern sich. Auf dieser Seite sollten Sie sie daher nicht prüfen. claude.com/pricing ist die maßgebliche Quelle. Die Methode bleibt auch nach einer Preisänderung gültig.

Ein wichtiger Punkt ist in der Preisliste nicht ersichtlich. Laut der Dokumentation von Anthropic verwenden Claude-4.7- und spätere Modelle einen neueren Tokenizer. Dieser erzeugt für denselben Text ungefähr 30% mehr Tokens als der Tokenizer von Sonnet 4.6 und früheren Modellen. Ein Vergleich von zwei Modellen allein anhand des Preises pro 1 Million Tokens begünstigt das neuere Modell, weil dasselbe Dokument dort mehr Tokens umfasst. Vergleichen Sie stattdessen die Kosten pro fertiger Aufgabe. Zählen Sie Ihre tatsächlichen Prompts mit dem Modell, das Sie tatsächlich einsetzen möchten. Dasselbe Problem besteht zwischen verschiedenen Anbietern. Deren Tokenizer unterscheiden sich noch stärker. Deshalb sagt die Berechnung der Kosten für eine echte Aufgabe mit Claude und ChatGPT mehr aus, als die beiden Tariftabellen nebeneinanderzustellen. Was 1 Million Claude-Tokens in echtem Text wert sind zeigt, wie dieses Volumen in der Praxis aussieht.

Ab wann dominiert die Ausgabe Ihre Kosten?

Bei einem Preis für Ausgabetokens, der dem 5-Fachen des Preises für Eingabetokens entspricht, lässt sich der Break-even leicht im Kopf berechnen. Bezeichnen Sie die Anzahl Ihrer Eingabetokens mit I und die Ihrer Ausgabetokens mit O. Die Eingabe kostet I. Die Ausgabe kostet 5 mal O. Die Ausgabe macht mehr als die Hälfte Ihrer Kosten aus, sobald 5 mal O größer als I ist. Das entspricht einem Token-Verhältnis von 5 Eingabetokens zu 1 Ausgabetoken.

Wenn Ihre Eingabe also mehr als fünfmal länger als Ihre Antwort ist, ist die Eingabe der größere Kostenposten. Bei einem geringeren Verhältnis ist es die Ausgabe.

ChartShare of spend by input to output token ratio, at 5x output pricing
The data behind this chart
[
  {
    "label": "100:1",
    "input_share_pct": 95.2,
    "output_share_pct": 4.8
  },
  {
    "label": "75:1",
    "input_share_pct": 93.75,
    "output_share_pct": 6.25
  },
  {
    "label": "20:1",
    "input_share_pct": 80,
    "output_share_pct": 20
  },
  {
    "label": "10:1",
    "input_share_pct": 66.7,
    "output_share_pct": 33.3
  },
  {
    "label": "5:1",
    "input_share_pct": 50,
    "output_share_pct": 50
  },
  {
    "label": "1:1",
    "input_share_pct": 16.7,
    "output_share_pct": 83.3
  },
  {
    "label": "1:6",
    "input_share_pct": 3.2,
    "output_share_pct": 96.8
  }
]

Bei einem Verhältnis von 100 zu 1 entfallen 4.8% der Kosten auf die Ausgabe. Dann lohnt sich nur, die Eingabe zu kürzen. Bei 5 zu 1 sind beide Kostenposten gleich hoch. Bei 1 zu 6 entfallen 96.8% auf die Ausgabe, und die Eingabe fällt kaum ins Gewicht. Die meisten Menschen schätzen ihr eigenes Verhältnis falsch ein. Ermitteln Sie es daher aus Ihren Logs, bevor Sie etwas optimieren.

Ein Agent-Workload: langer Kontext hinein, kurze Antwort hinaus

Führen Sie einen Schritt eines Retrieval-Agenten aus: 60,000 Eingabetoken aus abgerufenen Dokumenten und dem Gesprächsverlauf sowie eine Antwort mit 800 Token. Das entspricht 75 zu 1. Für alles, was vor dem Schreiben liest, ist das normal.

ChartOne agent step, 60,000 input and 800 output tokens, US dollars per call
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.06,
    "output_cost": 0.004,
    "total_cost": 0.064
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.12,
    "output_cost": 0.008,
    "total_cost": 0.128
  },
  {
    "label": "Opus 5",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "Fable 5",
    "input_cost": 0.6,
    "output_cost": 0.04,
    "total_cost": 0.64
  }
]

Die Ausgabe macht bei jedem Modell 6.25% dieses Aufrufs aus, weil das Verhältnis über die gesamte Preisliste hinweg fest ist. Der Aufruf kostet bei Opus 5 $0.32, bei Sonnet 5 zum August-Tarif $0.128 und bei Haiku 4.5 $0.064. Zweihundert solcher Schritte pro Tag auf Opus 5 kosten $64 pro Tag.

Sobald Sie die Aufteilung sehen, ist der entscheidende Hebel offensichtlich. Wenn Sie die Antwort von 800 auf 400 Token kürzen, sparen Sie etwa 3% der Kosten des Aufrufs. Wenn Sie 20,000 Token veralteten Kontext aus der Eingabe entfernen, sparen Sie etwa ein Drittel davon. Die Ausgabelänge eines leseintensiven Agenten zu begrenzen, ist nahezu vergebliche Mühe. wo die Token eines Coding-Agenten tatsächlich verwendet werden zeigt, wodurch diese Eingabe überhaupt so umfangreich wird.

Ein Generierungs-Workload: kurzer Prompt, langer Entwurf

Drehen Sie das Verhältnis nun um. Ein Briefing mit 2,000 Tokens und ein Entwurf mit 12,000 Tokens ergeben ein Verhältnis von 1 zu 6.

ChartOne draft, 2,000 input and 12,000 output tokens, US dollars per draft
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.002,
    "output_cost": 0.06,
    "total_cost": 0.062,
    "batch_total_cost": 0.031
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.004,
    "output_cost": 0.12,
    "total_cost": 0.124,
    "batch_total_cost": 0.062
  },
  {
    "label": "Opus 5",
    "input_cost": 0.01,
    "output_cost": 0.3,
    "total_cost": 0.31,
    "batch_total_cost": 0.155
  },
  {
    "label": "Fable 5",
    "input_cost": 0.02,
    "output_cost": 0.6,
    "total_cost": 0.62,
    "batch_total_cost": 0.31
  }
]

Der Output macht 96.8% dieser Rechnung aus. Opus 5 kostet pro Entwurf $0.31, gegenüber $0.062 bei Haiku 4.5. Dieser fünffache Unterschied entsteht fast vollständig auf der Output-Seite. Genau dort sparen Sie mit einem günstigeren Modell am meisten.

Die letzte Spalte zeigt denselben Auftrag über die Batch API. Dabei werden die Kosten für Input und Output um 50% reduziert. Opus 5 kostet dann $0.155 pro Entwurf. Batch liefert die Ergebnisse innerhalb von 24 Stunden statt sofort. Damit eignet sich die API für die nächtliche Berichtserstellung und die Klassifizierung großer Datenmengen. Sie eignet sich nicht für Aufgaben, bei denen eine Person auf das Ergebnis wartet.

Model-Routing lohnt sich hier, anders als beim Agent-Schritt. Wenn der ausführliche Teil der Aufgabe mechanisch ist, etwa das Umformatieren von Text oder das Erweitern einer bereits freigegebenen Gliederung, erzeugt das günstigere Modell diese Tokens zum fünften Teil des Preises. Auswahl zwischen Opus, Sonnet und Haiku zeigt, wo die Qualitätsgrenze tatsächlich liegt.

Caching vergünstigt den Input, aber nur den Input

Prompt-Caching speichert ein Präfix Ihres Prompts auf dem Server und berechnet für das erneute Lesen einen Bruchteil des Input-Preises. Im August 2026 betragen die Multiplikatoren das 1.25-Fache des normalen Input-Preises zum Schreiben eines 5-Minuten-Caches, das 2-Fache zum Schreiben eines 1-Stunden-Caches und das 0.1-Fache zum Lesen eines Cache-Treffers.

Der Output ist davon nicht betroffen. Es gibt keinen gecachten Output. Jedes Token, das das Modell schreibt, wird jedes Mal vollständig zum Output-Preis berechnet, unabhängig davon, wie viel des Prompts aus dem Cache gelesen wurde.

Nehmen Sie denselben Agent-Schritt mit Opus 5, bei dem 55,000 der 60,000 Input-Tokens aus einem gefüllten Cache bereitgestellt werden.

ChartThe same Opus 5 agent step, with and without a warm 55,000 token cache, US dollars
The data behind this chart
[
  {
    "label": "No cache",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "55k prefix cache read",
    "input_cost": 0.0525,
    "output_cost": 0.02,
    "total_cost": 0.0725
  }
]

Die Kosten sinken von $0.32 auf $0.0725. Die Output-Zeile ändert sich nicht: vorher $0.02, danach $0.02. Caching senkt die Rechnung und verändert ihre Zusammensetzung. Der Output machte bei diesem Aufruf 6.25% aus. Jetzt beträgt sein Anteil mehr als ein Viertel. Dadurch ändert sich, an welchem Stellhebel sich als Nächstes ansetzen lässt.

Der erste Aufruf bezahlt das Schreiben. Das Schreiben eines 5-Minuten-Caches kostet das 1.25-Fache des normalen Input-Preises und amortisiert sich daher nach einem einzigen Treffer. Das Schreiben eines 1-Stunden-Caches kostet das 2-Fache und benötigt daher zwei Treffer. Die Multiplikatoren für Schreiben und Lesen sowie der Punkt, ab dem sich Caching nicht mehr lohnt führt diese Berechnung im Detail durch.

Vier Stellhebel, die Sie kontrollieren

  1. Setzen Sie max_tokens auf Ihre p95-Ausgabelänge und nicht auf das Modellmaximum.
  2. Leiten Sie ausführliche Schritte an ein günstigeres Modell weiter.
  3. Stapeln Sie alles, worauf niemand wartet.
  4. Löschen Sie Anweisungen, die Antworten unnötig verlängern.

max_tokens ist eine harte Obergrenze. Eine hohe Einstellung verursacht allein keine Kosten, weil Sie für erzeugte Tokens und niemals für die Obergrenze bezahlen. Eine großzügige Obergrenze entfernt lediglich die Begrenzung für eine Antwort, die aus dem Ruder läuft. Ermitteln Sie die output_tokens-Verteilung aus Ihren Logs, setzen Sie die Obergrenze etwas über das 95. Perzentil und behandeln Sie stop_reason: "max_tokens" im Code, indem Sie die Antwort fortsetzen oder einen neuen Versuch starten. Eine erkannte Abschneidung kostet weniger als eine 4.000-Token-Abschweifung, für die Sie bezahlen und die Sie anschließend verwerfen. Extended Thinking fließt ebenfalls in output_tokens ein. Legen Sie dieses Budget daher anhand derselben Daten fest.

Routing funktioniert, wenn der teure Teil eines Schritts eher im Umfang als in der Beurteilung liegt. Lassen Sie das leistungsfähige Modell die Entscheidung treffen und übertragen Sie die Texterstellung an ein günstigeres Modell. Messen Sie die geroutete Variante zuerst anhand Ihres eigenen Evaluierungssatzes. Ein günstiges Modell, das zwei Versuche benötigt, kostet mehr als ein einziger Versuch mit einem teuren Modell.

Batching ist der einzige Stellhebel, der die Kosten für Ausgaben reduziert. 50 % Rabatt auf beide Seiten, Ergebnisse innerhalb von 24 Stunden und alles, was nach einem Zeitplan ausgeführt wird, ist dafür geeignet.

Der letzte Stellhebel wird am häufigsten übersprungen. Formulierungen wie „seien Sie gründlich“ und „erklären Sie Ihre Überlegungen“ erhöhen die Ausgabelänge bei jedem Aufruf, den Sie jemals durchführen. Ersetzen Sie sie durch die gewünschte Struktur: „Antworten Sie in höchstens drei Sätzen“ oder „Geben Sie ausschließlich das JSON-Objekt ohne Einleitung zurück“. Ein System-Prompt, der jede Antwort um 300 Tokens verlängert, kostet fünfmal so viel wie dieselben 300 Tokens im Prompt. Die Kosten eines laufenden Agenten unter Kontrolle halten behandelt die Überwachung. Außerdem sollten Sie klären, ob die API oder ein Flatrate-Abonnement für Ihr Nutzungsmuster günstiger ist, bevor Sie eine Woche lang die Kosten pro Token optimieren, die ein Abonnement bereits abgedeckt hätte. Für eine einzelne Entwicklerin oder einen einzelnen Entwickler hängt das meist davon ab, ob Claude Pro mit 20 $ pro Monat und den enthaltenen Nutzungslimits die Arbeit abdeckt, die Sie ansonsten nach Verbrauch abrechnen würden. Wenn Sie diese Limits bereits mitten in einer Sitzung erreichen, sollten Sie zuerst ermitteln, auf welches Zeitfenster Sie warten. Danach kommen als Lösung ein kleineres Modell, ein kürzerer Kontext, zusätzliche Nutzungsguthaben oder die Verlagerung dieser Arbeit auf die verbrauchsabhängige API infrage. Wenn sich die verbrauchsabhängige API für diese Arbeit als günstiger erweist, können Sie auf einen kleineren Tarif wechseln oder das Abonnement kündigen, ohne den bereits bezahlten Monat zu verlieren. Der Wechsel kostet Sie dadurch nichts. Wenn der Tarif, mit dem Sie Pro vergleichen, zu ChatGPT und nicht zur verbrauchsabhängigen API gehört, zeigt der direkte Vergleich der beiden Abonnementstufen, welcher Tarif für Programmierarbeiten günstiger ist. Wenn diese Frage ein Team und nicht nur eine Entwicklerin oder einen Entwickler betrifft, beachten Sie, dass Claude Enterprise eine Gebühr pro Sitzplatz mit nach diesen API-Sätzen abgerechneten Tokens kombiniert. Daher gilt jeder Stellhebel auf dieser Seite weiterhin für den verbrauchsabhängig abgerechneten Teil der Rechnung.

FAQ

Warum kosten Ausgabetokens mehr als Eingabetokens?

Ihre Generierung benötigt pro Token deutlich mehr Accelerator-Zeit. Eine Eingabe wird in einem einzigen Forward-Pass vollständig verarbeitet. Dabei deckt ein einmaliges Lesen der Modellgewichte Tausende Tokens ab, und die Hardware ist durch den Durchsatz der Multiplikationen begrenzt. Eine Antwort wird dagegen Token für Token erzeugt. Jeder Token benötigt einen eigenen Forward-Pass, der erneut die vollständigen Modellgewichte liest. Daher ist die Hardware stattdessen durch die Speicherbandbreite begrenzt. Anthropic berechnet für Ausgaben im gesamten aktuellen Katalog, von Haiku 4.5 bis Fable 5, das Fünffache des Preises für Eingaben.

Werden Ausgabetokens durch Prompt-Caching günstiger?

Nein. Prompt-Caching gilt nur für Eingaben. Im August 2026 kostet ein Cache-Read das 0.1-Fache des Basistarifs für Eingaben. Cache-Writes kosten für die Dauer von 5 Minuten das 1.25-Fache und für die Dauer von 1 Stunde das 2-Fache. Ausgaben werden bei jedem Aufruf zum vollständigen Tarif berechnet, unabhängig davon, was der Cache bewirkt hat. Deshalb verändert Caching nicht nur die Höhe Ihrer Rechnung, sondern auch ihre Zusammensetzung: Sobald der Anteil der Eingaben stark sinkt, wird der Anteil der Ausgaben zum lohnenden Optimierungsziel.

Kostet mich ein hoher max_tokens Geld, wenn die Antwort kurz ausfällt?

Nein. Sie zahlen für die Tokens, die das Modell tatsächlich erzeugt. max_tokens ist daher eine Obergrenze und keine Reservierung. Der Wert bleibt dennoch wichtig, weil er die einzige feste Begrenzung für eine außer Kontrolle geratende Antwort ist. Setzen Sie ihn etwas oberhalb des 95. Perzentils Ihres beobachteten output_tokens und behandeln Sie stop_reason: "max_tokens" im Code, statt eine unbemerkt abgeschnittene Antwort auszuliefern.

Wie ermittle ich mein eigenes Verhältnis von Eingabe- zu Ausgabetokens?

Protokollieren Sie input_tokens, output_tokens, cache_read_input_tokens und cache_creation_input_tokens aus dem usage-Objekt jeder Antwort und teilen Sie anschließend die Summen über eine Woche. Liegt das Verhältnis über 5 Eingabetokens zu 1 Ausgabetoken, entstehen Ihre Kosten hauptsächlich durch die Eingabe. Cachen Sie dann den stabilen Teil und kürzen Sie den Rest. Liegt es darunter, entstehen Ihre Kosten hauptsächlich durch die Antwort. Begrenzen Sie dann deren Länge und verschieben Sie die Schritte, die den größten Teil der Antwort erzeugen, auf ein günstigeres Modell oder auf die Batch API.