SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-30

Mengapa Harga Token Output Claude Lebih Mahal?

Token output Claude berharga lima kali ganda berbanding token input. Ketahui perbezaan antara fasa prefill dan penyahkodan serta kesannya terhadap bil ejen AI anda.

Mengapa token output lebih mahal daripada token input

Token output berharga lima kali ganda berbanding token input bagi setiap model Claude dalam katalog semasa. Punca bagi perkara ini ialah bentuk pengiraan yang dilakukan. Membaca prompt merupakan satu hantaran (pass) ke atas model. Menulis jawapan pula merupakan satu hantaran bagi setiap token, dan setiap hantaran perlu menunggu hantaran sebelumnya selesai.

Nisbah tersebut adalah sama pada setiap baris senarai harga, jadi model yang anda pilih tidak mengubah bahagian output dalam bil anda. Bentuk beban kerja anda yang menentukan perkara tersebut. Langkah ejen yang membaca 60,000 token dan menjawab dalam 800 token hampir tidak membelanjakan apa-apa untuk output. Tugas penggubalan yang membaca 2,000 token dan menulis 12,000 token hampir tidak membelanjakan apa-apa untuk input. Kedua-dua kes di bawah dikira berdasarkan kadar yang diterbitkan oleh Anthropic pada Ogos 2026.

Prefill dijalankan sekali, penyahkodan dijalankan sekali bagi setiap token

Pelayan inferens mengendalikan permintaan dalam dua fasa dengan kos yang sangat berbeza. Prefill membaca prompt. Penyahkodan menulis balasan.

Prefill mengambil keseluruhan prompt sekaligus. Setiap token prompt memasuki rangkaian dalam pas ke hadapan (forward pass) yang sama, jadi kerja attention dan feed-forward menjadi sejumlah kecil pendaraban matriks besar yang meliputi beribu-ribu token pada satu masa. Satu bacaan pemberat model daripada memori melayani keseluruhan prompt. Unit matriks pemecut sentiasa sibuk, yang bermaksud prefill terikat dengan pengiraan (compute-bound): hadnya ialah kelajuan cip melakukan pendaraban.

Penyahkodan tidak boleh berfungsi dengan cara itu, kerana token 2 bergantung pada token 1. Token yang baru dihasilkan oleh model menjadi sebahagian daripada input untuk langkah seterusnya, jadi langkah-langkah tersebut tidak boleh dijalankan pada masa yang sama. Setiap token output mendapat pas ke hadapan sendiri, dan setiap pas tersebut membaca set penuh pemberat model daripada memori jalur lebar tinggi (high-bandwidth memory) untuk menghasilkan satu token. Ini menjadikan penyahkodan terikat dengan memori (memory-bound): hadnya ialah kelajuan pemberat boleh dipindahkan, bukan kelajuan ia didarabkan. Trafik pemberat yang sama yang menggunakan keseluruhan prompt semasa prefill hanya memberikan anda satu token semasa penyahkodan.

Sistem penyajian melawan keadaan ini dengan pemprosesan kelompok (batching). Banyak permintaan dinyahkod bersama-sama, jadi satu bacaan pemberat menghasilkan satu token untuk setiap permintaan dalam kelompok tersebut. Itulah sebabnya penyahkodan boleh dilakukan. Hadnya sekali lagi ialah memori. Setiap permintaan yang sedang diproses memegang KV cache (key/value cache, iaitu status attention yang disimpan untuk setiap token setakat ini), cache tersebut berkembang dengan setiap token yang dijana, dan apabila ia memenuhi pemecut, kelompok tersebut tidak boleh ditambah lagi.

Tiada satu pun daripada perkara ini memberikan anda nombor yang tepat, dan anda tidak seharusnya menganggap 5x sebagai nisbah perkakasan yang diukur. Ia adalah harga yang ditetapkan oleh Anthropic, berdasarkan asimetri tersebut. Apa yang anda boleh semak sendiri ialah arahnya, dan ia mengambil masa kira-kira satu minit.

Ukur sendiri jurang input dan output

Pasang alatan tersebut pada mana-mana mesin Ubuntu:

sudo apt update && sudo apt install -y curl jq moreutils

Sekarang, strimkan satu gesaan (prompt) ringkas yang meminta jawapan panjang, dan setem setiap baris dengan masa ia tiba.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":1000,"stream":true,
       "messages":[{"role":"user","content":"Count from 1 to 300, one number per line."}]}' \
  | ts -s '%.s'

ts -s meletakkan awalan saat yang telah berlalu sejak arahan dimulakan pada setiap baris. Dua perkara perlu diperhatikan daripada output tersebut. Baris content_block_delta yang pertama ialah masa untuk token pertama anda, dan keseluruhan proses prefill berlaku di dalamnya. Setiap baris selepas itu merupakan satu langkah kecil penyahkodan (decoding), dan setem masa terus meningkat sehingga message_stop tiba.

Sekarang, terbalikkan bentuknya. Masukkan dokumen yang panjang ke dalam gesaan dan hadkan jawapan kepada beberapa token sahaja.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d "$(jq -n --rawfile doc ./long-document.txt \
       '{model:"claude-sonnet-5", max_tokens:16, stream:true,
         messages:[{role:"user", content:("Answer in one word. Is this document about networking?\n\n" + $doc)}]}')" \
  | ts -s '%.s'

Delta pertama mengambil masa lebih lama berbanding gesaan ringkas tadi, kerana prefill perlu membaca teks yang jauh lebih banyak. Selepas ia tiba, respons tamat hampir serta-merta, kerana hanya beberapa token sahaja yang perlu dinyahkod. Berpuluh-puluh ribu token dimasukkan dan jam hampir tidak bergerak. Beberapa ratus token dikeluarkan dan jam berjalan sepanjang masa.

Setiap respons bukan penstriman berakhir dengan nombor yang akan dikenakan caj kepada anda.

{
  "usage": {
    "input_tokens": 41283,
    "output_tokens": 6,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0
  }
}

Log keempat-empat medan bagi setiap permintaan. output_tokens merangkumi pemikiran lanjutan, jadi model yang berfikir sebelum menjawab akan mengenakan caj bagi pemikiran tersebut pada kadar output. Untuk menetapkan harga gesaan sebelum anda menghantarnya, POST /v1/messages/count_tokens menerima badan permintaan yang sama, mengembalikan {"input_tokens": N} tanpa menjalankan model, dan ia adalah percuma. Ini bukan satu-satunya bahagian API yang tidak mengenakan sebarang kos, dan bahagian API Claude yang tidak pernah dikenakan caj wajar disemak sebelum anda merangka belanjawan projek pertama.

Caj Claude bagi setiap juta token setakat Ogos 2026

ChartClaude API list rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug)",
    "input_usd": 2,
    "output_usd": 10,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (from 1 Sep)",
    "input_usd": 3,
    "output_usd": 15,
    "output_multiple": 5
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "output_multiple": 5
  },
  {
    "label": "Fable 5",
    "input_usd": 10,
    "output_usd": 50,
    "output_multiple": 5
  }
]

Lajur terakhir ialah output dibahagikan dengan input, dan ia memaparkan 5 pada setiap baris. Haiku 4.5 mengenakan bayaran $1 untuk input dan $5 untuk output. Opus 5 mengenakan bayaran $5 dan $25. Fable 5, yang paling mahal, mengenakan bayaran $10 dan $50, dan apa yang anda peroleh dengan kadar Fable 5 tersebut wajar dibaca sebelum anda menolak baris teratas itu. Bergerak ke atas dalam julat model mendarabkan kedua-dua belah pihak dengan faktor yang sama, jadi ia mengubah jumlah keseluruhan anda tetapi mengekalkan nisbah input kepada output tepat seperti sebelumnya.

Sonnet 5 muncul dua kali kerana kadar pengenalannya akan tamat. Sehingga 31 Ogos 2026, ia mengenakan bayaran $2 dan $10. Mulai 1 September 2026, kadar standard sebanyak $3 dan $15 akan dikenakan, iaitu 50% lebih tinggi pada kedua-dua belah pihak. Setiap contoh kerja di bawah menggunakan kadar Ogos.

Kadar sentiasa berubah, dan halaman ini bukanlah tempat untuk anda menyemaknya. claude.com/pricing ialah sumber yang tepat. Apa yang kekal selepas perubahan harga ialah kaedahnya.

Satu peringatan yang tidak ditunjukkan dalam senarai harga. Dokumentasi Anthropic menyatakan bahawa Claude 4.7 dan model terkemudian menggunakan tokenizer baharu yang menghasilkan kira-kira 30% lebih banyak token untuk teks yang sama berbanding tokenizer dalam Sonnet 4.6 dan sebelumnya. Dua model yang dibandingkan berdasarkan harga per juta token sahaja akan memberikan gambaran yang lebih baik kepada model baharu, kerana dokumen yang sama akan menghasilkan lebih banyak token pada model tersebut. Bandingkan berdasarkan kos bagi setiap tugasan yang diselesaikan, dan kira prompt sebenar anda terhadap model yang anda rancang untuk gunakan. Perangkap yang sama wujud antara penyedia perkhidmatan, yang tokenizer mereka berbeza antara satu sama lain lebih daripada itu, jadi mengira kos tugasan sebenar pada Claude dan ChatGPT memberitahu anda lebih banyak perkara berbanding meletakkan dua kad kadar bersebelahan. nilai sejuta token Claude dalam teks sebenar merangkumi rupa jumlah tersebut dalam praktiknya.

Bilakah output mula mendominasi bil anda?

Dengan harga output ditetapkan pada 5 kali ganda input, titik pulang modal mudah dikira dalam kepala. Katakan token input anda ialah I dan token output anda ialah O. Kos input ialah I. Kos output ialah 5 kali O. Output melebihi separuh daripada perbelanjaan anda apabila 5 kali O lebih besar daripada I, iaitu nisbah token 5 input kepada 1 output.

Jadi, jika prompt anda lebih panjang daripada lima kali ganda jawapan anda, input merupakan item perbelanjaan yang lebih besar. Di bawah nisbah tersebut, output pula yang lebih besar.

ChartShare of spend by input to output token ratio, at 5x output pricing
The data behind this chart
[
  {
    "label": "100:1",
    "input_share_pct": 95.2,
    "output_share_pct": 4.8
  },
  {
    "label": "75:1",
    "input_share_pct": 93.75,
    "output_share_pct": 6.25
  },
  {
    "label": "20:1",
    "input_share_pct": 80,
    "output_share_pct": 20
  },
  {
    "label": "10:1",
    "input_share_pct": 66.7,
    "output_share_pct": 33.3
  },
  {
    "label": "5:1",
    "input_share_pct": 50,
    "output_share_pct": 50
  },
  {
    "label": "1:1",
    "input_share_pct": 16.7,
    "output_share_pct": 83.3
  },
  {
    "label": "1:6",
    "input_share_pct": 3.2,
    "output_share_pct": 96.8
  }
]

Pada nisbah 100 kepada 1, output merangkumi 4.8% daripada perbelanjaan, dan mengurangkan prompt adalah satu-satunya usaha yang berbaloi. Pada nisbah 5 kepada 1, kedua-dua bahagian adalah seimbang. Pada nisbah 1 kepada 6, output merangkumi 96.8% dan prompt hanyalah ralat pembundaran. Kebanyakan orang tersilap meneka nisbah mereka sendiri, jadi dapatkan data tersebut daripada log anda sebelum anda mengoptimumkan apa-apa.

Beban kerja ejen: konteks input panjang, jawapan output pendek

Ambil satu langkah ejen perolehan: 60,000 token input daripada dokumen yang diperoleh dan sejarah perbualan, serta jawapan sepanjang 800 token. Nisbahnya ialah 75 kepada 1, iaitu perkara biasa bagi mana-mana proses yang membaca sebelum menulis.

ChartOne agent step, 60,000 input and 800 output tokens, US dollars per call
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.06,
    "output_cost": 0.004,
    "total_cost": 0.064
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.12,
    "output_cost": 0.008,
    "total_cost": 0.128
  },
  {
    "label": "Opus 5",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "Fable 5",
    "input_cost": 0.6,
    "output_cost": 0.04,
    "total_cost": 0.64
  }
]

Output adalah 6.25% daripada kos panggilan tersebut pada setiap model, kerana nisbahnya ditetapkan merentas keseluruhan senarai harga. Panggilan itu berharga $0.32 pada Opus 5, $0.128 pada Sonnet 5 mengikut kadar Ogos, dan $0.064 pada Haiku 4.5. Dua ratus langkah sedemikian sehari pada Opus 5 bersamaan dengan $64 sehari.

Tuas pengoptimuman menjadi jelas sebaik sahaja anda melihat pembahagian tersebut. Memotong jawapan daripada 800 token kepada 400 hanya menjimatkan kira-kira 3% daripada kos panggilan. Membuang 20,000 token konteks lama daripada prompt menjimatkan kira-kira satu pertiga daripada kos tersebut. Mengehadkan panjang output pada ejen yang banyak membaca adalah usaha yang hampir sia-sia. ke mana perginya token ejen pengekodan memperincikan perkara yang mengisi prompt tersebut pada mulanya.

Beban kerja penjanaan: arahan ringkas, draf panjang

Sekarang, terbalikkan bentuknya. Ringkasan 2,000 token, draf 12,000 token, nisbah 1 kepada 6.

ChartOne draft, 2,000 input and 12,000 output tokens, US dollars per draft
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.002,
    "output_cost": 0.06,
    "total_cost": 0.062,
    "batch_total_cost": 0.031
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.004,
    "output_cost": 0.12,
    "total_cost": 0.124,
    "batch_total_cost": 0.062
  },
  {
    "label": "Opus 5",
    "input_cost": 0.01,
    "output_cost": 0.3,
    "total_cost": 0.31,
    "batch_total_cost": 0.155
  },
  {
    "label": "Fable 5",
    "input_cost": 0.02,
    "output_cost": 0.6,
    "total_cost": 0.62,
    "batch_total_cost": 0.31
  }
]

Output adalah 96.8% daripada bil ini. Opus 5 berharga $0.31 bagi setiap draf berbanding $0.062 pada Haiku 4.5. Perbezaan lima kali ganda itu hampir sepenuhnya datang daripada bahagian output, iaitu tempat model yang lebih murah memberikan penjimatan paling besar kepada anda.

Lajur terakhir adalah tugasan yang sama melalui Batch API, yang memberikan potongan 50% untuk input dan output. Opus 5 turun kepada $0.155 bagi setiap draf. Batch memberikan hasil dalam tempoh 24 jam dan bukannya serta-merta, jadi ia sesuai untuk penjanaan laporan semalaman dan klasifikasi pukal. Ia tidak sesuai untuk tugasan yang memerlukan seseorang menunggu di hadapan skrin.

Penghalaan model (model routing) memberikan pulangan di sini dengan cara yang tidak berlaku pada langkah ejen. Jika bahagian tugasan yang panjang itu bersifat mekanikal, seperti memformat semula teks atau mengembangkan rangka yang telah anda luluskan, model yang murah menghasilkan token tersebut pada satu perlima daripada harga asal. memilih antara Opus, Sonnet dan Haiku merangkumi di mana garis kualiti itu sebenarnya terletak.

Caching hanya mendiskaun input, dan input sahaja

Caching prompt menyimpan awalan prompt anda pada pelayan dan mengenakan caj sebahagian kecil daripada kadar input untuk membacanya semula. Setakat Ogos 2026, penggandanya ialah 1.25x kadar input asas untuk menulis cache 5 minit, 2x untuk menulis cache 1 jam, dan 0.1x untuk membaca hit.

Output tidak termasuk dalam tawaran tersebut. Tiada output yang dicache. Setiap token yang ditulis oleh model dibilkan pada kadar output penuh, setiap kali, tidak kira berapa banyak prompt yang kembali sebagai hit cache.

Ambil langkah ejen yang sama pada Opus 5, dengan 55,000 daripada 60,000 token input dihidangkan daripada cache yang sedia ada.

ChartThe same Opus 5 agent step, with and without a warm 55,000 token cache, US dollars
The data behind this chart
[
  {
    "label": "No cache",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "55k prefix cache read",
    "input_cost": 0.0525,
    "output_cost": 0.02,
    "total_cost": 0.0725
  }
]

Panggilan tersebut turun daripada $0.32 kepada $0.0725. Baris output tidak berubah: $0.02 sebelum, $0.02 selepas. Caching mengurangkan bil dan mengubah bentuknya. Output adalah 6.25% daripada panggilan tersebut. Ia kini lebih daripada satu perempat daripadanya, yang mengubah tuil mana yang berbaloi untuk ditarik seterusnya.

Panggilan pertama membayar kos penulisan. Penulisan cache 5 minit berharga 1.25x input asas, jadi ia membayar untuk dirinya sendiri selepas satu hit sahaja. Penulisan 1 jam berharga 2x, jadi ia memerlukan dua hit. pengganda tulis dan baca, serta di mana caching berhenti memberi pulangan menghuraikan pengiraan tersebut.

Empat tuil yang anda kawal

  1. Tetapkan max_tokens pada panjang output p95 anda, bukan pada tahap maksimum model.
  2. Halakan langkah yang panjang lebar kepada model yang lebih murah.
  3. Lakukan pemprosesan kelompok (batching) untuk sebarang tugasan yang tidak memerlukan respons segera.
  4. Padamkan arahan yang menyebabkan jawapan menjadi terlalu panjang.

max_tokens ialah had siling yang keras, dan menetapkannya pada tahap tinggi tidak menelan kos kerana anda dibilkan berdasarkan token yang dihasilkan, bukan berdasarkan had siling tersebut. Siling yang tinggi hanya berfungsi untuk mengelakkan sekatan pada respons yang tidak dijangka. Dapatkan taburan output_tokens daripada log anda, tetapkan had siling sedikit melebihi persentil ke-95, dan kendalikan stop_reason: "max_tokens" dalam kod dengan menyambung respons atau mencuba semula. Pemotongan (truncation) yang anda kesan menelan kos yang lebih rendah berbanding respons sepanjang 4,000 token yang anda bayar tetapi tidak gunakan. Proses pemikiran yang panjang juga termasuk dalam output_tokens, jadi tetapkan bajet tersebut berdasarkan bukti yang sama.

Penghalaan (routing) berkesan apabila bahagian langkah yang mahal melibatkan volum dan bukannya pertimbangan. Kekalkan model yang berkuasa untuk membuat keputusan, dan serahkan tugas menaip kepada model yang lebih murah. Ukur versi yang dihalakan pada set penilaian anda sendiri terlebih dahulu, kerana model murah yang memerlukan dua kali percubaan menelan kos lebih tinggi daripada satu percubaan model mahal.

Pemprosesan kelompok ialah satu-satunya tuil yang memberikan diskaun untuk output. Diskaun 50% untuk kedua-dua pihak, hasil diperoleh dalam masa 24 jam, dan sebarang tugasan mengikut jadual layak untuk kaedah ini.

Tuil terakhir ialah tuil yang sering diabaikan oleh pengguna. Frasa seperti "be thorough" dan "explain your reasoning" menetapkan panjang output anda pada setiap panggilan yang anda buat. Gantikannya dengan format yang anda mahukan: "Answer in at most three sentences", atau "Return only the JSON object, with no preamble". Prompt sistem yang menambah 300 token pada setiap respons menelan kos lima kali ganda lebih mahal berbanding 300 token yang sama dalam prompt. mengawal kos ejen yang sedang berjalan merangkumi aspek pemantauan, dan sama ada API atau langganan tetap lebih murah untuk corak penggunaan anda perlu diputuskan sebelum anda menghabiskan masa seminggu untuk melaraskan perbelanjaan per-token yang sepatutnya sudah dilindungi oleh langganan. Bagi seorang pembangun, perkara ini biasanya bergantung kepada sama ada Claude Pro pada harga $20 sebulan serta had penggunaan yang disertakan mencukupi untuk kerja yang sepatutnya anda pantau. Jika anda sudah mencapai had tersebut di pertengahan sesi, mengenal pasti tetingkap yang anda tunggu adalah langkah pertama, kerana penyelesaiannya ialah menggunakan model yang lebih kecil, konteks yang lebih ringan, kredit penggunaan tambahan, atau memindahkan kerja tersebut ke API bermeter. Jika API bermeter ternyata menjadi pilihan yang lebih murah untuk kerja tersebut, menurunkan pelan kepada yang lebih kecil atau membatalkannya tidak akan menjejaskan bulan yang telah anda bayar, jadi pertukaran tersebut tidak menelan sebarang kos. Jika pelan yang anda bandingkan dengan Pro ialah ChatGPT dan bukannya API bermeter, dua tangga langganan yang dibandingkan secara bersebelahan menunjukkan pelan mana yang lebih murah untuk kerja pengekodan. Jika soalan ini ditanya untuk pasukan dan bukannya seorang pembangun, ambil perhatian bahawa Claude Enterprise menggabungkan yuran per kerusi dengan token yang diukur pada kadar API yang sama, jadi setiap tuil pada halaman ini masih terpakai untuk bahagian bil yang diukur tersebut.

FAQ

Mengapakah token output lebih mahal daripada token input?

Penjanaan token memerlukan masa pemecut yang jauh lebih lama bagi setiap token. Prompt diproses dalam satu pas ke hadapan ke atas keseluruhan kandungan, jadi satu bacaan pemberat model merangkumi beribu-ribu token dan perkakasan dihadkan oleh daya pemprosesan pendaraban. Balasan dihasilkan satu token pada satu masa, setiap token memerlukan pas ke hadapan sendiri yang membaca semula keseluruhan pemberat model, jadi perkakasan dihadkan oleh lebar jalur memori sebaliknya. Anthropic meletakkan harga output pada lima kali ganda input merentas keseluruhan katalog semasa, daripada Haiku 4.5 sehingga Fable 5.

Adakah caching prompt menjadikan token output lebih murah?

Tidak. Caching prompt hanya terpakai pada input sahaja. Setakat Ogos 2026, bacaan cache berharga 0.1x daripada kadar input asas, dan penulisan cache berharga 1.25x untuk tempoh 5 minit atau 2x untuk tempoh 1 jam. Output dibilkan pada kadar penuh bagi setiap panggilan, tidak kira apa yang dilakukan oleh cache. Itulah sebabnya caching mengubah bentuk bil anda serta saiznya: sebaik sahaja bahagian input berkurangan, output menjadi bahagian yang perlu diberi perhatian.

Adakah max_tokens yang tinggi menyebabkan saya menanggung kos jika balasan yang diterima pendek?

Tidak. Anda dibilkan untuk token yang sebenarnya dihasilkan oleh model, jadi max_tokens merupakan siling dan bukannya tempahan. Ia masih penting kerana ia merupakan satu-satunya had keras bagi balasan yang tidak terkawal. Tetapkan nilainya sedikit melebihi persentil ke-95 bagi output_tokens yang anda perhatikan, kemudian kendalikan stop_reason: "max_tokens" dalam kod dan bukannya menghantar jawapan yang terpotong secara senyap.

Bagaimanakah cara untuk mencari nisbah token input kepada output saya sendiri?

Log input_tokens, output_tokens, cache_read_input_tokens dan cache_creation_input_tokens daripada objek usage bagi setiap respons, kemudian bahagikan jumlah keseluruhan sepanjang seminggu. Jika nisbah melebihi 5 input kepada 1 output, wang anda tertumpu pada prompt, jadi lakukan cache pada bahagian yang stabil dan ringkaskan bahagian selebihnya. Jika nisbah di bawah itu, wang anda tertumpu pada balasan, jadi hadkan panjangnya dan pindahkan langkah yang menjana paling banyak output kepada model yang lebih murah atau kepada Batch API.