SSD Nodes Learn 🎉 VPS dari $5.50/bln
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-13

Mengapa Harga Token Output Claude Lebih Mahal?

Ketahui sebab harga token output Claude lima kali ganda lebih mahal berbanding input. Kami terangkan perbezaan teknikal antara fasa prefill dan penyahkodan bagi bil anda.

Mengapa token output lebih mahal daripada token input

Token output berharga lima kali ganda berbanding token input bagi setiap model Claude dalam katalog semasa. Punca perbezaan ini ialah bentuk pengiraan yang dilakukan. Membaca prompt hanya memerlukan satu hantaran (pass) ke atas model. Menulis jawapan pula memerlukan satu hantaran bagi setiap token, dan setiap hantaran perlu menunggu hantaran sebelumnya selesai.

Nisbah tersebut adalah sama pada setiap baris senarai harga, jadi model yang anda pilih tidak mengubah bahagian output dalam bil anda. Bentuk beban kerja anda yang menentukan perkara tersebut. Langkah ejen yang membaca 60,000 token dan menjawab dalam 800 token hampir tidak membelanjakan apa-apa untuk output. Tugas penggubalan yang membaca 2,000 token dan menulis 12,000 token pula hampir tidak membelanjakan apa-apa untuk input. Kedua-dua kes di bawah dikira berdasarkan kadar rasmi Anthropic bagi Ogos 2026.

Prefill dijalankan sekali, penyahkodan dijalankan sekali bagi setiap token

Pelayan inferens mengendalikan permintaan dalam dua fasa dengan kos yang sangat berbeza. Prefill membaca prompt. Penyahkodan menulis balasan.

Prefill mengambil keseluruhan prompt sekaligus. Setiap token prompt memasuki rangkaian dalam pas ke hadapan (forward pass) yang sama, jadi kerja attention dan feed-forward menjadi sejumlah kecil pendaraban matriks besar yang meliputi ribuan token pada satu masa. Satu bacaan pemberat model (model weights) daripada memori melayani keseluruhan prompt. Unit matriks pemecut sentiasa sibuk, yang bermaksud prefill terikat dengan pengiraan (compute-bound): hadnya ialah kelajuan cip melakukan pendaraban.

Penyahkodan tidak boleh berfungsi sedemikian, kerana token 2 bergantung pada token 1. Token yang baru dihasilkan oleh model menjadi sebahagian daripada input untuk langkah seterusnya, jadi langkah-langkah tersebut tidak boleh dijalankan pada masa yang sama. Setiap token output mendapat pas ke hadapan sendiri, dan setiap pas tersebut membaca set penuh pemberat model daripada memori jalur lebar tinggi (high-bandwidth memory) untuk menghasilkan satu token. Ini menjadikan penyahkodan terikat dengan memori (memory-bound): hadnya ialah kelajuan pemberat dipindahkan, bukan kelajuan ia didarabkan. Trafik pemberat yang sama yang menggunakan keseluruhan prompt semasa prefill hanya memberikan anda satu token semasa penyahkodan.

Sistem penyajian melawan keadaan ini dengan pemprosesan kelompok (batching). Banyak permintaan dinyahkod bersama-sama, jadi satu bacaan pemberat menghasilkan satu token untuk setiap permintaan dalam kelompok tersebut. Itulah sebabnya penyahkodan boleh dilaksanakan. Hadnya sekali lagi ialah memori. Setiap permintaan yang sedang diproses memegang KV cache (key/value cache, iaitu status attention yang disimpan bagi setiap token setakat ini), cache itu berkembang dengan setiap token yang dijana, dan apabila ia memenuhi pemecut, kelompok tersebut tidak boleh berkembang lagi.

Tiada satu pun daripada perkara ini memberikan anda nombor yang tepat, dan anda tidak seharusnya membaca 5x sebagai nisbah perkakasan yang diukur. Ia adalah harga yang ditetapkan oleh Anthropic, berdasarkan asimetri tersebut. Apa yang boleh anda semak sendiri ialah arahnya, dan ia mengambil masa kira-kira satu minit.

Ukur sendiri jurang input dan output

Pasang alatan tersebut pada mana-mana mesin Ubuntu:

sudo apt update && sudo apt install -y curl jq moreutils

Sekarang, strimkan satu prompt pendek yang meminta jawapan panjang, dan setem setiap baris dengan masa ia tiba.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":1000,"stream":true,
       "messages":[{"role":"user","content":"Count from 1 to 300, one number per line."}]}' \
  | ts -s '%.s'

ts -s meletakkan awalan pada setiap baris dengan saat yang berlalu sejak arahan dimulakan. Dua perkara perlu diperhatikan daripada output tersebut. Baris content_block_delta yang pertama ialah masa anda untuk token pertama, dan keseluruhan prefill berlaku di dalamnya. Setiap baris selepas itu adalah satu langkah kecil penyahkodan, dan setem masa terus meningkat sehingga message_stop tiba.

Sekarang, terbalikkan bentuknya. Masukkan dokumen yang panjang ke dalam prompt dan hadkan jawapan kepada beberapa token sahaja.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d "$(jq -n --rawfile doc ./long-document.txt \
       '{model:"claude-sonnet-5", max_tokens:16, stream:true,
         messages:[{role:"user", content:("Answer in one word. Is this document about networking?\n\n" + $doc)}]}')" \
  | ts -s '%.s'

Delta pertama mengambil masa lebih lama berbanding prompt pendek, kerana prefill mempunyai lebih banyak teks untuk dibaca. Selepas ia tiba, respons tamat hampir serta-merta, kerana hanya beberapa token yang tinggal untuk dinyahkod. Berpuluh ribu token dimasukkan dan jam hampir tidak bergerak. Beberapa ratus token keluar dan jam berjalan sepanjang masa.

Setiap respons bukan penstriman berakhir dengan nombor yang anda dibilkan.

{
  "usage": {
    "input_tokens": 41283,
    "output_tokens": 6,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0
  }
}

Log keempat-empat medan bagi setiap permintaan. output_tokens merangkumi pemikiran lanjutan, jadi model yang berfikir sebelum menjawab akan mengenakan caj untuk pemikiran tersebut pada kadar output. Untuk menetapkan harga prompt sebelum anda menghantarnya, POST /v1/messages/count_tokens menerima badan permintaan yang sama, mengembalikan {"input_tokens": N} tanpa menjalankan model, dan ia adalah percuma. Ia bukan satu-satunya bahagian API yang tidak mengenakan bayaran, dan bahagian API Claude yang tidak pernah dibilkan kepada anda wajar disemak sebelum anda merancang belanjawan projek pertama.

Caj Claude bagi setiap juta token setakat Ogos 2026

ChartClaude API list rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug)",
    "input_usd": 2,
    "output_usd": 10,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (from 1 Sep)",
    "input_usd": 3,
    "output_usd": 15,
    "output_multiple": 5
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "output_multiple": 5
  },
  {
    "label": "Fable 5",
    "input_usd": 10,
    "output_usd": 50,
    "output_multiple": 5
  }
]

Lajur terakhir ialah output dibahagikan dengan input, dan ia memaparkan 5 pada setiap baris. Haiku 4.5 mengenakan caj $1 untuk input dan $5 untuk output. Opus 5 mengenakan caj $5 dan $25. Fable 5, yang paling mahal, mengenakan caj $10 dan $50, dan apa yang diperoleh dengan kadar Fable 5 tersebut wajar dibaca sebelum anda menolak baris teratas itu. Bergerak ke atas dalam julat tersebut mendarabkan kedua-dua belah pihak dengan faktor yang sama, jadi ia mengubah jumlah anda dan mengekalkan nisbah input kepada output tepat di tempat asalnya.

Sonnet 5 muncul dua kali kerana kadar pengenalannya akan tamat tempoh. Sehingga 31 Ogos 2026, ia mengenakan caj $2 dan $10. Mulai 1 September 2026, kadar standard sebanyak $3 dan $15 akan dikenakan, iaitu 50% lebih tinggi pada kedua-dua belah pihak. Setiap contoh kerja di bawah menggunakan kadar Ogos.

Kadar sentiasa berubah, dan halaman ini bukanlah tempat untuk anda menyemaknya. claude.com/pricing ialah sumber yang tepat. Perkara yang kekal selepas perubahan harga ialah kaedahnya.

Satu peringatan yang tidak ditunjukkan dalam senarai harga. Dokumentasi Anthropic menyatakan bahawa Claude 4.7 dan model terkemudian menggunakan tokenizer baharu yang menghasilkan kira-kira 30% lebih banyak token untuk teks yang sama berbanding tokenizer dalam Sonnet 4.6 dan sebelumnya. Dua model yang dibandingkan berdasarkan harga bagi setiap juta token sahaja akan memihak kepada model yang lebih baharu, kerana dokumen yang sama akan menghasilkan lebih banyak token pada model tersebut. Bandingkan berdasarkan kos bagi setiap tugasan yang diselesaikan, dan kira prompt sebenar anda terhadap model yang anda rancang untuk gunakan. nilai sejuta token Claude dalam teks sebenar merangkumi gambaran jumlah tersebut dalam praktiknya.

Bilakah output mula mendominasi bil anda?

Dengan harga output ditetapkan pada 5 kali ganda input, titik pulang modal mudah dikira dalam kepala. Katakan token input anda ialah I dan token output anda ialah O. Kos input ialah I. Kos output ialah 5 kali O. Output melebihi separuh daripada perbelanjaan anda apabila 5 kali O lebih besar daripada I, iaitu nisbah token 5 input kepada 1 output.

Jadi, jika prompt anda lebih daripada lima kali ganda lebih panjang daripada balasan anda, input merupakan item perbelanjaan yang lebih besar. Di bawah nisbah tersebut, output pula yang lebih besar.

ChartShare of spend by input to output token ratio, at 5x output pricing
The data behind this chart
[
  {
    "label": "100:1",
    "input_share_pct": 95.2,
    "output_share_pct": 4.8
  },
  {
    "label": "75:1",
    "input_share_pct": 93.75,
    "output_share_pct": 6.25
  },
  {
    "label": "20:1",
    "input_share_pct": 80,
    "output_share_pct": 20
  },
  {
    "label": "10:1",
    "input_share_pct": 66.7,
    "output_share_pct": 33.3
  },
  {
    "label": "5:1",
    "input_share_pct": 50,
    "output_share_pct": 50
  },
  {
    "label": "1:1",
    "input_share_pct": 16.7,
    "output_share_pct": 83.3
  },
  {
    "label": "1:6",
    "input_share_pct": 3.2,
    "output_share_pct": 96.8
  }
]

Pada nisbah 100 kepada 1, output ialah 4.8% daripada perbelanjaan, dan memendekkan prompt adalah satu-satunya usaha yang berbaloi. Pada nisbah 5 kepada 1, kedua-dua pihak adalah setara. Pada nisbah 1 kepada 6, output ialah 96.8% dan prompt hanyalah ralat pembundaran. Kebanyakan orang tersilap meneka nisbah mereka sendiri, jadi dapatkan data tersebut daripada log anda sebelum anda mengoptimumkan apa-apa.

Beban kerja ejen: konteks input panjang, jawapan output pendek

Ambil satu langkah ejen perolehan: 60,000 token input daripada dokumen yang diperoleh dan sejarah perbualan, serta jawapan sebanyak 800 token. Nisbahnya ialah 75 kepada 1, iaitu perkara biasa bagi mana-mana proses yang membaca sebelum menulis.

ChartOne agent step, 60,000 input and 800 output tokens, US dollars per call
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.06,
    "output_cost": 0.004,
    "total_cost": 0.064
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.12,
    "output_cost": 0.008,
    "total_cost": 0.128
  },
  {
    "label": "Opus 5",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "Fable 5",
    "input_cost": 0.6,
    "output_cost": 0.04,
    "total_cost": 0.64
  }
]

Output adalah 6.25% daripada panggilan tersebut pada setiap model, kerana nisbahnya adalah tetap merentas keseluruhan senarai harga. Panggilan itu berharga $0.32 pada Opus 5, $0.128 pada Sonnet 5 mengikut kadar Ogos, dan $0.064 pada Haiku 4.5. Dua ratus langkah sedemikian sehari pada Opus 5 bersamaan dengan $64 sehari.

Tuasnya jelas sebaik sahaja anda melihat pembahagian tersebut. Memotong jawapan daripada 800 token kepada 400 menjimatkan kira-kira 3% daripada kos panggilan. Memotong 20,000 token konteks lapuk daripada prompt menjimatkan kira-kira satu pertiga daripadanya. Mengetatkan panjang output pada ejen yang berat dengan bacaan adalah usaha yang hampir sia-sia. ke mana perginya token ejen pengekodan memperincikan perkara yang mengisi prompt tersebut pada mulanya.

Beban kerja penjanaan: gesaan pendek, draf panjang

Sekarang, terbalikkan bentuknya. Ringkasan 2,000 token, draf 12,000 token, nisbah 1 kepada 6.

ChartOne draft, 2,000 input and 12,000 output tokens, US dollars per draft
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.002,
    "output_cost": 0.06,
    "total_cost": 0.062,
    "batch_total_cost": 0.031
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.004,
    "output_cost": 0.12,
    "total_cost": 0.124,
    "batch_total_cost": 0.062
  },
  {
    "label": "Opus 5",
    "input_cost": 0.01,
    "output_cost": 0.3,
    "total_cost": 0.31,
    "batch_total_cost": 0.155
  },
  {
    "label": "Fable 5",
    "input_cost": 0.02,
    "output_cost": 0.6,
    "total_cost": 0.62,
    "batch_total_cost": 0.31
  }
]

Output adalah 96.8% daripada bil ini. Opus 5 menelan kos $0.31 bagi setiap draf berbanding $0.062 pada Haiku 4.5. Perbezaan lima kali ganda itu hampir sepenuhnya datang daripada bahagian output, iaitu tempat model yang lebih murah memberikan penjimatan paling banyak kepada anda.

Lajur terakhir adalah tugasan yang sama melalui Batch API, yang memberikan potongan 50% untuk input dan output. Opus 5 turun kepada $0.155 bagi setiap draf. Batch mengembalikan hasil dalam tempoh 24 jam dan bukannya serta-merta, jadi ia sesuai untuk penjanaan laporan semalaman dan klasifikasi pukal. Ia tidak sesuai untuk tugasan yang memerlukan seseorang menunggu di hadapan skrin.

Penghalaan model (model routing) memberikan pulangan di sini dengan cara yang tidak berlaku pada langkah ejen. Jika bahagian tugasan yang panjang lebar itu bersifat mekanikal, seperti memformat semula teks atau mengembangkan rangka yang telah anda luluskan, model yang murah menghasilkan token tersebut pada satu perlima daripada harga asal. memilih antara Opus, Sonnet dan Haiku merangkumi di mana garis kualiti sebenar terletak.

Caching mendiskaun input, dan hanya input

Prompt caching menyimpan awalan prompt anda pada pelayan dan mengenakan caj sebahagian kecil daripada kadar input untuk membacanya semula. Setakat Ogos 2026, penggandanya ialah 1.25x kadar input asas untuk menulis cache 5 minit, 2x untuk menulis cache 1 jam, dan 0.1x untuk membaca hit.

Output tidak termasuk dalam tawaran tersebut. Tiada output yang dicache. Setiap token yang ditulis oleh model dibilkan pada kadar output penuh, setiap kali, tidak kira berapa banyak prompt yang kembali sebagai cache hit.

Ambil langkah ejen yang sama pada Opus 5, dengan 55,000 daripada 60,000 token input dihidangkan daripada cache yang sedia ada.

ChartThe same Opus 5 agent step, with and without a warm 55,000 token cache, US dollars
The data behind this chart
[
  {
    "label": "No cache",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "55k prefix cache read",
    "input_cost": 0.0525,
    "output_cost": 0.02,
    "total_cost": 0.0725
  }
]

Panggilan tersebut turun daripada $0.32 kepada $0.0725. Baris output tidak berubah: $0.02 sebelum, $0.02 selepas. Caching mengurangkan bil dan mengubah bentuknya. Output adalah 6.25% daripada panggilan tersebut. Kini ia menjadi lebih daripada satu perempat daripadanya, yang mengubah tuas mana yang berbaloi untuk ditarik seterusnya.

Panggilan pertama membayar kos penulisan. Penulisan cache 5 minit berharga 1.25x input asas, jadi ia membayar untuk dirinya sendiri selepas satu hit. Penulisan 1 jam berharga 2x, jadi ia memerlukan dua hit. pengganda tulis dan baca, serta di mana caching berhenti memberi pulangan menghuraikan pengiraan tersebut.

Empat tuil yang anda kawal

  1. Tetapkan max_tokens pada panjang output p95 anda, bukan pada tahap maksimum model.
  2. Halakan langkah yang panjang lebar kepada model yang lebih murah.
  3. Lakukan pemprosesan kelompok (batching) untuk sebarang tugasan yang tidak memerlukan respons segera.
  4. Padamkan arahan yang menyebabkan jawapan menjadi terlalu panjang.

max_tokens ialah had siling yang keras, dan menetapkannya pada tahap tinggi tidak menelan kos kerana anda dibilkan berdasarkan token yang dihasilkan, bukan berdasarkan had siling tersebut. Had yang tinggi hanya berfungsi untuk membuang sekatan pada respons yang tidak berjalan lancar. Dapatkan taburan output_tokens daripada log anda, tetapkan had siling sedikit melebihi persentil ke-95, dan kendalikan stop_reason: "max_tokens" dalam kod dengan menyambung respons atau mencuba semula. Pemotongan (truncation) yang anda kesan menelan kos yang lebih rendah berbanding respons sepanjang 4,000 token yang anda bayar tetapi akhirnya dibuang. Proses pemikiran yang panjang juga termasuk dalam output_tokens, jadi tetapkan belanjawan tersebut berdasarkan bukti yang sama.

Penghalaan (routing) berkesan apabila bahagian yang mahal dalam sesuatu langkah adalah disebabkan oleh volum, bukannya pertimbangan. Kekalkan model yang berkuasa untuk membuat keputusan, dan serahkan tugas menaip kepada model yang lebih murah. Ukur versi yang dihalakan itu pada set penilaian anda sendiri terlebih dahulu, kerana model murah yang memerlukan dua kali percubaan menelan kos lebih tinggi daripada satu percubaan model mahal.

Pemprosesan kelompok ialah satu-satunya tuil yang memberikan diskaun untuk output. Diskaun 50% untuk kedua-dua bahagian, hasil diperoleh dalam masa 24 jam, dan sebarang tugasan yang dijadualkan layak untuk kaedah ini.

Tuil terakhir ialah tuil yang sering diabaikan oleh pengguna. Frasa seperti "be thorough" dan "explain your reasoning" menetapkan panjang output anda pada setiap panggilan yang anda buat. Gantikannya dengan bentuk yang anda mahukan: "Answer in at most three sentences", atau "Return only the JSON object, with no preamble". Prompt sistem yang menambah 300 token pada setiap respons menelan kos lima kali ganda berbanding 300 token yang sama dalam prompt biasa. mengawal kos ejen yang sedang berjalan merangkumi aspek pemantauan, dan sama ada API atau langganan tetap lebih murah untuk corak penggunaan anda perlu diputuskan sebelum anda menghabiskan masa seminggu untuk melaraskan perbelanjaan per-token yang sebenarnya boleh diserap oleh langganan. Bagi seorang pembangun, perkara ini biasanya bergantung kepada sama ada Claude Pro pada harga $20 sebulan dan had penggunaan yang disertakan mencukupi untuk kerja yang sepatutnya anda ukur. Jika anda sudah mencapai had tersebut di pertengahan sesi, mengenal pasti tetingkap yang anda tunggu perlu diutamakan, kerana penyelesaiannya ialah model yang lebih kecil, konteks yang lebih ringan, kredit penggunaan tambahan, atau memindahkan kerja tersebut ke API bermeter. Jika API bermeter terbukti menjadi tempat yang lebih murah untuk kerja tersebut, menurunkan pelan kepada yang lebih kecil atau membatalkannya tidak akan menjejaskan bulan yang telah anda bayar, jadi pertukaran tersebut tidak menelan sebarang kos. Jika pelan yang anda bandingkan dengan Pro ialah ChatGPT dan bukannya API bermeter, dua tangga langganan yang dibandingkan bersebelahan menunjukkan pelan mana yang lebih murah untuk kerja pengekodan. Jika soalan ini ditanya untuk pasukan dan bukannya seorang pembangun, ambil perhatian bahawa Claude Enterprise menggabungkan yuran per kerusi dengan token yang diukur pada kadar API yang sama, jadi setiap tuil pada halaman ini masih terpakai untuk bahagian bil yang diukur tersebut.

FAQ

Mengapakah token output lebih mahal daripada token input?

Penjanaan token output memerlukan masa pemecut yang jauh lebih lama bagi setiap token. Prompt diproses dalam satu hantaran ke hadapan (forward pass) ke atas keseluruhan teks, jadi satu bacaan pemberat model merangkumi ribuan token dan perkakasan dihadkan oleh daya pemprosesan pendaraban. Balasan pula dihasilkan satu token pada satu masa, dengan setiap token memerlukan hantaran ke hadapan sendiri yang membaca semula keseluruhan pemberat model, jadi perkakasan dihadkan oleh lebar jalur memori. Anthropic menetapkan harga output pada lima kali ganda harga input merentas keseluruhan katalog semasa, daripada Haiku 4.5 sehingga Fable 5.

Adakah caching prompt menjadikan token output lebih murah?

Tidak. Caching prompt hanya terpakai untuk input sahaja. Setakat Ogos 2026, bacaan cache berharga 0.1x daripada kadar input asas, dan penulisan cache berharga 1.25x untuk tempoh 5 minit atau 2x untuk tempoh 1 jam. Output dibilkan pada kadar penuh bagi setiap panggilan, tidak kira apa yang dilakukan oleh cache. Itulah sebabnya caching mengubah bentuk bil anda serta saiznya: apabila bahagian input berkurangan, output menjadi bahagian yang perlu dioptimumkan.

Adakah max_tokens yang tinggi menyebabkan saya menanggung kos jika balasan yang diterima pendek?

Tidak. Anda dibilkan berdasarkan token yang sebenarnya dihasilkan oleh model, jadi max_tokens merupakan had maksimum dan bukannya tempahan. Ia masih penting kerana ia merupakan satu-satunya had keras bagi balasan yang tidak terkawal. Tetapkan nilainya sedikit melebihi persentil ke-95 bagi output_tokens yang anda perhatikan, kemudian kendalikan stop_reason: "max_tokens" dalam kod dan bukannya menghantar jawapan yang terpotong secara senyap.

Bagaimanakah cara untuk mencari nisbah token input kepada output saya sendiri?

Log input_tokens, output_tokens, cache_read_input_tokens dan cache_creation_input_tokens daripada objek usage bagi setiap respons, kemudian bahagikan jumlahnya sepanjang satu minggu. Jika nisbah melebihi 5 input kepada 1 output, kos anda tertumpu pada prompt, jadi lakukan cache pada bahagian yang stabil dan ringkaskan bahagian selebihnya. Jika nisbah di bawah tahap tersebut, kos anda tertumpu pada balasan, jadi hadkan panjangnya dan pindahkan langkah-langkah yang menjana paling banyak output kepada model yang lebih murah atau kepada Batch API.