Token Input vs Output Claude: Mengapa Biayanya Berbeda
Token output Claude berbiaya lima kali token input. Pahami perbedaan prefill dan decoding, lalu hitung dampaknya pada tagihan agen Anda setiap bulan.
Mengapa token output lebih mahal daripada token input
Token output berbiaya lima kali lipat dibandingkan token input pada setiap model Claude dalam katalog saat ini. Penyebabnya adalah bentuk komputasinya. Membaca prompt memerlukan satu lintasan pada model. Menulis balasan memerlukan satu lintasan untuk setiap token, dan setiap lintasan harus menunggu lintasan sebelumnya selesai.
Rasio tersebut sama pada setiap baris daftar harga. Jadi, model yang dipilih tidak menentukan seberapa besar porsi tagihan Anda yang berasal dari output. Hal itu ditentukan oleh bentuk beban kerja Anda. Langkah agen yang membaca 60,000 token dan menghasilkan jawaban sepanjang 800 token hampir tidak mengeluarkan biaya untuk output. Pekerjaan penyusunan draf yang membaca 2,000 token dan menulis 12,000 token hampir tidak mengeluarkan biaya untuk input. Kedua kasus tersebut dibahas di bawah berdasarkan tarif Anthropic yang dipublikasikan untuk Agustus 2026.
Prefill berjalan satu kali, decoding berjalan satu kali per token
Server inferensi menangani sebuah request dalam dua fase dengan biaya yang sangat berbeda. Prefill membaca prompt. Decoding menulis balasan.
Prefill memproses seluruh prompt sekaligus. Setiap token prompt masuk ke network dalam forward pass yang sama, sehingga pekerjaan attention dan feed-forward menjadi sejumlah kecil operasi perkalian matriks berukuran besar yang mencakup ribuan token sekaligus. Satu pembacaan bobot model dari memori melayani seluruh prompt. Unit matriks accelerator tetap sibuk. Karena itu, prefill bersifat compute-bound: batasnya adalah seberapa cepat chip dapat melakukan perkalian.
Decoding tidak dapat bekerja dengan cara tersebut karena token 2 bergantung pada token 1. Token yang baru dihasilkan model menjadi bagian dari input untuk langkah berikutnya, sehingga langkah-langkah tersebut tidak dapat berjalan secara bersamaan. Setiap token output memperoleh forward pass sendiri, dan setiap pass membaca seluruh bobot model dari high-bandwidth memory untuk menghasilkan satu token. Karena itu, decoding bersifat memory-bound: batasnya adalah seberapa cepat bobot dapat dipindahkan, bukan seberapa cepat bobot dapat dikalikan. Traffic bobot yang sama, yang selama prefill memproses seluruh prompt, hanya menghasilkan satu token selama decoding.
Sistem serving mengatasinya dengan batching. Banyak request melakukan decoding secara bersamaan, sehingga satu pembacaan bobot menghasilkan satu token untuk setiap request dalam batch. Karena itu decoding tetap ekonomis. Batasnya kembali berada pada memori. Setiap request yang sedang diproses menyimpan KV cache (key/value cache, yaitu status attention yang tersimpan untuk setiap token sejauh ini). Cache tersebut bertambah pada setiap token yang dihasilkan. Ketika cache memenuhi accelerator, batch tidak dapat diperbesar lagi.
Semua itu tidak memberi Anda angka yang pasti, dan Anda tidak boleh menganggap 5x sebagai rasio hardware yang terukur. Angka tersebut adalah harga yang ditetapkan oleh Anthropic dan dipengaruhi oleh asimetri tersebut. Hal yang dapat Anda periksa sendiri adalah arahnya, dan pemeriksaannya memerlukan waktu sekitar satu menit.
Ukur gap input dan output sendiri
Instal alat yang diperlukan pada komputer Ubuntu mana pun:
sudo apt update && sudo apt install -y curl jq moreutilsSekarang kirim prompt singkat yang meminta jawaban panjang, lalu beri cap waktu pada setiap baris berdasarkan waktu kedatangannya.
curl -sN https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":1000,"stream":true,
"messages":[{"role":"user","content":"Count from 1 to 300, one number per line."}]}' \
| ts -s '%.s'ts -s menambahkan awalan pada setiap baris yang menunjukkan detik yang telah berlalu sejak perintah dimulai. Ada dua hal penting yang dapat dibaca dari output tersebut. Baris content_block_delta pertama menunjukkan waktu hingga token pertama diterima, dan seluruh proses prefill berlangsung di dalamnya. Setiap baris setelah itu merupakan satu langkah kecil decoding, dan cap waktunya terus bertambah hingga message_stop tiba.
Sekarang balik bentuknya. Masukkan dokumen panjang ke dalam prompt dan batasi jawaban hingga beberapa token.
curl -sN https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d "$(jq -n --rawfile doc ./long-document.txt \
'{model:"claude-sonnet-5", max_tokens:16, stream:true,
messages:[{role:"user", content:("Answer in one word. Is this document about networking?\n\n" + $doc)}]}')" \
| ts -s '%.s'Delta pertama membutuhkan waktu lebih lama dibandingkan prompt singkat karena proses prefill harus membaca lebih banyak teks. Setelah delta tersebut tiba, respons hampir langsung selesai karena hanya beberapa token yang perlu didekode. Puluhan ribu token masuk, tetapi waktu hampir tidak bertambah. Beberapa ratus token keluar, dan waktu terus berjalan sepanjang proses.
Setiap respons non-streaming berakhir dengan angka yang menjadi dasar penagihan Anda.
{
"usage": {
"input_tokens": 41283,
"output_tokens": 6,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
}Catat keempat kolom untuk setiap permintaan. output_tokens mencakup extended thinking, sehingga model yang berpikir sebelum menjawab akan menagihkan proses berpikir tersebut dengan tarif output. Untuk menghitung harga prompt sebelum mengirimkannya, POST /v1/messages/count_tokens menerima request body yang sama, mengembalikan {"input_tokens": N} tanpa menjalankan model, dan tidak dikenai biaya. Itu bukan satu-satunya bagian API yang tidak dikenai biaya, dan bagian Claude API yang tidak pernah ditagihkan kepada Anda layak diperiksa sebelum Anda menyusun anggaran proyek pertama.
Biaya Claude per satu juta token per Agustus 2026
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"output_multiple": 5
},
{
"label": "Sonnet 5 (to 31 Aug)",
"input_usd": 2,
"output_usd": 10,
"output_multiple": 5
},
{
"label": "Sonnet 5 (from 1 Sep)",
"input_usd": 3,
"output_usd": 15,
"output_multiple": 5
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"output_multiple": 5
},
{
"label": "Fable 5",
"input_usd": 10,
"output_usd": 50,
"output_multiple": 5
}
]Kolom terakhir adalah output dibagi input, dan nilainya 5 pada setiap baris. Haiku 4.5 mengenakan biaya $1 untuk input dan $5 untuk output. Opus 5 mengenakan biaya $5 untuk input dan $25 untuk output. Fable 5, yang paling mahal, mengenakan biaya $10 untuk input dan $50 untuk output. Apa yang Anda dapatkan dari tarif Fable 5 tersebut layak dibaca sebelum Anda mengabaikan baris teratas itu. Jika naik ke tingkat yang lebih tinggi, kedua sisi dikalikan dengan faktor yang sama. Jadi, total biaya berubah, tetapi perbandingan input terhadap output tetap persis sama.
Sonnet 5 muncul dua kali karena tarif perkenalannya berakhir. Hingga 31 August 2026, tarifnya $2 untuk input dan $10 untuk output. Mulai 1 September 2026, tarif standar sebesar $3 untuk input dan $15 untuk output berlaku. Tarif ini 50% lebih tinggi untuk kedua sisi. Semua contoh di bawah menggunakan tarif August.
Tarif dapat berubah, dan halaman ini bukan tempat untuk memeriksanya. claude.com/pricing adalah sumber informasi resmi. Metode perhitungannya tetap berlaku meskipun tarif berubah.
Ada satu hal yang tidak ditampilkan dalam daftar harga. Dokumentasi Anthropic menyatakan bahwa model Claude 4.7 dan yang lebih baru menggunakan tokenizer baru yang menghasilkan sekitar 30% lebih banyak token untuk teks yang sama dibandingkan tokenizer pada Sonnet 4.6 dan model yang lebih lama. Jika hanya membandingkan harga per satu juta token, model yang lebih baru akan tampak lebih murah, karena dokumen yang sama menghasilkan lebih banyak token pada model tersebut. Bandingkan biaya per tugas yang selesai, dan hitung prompt nyata Anda berdasarkan model yang benar-benar akan digunakan. Masalah yang sama juga terjadi antarapenyedia karena tokenizer mereka berbeda lebih dari itu. Oleh karena itu, menghitung biaya pekerjaan nyata pada Claude dan ChatGPT memberi informasi yang lebih berguna daripada membandingkan kedua daftar tarif secara berdampingan. nilai satu juta token Claude dalam teks nyata menjelaskan seperti apa volume tersebut dalam praktik.
Kapan output mulai mendominasi biaya Anda?
Dengan harga output sebesar 5 kali harga input, titik impasnya mudah dihitung. Misalkan token input adalah I dan token output adalah O. Biaya input adalah I. Biaya output adalah 5 kali O. Output menyumbang lebih dari separuh total biaya ketika 5 kali O lebih besar daripada I, yaitu pada rasio token 5 input berbanding 1 output.
Jadi, jika prompt Anda lebih dari lima kali lebih panjang daripada balasan, input menjadi komponen biaya yang lebih besar. Jika kurang dari itu, output yang lebih besar.
The data behind this chart
[
{
"label": "100:1",
"input_share_pct": 95.2,
"output_share_pct": 4.8
},
{
"label": "75:1",
"input_share_pct": 93.75,
"output_share_pct": 6.25
},
{
"label": "20:1",
"input_share_pct": 80,
"output_share_pct": 20
},
{
"label": "10:1",
"input_share_pct": 66.7,
"output_share_pct": 33.3
},
{
"label": "5:1",
"input_share_pct": 50,
"output_share_pct": 50
},
{
"label": "1:1",
"input_share_pct": 16.7,
"output_share_pct": 83.3
},
{
"label": "1:6",
"input_share_pct": 3.2,
"output_share_pct": 96.8
}
]Pada rasio 100 berbanding 1, output menyumbang 4.8% dari total biaya, sehingga mempersingkat prompt adalah satu-satunya optimasi yang layak dilakukan. Pada rasio 5 berbanding 1, kedua komponen biayanya sama besar. Pada rasio 1 berbanding 6, output menyumbang 96.8% dan prompt hanya menjadi perbedaan pembulatan. Kebanyakan orang keliru memperkirakan rasio mereka sendiri, jadi ambil angkanya dari log sebelum melakukan optimasi apa pun.
Beban kerja agent: konteks panjang, jawaban singkat
Ambil satu langkah agent retrieval: 60,000 token input yang berasal dari dokumen hasil retrieval dan riwayat percakapan, lalu jawaban 800 token. Itu adalah rasio 75 banding 1, yang normal untuk apa pun yang membaca sebelum menulis.
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_cost": 0.06,
"output_cost": 0.004,
"total_cost": 0.064
},
{
"label": "Sonnet 5 (Aug)",
"input_cost": 0.12,
"output_cost": 0.008,
"total_cost": 0.128
},
{
"label": "Opus 5",
"input_cost": 0.3,
"output_cost": 0.02,
"total_cost": 0.32
},
{
"label": "Fable 5",
"input_cost": 0.6,
"output_cost": 0.04,
"total_cost": 0.64
}
]Output merupakan 6.25% dari biaya pemanggilan tersebut pada setiap model, karena rasionya tetap di seluruh daftar harga. Biaya pemanggilan ini adalah $0.32 pada Opus 5, $0.128 pada Sonnet 5 dengan tarif Agustus, dan $0.064 pada Haiku 4.5. Dua ratus langkah tersebut per hari pada Opus 5 berbiaya $64 per hari.
Setelah melihat pembagiannya, pilihan penghematannya jelas. Mengurangi jawaban dari 800 token menjadi 400 hanya menghemat sekitar 3% biaya pemanggilan. Menghapus 20,000 token konteks lama dari prompt menghemat sekitar sepertiganya. Memperketat panjang output pada agent yang lebih banyak membaca hampir tidak memberikan hasil. ke mana token agent coding sebenarnya digunakan menguraikan apa saja yang mengisi prompt tersebut sejak awal.
Beban kerja generasi: prompt pendek, draf panjang
Sekarang balik bentuknya. Brief 2,000 token dan draf 12,000 token, dengan rasio 1 banding 6.
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_cost": 0.002,
"output_cost": 0.06,
"total_cost": 0.062,
"batch_total_cost": 0.031
},
{
"label": "Sonnet 5 (Aug)",
"input_cost": 0.004,
"output_cost": 0.12,
"total_cost": 0.124,
"batch_total_cost": 0.062
},
{
"label": "Opus 5",
"input_cost": 0.01,
"output_cost": 0.3,
"total_cost": 0.31,
"batch_total_cost": 0.155
},
{
"label": "Fable 5",
"input_cost": 0.02,
"output_cost": 0.6,
"total_cost": 0.62,
"batch_total_cost": 0.31
}
]Output merupakan 96.8% dari tagihan ini. Opus 5 berbiaya $0.31 per draf, sedangkan Haiku 4.5 berbiaya $0.062. Selisih lima kali lipat tersebut hampir seluruhnya berasal dari sisi output. Di sinilah model yang lebih murah memberikan penghematan terbesar.
Kolom terakhir menunjukkan pekerjaan yang sama melalui Batch API, yang memberikan potongan 50% untuk input dan output. Biaya Opus 5 turun menjadi $0.155 per draf. Batch mengembalikan hasil dalam 24 jam, bukan langsung. Karena itu, Batch cocok untuk pembuatan laporan pada malam hari dan klasifikasi massal. Batch tidak cocok untuk pekerjaan yang harus ditunggu langsung oleh seseorang.
Routing model memberikan manfaat di sini, berbeda dari langkah agen. Jika bagian pekerjaan yang panjang bersifat mekanis, seperti memformat ulang teks atau memperluas outline yang sudah Anda setujui, model murah dapat menghasilkan token tersebut dengan biaya seperlima. memilih antara Opus, Sonnet, dan Haiku membahas letak batas kualitas yang sebenarnya.
Caching mengurangi biaya input, dan hanya input
Prompt caching menyimpan awalan prompt di server dan mengenakan sebagian tarif input untuk membacanya kembali. Per Agustus 2026, pengalinya adalah 1.25x tarif input dasar untuk menulis cache berdurasi 5 menit, 2x untuk menulis cache berdurasi 1 jam, dan 0.1x untuk membaca cache yang cocok.
Output tidak termasuk dalam skema tersebut. Tidak ada output yang di-cache. Setiap token yang ditulis model ditagihkan dengan tarif output penuh setiap kali, terlepas dari seberapa banyak prompt yang dikembalikan sebagai cache yang cocok.
Gunakan langkah agent yang sama pada Opus 5, dengan 55,000 dari 60,000 token input dilayani dari cache yang masih hangat.
The data behind this chart
[
{
"label": "No cache",
"input_cost": 0.3,
"output_cost": 0.02,
"total_cost": 0.32
},
{
"label": "55k prefix cache read",
"input_cost": 0.0525,
"output_cost": 0.02,
"total_cost": 0.0725
}
]Biaya panggilan turun dari $0.32 menjadi $0.0725. Biaya output tidak berubah: $0.02 sebelumnya dan $0.02 sesudahnya. Caching mengurangi tagihan dan mengubah komposisinya. Output mencakup 6.25% dari panggilan tersebut. Kini porsinya lebih dari seperempat total biaya, sehingga pilihan penghematan berikutnya yang paling efektif juga berubah.
Panggilan pertama membayar biaya penulisan cache. Penulisan cache berdurasi 5 menit dikenai biaya 1.25x input dasar, sehingga balik modal setelah satu kali cache digunakan kembali. Penulisan cache berdurasi 1 jam dikenai biaya 2x, sehingga memerlukan dua kali penggunaan kembali. pengali penulisan dan pembacaan, serta titik saat caching tidak lagi menguntungkan menjelaskan perhitungan tersebut.
Empat tuas yang dapat Anda kendalikan
- Tetapkan
max_tokenspada panjang output p95, bukan pada maksimum model. - Arahkan langkah-langkah yang panjang ke model yang lebih murah.
- Lakukan batch pada semua pekerjaan yang tidak sedang ditunggu siapa pun.
- Hapus instruksi yang membuat balasan menjadi lebih panjang.
max_tokens adalah batas maksimum yang tidak dapat dilampaui. Menetapkannya pada nilai tinggi tidak menimbulkan biaya dengan sendirinya, karena Anda ditagih berdasarkan token yang dihasilkan, bukan berdasarkan batas maksimum tersebut. Batas yang besar hanya menghilangkan pembatas pada balasan yang berjalan tidak sesuai harapan. Ambil distribusi output_tokens dari log Anda, tetapkan batas sedikit di atas persentil ke-95, lalu tangani stop_reason: "max_tokens" dalam kode dengan melanjutkan respons atau melakukan retry. Pemotongan yang terdeteksi biayanya lebih rendah daripada 4.000 token bertele-tele yang harus Anda bayar lalu buang. Extended thinking juga masuk ke output_tokens, jadi tetapkan anggarannya berdasarkan bukti yang sama.
Routing efektif jika bagian termahal dari suatu langkah adalah volumenya, bukan penilaiannya. Pertahankan model yang kuat untuk pengambilan keputusan, lalu serahkan pengetikan kepada model yang lebih murah. Ukur versi yang dirutekan menggunakan set evaluasi Anda sendiri terlebih dahulu, karena model murah yang memerlukan dua percobaan biayanya lebih besar daripada satu percobaan dengan model mahal.
Batching adalah satu-satunya tuas yang memberikan diskon pada output. Diskon 50% untuk input dan output, hasil tersedia dalam 24 jam, dan semua pekerjaan terjadwal memenuhi syarat.
Tuas terakhir adalah hal yang sering dilewati orang. Frasa seperti "bersikap menyeluruh" dan "jelaskan penalaran Anda" menetapkan panjang output pada setiap panggilan yang akan Anda lakukan. Ganti frasa tersebut dengan bentuk yang Anda inginkan: "Jawab dalam paling banyak tiga kalimat", atau "Kembalikan hanya objek JSON, tanpa pengantar". System prompt yang menambahkan 300 token ke setiap balasan biayanya lima kali lipat dibandingkan biaya 300 token yang sama pada prompt. mengendalikan biaya agent yang terus berjalan membahas sisi pemantauan, dan menentukan apakah API atau langganan tetap lebih murah untuk pola penggunaan Anda sebaiknya diputuskan sebelum Anda menghabiskan waktu seminggu untuk mengoptimalkan biaya per token yang sebenarnya sudah dapat ditanggung oleh langganan. Bagi satu developer, hal ini terutama bergantung pada apakah Claude Pro seharga $20 per bulan beserta batas penggunaan yang menyertainya mencukupi pekerjaan yang jika tidak akan Anda ukur berdasarkan penggunaan. Jika Anda sudah mencapai batas tersebut di tengah sesi, menentukan jendela mana yang sedang Anda tunggu harus dilakukan terlebih dahulu, karena solusinya adalah model yang lebih kecil, konteks yang lebih ringan, kredit penggunaan tambahan, atau memindahkan pekerjaan tersebut ke API dengan penagihan berdasarkan penggunaan. Jika API dengan penagihan berdasarkan penggunaan ternyata menjadi pilihan yang lebih murah untuk pekerjaan tersebut, beralih ke paket yang lebih kecil atau membatalkannya tidak menghilangkan bulan yang sudah Anda bayar, sehingga perpindahan itu tidak menimbulkan biaya tambahan. Jika paket yang Anda bandingkan dengan Pro adalah milik ChatGPT, bukan API dengan penagihan berdasarkan penggunaan, perbandingan dua tingkatan langganan dengan harga yang ditampilkan berdampingan menunjukkan mana yang lebih murah untuk pekerjaan coding. Jika pertanyaan tersebut diajukan untuk sebuah tim, bukan satu developer, perhatikan bahwa Claude Enterprise menggabungkan biaya per seat dengan token yang ditagihkan berdasarkan penggunaan pada tarif API yang sama, sehingga setiap tuas di halaman ini tetap berlaku untuk bagian tagihan yang dihitung berdasarkan penggunaan.
FAQ
Mengapa token output lebih mahal daripada token input?
Pembuatannya memerlukan waktu akselerator yang jauh lebih besar untuk setiap token. Prompt diproses dalam satu forward pass pada seluruh isinya, sehingga satu pembacaan bobot model mencakup ribuan token dan perangkat keras dibatasi oleh throughput operasi perkalian. Balasan dihasilkan satu token setiap kali, dan setiap token memerlukan forward pass tersendiri yang kembali membaca seluruh bobot model. Karena itu, perangkat keras dibatasi oleh bandwidth memori. Anthropic menetapkan harga output sebesar lima kali harga input di seluruh katalog saat ini, mulai dari Haiku 4.5 hingga Fable 5.
Apakah prompt caching membuat token output lebih murah?
Tidak. Prompt caching hanya berlaku untuk input. Per Agustus 2026, pembacaan cache dikenai biaya 0.1x tarif input dasar, sedangkan penulisan cache dikenai biaya 1.25x untuk durasi 5 menit atau 2x untuk durasi 1 jam. Output ditagihkan dengan tarif penuh pada setiap panggilan, terlepas dari tindakan cache. Karena itu, caching mengubah struktur tagihan sekaligus nilainya: setelah sisi input menyusut, output menjadi bagian yang paling layak dioptimalkan.
Apakah max_tokens yang tinggi membuat saya membayar lebih jika balasannya pendek?
Tidak. Anda ditagih berdasarkan token yang benar-benar dihasilkan model, sehingga max_tokens adalah batas atas, bukan kuota yang dipesan. Namun, parameter ini tetap penting karena merupakan satu-satunya batas keras untuk mencegah balasan yang terus bertambah. Tetapkan nilainya sedikit di atas persentil ke-95 dari output_tokens yang Anda amati, lalu tangani stop_reason: "max_tokens" dalam kode agar tidak mengirimkan jawaban yang terpotong tanpa pemberitahuan.
Bagaimana cara mengetahui rasio token input terhadap output saya sendiri?
Catat input_tokens, output_tokens, cache_read_input_tokens, dan cache_creation_input_tokens dari objek usage pada setiap respons, lalu bagi totalnya selama satu minggu. Jika rasio input terhadap output lebih dari 5 banding 1, biaya utama Anda berasal dari prompt. Karena itu, cache bagian yang stabil dan ringkas bagian lainnya. Jika rasionya di bawah itu, biaya utama Anda berasal dari balasan. Batasi panjangnya, lalu pindahkan langkah yang menghasilkan sebagian besar output ke model yang lebih murah atau ke Batch API.