Mengapa Claude Mahal? Hitung Biaya Token API
Token output berbiaya lima kali token input, dan setiap giliran membaca ulang seluruh konteks. Lihat hitungan satu sesi serta empat cara menguranginya.
Mengapa Claude mahal? Jawaban singkat
Claude mahal karena empat alasan yang saling menambah biaya. Token output dihargai lima kali lipat dari token input. API tidak menyimpan memori percakapan Anda, sehingga seluruh riwayat dikirim ulang dan ditagihkan lagi pada setiap giliran. Agent mengubah satu pertanyaan menjadi puluhan panggilan API, dan setiap panggilan membawa riwayat yang terus bertambah. Selain itu, model terdepan dihargai berdasarkan tingkat kesulitan pekerjaan yang dilakukannya, bukan berdasarkan biaya menjalankan model kecil.
Token adalah bagian dari teks. Sebagai panduan kasar, satu token terdiri atas sekitar empat karakter, atau sekitar 0.75 kata dalam bahasa Inggris. Tarif dinyatakan per satu juta token dan ditulis sebagai MTok (million tokens). Semua tarif di bawah ini adalah tarif Claude API yang dipublikasikan per August 2026.
Sebagian besar tagihan yang mengejutkan berasal dari alasan kedua dan ketiga dalam daftar tersebut. Biasanya, orang mengira jawaban yang ditulis Claude adalah sumber biaya. Dalam sesi agent, penulisan tersebut sering kali kurang dari sepersepuluh total tagihan.
Tarif yang dipublikasikan, agar kita sepakat mengenai angkanya
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]Perhatikan polanya, bukan angka absolutnya. Setiap model mengenakan biaya output tepat lima kali lebih tinggi daripada input. Opus 5 dikenai biaya 5 dolar per satu juta token input dan 25 dolar per satu juta token output. Haiku 4.5 dikenai biaya 1 dan 5. Jadi, selisih antara model termurah dan termahal adalah lima kali lipat, dan selisih antara membaca dan menulis juga lima kali lipat.
Sonnet 5 menggunakan tarif perkenalan sebesar 2 dan 10 dolar per satu juta token hingga 31 Agustus 2026. Mulai 1 September 2026, tarifnya berubah menjadi 3 dan 15. Tarif berubah seiring perilisan model, jadi periksa tarif terbaru sebelum menggunakannya untuk menyusun anggaran. Tidak ada free tier di bawah tabel ini, meskipun akun baru memperoleh kredit kecil dan beberapa bagian API sama sekali tidak dikenai biaya.
Kolom terakhir adalah tarif pembacaan cache. Kolom ini paling menentukan sebagian besar tagihan. Kita akan membahasnya lagi setelah perhitungannya.
Mengapa token output berbiaya lima kali lipat dibandingkan token input?
Membaca dan menulis membutuhkan jumlah kerja yang berbeda. Token input diproses dalam satu lintasan. Model membaca seluruh prompt sekaligus, lalu pekerjaannya berjalan secara paralel di seluruh bagian prompt. Karena itu, prompt dengan 60,000 token tidak memerlukan waktu baca 60,000 kali lebih lama daripada prompt dengan 1,000 token.
Token output dihasilkan satu per satu. Setiap token baru memerlukan lintasan tersendiri melalui model dan memerlukan semua token sebelumnya sebagai konteks. Menulis 1,000 token berarti melakukan 1,000 lintasan secara berurutan. Pekerjaan serial ini tidak dapat dibagi seperti proses membaca. Akibatnya, setiap token output menggunakan hardware lebih lama.
Karena itu, perintah "buat jawabannya lebih singkat" tidak seefektif yang diperkirakan banyak orang. Cara ini hanya mengurangi bagian yang lebih kecil dari biaya agent.
Mengapa seluruh percakapan saya ditagihkan lagi pada setiap giliran?
Claude API bersifat stateless. Tidak ada percakapan di sisi Anthropic yang hanya Anda tambahi satu pesan. Setiap request membawa seluruh riwayat pesan, lalu model membaca semuanya sebelum menghasilkan respons. Jadi, giliran 30 juga ditagihkan untuk giliran 1 hingga 29.
Artinya, biaya percakapan bertambah lebih cepat daripada panjangnya. Giliran 1 hanya menagihkan context berukuran kecil. Giliran 40 menagihkan context berukuran besar. Jika seluruh empat puluh giliran dijumlahkan, token yang ditagihkan bisa berkali-kali lipat dari jumlah token yang pernah ditulis.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]Sesi di atas dimulai dengan 20,000 token. Jumlah ini mencakup system prompt, definisi tool, dan file pertama yang dibuka agent. Pada giliran 40, context tersebut berisi 100,000 token. Jika dirata-ratakan untuk seluruh empat puluh giliran, sekitar 60,000 token dibaca pada setiap request.
Mengapa biaya agent jauh lebih tinggi daripada chat?
Chat menggunakan satu request untuk setiap pertanyaan. Agent menggunakan satu request untuk setiap langkah. Membaca file adalah satu langkah. Menjalankan pengujian adalah satu langkah. Membaca output pengujian adalah satu langkah. Mengedit file adalah satu langkah. Empat puluh langkah untuk menyelesaikan satu tugas merupakan hal yang biasa bagi coding agent.
Dua biaya tambahan muncul saat tool digunakan. Definisi tool menjadi input token pada setiap request karena model harus diberi tahu tentang tool yang tersedia setiap kali. Anthropic memublikasikan overhead tersebut: system prompt untuk penggunaan tool berisi 286 token pada Opus 5 dengan tool_choice diatur ke auto, ditambah token dari skema tool Anda sendiri. Beberapa tool sisi server juga memiliki biaya terpisah. Web search dikenai biaya $10 per 1,000 pencarian, di luar token yang digunakan oleh hasil pencarian.
Setiap hasil tool juga menjadi context permanen. Perintah yang mencetak 3,000 baris akan memasukkan 3,000 baris tersebut ke setiap request selama sisa sesi. Penggunaan token per sesi yang dilaporkan Claude Code membuat hal ini terlihat: pantau angka input yang meningkat tepat setelah menjalankan perintah yang menghasilkan banyak output.
Perhitungan pada satu sesi nyata
Berikut contoh nyata coding agentik selama satu jam dengan Opus 5. Terdapat empat puluh permintaan API. Konteks bertambah dari 20,000 menjadi 100,000 token, sehingga rata-ratanya sekitar 60,000 token per permintaan. Model menulis sekitar 700 token per permintaan. Jumlah ini terdiri atas beberapa pemanggilan tool singkat dan beberapa blok kode yang lebih panjang.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]Perhatikan pembagiannya. Biaya membaca adalah 12.00 dolar, sedangkan biaya menulis adalah 0.70 dolar. Jadi, output yang benar-benar Anda baca hanya sekitar lima persen dari total tagihan. Model menulis 28,000 token dan ditagih untuk membaca 2,400,000 token. Tidak ada yang mengetik 2.4 juta token. 100,000 token yang sama dibaca berulang kali.
Level 1: caching prompt, yang paling besar
Caching prompt menyimpan bentuk prompt Anda yang telah diproses untuk prefix yang stabil. Pada request berikutnya, prefix tersebut dibaca dari cache dan tidak diproses ulang. Penulisan ke cache dikenai biaya 1.25 kali tarif input untuk cache lima menit, atau 2 kali untuk cache satu jam. Pembacaan dari cache dikenai biaya 0.1 kali tarif input. Pada Opus 5, biayanya adalah 0.50 dolar per satu juta token, bukan 5 dolar.
Terapkan perhitungan tersebut pada sesi di atas. Setiap 100,000 token ditulis ke cache satu kali selama percakapan berkembang. Sebanyak 2,300,000 token input lainnya menjadi cache read.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48Tandai bagian yang dapat di-cache dengan field cache_control. Letakkan breakpoint setelah konten yang tidak berubah antar-turn: system prompt dan definisi tool. Dokumen panjang yang terus Anda rujuk juga harus ditempatkan dalam blok stabil yang sama.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}Urutan prompt sekarang menentukan biaya. Cache hit memerlukan kecocokan persis sejak awal prompt. Karena itu, semua hal yang berubah pada setiap request harus ditempatkan setelah semua hal yang tidak berubah. Jika Anda menempatkan timestamp di bagian atas system prompt, cache akan rusak pada setiap turn. Seluruh prefix menjadi cache miss, dan Anda harus membayar 1.25 kali tarif input untuk menulisnya kembali.
Respons menunjukkan apakah konfigurasi tersebut berhasil. Kirim request, lalu baca blok penggunaan.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'Setiap respons menyertakan objek usage seperti berikut:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Jika request ulang masih menampilkan 0 dalam cache_read_input_tokens, berarti cache tidak digunakan. Penyebab yang umum adalah adanya perubahan pada bagian sebelum breakpoint. Cache lima menit juga kedaluwarsa. Karena itu, request yang dikirim enam menit kemudian menjadi cache miss dan diikuti penulisan baru ke cache.
Tingkat 2: arahkan tugas sederhana ke model yang lebih kecil
Sebagian besar giliran dalam sesi agen tidak sulit. Membuka file, menjalankan formatter, atau membaca diff. Tugas-tugas tersebut tidak memerlukan model frontier. Mengarahkannya ke Haiku 4.5 menurunkan tarif input dari 5 dolar per juta menjadi 1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]Sesi yang sama berbiaya 12.70 dolar pada Opus 5 tanpa caching, 2.48 dengan caching, 0.99 pada Sonnet 5 dengan caching, dan 0.50 pada Haiku 4.5 dengan caching. Caching saja menghapus sekitar delapan puluh persen biaya. Pemilihan model menghapus sebagian besar biaya yang tersisa.
Berikut catatan pentingnya. Model yang lebih murah tetapi memberikan jawaban yang salah dapat membuat Anda mengulangi seluruh sesi, ditambah waktu Anda sendiri. Tentukan rute berdasarkan tingkat kesulitan tugas, bukan harga. Aturan ini juga berlaku ke arah sebaliknya: Claude Fable 5 tercantum di atas Opus 5 dengan harga $10 dan $50 per juta, jadi baca apa yang Anda dapatkan dari tarif tersebut sebelum mengarahkan giliran ke sana. Memilih antara Opus, Sonnet, dan Haiku membahas kemampuan masing-masing model dalam menangani tugas.
Kebersihan konteks
Setiap token yang Anda biarkan berada dalam konteks akan ditagihkan pada setiap giliran berikutnya. Karena itu, menghapus token lebih awal jauh lebih menguntungkan daripada menghapusnya belakangan. File berisi 5,000 token yang dimasukkan pada giliran ke-5 dalam sesi sepanjang 40 giliran akan dibaca 35 kali lagi. Itu berarti tambahan 175,000 token input, yang hampir mencapai satu dolar pada Opus 5 hanya karena satu paste yang tidak dipertimbangkan.
Empat kebiasaan yang memengaruhi jumlah tersebut:
- Mulai sesi baru untuk tugas baru, bukan melanjutkan sesi kemarin.
- Filter output perintah yang berisik sebelum output tersebut mencapai model, menggunakan sesuatu seperti
head -50, bukan setelahnya. - Minta satu fungsi yang Anda perlukan, bukan seluruh file.
- Jika sesi yang panjang tidak lagi menghasilkan kemajuan, minta ringkasan lalu mulai lagi dari ringkasan tersebut. Ringkasan hanya terdiri atas beberapa ratus token. Transkrip dapat mencapai seratus ribu token.
Level 4: batch semua proses yang tidak interaktif
Batch API memproses permintaan secara asinkron dan memberikan diskon 50 persen untuk input maupun output. Jika suatu pekerjaan tidak memerlukan jawaban dalam satu detik berikutnya, jalankan pekerjaan tersebut secara batch. Ini mencakup klasifikasi, ekstraksi, pembuatan ringkasan backlog, dan proses evaluasi. Diskon batch dapat digabungkan dengan caching prompt. Diskon ini tidak berlaku untuk sesi interaktif karena sesi tersebut tidak memiliki proses yang dapat ditunda.
Apakah saya ditagih terlalu mahal?
Itulah pertanyaan sebenarnya di balik “mengapa Claude mahal”, jadi berikut jawaban langsungnya. Tarifnya dipublikasikan, sama untuk semua orang pada tingkat standar, dan dikenakan per token. Pengecualiannya adalah kontrak yang dinegosiasikan. Bahkan dalam kontrak tersebut, harga Claude Enterprise menambahkan biaya per seat di depan token yang tetap dihitung berdasarkan pemakaian, bukan menggantikannya. Tidak ada komponen tagihan yang bersifat diskresioner. Hal yang tidak dapat diberi tahu oleh daftar tarif adalah apakah Anda memperoleh manfaat yang sepadan, karena tarif menghitung token sedangkan Anda memedulikan hasil.
Karena itu, hitung harga berdasarkan hasilnya. Sesi di atas menelan biaya 12.70 dolar tanpa cache. Jika sesi tersebut merilis fitur yang biasanya memerlukan waktu satu jam untuk Anda kerjakan, biayanya murah. Jika sesi tersebut menghabiskan empat puluh giliran tanpa menghasilkan kemajuan, 12.70 dolar yang sama tidak menghasilkan apa pun, dan tarifnya bukan masalahnya.
Inilah bagian yang perlu diingat. Tagihan Anda bertambah berdasarkan jumlah token, bukan berdasarkan nilai yang dihasilkan. Sesi yang produktif dan sesi yang sia-sia dengan panjang yang sama akan dikenai biaya yang sama. Itulah sebabnya empat tuas tersebut lebih penting daripada daftar tarif: Anda tidak dapat menegosiasikan harga per token, tetapi Anda menentukan jumlah token yang diperlukan pekerjaan tersebut.
Jadi, lacak dolar per tugas yang selesai, bukan dolar per bulan. Jika angka tersebut turun saat Anda menyempurnakan caching dan routing, berarti konfigurasi Anda membaik meskipun total bulanan meningkat, karena peningkatan total itu berasal dari lebih banyak pekerjaan yang diselesaikan.
Hal yang tidak menurunkan tagihan
Beberapa saran populer hanya memberi sedikit dampak. Meminta model untuk "ringkas" mengurangi output, dan output hanya mencapai lima persen dari contoh tagihan. Memperpendek pertanyaan Anda sendiri menghemat beberapa ratus token dari konteks 60,000 token. Menonaktifkan extended thinking hanya membantu jika token untuk thinking benar-benar menjadi bagian besar dari output Anda. Usage block menunjukkan hal tersebut sehingga Anda tidak perlu menebak.
Context window yang lebih besar juga tidak otomatis meningkatkan biaya. Pada Claude 4.6 dan versi setelahnya, context window penuh sebesar satu juta token ditagihkan dengan tarif standar per token. Jadi, permintaan 900,000 token memiliki biaya per token yang sama dengan permintaan 9,000 token. Ukuran window tidak menentukan harga. Isi yang Anda masukkan ke dalam window-lah yang menentukan.
Dua hal lain perlu direncanakan, bukan ditangani dalam satu sesi. Jika penggunaan Anda berlangsung setiap hari dan bersifat interaktif, bandingkan pembayaran per token dengan paket tetap: perbandingan biaya API dan langganan menghitungnya. Jika paket tetap lebih menguntungkan dan Anda juga sedang mempertimbangkan vendor lain, perbandingan paket Claude dan ChatGPT secara berdampingan melakukan perbandingan yang sama untuk keduanya. Jika agent berjalan tanpa pengawasan pada server, tetapkan batas pengeluaran maksimum sebelum menyesuaikan hal lain. Hal tersebut dibahas dalam kontrol biaya untuk agent AI pada VPS. Untuk gambaran skala, apa yang sebenarnya dapat dibeli dengan satu juta token Claude mengubah daftar tarif menjadi halaman teks.
FAQ
Mengapa tagihan Claude saya melonjak setelah mulai menggunakan agent?
Karena agent mengirim banyak permintaan untuk setiap pertanyaan, dan setiap permintaan menyertakan seluruh percakapan hingga saat itu. Chat mengirim satu permintaan untuk setiap pertanyaan. Coding agent mengirim satu permintaan untuk setiap langkah, dan 40 langkah untuk satu tugas merupakan hal yang normal. Setiap permintaan tersebut ditagihkan berdasarkan seluruh konteks, sehingga sesi yang berakhir pada 100,000 token dapat ditagihkan lebih dari dua juta token input secara total. Baca input_tokens dan cache_read_input_tokens dalam respons API untuk melihatnya secara langsung.
Apakah prompt caching benar-benar mengurangi tagihan sebesar itu?
Dalam contoh perhitungan, biayanya turun dari 12.70 dolar menjadi 2.48 dolar, karena pembacaan cache dikenai biaya sepersepuluh dari tarif input. Besarnya penghematan sepenuhnya bergantung pada hit rate Anda. Dengan cache lima menit, fitur ini sudah balik modal setelah satu kali pembacaan, karena penulisan dikenai biaya 1.25 kali tarif input, sedangkan pembacaan dikenai biaya 0.1 kali tarif input. Jika prompt Anda berubah di bagian awal pada setiap permintaan, Anda tidak mendapatkan hit sama sekali dan membayar biaya tambahan penulisan tanpa manfaat. Konfirmasikan dengan cache_read_input_tokens sebelum menganggap fitur ini berfungsi.
Apakah saya sebaiknya menggunakan Haiku untuk semuanya?
Tidak. Haiku 4.5 berbiaya 1 dolar per satu juta token input, sedangkan Opus 5 berbiaya 5, sehingga penghematannya nyata untuk pekerjaan sederhana bervolume tinggi seperti klasifikasi dan routing. Jawaban yang salah pada pekerjaan sulit dapat menimbulkan biaya lebih besar daripada penghematan model, karena Anda harus membayar percobaan ulang dan waktu Anda sendiri. Pola yang dapat diandalkan adalah penggunaan campuran: model kecil untuk langkah mekanis, dan model frontier untuk langkah yang memerlukan penilaian.
Apakah API lebih murah daripada langganan Claude?
Hal ini bergantung pada kestabilan penggunaan Anda. Langganan memiliki harga bulanan tetap dengan batas penggunaan. API menggunakan skema bayar per token tanpa batas atas, sehingga lebih murah jika penggunaan Anda ringan atau berlangsung dalam beberapa lonjakan, dan lebih mahal jika Anda menggunakannya secara intensif setiap hari kerja. Ambil rata-rata token per hari dari blok penggunaan, hitung biayanya berdasarkan tarif model Anda, lalu bandingkan angka tersebut dengan harga paket yang, untuk tingkat awal, dijelaskan dalam biaya Claude Pro dan batas penggunaan yang diberlakukannya. Jika hasilnya lebih menguntungkan API, membatalkan paket atau beralih ke tingkat yang lebih rendah tidak membuat bulan yang sudah Anda bayar menjadi sia-sia, karena akses Anda tetap berlaku hingga akhir periode penagihan saat ini.