Pilih model Claude mana? Panduan biaya API
Bandingkan tarif Claude Opus 4.8, Sonnet 5, dan Haiku 4.5 per 23 Juli 2026. Simak perbandingan biaya untuk 100.000 tugas agar anggaran API Anda tetap efisien.
Model Claude mana yang harus saya gunakan?
Jawaban singkat untuk model Claude mana yang harus Anda gunakan: mulailah dengan Claude Opus 4.8, dan beralihlah hanya jika ada alasan yang jelas. Panduan Anthropic juga sama. "Jika Anda tidak yakin model mana yang harus digunakan, mulailah dengan Claude Opus 4.8 untuk pengodean agen yang kompleks dan pekerjaan perusahaan." Gunakan Claude Sonnet 5 jika tugas sudah ditentukan dengan jelas dan Anda menjalankannya berkali-kali dalam sehari. Gunakan Claude Haiku 4.5 untuk pekerjaan mekanis bervolume tinggi di mana Anda sudah mengetahui bentuk jawaban yang benar. Claude Fable 5 berada di atas semuanya, untuk agen yang berjalan lama.
Pilihan tersebut memiliki biaya. Berikut adalah tarif pada Claude API (application programming interface) per 23 Juli 2026, per satu juta token, yang ditulis dalam dokumentasi sebagai MTok.
- Claude Fable 5 (
claude-fable-5): $10 / MTok masuk, $50 / MTok keluar. 1M konteks. - Claude Opus 4.8 (
claude-opus-4-8): $5 masuk, $25 keluar. 1M konteks. - Claude Opus 4.7 (
claude-opus-4-7): $5 masuk, $25 keluar. 1M konteks. - Claude Sonnet 5 (
claude-sonnet-5): $2 masuk, $10 keluar pada harga perkenalan hingga 31 Agustus 2026. Harga standar $3 masuk, $15 keluar berlaku pada 1 September 2026. 1M konteks. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 masuk, $5 keluar. 200K konteks.
Identifikasi tersebut sudah lengkap sesuai tulisan. Tidak ada tambahan apa pun pada identifikasi tersebut.
Ukuran tidak dikenakan biaya tambahan pada model 1M-token: "Permintaan 900k-token ditagih dengan tarif per-token yang sama dengan permintaan 9k-token."
Kegunaan setiap model
Anthropic mendeskripsikan lini produk mereka dalam satu baris per model, dan deskripsi tersebut lebih akurat daripada papan peringkat mana pun.
- Claude Fable 5: "Kecerdasan generasi berikutnya untuk agen yang berjalan lama." Memiliki latensi paling lambat di antara keempatnya.
- Claude Opus 4.8: "Untuk pengodean agen yang kompleks dan pekerjaan perusahaan." Latensi moderat.
- Claude Sonnet 5: "Kombinasi terbaik antara kecepatan dan kecerdasan." Cepat.
- Claude Haiku 4.5: "Model tercepat dengan kecerdasan mendekati frontier."
Haiku 4.5 juga memiliki batasan yang menentukan kesesuaian tugas sebelum mempertimbangkan harga. Context window model ini adalah 200K token, bukan 1M, sehingga repositori besar atau transkrip agen yang panjang tidak akan muat. Output maksimum pada synchronous Messages API adalah 64K token, berbeda dengan 128K pada model lainnya, dan batas pengetahuan (knowledge cutoff) yang andal adalah Februari 2025, sementara tiga model lainnya berada pada Januari 2026.
Berapa biaya yang harus saya keluarkan untuk beban kerja nyata?
Setiap model dalam lini produk menetapkan harga output sebesar lima kali lipat dari tarif input. Opus 4.8 adalah $5 untuk input dan $25 untuk output. Haiku 4.5 adalah $1 untuk input dan $5 untuk output. Rasio ini berlaku di seluruh rentang produk, sehingga model yang Anda pilih sangat berpengaruh pada pekerjaan yang menghasilkan banyak output.
Pekerjaan agentic termasuk dalam kategori tersebut, karena token berpikir (thinking tokens) ditagih sebagai token output dan dihitung ke dalam max_tokens meskipun teks tersebut tidak pernah sampai kepada Anda. Pada Fable 5, Opus 4.8, Opus 4.7, dan Sonnet 5, ringkasan penalaran dihilangkan secara default, sehingga field thinking akan kosong. Penagihan tetap sama: "Bagaimanapun, blok tersebut ditagih dengan cara yang sama dan dikembalikan dengan cara yang sama dalam percakapan multi-turn." Apa yang sebenarnya mengisi tagihan token Claude menjelaskan hal tersebut secara mendalam.
Apakah fitur thinking berjalan atau tidak berbeda di antara model yang Anda bandingkan, hal ini akan merusak uji biaya jika Anda melewatkannya. Pada Sonnet 5 dan Fable 5, fitur thinking sudah aktif dan tidak memerlukan konfigurasi. Pada Opus 4.8 dan Opus 4.7, fitur ini mati hingga Anda mengatur thinking: {type: "adaptive"} dalam request. Samakan konfigurasi pada kedua sisi sebelum Anda menganalisis angka-angkanya.
Mengapa model termurah bisa menjadi yang termahal
Ambil satu tugas pemrograman mandiri. Permintaan tersebut membawa 60,000 token konteks, dan model menghasilkan 8,000 token output termasuk proses berpikir. Tanpa caching, sehingga perhitungan tetap terlihat.
Pada Opus 4.8: 0.06 MTok input pada $5 adalah $0.30, dan 0.008 MTok output pada $25 adalah $0.20. Satu percobaan membutuhkan biaya $0.50. Pada Haiku 4.5, percobaan yang sama adalah $0.06 ditambah $0.04, sehingga totalnya $0.10.
Haiku lima kali lebih murah per percobaan, yang terlihat sangat hemat sampai Anda melihat dampak dari percobaan yang gagal. Anda membaca jawaban yang salah, yang membuang waktu Anda. Anda mengirimnya kembali sebagai konteks pada percobaan ulang, sehingga setiap percobaan menjadi lebih besar dari sebelumnya. Dan ketika percobaan ketiga masih gagal, Anda tetap beralih ke model yang lebih kuat: $0.30 dari Haiku ditambah $0.50 dari Opus adalah $0.80, atau 60% lebih mahal daripada menjalankan Opus satu kali.
Jadi pertanyaan penentunya adalah seberapa murah Anda dapat memverifikasi jawaban tersebut. Ketika jawaban yang salah dapat diketahui dalam satu detik, model kecil adalah pilihan yang ekonomis. Ketika mendeteksi kesalahan berarti harus membaca diff dengan teliti, model kecil membuang waktu Anda yang tidak muncul dalam tagihan.
Kapan model yang lebih kecil lebih unggul
Haiku 4.5 adalah pilihan yang tepat dalam kasus berikut:
- Pekerjaan subagent mekanis. Subagent yang mengubah nama file atau mengumpulkan hasil pencarian tidak memerlukan penalaran tingkat tinggi. Ini adalah pola standar setelah Anda membangun AI agent dengan Claude dan memberikan alat bantu.
- Triase log. Menentukan apakah sebuah baris adalah gangguan atau layak diperiksa manusia adalah penilaian sempit dengan mode kegagalan yang jelas.
- Klasifikasi terhadap kumpulan label tetap. Output bersifat pendek dan akurasi dapat diukur pada sebuah sampel.
- Panggilan produksi volume tinggi. Pada 100,000 eksekusi per hari, selisih biaya per-token bukan lagi sekadar angka pembulatan. Ini adalah bentuk umum dari alur kerja AI yang terhubung ke n8n.
- Segala hal di mana kecepatan respons penting bagi pengguna. Haiku 4.5 adalah model tercepat dalam lini produk ini.
Satu batasan khusus milik Haiku. Prompt minimum yang dapat disimpan dalam cache adalah 4,096 token, dibandingkan dengan 1,024 pada Opus 4.8 dan Sonnet 5. Di bawah batas minimum tersebut, "setiap permintaan untuk menyimpan cache kurang dari jumlah token ini akan diproses tanpa caching, dan tidak ada error yang dikembalikan". Blok instruksi 1,500-token yang tersimpan di cache pada Sonnet 5 tidak akan tersimpan di cache pada Haiku 4.5 secara diam-diam. Tandanya adalah cache_creation_input_tokens dan cache_read_input_tokens keduanya bernilai nol, yang mana menjaga biaya agent yang selalu aktif tetap rendah mencakup hal tersebut bersama cara lain kehilangan cache.
Faktor yang mengubah hasil jawaban
Setiap faktor ini memberikan dampak yang lebih besar daripada nama model itu sendiri.
Effort. output_config.effort mengontrol seberapa banyak proses yang dilakukan model sebelum memberikan jawaban. Level yang tersedia adalah low, medium, high, xhigh, dan max, dengan high sebagai nilai default: "Mengatur effort ke high menghasilkan perilaku yang persis sama dengan tidak menggunakan parameter effort sama sekali." Parameter ini berada di dalam output_config, bukan di level teratas permintaan:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort memengaruhi setiap token dalam respons: "Ini dapat memengaruhi seluruh penggunaan token termasuk pemanggilan tool. Sebagai contoh, effort yang lebih rendah berarti Claude melakukan lebih sedikit pemanggilan tool." Hal ini berdampak kumulatif pada loop agen. Ini bukan batas token: "Effort adalah sinyal perilaku, bukan anggaran token yang ketat." Anthropic tidak menerbitkan pengali biaya per level dan menyarankan Anda untuk menguji kasus penggunaan sendiri, sehingga menjalankan Sonnet 5 pada high dibandingkan dengan Opus 4.8 pada low adalah perbandingan nyata yang dapat Anda lakukan sore ini. Haiku 4.5 tidak ada dalam daftar model yang mendukung fitur effort.
Prompt caching. Pembacaan cache membutuhkan biaya 0.1x dari tarif input dasar, dan angka tersebut menentukan pilihan model berdasarkan efisiensinya di berbagai tier. Cache hit pada Opus 4.8 berbiaya $0.50 / MTok, sedangkan input tanpa cache pada Haiku 4.5 berbiaya $1 / MTok, sehingga prefix Opus yang ter-cache dengan baik lebih murah per token input dibandingkan prompt Haiku yang dingin. Manajemen sesi yang baik lebih menguntungkan daripada pemilihan model pada beban kerja apa pun yang mengirim ulang prefix stabil yang besar.
Batches. Jika jawaban tidak memerlukan respon instan, Message Batches API menjalankan model yang sama dengan "diskon 50% untuk token input dan output". Ini memotong setengah dari setiap baris pada perbandingan di bawah ini, dan berlaku di semua tier: pekerjaan Opus 4.8 secara batch lebih murah daripada pekerjaan Sonnet 5 secara sinkron dengan harga standar per 1 September 2026, menukar latensi dengan kapabilitas pada anggaran yang sama.
Perbandingan biaya satu beban kerja
Beban kerja: klasifikasi 100,000 email dukungan, satu panggilan per email, 2,000 token input dan 300 token output per panggilan. Totalnya adalah 200 MTok input dan 30 MTok output.
- Haiku 4.5: 200 x $1 = $200 input, 30 x $5 = $150 output. Total $350.
- Sonnet 5, tarif perkenalan: 200 x $2 = $400 input, 30 x $10 = $300 output. Total $700.
- Sonnet 5, mulai 1 September 2026: 200 x $3 = $600 input, 30 x $15 = $450 output. Total $1,050.
- Opus 4.8: 200 x $5 = $1,000 input, 30 x $25 = $750 output. Total $1,750.
Ganti empat angka untuk menghitung ulang dengan harga besok. Penyesuaian di bawah ini memberikan dampak yang lebih besar daripada nama model:
- Batching membagi dua setiap baris: $175, $350, $525 dan $875. Tidak ada proses yang menunggu pada proses klasifikasi malam hari, jadi tidak ada alasan untuk melewatkannya.
- Caching prefix yang sama. Misalkan 1,200 dari 2,000 token input adalah blok instruksi yang sama setiap saat. Pada Sonnet 5 dengan tarif perkenalan, biaya cache hit adalah $0.20 / MTok, bukan $2 / MTok, sehingga 120 MTok berbiaya $24, bukan $240. Tambahkan 80 MTok input baru seharga $2, yaitu $160, ditambah $300 output, maka biaya Sonnet 5 menjadi sekitar $484, bukan $700. Trik yang sama tidak berpengaruh pada Haiku 4.5, karena 1,200 token berada di bawah batas minimum 4,096 token.
- Retries. Misalkan Anda menolak jawaban Haiku pada 8% email dan menjalankan ulang email tersebut pada Opus 4.8. Tambahkan 0.08 x $1,750 = $140 ke $350, sehingga menjadi $490. Ukur tingkat penolakan Anda sendiri daripada menggunakan angka saya.
- Definisi tool, jika pekerjaan menggunakannya. Prompt sistem yang dihasilkan adalah 290 token pada Opus 4.8 dengan
tool_choicediatur keauto, 354 pada Sonnet 5, dan 496 pada Haiku 4.5. Model termurah memiliki overhead tetap terbesar.
Haiku dengan jalur eskalasi seharga $490 dan Sonnet 5 dengan cache seharga $484 memiliki biaya yang sama, dan salah satunya dapat menyelesaikan pekerjaan dalam satu kali proses. Model bukanlah satu-satunya faktor penentu.
Apakah mengganti model di tengah sesi dapat menghemat biaya?
Jarang terjadi seperti yang disarankan oleh harga label, karena penghematan dihitung per token dan risiko yang Anda ambil adalah seluruh prefix yang tersimpan di cache.
Anthropic mendokumentasikan hal-hal yang membatalkan cache. Prefix dibangun secara berurutan mulai dari tools, lalu system, kemudian messages, dan "Perubahan pada setiap level akan membatalkan level tersebut dan semua level berikutnya." Dua pengaturan permintaan juga ada dalam daftar tersebut: "Konfigurasi thinking dan level effort yang telah diselesaikan dimasukkan ke dalam prompt itu sendiri, sehingga mengubah salah satunya akan memulai prefix cache baru." Dokumentasi tersebut memberikan saran lebih lanjut: "variasikan effort di antara beban kerja, bukan di dalam satu percakapan yang mengandalkan cache hits".
Model tidak ada dalam daftar dokumentasi tersebut, jadi jangan berasumsi dalam kondisi apa pun. Baca cache_read_input_tokens pada permintaan pertama setelah penggantian model dan biarkan angkanya menjawab. Pada prefix Opus 150,000-token 4.8, pembacaan cache membutuhkan biaya sekitar $0.08 dan penulisan baru sekitar $0.94, yang mana lebih mahal daripada selisih per-token dari beberapa giliran yang Anda incar.
Jadi, ubahlah hal-hal ini di antara tugas, bukan di dalam satu tugas. Dalam Claude Code, itu berarti lakukan /clear terlebih dahulu, saat cache memang akan dibuang, kemudian /model atau /effort.
Cara menguji jawaban pada beban kerja Anda sendiri
Jangan menentukan ukuran prompt menggunakan hitungan dari model yang berbeda. Endpoint penghitungan token dapat digunakan secara gratis dan menghitung menggunakan tokenizer dari model yang Anda tentukan, jadi tentukan model yang akan Anda panggil. Opus 4.7 dan versi setelahnya, Fable 5, dan Sonnet 5 menggunakan tokenizer baru yang "menghasilkan sekitar 30% lebih banyak token untuk teks yang sama", sehingga anggaran yang diukur pada model lama akan terbaca lebih rendah pada model baru meskipun tarif per token tetap sama.
Kemudian baca hasil yang diterima. input_tokens hanyalah sisa yang tidak tersimpan di cache, sehingga ukuran prompt yang sebenarnya adalah bidang tersebut ditambah cache_creation_input_tokens ditambah cache_read_input_tokens. Aplikasi Claude API pertama pada VPS adalah tempat paling akurat untuk menjalankan pengukuran tersebut, dan rencana Claude mana yang sesuai dengan penggunaan Anda adalah keputusan terpisah mengenai apakah Anda akan membayar per token atau tidak.
FAQ
Model Claude mana yang terbaik untuk coding?
Claude Opus 4.8 adalah titik awal yang terdokumentasi untuk coding agentic yang kompleks, dengan harga $5 per satu juta input token dan $25 per satu juta output per Juli 2026. Claude Sonnet 5 diposisikan sebagai kombinasi kecepatan dan kecerdasan terbaik, dan dengan harga $2 / $10 hingga 31 Agustus 2026, biayanya kurang dari setengahnya. Jalankan tugas yang sama pada keduanya, jaga konfigurasi thinking tetap konstan, dan bandingkan total pengeluaran token dari response.usage.
Apakah Claude Haiku 4.5 cukup murah untuk menggantikan Sonnet 5?
Per token, tentu saja: $1 / $5 dibandingkan dengan $2 / $10 untuk Sonnet 5 pada harga perkenalan, atau $3 / $15 mulai 1 September 2026. Batasan yang menentukannya. Haiku 4.5 memiliki context window 200K token, bukan 1M, output maksimum 64K pada synchronous Messages API, cutoff pengetahuan yang andal pada Februari 2025, tidak ada dukungan output_config.effort, dan minimum prompt cacheable sebesar 4,096 token yang secara otomatis menonaktifkan caching pada system prompt yang pendek.
Apakah beralih ke model Claude yang lebih murah di tengah sesi dapat menghemat uang?
Tidak sesering yang terlihat. Anthropic mendokumentasikan cache invalidators sebagai perubahan pada prefix tools, system, atau messages, perubahan pada konfigurasi thinking, dan perubahan pada output_config.effort. Apa yang dilakukan pergantian model terhadap cache yang ada tidak didokumentasikan, jadi anggap sebagai hal yang tidak diketahui dan baca cache_read_input_tokens pada permintaan pertama setelahnya. Hal ini penting untuk diketahui: pada prefix Opus 4.8 sebesar 150,000 token, biaya cache read adalah sekitar $0.08 dan fresh write sekitar $0.94, yang mana lebih besar daripada penghematan per token selama beberapa giliran. Beralihlah antar tugas, setelah /clear di Claude Code, saat cache memang akan dibuang.
Apa fungsi output_config.effort terhadap tagihan saya?
Ini mengubah jumlah token yang dihabiskan model untuk teks, tool calls, dan thinking. Effort yang lebih rendah menghasilkan lebih sedikit tool calls, yang akan berakumulasi pada agentic loops karena setiap hasil tool dikirim ulang pada giliran berikutnya. Levelnya adalah low, medium, high, xhigh, dan max, dengan high sebagai default. Anthropic tidak menerbitkan multiplier biaya per level, karena menyebut effort sebagai sinyal perilaku dan bukan anggaran token, jadi ukur sendiri pada tugas Anda.
Berapa banyak penghematan dari Claude Batches API?
50% pada token input dan output, sebagai ganti pengiriman secara asynchronous. Per Juli 2026, hal ini membuat Opus 4.8 menjadi $2.50 in / $12.50 out, Sonnet 5 menjadi $1 / $5 pada harga perkenalan, dan Haiku 4.5 menjadi $0.50 / $2.50. Perbandingan yang perlu diperhatikan berjalan di berbagai tier: satu pekerjaan Opus 4.8 secara batch biayanya lebih murah daripada satu pekerjaan Sonnet 5 secara synchronous pada tarif standar mulai 1 September 2026, sehingga batching memberikan model yang lebih kuat dengan jumlah uang yang sama.