SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-27

Model Claude Mana yang Sebaiknya Dipilih? Panduan Biaya

Bandingkan Claude Opus 4.8, Sonnet 5, Haiku 4.5, dan Fable 5. Lihat tarif Juli 2026, simulasi 100.000 pekerjaan, serta pengaturan yang paling memengaruhi biaya.

Model Claude mana yang sebaiknya saya gunakan?

Jawaban singkat untuk pertanyaan model Claude yang sebaiknya digunakan: mulai dengan Claude Opus 4.8, lalu beralih hanya jika Anda memiliki alasan yang jelas. Panduan Anthropic juga sama. "Jika Anda tidak yakin model mana yang harus digunakan, mulai dengan Claude Opus 4.8 untuk coding agentik yang kompleks dan pekerjaan enterprise." Gunakan Claude Sonnet 5 untuk tugas yang spesifikasinya sudah jelas dan dijalankan berkali-kali dalam sehari. Gunakan Claude Haiku 4.5 untuk pekerjaan mekanis bervolume tinggi ketika Anda sudah mengetahui seperti apa jawaban yang benar. Claude Fable 5 berada di atas semuanya, untuk agent yang berjalan dalam waktu lama.

Pilihan ini memiliki biaya. Berikut tarif Claude API (application programming interface) per 23 July 2026, per satu juta token, yang dalam dokumentasi ditulis sebagai MTok.

  • Claude Fable 5 (claude-fable-5): $10 / MTok input, $50 / MTok output. Konteks 1M.
  • Claude Opus 4.8 (claude-opus-4-8): $5 input, $25 output. Konteks 1M.
  • Claude Opus 4.7 (claude-opus-4-7): $5 input, $25 output. Konteks 1M.
  • Claude Sonnet 5 (claude-sonnet-5): $2 input, $10 output dengan harga perkenalan hingga 31 August 2026. Tarif standar $3 input, $15 output mulai berlaku pada 1 September 2026. Konteks 1M.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 input, $5 output. Konteks 200K.

Identifier tersebut sudah lengkap seperti yang ditulis. Tidak ada apa pun yang ditambahkan ke identifier tersebut.

Ukuran konteks itu sendiri tidak dikenai biaya tambahan pada model dengan kapasitas 1M token: "Permintaan 900k token ditagihkan dengan tarif per token yang sama seperti permintaan 9k token." Tarif tersebut juga berlaku di luar API, karena Claude Enterprise menghitung penggunaan dengan tarif API di luar harga seat-nya. Jadi, seluruh perhitungan di bawah ini juga berlaku untuk tim yang menggunakan paket seat. Langganan tarif tetap mengubah cara penggunaan dihitung, tetapi tidak mengubah keputusan ini, karena kedua tingkatan Claude Max menyediakan model yang sama dan hanya berbeda pada jumlah penggunaan yang tersedia. Pada tingkat yang lebih rendah dalam hierarki yang sama, Claude Pro seharga $20 per bulan memberikan alokasi penggunaan, bukan tarif per token, sehingga yang membatasi Anda adalah reset batas penggunaan, bukan tagihan. Jika saat ini Anda berada pada kondisi tersebut, menentukan jendela waktu mana yang sedang Anda tunggu harus dilakukan sebelum perhitungan apa pun di bawah ini, karena solusinya adalah menggunakan model yang lebih kecil, konteks yang lebih kecil, atau beralih ke API, bukan mencari tarif yang lebih murah. Jika Anda belum mulai membayar sama sekali, menentukan apakah Pro memang sepadan dengan biaya $20 bergantung pada seberapa sering batas gratis menghambat Anda, bukan pada tarif mana pun di atas.

Untuk apa masing-masing model sebenarnya

Anthropic menjelaskan rangkaian model ini dengan satu baris untuk setiap model. Penjelasan tersebut lebih membantu daripada leaderboard mana pun.

  • Claude Fable 5: "Inteligensi generasi berikutnya untuk agent yang berjalan lama." Model ini memiliki latensi paling tinggi di antara keempatnya.
  • Claude Opus 4.8: "Untuk coding agentic yang kompleks dan pekerjaan enterprise." Latensinya sedang.
  • Claude Sonnet 5: "Kombinasi terbaik antara kecepatan dan inteligensi." Cepat.
  • Claude Haiku 4.5: "Model tercepat dengan inteligensi yang mendekati frontier."

Fable 5 adalah satu-satunya dari keempat model yang tidak diberi harga berdasarkan workload dalam perbandingan ini. Dengan tarif dua kali lipat Opus 4.8, pertanyaan tentang pekerjaan mana yang menghasilkan $10 menjadi $50 layak mendapat jawaban tersendiri.

Haiku 4.5 juga memiliki batasan yang menentukan kesesuaian pekerjaan sebelum harga dipertimbangkan. Context window-nya adalah 200K token, bukan 1M, sehingga repository besar atau transkrip agent yang panjang tidak akan muat. Output maksimum pada synchronous Messages API adalah 64K token, sedangkan tiga model lainnya mendukung 128K. Cutoff pengetahuan yang andal adalah February 2025, sementara ketiga model lainnya berada pada January 2026.

Berapa biaya pilihan tersebut pada beban kerja nyata?

Setiap model dalam jajaran ini menetapkan harga output sebesar lima kali tarif input-nya. Opus 4.8 dikenai biaya $5 untuk input dan $25 untuk output. Haiku 4.5 dikenai biaya $1 untuk input dan $5 untuk output. Rasio ini berlaku di seluruh jajaran, sehingga model yang Anda pilih paling berpengaruh pada pekerjaan yang menghasilkan banyak output.

Pekerjaan agentic termasuk jenis pekerjaan tersebut karena token penalaran ditagihkan sebagai token output dan dihitung dalam max_tokens meskipun teksnya tidak pernah sampai kepada Anda. Pada Fable 5, Opus 4.8, Opus 4.7, dan Sonnet 5, ringkasan penalaran dihilangkan secara default, sehingga kolom thinking dikembalikan dalam keadaan kosong. Penagihannya tetap sama: "Bagaimanapun juga, blok tersebut ditagihkan dengan cara yang sama dan dikirim kembali dengan cara yang sama dalam percakapan multi-turn." Apa yang sebenarnya mengisi tagihan token Claude menguraikan meter tersebut secara lengkap.

Apakah proses berpikir dijalankan sama sekali atau tidak berbeda di antara model yang Anda bandingkan. Jika hal ini terlewat, pengujian biaya akan menghasilkan kesimpulan yang keliru. Pada Sonnet 5 dan Fable 5, proses berpikir sudah aktif dan tidak memerlukan konfigurasi. Pada Opus 4.8 dan Opus 4.7, proses tersebut nonaktif sampai Anda menetapkan thinking: {type: "adaptive"} dalam request. Samakan konfigurasi di kedua sisi sebelum menarik kesimpulan dari angkanya.

Mengapa model termurah bisa menjadi yang paling mahal

Gunakan satu tugas coding yang berdiri sendiri. Permintaan tersebut membawa konteks sebanyak 60,000 token, dan model menghasilkan 8,000 token output termasuk proses berpikir. Tidak ada caching, sehingga perhitungannya tetap terlihat.

Pada Opus 4.8: 0.06 MTok input dengan tarif $5 berbiaya $0.30, dan 0.008 MTok output dengan tarif $25 berbiaya $0.20. Satu percobaan berbiaya $0.50. Pada Haiku 4.5, percobaan yang sama berbiaya $0.06 ditambah $0.04, sehingga totalnya $0.10.

Haiku lima kali lebih murah per percobaan. Ini terlihat memberikan banyak ruang penghematan, sampai Anda memperhitungkan dampak percobaan yang gagal. Anda membaca jawaban yang salah, sehingga waktu Anda terpakai. Anda mengirim ulang jawaban tersebut sebagai konteks pada percobaan berikutnya, sehingga setiap percobaan lebih besar daripada sebelumnya. Ketika percobaan ketiga masih gagal, Anda tetap beralih ke model yang lebih besar: $0.30 untuk Haiku ditambah $0.50 untuk Opus menjadi $0.80, atau 60% lebih mahal daripada langsung menjalankan Opus satu kali.

Jadi, pertanyaan penentunya adalah seberapa murah Anda dapat memeriksa jawabannya. Jika jawaban yang salah terlihat jelas dalam satu detik, model kecil merupakan pilihan yang hemat. Jika untuk menemukannya Anda harus membaca diff dengan teliti, model kecil menghabiskan waktu Anda yang tidak pernah muncul pada tagihan.

Saat model yang lebih kecil jelas lebih unggul

Haiku 4.5 adalah pilihan yang tepat dalam situasi berikut:

  • Pekerjaan subagent yang mekanis. Subagent yang mengganti nama file atau mengumpulkan output pencarian tidak memerlukan penalaran tingkat terdepan. Ini adalah pola standar setelah Anda membangun agen AI dengan Claude dan memberinya helper.
  • Triage log. Menentukan apakah suatu baris merupakan noise atau perlu diperhatikan manusia adalah penilaian yang terbatas dengan mode kegagalan yang jelas.
  • Klasifikasi berdasarkan kumpulan label tetap. Output-nya singkat dan akurasinya dapat diukur pada sampel.
  • Panggilan produksi bervolume tinggi. Pada 100,000 eksekusi per hari, selisih biaya per token tidak lagi dapat diabaikan. Ini adalah pola umum workflow AI yang dihubungkan ke n8n.
  • Apa pun yang membutuhkan kecepatan respons bagi pengguna. Haiku 4.5 dinilai sebagai model tercepat dalam lini produk tersebut.

Ada satu batasan yang khusus berlaku untuk Haiku. Prompt minimum yang dapat di-cache adalah 4,096 token, sedangkan Opus 4.8 dan Sonnet 5 menetapkan 1,024 token. Di bawah batas minimum tersebut, "setiap permintaan untuk melakukan cache pada jumlah token yang lebih sedikit akan diproses tanpa caching, dan tidak ada error yang dikembalikan". Blok instruksi 1,500 token yang di-cache pada Sonnet 5 secara diam-diam tidak di-cache pada Haiku 4.5. Indikasinya adalah cache_creation_input_tokens dan cache_read_input_tokens sama-sama bernilai zero. Hal ini dibahas bersama cara lain untuk kehilangan cache dalam menekan biaya agen yang selalu aktif.

Pengungkit yang mengubah jawabannya

Setiap faktor berikut memengaruhi biaya lebih besar daripada nama model.

Effort. output_config.effort menentukan seberapa banyak pekerjaan yang dilakukan model sebelum memberikan jawaban. Levelnya adalah low, medium, high, xhigh, dan max, sedangkan high adalah nilai default: "Menetapkan effort ke high menghasilkan perilaku yang sama persis seperti menghilangkan parameter effort sepenuhnya." Parameter ini berada di dalam output_config, bukan pada tingkat teratas request:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort memengaruhi setiap token dalam respons: "Effort dapat memengaruhi seluruh penggunaan token, termasuk tool call. Misalnya, effort yang lebih rendah berarti Claude melakukan lebih sedikit tool call." Dampaknya terakumulasi dalam loop agentic. Effort bukan batas token: "Effort adalah sinyal perilaku, bukan anggaran token yang ketat." Anthropic tidak menerbitkan pengali biaya untuk setiap level dan meminta Anda menguji use case sendiri. Dengan demikian, menjalankan Sonnet 5 pada high dan Opus 4.8 pada low merupakan perbandingan nyata yang dapat Anda lakukan sore ini. Haiku 4.5 tidak tercantum dalam daftar model yang mendukung effort.

Prompt caching. Pembacaan cache dikenai biaya 0.1x dari tarif input dasar. Hal yang menentukan pilihan model adalah dampaknya pada berbagai tier. Cache hit pada Opus 4.8 berbiaya $0.50 / MTok, sedangkan input tanpa cache pada Haiku 4.5 berbiaya $1 / MTok. Jadi, prefix Opus yang tersimpan baik dalam cache lebih murah per token input daripada prompt Haiku yang belum memiliki cache. Kebersihan session lebih berpengaruh daripada pilihan model pada workload yang mengirim ulang prefix stabil berukuran besar.

Batches. Jika tidak ada yang menunggu jawaban, Message Batches API menjalankan model yang sama dengan "diskon 50% untuk token input dan output". API ini membagi dua setiap baris pada perbandingan di bawah dan berlaku pada semua tier. Job Opus 4.8 dalam batch berbiaya lebih rendah daripada job Sonnet 5 sinkron dengan harga standar mulai 1 September 2026, dengan menukar latensi dengan kapabilitas pada biaya yang sama.

Satu perbandingan biaya lengkap

Beban kerja: mengklasifikasikan 100,000 email dukungan, satu panggilan untuk setiap email, dengan 2,000 token input dan 300 token output per panggilan. Totalnya adalah 200 MTok input dan 30 MTok output.

  • Haiku 4.5: 200 x $1 = $200 untuk input, 30 x $5 = $150 untuk output. Total $350.
  • Sonnet 5, tarif perkenalan: 200 x $2 = $400 untuk input, 30 x $10 = $300 untuk output. Total $700.
  • Sonnet 5, mulai 1 September 2026: 200 x $3 = $600 untuk input, 30 x $15 = $450 untuk output. Total $1,050.
  • Opus 4.8: 200 x $5 = $1,000 untuk input, 30 x $25 = $750 untuk output. Total $1,750.

Ganti empat angka untuk menghitung ulang dengan harga besok. Penyesuaian di bawah ini mengubah hasil lebih besar daripada nama model:

  • Batching membagi dua setiap baris: $175, $350, $525, dan $875. Tidak ada yang perlu menunggu proses klasifikasi malam hari, jadi tidak ada alasan untuk melewatkan batching.
  • Caching prefix yang sama. Misalkan 1,200 dari 2,000 token input merupakan blok instruksi yang sama pada setiap panggilan. Pada Sonnet 5 dengan tarif perkenalan, token tersebut dikenai biaya $0.20 / MTok sebagai cache hit, bukan $2 / MTok, sehingga 120 MTok berbiaya $24, bukan $240. Tambahkan 80 MTok input baru dengan biaya $2, yaitu $160, dan $300 untuk output. Dengan demikian, biaya Sonnet 5 menjadi sekitar $484, bukan $700. Teknik yang sama tidak berpengaruh pada Haiku 4.5 karena 1,200 token berada di bawah minimum 4,096 token.
  • Retry. Misalkan Anda menolak jawaban Haiku pada 8% email dan menjalankan ulang email tersebut pada Opus 4.8. Tambahkan 0.08 x $1,750 = $140 ke $350, sehingga totalnya menjadi $490. Ukur sendiri tingkat penolakan Anda, bukan menggunakan angka saya.
  • Definisi tool, jika pekerjaan menggunakannya. System prompt yang dihasilkan berukuran 290 token pada Opus 4.8 dengan tool_choice ditetapkan ke auto, 354 token pada Sonnet 5, dan 496 token pada Haiku 4.5. Model termurah memiliki overhead tetap terbesar.

Haiku dengan jalur eskalasi seharga $490 dan Sonnet 5 dengan caching seharga $484 memiliki biaya yang sama, dan salah satunya menyelesaikan pekerjaan dalam satu proses. Model bukan satu-satunya faktor yang perlu dipertimbangkan.

Apakah mengganti model di tengah sesi menghemat biaya?

Tidak sesering yang ditunjukkan oleh harga yang tercantum, karena penghematannya dihitung per token, sedangkan yang Anda pertaruhkan adalah seluruh awalan yang tersimpan dalam cache.

Anthropic mendokumentasikan hal-hal yang membatalkan cache. Awalan dibangun dalam urutan tools, lalu system, kemudian messages, dan "Perubahan pada setiap tingkat membatalkan tingkat tersebut serta semua tingkat berikutnya." Dua pengaturan permintaan juga tercantum: "Konfigurasi thinking dan tingkat effort yang telah ditentukan dimasukkan ke dalam prompt itu sendiri, sehingga perubahan pada salah satunya akan memulai awalan cache baru." Untuk effort, dokumentasinya memberikan anjuran yang lebih spesifik: "gunakan effort yang berbeda untuk beban kerja yang berbeda, bukan dalam satu percakapan yang mengandalkan cache hit".

Model tidak tercantum dalam daftar tersebut, jadi jangan langsung menganggap bahwa perubahan model selalu membatalkan cache atau tidak pernah membatalkannya. Baca cache_read_input_tokens pada permintaan pertama setelah pergantian dan gunakan angka tersebut sebagai acuan. Pada awalan Opus 4.8 sepanjang 150,000 token, pembacaan dari cache berbiaya sekitar $0.08, sedangkan penulisan baru berbiaya sekitar $0.94. Biaya ini lebih besar daripada selisih biaya per token selama beberapa giliran yang ingin Anda hemat.

Karena itu, ubah pengaturan tersebut di antara tugas, bukan di tengah satu tugas. Di Claude Code, jalankan /clear terlebih dahulu, saat cache memang akan dibuang, lalu gunakan /model atau /effort. Keduanya diketik pada CLI, jadi jika Anda bekerja di Linux, instalasi yang paling berguna adalah versi terminal, karena yang Anthropic sediakan secara native untuk Linux memasangkan CLI yang sudah stabil dengan aplikasi desktop yang masih dalam versi beta. Apakah pergantian tersebut muncul pada tagihan atau tidak bergantung pada cara Anda membayar sesi itu, karena Claude Code berjalan dengan paket bulanan tetap atau kredit API berbasis token dan hanya opsi kedua yang menetapkan harga pergantian model dalam dolar.

Cara menguji jawaban pada beban kerja Anda sendiri

Jangan menentukan ukuran prompt berdasarkan jumlah token dari model lain. Endpoint penghitung token dapat digunakan secara gratis dan menghitung token menggunakan tokenizer dari model yang Anda tentukan. Karena itu, tentukan model yang akan Anda panggil. Endpoint tersebut adalah salah satu dari sedikit bagian platform yang tidak pernah ditagihkan, dan hal lain yang dapat Anda jalankan tanpa membayar layak diperiksa sebelum Anda menggunakan kredit sungguhan untuk perbandingan. Opus 4.7 dan versi yang lebih baru, Fable 5, serta Sonnet 5 menggunakan tokenizer yang lebih baru dan "menghasilkan sekitar 30% lebih banyak token untuk teks yang sama". Karena itu, anggaran yang diukur pada model lama akan terlihat terlalu rendah pada model baru jika tarif per token tidak berubah.

Selanjutnya, baca hasil yang dikembalikan. input_tokens hanya menunjukkan sisa yang tidak menggunakan cache, sehingga ukuran prompt sebenarnya adalah nilai pada kolom tersebut ditambah cache_creation_input_tokens dan cache_read_input_tokens. Aplikasi Claude API pertama pada VPS adalah tempat paling sederhana dan realistis untuk melakukan pengukuran tersebut. Sementara itu, paket Claude yang sesuai dengan penggunaan Anda adalah keputusan terpisah tentang apakah Anda akan membayar per token. Jika persoalannya ternyata adalah paket langganan mana yang harus dipilih, bukan apakah perlu berlangganan, tingkatan Claude dengan harga di samping tingkatan ChatGPT menjelaskan biaya pekerjaan coding yang sama pada paket penyedia lain. Jika pengukuran tersebut membuat Anda sepenuhnya beralih menggunakan API, menurunkan paket langganan atau menghentikannya sepenuhnya tetap memberi Anda akses selama periode yang sudah dibayar. Jadi, tidak ada penalti jika keputusan dibuat setelah hasil pengukuran tersedia.

FAQ

Model Claude mana yang paling baik untuk coding?

Claude Opus 4.8 adalah titik awal yang direkomendasikan dalam dokumentasi untuk coding agentic yang kompleks, dengan biaya $5 per juta token input dan $25 per juta token output per Juli 2026. Claude Sonnet 5 diposisikan sebagai kombinasi terbaik antara kecepatan dan kecerdasan. Dengan harga $2 / $10 hingga 31 August 2026, biayanya kurang dari separuhnya. Jalankan tugas yang sama pada keduanya, pertahankan konfigurasi thinking tetap sama, lalu bandingkan total penggunaan token dari response.usage.

Apakah Claude Haiku 4.5 cukup murah untuk menggantikan Sonnet 5?

Untuk setiap token, jelas lebih murah: $1 / $5 dibandingkan $2 / $10 untuk Sonnet 5 pada harga perkenalan, atau $3 / $15 mulai 1 September 2026. Namun, batasannya menentukan. Haiku 4.5 memiliki context window 200K token, bukan 1M, output maksimum 64K pada synchronous Messages API, knowledge cutoff andal pada February 2025, tidak mendukung output_config.effort, serta prompt minimum 4,096 token yang dapat di-cache. Batas terakhir ini secara diam-diam menonaktifkan caching pada system prompt yang pendek.

Apakah berpindah ke model Claude yang lebih murah di tengah session menghemat biaya?

Tidak sesering yang terlihat. Anthropic mendokumentasikan cache invalidator sebagai perubahan pada prefix tools, system, atau messages, perubahan konfigurasi thinking, dan perubahan pada output_config.effort. Dampak pergantian model terhadap cache yang sudah ada tidak didokumentasikan. Karena itu, anggap dampaknya tidak diketahui dan baca cache_read_input_tokens pada request pertama setelah pergantian. Hal ini penting untuk diketahui: pada prefix Opus 4.8 sepanjang 150,000 token, cache read berbiaya sekitar $0.08, sedangkan fresh write berbiaya sekitar $0.94. Biaya tersebut dapat melampaui penghematan per token selama beberapa turn. Lakukan pergantian antar-tugas, setelah /clear di Claude Code, ketika cache memang akan dibuang.

Apa dampak output_config.effort terhadap tagihan saya?

Parameter ini mengubah jumlah token yang digunakan model untuk teks, tool call, dan thinking. Effort yang lebih rendah menghasilkan lebih sedikit tool call. Dampaknya terakumulasi dalam agentic loop karena setiap hasil tool dikirim ulang pada turn berikutnya. Levelnya adalah low, medium, high, xhigh, dan max, dengan high sebagai default. Anthropic tidak menerbitkan pengali biaya untuk setiap level. Anthropic menyebut effort sebagai sinyal perilaku, bukan anggaran token. Karena itu, ukur dampaknya pada tugas Anda sendiri.

Berapa besar penghematan dari Claude Batches API?

50% untuk token input dan output, dengan imbalan pengiriman secara asynchronous. Per July 2026, harga tersebut membuat Opus 4.8 berbiaya $2.50 in / $12.50 out, Sonnet 5 berbiaya $1 / $5 pada harga perkenalan, dan Haiku 4.5 berbiaya $0.50 / $2.50. Perbandingan yang perlu diperhatikan mencakup beberapa tier: pekerjaan Opus 4.8 melalui batch berbiaya lebih rendah daripada pekerjaan Sonnet 5 secara synchronous dengan tarif standar mulai 1 September 2026. Dengan demikian, batching menyediakan model yang lebih kuat dengan biaya yang sama.