SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-27

Panduan Pilih Model Claude: Opus, Sonnet atau Haiku?

Bandingkan kos Claude Opus 4.8, Sonnet 5 dan Haiku 4.5 bagi Julai 2026. Ketahui perbezaan harga setiap juta token dan cara mengoptimumkan bil untuk 100,000 tugasan API anda.

Model Claude yang manakah patut saya gunakan?

Jawapan ringkas bagi model Claude yang patut anda gunakan: mulakan dengan Claude Opus 4.8, dan beralih daripadanya hanya jika anda mempunyai sebab yang jelas. Panduan daripada Anthropic juga sama. "Jika anda tidak pasti model mana yang patut digunakan, mulakan dengan Claude Opus 4.8 untuk pengekodan ejen yang kompleks dan kerja peringkat perusahaan." Beralih kepada Claude Sonnet 5 apabila tugasan tersebut telah ditentukan dengan jelas dan anda menjalankannya berkali-kali sehari. Beralih pula kepada Claude Haiku 4.5 untuk kerja mekanikal berisipadu tinggi yang mana anda sudah mengetahui rupa jawapan yang betul. Claude Fable 5 berada di kedudukan tertinggi antara kesemuanya, untuk ejen yang berjalan dalam tempoh masa yang lama.

Pilihan ini mempunyai kos yang berkaitan. Berikut adalah kadar pada Claude API (application programming interface) setakat 23 Julai 2026, bagi setiap juta token, yang ditulis dalam dokumentasi sebagai MTok.

  • Claude Fable 5 (claude-fable-5): $10 / MTok masuk, $50 / MTok keluar. 1M konteks.
  • Claude Opus 4.8 (claude-opus-4-8): $5 masuk, $25 keluar. 1M konteks.
  • Claude Opus 4.7 (claude-opus-4-7): $5 masuk, $25 keluar. 1M konteks.
  • Claude Sonnet 5 (claude-sonnet-5): $2 masuk, $10 keluar pada harga pengenalan sehingga 31 Ogos 2026. Kadar standard $3 masuk, $15 keluar berkuat kuasa pada 1 September 2026. 1M konteks.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 masuk, $5 keluar. 200K konteks.

Pengecam tersebut adalah lengkap seperti yang ditulis. Tiada apa-apa yang ditambah kepadanya.

Saiz itu sendiri tidak dikenakan surcaj pada model dengan had 1M token: "Permintaan 900k token dibilkan pada kadar setiap token yang sama seperti permintaan 9k token." Kadar itu juga terpakai di luar API, kerana Claude Enterprise mengira penggunaan pada kadar API selain harga tempat duduknya. Oleh itu, semua pengiraan di bawah sama untuk pasukan yang menggunakan pelan tempat duduk. Langganan kadar rata mengubah meter penggunaan, tetapi bukan keputusan ini, kerana kedua-dua peringkat Claude Max menggunakan model yang sama dan hanya berbeza dari segi jumlah penggunaan yang diperoleh. Pada peringkat lebih rendah dalam hierarki yang sama, Claude Pro berharga $20 sebulan dan memberikan kuota penggunaan, bukannya kadar setiap token, jadi perkara yang menghentikan anda ialah penetapan semula had, bukan bil. Jika itu keadaan anda sekarang, tentukan dahulu tetingkap penggunaan yang sedang anda tunggu sebelum membuat sebarang pengiraan di bawah, kerana penyelesaiannya ialah menggunakan model yang lebih kecil, konteks yang lebih kecil atau beralih ke API, bukannya mencari kadar yang lebih murah. Jika anda masih belum mula membayar, sama ada Pro berbaloi dengan harga $20 ditentukan oleh kekerapan had percuma menghalang anda, bukan oleh mana-mana kadar di atas.

Tujuan sebenar setiap model

Anthropic menerangkan barisan model ini dalam satu baris bagi setiap model, dan penerangan tersebut menjadi panduan yang lebih baik daripada mana-mana papan pendahulu (leaderboard).

  • Claude Fable 5: "Kecerdasan generasi seterusnya untuk ejen yang berjalan lama." Dinilai sebagai yang paling perlahan antara keempat-empat model dari segi kependaman (latency).
  • Claude Opus 4.8: "Untuk pengekodan ejen yang kompleks dan kerja perusahaan." Kependaman sederhana.
  • Claude Sonnet 5: "Gabungan terbaik antara kelajuan dan kecerdasan." Pantas.
  • Claude Haiku 4.5: "Model terpantas dengan kecerdasan yang menghampiri tahap sempadan (frontier)."

Fable 5 adalah satu-satunya daripada empat model ini yang perbandingan ini tidak pernah meletakkan harga berdasarkan beban kerja, dan pada kadar dua kali ganda daripada Opus 4.8, persoalan tentang pekerjaan yang manakah memberikan pulangan $50 bagi setiap $10 kos memerlukan jawapannya yang tersendiri.

Haiku 4.5 juga membawa had yang menentukan kesesuaian kerja sebelum faktor harga diambil kira. Tetingkap konteksnya adalah 200K token dan bukannya 1M, jadi repositori yang besar atau transkrip ejen yang panjang tidak akan muat. Output maksimumnya pada Messages API segerak adalah 64K token berbanding 128K bagi model lain, dan tarikh akhir pengetahuan yang boleh dipercayai adalah Februari 2025, manakala tiga model yang lain berada pada Januari 2026.

Apakah kos pilihan tersebut bagi beban kerja sebenar?

Setiap model dalam barisan produk meletakkan harga output pada lima kali ganda kadar inputnya. Opus 4.8 berharga $5 untuk input dan $25 untuk output. Haiku 4.5 berharga $1 untuk input dan $5 untuk output. Nisbah ini kekal konsisten di seluruh julat, jadi model yang anda pilih paling memberi kesan kepada kerja yang menjana banyak output.

Kerja ejen (agentic work) adalah jenis kerja tersebut, kerana token pemikiran dibilkan sebagai token output dan dikira ke arah max_tokens walaupun teks tersebut tidak pernah sampai kepada anda. Pada Fable 5, Opus 4.8, Opus 4.7 dan Sonnet 5, ringkasan penaakulan ditinggalkan secara lalai, jadi medan thinking kembali kosong. Pengebilan tetap tidak berubah: "Walau apa pun, blok tersebut dibilkan dengan harga yang sama dan dihantar semula dengan cara yang sama dalam perbualan berbilang pusingan." Apa yang sebenarnya mengisi bil token Claude menghuraikan meter tersebut sepenuhnya.

Sama ada pemikiran berjalan atau tidak, ia berbeza antara model yang anda bandingkan, yang akan merosakkan ujian kos jika anda terlepas pandang. Pada Sonnet 5 dan Fable 5, pemikiran sudah dihidupkan dan tidak memerlukan konfigurasi. Pada Opus 4.8 dan Opus 4.7, ia dimatikan sehingga anda menetapkan thinking: {type: "adaptive"} dalam permintaan. Padankan konfigurasi pada kedua-dua belah pihak sebelum anda membuat sebarang kesimpulan daripada angka tersebut.

Mengapa model paling murah boleh menjadi yang paling mahal

Ambil satu tugasan pengekodan yang lengkap. Permintaan tersebut membawa 60,000 token konteks, dan model menghasilkan 8,000 token output termasuk proses pemikiran. Tiada caching, jadi pengiraan kekal kelihatan.

Pada Opus 4.8: 0.06 MTok input pada harga $5 ialah $0.30, dan 0.008 MTok output pada harga $25 ialah $0.20. Percubaan tersebut menelan kos $0.50. Pada Haiku 4.5, percubaan yang sama ialah $0.06 ditambah $0.04, jadi $0.10.

Haiku adalah lima kali ganda lebih murah bagi setiap percubaan, yang kelihatan seperti ruang penjimatan yang besar sehingga anda melihat apa yang berlaku apabila percubaan gagal. Anda membaca jawapan yang salah, yang memakan masa anda. Anda menghantarnya semula sebagai konteks pada percubaan seterusnya, jadi setiap percubaan menjadi lebih besar daripada yang sebelumnya. Dan apabila percubaan ketiga masih gagal, anda tetap perlu meningkatkan tahap model: $0.30 untuk Haiku ditambah $0.50 untuk Opus ialah $0.80, atau 60% lebih mahal daripada menjalankan Opus sekali sahaja.

Jadi, soalan penentu ialah betapa murahnya anda boleh menyemak jawapan tersebut. Apabila jawapan yang salah jelas kelihatan dalam satu saat, model kecil adalah satu penjimatan. Apabila mengesan jawapan salah bermakna perlu membaca diff dengan teliti, model kecil memakan masa anda yang tidak pernah muncul dalam invois.

Situasi model yang lebih kecil lebih berkesan

Haiku 4.5 merupakan pilihan yang tepat dalam kes-kes berikut:

  • Tugasan subejen mekanikal. Subejen yang menamakan semula fail atau mengumpul output carian tidak memerlukan penaakulan peringkat tinggi. Ini adalah corak standard sebaik sahaja anda membina ejen AI dengan Claude dan memberikan pembantu kepadanya.
  • Triage log. Menentukan sama ada sesuatu baris itu hanyalah gangguan atau perlu diberi perhatian oleh manusia adalah pertimbangan yang terhad dengan mod kegagalan yang jelas.
  • Klasifikasi berdasarkan set label tetap. Outputnya pendek dan ketepatan boleh diukur pada sampel.
  • Panggilan pengeluaran volum tinggi. Pada 100,000 pelaksanaan sehari, jurang per-token bukan lagi sekadar ralat pembundaran. Ini adalah bentuk biasa bagi alur kerja AI yang disambungkan ke dalam n8n.
  • Apa-apa sahaja yang mementingkan kelajuan respons kepada pengguna. Haiku 4.5 dinilai sebagai model terpantas dalam barisan model tersebut.

Satu had khusus untuk Haiku ialah saiz minimum prompt yang boleh dicache adalah 4,096 token, berbanding 1,024 pada Opus 4.8 dan Sonnet 5. Di bawah had minimum tersebut, "sebarang permintaan untuk cache kurang daripada jumlah token ini akan diproses tanpa caching, dan tiada ralat dikembalikan". Blok arahan 1,500-token yang dicache pada Sonnet 5 tidak akan dicache pada Haiku 4.5 tanpa sebarang amaran. Petandanya ialah cache_creation_input_tokens dan cache_read_input_tokens kedua-duanya berada pada sifar, yang mana mengekalkan kos ejen yang sentiasa aktif merangkumi perkara ini di samping cara lain yang menyebabkan kehilangan cache.

Tuas yang mengubah jawapan

Setiap perkara ini menggerakkan bil lebih jauh daripada nama model.

Usaha (Effort). output_config.effort mengawal jumlah kerja yang dilakukan oleh model sebelum ia menjawab. Tahapnya ialah low, medium, high, xhigh dan max, manakala high ialah tetapan lalai: "Menetapkan effort kepada high menghasilkan tingkah laku yang sama persis seperti meninggalkan parameter effort sepenuhnya." Ia terletak di dalam output_config dan bukannya pada peringkat atas permintaan:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Usaha mempengaruhi setiap token dalam respons: "Ia boleh menjejaskan semua penggunaan token termasuk panggilan alat. Sebagai contoh, usaha yang lebih rendah bermakna Claude membuat lebih sedikit panggilan alat." Ini memberi kesan terkumpul pada gelung ejen. Ia bukan had token: "Usaha ialah isyarat tingkah laku, bukan bajet token yang ketat." Anthropic tidak menerbitkan pengganda kos bagi setiap tahap dan menyarankan anda menguji kes penggunaan anda sendiri, jadi pelaksanaan Sonnet 5 pada high berbanding pelaksanaan Opus 4.8 pada low ialah perbandingan sebenar yang boleh anda jalankan petang ini. Haiku 4.5 tiada dalam senarai model yang menyokong usaha.

Caching prompt. Bacaan cache berharga 0.1x daripada kadar input asas, dan angka yang menentukan pilihan model ialah kesan perkara tersebut merentas peringkat. Cache hit pada Opus 4.8 berharga $0.50 / MTok, dan input tanpa cache pada Haiku 4.5 berharga $1 / MTok, jadi awalan Opus yang di-cache dengan baik adalah lebih murah bagi setiap token input berbanding prompt Haiku yang baharu. Kebersihan sesi lebih berkesan daripada pilihan model bagi sebarang beban kerja yang menghantar semula awalan besar yang stabil.

Batch. Jika tiada apa-apa yang menunggu jawapan, API Message Batches menjalankan model yang sama dengan "diskaun 50% bagi kedua-dua token input dan output". Ia mengurangkan separuh setiap baris perbandingan di bawah, dan ia berfungsi merentas peringkat: kerja Opus 4.8 secara batch berharga lebih rendah daripada kerja Sonnet 5 secara segerak pada harga standard mulai 1 September 2026, menukarkan kependaman (latency) dengan keupayaan pada kos yang sama.

Perbandingan kos kerja yang telah diselesaikan

Beban kerja: mengelaskan 100,000 e-mel sokongan, satu panggilan setiap satu, 2,000 token input dan 300 token output setiap panggilan. Ini bermakna 200 MTok input dan 30 MTok output.

  • Haiku 4.5: 200 x $1 = $200 masuk, 30 x $5 = $150 keluar. Jumlah $350.
  • Sonnet 5, kadar pengenalan: 200 x $2 = $400 masuk, 30 x $10 = $300 keluar. Jumlah $700.
  • Sonnet 5, mulai 1 September 2026: 200 x $3 = $600 masuk, 30 x $15 = $450 keluar. Jumlah $1,050.
  • Opus 4.8: 200 x $5 = $1,000 masuk, 30 x $25 = $750 keluar. Jumlah $1,750.

Tukar empat nombor untuk mengiranya semula dengan harga esok. Pelarasan di bawah mengubah hasil lebih jauh berbanding nama model:

  • Batching mengurangkan setiap baris kepada separuh: $175, $350, $525 dan $875. Tiada apa yang perlu menunggu proses klasifikasi waktu malam, jadi tiada sebab untuk melangkau langkah ini.
  • Caching awalan yang dikongsi. Katakan 1,200 daripada 2,000 token input adalah blok arahan yang sama setiap kali. Pada Sonnet 5 dengan kadar pengenalan, kosnya ialah $0.20 / MTok sebagai cache hit dan bukannya $2 / MTok, jadi 120 MTok berharga $24 berbanding $240. Tambahkan 80 MTok input baharu pada harga $2, iaitu $160, ditambah $300 untuk output, dan Sonnet 5 mencecah sekitar $484 berbanding $700. Trik yang sama tidak memberi kesan pada Haiku 4.5, kerana 1,200 token adalah di bawah had minimum 4,096-tokennya.
  • Percubaan semula (Retries). Andaikan anda menolak jawapan Haiku pada 8% daripada e-mel tersebut dan menjalankan semula e-mel itu pada Opus 4.8. Tambahkan 0.08 x $1,750 = $140 kepada $350, memberikan $490. Ukur kadar penolakan anda sendiri dan jangan meminjam kadar saya.
  • Definisi alat, jika tugasan menggunakannya. Prompt sistem yang dijana adalah 290 token pada Opus 4.8 dengan tool_choice ditetapkan kepada auto, 354 pada Sonnet 5 dan 496 pada Haiku 4.5. Model paling murah membawa overhead tetap yang paling besar.

Haiku dengan laluan eskalasi pada harga $490 dan Sonnet 5 yang menggunakan cache pada harga $484 mempunyai kos yang sama, dan salah satu daripadanya menyelesaikan tugasan dalam satu hantaran. Model bukanlah satu-satunya persoalan dalam perkara ini.

Adakah menukar model di pertengahan sesi menjimatkan kos?

Jarang sekali, tidak seperti harga yang tertera, kerana penjimatan adalah berdasarkan setiap token manakala risiko yang anda tanggung ialah keseluruhan awalan (prefix) yang dicache.

Anthropic mendokumentasikan perkara yang membatalkan cache. Awalan dibina mengikut urutan tools, kemudian system, kemudian messages, dan "Perubahan pada setiap peringkat akan membatalkan peringkat tersebut dan semua peringkat seterusnya." Dua tetapan permintaan juga berada dalam senarai itu: "Konfigurasi pemikiran dan peringkat effort yang diselesaikan akan dirender ke dalam prompt itu sendiri, jadi menukar mana-mana daripadanya akan memulakan awalan cache yang baharu." Mengenai usaha (effort), dokumen tersebut menyatakan dengan lebih lanjut: "pelbagaikan usaha merentas beban kerja dan bukannya dalam perbualan yang bergantung pada cache hits".

Model tidak berada dalam senarai yang didokumentasikan itu, jadi jangan buat andaian sama ada ia menjejaskan cache atau tidak. Baca cache_read_input_tokens pada permintaan pertama selepas penukaran dan biarkan angka tersebut memberikan jawapan. Pada awalan Opus 4.8 sebanyak 150,000-token, bacaan cache menelan kos kira-kira $0.08 dan penulisan baharu kira-kira $0.94, iaitu lebih tinggi daripada beberapa pusingan jurang per-token yang anda kejar.

Oleh itu, tukar perkara ini antara tugasan, bukan di dalam satu tugasan. Dalam Claude Code, ini bermakna /clear dahulu, apabila cache sedang dibuang, kemudian /model atau /effort. Kedua-duanya ditaip pada CLI, jadi jika anda bekerja pada Linux, pemasangan yang berbaloi untuk dimiliki ialah pemasangan terminal, memandangkan apa yang Anthropic sediakan secara natif untuk Linux menggandingkan CLI yang stabil dengan aplikasi desktop yang masih dalam versi beta. Sama ada pertukaran tersebut muncul dalam bil atau tidak, ia bergantung pada cara anda membayar untuk sesi tersebut, memandangkan Claude Code berjalan sama ada pada pelan bulanan tetap atau kredit API per-token dan hanya pilihan kedua yang meletakkan harga dalam dolar bagi penukaran model.

Cara menguji jawapan pada beban kerja anda sendiri

Jangan tentukan saiz prompt berdasarkan kiraan daripada model yang berbeza. Endpoint pengiraan token adalah percuma untuk digunakan dan mengira menggunakan tokenizer bagi mana-mana model yang anda namakan, jadi namakan model yang anda rancang untuk panggil. Endpoint tersebut adalah salah satu daripada beberapa bahagian platform yang tidak pernah mengenakan caj, dan apa lagi yang boleh anda jalankan tanpa bayaran patut disemak sebelum anda membelanjakan kredit sebenar untuk perbandingan. Opus 4.7 dan versi seterusnya, Fable 5 serta Sonnet 5 menggunakan tokenizer baharu yang "menghasilkan kira-kira 30% lebih banyak token untuk teks yang sama", jadi bajet yang diukur pada model lama akan kelihatan rendah pada model baharu walaupun kadar per-token tidak berubah.

Kemudian, baca maklum balas yang diterima. input_tokens hanyalah baki yang tidak dicache, jadi saiz prompt yang sebenar ialah medan tersebut ditambah dengan cache_creation_input_tokens dan cache_read_input_tokens. Aplikasi API Claude pertama pada VPS ialah tempat paling kecil dan jujur untuk menjalankan pengukuran tersebut, dan pelan Claude yang sesuai dengan penggunaan anda ialah keputusan berasingan mengenai sama ada anda perlu membayar per-token atau tidak. Jika ia menjadi persoalan tentang langganan mana yang perlu dikekalkan dan bukannya sama ada perlu melanggan, peringkat harga Claude berbanding ChatGPT merangkumi kos kerja pengekodan yang sama pada tempat duduk penyedia lain. Jika pengukuran tersebut menyebabkan kerja anda dihantar ke API secara kekal, menurunkan peringkat langganan atau membatalkannya terus masih membolehkan anda menggunakan tempoh yang telah dibayar, jadi tiada penalti untuk membuat keputusan sebaik sahaja angka-angka tersebut diperoleh.

FAQ

Model Claude yang manakah paling sesuai untuk pengekodan?

Claude Opus 4.8 ialah titik permulaan yang didokumentasikan untuk pengekodan ejen yang kompleks, pada harga $5 bagi setiap juta token input dan $25 bagi setiap juta token output setakat Julai 2026. Claude Sonnet 5 diletakkan sebagai gabungan terbaik antara kelajuan dan kecerdasan, dan pada harga $2 / $10 sehingga 31 Ogos 2026, kosnya kurang daripada separuh. Jalankan tugasan yang sama pada kedua-duanya, kekalkan konfigurasi pemikiran (thinking configuration) yang sama, dan bandingkan jumlah perbelanjaan token daripada response.usage.

Adakah Claude Haiku 4.5 cukup murah untuk menggantikan Sonnet 5?

Bagi setiap token, sememangnya: $1 / $5 berbanding $2 / $10 untuk Sonnet 5 pada harga pengenalan, atau $3 / $15 mulai 1 September 2026. Had (limits) yang menentukan keputusan tersebut. Haiku 4.5 mempunyai tetingkap konteks 200K token dan bukannya 1M, output maksimum 64K pada Messages API segerak, tarikh akhir pengetahuan yang boleh dipercayai pada Februari 2025, tiada sokongan output_config.effort, dan gesaan (prompt) boleh cache minimum 4,096-token yang melumpuhkan caching secara senyap pada gesaan sistem yang pendek.

Adakah menukar kepada model Claude yang lebih murah di pertengahan sesi menjimatkan wang?

Kurang kerap daripada yang disangka. Anthropic mendokumentasikan pembatal cache sebagai perubahan kepada awalan tools, system atau messages, perubahan kepada konfigurasi pemikiran, dan perubahan kepada output_config.effort. Kesan pertukaran model terhadap cache sedia ada tidak didokumentasikan, jadi anggap ia sebagai tidak diketahui dan baca cache_read_input_tokens pada permintaan pertama selepas itu. Kepentingannya perlu diketahui: pada awalan 150,000-token Opus 4.8, bacaan cache berharga kira-kira $0.08 dan penulisan baharu kira-kira $0.94, yang mengatasi penjimatan bagi setiap token untuk beberapa pusingan. Tukar antara tugasan, selepas /clear dalam Claude Code, apabila cache dibuang tanpa mengira keadaan.

Apakah kesan output_config.effort terhadap bil saya?

Ia mengubah jumlah token yang dibelanjakan oleh model merentasi teks, panggilan alat (tool calls) dan pemikiran. Usaha (effort) yang lebih rendah menghasilkan lebih sedikit panggilan alat, yang terkumpul pada gelung ejen kerana setiap hasil alat dihantar semula pada pusingan kemudian. Tahap-tahapnya ialah low, medium, high, xhigh dan max, dengan high sebagai lalai. Anthropic tidak menerbitkan pengganda kos bagi setiap tahap, memanggil usaha sebagai isyarat tingkah laku dan bukannya bajet token, jadi ukur ia berdasarkan tugasan anda sendiri.

Berapakah penjimatan Claude Batches API?

50% pada kedua-dua token input dan output, sebagai pertukaran untuk penghantaran tak segerak. Setakat Julai 2026, ini meletakkan Opus 4.8 pada $2.50 masuk / $12.50 keluar, Sonnet 5 pada $1 / $5 pada harga pengenalan, dan Haiku 4.5 pada $0.50 / $2.50. Perbandingan yang perlu diberi perhatian merentasi peringkat: kerja Opus 4.8 yang diproses secara kelompok (batched) berharga kurang daripada kerja Sonnet 5 segerak pada kadar standard mulai 1 September 2026, jadi pemprosesan kelompok membolehkan penggunaan model yang lebih berkuasa dengan kos yang sama.