Model Claude mana paling berbaloi? Panduan kos
Bandingkan kadar Claude Opus 4.8, Sonnet 5 dan Haiku 4.5. Lihat perbandingan kos bagi 100,000 tugasan serta kadar MTok terkini setakat Julai 2026.
Model Claude manakah yang patut saya gunakan?
Jawapan ringkas bagi model Claude yang patut anda gunakan: mulakan dengan Claude Opus 4.8, dan hanya tukar jika anda mempunyai sebab yang khusus. Panduan Anthropic adalah sama. "Jika anda tidak pasti model mana yang hendak digunakan, mulakan dengan Claude Opus 4.8 untuk pengkodan ejen yang kompleks dan kerja perusahaan." Gunakan Claude Sonnet 5 apabila tugasan sudah ditentukan dengan jelas dan anda melaksanakannya berkali-kali sehari. Gunakan Claude Haiku 4.5 untuk kerja mekanikal volum tinggi di mana anda sudah tahu rupa jawapan yang betul. Claude Fable 5 berada di atas kesemuanya, untuk ejen yang berjalan lama.
Pilihan ini mempunyai kos. Ini adalah kadar pada Claude API (application programming interface) setakat 23 Julai 2026, bagi setiap satu juta token, yang ditulis dalam dokumentasi sebagai MTok.
- Claude Fable 5 (
claude-fable-5): $10 / MTok masuk, $50 / MTok keluar. 1M konteks. - Claude Opus 4.8 (
claude-opus-4-8): $5 masuk, $25 keluar. 1M konteks. - Claude Opus 4.7 (
claude-opus-4-7): $5 masuk, $25 keluar. 1M konteks. - Claude Sonnet 5 (
claude-sonnet-5): $2 masuk, $10 keluar pada harga pengenalan sehingga 31 Ogos 2026. Kadar standard $3 masuk, $15 keluar berkuat kuasa pada 1 September 2026. 1M konteks. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 masuk, $5 keluar. 200K konteks.
Pengecam tersebut adalah lengkap seperti yang ditulis. Tiada apa-apa yang ditambah pada mereka.
Saiz tidak membawa caj tambahan pada model 1M-token: "Permintaan 900k-token dibilkan pada kadar per-token yang sama dengan permintaan 9k-token."
Kegunaan sebenar setiap model
Anthropic menerangkan setiap model dalam satu baris, dan penerangan tersebut lebih berguna daripada mana-mana papan pendahulu.
- Claude Fable 5: "Kecerdasan generasi seterusnya untuk ejen jangka panjang." Dinilai sebagai yang paling lambat antara empat model dari segi kependaman.
- Claude Opus 4.8: "Untuk pengekodan ejen yang kompleks dan kerja perusahaan." Kependaman sederhana.
- Claude Sonnet 5: "Gabungan kelajuan dan kecerdasan yang terbaik." Pantas.
- Claude Haiku 4.5: "Model terpantas dengan kecerdasan tahap frontier."
Haiku 4.5 juga mempunyai had yang menentukan kesesuaian tugasan sebelum faktor harga. Jendela konteksnya adalah 200K token dan bukannya 1M, jadi repositori besar atau transkrip ejen yang panjang tidak akan muat. Output maksimumnya pada Messages API secara sinkronus adalah 64K token berbanding 128K untuk model lain, dan had pengetahuan yang boleh dipercayai adalah Februari 2025, manakala tiga model lain adalah pada Januari 2026.
Apakah kos pilihan ini pada beban kerja sebenar?
Setiap model dalam barisan ini menetapkan harga output pada lima kali ganda kadar inputnya. Opus 4.8 adalah $5 untuk input dan $25 untuk output. Haiku 4.5 adalah $1 untuk input dan $5 untuk output. Nisbah ini konsisten bagi seluruh julat, jadi model yang anda pilih paling penting bagi kerja yang menghasilkan banyak output.
Kerja agentic adalah jenis kerja sedemikian, kerana token pemikiran (thinking tokens) dibilkan sebagai token output dan dikira ke dalam max_tokens walaupun teks tersebut tidak dihantar kepada anda. Pada Fable 5, Opus 4.8, Opus 4.7 dan Sonnet 5, ringkasan penaakulan (reasoning summary) diabaikan secara lalai, jadi medan thinking akan dikembalikan sebagai kosong. Bil adalah tidak berubah: "Dalam kedua-dua keadaan, blok tersebut dibilkan dengan cara yang sama dan dikembalikan dengan cara yang sama dalam perbualan pelbagai pusingan (multi-turn conversations)." Apa yang sebenarnya mengisi bil token Claude membincangkan perkara itu secara terperinci.
Sama ada fungsi pemikiran (thinking) berjalan atau tidak berbeza antara model yang anda bandingkan, yang mana akan merosakkan ujian kos jika anda terlepas pandang. Pada Sonnet 5 dan Fable 5, pemikiran sudah diaktifkan dan tidak memerlukan konfigurasi. Pada Opus 4.8 dan Opus 4.7, ia dimatikan sehingga anda menetapkan thinking: {type: "adaptive"} dalam permintaan. Samakan konfigurasi pada kedua-dua belah sebelum anda menganalisis angka tersebut.
Mengapa model termurah boleh menjadi yang paling mahal
Ambil satu tugasan pengekodan yang lengkap. Permintaan tersebut mengandungi 60,000 token konteks, dan model menghasilkan 8,000 token output termasuk proses pemikiran. Tanpa caching, pengiraan kekal nyata.
Pada Opus 4.8: 0.06 MTok input pada $5 adalah $0.30, dan 0.008 MTok output pada $25 adalah $0.20. Percubaan tersebut menelan kos $0.50. Pada Haiku 4.5, percubaan yang sama adalah $0.06 ditambah $0.04, iaitu $0.10.
Haiku adalah lima kali lebih murah bagi setiap percubaan, yang kelihatan seperti penjimatan besar sehingga anda melihat kesan daripada percubaan yang gagal. Anda membaca jawapan yang salah, yang membazirkan masa anda. Anda menghantar semula jawapan tersebut sebagai konteks semasa cubaan semula, jadi setiap percubaan adalah lebih besar daripada sebelumnya. Dan apabila cubaan ketiga masih gagal, anda tetap beralih ke model lebih besar: $0.30 daripada Haiku ditambah $0.50 daripada Opus adalah $0.80, atau 60% lebih mahal daripada menjalankan Opus sekali.
Jadi, persoalan utamanya adalah betapa murahnya anda boleh menyemak jawapan tersebut. Apabila jawapan yang salah jelas kelihatan dalam satu saat, model kecil adalah pilihan yang berbaloi. Apabila mengesan kesilapan memerlukan pembacaan diff secara teliti, model kecil menelan masa yang tidak tertera pada bil.
Keadaan di mana model yang lebih kecil lebih unggul
Haiku 4.5 adalah pilihan yang tepat dalam kes-kes berikut:
- Kerja subeagen mekanikal. Subeagen yang menamakan semula fail atau mengumpul output carian tidak memerlukan penaakulan tahap tinggi. Itu adalah corak standard sebaik sahaja anda membina ejen AI dengan Claude dan memberikan pembantu kepadanya.
- Triage log. Menentukan sama ada sesuatu baris adalah gangguan atau memerlukan perhatian manusia adalah penilaian khusus dengan mod kegagalan yang jelas.
- Klasifikasi terhadap set label tetap. Output adalah pendek dan ketepatan boleh diukur pada sampel.
- Panggilan produksi volum tinggi. Pada 100,000 larian sehari, perbezaan kos per-token bukan lagi ralat pembundaran yang kecil. Itu adalah bentuk biasa bagi aliran kerja AI yang disambungkan ke n8n.
- Apa-apa keadaan di mana kelajuan respons penting kepada pengguna. Haiku 4.5 dinilai sebagai model terpantas dalam siri tersebut.
Satu had adalah khusus untuk Haiku. Prompt minimum yang boleh disimpan dalam cache adalah 4,096 token, berbanding 1,024 pada Opus 4.8 dan Sonnet 5, dan di bawah minimum tersebut "sebarang permintaan untuk menyimpan cache kurang daripada jumlah token ini akan diproses tanpa cache, dan tiada ralat dikembalikan". Blok arahan 1,500-token yang disimpan dalam cache pada Sonnet 5 secara senyap tidak disimpan dalam cache pada Haiku 4.5. Petandanya ialah cache_creation_input_tokens dan cache_read_input_tokens kedua-duanya berada pada sifar, yang mana menjaga kos ejen sentiasa-aktif agar rendah merangkumi perkara tersebut bersama cara lain untuk kehilangan cache.
Pemboleh ubah yang mengubah jawapan
Setiap perkara ini mempengaruhi kos lebih daripada nama model itu sendiri.
Effort. output_config.effort mengawal jumlah kerja yang dilakukan model sebelum memberikan jawapan. Tahap-tahapnya adalah low, medium, high, xhigh dan max, manakala high adalah nilai lalai: "Menetapkan effort kepada high menghasilkan tingkah laku yang sama persis dengan tidak menggunakan parameter effort sama sekali." Ia berada di dalam output_config dan bukan pada tahap teratas permintaan:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort mempengaruhi setiap token dalam respons: "Ia boleh menjejaskan semua penggunaan token termasuk panggilan alatan (tool calls). Sebagai contoh, effort yang lebih rendah bermaksud Claude membuat kurang panggilan alatan." Ini akan bertambah dalam gelung ejen (agentic loop). Ia bukan had token: "Effort adalah isyarat tingkah laku, bukan bajet token yang ketat." Anthropic tidak menerbitkan pengganda kos bagi setiap tahap dan menyarankan anda menguji kes penggunaan sendiri, jadi menjalankan Sonnet 5 pada high berbanding Opus 4.8 pada low adalah perbandingan sebenar yang boleh anda lakukan petang ini. Haiku 4.5 tiada dalam senarai model yang menyokong effort.
Prompt caching. Pembacaan cache berharga 0.1x daripada kadar input asas, dan faktor yang menentukan pilihan model adalah apa yang dilakukan oleh cache merentasi pelbagai tier. Cache hit pada Opus 4.8 berharga $0.50 / MTok, manakala input tanpa cache pada Haiku 4.5 berharga $1 / MTok, jadi prefix Opus yang di-cache dengan baik adalah lebih murah bagi setiap token input berbanding prompt Haiku yang sejuk (cold). Pengurusan sesi (session hygiene) adalah lebih penting daripada pilihan model bagi mana-mana beban kerja yang menghantar semula prefix stabil yang besar.
Batches. Jika jawapan tidak diperlukan dengan segera, Message Batches API menjalankan model yang sama dengan "diskaun 50% bagi kedua-dua token input dan output". Ia mengurangkan separuh setiap baris dalam perbandingan di bawah, dan ia berfungsi merentasi semua tier: tugasan Opus 4.8 secara batch berharga lebih murah daripada tugasan Sonnet 5 secara sinkronus pada harga standard bermula 1 September 2026, menukar latensi dengan keupayaan pada jumlah wang yang sama.
Perbandingan kos satu beban kerja
Beban kerja: klasifikasikan 100,000 e-mel sokongan, satu panggilan setiap satu, 2,000 token input dan 300 token output bagi setiap panggilan. Ini bersamaan dengan 200 MTok input dan 30 MTok output.
- Haiku 4.5: 200 x $1 = $200 masuk, 30 x $5 = $150 keluar. Jumlah $350.
- Sonnet 5, kadar pengenalan: 200 x $2 = $400 masuk, 30 x $10 = $300 keluar. Jumlah $700.
- Sonnet 5, bermula 1 September 2026: 200 x $3 = $600 masuk, 30 x $15 = $450 keluar. Jumlah $1,050.
- Opus 4.8: 200 x $5 = $1,000 masuk, 30 x $25 = $750 keluar. Jumlah $1,750.
Tukar empat nombor untuk mengira semula dengan harga masa hadapan. Pelarasan di bawah memberikan kesan yang lebih besar daripada nama model:
- Batching memotong harga setiap baris kepada separuh: $175, $350, $525 dan $875. Tiada proses yang menunggu dalam larian klasifikasi malam, jadi tiada sebab untuk tidak menggunakannya.
- Caching prefix yang dikongsi. Katakan 1,200 daripada 2,000 token input adalah blok arahan yang sama setiap kali. Pada Sonnet 5 dengan kadar pengenalan, kosnya adalah $0.20 / MTok sebagai cache hits berbanding $2 / MTok, jadi 120 MTok berharga $24 berbanding $240. Tambah 80 MTok input baharu pada $2, iaitu $160, ditambah $300 output, maka Sonnet 5 menjadi sekitar $484 berbanding $700. Teknik yang sama tidak memberi kesan pada Haiku 4.5, kerana 1,200 token adalah di bawah had minimum 4,096-token.
- Retries. Andaikan anda menolak jawapan Haiku pada 8% e-mel dan menjalankan semula e-mel tersebut pada Opus 4.8. Tambah 0.08 x $1,750 = $140 kepada $350, menjadikan jumlahnya $490. Ukur kadar penolakan anda sendiri berbanding menggunakan kadar saya.
- Definisi tool, jika tugasan menggunakannya. Prompt sistem yang dihasilkan adalah 290 token pada Opus 4.8 dengan
tool_choiceditetapkan kepadaauto, 354 pada Sonnet 5 dan 496 pada Haiku 4.5. Model termurah membawa beban tetap yang paling besar.
Haiku dengan laluan eskalasi pada $490 dan Sonnet 5 dengan cache pada $484 mempunyai kos yang sama, dan salah satunya menyelesaikan tugasan dalam satu larian. Model bukanlah satu-satunya faktor utama.
Adakah menukar model di tengah sesi menjimatkan wang?
Ia jarang berlaku berbanding harga yang dinyatakan, kerana penjimatan dikira mengikut token dan risiko yang dihadapi adalah keseluruhan prefix yang disimpan dalam cache.
Anthropic mendokumentasikan perkara yang membatalkan cache. Prefix dibina mengikut urutan tools, kemudian system, kemudian messages, dan "Perubahan pada setiap tahap membatalkan tahap tersebut dan semua tahap seterusnya." Dua tetapan permintaan juga berada dalam senarai tersebut: "Konfigurasi pemikiran dan tahap effort yang telah diselesaikan dimasukkan ke dalam prompt itu sendiri, jadi menukar mana-mana tetapan tersebut akan memulakan prefix cache yang baharu." Dokumentasi tersebut menjelaskan lebih lanjut: "Pelbagaikan tahap usaha (effort) merentasi beban kerja berbanding di dalam satu perbualan yang bergantung pada padanan cache (cache hits)".
Model tidak berada dalam senarai dokumentasi tersebut, jadi jangan membuat andaian. Baca cache_read_input_tokens pada permintaan pertama selepas pertukaran dan lihat hasilnya. Bagi prefix Opus 150,000-token 4.8, bacaan cache menelan kos sekitar $0.08 manakala penulisan baharu menelan kos sekitar $0.94, yang mana lebih mahal daripada perbezaan harga per-token yang anda cuba jimatkan.
Oleh itu, tukar perkara ini antara tugasan, bukan di dalam satu tugasan. Dalam Claude Code, ini bermaksud lakukan /clear terlebih dahulu, apabila cache memang akan dibuang, kemudian /model atau /effort.
Cara menguji jawapan pada beban kerja anda sendiri
Jangan tentukan saiz prompt menggunakan jumlah daripada model yang berbeza. Endpoint pengiraan token adalah percuma untuk digunakan dan mengira menggunakan tokenizer bagi model yang anda nyatakan, jadi nyatakan model yang anda rancang untuk panggil. Opus 4.7 dan versi kemudian, Fable 5 dan Sonnet 5 menggunakan tokenizer baharu yang "menghasilkan kira-kira 30% lebih banyak token untuk teks yang sama", jadi bajet yang diukur pada model lama akan menjadi rendah pada model baharu walaupun kadar per-token adalah sama.
Kemudian baca hasil yang diterima. input_tokens hanyalah baki yang tidak tersimpan dalam cache, jadi saiz prompt yang sebenar adalah medan tersebut ditambah dengan cache_creation_input_tokens dan cache_read_input_tokens. Aplikasi Claude API pertama pada VPS adalah tempat paling ringkas dan tepat untuk menjalankan pengukuran tersebut, manakala pelan Claude yang sesuai dengan penggunaan anda adalah keputusan berasingan tentang sama ada anda perlu membayar mengikut token atau tidak.
FAQ
Model Claude manakah yang terbaik untuk pengkodan?
Claude Opus 4.8 adalah titik permulaan yang didokumentasikan untuk pengkodan ejen yang kompleks, pada harga $5 per satu juta token input dan $25 per satu juta output setakat Julai 2026. Claude Sonnet 5 diletakkan sebagai kombinasi terbaik antara kelajuan dan kecerdasan, dan pada harga $2 / $10 sehingga 31 Ogos 2026, ia menelan kos kurang daripada separuh. Jalankan tugasan yang sama pada kedua-duanya, kekalkan konfigurasi pemikiran yang tetap, dan bandingkan jumlah perbelanjaan token daripada response.usage.
Adakah Claude Haiku 4.5 cukup murah untuk menggantikan Sonnet 5?
Berdasarkan per token, ya: $1 / $5 berbanding $2 / $10 untuk Sonnet 5 pada harga pengenalan, atau $3 / $15 bermula 1 September 2026. Had penggunaan yang menentukannya. Haiku 4.5 mempunyai tetingkap konteks 200K token berbanding 1M, output maksimum 64K pada Messages API yang sinkronus, had pengetahuan yang boleh dipercayai pada Februari 2025, tiada sokongan output_config.effort, dan minimum prompt boleh simpan (cacheable) sebanyak 4,096 token yang akan mematikan fungsi simpanan pada prompt sistem yang pendek.
Adakah menukar ke model Claude yang lebih murah di tengah sesi menjimatkan wang?
Tidaklah sebanyak yang disangka. Anthropic mendokumentasikan pembatal simpanan (cache invalidators) sebagai perubahan pada awalan tools, system atau messages, perubahan pada konfigurasi pemikiran, dan perubahan pada output_config.effort. Kesan pertukaran model terhadap simpanan sedia ada tidak didokumentasikan, jadi anggap ia sebagai tidak diketahui dan baca cache_read_input_tokens pada permintaan pertama selepas itu. Perkara ini penting untuk diketahui: pada awalan Opus 4.8 sebanyak 150,000 token, bacaan simpanan menelan kos sekitar $0.08 dan penulisan baharu sekitar $0.94, yang mana lebih tinggi daripada penjimatan per token bagi beberapa pusingan. Tukar antara tugasan, selepas /clear dalam Claude Code, apabila simpanan memang akan dibuang.
Apakah fungsi output_config.effort terhadap bil saya?
Ia mengubah jumlah token yang digunakan model merentasi teks, panggilan alatan (tool calls), dan pemikiran. Tahap usaha (effort) yang lebih rendah menghasilkan kurang panggilan alatan, yang akan berganda dalam gelung ejen kerana setiap hasil alatan dihantar semula pada pusingan seterusnya. Tahap-tahapnya ialah low, medium, high, xhigh dan max, dengan high sebagai lalai. Anthropic tidak menerbitkan pendarab kos bagi setiap tahap, kerana mereka menganggap usaha sebagai isyarat tingkah laku dan bukannya bajet token, jadi ukur ia pada tugasan anda sendiri.
Berapakah penjimatan Claude Batches API?
50% bagi kedua-dua token input dan output, sebagai pertukaran untuk penghantaran asinkronus. Setakat Julai 2026, ini meletakkan Opus 4.8 pada $2.50 masuk / $12.50 keluar, Sonnet 5 pada $1 / $5 pada harga pengenalan, dan Haiku 4.5 pada $0.50 / $2.50. Perbandingan yang perlu diperhatikan merentasi tahap: tugasan Opus 4.8 secara berkelompok (batched) menelan kos kurang daripada tugasan Sonnet 5 secara sinkronus pada kadar standard bermula 1 September 2026, jadi penggunaan berkelompok memberikan model yang lebih kuat dengan jumlah wang yang sama.