SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-13

Mengapa kos API Claude mahal? Analisis pengiraan token

Kos token output lima kali ganda lebih tinggi daripada input. Setiap giliran menghantar semula keseluruhan sejarah perbualan. Ketahui pengiraan sebenar dan empat cara jimat.

Mengapa Claude mahal? Jawapan ringkas

Claude mahal disebabkan oleh empat faktor yang saling berkait. Token output dikenakan harga lima kali ganda berbanding token input. API tidak menyimpan memori perbualan anda, jadi keseluruhan sejarah dihantar semula dan dibilkan semula pada setiap giliran. Sesuatu ejen menukarkan satu soalan kepada berpuluh-puluh panggilan API, dan setiap panggilan membawa sejarah yang semakin bertambah itu. Selain itu, model frontier diletakkan harga berdasarkan tahap kesukaran kerja yang dilakukan, bukan berdasarkan kos menjalankan model yang kecil.

Token ialah sebahagian daripada teks. Sebagai panduan kasar, satu token adalah kira-kira empat aksara, atau kira-kira 0.75 perkataan bahasa Inggeris. Kadar dinyatakan bagi setiap juta token, ditulis sebagai MTok (million tokens). Setiap kadar di bawah adalah kadar API Claude yang diterbitkan setakat Ogos 2026.

Kebanyakan bil yang mengejutkan berpunca daripada sebab kedua dan ketiga dalam senarai tersebut. Pengguna biasanya beranggapan bahawa jawapan yang ditulis oleh Claude adalah perkara yang menelan kos. Dalam sesi ejen, penulisan tersebut selalunya kurang daripada satu persepuluh daripada jumlah bil.

Kadar yang diterbitkan, supaya kita bersetuju dengan angka tersebut

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

Lihat pada corak berbanding angka mutlak. Setiap model mengenakan bayaran tepat lima kali ganda lebih tinggi untuk output berbanding input. Opus 5 berharga 5 dolar bagi setiap juta token input dan 25 dolar bagi setiap juta token output. Haiku 4.5 berharga 1 dan 5. Jadi, jurang antara model termurah dengan yang paling mahal adalah lima kali ganda, dan jurang antara membaca dengan menulis juga adalah lima kali ganda.

Sonnet 5 berada pada harga pengenalan 2 dan 10 dolar bagi setiap juta sehingga 31 Ogos 2026. Mulai 1 September 2026, harganya berubah kepada 3 dan 15. Kadar berubah mengikut keluaran model, jadi semak kadar semasa sebelum anda membina belanjawan berdasarkan kadar tersebut. Tiada pelan percuma di bawah jadual ini, walaupun akaun baharu bermula dengan kredit kecil dan beberapa bahagian API tidak dikenakan sebarang bayaran.

Lajur terakhir ialah kadar bacaan cache. Ia menentukan kebanyakan bil. Kembali semula kepadanya selepas melakukan pengiraan.

Mengapakah token output menelan kos lima kali ganda berbanding token input?

Membaca dan menulis memerlukan beban kerja yang berbeza. Token input diproses dalam satu hantaran. Model membaca keseluruhan prompt sekaligus dan kerja tersebut dijalankan secara selari, itulah sebabnya prompt 60,000 token tidak mengambil masa 60,000 kali lebih lama untuk dibaca berbanding prompt 1,000 token.

Token output dihasilkan satu demi satu. Setiap token baharu memerlukan hantaran tersendiri melalui model, dan ia memerlukan setiap token sebelumnya sebagai konteks. Menulis 1,000 token bermakna 1,000 hantaran, satu demi satu. Kerja bersiri itu tidak boleh diagihkan seperti proses membaca, jadi setiap token output menggunakan perkakasan untuk tempoh yang lebih lama.

Inilah sebabnya "jadikan jawapan lebih pendek" merupakan tuil yang kurang berkesan daripada jangkaan orang ramai. Ia hanya berfungsi pada bahagian yang lebih kecil dalam bil ejen.

Mengapa keseluruhan perbualan saya dibilkan semula pada setiap giliran?

Claude API adalah tanpa status (stateless). Tiada perbualan yang disimpan di pihak Anthropic untuk anda menambah satu mesej sahaja. Setiap permintaan membawa keseluruhan sejarah mesej, dan model membaca kesemuanya sebelum menulis apa-apa. Oleh itu, giliran ke-30 dibilkan untuk giliran 1 hingga 29 juga.

Ini bermakna kos sesuatu perbualan meningkat lebih pantas daripada panjangnya. Giliran 1 dibilkan untuk konteks yang kecil. Giliran 40 dibilkan untuk konteks yang besar. Jika anda jumlahkan kesemua empat puluh giliran, anda telah membayar berkali-kali ganda jumlah token yang pernah ditulis.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

Sesi di atas bermula pada 20,000 token, iaitu prompt sistem, definisi alat dan fail pertama yang dibuka oleh ejen. Menjelang giliran 40, konteks tersebut mengandungi 100,000 token. Puratakan jumlah ini merentasi kesemua empat puluh giliran dan anda mendapat kira-kira 60,000 token yang dibaca bagi setiap permintaan.

Mengapa kos ejen jauh lebih tinggi daripada sembang?

Sembang ialah satu permintaan bagi setiap soalan. Ejen pula ialah satu permintaan bagi setiap langkah. Membaca fail ialah satu langkah. Menjalankan ujian ialah satu langkah. Membaca output ujian ialah satu langkah. Menyunting fail ialah satu langkah. Empat puluh langkah untuk menyelesaikan satu tugasan adalah perkara biasa bagi ejen pengekodan.

Dua kos tambahan wujud bersama penggunaan alatan. Definisi alatan merupakan token input bagi setiap permintaan, kerana model perlu diberitahu tentang alatan yang tersedia pada setiap masa. Anthropic menerbitkan kos overhed tersebut: prompt sistem penggunaan alatan adalah sebanyak 286 token pada Opus 5 dengan tool_choice ditetapkan kepada auto, ditambah dengan token skema alatan anda sendiri. Sesetengah alatan sebelah pelayan juga membawa caj berasingan. Carian web dibilkan pada harga $10 bagi setiap 1,000 carian sebagai tambahan kepada token yang digunakan oleh hasil carian tersebut.

Setiap hasil alatan juga menjadi konteks kekal. Perintah yang mencetak 3,000 baris akan memasukkan 3,000 baris tersebut ke dalam setiap permintaan bagi sepanjang sesi. Penggunaan token bagi setiap sesi yang dilaporkan oleh Claude Code menjadikan perkara ini jelas: perhatikan nombor input meningkat sejurus selepas perintah yang menghasilkan banyak output.

Pengiraan bagi satu sesi sebenar

Berikut adalah satu jam pengekodan ejen yang realistik pada Opus 5. Sebanyak 40 permintaan API dibuat. Konteks berkembang daripada 20,000 kepada 100,000 token, jadi puratanya adalah sekitar 60,000 token bagi setiap permintaan. Model ini menulis kira-kira 700 token bagi setiap permintaan, yang merupakan gabungan antara panggilan alat yang singkat dan beberapa blok kod yang lebih panjang.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

Perhatikan pembahagian kos tersebut. Kos bacaan adalah 12.00 dolar dan kos penulisan adalah 0.70 dolar, jadi output yang anda baca sebenarnya hanyalah kira-kira lima peratus daripada jumlah bil. Model tersebut menulis 28,000 token dan dibilkan untuk bacaan sebanyak 2,400,000 token. Tiada sesiapa pun yang menaip 2.4 juta token. 100,000 token yang sama dibaca berulang kali.

Tahap 1: prompt caching, iaitu tahap yang paling besar

Prompt caching menyimpan bentuk yang telah diproses bagi awalan (prefix) prompt anda yang stabil. Pada permintaan seterusnya, awalan tersebut dibaca daripada cache dan bukannya diproses semula. Penulisan ke dalam cache menelan kos 1.25 kali ganda kadar input untuk cache lima minit, atau 2 kali ganda untuk cache satu jam. Pembacaan daripadanya menelan kos 0.1 kali ganda kadar input. Pada Opus 5, kosnya ialah 0.50 dolar bagi setiap juta token berbanding 5 dolar.

Gunakan kaedah ini pada sesi di atas. Setiap 100,000 token ditulis ke dalam cache sekali apabila perbualan berkembang. Baki 2,300,000 token input menjadi bacaan cache.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

Anda perlu menandakan bahagian yang boleh dicache dengan medan cache_control. Letakkan titik henti (breakpoint) selepas kandungan yang tidak berubah antara giliran: prompt sistem dan definisi alat. Dokumen panjang yang sering anda rujuk juga tergolong dalam blok stabil yang sama.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

Susunan prompt anda kini menentukan kos. Padanan cache memerlukan padanan tepat dari permulaan prompt, jadi apa-apa yang berubah pada setiap permintaan mestilah diletakkan selepas bahagian yang tidak berubah. Jika anda meletakkan cap masa (timestamp) di bahagian atas prompt sistem, anda akan membatalkan cache pada setiap giliran: keseluruhan awalan menjadi miss, dan anda perlu membayar 1.25 kali ganda kadar input untuk menulisnya semula.

Respons yang diterima akan memberitahu anda sama ada ia berjaya. Hantar permintaan dan baca blok penggunaan (usage block).

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Setiap respons membawa objek usage seperti yang berikut:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

Permintaan ulangan yang masih menunjukkan 0 dalam cache_read_input_tokens bermakna cache tidak diakses (cache miss). Punca biasa ialah terdapat sesuatu sebelum titik henti anda yang telah berubah. Cache lima minit juga akan tamat tempoh, jadi permintaan yang dihantar enam minit kemudian akan menyebabkan miss diikuti dengan penulisan baharu.

Tahap 2: hantar tugasan mudah kepada model yang lebih kecil

Kebanyakan giliran dalam sesi ejen tidaklah sukar. Membuka fail, menjalankan pemformat, atau membaca diff. Tugasan ini tidak memerlukan model frontier. Menghalakannya kepada Haiku 4.5 menukar kadar input daripada 5 dolar bagi setiap juta kepada 1.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

Sesi yang sama menelan kos 12.70 dolar pada Opus 5 tanpa caching, 2.48 dengan caching, 0.99 pada Sonnet 5 dengan caching, dan 0.50 pada Haiku 4.5 dengan caching. Caching sahaja menghapuskan kira-kira lapan puluh peratus daripada bil. Pemilihan model pula menghapuskan kebanyakan baki kos tersebut.

Berikut adalah peringatan jujur. Model yang lebih murah tetapi memberikan jawapan yang salah akan menyebabkan anda perlu mengulangi keseluruhan sesi, di samping membuang masa anda sendiri. Halakan tugasan berdasarkan tahap kesukaran, bukan berdasarkan harga. Peraturan ini juga terpakai ke atas: Claude Fable 5 disenaraikan lebih tinggi daripada Opus 5 pada harga $10 dan $50 bagi setiap juta, jadi baca apa yang anda peroleh dengan kadar tersebut sebelum anda menghantar giliran ke sana. Memilih antara Opus, Sonnet dan Haiku menjelaskan keupayaan setiap model.

Tahap 3: kebersihan konteks

Setiap token yang ditinggalkan dalam konteks akan dicaj pada setiap pusingan seterusnya, jadi membuang token lebih awal adalah jauh lebih berbaloi daripada membuangnya lewat. Fail 5,000 token yang dimasukkan pada pusingan 5 daripada sesi 40 pusingan akan dibaca 35 kali lagi. Ini bermakna 175,000 token input tambahan, yang hampir bernilai satu dolar pada Opus 5 hanya kerana satu tampalan yang cuai.

Empat tabiat yang mengubah angka tersebut:

  • Mulakan sesi baharu untuk tugasan baharu dan bukannya menyambung sesi semalam.
  • Tapis arahan yang bising sebelum output sampai kepada model, dengan sesuatu seperti head -50, bukannya selepas itu.
  • Minta fungsi yang anda perlukan sahaja, bukan keseluruhan fail.
  • Apabila sesi yang panjang berhenti menunjukkan kemajuan, minta ringkasan dan mulakan semula daripada ringkasan tersebut. Ringkasan hanya mengandungi beberapa ratus token. Transkrip pula mengandungi seratus ribu token.

Tahap 4: kelompokkan apa sahaja yang tidak interaktif

Batch API memproses permintaan secara tak segerak dan memberikan potongan 50 peratus untuk input serta output. Jika sesuatu tugasan tidak memerlukan jawapan dalam masa satu saat, kelompokkan tugasan tersebut. Ini merangkumi klasifikasi, pengekstrakan, meringkaskan backlog, dan menjalankan penilaian. Diskaun kelompok ini boleh digabungkan dengan prompt caching. Ia tidak terpakai pada sesi interaktif, kerana tiada apa-apa yang perlu ditunggu di sana.

Adakah saya ditipu?

Itulah persoalan sebenar di sebalik "mengapa Claude mahal", jadi berikut adalah jawapan terus terang. Kadar harga telah diterbitkan, ia adalah sama untuk semua orang pada tier standard, dan ia dicaj mengikut token. Pengecualiannya adalah kontrak yang dirundingkan, dan walaupun begitu harga Claude Enterprise meletakkan caj bagi setiap tempat duduk di hadapan token bermeter yang sama dan bukannya menggantikannya. Tiada apa-apa dalam bil yang bersifat budi bicara. Apa yang kad kadar tidak boleh beritahu anda ialah sama ada anda mendapat nilai, kerana ia meletakkan harga pada token sedangkan anda mementingkan hasil.

Jadi, letakkan harga pada hasil tersebut. Sesi di atas menelan kos 12.70 dolar tanpa caching. Jika ia berjaya mengeluarkan ciri yang sepatutnya mengambil masa sejam untuk anda siapkan, itu murah. Jika ia menghabiskan empat puluh pusingan berlegar-legar tanpa arah, jumlah 12.70 dolar yang sama tidak memberikan apa-apa hasil, dan kadar harga bukanlah masalahnya.

Ini adalah bahagian yang perlu diingat. Bil anda berskala mengikut token, bukan mengikut nilai. Sesi yang produktif dan sesi yang sia-sia dengan panjang yang sama menelan kos yang sama. Itulah sebabnya empat tuil tersebut lebih penting daripada kad kadar: anda tidak boleh merundingkan harga bagi setiap token, tetapi anda menentukan berapa banyak token yang diperlukan untuk sesuatu tugasan.

Oleh itu, jejak dolar bagi setiap tugasan yang diselesaikan, bukan dolar bagi setiap bulan. Jika angka itu menurun semasa anda melaraskan caching dan penghalaan, persediaan anda bertambah baik walaupun jumlah bulanan meningkat, kerana jumlah itu meningkat disebabkan oleh kerja yang lebih banyak dilakukan.

Perkara yang tidak mengurangkan bil anda

Beberapa nasihat popular tidak memberikan kesan yang ketara. Meminta model untuk "menjadi ringkas" hanya memendekkan output, sedangkan output hanya menyumbang lima peratus daripada bil contoh. Memendekkan soalan anda sendiri hanya menjimatkan beberapa ratus token berbanding konteks 60,000 token. Mematikan pemikiran lanjutan (extended thinking) hanya membantu jika token pemikiran merupakan bahagian besar daripada output anda, dan blok penggunaan akan memberitahu anda perkara tersebut tanpa perlu meneka.

Tetingkap konteks yang lebih besar juga bukan satu kos. Pada Claude 4.6 dan versi seterusnya, tetingkap satu juta token penuh dibilkan pada kadar standard setiap token, jadi permintaan 900,000 token mempunyai kos setiap token yang sama dengan permintaan 9,000 token. Saiz tetingkap tidak menetapkan harga. Apa yang anda pilih untuk diletakkan di dalam tetingkap itulah yang menentukan harga.

Dua perkara lagi perlu dirancang dan bukannya dilakukan dalam satu sesi. Jika penggunaan anda bersifat harian dan interaktif, bandingkan bayaran setiap token dengan pelan tetap: perbandingan kos API dan langganan melakukan pengiraan tersebut. Jika pelan tetap lebih berbaloi dan anda sedang menimbangkan pelan vendor lain pada masa yang sama, perbandingan harga pelan Claude dan ChatGPT menjalankan perbandingan yang sama untuk kedua-duanya. Dan jika ejen berjalan tanpa pengawasan pada pelayan, tetapkan had perbelanjaan yang ketat sebelum anda melaraskan perkara lain, itulah yang diliputi dalam kawalan kos untuk ejen AI pada VPS. Untuk gambaran skala yang jelas, apa yang boleh dibeli dengan satu juta token Claude menukarkan kad kadar kepada jumlah halaman teks.

FAQ

Mengapakah bil Claude saya meningkat mendadak apabila saya mula menggunakan ejen?

Kerana ejen menghantar banyak permintaan bagi setiap soalan, dan setiap permintaan membawa keseluruhan perbualan setakat itu. Sembang biasa hanya menghantar satu permintaan bagi setiap soalan. Ejen pengekodan menghantar satu permintaan bagi setiap langkah, dan empat puluh langkah untuk satu tugasan adalah perkara biasa. Setiap permintaan tersebut dibilkan untuk konteks penuh, jadi sesi yang berakhir pada 100,000 token boleh dibilkan untuk lebih dua juta token input secara keseluruhan. Baca input_tokens dan cache_read_input_tokens dalam respons API untuk melihatnya secara terus.

Adakah cache prompt benar-benar mengurangkan bil sebanyak itu?

Dalam contoh yang diberikan, ia mengubah sesi daripada 12.70 dolar kepada 2.48 dolar, kerana bacaan cache hanya menelan kos satu persepuluh daripada kadar input. Penjimatan bergantung sepenuhnya pada kadar hit anda. Dengan cache lima minit, ia menampung kosnya sendiri selepas satu bacaan sahaja, memandangkan kos penulisan adalah 1.25 kali ganda daripada input dan kos bacaan adalah 0.1 kali ganda. Jika prompt anda berubah berhampiran permulaan pada setiap permintaan, anda tidak akan mendapat sebarang hit dan anda membayar premium penulisan tanpa sebarang hasil. Sahkan dengan cache_read_input_tokens sebelum anda menganggap ia berfungsi.

Patutkah saya menggunakan Haiku untuk segala-galanya?

Tidak. Haiku 4.5 berharga 1 dolar bagi setiap juta token input berbanding 5 untuk Opus 5, jadi penjimatan adalah nyata bagi kerja volum tinggi yang mudah seperti klasifikasi dan penghalaan. Jawapan yang salah bagi kerja yang sukar menelan kos lebih tinggi daripada penjimatan model tersebut, kerana anda perlu membayar untuk percubaan semula dan masa anda sendiri. Corak yang berkesan adalah campuran: model kecil untuk tugasan mekanikal, model frontier untuk tugasan yang memerlukan pertimbangan.

Adakah API lebih murah daripada langganan Claude?

Ia bergantung pada sejauh mana penggunaan anda stabil. Langganan adalah harga bulanan tetap dengan had penggunaan yang disertakan. API adalah bayaran mengikut token tanpa had siling, yang lebih murah apabila penggunaan anda ringan atau berlaku secara berkala, dan lebih mahal apabila anda menggunakannya dengan kerap setiap hari bekerja. Ambil purata token anda sehari daripada blok penggunaan, nilaikan mengikut kadar model anda, kemudian bandingkan angka tersebut dengan harga pelan, yang bagi peringkat permulaan dinyatakan dalam kos Claude Pro dan had penggunaannya. Jika jumlahnya lebih memihak kepada API, membatalkan pelan atau menurunkan peringkat tidak akan membazirkan bulan yang telah anda bayar, kerana akses anda kekal sehingga tamat tempoh pengebilan semasa.