SSD Nodes Learn 🎉 VPS dari $5.50/bln
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-13

Harga 1 Juta Token Claude: Kira Kos API Anda

Ketahui cara mengira kos 1 juta token untuk model Claude Haiku, Sonnet dan Opus. Kami jelaskan perbezaan harga input dan output agar anda boleh menganggarkan bil bulanan.

Berapakah harga 1 juta token dalam Claude?

1M token bermaksud satu juta token, dan ia merupakan unit yang digunakan bagi setiap harga API (application programming interface) Claude. Tiada harga tunggal untuknya, kerana input dan output dibilkan pada kadar yang berbeza dan setiap model mempunyai pasangan kadarnya sendiri. Setakat Ogos 2026, satu juta token input berharga $1 pada Claude Haiku 4.5, $2 pada Claude Sonnet 5 dan $5 pada Claude Opus 5.

Output merupakan bahagian yang lebih mahal. Pada setiap model semasa, kadar output adalah lima kali ganda kadar input, jadi pembahagian antara kedua-duanya lebih menentukan bil anda berbanding angka utama. Aplikasi yang menghantar dokumen panjang dan menerima jawapan pendek berkelakuan sangat berbeza daripada aplikasi yang menulis jawapan panjang daripada prompt yang pendek.

Halaman ini adalah mengenai ekonomi unit: kos satu token, dan cara menganggarkan bil sebelum anda membina sesuatu. Untuk mengetahui ke mana token pergi semasa anda bekerja, baca ke mana token pergi di dalam sesi Claude Code.

Apakah rupa 1 juta token

Token ialah cebisan teks yang dibaca atau ditulis oleh model. Panduan kasar Anthropic ialah satu token bagi setiap 4 aksara, atau kira-kira 0.75 perkataan bahasa Inggeris. Oleh itu, satu juta token adalah sekitar 750,000 perkataan, atau lebih kurang 4 MB teks biasa.

Anggaran yang diterbitkan untuk input biasa memberikan gambaran yang lebih baik tentang skala tersebut.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Pada kadar tersebut, 1 juta token adalah kira-kira 400 halaman web purata yang dibaca sekali, atau lapan kertas penyelidikan dengan saiz yang sama. Ia adalah satu imbasan ke atas pangkalan kod bersaiz sederhana, atau penggunaan sembang ringan selama sebulan untuk seorang individu.

Anggap semua itu sebagai anggaran. Kod, JSON dan teks dalam bahasa selain bahasa Inggeris memuatkan lebih sedikit perkataan ke dalam satu token, jadi nisbah 0.75 adalah tahap yang optimistik. Satu lagi perkara yang mengubah kiraan: Claude Opus 4.7 dan versi terkemudian, yang merangkumi Opus 5 dan Sonnet 5, menggunakan tokenizer baharu yang menghasilkan kira-kira 30 peratus lebih banyak token untuk teks yang sama berbanding Sonnet 4.6 dan versi sebelumnya. Claude Haiku 4.5 menggunakan tokenizer yang lebih lama. Jadi, kiraan yang anda ukur pada Haiku 4.5 akan merendahkan kiraan pada Sonnet 5 untuk input yang sama, yang bermaksud perbandingan harga-per-juta secara terus merentasi sempadan tersebut adalah tidak adil. Kira prompt yang sama pada kedua-dua model sebelum anda membuat keputusan.

Caj Claude bagi setiap juta token

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

Claude Sonnet 5 ditawarkan pada harga pengenalan $2 untuk input dan $10 untuk output sehingga 31 Ogos 2026. Bermula 1 September 2026, kadar standard akan diguna pakai: $3 untuk input dan $15 untuk output. Claude Opus 5 pula ditetapkan pada harga $5 dan $25. Terdapat satu model yang berada di luar carta tersebut sepenuhnya: Claude Fable 5 disenaraikan pada harga $10 untuk input dan $50 untuk output, jadi sama ada kadar tersebut berbaloi untuk dibayar bergantung pada tugasan yang anda berikan kepadanya.

Kadar harga sentiasa berubah. Anggap setiap angka pada halaman ini sebagai contoh pengiraan bertarikh Ogos 2026, dan sahkan nombor semasa pada halaman harga rasmi sebelum anda meluluskan bajet.

Satu perkara yang tidak mengubah kadar harga ialah panjang konteks. Pada Claude 4.6 dan versi seterusnya, tetingkap konteks 1M token penuh dibilkan mengikut harga standard, jadi permintaan 900,000 token mempunyai kos yang sama bagi setiap token seperti permintaan 9,000 token. Prompt yang panjang menelan kos lebih tinggi kerana ia melibatkan lebih banyak token, dan tiada kadar berasingan untuk konteks panjang yang dikenakan.

Pengiraan yang kekal selepas perubahan harga

Setiap bil terdiri daripada dua pendaraban dan satu penambahan.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Ditulis sebagai kod yang boleh anda jalankan:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Kod tersebut mencetak 0.0126. Permintaan yang menghantar 4,300 token input dan menerima 400 token output berharga kira-kira 1.3 sen pada Sonnet 5. Simpan kedua-dua kadar tersebut di satu tempat dalam kod anda. Apabila harga berubah, anda hanya perlu menyunting dua baris, dan setiap anggaran dalam sistem anda akan berubah mengikutnya.

Anggaran kerja untuk aplikasi sebenar

Bayangkan seorang pembantu sokongan. Prompt sistem dan dokumentasi produknya berjumlah 4,000 token, dan ia dihantar dalam setiap permintaan kerana Messages API adalah tanpa status (stateless) dan model tidak mengingati apa-apa antara panggilan. Soalan pengguna menambah kira-kira 300 token. Jawapan pula sekitar 400 token. Ini bermakna 4,300 input dan 400 output bagi setiap permintaan.

Satu juta token input boleh menampung kira-kira 232 permintaan dengan bentuk tersebut. Pada kadar 1,000 permintaan sehari, aplikasi menggunakan 4.3 juta token input setiap hari, jadi "1M token" hanya bertahan kurang daripada enam jam trafik.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

Pada Claude Opus 5, trafik tersebut menelan kos $31.50 bagi setiap 1,000 permintaan. Pada Sonnet 5, kosnya ialah $12.60. Beralih kepada Claude Haiku 4.5 mengurangkan kos kepada $6.30, dan penggunaan prompt cache yang aktif pada Sonnet 5 menjadikan kos lebih rendah iaitu $5.40.

Darabkan dengan 30 untuk mendapatkan kos trafik sebulan. Sonnet 5 pada kadar senarai adalah kira-kira $378 sebulan. Aplikasi yang sama dengan cache aktif adalah sekitar $162. Pilihan model dan keputusan caching anda masing-masing mempunyai nilai yang lebih besar daripada sebarang kadar yang akan anda rundingkan pada volum ini. Model mana yang patut digunakan adalah persoalan tersendiri, dan model paling murah yang melepasi penilaian anda adalah pemenangnya: memilih antara Opus, Sonnet dan Haiku merangkumi cara untuk mengujinya dengan betul.

Caching prompt mengurangkan bahagian yang berulang

Awalan 4,000 token itu adalah sama bagi setiap permintaan, dan anda membayar harga input penuh untuknya setiap kali. Caching prompt menyimpan awalan yang telah diproses dan mengenakan kadar yang lebih rendah untuk menggunakannya semula.

Bacaan cache berharga 0.1 kali ganda kadar input asas. Penulisan cache berharga 1.25 kali ganda kadar asas untuk jangka hayat 5 minit, atau 2 kali ganda kadar asas untuk jangka hayat 1 jam. Oleh itu, cache 5 minit akan mencapai titik pulang modal selepas satu bacaan, kerana kos penulisan adalah 0.25 tambahan manakala setiap bacaan menjimatkan 0.9. Cache 1 jam memerlukan dua bacaan untuk mencapai titik pulang modal.

Cara paling mudah untuk mengaktifkannya adalah dengan satu medan peringkat atas:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Kemudian baca blok usage yang dikembalikan:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Tiga pembilang input tersebut dibilkan pada tiga kadar berbeza dan jumlahnya adalah volum input sebenar anda: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Anggaran kos yang hanya membaca input_tokens akan menjadi sangat tidak tepat apabila caching diaktifkan.

Dua perkara menghalang cache daripada memberikan pulangan, dan kedua-duanya gagal secara senyap.

Awalan mestilah sama dari segi bait. Carian cache adalah padanan awalan, jadi cap masa atau nama pengguna di bahagian atas prompt sistem anda akan mengubahnya pada setiap permintaan. Anda kemudian membayar 1.25 kali ganda input asas setiap kali dan tidak pernah membaca cache sekali pun. Simptomnya ialah cache_creation_input_tokens kekal tinggi manakala cache_read_input_tokens kekal 0. Letakkan cache_control pada blok terakhir yang kandungannya sama merentas permintaan, dan letakkan semua perkara yang berubah selepasnya. Menukar definisi tools anda akan membatalkan keseluruhan cache di bawahnya, kerana pembatalan dijalankan mengikut urutan alatan, kemudian sistem, kemudian mesej.

Awalan mestilah cukup panjang. Panjang minimum yang boleh dicache ialah 512 token pada Opus 5, 1,024 pada Sonnet 5 dan 4,096 pada Haiku 4.5. Prompt yang lebih pendek tidak dicache dan tiada ralat dikembalikan. Awalan 4,000 token dalam contoh di atas dicache pada Sonnet 5 dan tidak dicache pada Haiku 4.5, kerana 4,000 adalah di bawah had minimum model tersebut. Apabila kedua-dua pembilang membaca 0, tiada apa-apa yang dicache.

Pemprosesan kelompok mengurangkan kadar sebanyak separuh

Batch API memproses permintaan secara tak segerak (asynchronous) pada harga 50 peratus lebih murah bagi input dan output. Dalam contoh di atas, ini menukarkan $12.60 bagi setiap 1,000 permintaan kepada $6.30. Diskaun ini boleh digabungkan dengan prompt caching, menjadikan kerja kelompok yang dicache sebagai cara paling murah untuk menjalankan tugasan pukal.

Perkara yang dikorbankan ialah kependaman (latency), yang menjadikan pemprosesan kelompok tidak sesuai untuk sebarang tugasan yang memerlukan respons segera daripada pengguna. Ia sesuai untuk klasifikasi semalaman dan pengisian semula dokumen (document backfills).

Mengapa kos sembang meningkat dalam satu perbualan

Oleh kerana API tidak menyimpan sebarang status, klien anda menghantar semula keseluruhan perbualan pada setiap giliran. Oleh itu, penggunaan token dalam satu sembang meningkat mengikut kuasa dua panjangnya, bukan secara linear.

Ambil giliran yang puratanya 500 token. Giliran 1 menghantar 500 token input. Giliran 2 menghantar 1,000. Giliran 20 menghantar 10,000. Jika dijumlahkan dengan n(n+1)/2, perbualan 20 giliran telah menghantar kira-kira 105,000 token input, sedangkan transkrip itu sendiri hanya sepanjang 10,000 token.

Itulah sebabnya ciri sembang menelan kos yang lebih tinggi daripada yang ditunjukkan oleh transkripnya, dan mengapa menyimpan cache awalan yang stabil atau meringkaskan giliran lama berbaloi untuk perbualan yang panjang. Ejen yang melakukan gelung ke atas panggilan alat (tool calls) mempunyai corak yang sama, malah lebih buruk: setiap hasil alat kekal dalam sejarah dan dihantar semula pada setiap giliran seterusnya. Menetapkan had perbelanjaan yang ketat pada ejen yang anda jalankan sendiri adalah sangat penting di sini, kerana peningkatan tersebut berlaku secara automatik dan tiada siapa yang memantaunya.

Kira token sebelum anda meneka

Berhenti menganggarkan kiraan token berdasarkan kiraan perkataan. API mengiranya untuk anda, tanpa caj, pada had kadar yang berasingan daripada penciptaan mesej.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

Respons tersebut mengandungi satu medan:

{ "input_tokens": 14 }

Masukkan prompt sistem dan definisi alat anda yang sebenar, bersama mesej pengguna yang mewakili, kemudian masukkan nombor tersebut ke dalam fungsi kos di atas. Endpoint tersebut menerima badan yang sama seperti permintaan mesej, jadi imej dan PDF juga dikira dengan tepat. Dua perkara perlu diberi perhatian. Kiraan ini adalah anggaran dan mungkin sedikit berbeza daripada angka yang dibilkan. Ia juga diukur dengan tokenizer model yang anda hantar, jadi hantarkan model yang akan anda jalankan sebenarnya.

Token output tidak boleh dikira lebih awal, kerana ia belum wujud lagi. Hadkan ia dengan max_tokens, kemudian ukur taburan sebenar daripada usage.output_tokens pada trafik langsung.

Perkara lain yang termasuk dalam bil

Token merangkumi sebahagian besar bil. Terdapat beberapa item yang bukan token dan ini sering mengejutkan pengguna.

  • Definisi alat menjadi token input pada setiap permintaan. Prompt sistem penggunaan alat sahaja menambah 286 hingga 406 token pada Opus 5, sebelum mengambil kira skema anda sendiri. Sepuluh deskripsi alat yang panjang boleh menggandakan saiz prompt yang kecil.
  • Carian web dikenakan bayaran sebanyak $10 bagi setiap 1,000 carian, sebagai tambahan kepada token yang digunakan oleh hasil carian apabila ia memasuki konteks.
  • Pengambilan web (web fetch) tidak mempunyai yuran tambahan, tetapi halaman yang diambil akan menjadi token input. Halaman dokumentasi bersaiz 100 kB adalah lebih kurang 25,000 token.
  • Meminta inferens khusus AS dengan inference_geo pada Claude 4.6 dan versi seterusnya akan mengenakan pengganda 1.1 kepada setiap kategori token, termasuk bacaan dan penulisan cache.

Sama ada API merupakan pilihan yang tepat untuk dibeli bergantung pada jumlah penggunaan anda. Mencapai had penggunaan pada pelan biasanya menjadi punca persoalan ini timbul, dan laluan keluar daripada had bermula daripada menunggu sehingga tempoh tamat atau memindahkan beban kerja tersebut kepada panggilan API bermeter. Di bawah tahap penggunaan tertentu, pelan bulanan tetap adalah lebih berbaloi, dan perbandingan API dengan langganan Claude menjalankan perbandingan tersebut dengan angka sebenar.

FAQ

Berapakah kos 1 juta token dalam Claude?

Ia bergantung pada model, dan sama ada token tersebut adalah input atau output. Setakat Ogos 2026, satu juta token input berharga $1 pada Claude Haiku 4.5, $2 pada Claude Sonnet 5 di bawah harga pengenalan, dan $5 pada Claude Opus 5. Kos output adalah lima kali ganda kadar input bagi setiap model tersebut. Sonnet 5 akan berubah kepada $3 untuk input dan $15 untuk output pada 1 September 2026. Kadar harga sentiasa berubah, jadi sahkan harga tersebut pada halaman harga rasmi sebelum anda menetapkan angka untuk bajet.

Adakah 1 juta token sama dengan 1 juta perkataan?

Tidak. Satu token adalah lebih kurang 4 aksara bahasa Inggeris, atau kira-kira 0.75 perkataan, jadi satu juta token adalah sekitar 750,000 perkataan. Nisbah itu hanyalah panduan. Kod, JSON dan bahasa selain bahasa Inggeris menggunakan lebih banyak token bagi setiap perkataan. Claude Opus 4.7 dan versi terkemudian juga menggunakan tokenizer baharu yang menghasilkan kira-kira 30 peratus lebih banyak token untuk teks yang sama berbanding Claude Sonnet 4.6 dan versi sebelumnya, jadi kiraan tidak boleh dipindahkan antara generasi model. Ukur menggunakan endpoint /v1/messages/count_tokens percuma dengan menghantar model yang anda rancang untuk jalankan.

Adakah caching prompt sentiasa menjimatkan wang?

Tidak. Penulisan cache selama 5 minit menelan kos 1.25 kali ganda kadar input asas, jadi awalan (prefix) yang ditulis tetapi tidak pernah dibaca menelan kos 25 peratus lebih tinggi daripada menghantarnya secara biasa. Ia akan memberikan pulangan nilai bermula daripada bacaan pertama. Ia gagal dalam dua cara, kedua-duanya tanpa ralat (silent). Jika awalan yang dicache berubah antara permintaan, carian tidak akan sepadan kerana ia adalah padanan awalan yang tepat. Jika awalan lebih pendek daripada panjang minimum yang boleh dicache oleh model, iaitu 1,024 token pada Sonnet 5 dan 4,096 pada Haiku 4.5, tiada apa-apa yang dicache dan tiada ralat dikembalikan. Apabila cache_creation_input_tokens dan cache_read_input_tokens kedua-duanya membaca 0, cache tidak berfungsi.

Mengapa bil saya meningkat lebih cepat daripada jumlah mesej saya?

Kerana keseluruhan perbualan dihantar semula pada setiap giliran. Messages API tidak menyimpan sebarang status, jadi giliran ke-20 dalam satu sembang membawa kesemua 19 giliran sebelumnya sebagai input sekali lagi. Dengan purata 500 token bagi setiap giliran, perbualan 20 giliran menghantar kira-kira 105,000 token input walaupun transkrip hanya sepanjang 10,000 token. Gelung ejen (agent loops) berkelakuan sama kerana setiap hasil alat (tool result) kekal dalam sejarah. Cache awalan yang stabil, atau ringkaskan giliran yang lebih lama dan gugurkannya daripada permintaan.