Berapakah Kos 1 Juta Token dalam Claude?
Ketahui kos 1 juta token Claude: kadar input dan output berbeza, malah output lima kali ganda input. Gunakan pengiraan ini untuk menganggarkan bil API bulanan.
Berapakah kos 1M token dalam Claude?
1M token bermaksud satu juta token, dan ini ialah unit yang digunakan untuk menyatakan harga setiap Claude API (antara muka pengaturcaraan aplikasi). Tiada satu harga tetap untuknya kerana token input dan output dikenakan kadar yang berbeza, manakala setiap model mempunyai pasangan kadar tersendiri. Setakat August 2026, satu juta token input berharga $1 pada Claude Haiku 4.5, $2 pada Claude Sonnet 5 dan $5 pada Claude Opus 5.
Output ialah bahagian yang lebih mahal. Pada setiap model semasa, kadar output ialah lima kali ganda kadar input. Oleh itu, pecahan antara kedua-duanya lebih menentukan bil anda berbanding angka utama. Aplikasi yang menghantar dokumen panjang dan mengembalikan jawapan ringkas mempunyai corak kos yang sangat berbeza daripada aplikasi yang menulis jawapan panjang berdasarkan prompt yang pendek.
Halaman ini menerangkan ekonomi unit: kos setiap token dan cara menganggarkan bil sebelum anda membina aplikasi. Untuk mengetahui ke mana token sebenarnya digunakan semasa anda bekerja, baca ke mana token digunakan dalam sesi Claude Code.
Rupa 1M token
Token ialah sebahagian teks yang dibaca atau ditulis oleh model. Panduan kasar Anthropic ialah 1 token bagi setiap 4 aksara, atau kira-kira 0.75 perkataan dalam bahasa Inggeris. Oleh itu, 1 juta token bersamaan kira-kira 750,000 perkataan, atau lebih kurang 4 MB teks biasa.
Anggaran yang diterbitkan untuk input biasa memberikan gambaran skala yang lebih jelas.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]Pada kadar tersebut, 1M token bersamaan kira-kira 400 halaman web biasa yang dibaca sekali, atau 8 kertas penyelidikan dengan saiz sedemikian. Jumlah itu bersamaan satu laluan pemprosesan terhadap codebase bersaiz sederhana, atau sebulan penggunaan chat ringan bagi seorang pengguna.
Anggap semua angka itu sebagai anggaran. Code, JSON dan teks dalam bahasa selain bahasa Inggeris memuatkan lebih sedikit perkataan bagi setiap token. Oleh itu, nisbah 0.75 ialah anggaran yang optimistik. Ada satu lagi faktor yang mengubah kiraan: Claude Opus 4.7 dan versi selepasnya, termasuk Opus 5 dan Sonnet 5, menggunakan tokenizer baharu yang menghasilkan kira-kira 30 peratus lebih banyak token untuk teks yang sama berbanding Sonnet 4.6 dan versi terdahulu. Claude Haiku 4.5 menggunakan tokenizer lama. Oleh itu, kiraan yang diukur pada Haiku 4.5 merendahkan kiraan pada Sonnet 5 bagi input yang sama. Ini bermakna perbandingan terus harga bagi setiap juta token merentas sempadan tersebut tidak adil. Kira prompt yang sama menggunakan kedua-dua model sebelum membuat keputusan.
Kos Claude bagi setiap juta token
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5 menggunakan harga pengenalan sebanyak $2 bagi input dan $10 bagi output sehingga 31 August 2026. Mulai 1 September 2026, kadar standard akan digunakan: $3 bagi input dan $15 bagi output. Claude Opus 5 berharga $5 bagi input dan $25 bagi output. Satu model berada sepenuhnya di atas julat harga itu: Claude Fable 5 menetapkan harga $10 bagi input dan $50 bagi output. Oleh itu, sama ada kadar tersebut berbaloi dibayar bergantung pada tugasan yang anda berikan kepadanya.
Kadar boleh berubah. Anggap setiap angka pada halaman ini sebagai contoh pengiraan bertarikh August 2026, dan sahkan angka semasa pada halaman harga rasmi sebelum memuktamadkan belanjawan.
Kadar ini menunjukkan kos Claude, tetapi tidak menunjukkan sama ada Claude ialah pilihan yang lebih murah untuk beban kerja anda. Tiga tugasan yang dikira kosnya pada Claude dan ChatGPT menunjukkan API yang memberikan kos lebih rendah bagi setiap tugasan.
Panjang konteks tidak mengubah kadar ini. Pada Claude 4.6 dan versi yang lebih baharu, tetingkap konteks penuh 1M token dibilkan pada harga standard. Oleh itu, permintaan 900,000 token mempunyai kos setiap token yang sama seperti permintaan 9,000 token. Prompt yang panjang berharga lebih tinggi kerana mengandungi lebih banyak token. Tiada kadar konteks panjang yang berasingan.
Aritmetik yang kekal tepat selepas perubahan harga
Setiap bil terdiri daripada dua pendaraban dan satu penambahan.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateDitulis sebagai kod yang boleh anda jalankan:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")Kod itu mencetak 0.0126. Permintaan yang menghantar 4,300 token input dan menerima 400 token output berharga kira-kira 1.3 sen pada Sonnet 5. Simpan kedua-dua kadar di satu tempat dalam kod anda. Apabila harga berubah, anda hanya perlu mengedit dua baris, dan semua anggaran dalam sistem anda akan dikemas kini.
Anggaran berdasarkan aplikasi sebenar
Ambil contoh pembantu sokongan. Gesaan sistem dan dokumentasi produk berjumlah 4,000 token, dan kedua-duanya dihantar pada setiap permintaan kerana Messages API tidak menyimpan keadaan dan model tidak mengingati apa-apa antara panggilan. Soalan pengguna menambah kira-kira 300 token. Jawapan pula kira-kira 400 token. Oleh itu, setiap permintaan menggunakan 4,300 token input dan 400 token output.
Satu juta token input menghasilkan kira-kira 232 permintaan dengan bentuk penggunaan sedemikian. Pada 1,000 permintaan sehari, aplikasi menggunakan 4.3 juta token input setiap hari. Jadi, "1M tokens" hanya meliputi kurang daripada enam jam trafik.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]Pada Claude Opus 5, trafik itu berharga $31.50 bagi setiap 1,000 permintaan. Pada Sonnet 5, kosnya ialah $12.60. Jika menggunakan Claude Haiku 4.5, kos turun kepada $6.30, manakala cache gesaan yang kekal tersedia pada Sonnet 5 mengurangkan kos lagi kepada $5.40.
Darabkan jumlah itu dengan 30 untuk mendapatkan kos sebulan bagi trafik tersebut. Sonnet 5 pada kadar senarai berharga kira-kira $378 sebulan. Aplikasi yang sama dengan cache yang kekal tersedia berharga kira-kira $162. Pemilihan model dan keputusan caching anda masing-masing lebih memberi kesan berbanding sebarang kadar yang dapat anda runding pada jumlah penggunaan ini. Model yang patut digunakan ialah persoalan berasingan. Pilih model paling murah yang lulus penilaian anda: memilih antara Opus, Sonnet dan Haiku menerangkan cara mengujinya dengan betul.
Prompt caching mengurangkan bahagian yang berulang
Awalan 4,000 token itu sama dalam setiap permintaan, dan anda membayar harga input penuh untuknya setiap kali. Prompt caching menyimpan awalan yang telah diproses dan mengenakan kadar yang lebih rendah apabila awalan itu digunakan semula.
Bacaan cache berharga 0.1 kali kadar input asas. Penulisan cache berharga 1.25 kali kadar asas untuk tempoh hayat 5 minit, atau 2 kali kadar asas untuk tempoh hayat 1 jam. Oleh itu, cache 5 minit mula menjimatkan kos selepas satu bacaan, kerana penulisan cache berharga tambahan 0.25 manakala setiap bacaan menjimatkan 0.9. Cache 1 jam memerlukan dua bacaan untuk mencapai titik pulang modal.
Cara paling mudah untuk mengaktifkannya ialah dengan satu medan peringkat teratas:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'Kemudian baca blok usage yang dikembalikan:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}Ketiga-tiga pembilang input itu dicaj pada kadar yang berbeza dan jumlahnya ialah volum input sebenar anda: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Anggaran kos yang hanya membaca input_tokens akan tersasar jauh apabila caching diaktifkan.
Dua perkara menghalang cache daripada menjimatkan kos, dan kedua-duanya gagal secara senyap.
Awalan mesti sepadan pada peringkat bait. Carian cache sepadan dengan awalan. Oleh itu, cap masa atau nama pengguna pada bahagian atas system prompt akan mengubahnya dalam setiap permintaan. Anda kemudian membayar 1.25 kali input asas setiap kali dan tidak pernah membuat satu pun bacaan cache. Petandanya ialah cache_creation_input_tokens kekal tinggi manakala cache_read_input_tokens kekal 0. Letakkan cache_control pada blok terakhir yang kandungannya sama antara permintaan, kemudian letakkan semua kandungan yang berubah selepasnya. Perubahan pada takrif tools anda akan membatalkan keseluruhan cache di bawahnya, kerana pembatalan berlaku mengikut susunan tools, kemudian system, kemudian messages.
Awalan mesti cukup panjang. Panjang minimum yang boleh dicache ialah 512 token pada Opus 5, 1,024 pada Sonnet 5 dan 4,096 pada Haiku 4.5. Prompt yang lebih pendek tidak dicache dan tiada ralat dikembalikan. Awalan 4,000 token dalam contoh di atas dicache pada Sonnet 5 tetapi tidak dicache pada Haiku 4.5, kerana 4,000 berada di bawah had minimum model itu. Apabila kedua-dua pembilang menunjukkan 0, tiada kandungan yang dicache.
Pemprosesan kelompok mengurangkan kadar sebanyak separuh
Batch API memproses permintaan secara tak segerak dengan kadar 50 peratus lebih rendah bagi input dan output. Dalam contoh di atas, kos $12.60 bagi setiap 1,000 permintaan menjadi $6.30. Diskaun ini boleh digabungkan dengan caching prompt, jadi kerja kelompok yang menggunakan cache ialah cara paling murah untuk menjalankan kerja secara pukal.
Kekurangannya ialah kependaman. Oleh itu, pemprosesan kelompok tidak sesuai untuk tugas yang memerlukan seseorang menunggu hasilnya. Ia sesuai untuk pengelasan semalaman dan pengisian semula dokumen.
Kos sembang meningkat dalam satu perbualan
Oleh sebab API tidak menyimpan keadaan, klien anda menghantar semula seluruh perbualan pada setiap giliran. Oleh itu, penggunaan token dalam satu sembang meningkat mengikut kuasa dua panjangnya, bukan secara linear.
Anggap setiap giliran mempunyai purata 500 token. Giliran 1 menghantar 500 token input. Giliran 2 menghantar 1,000. Giliran 20 menghantar 10,000. Jumlahkan nilai ini menggunakan n(n+1)/2, dan perbualan 20 giliran telah menghantar kira-kira 105,000 token input, sedangkan transkrip itu sendiri hanya sepanjang 10,000 token.
Sebab itu ciri sembang menelan kos yang lebih tinggi daripada yang ditunjukkan oleh transkripnya, dan sebab itu caching awalan yang stabil atau meringkaskan giliran lama berbaloi untuk perbualan yang panjang. Ejen yang mengulangi panggilan alat mempunyai corak yang sama, malah lebih teruk: setiap hasil alat kekal dalam sejarah dan dihantar semula pada setiap giliran berikutnya. Menetapkan had perbelanjaan yang ketat untuk ejen yang anda jalankan sendiri paling penting dalam keadaan ini kerana pertumbuhan itu berlaku secara automatik dan tiada sesiapa yang memantaunya.
Bilang token sebelum membuat anggaran
Jangan lagi menganggarkan bilangan token berdasarkan bilangan perkataan. API mengiranya untuk anda tanpa caj, dengan had kadar yang berasingan daripada penciptaan mesej.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'Respons mengandungi satu medan:
{ "input_tokens": 14 }Berikan prompt sistem dan definisi alat sebenar anda, bersama-sama mesej pengguna yang mewakili penggunaan sebenar, kemudian masukkan nombor itu ke dalam fungsi kos di atas. Endpoint ini menerima isi permintaan yang sama seperti permintaan mesej, jadi imej dan PDF turut dikira dengan betul. Dua perkara perlu diberi perhatian. Kiraan ini ialah anggaran dan mungkin berbeza sedikit daripada angka yang dibilkan. Kiraan ini juga diukur menggunakan tokenizer model yang anda hantarkan, jadi hantarkan model yang sebenarnya akan anda jalankan.
Token output tidak boleh dikira lebih awal kerana token tersebut belum wujud. Hadkan token itu dengan max_tokens, kemudian ukur taburan sebenar daripada usage.output_tokens pada trafik langsung.
Perkara lain yang dikenakan caj
Token merangkumi sebahagian besar bil. Beberapa item lain bukan token dan sering mengejutkan pengguna.
- Takrif alat menjadi token input dalam setiap permintaan. System prompt penggunaan alat sahaja menambah 286 hingga 406 token pada Opus 5, sebelum skema anda sendiri ditambah. Sepuluh perihalan alat yang panjang boleh menggandakan prompt yang kecil.
- Carian web dikenakan caj $10 bagi setiap 1,000 carian, selain token yang digunakan oleh hasil carian apabila hasil tersebut dimasukkan ke dalam konteks.
- Web fetch tidak mengenakan caj tambahan, tetapi halaman yang diambil menjadi token input. Halaman dokumentasi bersaiz 100 kB mengandungi kira-kira 25,000 token.
- Permintaan inferens khusus AS dengan
inference_geopada Claude 4.6 dan versi selepasnya mengenakan pengganda 1.1 pada setiap kategori token, termasuk bacaan dan penulisan cache.
Sama ada API merupakan pilihan yang sesuai untuk dibeli bergantung pada jumlah penggunaan anda. Had penggunaan pada sesuatu pelan biasanya mencetuskan persoalan ini, dan laluan selepas had merangkumi tindakan menunggu sehingga tempoh tersebut berakhir atau memindahkan tugas itu kepada panggilan API bermeter. Di bawah tahap penggunaan tertentu, pelan bulanan tetap lebih berbaloi, dan perbandingan API dengan langganan Claude mengira perbezaan itu menggunakan angka sebenar.
FAQ
Berapakah kos 1M token dalam Claude?
Kosnya bergantung pada model dan sama ada token tersebut ialah input atau output. Setakat Ogos 2026, satu juta token input berharga $1 pada Claude Haiku 4.5, $2 pada Claude Sonnet 5 di bawah harga pengenalan, dan $5 pada Claude Opus 5. Kos output ialah lima kali ganda kadar input bagi setiap model tersebut. Harga Sonnet 5 berubah kepada $3 untuk input dan $15 untuk output pada 1 September 2026. Kadar boleh berubah, jadi sahkan kadar tersebut pada halaman harga rasmi sebelum anda memasukkan angka ke dalam belanjawan.
Adakah 1M token sama dengan 1M perkataan?
Tidak. Satu token mengandungi kira-kira 4 aksara bahasa Inggeris, atau sekitar 0.75 perkataan. Oleh itu, satu juta token bersamaan kira-kira 750,000 perkataan. Nisbah ini hanya anggaran. Kod, JSON dan bahasa selain bahasa Inggeris menggunakan lebih banyak token bagi setiap perkataan. Claude Opus 4.7 dan versi lebih baharu juga menggunakan tokenizer yang lebih baharu. Tokenizer ini menghasilkan kira-kira 30 peratus lebih banyak token untuk teks yang sama berbanding Claude Sonnet 4.6 dan versi terdahulu. Oleh itu, jumlah token tidak boleh dibandingkan secara langsung antara generasi model. Buat pengukuran menggunakan endpoint percuma /v1/messages/count_tokens dengan menghantar model yang anda rancang untuk jalankan.
Adakah caching prompt sentiasa menjimatkan kos?
Tidak. Penulisan cache selama 5 minit berharga 1.25 kali kadar input asas. Oleh itu, awalan yang ditulis tetapi tidak pernah dibaca berharga 25 peratus lebih tinggi berbanding penghantaran biasa. Kosnya mula berbaloi apabila dibaca kali pertama. Ciri ini boleh gagal dalam dua keadaan, dan kedua-duanya berlaku tanpa mesej ralat. Jika awalan cache berubah antara permintaan, carian tidak akan sepadan kerana padanan awalan mesti tepat. Jika awalan lebih pendek daripada panjang minimum yang boleh dicache oleh model, tiada apa-apa yang dicache dan tiada ralat dipulangkan. Panjang minimum tersebut ialah 1,024 token pada Sonnet 5 dan 4,096 pada Haiku 4.5. Apabila cache_creation_input_tokens dan cache_read_input_tokens kedua-duanya menunjukkan 0, cache tidak melakukan apa-apa.
Mengapakah bil saya meningkat lebih cepat daripada jumlah mesej?
Kerana keseluruhan perbualan dihantar semula pada setiap giliran. Messages API tidak menyimpan keadaan, jadi giliran ke-20 dalam sesuatu perbualan menghantar kesemua 19 giliran terdahulu sekali lagi sebagai input. Jika setiap giliran mengandungi purata 500 token, perbualan 20 giliran menghantar kira-kira 105,000 token input, walaupun transkripnya hanya sepanjang 10,000 token. Gelung ejen berfungsi dengan cara yang sama kerana setiap hasil alat kekal dalam sejarah perbualan. Cache awalan yang stabil, atau ringkaskan giliran lama dan keluarkannya daripada permintaan.