SSD Nodes Learn RAM 8GB — $66/tahun
Panduan Matt ConnorOleh Matt Connor

Berapakah Kos 1M Token dalam Claude?

Claude mengira token input dan output secara berasingan, dengan output lima kali ganda lebih mahal. Ketahui cara menukar jumlah token kepada anggaran bil bulanan.

Berapakah kos 1M token dalam Claude?

1M token bermaksud satu juta token. Unit ini digunakan untuk menyatakan harga setiap API Claude (antara muka pengaturcaraan aplikasi). Tiada satu harga tetap untuknya kerana token input dan output dibilkan pada kadar yang berbeza, dan setiap model mempunyai pasangan kadar tersendiri. Setakat Ogos 2026, satu juta token input berharga $1 pada Claude Haiku 4.5, $2 pada Claude Sonnet 5 dan $5 pada Claude Opus 5.

Output ialah bahagian yang lebih mahal. Pada setiap model semasa, kadar output adalah lima kali ganda kadar input. Oleh itu, pembahagian antara kedua-duanya lebih menentukan bil anda berbanding angka utama. Aplikasi yang menghantar dokumen panjang dan mengembalikan jawapan pendek berfungsi dengan cara yang sangat berbeza daripada aplikasi yang menulis jawapan panjang berdasarkan prompt yang pendek.

Halaman ini membincangkan ekonomi unit: kos token dan cara menganggarkan bil sebelum anda membina aplikasi. Untuk mengetahui ke mana token sebenarnya digunakan semasa anda bekerja, baca ke mana token digunakan dalam sesi Claude Code.

Gambaran 1M token

Token ialah sebahagian teks yang dibaca atau ditulis oleh model. Panduan anggaran Anthropic ialah 1 token bagi setiap 4 aksara, atau kira-kira 0.75 perkataan dalam bahasa Inggeris. Oleh itu, 1 juta token bersamaan kira-kira 750,000 perkataan, atau lebih kurang 4 MB teks biasa.

Anggaran yang diterbitkan untuk input biasa memberikan gambaran yang lebih jelas tentang skalanya.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Pada kadar tersebut, 1M token bersamaan kira-kira 400 halaman web biasa yang dibaca sekali, atau 8 kertas penyelidikan dengan saiz sedemikian. Jumlah itu bersamaan satu laluan pemprosesan pada pangkalan kod bersaiz sederhana, atau penggunaan sembang ringan selama sebulan bagi seorang pengguna.

Anggap semua angka itu sebagai anggaran. Kod, JSON dan teks dalam bahasa selain bahasa Inggeris memuatkan lebih sedikit perkataan dalam satu token, jadi nisbah 0.75 itu berada pada hujung yang optimistik. Satu lagi faktor turut mengubah kiraan: Claude Opus 4.7 dan versi kemudian, termasuk Opus 5 dan Sonnet 5, menggunakan tokenizer yang lebih baharu dan menghasilkan kira-kira 30 peratus lebih banyak token untuk teks yang sama berbanding Sonnet 4.6 dan versi terdahulu. Claude Haiku 4.5 menggunakan tokenizer yang lebih lama. Oleh itu, kiraan yang diukur pada Haiku 4.5 akan merendahkan kiraan pada Sonnet 5 untuk input yang sama. Ini bermakna perbandingan terus harga bagi setiap juta token merentasi sempadan tersebut tidak adil. Kira prompt yang sama menggunakan kedua-dua model sebelum membuat keputusan.

Caj yang dikenakan oleh Claude bagi setiap juta token

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

Claude Sonnet 5 menggunakan harga pengenalan sebanyak $2 untuk input dan $10 untuk output sehingga 31 August 2026. Mulai 1 September 2026, kadar standard akan digunakan: $3 untuk input dan $15 untuk output. Claude Opus 5 berharga $5 untuk input dan $25 untuk output.

Kadar boleh berubah. Anggap setiap angka pada halaman ini sebagai contoh pengiraan bertarikh August 2026, dan sahkan angka semasa pada halaman harga rasmi sebelum memuktamadkan belanjawan.

Panjang konteks tidak mengubah kadar. Pada Claude 4.6 dan versi yang lebih baharu, keseluruhan tetingkap konteks 1M token dibilkan mengikut harga standard. Oleh itu, permintaan sebanyak 900,000 token mempunyai kos setiap token yang sama seperti permintaan sebanyak 9,000 token. Gesaan yang panjang berharga lebih tinggi kerana mengandungi lebih banyak token, dan tiada kadar konteks panjang yang berasingan.

Pengiraan yang kekal tepat selepas perubahan harga

Setiap bil melibatkan dua pendaraban dan satu penambahan.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Ditulis sebagai kod yang boleh anda jalankan:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Kod itu mencetak 0.0126. Permintaan yang menghantar 4,300 token input dan menerima 400 token output berharga kira-kira 1.3 sen pada Sonnet 5. Simpan kedua-dua kadar di satu tempat dalam kod anda. Apabila harga berubah, anda hanya perlu mengedit dua baris, dan semua anggaran dalam sistem anda akan berubah mengikutnya.

Anggaran terperinci untuk aplikasi sebenar

Ambil contoh pembantu sokongan. Gesaan sistem dan dokumentasi produk menggunakan 4,000 token, dan dihantar dalam setiap permintaan kerana Messages API tidak mengekalkan keadaan serta model tidak mengingati apa-apa antara panggilan. Soalan pengguna menambah kira-kira 300 token. Jawapan menggunakan kira-kira 400 token. Maka, setiap permintaan menggunakan 4,300 token input dan 400 token output.

Satu juta token input membolehkan kira-kira 232 permintaan dengan bentuk tersebut. Dengan 1,000 permintaan sehari, aplikasi menggunakan 4.3 juta token input setiap hari. Oleh itu, "1M tokens" mewakili kurang daripada enam jam trafik.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

Pada Claude Opus 5, trafik tersebut berharga $31.50 bagi setiap 1,000 permintaan. Pada Sonnet 5, kosnya ialah $12.60. Beralih kepada Claude Haiku 4.5 mengurangkan kos kepada $6.30, manakala cache gesaan yang masih aktif pada Sonnet 5 mengurangkan kos dengan lebih lanjut kepada $5.40.

Darabkan dengan 30 untuk mendapatkan kos trafik selama sebulan. Sonnet 5 pada kadar senarai berharga kira-kira $378 sebulan. Aplikasi yang sama dengan cache yang masih aktif berharga kira-kira $162. Pemilihan model dan keputusan caching anda masing-masing lebih bernilai daripada sebarang kadar yang boleh dirundingkan pada jumlah penggunaan ini. Model yang hendak digunakan ialah persoalan berasingan. Pilih model termurah yang lulus penilaian anda: memilih antara Opus, Sonnet dan Haiku menerangkan cara mengujinya dengan betul.

Prompt caching mengurangkan bahagian yang berulang

Awalan 4,000 token itu sama pada setiap permintaan, dan anda membayar harga input penuh untuknya setiap kali. Prompt caching menyimpan awalan yang telah diproses dan mengenakan kadar yang lebih rendah apabila awalan itu digunakan semula.

Bacaan cache berharga 0.1 kali kadar input asas. Penulisan cache berharga 1.25 kali kadar asas untuk jangka hayat 5 minute, atau 2 kali kadar asas untuk jangka hayat 1 hour. Oleh itu, cache 5 minute balik modal selepas satu bacaan, kerana kos penulisan adalah 0.25 lebih tinggi manakala setiap bacaan menjimatkan 0.9. Cache 1 hour memerlukan dua bacaan untuk balik modal.

Cara paling mudah untuk mengaktifkannya ialah dengan satu medan peringkat atas:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Kemudian baca blok usage yang dikembalikan:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Ketiga-tiga pembilang input itu dicaj pada tiga kadar yang berbeza dan jumlahnya ialah jumlah input sebenar anda: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Anggaran kos yang hanya membaca input_tokens akan tersasar jauh selepas caching diaktifkan.

Dua perkara menghalang cache daripada berbaloi, dan kedua-duanya gagal secara senyap.

Awalan mesti sama pada peringkat bait. Carian cache ialah padanan awalan, jadi cap masa atau nama pengguna pada bahagian atas system prompt anda mengubahnya pada setiap permintaan. Anda kemudian membayar 1.25 kali input asas setiap kali dan tidak pernah mendapat bacaan. Tanda-tandanya ialah cache_creation_input_tokens kekal tinggi manakala cache_read_input_tokens kekal 0. Letakkan cache_control pada blok terakhir yang kandungannya sama merentas permintaan, dan letakkan semua kandungan yang berubah selepasnya. Perubahan pada definisi tools anda membatalkan keseluruhan cache di bawahnya, kerana pembatalan berjalan mengikut susunan tools, kemudian system, kemudian messages.

Awalan mesti cukup panjang. Panjang minimum yang boleh dicache ialah 512 token pada Opus 5, 1,024 pada Sonnet 5 dan 4,096 pada Haiku 4.5. Prompt yang lebih pendek tidak dicache dan tiada ralat dikembalikan. Awalan 4,000 token dalam contoh di atas dicache pada Sonnet 5 tetapi tidak dicache pada Haiku 4.5, kerana 4,000 kurang daripada had minimum model itu. Apabila kedua-dua pembilang menunjukkan 0, tiada apa-apa yang dicache.

Pemprosesan kelompok mengurangkan kadar sebanyak separuh

Batch API memproses permintaan secara tak segerak dengan diskaun 50 peratus untuk input dan output. Dalam contoh di atas, kosnya berubah daripada $12.60 bagi setiap 1,000 permintaan kepada $6.30. Diskaun ini boleh digabungkan dengan caching gesaan, jadi kerja kelompok yang dicache ialah cara paling murah untuk menjalankan kerja pukal.

Kekurangannya ialah kependaman. Oleh itu, kaedah kelompok tidak sesuai untuk apa-apa tugas yang memerlukan seseorang menunggu hasilnya. Kaedah ini sesuai untuk pengelasan semalaman dan pengisian semula dokumen.

Mengapa kos sembang meningkat dalam satu perbualan

Oleh sebab API tidak menyimpan keadaan, klien anda menghantar semula keseluruhan perbualan pada setiap giliran. Oleh itu, penggunaan token dalam satu sembang meningkat mengikut kuasa dua panjangnya, bukan secara linear.

Anggap setiap giliran mempunyai purata 500 token. Giliran 1 menghantar 500 token input. Giliran 2 menghantar 1,000. Giliran 20 menghantar 10,000. Jumlahkan menggunakan n(n+1)/2, maka perbualan 20 giliran telah menghantar kira-kira 105,000 token input, sedangkan transkrip itu sendiri hanya sepanjang 10,000 token.

Itulah sebabnya ciri sembang menelan kos yang lebih tinggi daripada yang ditunjukkan oleh transkripnya, dan sebab caching awalan yang stabil atau meringkaskan giliran lama berbaloi untuk rangkaian perbualan yang panjang. Ejen yang mengulangi panggilan alat mempunyai corak yang sama, malah lebih teruk: setiap hasil alat kekal dalam sejarah dan dihantar semula pada setiap giliran seterusnya. Menetapkan had perbelanjaan yang ketat untuk ejen yang anda jalankan sendiri paling penting dalam keadaan ini kerana pertumbuhan itu berlaku secara automatik dan tiada sesiapa memantaunya.

Kira token sebelum membuat anggaran

Jangan lagi mengira jumlah token berdasarkan jumlah perkataan. API mengiranya untuk anda tanpa caj, menggunakan had kadar yang berasingan daripada penciptaan mesej.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

Respons mengandungi satu medan:

{ "input_tokens": 14 }

Hantar gesaan sistem sebenar dan definisi alat anda, bersama mesej pengguna yang mewakili penggunaan sebenar, kemudian masukkan nombor itu ke dalam fungsi kos di atas. Titik akhir ini menerima isi yang sama seperti permintaan mesej, jadi imej dan PDF turut dikira dengan betul. Dua perkara perlu diberi perhatian. Jumlah itu ialah anggaran dan mungkin berbeza sedikit daripada angka yang dicaj. Jumlah itu juga diukur menggunakan tokenizer model yang anda hantar. Oleh itu, hantar model yang benar-benar akan anda jalankan.

Token output tidak boleh dikira lebih awal kerana token tersebut belum wujud. Hadkan jumlahnya dengan max_tokens, kemudian ukur taburan sebenar daripada usage.output_tokens pada trafik langsung.

Perkara lain yang ditambah pada bil

Token merangkumi sebahagian besar bil. Beberapa item bukan token dan sering mengejutkan pengguna.

  • Takrif alat menjadi token input pada setiap permintaan. Gesaan sistem penggunaan alat sahaja menambah 286 hingga 406 token pada Opus 5, sebelum skema anda sendiri ditambah. Sepuluh huraian alat yang panjang boleh menggandakan gesaan kecil.
  • Carian web dikenakan bayaran $10 bagi setiap 1,000 carian, selain token yang digunakan oleh hasil carian apabila hasil tersebut dimasukkan ke dalam konteks.
  • Web fetch tidak mengenakan bayaran tersendiri, tetapi halaman yang diambil menjadi token input. Halaman dokumentasi berukuran 100 kB mengandungi kira-kira 25,000 token.
  • Meminta inferens khusus AS dengan inference_geo pada Claude 4.6 dan versi lebih baharu mengenakan pengganda 1.1 pada setiap kategori token, termasuk bacaan dan penulisan cache.

Sama ada API merupakan pilihan yang wajar bergantung sepenuhnya pada jumlah penggunaan anda. Di bawah tahap penggunaan tertentu, pelan bulanan tetap lebih berbaloi, dan perbandingan API dengan langganan Claude mengira perbezaan tersebut menggunakan nombor sebenar.

FAQ

Berapakah kos 1M token dalam Claude?

Kos bergantung pada model dan sama ada token tersebut ialah token input atau output. Setakat Ogos 2026, satu juta token input berharga $1 pada Claude Haiku 4.5, $2 pada Claude Sonnet 5 di bawah harga pengenalan, dan $5 pada Claude Opus 5. Kos output ialah lima kali ganda kadar input bagi setiap model tersebut. Harga input Sonnet 5 akan berubah kepada $3 dan harga output kepada $15 pada 1 September 2026. Kadar boleh berubah, jadi sahkan kadar tersebut pada halaman harga rasmi sebelum memasukkan angka ke dalam belanjawan.

Adakah 1M token sama dengan 1M perkataan?

Tidak. Satu token mengandungi kira-kira 4 aksara bahasa Inggeris, atau kira-kira 0.75 perkataan. Oleh itu, satu juta token bersamaan kira-kira 750,000 perkataan. Nisbah ini hanya sebagai panduan. Kod, JSON dan bahasa selain bahasa Inggeris menggunakan lebih banyak token bagi setiap perkataan. Claude Opus 4.7 dan versi selepasnya juga menggunakan tokenizer yang lebih baharu. Tokenizer ini menghasilkan kira-kira 30 peratus lebih banyak token untuk teks yang sama berbanding Claude Sonnet 4.6 dan versi terdahulu. Oleh itu, kiraan token tidak boleh digunakan secara langsung antara generasi model. Buat pengukuran menggunakan endpoint /v1/messages/count_tokens percuma dengan menghantar model yang hendak anda jalankan.

Adakah caching prompt sentiasa menjimatkan kos?

Tidak. Penulisan cache selama 5 minit berharga 1.25 kali kadar input asas. Oleh itu, awalan yang ditulis tetapi tidak pernah dibaca berharga 25 peratus lebih tinggi berbanding penghantaran biasa. Kos tersebut berbaloi selepas bacaan pertama. Kegagalan berlaku dalam dua keadaan, dan kedua-duanya berlaku tanpa pemberitahuan. Jika awalan cache berubah antara permintaan, carian tidak pernah sepadan kerana padanan awalan mesti tepat. Jika awalan lebih pendek daripada panjang minimum yang boleh dicache oleh model, iaitu 1,024 token pada Sonnet 5 dan 4,096 pada Haiku 4.5, tiada apa-apa akan dicache dan tiada ralat akan dikembalikan. Apabila cache_creation_input_tokens dan cache_read_input_tokens kedua-duanya membaca 0, cache tidak berfungsi.

Mengapakah bil saya meningkat lebih cepat daripada bilangan mesej?

Hal ini berlaku kerana keseluruhan perbualan dihantar semula pada setiap giliran. Messages API tidak menyimpan keadaan. Oleh itu, giliran 20 dalam sembang menghantar semula kesemua 19 giliran terdahulu sebagai input. Jika setiap giliran mengandungi purata 500 token, perbualan 20 giliran menghantar kira-kira 105,000 token input, sedangkan transkripnya hanya mengandungi 10,000 token. Gelung ejen berfungsi dengan cara yang sama kerana setiap hasil alat kekal dalam sejarah. Cache awalan yang stabil, atau ringkaskan giliran lama dan keluarkannya daripada permintaan.

#claude#tokens#api-pricing#cost-estimation#prompt-caching