SSD Nodes Learn
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-07-24

Apa itu token dalam Claude dan kosnya

Satu token Claude adalah 3.5 aksara. Ketahui mengapa satu sesi Claude Code boleh mencecah 80,000 token dan kesan masa idle terhadap kos penggunaan anda.

Apakah token dalam Claude?

Token ialah unit teks yang dibaca dan ditulis oleh Claude: sebahagian daripada perkataan, kira-kira 3.5 aksara bahasa Inggeris. Angka tersebut berasal daripada glosari Anthropic sendiri, dan jumlahnya melebihi satu token bagi setiap perkataan apabila ruang dan tanda baca dikira, jadi seribu perkataan prosa adalah melebihi 1,300 token. Kod menggunakan lebih banyak token bagi setiap baris: kurungan, operator, garis bawah, dan inden membahagikan lebih banyak token bagi setiap aksara berbanding bahasa Inggeris, dan fail sumber dengan beberapa ratus baris biasanya mencecah beberapa ribu token. Fail 2,000 baris yang dipilih untuk dibaca oleh ejen memerlukan penggunaan token lima angka sebelum sebarang baris kod baharu ditulis.

Dua perkara mengenai tokenizer sering mengelirukan pengguna. Pertama, ia adalah khusus untuk model tertentu. Setakat Julai 2026, Opus 4.7 dan versi kemudian, Sonnet 5, dan Fable 5 menggunakan tokenizer baharu yang menghasilkan kira-kira 30% lebih banyak token bagi teks yang sama berbanding model Claude terdahulu (peningkatan tepat bergantung pada kandungan), yang mengubah bajet token anda walaupun harga setiap token tidak meningkat. Kedua, tiktoken, perpustakaan yang sering digunakan dalam setiap hantaran blog, ialah tokenizer OpenAI dan mengira kurang daripada Claude sebanyak kira-kira 15–20% bagi teks biasa, dan lebih banyak bagi kod. Satu-satunya pengiraan yang boleh dipercayai ialah titik akhir count_tokens, yang dibincangkan di bawah.

Mengapa sesi pengekodan anda menelan kos sebanyak itu

Setiap bil Claude, sama ada invois API atau had langganan, bergantung pada satu ukuran: token masuk, token keluar. Halaman harga menjadikannya kelihatan mudah: sekian dolar bagi setiap sejuta token input, sekian bagi setiap sejuta token output. Apa yang tidak diberitahu adalah dalam sesi pengekodan ejen, bahagian input meter berjalan jauh lebih pantas daripada jangkaan, kerana keseluruhan perbualan dihantar semula pada setiap pusingan. Saya telah menjual infrastruktur berasaskan meter selama lima belas tahun, dan token adalah meter pertama yang saya lihat di mana kebanyakan pelanggan benar-benar tidak tahu apa yang menyebabkan penggunaannya meningkat. Ini adalah pengajaran pembacaan meter: apa yang dikira sebagai input dan output dalam sesi ejen, mengapa gelung penghantaran semula sangat mahal, mengapa tiktoken menulis semula pengiraan, dan lever mana yang sebenarnya mengubah jumlah tersebut.

Semuanya adalah input: apa yang sebenarnya dikira oleh meter

Pengguna menganggap mereka membayar untuk kod yang ditulis oleh Claude. Dalam sesi ejen, itu hanyalah komponen kecil. Token input — kadar yang lebih murah tetapi volum yang jauh lebih tinggi — merangkumi:

  • Prompt sistem. Arahan kerangka Claude Code sendiri, ditambah dengan CLAUDE.md dan fail memori anda, dimuatkan pada permulaan sesi dan hadir pada setiap permintaan seterusnya.
  • Definisi alatan. Setiap skema alatan yang boleh dipanggil oleh ejen. Setiap pelayan MCP yang anda sambungkan menambah kos overhead tetap ini — walaupun Claude Code kini menangguhkan definisi alatan MCP penuh secara lalai, jadi hanya nama alatan berada dalam konteks sehingga alatan digunakan buat kali pertama, yang mengurangkan tetapi tidak menghapuskan kos tersebut.
  • Setiap fail yang dibaca oleh ejen. Read daripada fail sumber memasukkan keseluruhan fail ke dalam konteks, dan ia kekal di sana.
  • Setiap hasil alatan. Larian ujian, output grep, output terminal, log binaan — semuanya kembali sebagai token input. Set ujian yang gagal dan mencetak 8,000 baris hanya akan mengenakan caj seperti sebuah buku kecil.
  • Keseluruhan perbualan setakat ini, dihantar semula pada setiap pusingan. Bahagian ini memerlukan seksyen khasnya sendiri.

Mengapa kos meningkat setiap kali menghantar semula

Claude API adalah stateless. Ia tidak mengingati sesi anda antara permintaan — tiada apa yang disimpan. Jadi pada pusingan 2, klien menghantar pusingan 1 berserta responsnya dan mesej baharu anda. Pada pusingan 50, ia menghantar semula pusingan 1 hingga 49 — setiap fail yang dibaca, setiap hasil alatan, setiap diff — berserta pusingan 50. Model tersebut membaca semula keseluruhan transkrip setiap kali, dan setiap token yang dibaca semula itu dikira sebagai input berbayar.

Kesannya: kos bagi setiap pusingan meningkat secara linear mengikut panjang sesi, dan jumlah kos sesi meningkat secara kuadratik. Mesej yang menelan kos separuh sen pada pusingan 3 boleh menelan kos 20 kali ganda lebih tinggi pada pusingan 60 untuk soalan satu baris yang sama, kerana ia membawa beban 60 pusingan sebelumnya. Ini adalah fakta utama yang menjelaskan kebanyakan tiket "mengapa bil saya terlalu tinggi", dan ini bukan keanehan Claude — setiap produk LLM yang terasa seperti stateful sebenarnya adalah API stateless dengan gelung penghantaran semula di bawahnya.

Output: apa yang anda lihat, ditambah dengan pemikiran yang tidak dilihat

Token output adalah yang paling mahal — lima kali ganda kadar input bagi barisan produk semasa ($5/$25 pada Opus 4.8, $3/$15 pada Sonnet 5, $1/$5 pada Haiku 4.5, setakat Julai 2026). Output merangkumi teks dan kod yang dijana oleh Claude, serta token pemikiran: penaakulan dalaman yang dilakukan model sebelum menjawab. Dua fakta adalah penting di sini. Pemikiran dikenakan caj pada kadar output dan dikira terhadap max_tokens — respons API yang terhenti disebabkan stop_reason: "max_tokens" dan jawapan yang terpotong sering bermaksud pemikiran telah menggunakan bajet sebelum jawapan sempat dihasilkan. Dan pada model semasa, ringkasan penaakulan mungkin tidak dipaparkan langsung — Opus 4.8, Sonnet 5, dan Fable 5 mengabaikannya secara lalai — tetapi pemikiran tetap berlaku dan tetap dikenakan caj. Sesuatu yang tidak kelihatan bukan bermaksud percuma.

Claude Code membolehkan pemikiran lanjutan secara lalai kerana ia meningkatkan kerja pelbagai langkah secara ketara, dan bajet lalai boleh mencecah puluhan ribu token bagi setiap permintaan. Untuk tugas yang lebih mudah, anda boleh mengurangkannya: rendahkan tahap usaha dengan /effort atau dalam /model, atau laras tetapan pemikiran dalam /config. Ini adalah pemacu kos yang nyata, bukan sekadar kepercayaan.

Prompt caching mengubah pengiraan matematik

Prompt caching adalah sebab mengapa kitaran penghantaran semula tidak memufliskan semua orang. API boleh menyimpan cache bagi awalan (prefix) prompt yang stabil — prompt sistem, definisi alatan, sejarah perbualan — dan pada permintaan seterusnya, ia akan disajikan pada harga yang jauh lebih rendah. Setakat Julai 2026, pengganda adalah seperti berikut: satu penulisan (write) cache menelan kos 1.25× kadar input asas (2× untuk varian 1-jam), dan satu pembacaan (read) cache menelan kos 0.1×. Penulisan adalah premium; pembacaan memberikan diskaun 90%. Satu pembacaan sahaja sudah memadai untuk membayar balik premium penulisan 5-minit tersebut.

Claude Code menguruskan caching untuk anda, dan dalam sesi yang aktif, hampir semua penghantaran semula yang besar itu disajikan daripada cache. Namun, cache lalai bertahan selama lima minit dari penggunaan terakhir. Jika anda berehat terlalu lama, kemudian kembali dan menghantar mesej — cache telah tamat tempoh, dan keseluruhan awalan yang terkumpul akan ditulis semula pada kadar 1.25× berbanding dibaca pada kadar 0.1×. Dalam sesi 150K-token, satu pusingan sejuk (cold turn) tersebut menelan kos lebih tinggi daripada belasan pusingan panas (warm turns). Ini adalah hasil yang bertentangan dengan logik yang perlu difahami: ritma rehat-kemudian-sambung boleh menelan kos lebih tinggi daripada kerja berterusan, kerana setiap jurang rehat selepas TTL menukarkan pusingan seterusnya daripada pembacaan murah kepada penulisan semula yang mahal. Bekerja dalam sesi yang padat; jangan hantar sesi besar secara perlahan dengan satu mesej setiap sepuluh minit.

Jika anda memanggil API daripada aplikasi sendiri anda pada VPS, anda tidak mendapat semua ini secara percuma — dan kesilapan biasa yang dilakukan sendiri adalah memasukkan timestamp atau request ID ke dalam prompt sistem, yang mengubah bait awalan pada setiap permintaan dan melumpuhkan caching secara senyap. Petandanya ialah usage.cache_read_input_tokens berada pada nilai sifar bagi panggilan yang kelihatan serupa.

Formula, dengan contoh pengiraan

Abaikan sesiapa yang menyatakan "satu sesi berharga $X." Kos sesi berbeza sehingga dua gandaan magnitud. Formula yang tepat adalah:

turn cost = (uncached input      x base input price)
          + (cache writes        x 1.25 x base input price)
          + (cache reads         x 0.10 x base input price)
          + (output incl. thinking x output price)

session cost = sum over all turns

Contoh pengiraan pada Claude Opus 4.8, yang pada Julai 2026 berharga $5 bagi setiap sejuta token input dan $25 bagi setiap sejuta token output. Satu pusingan sesi sederhana dengan 80,000 token konteks terkumpul: 75,000 dibaca daripada cache, 3,000 ditulis baharu, 2,000 input segar tanpa cache, 1,500 token output termasuk pemikiran.

  • Cache reads: 75,000 × $0.50/M = $0.0375
  • Cache writes: 3,000 × $6.25/M = $0.019
  • Uncached input: 2,000 × $5/M = $0.010
  • Output: 1,500 × $25/M = $0.0375

Kira-kira $0.10 untuk pusingan tersebut; lima puluh pusingan yang sama akan menelan kos sekitar $5. Sekarang, pusingan yang sama selepas cache tamat tempoh: keseluruhan 80,000 token ditulis semula pada kadar $6.25/M adalah $0.50 sebelum output — kira-kira lima kali ganda kos pusingan cache, untuk kerja yang sama. Perbezaan tersebut adalah gambaran keseluruhan fungsi caching dalam satu angka.

Untuk tujuan kalibrasi dan bukannya ramalan: angka yang diterbitkan oleh Anthropic untuk penggunaan Claude Code peringkat perusahaan, setakat Julai 2026, puratanya adalah sekitar $13 bagi setiap pembangun untuk satu hari aktif — $150–250 sebulan — dengan 90% pengguna kekal di bawah $30 sehari. Kos penggunaan anda bergantung pada pilihan model, kebersihan sesi, dan saiz kod sumber, sebab itulah faktor-faktor di bawah adalah penting.

Melihat penggunaan anda

Dalam Claude Code, perintahnya ialah /usage (/cost masih berfungsi — ia adalah alias). Blok Session di bahagian atas menunjukkan statistik token dan anggaran kos yang dikira secara tempatan untuk sesi semasa; bagi pelan langganan, skrin yang sama menunjukkan bar had had pelan anda dan pecahan penggunaan terkini mengikut skill, subagent, plugin, dan server MCP individu. Untuk pengebilan rasmi bagi akaun API, halaman penggunaan dalam Claude Console adalah sumber rujukan utama — angka CLI hanyalah anggaran. /context memaparkan grid berwarna tentang apa yang memenuhi tetingkap konteks — prompt sistem, tools, definisi MCP, fail, sejarah — dan merupakan cara terpantas untuk mengesan CLAUDE.md yang terlalu besar atau server MCP yang terlalu banyak menghantar mesej; gunakan all untuk melihat pecahan penuh bagi setiap item.

Daripada API, setiap respons memberitahu anda dengan tepat apa yang telah berlaku:

response = client.messages.create(model="claude-sonnet-5", max_tokens=2048,
                                  messages=messages)
u = response.usage
total_prompt = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens
print(f"uncached={u.input_tokens} written={u.cache_creation_input_tokens} "
      f"read={u.cache_read_input_tokens} output={u.output_tokens}")

Sila ambil perhatian bahawa input_tokens hanyalah baki tanpa cache — saiz prompt yang sebenar adalah jumlah keseluruhan ketiga-tiga medan input. Agent yang berjalan selama satu jam dengan paparan input_tokens: 4000 bukanlah murah; 200,000 token yang lain telah diambil daripada cache. Untuk membuat anggaran sebelum anda menghantar, gunakan endpoint pengiraan token — ia adalah percuma untuk dipanggil, mempunyai had kadar tersendiri, dan mengira menggunakan tokenizer bagi mana-mana model yang anda namakan (anggap hasil tersebut sebagai anggaran rapat; pengebilan mencerminkan permintaan sebenar):

count = client.messages.count_tokens(model="claude-sonnet-5",
                                     messages=[{"role": "user", "content": big_file}])
print(count.input_tokens)

Jangan sesekali tiktoken, atas sebab yang dinyatakan di atas.

Pelan langganan berbanding bayar mengikut penggunaan

Mekanisme dalam panduan ini adalah sama di mana-mana; hanya penyelesaian bayaran yang berbeza. Dengan kunci API, Anthropic mengenakan caj bayar mengikut penggunaan, bagi setiap token, pada kadar yang diterbitkan — setiap angka di atas adalah nilai wang sebenar. Bagi langganan Claude (Pro, Max, Team, Enterprise), penggunaan Claude Code menggunakan kuota yang disertakan dalam pelan anda: setakat Julai 2026, ia adalah tetingkap sesi lima jam beransur-ansur ditambah dengan tetingkap mingguan, dikongsi antara model dan dengan sembang claude.ai, dan angka /usage dolar hanyalah maklumat dan bukannya bil. Jika tetingkap habis, anda akan melihat "You've hit your session limit" atau "You've hit your weekly limit" berserta masa tetapan semula — dan menukar model dengan /model tidak akan memulihkan akses, kerana tetingkap tersebut dikongsi antara model. Pelan boleh mengaktifkan kredit penggunaan secara pilihan, yang diuruskan dengan /usage-credits, untuk membeli penggunaan melebihi had. Saya tidak akan mencetak kuota pelan: ia adalah angka yang paling tidak stabil dalam topik ini, jadi sila semak claude.com/pricing dan bar /usage anda sendiri sebagai ganti. Mekanisme token tetap penting dalam langganan — sesi yang membazir akan menghabiskan tetingkap anda sama seperti ia menghabiskan wang. Untuk bahagian langganan, lihat pelan Claude mana yang sesuai dengan penggunaan anda.

Tuas yang benar-benar berkesan

  • Hadkan skop pembacaan ejen. "Baiki pepijat pengesahan dalam auth.py" hanya membaca satu fail; "tingkatkan kod ini" membaca empat puluh fail. Pastikan CLAUDE.md ringkas — ia dimuatkan ke dalam setiap sesi, jadi hadkan kepada perkara penting — dan pindahkan arahan khusus aliran kerja ke dalam kemahiran yang dimuatkan mengikut keperluan.
  • Jelas dan padat. /clear antara tugasan yang tidak berkaitan — konteks lama dihantar semula, dan dicaj semula, pada setiap mesej seterusnya. Dalam satu tugasan panjang, /compact Focus on the failing tests and the diff meringkaskan sejarah untuk mengelakkan peningkatan kos secara kuadratik.
  • Saiz model yang tepat. Sonnet sesuai untuk kebanyakan pengekodan pada harga pengenalan $2/$10 bagi setiap sejuta token setakat Julai 2026 ($3/$15, berbanding Opus pada $5/$25), manakala Haiku pada $1/$5 adalah alat yang tepat untuk kerja sub-ejen mekanikal seperti triaj log. /model boleh bertukar di tengah sesi.
  • Tapis output yang panjang. Menggunakan hook yang melakukan grep pada hasil ujian untuk mengecilkan output kepada kegagalan sahaja sebelum Claude membacanya akan menukar 20,000 token hasil alatan kepada 300 token, dan ini dilakukan pada setiap penghantaran semula giliran tersebut.
  • Gunakan batch untuk tugasan bukan interaktif. Untuk saluran paip API anda sendiri — klasifikasi, semakan pukal, tugasan malam — Batches API menjalankan model yang sama dengan diskaun 50% sebagai pertukaran untuk penghantaran secara asinkronus.
  • Hormati masa cache. Bekerja dalam tempoh yang berterusan. Sesi Claude Code dalam tmux pada VPS yang terpisah tidak menelan kos semasa keadaan pegun — token hanya digunakan apabila giliran dijalankan — tetapi cache yang panas adalah apa yang hilang semasa waktu pegun, dan giliran seterusnya akan membayar kos penulisan semula.

FAQ

Berapakah jumlah token yang digunakan dalam sesi pengekodan Claude Code?

Tiada jumlah tetap — satu pusingan pertengahan sesi biasanya membawa puluhan ribu token prompt apabila fail dan sejarah terkumpul, manakala sesi kerja boleh mencecah jutaan token, dengan kebanyakan token diambil daripada cache pada satu persepuluh kadar asas. Untuk kalibrasi, angka perusahaan yang diterbitkan oleh Anthropic setakat Julai 2026 adalah purata sekitar $13 bagi setiap pembangun setiap hari aktif, dengan 90% pengguna di bawah $30. Jalankan /usage dalam sesi anda sendiri; lima minit memerhatikannya adalah lebih baik daripada mana-mana purata yang diterbitkan.

Adakah token pemikiran (thinking tokens) memerlukan kos walaupun saya tidak dapat melihatnya?

Ya. Token pemikiran dibilkan sebagai token output — kadar yang lebih mahal — dan dikira terhadap max_tokens, dan model semasa membilang token tersebut walaupun antara muka tidak memaparkan ringkasan penaakulan. Jika respons terpotong dengan stop_reason: "max_tokens" sebelum jawapan yang kelihatan selesai, pemikiran berkemungkinan telah menggunakan bajet tersebut. Dalam Claude Code, turunkan tahap usaha dengan /effort untuk tugasan yang tidak memerlukan penaakulan mendalam.

Mengapa sesi Claude Code yang panjang menjadi lebih mahal bagi setiap mesej?

Kerana API adalah stateless: setiap pusingan menghantar semula keseluruhan perbualan — setiap fail yang dibaca, hasil alatan, dan pertukaran terdahulu — sebagai input yang dibilkan, jadi pusingan 50 membawa pusingan 1 hingga 49 sebagai beban. Prompt caching menyediakan awalan (prefix) yang berulang pada kira-kira satu persepuluh harga input asas, tetapi awalan itu sendiri terus berkembang, dan sebarang jurang masa selepas TTL cache akan menukarkan pusingan seterusnya kepada penulisan semula harga penuh. /compact mengecilkan sejarah; /clear menetapkannya semula.

Bagaimanakah saya ingin menyemak penggunaan token dan kos Claude saya?

Dalam Claude Code, /usage menunjukkan statistik token sesi, anggaran kos tempatan, dan bar had pelan pada langganan (/cost adalah alias); /context menunjukkan apa yang memenuhi tetingkap. Untuk bil API yang sahih, gunakan halaman penggunaan dalam Claude Console. Dalam kod anda sendiri, baca response.usage — menjumlahkan input_tokens, cache_creation_input_tokens, dan cache_read_input_tokens memberikan saiz prompt yang sebenar — dan buat anggaran lebih awal dengan endpoint count_tokens, jangan sesekali dengan tiktoken.