SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-29

Apakah itu token dalam Claude dan kos sesi kod?

Ketahui cara Claude mengira token bagi setiap baris kod. Satu token bersamaan 3.5 aksara. Ketahui mengapa sesi Claude Code mencecah 80,000 token dan kos lima minit melahu.

Apakah itu token dalam Claude?

Token ialah unit teks yang dibaca dan ditulis oleh Claude: satu serpihan perkataan, secara kasarnya 3.5 aksara bahasa Inggeris. Angka tersebut datang daripada glosari Anthropic sendiri, dan ia berjumlah lebih daripada satu token bagi setiap perkataan apabila ruang kosong dan tanda baca dikira, jadi seribu perkataan prosa adalah melebihi 1,300 token. Kod lebih berat bagi setiap baris: kurungan, operator, garis bawah (underscore) dan indentasi dipecahkan kepada lebih banyak token bagi setiap aksara berbanding bahasa Inggeris, dan fail sumber yang mempunyai beberapa ratus baris biasanya mencecah beberapa ribu token. Fail 2,000 baris yang diputuskan untuk dibaca oleh ejen adalah pembelian token lima angka sebelum sesiapa pun menulis sebaris kod baharu.

Dua perkara mengenai tokenizer sering mengelirukan pengguna. Pertama, ia adalah khusus untuk model. Setakat Julai 2026, Opus 4.7 dan versi terkemudian, Sonnet 5, serta Fable 5 menggunakan tokenizer baharu yang menghasilkan kira-kira 30% lebih banyak token untuk teks yang sama berbanding model Claude terdahulu (peningkatan tepat berbeza mengikut kandungan), yang mengubah sebarang bajet token anda walaupun harga per-token tidak meningkat bersamanya. Kedua, tiktoken, pustaka yang sering dirujuk oleh setiap hantaran blog, ialah tokenizer OpenAI dan kurang mengira (undercount) jumlah Claude sebanyak kira-kira 15–20% pada teks biasa, dan lebih banyak pada kod. Satu-satunya kiraan yang boleh dipercayai ialah endpoint count_tokens, yang dibincangkan di bawah.

Mengapa sesi pengekodan anda menelan kos sedemikian

Setiap bil Claude, sama ada invois API atau had langganan, ditentukan oleh satu metrik: token masuk dan token keluar. Halaman harga menjadikannya kelihatan mudah: jumlah dolar tertentu bagi setiap juta token input, dan jumlah tertentu bagi setiap juta output. Apa yang tidak diberitahu ialah dalam sesi pengekodan ejen, bahagian input berjalan jauh lebih pantas daripada jangkaan, kerana keseluruhan perbualan dihantar semula pada setiap pusingan. Saya telah menjual infrastruktur bermeter selama lima belas tahun, dan token adalah metrik pertama yang saya temui di mana kebanyakan pelanggan benar-benar tidak tahu apa yang menyebabkannya meningkat. Ini adalah pelajaran membaca meter: perkara yang dikira sebagai input dan output dalam sesi ejen, sebab gelung hantar semula sangat mahal, sebab prompt caching mengubah pengiraan, dan tuil yang sebenarnya mempengaruhi angka tersebut.

Segala-galanya adalah input: apa yang sebenarnya dikira oleh meter

Pengguna menganggap mereka membayar untuk kod yang ditulis oleh Claude. Dalam sesi ejen, itu hanyalah item kecil dalam bil. Token input, iaitu kadar yang lebih murah tetapi dengan volum yang jauh lebih tinggi, merangkumi:

  • System prompt. Arahan rangka kerja Claude Code sendiri, ditambah dengan CLAUDE.md dan fail memori anda, dimuatkan pada permulaan sesi dan hadir dalam setiap permintaan selepas itu.
  • Definisi alat. Setiap skema alat yang boleh dipanggil oleh ejen. Setiap pelayan MCP yang anda sambungkan menambah kepada kos tetap ini, walaupun Claude Code kini menangguhkan definisi penuh alat MCP secara lalai. Oleh itu, hanya nama alat yang berada dalam konteks sehingga alat tersebut digunakan buat kali pertama, yang mengurangkan tetapi tidak menghapuskan kos tersebut.
  • Setiap fail yang dibaca oleh ejen. Read bagi fail sumber memasukkan keseluruhan fail tersebut ke dalam konteks, dan ia kekal di sana.
  • Setiap hasil alat. Ujian yang dijalankan, output grep, paparan terminal, log binaan, semuanya kembali sebagai token input. Rangkaian ujian yang gagal dan mencetak 8,000 baris baru sahaja mengenakan caj kepada anda untuk jumlah teks yang setara dengan sebuah buku kecil.
  • Keseluruhan perbualan setakat ini, dihantar semula pada setiap pusingan. Perkara ini memerlukan bahagiannya yang tersendiri.

Kos penghantaran semula yang tidak disedari

Claude API bersifat tanpa status (stateless). Ia tidak mengingati sesi anda antara permintaan, begitu juga dengan sistem lain. Oleh itu, pada giliran ke-2, klien menghantar giliran ke-1 berserta responsnya dan mesej baharu anda. Pada giliran ke-50, ia menghantar semula giliran 1 hingga 49, setiap fail yang dibaca, setiap hasil alat (tool result), setiap diff, berserta giliran ke-50. Model tersebut membaca semula keseluruhan transkrip setiap kali, dan setiap token yang dibaca semula itu dibilkan sebagai input.

Akibatnya: kos bagi setiap giliran meningkat secara hampir linear mengikut panjang sesi, dan jumlah kos sesi meningkat secara kuadratik. Mesej yang berharga setengah sen pada giliran ke-3 boleh menelan kos dua puluh kali ganda pada giliran ke-60, untuk soalan satu baris yang sama, kerana ia membawa beban enam puluh giliran sebelumnya. Ini adalah fakta tunggal yang menjelaskan kebanyakan tiket "mengapa bil saya begitu tinggi", dan ia bukanlah keanehan Claude; setiap produk LLM yang kelihatan mempunyai status sebenarnya adalah API tanpa status dengan gelung penghantaran semula di bawahnya.

Output: apa yang anda lihat, berserta proses pemikiran yang tidak kelihatan

Token output adalah token yang mahal, dengan kadar lima kali ganda berbanding kadar input merentas barisan model semasa ($5/$25 untuk Opus 4.8, $3/$15 untuk Sonnet 5, $1/$5 untuk Haiku 4.5, setakat Julai 2026). Output merangkumi teks dan kod yang dijana oleh Claude, serta token pemikiran: penaakulan dalaman yang dilakukan oleh model sebelum menjawab. Dua fakta penting di sini. Pemikiran dibilkan mengikut kadar output dan dikira terhadap max_tokens, respons API yang terhenti dengan stop_reason: "max_tokens" dan jawapan yang terpotong sering bermakna pemikiran telah menghabiskan bajet sebelum jawapan sempat diselesaikan. Pada model semasa, ringkasan penaakulan mungkin tidak dipaparkan langsung; Opus 4.8, Sonnet 5, dan Fable 5 melangkauinya secara lalai, namun proses pemikiran tetap berlaku dan tetap dibilkan. Sesuatu yang tidak kelihatan tidak bermakna ia percuma.

Claude Code mendayakan pemikiran lanjutan secara lalai kerana ia terbukti meningkatkan kualiti kerja berbilang langkah secara ketara, dan bajet lalai boleh mencecah puluhan ribu token bagi setiap permintaan. Bagi tugasan yang lebih mudah, anda boleh mengurangkannya: rendahkan tahap usaha dengan /effort atau dalam /model, atau laraskan tetapan pemikiran dalam /config. Ini merupakan tuil kawalan kos yang sebenar, bukan sekadar andaian.

Prompt caching mengubah pengiraan kos

Prompt caching adalah sebab mengapa gelung hantaran semula tidak menyebabkan kerugian kewangan kepada semua orang. API boleh menyimpan cache bagi awalan (prefix) prompt, prompt sistem, definisi alat, dan sejarah perbualan anda yang stabil, kemudian menyajikannya pada permintaan seterusnya dengan harga yang jauh lebih murah. Setakat Julai 2026, penggandanya adalah: tulis (write) cache berharga 1.25× daripada kadar input asas (2× untuk varian 1 jam), dan baca (read) cache berharga 0.1×. Penulisan adalah premium; pembacaan pula mendapat diskaun 90%. Satu bacaan sahaja sudah lebih daripada cukup untuk menampung premium penulisan 5 minit.

Claude Code menguruskan caching untuk anda, dan dalam sesi yang sihat, hampir keseluruhan hantaran semula yang besar itu disajikan daripada cache. Walau bagaimanapun, cache lalai hanya bertahan selama lima minit daripada penggunaan terakhir. Jika anda pergi minum kopi yang mengambil masa lama, kembali semula, dan menghantar mesej, cache tersebut telah tamat tempoh. Akibatnya, keseluruhan awalan yang terkumpul ditulis semula pada kadar 1.25× dan bukannya dibaca pada 0.1×. Dalam sesi 150K-token, satu pusingan sejuk (cold turn) itu menelan kos lebih tinggi daripada sedozen pusingan panas (warm turn). Ini adalah hasil yang berlawanan dengan intuisi dan perlu difahami: irama melahu-kemudian-sambung boleh menelan kos lebih tinggi daripada kerja berterusan, kerana setiap jurang melahu yang melebihi TTL akan menukar pusingan seterusnya anda daripada bacaan murah kepada penulisan semula yang mahal. Bekerjalah dalam tempoh yang padat; jangan menghantar mesej secara sedikit-sedikit bagi sesi yang besar setiap sepuluh minit.

Jika anda memanggil API daripada aplikasi anda sendiri pada VPS, anda tidak mendapat semua ini secara percuma. Kesilapan klasik yang sering dilakukan sendiri adalah menyelitkan cap masa (timestamp) atau ID permintaan ke dalam prompt sistem, yang mengubah bait awalan pada setiap permintaan dan melumpuhkan caching secara senyap. Petandanya ialah usage.cache_read_input_tokens yang kekal pada sifar merentasi panggilan yang kelihatan serupa.

Formula, berserta contoh pengiraan

Abaikan sesiapa yang menyatakan secara ringkas bahawa "sesuatu sesi berharga $X." Kos sesi berbeza sehingga dua gandaan magnitud. Apa yang kekal tepat ialah formula ini:

turn cost = (uncached input      x base input price)
          + (cache writes        x 1.25 x base input price)
          + (cache reads         x 0.10 x base input price)
          + (output incl. thinking x output price)

session cost = sum over all turns

Contoh pengiraan pada Claude Opus 4.8, yang setakat Julai 2026 berharga $5 bagi setiap sejuta token input dan $25 bagi setiap sejuta token output. Satu pusingan pertengahan sesi yang membawa 80,000 token konteks terkumpul: 75,000 dibaca daripada cache, 3,000 ditulis baharu, 2,000 input segar tanpa cache, 1,500 token output termasuk proses pemikiran.

  • Bacaan cache: 75,000 × $0.50/J = $0.0375
  • Penulisan cache: 3,000 × $6.25/J = $0.019
  • Input tanpa cache: 2,000 × $5/J = $0.010
  • Output: 1,500 × $25/J = $0.0375

Sekitar $0.10 bagi satu pusingan; lima puluh pusingan yang serupa, sekitar $5. Sekarang, bayangkan pusingan yang sama selepas cache tamat tempoh: kesemua 80,000 token ditulis semula pada harga $6.25/J iaitu $0.50 sebelum output, kira-kira lima kali ganda daripada kos pusingan yang menggunakan cache, untuk hasil kerja yang sama. Jurang tersebut merupakan keseluruhan kepentingan caching dalam satu angka. Empat baris pengiraan yang sama juga merupakan satu-satunya cara jujur untuk membandingkan vendor, kerana kadar harga pada pelekat mengabaikan bacaan cache dan proses pemikiran sepenuhnya, dan menjalankan pengiraan ini ke atas tiga tugasan sebenar menunjukkan di mana bil Claude berada di atas atau di bawah bil OpenAI.

Jika anda ingin memahami unit pengebilan itu sendiri dan bukannya sekadar satu pusingan, jumlah sejuta token dalam bentuk halaman, fail, dan dolar menjalankan aritmetik yang sama pada tahap yang lebih tinggi. Sebagai penentukuran dan bukannya ramalan: angka yang diterbitkan oleh Anthropic untuk penggunaan Claude Code peringkat perusahaan, setakat Julai 2026, secara purata adalah sekitar $13 bagi setiap pembangun untuk setiap hari aktif, $150–250 sebulan, dengan 90% pengguna kekal di bawah $30 sehari. Perbelanjaan anda bergantung kepada pilihan model, kebersihan sesi, dan saiz pangkalan kod, itulah sebabnya tuil-tuil di bawah ini penting.

Melihat penggunaan anda sendiri

Dalam Claude Code, arahannya ialah /usage (/cost masih berfungsi, ia merupakan alias). Blok Sesi di bahagian atas memaparkan statistik token dan anggaran kos yang dikira secara setempat untuk sesi semasa; pada pelan langganan, skrin yang sama memaparkan bar had pelan anda serta pecahan yang mengaitkan penggunaan terkini dengan kemahiran, subejen, pemalam dan pelayan MCP individu. Untuk pengebilan rasmi pada akaun API, halaman penggunaan dalam Claude Console ialah sumber kebenaran, angka CLI hanyalah anggaran. /context melukis grid berwarna bagi apa yang memenuhi tetingkap konteks, prompt sistem, alatan, definisi MCP, fail, sejarah, dan merupakan cara terpantas untuk mengesan CLAUDE.md yang sarat atau pelayan MCP yang terlalu banyak berkomunikasi; hantarkan all untuk mengembangkan pecahan penuh bagi setiap item.

Daripada API, setiap respons memberitahu anda dengan tepat apa yang berlaku:

response = client.messages.create(model="claude-sonnet-5", max_tokens=2048,
                                  messages=messages)
u = response.usage
total_prompt = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens
print(f"uncached={u.input_tokens} written={u.cache_creation_input_tokens} "
      f"read={u.cache_read_input_tokens} output={u.output_tokens}")

Ambil perhatian bahawa input_tokens hanyalah baki tanpa cache, saiz prompt sebenar ialah hasil tambah ketiga-tiga medan input. Ejen yang berjalan selama sejam menunjukkan input_tokens: 4000 bukanlah murah; 200,000 token yang lain telah dihidangkan daripada cache. Untuk membuat anggaran sebelum anda menghantar, gunakan titik akhir pengiraan token, ia percuma untuk dipanggil, mempunyai had kadar tersendiri, dan mengira dengan tokenizer bagi mana-mana model yang anda namakan (anggap keputusan tersebut sebagai anggaran yang hampir; pengebilan mencerminkan permintaan sebenar):

count = client.messages.count_tokens(model="claude-sonnet-5",
                                     messages=[{"role": "user", "content": big_file}])
print(count.input_tokens)

Jangan sekali-kali tiktoken, atas sebab di atas.

Pelan langganan berbanding bayar-ikut-penggunaan

Mekanisme dalam panduan ini adalah sama di mana-mana; hanya kaedah pembayaran yang berbeza. Dengan API key, Anthropic mengenakan caj bayar-ikut-penggunaan, mengikut token, pada kadar yang diterbitkan; setiap angka di atas adalah wang sebenar. Meter itu bermula lebih awal daripada jangkaan kebanyakan orang kerana tiada pelan percuma sebagai sandaran, hanya kredit kecil semasa pendaftaran dan beberapa endpoint yang tidak mengenakan caj, iaitu apa yang sebenarnya diperoleh oleh akaun API baharu sebelum anda memasukkan kad pada fail. Bagi langganan Claude (Pro, Max, Team, Enterprise), penggunaan Claude Code sebaliknya ditolak daripada peruntukan pelan anda: setakat Julai 2026, ia adalah tetingkap sesi lima jam yang bergerak serta tetingkap mingguan, dikongsi merentas model dan dengan sembang claude.ai, dan angka dolar /usage adalah untuk maklumat sahaja dan bukannya bil. Jika anda menghabiskan tetingkap, anda akan melihat "You've hit your session limit" atau "You've hit your weekly limit" berserta waktu set semula, dan menukar model dengan /model tidak akan memulihkan akses kerana tetingkap tersebut dikongsi merentas semua model. Tetingkap tersebut mengikut akaun dan bukannya klien yang anda gunakan, perkara yang perlu diketahui jika anda masih cuba menentukan apa yang berjalan secara natif pada Linux dan pelan mana yang meliputi setiap permukaan. Tetingkap mana yang sebenarnya telah anda habiskan menentukan berapa lama tempoh menunggu dan apa yang patut dilakukan sementara itu, jadi adalah berbaloi untuk mengetahui pilihan anda apabila anda mencapai had di tengah-tengah tugasan. Pelan boleh membolehkan kredit penggunaan secara pilihan, diuruskan dengan /usage-credits, untuk membeli penggunaan melebihi had siling. Saya sengaja tidak mencetak kuota pelan: ia adalah angka yang paling tidak menentu dalam keseluruhan topik ini, jadi semak claude.com/pricing dan bar /usage anda sendiri. Mekanisme token masih penting dalam langganan; sesi yang membazir akan menghabiskan tetingkap anda sama seperti ia menghabiskan dolar. Untuk bahagian langganan, lihat pelan Claude yang mana sesuai dengan penggunaan anda.

Tuas yang benar-benar berkesan

  • Hadkan skop bacaan ejen. "Baiki pepijat pengesahan dalam auth.py" hanya membaca satu fail; "tingkatkan kod ini" membaca empat puluh fail. Pastikan CLAUDE.md ringkas kerana ia dimuatkan ke dalam setiap sesi, jadi simpan hanya perkara penting dan pindahkan arahan khusus aliran kerja ke dalam kemahiran yang dimuatkan mengikut permintaan.
  • Jelas dan padat. /clear antara tugasan yang tidak berkaitan, konteks lama akan dihantar semula dan dicaj semula pada setiap mesej berikutnya. Dalam satu tugasan yang panjang, /compact Focus on the failing tests and the diff meringkaskan sejarah dan menghalang anda daripada terperangkap dalam lengkung kuadratik.
  • Saiz model yang tepat. Sonnet mengendalikan kebanyakan pengekodan pada harga $2/$10 bagi setiap juta token mengikut harga pengenalan setakat Julai 2026 (harga asal $3/$15, berbanding Opus pada $5/$25), dan Haiku pada $1/$5 ialah alat yang tepat untuk kerja subejen mekanikal seperti triaj log. Fable 5 berada di hujung spektrum yang satu lagi pada $10/$50, dua kali ganda harga Opus bagi kedua-dua belah meter, jadi adalah berbaloi untuk mengetahui tugasan yang benar-benar mewajarkan kadar tersebut sebelum anda membiarkannya dipilih untuk kerja rutin. /model bertukar di pertengahan sesi.
  • Pra-tapis output yang berjela. Cangkuk (hook) yang menggunakan grep untuk menapis hasil ujian kepada kegagalan sahaja sebelum Claude melihatnya akan menukar 20,000 token hasil alat kepada 300, dan ia melakukannya pada setiap penghantaran semula pusingan tersebut pada masa hadapan.
  • Kelompokkan apa yang tidak interaktif. Untuk talian paip API anda sendiri, klasifikasi, semakan pukal, dan kerja malam, Batches API menjalankan model yang sama pada diskaun 50% sebagai pertukaran untuk penghantaran tak segerak (asynchronous).
  • Hormati jam cache. Bekerja dalam tempoh yang berterusan. Sesi Claude Code dalam tmux pada VPS yang terputus tidak menelan kos semasa melahu, token hanya dibelanjakan apabila pusingan berjalan, tetapi cache yang hangat akan hilang semasa masa melahu, dan pusingan seterusnya akan menanggung kos penulisan semula.

FAQ

Berapakah jumlah token yang digunakan oleh sesi pengekodan dalam Claude Code?

Tiada jumlah tetap. Satu pusingan pertengahan sesi biasanya membawa puluhan ribu token prompt sebaik sahaja fail dan sejarah terkumpul, dan sesi kerja yang aktif boleh mencecah jutaan token, dengan kebanyakannya dihidangkan daripada cache pada satu persepuluh kadar asas. Sebagai penentukuran, angka perusahaan yang diterbitkan oleh Anthropic setakat Julai 2026 adalah purata sekitar $13 bagi setiap pembangun untuk setiap hari aktif, dengan 90% pengguna di bawah $30. Jalankan /usage dalam sesi anda sendiri; memerhatikannya selama lima minit adalah lebih baik daripada sebarang purata yang diterbitkan.

Adakah token pemikiran (thinking tokens) dikenakan bayaran walaupun saya tidak dapat melihatnya?

Ya. Token pemikiran dibilkan sebagai token output, iaitu kadar yang mahal, dan dikira terhadap max_tokens. Model semasa mengenakan bayaran untuknya walaupun antara muka tidak memaparkan ringkasan penaakulan tersebut. Jika respons terpotong dengan stop_reason: "max_tokens" sebelum jawapan yang kelihatan selesai, kemungkinan besar proses pemikiran telah menghabiskan bajet tersebut. Dalam Claude Code, rendahkan tahap usaha dengan /effort untuk tugasan yang tidak memerlukan penaakulan mendalam.

Mengapa sesi Claude Code yang panjang menjadi lebih mahal bagi setiap mesej?

Kerana API adalah tanpa status (stateless): setiap pusingan menghantar semula keseluruhan perbualan, setiap fail yang dibaca, hasil alat, dan pertukaran terdahulu sebagai input yang dibilkan. Oleh itu, pusingan 50 membawa pusingan 1 hingga 49 sebagai beban. Pengecaman prompt (prompt caching) menghidangkan awalan yang berulang pada kira-kira satu persepuluh harga input asas, tetapi awalan itu sendiri terus berkembang, dan sebarang jurang melahu yang melepasi TTL cache akan menukarkan pusingan seterusnya menjadi penulisan semula harga penuh. /compact mengecilkan sejarah; /clear menetapkan semula sejarah tersebut.

Bagaimanakah cara saya menyemak penggunaan token dan kos Claude saya?

Dalam Claude Code, /usage memaparkan statistik token sesi, anggaran kos tempatan, dan bar had pelan bagi langganan (/cost ialah alias); /context menunjukkan perkara yang memenuhi tetingkap tersebut. Untuk bil API yang rasmi, gunakan halaman penggunaan dalam Claude Console. Dalam kod anda sendiri, baca response.usage; menjumlahkan input_tokens, cache_creation_input_tokens, dan cache_read_input_tokens memberikan saiz prompt yang sebenar, dan buat anggaran lebih awal dengan titik akhir count_tokens, jangan sekali-kali menggunakan tiktoken.