SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-29

Apa Itu Token Claude dan Cara Menghitung Biaya Penggunaan

Pelajari cara kerja token Claude yang setara dengan 3,5 karakter. Artikel ini menjelaskan mengapa sesi Claude Code bisa mencapai 80.000 token dan dampak jeda waktu idle.

Apa itu token di Claude?

Token adalah unit teks yang dibaca dan ditulis oleh Claude: sebuah fragmen kata, kira-kira 3,5 karakter bahasa Inggris. Angka tersebut berasal dari glosarium resmi Anthropic, dan jumlahnya mencapai lebih dari satu token per kata jika spasi dan tanda baca dihitung, sehingga seribu kata prosa biasanya berjumlah lebih dari 1.300 token. Kode program memiliki bobot lebih besar per baris: kurung kurawal, operator, garis bawah, dan indentasi terbagi menjadi lebih banyak token per karakter dibandingkan bahasa Inggris, dan file sumber sepanjang beberapa ratus baris biasanya bernilai beberapa ribu token. File sepanjang 2.000 baris yang diputuskan untuk dibaca oleh agen akan memakan biaya lima digit token sebelum ada satu baris kode baru yang ditulis.

Dua hal mengenai tokenizer sering kali membingungkan pengguna. Pertama, tokenizer bersifat spesifik terhadap model. Per Juli 2026, Opus 4.7 ke atas, Sonnet 5, dan Fable 5 menggunakan tokenizer yang lebih baru yang menghasilkan sekitar 30% lebih banyak token untuk teks yang sama dibandingkan model Claude sebelumnya (peningkatan tepatnya bervariasi tergantung konten), yang mengubah anggaran token Anda meskipun harga per token tidak naik bersamanya. Kedua, tiktoken, pustaka yang sering dirujuk oleh setiap postingan blog, adalah tokenizer milik OpenAI dan memberikan perhitungan yang lebih rendah sekitar 15–20% untuk teks biasa dibandingkan Claude, dan lebih besar lagi untuk kode. Satu-satunya perhitungan yang dapat dipercaya adalah endpoint count_tokens, yang dibahas di bawah ini.

Mengapa sesi coding Anda memakan biaya tertentu

Setiap tagihan Claude, baik itu faktur API maupun batas langganan, ditentukan oleh satu metrik: token masuk dan token keluar. Halaman harga membuatnya terlihat sederhana: sekian dolar per satu juta token input, dan sekian per satu juta output. Hal yang tidak dijelaskan adalah bahwa dalam sesi coding berbasis agen, sisi input berjalan jauh lebih intens daripada yang diperkirakan, karena seluruh percakapan dikirim ulang pada setiap giliran. Saya telah menjual infrastruktur berbasis meteran selama lima belas tahun, dan token adalah meteran pertama yang saya temui di mana sebagian besar pelanggan benar-benar tidak tahu apa yang menyebabkannya membengkak. Ini adalah pelajaran membaca meteran: apa yang dihitung sebagai input dan output dalam sesi agen, mengapa loop pengiriman ulang sangat mahal, mengapa prompt caching mengubah perhitungan, dan tuas mana yang benar-benar memengaruhi angka tersebut.

Semuanya adalah input: apa yang sebenarnya dihitung oleh meteran

Banyak orang berasumsi bahwa mereka membayar untuk kode yang ditulis Claude. Dalam sesi agen, itu hanyalah poin kecil dalam tagihan. Token input, dengan tarif yang lebih murah namun volume yang jauh lebih besar, mencakup:

  • System prompt. Instruksi harness Claude Code sendiri, ditambah CLAUDE.md dan file memori Anda, dimuat saat sesi dimulai dan ada di setiap permintaan setelahnya.
  • Definisi tool. Setiap skema tool yang dapat dipanggil oleh agen. Setiap MCP server yang Anda hubungkan menambah overhead tetap ini, meskipun Claude Code sekarang menunda definisi lengkap tool MCP secara default, sehingga hanya nama tool yang berada dalam konteks sampai tool tersebut pertama kali digunakan, yang mengurangi namun tidak menghilangkan biaya.
  • Setiap file yang dibaca agen. Read dari file sumber memasukkan seluruh isi file ke dalam konteks, dan file tersebut tetap berada di sana.
  • Setiap hasil tool. Hasil pengujian, output grep, luapan terminal, log build, semuanya kembali sebagai token input. Rangkaian pengujian yang gagal dan mencetak 8.000 baris baru saja menagih Anda untuk biaya setara sebuah buku kecil.
  • Seluruh percakapan sejauh ini, dikirim ulang pada setiap giliran. Poin ini layak mendapatkan bagiannya sendiri.

Pengiriman ulang tanpa biaya

Claude API bersifat stateless. API ini tidak mengingat sesi Anda di antara permintaan, tidak ada yang mengingatnya. Jadi pada giliran ke-2, klien mengirimkan giliran ke-1 ditambah responsnya serta pesan baru Anda. Pada giliran ke-50, klien mengirim ulang giliran ke-1 sampai ke-49, setiap file yang dibaca, setiap hasil tool, setiap diff, ditambah giliran ke-50. Model membaca ulang seluruh transkrip setiap saat, dan setiap token yang dibaca ulang tersebut ditagihkan sebagai input.

Konsekuensinya: biaya per giliran tumbuh secara linear seiring panjangnya sesi, dan total biaya sesi tumbuh secara kuadratik. Sebuah pesan yang menghabiskan setengah sen pada giliran ke-3 bisa berharga dua puluh kali lipat pada giliran ke-60 untuk pertanyaan satu baris yang sama, karena pesan tersebut membawa beban enam puluh giliran. Ini adalah satu-satunya fakta yang menjelaskan sebagian besar tiket "mengapa tagihan saya begitu tinggi", dan ini bukan keunikan Claude; setiap produk LLM yang terasa memiliki state sebenarnya adalah API stateless dengan loop pengiriman ulang di bawahnya.

Output: apa yang Anda lihat, ditambah proses berpikir yang tidak terlihat

Token output adalah bagian yang mahal, dengan tarif lima kali lipat dari tarif input di seluruh jajaran model saat ini ($5/$25 pada Opus 4.8, $3/$15 pada Sonnet 5, $1/$5 pada Haiku 4.5, per Juli 2026). Output mencakup teks dan kode yang dihasilkan Claude, serta token berpikir: penalaran internal yang dilakukan model sebelum menjawab. Dua fakta penting di sini. Proses berpikir ditagih dengan tarif output dan dihitung terhadap max_tokens, respons API yang terputus dengan stop_reason: "max_tokens" dan jawaban yang terpotong sering kali berarti proses berpikir telah menghabiskan anggaran sebelum jawabannya selesai. Pada model saat ini, ringkasan penalaran mungkin tidak ditampilkan sama sekali; Opus 4.8, Sonnet 5, dan Fable 5 menyembunyikannya secara default, namun proses berpikir tetap terjadi dan tetap ditagihkan. Sesuatu yang tidak terlihat bukan berarti gratis.

Claude Code mengaktifkan extended thinking secara default karena fitur ini terbukti meningkatkan kualitas pekerjaan multi-langkah secara terukur, dan anggaran default dapat mencapai puluhan ribu token per permintaan. Untuk tugas yang lebih sederhana, Anda dapat menguranginya: turunkan tingkat upaya dengan /effort atau di /model, atau sesuaikan pengaturan berpikir di /config. Ini adalah tuas kendali biaya yang nyata, bukan sekadar mitos.

Prompt caching mengubah perhitungan

Prompt caching adalah alasan mengapa loop pengiriman ulang tidak membuat semua orang bangkrut. API dapat menyimpan cache awalan stabil dari prompt, system prompt, definisi tool, riwayat percakapan, dan pada permintaan berikutnya menyajikannya dengan harga yang jauh lebih murah. Per Juli 2026, pengalinya adalah: penulisan cache memakan biaya 1,25× dari tarif input dasar (2× untuk varian 1 jam), dan pembacaan cache memakan biaya 0,1×. Penulisan adalah biaya premium; pembacaan adalah diskon 90%. Satu kali pembacaan saja sudah lebih dari cukup untuk menutupi biaya premium penulisan 5 menit.

Claude Code mengelola caching untuk Anda, dan dalam sesi yang sehat, hampir seluruh pengiriman ulang yang besar tersebut disajikan dari cache. Namun, cache default hanya bertahan selama lima menit sejak penggunaan terakhir. Jika Anda pergi untuk minum kopi yang cukup lama, kembali, lalu mengirim pesan, cache tersebut telah kedaluwarsa, dan seluruh awalan yang terakumulasi akan ditulis ulang pada 1,25×, bukan dibaca pada 0,1×. Pada sesi 150K-token, satu giliran dingin tersebut memakan biaya lebih besar daripada belasan giliran hangat. Ini adalah hasil yang berlawanan dengan intuisi yang perlu dipahami: ritme diam-lalu-lanjut bisa memakan biaya lebih mahal daripada bekerja terus-menerus, karena setiap jeda diam yang melewati TTL mengubah giliran Anda berikutnya dari pembacaan murah menjadi penulisan ulang yang mahal. Bekerjalah dalam sesi yang intens; jangan mencicil sesi besar dengan satu pesan setiap sepuluh menit.

Jika Anda memanggil API dari aplikasi Anda sendiri di VPS, Anda tidak mendapatkan ini secara gratis, dan kesalahan klasik yang sering terjadi adalah menyisipkan timestamp atau request ID ke dalam system prompt, yang mengubah byte awalan pada setiap permintaan dan secara diam-diam menonaktifkan caching. Indikatornya adalah usage.cache_read_input_tokens yang tetap berada di angka nol pada panggilan yang terlihat identik.

Rumus dan contoh pengerjaan

Abaikan siapa pun yang menyebut harga sesi secara flat sebesar $X. Biaya sesi bervariasi hingga dua orde besaran. Yang berlaku adalah rumus berikut:

turn cost = (uncached input      x base input price)
          + (cache writes        x 1.25 x base input price)
          + (cache reads         x 0.10 x base input price)
          + (output incl. thinking x output price)

session cost = sum over all turns

Contoh pengerjaan pada Claude Opus 4.8, yang per Juli 2026 berharga $5 per juta token input dan $25 per juta token output. Sebuah giliran (turn) di tengah sesi dengan 80.000 token konteks terakumulasi: 75.000 dibaca dari cache, 3.000 ditulis baru, 2.000 input segar tanpa cache, dan 1.500 token output termasuk proses berpikir.

  • Pembacaan cache: 75.000 × $0,50/J = $0,0375
  • Penulisan cache: 3.000 × $6,25/J = $0,019
  • Input tanpa cache: 2.000 × $5/J = $0,010
  • Output: 1.500 × $25/J = $0,0375

Sekitar $0,10 untuk satu giliran; lima puluh giliran serupa, sekitar $5. Sekarang, giliran yang sama setelah cache kedaluwarsa: seluruh 80.000 token ditulis ulang dengan harga $6,25/J menjadi $0,50 sebelum output, kira-kira lima kali lipat dari giliran dengan cache aktif untuk pekerjaan yang identik. Kesenjangan itulah inti dari caching dalam satu angka. Empat baris yang sama juga merupakan satu-satunya cara jujur untuk membandingkan vendor, karena harga yang tertera mengabaikan pembacaan cache dan proses berpikir sepenuhnya, dan menjalankannya pada tiga pekerjaan nyata akan menunjukkan di mana tagihan Claude berada di atas atau di bawah tagihan OpenAI.

Jika Anda ingin memahami unit penagihan itu sendiri alih-alih satu giliran, berapa nilai satu juta token dalam halaman, file, dan dolar menjalankan aritmatika yang sama satu tingkat lebih tinggi. Untuk kalibrasi alih-alih prediksi: angka yang dipublikasikan Anthropic untuk deployment Claude Code perusahaan, per Juli 2026, rata-rata sekitar $13 per pengembang per hari aktif, $150–250 per bulan, dengan 90% pengguna tetap di bawah $30 per hari. Hasil yang Anda dapatkan adalah fungsi dari pilihan model, kebersihan sesi, dan ukuran basis kode, itulah sebabnya tuas di bawah ini penting.

Melihat penggunaan Anda sendiri

Di Claude Code, perintahnya adalah /usage (/cost tetap berfungsi, ini adalah alias). Blok Sesi di bagian atas menampilkan statistik token dan estimasi biaya yang dihitung secara lokal untuk sesi saat ini; pada paket langganan, layar yang sama menampilkan bilah batas paket Anda serta rincian yang mengaitkan penggunaan terbaru dengan skill, sub-agen, plugin, dan server MCP individual. Untuk penagihan resmi pada akun API, halaman penggunaan di Claude Console adalah sumber kebenaran, angka di CLI hanyalah estimasi. /context menggambar kisi berwarna dari apa yang mengisi jendela konteks, prompt sistem, alat, definisi MCP, file, riwayat, dan merupakan cara tercepat untuk menemukan CLAUDE.md yang membengkak atau server MCP yang terlalu banyak mengirim data; gunakan all untuk memperluas rincian lengkap per item.

Dari API, setiap respons memberi tahu Anda dengan tepat apa yang terjadi:

response = client.messages.create(model="claude-sonnet-5", max_tokens=2048,
                                  messages=messages)
u = response.usage
total_prompt = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens
print(f"uncached={u.input_tokens} written={u.cache_creation_input_tokens} "
      f"read={u.cache_read_input_tokens} output={u.output_tokens}")

Perhatikan bahwa input_tokens hanyalah sisa yang tidak di-cache, ukuran prompt yang sebenarnya adalah jumlah dari ketiga kolom input. Agen yang berjalan selama satu jam dengan menampilkan input_tokens: 4000 tidaklah murah; 200.000 token lainnya disajikan dari cache. Untuk melakukan estimasi sebelum Anda mengirim, gunakan endpoint penghitungan token, pemanggilannya gratis, memiliki batas rate sendiri, dan menghitung dengan tokenizer dari model mana pun yang Anda sebutkan (anggap hasilnya sebagai estimasi yang mendekati; penagihan mencerminkan permintaan yang sebenarnya):

count = client.messages.count_tokens(model="claude-sonnet-5",
                                     messages=[{"role": "user", "content": big_file}])
print(count.input_tokens)

Jangan pernah tiktoken, karena alasan di atas.

Paket langganan versus bayar sesuai pemakaian

Mekanisme dalam panduan ini identik di mana pun; hanya metode pembayarannya yang berbeda. Dengan API key, Anthropic menagih biaya secara bayar sesuai pemakaian (pay-as-you-go), per token, sesuai tarif yang dipublikasikan; setiap angka di atas adalah uang sungguhan. Meteran tersebut mulai berjalan lebih cepat dari perkiraan kebanyakan orang karena tidak ada tingkat gratis (free tier) sebagai cadangan, hanya kredit kecil saat pendaftaran dan segelintir endpoint yang tidak membebankan biaya, yang merupakan apa yang sebenarnya didapatkan akun API baru sebelum Anda memasukkan kartu kredit. Pada langganan Claude (Pro, Max, Team, Enterprise), penggunaan Claude Code justru mengambil jatah dari kuota paket Anda: per Juli 2026, kuota tersebut berupa jendela sesi lima jam yang bergulir ditambah jendela mingguan, yang digunakan bersama antar model dan dengan obrolan claude.ai, dan angka /usage dolar hanyalah informasi, bukan tagihan. Jika jendela habis, Anda akan melihat "You've hit your session limit" atau "You've hit your weekly limit" beserta waktu reset, dan mengganti model dengan /model tidak akan memulihkan akses karena jendela tersebut digunakan bersama antar model. Jendela tersebut mengikuti akun, bukan klien tempat Anda berada, yang perlu diketahui jika Anda masih mencari tahu apa yang berjalan secara native di Linux dan paket mana yang mencakup setiap antarmuka. Jendela mana yang sebenarnya telah habis menentukan berapa lama waktu tunggu dan apa yang sebaiknya dilakukan sementara itu, jadi ada baiknya mengetahui opsi Anda saat mencapai batas di tengah tugas. Paket dapat mengaktifkan kredit penggunaan secara opsional, yang dikelola dengan /usage-credits, untuk membeli penggunaan melebihi batas atas. Saya sengaja tidak mencantumkan kuota paket: itu adalah angka yang paling fluktuatif dalam topik ini, jadi periksa claude.com/pricing dan bar /usage Anda sendiri sebagai gantinya. Mekanisme token tetap penting dalam langganan; sesi yang boros akan menghabiskan jendela Anda sama seperti menghabiskan dolar. Untuk sisi langganan, lihat paket Claude mana yang sesuai dengan penggunaan Anda.

Tuas yang benar-benar efektif

  • Batasi cakupan baca agen. "Perbaiki bug validasi di auth.py" hanya membaca satu file; "tingkatkan basis kode ini" membaca empat puluh file. Jaga agar CLAUDE.md tetap ringkas karena dimuat ke dalam setiap sesi, jadi simpan hanya hal-hal penting dan pindahkan instruksi spesifik alur kerja ke dalam skill yang dimuat sesuai permintaan.
  • Jelas dan padat. /clear di antara tugas yang tidak terkait, konteks lama akan dikirim ulang dan ditagihkan kembali pada setiap pesan berikutnya. Dalam satu tugas panjang, /compact Focus on the failing tests and the diff meringkas riwayat dan menjaga Anda agar tidak terjebak dalam kurva kuadratik.
  • Sesuaikan ukuran model. Sonnet menangani sebagian besar pengodean dengan harga $2/$10 per juta token pada harga perkenalan per Juli 2026 (harga normal $3/$15, dibandingkan dengan Opus seharga $5/$25), dan Haiku seharga $1/$5 adalah alat yang tepat untuk pekerjaan sub-agen mekanis seperti triase log. Fable 5 berada di ujung spektrum lainnya dengan harga $10/$50, dua kali lipat dari Opus di kedua sisi meteran, jadi ada baiknya mengetahui pekerjaan mana yang benar-benar membenarkan tarif tersebut sebelum Anda membiarkannya terpilih untuk pekerjaan rutin. /model dapat beralih di tengah sesi.
  • Pra-filter output yang bertele-tele. Hook yang melakukan grep pada hasil pengujian untuk hanya menampilkan kegagalan sebelum Claude melihatnya akan mengubah 20.000 token hasil alat menjadi 300, dan ini berlaku pada setiap pengiriman ulang giliran tersebut di masa mendatang.
  • Kelompokkan (batch) apa yang tidak interaktif. Untuk pipeline API, klasifikasi, tinjauan massal, dan pekerjaan malam hari Anda sendiri, Batches API menjalankan model yang sama dengan diskon 50% sebagai ganti pengiriman asinkron.
  • Perhatikan jam cache. Bekerjalah dalam sesi yang berkelanjutan. Sesi Claude Code di tmux pada VPS yang terputus tidak memakan biaya saat idle, token hanya dihabiskan saat giliran berjalan, tetapi waktu idle akan menghilangkan cache yang hangat, dan giliran berikutnya akan membayar biaya penulisan ulang.

FAQ

Berapa banyak token yang digunakan dalam sesi coding di Claude Code?

Tidak ada angka tetap. Satu giliran di tengah sesi biasanya membawa puluhan ribu token prompt setelah file dan riwayat terakumulasi, dan sesi kerja yang panjang bisa mencapai jutaan token, di mana sebagian besar dilayani dari cache dengan tarif sepersepuluh dari tarif dasar. Sebagai kalibrasi, angka perusahaan yang dipublikasikan Anthropic per Juli 2026 rata-rata sekitar $13 per pengembang per hari aktif, dengan 90% pengguna di bawah $30. Jalankan /usage dalam sesi Anda sendiri; lima menit mengamatinya lebih akurat daripada rata-rata yang dipublikasikan.

Apakah token berpikir (thinking tokens) tetap berbayar meskipun saya tidak bisa melihatnya?

Ya. Token berpikir ditagihkan sebagai token output, yaitu tarif yang lebih mahal, dan dihitung terhadap max_tokens. Model saat ini menagihnya meskipun antarmuka menyembunyikan ringkasan penalaran dari tampilan. Jika respons terpotong dengan stop_reason: "max_tokens" sebelum jawaban yang terlihat selesai, kemungkinan besar proses berpikir telah menghabiskan anggaran. Di Claude Code, turunkan tingkat upaya dengan /effort untuk tugas yang tidak memerlukan penalaran mendalam.

Mengapa sesi Claude Code yang panjang menjadi lebih mahal per pesan?

Karena API bersifat stateless: setiap giliran mengirim ulang seluruh percakapan, setiap file yang dibaca, hasil tool, dan pertukaran sebelumnya sebagai input yang ditagihkan. Jadi, giliran ke-50 membawa beban giliran 1 hingga 49. Prompt caching melayani awalan yang berulang dengan harga sekitar sepersepuluh dari harga input dasar, tetapi awalan itu sendiri terus bertambah, dan jeda tidak aktif yang melewati TTL cache akan mengubah giliran berikutnya menjadi penulisan ulang dengan harga penuh. /compact memperkecil riwayat; /clear meresetnya.

Bagaimana cara memeriksa penggunaan token dan biaya Claude saya?

Di Claude Code, /usage menampilkan statistik token sesi, estimasi biaya lokal, dan bilah batas paket pada langganan (/cost adalah aliasnya); /context menunjukkan apa yang memenuhi jendela konteks. Untuk penagihan API yang otoritatif, gunakan halaman penggunaan di Claude Console. Dalam kode Anda sendiri, baca response.usage, menjumlahkan input_tokens, cache_creation_input_tokens, dan cache_read_input_tokens akan memberikan ukuran prompt yang sebenarnya, dan lakukan estimasi sebelumnya dengan endpoint count_tokens, jangan pernah dengan tiktoken.