SSD Nodes Learn 🎉 VPS mulai $5.50/bln
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-14

Apakah Memori Claude Dikenai Biaya Tambahan?

Anthropic tidak menetapkan harga token memori. Teks yang diingat dikirim ulang sebagai token input, sehingga biaya bergantung pada jumlah token dan prompt caching.

Apakah fitur memori Claude dikenai biaya tambahan?

Fitur memori Claude tidak memiliki biaya tersendiri. Tarif yang dipublikasikan Anthropic dihitung per juta token input dan per juta token output, dengan tarif tambahan untuk prompt caching. Tidak ada tarif yang disebut sebagai token memori. Penyimpanan memori itu sendiri tidak dikenai biaya pada Claude API (antarmuka pemrograman aplikasi), karena memory tool berjalan di sisi klien dan file disimpan pada penyimpanan yang Anda miliki.

Memori tetap memengaruhi tagihan karena fakta yang diingat hanya mengubah jawaban jika fakta tersebut berada di dalam request yang dibaca Claude. Mengingat berarti mengirim ulang. Teks tersebut diterima sebagai token input dan dikenai tarif input model biasa. Ada dua hal yang menentukan biayanya: jumlah token dari teks yang diingat dan dikirim ulang pada setiap giliran, serta apakah teks yang dikirim ulang tersebut dapat dilayani dari prompt cache.

Pada langganan Pro atau Max, Anda tidak ditagih per token, sehingga memori mengurangi alokasi penggunaan, bukan uang Anda. Mekanismenya tetap sama. Hanya satuannya yang berbeda. Alokasi tersebut terbatas. Karena itu, pelajari biaya Claude Pro dan batas yang dapat menghentikan penggunaan Anda sebelum menentukan jumlah memori yang harus dibawa pada setiap giliran. Claude Enterprise berbeda lagi karena mengukur setiap token dengan tarif API di luar harga seat, sehingga blok memori yang terlalu besar kembali menjadi biaya, bukan pengurangan alokasi. Jika pemangkasan memori membuat penggunaan Anda tetap nyaman di bawah batas paket yang lebih kecil, beralih dari Max ke Pro adalah langkah lanjutan yang patut dipertimbangkan. Perubahan tersebut berlaku pada akhir periode yang sudah Anda bayar. Jika perbandingan yang Anda pertimbangkan sebenarnya mencakup beberapa provider, bukan hanya tingkatan Anthropic, mulailah dari perbandingan paket Claude dan ChatGPT berdasarkan harga saat ini.

Apa yang dimaksud dengan "memory" pada setiap antarmuka Claude

Tiga produk terpisah menggunakan istilah ini, dan kekeliruan dalam membedakannya adalah alasan utama pertanyaan ini terasa membingungkan.

Memory tool pada Claude API. Anda menambahkan satu entri ke array tools dan mengimplementasikan operasi file dalam kode Anda sendiri.

{"type": "memory_20250818", "name": "memory"}

Per Agustus 2026, tool ini tersedia secara umum pada Messages API tanpa header beta, untuk model Claude 4 dan yang lebih baru. Tool ini berjalan di sisi klien: Claude meminta operasi seperti view /memories, handler Anda menjalankannya pada storage yang Anda kendalikan, lalu Anda mengembalikan hasilnya dalam blok tool_result. Anthropic tidak pernah menyimpan file tersebut, sehingga tidak ada biaya storage yang perlu diteruskan kepada Anda. Anda membayar round trip sebagai gantinya. Definisi tool dikirim dalam setiap request, dan konten file yang dikembalikan tetap berada dalam percakapan sejak saat itu.

Anthropic menerbitkan bagian tetap dari overhead tersebut. Pada Claude Opus 5 dengan pilihan tool auto, system prompt untuk penggunaan tool berukuran 286 token, sebagaimana didokumentasikan pada Agustus 2026. Biaya ini dikenakan satu kali per request setiap kali ada tool, baik memory maupun tool lainnya.

Claude Code. Dua mekanisme dimuat pada awal setiap sesi. File CLAUDE.md berisi instruksi yang Anda tulis. Auto memory berisi catatan yang ditulis Claude untuk dirinya sendiri, di bawah ~/.claude/projects/<project>/memory/. Hanya 200 baris pertama atau 25KB dari MEMORY.md yang dimuat, mana pun batas yang tercapai lebih dahulu, sedangkan file topik di sebelahnya dibaca saat diperlukan, bukan saat startup. Semua yang dimuat saat startup menjadi bagian dari prefix yang dibawa oleh setiap request berikutnya dalam sesi tersebut. Cara Claude Code mengingat memory antar-sesi membahas urutan pemuatan file per file.

Claude di web. Di claude.ai, memory adalah kumpulan entri yang ditulis dan diperbarui Claude saat Anda mengobrol, dengan ruang memory terpisah untuk setiap project. Settings > Memory mencantumkan hal-hal yang disimpan, dan toggle di sana menyediakan opsi Pause memory atau Reset memory. Antarmuka ini ditagihkan melalui subscription, sehingga penggunaan memory di sini mengurangi batas penggunaan.

Mengapa teks yang diingat ditagihkan sebagai token input

Messages API bersifat stateless. API ini tidak menyimpan apa pun di antara panggilan, sehingga client mengirim seluruh percakapan pada setiap giliran dan model membacanya kembali. Memory tidak dikecualikan dari aturan tersebut. Memory adalah satu blok teks tambahan dalam request yang sama.

Pembagian ini terlihat pada objek usage dalam setiap response.

"usage": {
  "input_tokens": 412,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 18240,
  "output_tokens": 236
}

input_tokens hanya menghitung token yang tidak dibaca dari cache dan tidak digunakan untuk membuat cache. Dalam praktiknya, ini berarti token setelah cache breakpoint terakhir. Total input untuk request tersebut adalah cache_read_input_tokens ditambah cache_creation_input_tokens dan input_tokens. File memory yang dibuka Claude tiga giliran sebelumnya tetap termasuk dalam total tersebut pada setiap giliran setelahnya. File itu masuk ke cache_read_input_tokens selama prefix yang di-cache masih berlaku, dan masuk ke input_tokens jika tidak. Teksnya sama, tetapi harganya sangat berbeda. Token input dan output memiliki harga yang berbeda, dan memory selalu masuk ke sisi input.

Di mana melihat angka ini dalam penggunaan Anda sendiri

Jangan mengambil angka dari postingan blog, termasuk yang ini. Ukur blok memori Anda sendiri. Penghitungan token gratis dan memiliki batas lajunya sendiri, sehingga pengukuran tidak memerlukan biaya.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{"role": "user", "content": "Hello, Claude"}]
  }'

Hasilnya berupa satu angka, misalnya { "input_tokens": 14 }. Jalankan sekali dengan teks memori Anda ditempelkan ke kolom system, lalu jalankan lagi tanpa teks tersebut. Selisihnya adalah biaya memori itu pada setiap giliran. Ada dua hal yang perlu diperhatikan. Jumlah tersebut merupakan perkiraan, dan token tambahan yang ditambahkan Anthropic untuk optimisasi sistemnya sendiri tidak ditagihkan kepada Anda. Hitung juga berdasarkan model yang benar-benar akan Anda jalankan, karena Claude 4.7 dan versi setelahnya menggunakan tokenizer yang lebih baru dan menghasilkan sekitar 30 persen lebih banyak token untuk teks yang sama.

Di dalam Claude Code, pertanyaan yang sama dapat dijawab tanpa curl sama sekali.

  • /context menampilkan hal yang sedang dimuat saat ini, termasuk file memori, sehingga Anda dapat melihat porsinya dalam context window sebelum mengetik apa pun.
  • /memory mencantumkan file CLAUDE.md Anda dan membuka folder auto memory.
  • /usage menampilkan total sesi, termasuk cache reads dan cache writes.
  • Status line dapat menampilkan penggunaan context window secara terus-menerus, sehingga pertumbuhannya terlihat saat terjadi.

Blok sesi /usage terlihat seperti ini:

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Baca baris terakhir dengan cermat. Angka cache read 940.0k adalah seluruh percakapan, termasuk memori, yang dikirim kembali pada setiap giliran dengan tarif cache. Angka input 1.2k hanya mencakup bagian yang baru. Claude Code menghitung jumlah dalam dolar tersebut secara lokal berdasarkan harga daftar, sehingga diskon yang Anda miliki diabaikan dan hasilnya dapat berbeda dari invoice Anda. Usage page di Claude Console adalah angka yang menjadi acuan.

Selanjutnya, jalankan perbandingan secara langsung. Ajukan pertanyaan pembuka yang sama dalam dua sesi baru, satu sesi normal dan satu sesi dengan auto memory dinonaktifkan.

CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claude

Jalankan /context di masing-masing sesi, lalu bandingkan entri memory files. Selisihnya adalah biaya memori yang telah terakumulasi pada awal setiap sesi, sebelum pekerjaan apa pun dimulai. Uraian lengkap tentang penggunaan token Claude Code layak dibaca bersama kedua angka tersebut.

Berapa biaya memutar ulang memori per satu juta token?

Prompt caching adalah alasan blok memori yang sama dapat berbiaya sepuluh kali lebih mahal pada satu giliran dibandingkan giliran lainnya. Anthropic memublikasikan tarif cache sebagai kelipatan dari harga input dasar setiap model, sehingga hubungan ini tetap berlaku meskipun harga dalam dolar berubah.

ChartAnthropic's published prompt caching rates, as a multiple of base input price
The data behind this chart
[
  {
    "label": "Base input",
    "price_multiple": 1
  },
  {
    "label": "5 minute cache write",
    "price_multiple": 1.25
  },
  {
    "label": "1 hour cache write",
    "price_multiple": 2
  },
  {
    "label": "Cache read",
    "price_multiple": 0.1
  }
]

Pembacaan cache dikenai biaya 0.1 kali harga input dasar. Penulisan entri dengan masa berlaku 5 menit dikenai biaya 1.25 kali harga dasar, sedangkan masa berlaku 1 jam dikenai biaya 2 kali harga dasar. Anthropic menyatakan titik impasnya secara jelas: caching mulai menguntungkan setelah satu pembacaan cache pada durasi 5 menit, atau setelah dua pembacaan cache pada durasi 1 jam. Titik impas prompt caching adalah perhitungan yang harus dilakukan sebelum Anda menentukan lokasi memori.

Kelipatan tersebut mengubah jumlah pemutaran ulang menjadi perhitungan aritmetika. Blok berikutnya merupakan perhitungan berdasarkan kelipatan yang dipublikasikan di atas, bukan pengukuran dari workload yang sedang berjalan. Blok ini menghitung biaya satu blok memori dengan tiga cara selama sesi 100 giliran, yang dinyatakan sebagai jumlah ekuivalen token yang ditagihkan pada tarif input dasar biasa.

ChartA memory block over 100 turns, expressed as base-rate input tokens
The data behind this chart
[
  {
    "label": "4,000 tokens, never cached",
    "base_rate_equivalent_tokens": "400,000"
  },
  {
    "label": "4,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "44,600"
  },
  {
    "label": "1,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "11,150"
  }
]

Blok memori 4,000 token yang tidak pernah mencapai cache selama 100 giliran ditagihkan seperti 400,000 token pada tarif dasar. Blok yang sama dengan satu penulisan cache 5 menit dan 99 pembacaan cache ditagihkan seperti 44,600. Pangkas ukurannya menjadi seperempat dan tetap gunakan caching, maka biayanya setara dengan 11,150. Fitur tersebut tidak berubah pada 3 baris itu. Yang berubah hanya perilaku pemutaran ulangnya. Angka tersebut masih berupa jumlah token, bukan nilai uang, dan mengubah jumlah token menjadi angka pada tagihan bulanan Anda cukup dilakukan dengan satu perkalian menggunakan tarif per juta token model Anda. Tarif tersebut ditentukan oleh model yang Anda jalankan. Jadi, jika agent akan berjalan pada Claude Fable 5, mulailah dari tarif per juta token yang dipublikasikan dan jenis pekerjaan yang sesuai untuknya.

Baris kedua mengasumsikan setiap permintaan berikutnya dari 99 permintaan tersebut tiba ketika entri cache masih aktif. Asumsi inilah yang paling sering menyebabkan tagihan aktual berbeda dari perkiraan.

Mengapa pertanyaan yang sama menjadi lebih mahal setelah jeda?

Entri cache memiliki masa berlaku, dan penghitung waktunya dimulai saat permintaan menulis atau membaca entri tersebut. Nilai default-nya adalah 5 menit. Opsi 1 jam dikenai biaya penulisan 2x seperti yang ditunjukkan di atas. Di Claude Code, masa berlaku tersebut adalah satu jam pada subscription, lalu turun menjadi lima menit setelah Anda mulai menggunakan usage credits; pada API key atau cloud provider, nilai default-nya adalah lima menit. Pengaturan ENABLE_PROMPT_CACHING_1H=1 mempertahankan masa berlaku satu jam saat Anda menggunakan usage credits.

Jadi, pertanyaan satu baris yang diketik ke dalam session yang dibiarkan terbuka selama makan siang menjadi mahal karena entri cache kedaluwarsa saat Anda pergi. Seluruh prefix, termasuk memory, diproses ulang dengan base input rate dan ditulis kembali ke cache. Durasi jeda menentukan biaya tersebut.

Anda dapat mengonfirmasi hal ini, bukan sekadar mempercayainya. Pada paket Pro, Max, Team, atau Enterprise, rincian /usage menandai perilaku yang bertanggung jawab atas 10 persen atau lebih dari penggunaan terbaru. Context yang panjang dan cache miss akan muncul di sana dengan nama masing-masing. Pada API, pantau cache_creation_input_tokens yang kembali naik hingga ukuran penuh prefix Anda pada permintaan pertama setelah periode tanpa aktivitas.

Hal yang secara diam-diam membatalkan cache

Prefiks yang di-cache memiliki urutan: tools, lalu system, kemudian messages. Perubahan pada satu tingkat akan membatalkan cache pada tingkat tersebut dan semua tingkat setelahnya. Mengedit definisi tool akan membuang seluruh cache. Mengedit system prompt akan membuang cache system dan messages.

Inilah jebakan bagi siapa pun yang menyimpan memori di system prompt lalu menulis ulang prompt tersebut saat agent belajar. Setiap penulisan ulang membuang salinan cache dari semua bagian setelahnya, sehingga request berikutnya harus menulis ulang seluruh bagian tersebut. Letakkan materi yang stabil di bagian depan dan jangan mengubahnya. Letakkan materi yang mudah berubah di bagian akhir daftar messages agar pembatalan cache tetap murah.

Ada kegagalan kedua yang lebih sulit terlihat. Setiap model memiliki prefiks minimum yang dapat di-cache: 512 token pada Claude Opus 5, 1,024 pada Claude Sonnet 5, dan 4,096 pada Claude Haiku 4.5, sebagaimana dipublikasikan pada Agustus 2026. Dokumentasi Anthropic menjelaskan dengan tegas apa yang terjadi jika jumlahnya kurang dari batas tersebut: "Setiap request untuk men-cache kurang dari jumlah token ini akan diproses tanpa caching, dan tidak ada error yang dikembalikan." Oleh karena itu, file memory kecil yang ditandai dengan cache_control tidak melakukan apa pun, secara diam-diam. Gejala yang dapat Anda lihat adalah cache_creation_input_tokens tetap bernilai 0, meskipun prompt Anda jelas berisi breakpoint.

Pangkas memori yang tidak lagi berguna

Setiap baris memori menggunakan token pada setiap giliran yang memuatnya. Karena itu, untuk setiap baris, tanyakan apakah baris tersebut baru-baru ini mengubah jawaban. Claude Code menetapkan batas yang jelas. Usahakan agar CLAUDE.md berisi kurang dari 200 baris, karena file yang lebih panjang menggunakan lebih banyak konteks dan mengurangi keandalan Claude dalam mengikutinya. MEMORY.md dibatasi hingga 200 baris pertama atau 25KB saat dimuat. Apa pun setelah batas tersebut akan dihapus saat sesi berikutnya dimulai. Karena itu, indeks yang terlalu besar menggunakan token tanpa memberikan informasi tambahan.

Dua kebiasaan membantu menjaga ukurannya tetap kecil. Pindahkan detail dari indeks ke file topik. Claude akan membaca file tersebut sesuai kebutuhan, bukan saat startup. Pindahkan instruksi alur kerja dari CLAUDE.md ke skills. Instruksi tersebut hanya dimuat saat dipanggil. Untuk file memori yang sudah diawali frontmatter, Claude Code mencatat waktu penulisan dalam field modified sebagai timestamp ISO 8601 pada version 2.1.214 atau yang lebih baru. Timestamp tersebut adalah cara tercepat untuk menemukan fakta yang sudah tidak berlaku. Pangkas memori agen yang sudah tidak berlaku menjelaskan proses peninjauan ini secara lebih mendalam.

Saat mengambil data lebih efisien daripada memuat semuanya ke dalam konteks

Memory tool digunakan untuk mengambil data tepat saat dibutuhkan. Alih-alih memuat semuanya sejak awal, agent mencatat informasi yang diperolehnya lalu membaca kembali file hanya ketika tugas memerlukannya. Hal ini mengubah perhitungannya, karena pembacaan file hanya membebankan token satu kali dan kemudian berada di dalam cached prefix, sedangkan blok yang selalu dimuat membebankan token pada setiap turn.

Aturan sederhananya dapat diturunkan dari dua chart di atas. Teks yang digunakan oleh hampir setiap turn sebaiknya berada di dalam stable cached prefix. Teks yang digunakan satu kali dari setiap dua puluh turn sebaiknya ditempatkan di balik pemanggilan view. Titik impas berubah mengikuti jumlah replay, bukan berdasarkan biaya yang dikenakan Anthropic.

Pada API, Anda juga dapat membiarkan platform memangkas percakapan. Context editing menghapus hasil tool lama setelah percakapan melewati threshold yang Anda tetapkan.

{
  "edits": [
    {
      "type": "clear_tool_uses_20250919",
      "trigger": {"type": "input_tokens", "value": 30000},
      "keep": {"type": "tool_uses", "value": 3},
      "clear_at_least": {"type": "input_tokens", "value": 5000}
    }
  ]
}

Nilai defaultnya adalah trigger 100,000 input tokens dan 3 tool uses yang dipertahankan. Pahami interaksi dengan caching sebelum mengaktifkannya: penghapusan content membatalkan cached prefix pada titik penghapusan, sehingga Anda membayar cache write pada request berikutnya. Itulah fungsi clear_at_least. Fitur ini menunda penghapusan sampai penghematannya cukup besar untuk membenarkan write tersebut. Response melaporkan secara tepat apa yang terjadi melalui context_management, bersama cleared_tool_uses dan cleared_input_tokens, sehingga trade-off ini dapat diukur, bukan hanya bersifat teoretis. Mengelola context window di Claude Code menerapkan gagasan yang sama pada sesi coding.

Apa yang memiliki biaya tersendiri

Memory tidak memiliki biaya tersendiri, tetapi beberapa fitur memang memilikinya, dan Anda perlu mengetahui fitur mana saja. Berikut adalah tarif Claude API yang dipublikasikan per Agustus 2026. Beberapa operasi sama sekali tidak dikenai biaya, tetapi Claude API tidak memiliki free tier, hanya kredit kecil saat pendaftaran. Jadi, semua biaya di bawah ini merupakan pengeluaran nyata sejak permintaan pertama Anda.

  • Web search: $10 per 1,000 pencarian, ditambah biaya token biasa untuk seluruh hasil yang dimasukkan pencarian ke dalam context.
  • Code execution: 1,550 jam gratis per organisasi setiap bulan, kemudian $0.05 per jam untuk setiap container. Fitur ini gratis jika digunakan bersama web search atau web fetch.
  • Claude Managed Agents: runtime session seharga $0.08 per session-hour, di luar biaya token biasa.
  • Web fetch: tidak ada biaya tambahan, hanya biaya token untuk konten yang diambil.

Memory tidak tercantum pada satu pun biaya tersebut. Memory dihitung dalam jumlah input token Anda. Di sanalah Anda dapat mengukurnya, dan di sanalah pruning serta caching dapat menguranginya. Jika Anda menganggarkan agent yang berjalan tanpa pengawasan pada virtual private server (VPS), pengendalian biaya untuk AI agent pada VPS adalah hal berikutnya yang perlu diterapkan. Agent dengan file memory yang terus membesar tanpa pruning akan menjadi lebih mahal setiap minggu tanpa ada sistem yang melaporkannya.

FAQ

Apakah ada biaya terpisah untuk fitur memori Claude?

Tidak. Daftar harga Anthropic mencantumkan tarif per juta token input, per juta token output, dan pengali prompt caching, tanpa baris biaya untuk memori. Pada Claude API, memory tool berada di sisi klien, sehingga file disimpan pada storage yang sudah Anda bayar. Memori menambah token input, yang ditagihkan dengan tarif input normal model pada setiap giliran yang menyertakan token tersebut.

Apakah menonaktifkan memori membuat Claude lebih murah?

Jumlah token pada setiap request berkurang, sehingga biaya setiap request juga turun. Apakah hal ini menghemat biaya secara keseluruhan bergantung pada proses berikutnya. Jika Claude harus membaca ulang tiga file dan mengajukan dua pertanyaan untuk membangun kembali informasi yang sudah disimpan oleh memori, token tersebut dapat berbiaya lebih besar daripada memori. Ukur, jangan menebak: jalankan /context dalam satu session dengan auto memory aktif dan dalam session yang dimulai dengan CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, lalu bandingkan total token yang digunakan untuk tugas yang sama.

Mengapa penggunaan saya meningkat padahal saya tidak mengubah apa pun?

Penyebab yang paling umum adalah cache miss setelah jeda. Entri cache berlaku selama 5 menit secara default, atau satu jam jika menggunakan pengaturan extended. Karena itu, request pertama setelah jeda memproses ulang seluruh prefix dengan tarif input dasar dan menulisnya kembali. Penyebab umum kedua adalah perubahan pada prefix: mengubah definisi tool membatalkan seluruh cache, sedangkan mengubah system prompt membatalkan cache sistem dan pesan. Pada subscription plan, rincian /usage menjelaskan perilaku ini jika menyumbang 10 persen atau lebih dari penggunaan terbaru.

Sebaiknya memori ditempatkan di system prompt atau di balik pemanggilan tool?

Tempatkan memori di system prompt jika hampir setiap giliran menggunakannya, karena memori kemudian berada dalam prefix yang di-cache dan dikenai tarif pembacaan cache. Tempatkan memori di balik pemanggilan view jika hanya tugas tertentu yang memerlukannya, karena file yang dibaca satu kali hanya menimbulkan biaya token satu kali, bukan pada setiap giliran. Angka penentu adalah jumlah pemutaran ulang Anda, dan objek usage memberikan angka tersebut secara langsung.

Apakah fitur memori diperhitungkan dalam batas penggunaan subscription?

Ya, secara tidak langsung, karena batas subscription dikonsumsi oleh token yang dibawa setiap request. Dokumentasi bantuan Anthropic menyatakan bahwa percakapan yang lebih panjang dan memicu pengelolaan konteks otomatis akan mengonsumsi lebih banyak dari batas penggunaan Anda. Memori membuat setiap request sedikit lebih panjang, dan session yang panjang mengulang panjang tersebut pada setiap giliran. Cara kerja batas penggunaan Claude menjelaskan apa yang di-reset dan kapan.