SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-29

Apakah Memori Claude Dikenai Biaya Tambahan?

Memori Claude tidak memiliki tarif token khusus. Pelajari mengapa teks yang diingat tetap menambah token input, serta bagaimana prompt caching memengaruhi biaya API.

Apakah fitur memori Claude dikenai biaya tambahan?

Fitur memori Claude tidak memiliki biaya tersendiri. Tarif yang dipublikasikan Anthropic dihitung per juta token input dan per juta token output, dengan tarif tambahan untuk prompt caching. Tidak ada tarif yang disebut sebagai token memori. Penyimpanan memori itu sendiri tidak dikenai biaya pada Claude API (application programming interface), karena memory tool berjalan di sisi klien dan filenya disimpan pada storage yang Anda miliki.

Memori tetap memengaruhi tagihan karena fakta yang diingat hanya mengubah jawaban jika fakta tersebut berada di dalam request yang dibaca Claude. Mengingat berarti mengirim ulang. Teks itu diterima sebagai token input dan dikenai tarif input standar model. Dua hal menentukan biayanya: jumlah token dari teks yang diingat dan dikirim ulang pada setiap giliran, serta apakah teks yang dikirim ulang tersebut dapat dilayani dari prompt cache.

Pada subscription Pro atau Max, Anda tidak ditagih berdasarkan token. Memori menggunakan kuota penggunaan, bukan uang Anda. Mekanismenya tetap sama. Yang berubah hanya satuannya. Kuota tersebut terbatas. Karena itu, sebelum menentukan jumlah memori yang dibawa pada setiap giliran, pahami biaya Claude Pro dan kapan batasnya mulai membatasi Anda. Claude Enterprise memiliki model yang berbeda karena menghitung setiap token dengan tarif API di luar harga seat, sehingga blok memori yang terlalu besar kembali menjadi biaya uang, bukan penggunaan kuota. Jika pemangkasan memori membuat penggunaan Anda tetap jauh di bawah batas plan yang lebih kecil, beralih dari Max ke Pro merupakan langkah lanjutan yang layak dipertimbangkan. Perubahan tersebut berlaku pada akhir periode yang sudah Anda bayar. Jika perbandingan yang sedang Anda pertimbangkan sebenarnya mencakup beberapa provider, bukan hanya tier Anthropic, mulailah dari perbandingan plan Claude dan ChatGPT berdasarkan harga saat ini.

Arti “memory” pada setiap surface Claude

Tiga produk terpisah menggunakan istilah yang sama, dan kekeliruan dalam membedakannya adalah alasan utama pertanyaan ini terasa membingungkan.

Tool memory pada Claude API. Anda menambahkan satu entri ke array tools dan mengimplementasikan operasi file dalam kode Anda sendiri.

{"type": "memory_20250818", "name": "memory"}

Per Agustus 2026, tool ini tersedia secara umum pada Messages API tanpa header beta, pada model Claude 4 dan yang lebih baru. Tool ini berjalan di sisi klien: Claude meminta operasi seperti view /memories, handler Anda menjalankannya pada storage yang Anda kendalikan, lalu Anda mengembalikan hasilnya dalam blok tool_result. Anthropic tidak pernah menyimpan file tersebut, sehingga tidak ada biaya storage yang perlu diteruskan kepada Anda. Anda membayar round trip-nya. Definisi tool dikirim dalam setiap request, dan konten file yang dikembalikan tetap berada dalam conversation sejak saat itu.

Anthropic menerbitkan bagian overhead yang tetap. Pada Claude Opus 5 dengan pilihan tool auto, system prompt untuk penggunaan tool berukuran 286 token, sebagaimana didokumentasikan pada Agustus 2026. Biaya tersebut dikenakan satu kali per request setiap kali ada tool, baik memory maupun tool lainnya.

Claude Code. Dua mekanisme dimuat pada awal setiap session. File CLAUDE.md berisi instruksi yang Anda tulis. Auto memory berisi catatan yang ditulis Claude untuk dirinya sendiri, di bawah ~/.claude/projects/<project>/memory/. Hanya 200 baris pertama atau 25KB pertama dari MEMORY.md yang dimuat, bergantung pada batas mana yang tercapai lebih dahulu, sedangkan file topik di sebelahnya dibaca sesuai kebutuhan, bukan saat startup. Semua yang dimuat saat startup menjadi bagian dari prefix yang dibawa oleh setiap request berikutnya dalam session tersebut. Cara Claude Code mengingat memory antar-session membahas urutan pemuatan file demi file.

Claude di web. Di claude.ai, memory adalah kumpulan entri yang ditulis dan diperbarui Claude saat Anda mengobrol, dengan memory space terpisah untuk setiap project. Settings > Memory menampilkan hal yang disimpan, dan toggle di sana menyediakan opsi Pause memory atau Reset memory. Surface ini ditagihkan melalui subscription, sehingga memory di sini menggunakan batas penggunaan.

Mengapa teks yang diingat ditagihkan sebagai token input

Messages API bersifat stateless. API ini tidak menyimpan apa pun di antara panggilan, sehingga client Anda mengirim seluruh percakapan pada setiap giliran dan model membacanya kembali. Memori tidak terkecuali dari aturan tersebut. Memori adalah satu blok teks tambahan dalam request yang sama.

Pemisahan ini terlihat pada objek usage di setiap response.

"usage": {
  "input_tokens": 412,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 18240,
  "output_tokens": 236
}

input_tokens hanya menghitung token yang tidak dibaca dari cache dan tidak digunakan untuk membuat cache. Dalam praktiknya, ini berarti token setelah breakpoint cache terakhir. Total input untuk request tersebut adalah cache_read_input_tokens ditambah cache_creation_input_tokens ditambah input_tokens. File memori yang dibuka Claude tiga giliran sebelumnya tetap termasuk dalam total tersebut pada setiap giliran berikutnya. File itu dihitung sebagai cache_read_input_tokens selama prefix yang di-cache masih berlaku, dan sebagai input_tokens jika tidak. Teksnya sama, tetapi harganya sangat berbeda. Token input dan output memiliki harga yang berbeda, dan memori selalu dihitung sebagai input.

Tempat melihat angka ini dalam penggunaan Anda sendiri

Jangan mengambil angka dari artikel blog, termasuk artikel ini. Ukur blok memori Anda sendiri. Penghitungan token gratis dan memiliki batas laju tersendiri, jadi pengukuran ini tidak menimbulkan biaya.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{"role": "user", "content": "Hello, Claude"}]
  }'

Responsnya berupa satu angka, misalnya { "input_tokens": 14 }. Jalankan sekali dengan teks memori Anda ditempelkan pada bidang system, lalu jalankan sekali tanpa teks tersebut. Selisihnya adalah biaya memori itu pada setiap giliran. Ada dua hal yang perlu diperhatikan. Jumlah tersebut merupakan perkiraan, dan token tambahan yang ditambahkan Anthropic untuk optimisasi sistemnya sendiri tidak ditagihkan kepada Anda. Hitung juga berdasarkan model yang benar-benar akan Anda jalankan, karena Claude 4.7 dan versi setelahnya menggunakan tokenizer yang lebih baru dan menghasilkan sekitar 30 persen lebih banyak token untuk teks yang sama.

Di dalam Claude Code, pertanyaan yang sama dapat dijawab tanpa curl sama sekali.

  • /context menampilkan apa yang sedang dimuat saat ini, termasuk file memori, sehingga Anda dapat melihat porsinya dalam window sebelum mengetik apa pun.
  • /memory mencantumkan file CLAUDE.md Anda dan membuka folder auto memory.
  • /usage mencetak total sesi, termasuk pembacaan cache dan penulisan cache.
  • Baris status dapat menampilkan penggunaan context window secara terus-menerus, sehingga pertumbuhannya terlihat saat berlangsung.

Blok sesi /usage terlihat seperti ini:

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Baca baris terakhir dengan saksama. Angka pembacaan cache 940.0k adalah seluruh percakapan, termasuk memori, yang dikirim ulang pada setiap giliran dengan tarif cache. Angka input 1.2k hanya merupakan bagian yang baru. Claude Code menghitung jumlah dolar tersebut secara lokal berdasarkan harga daftar, sehingga diskon yang Anda dapatkan diabaikan dan hasilnya dapat berbeda dari invoice Anda. Usage page di Claude Console adalah angka yang menjadi acuan.

Selanjutnya, jalankan perbandingan secara langsung. Ajukan pertanyaan pembuka yang sama dalam dua sesi baru, satu sesi normal dan satu sesi dengan auto memory dinonaktifkan.

CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claude

Jalankan /context pada masing-masing sesi, lalu bandingkan entri file memori. Selisihnya adalah biaya memori yang terakumulasi pada awal setiap sesi, sebelum pekerjaan apa pun dilakukan. Rincian lengkap penggunaan token Claude Code layak dibaca setelah melihat kedua angka tersebut.

Berapa biaya pemutaran ulang memori per satu juta token?

Prompt caching adalah alasan blok memori yang sama dapat berbiaya sepuluh kali lebih besar pada satu giliran dibandingkan giliran lainnya. Anthropic menerbitkan tarif cache sebagai kelipatan dari harga input dasar setiap model, sehingga hubungan ini tetap berlaku meskipun harga dalam dolar berubah.

ChartAnthropic's published prompt caching rates, as a multiple of base input price
The data behind this chart
[
  {
    "label": "Base input",
    "price_multiple": 1
  },
  {
    "label": "5 minute cache write",
    "price_multiple": 1.25
  },
  {
    "label": "1 hour cache write",
    "price_multiple": 2
  },
  {
    "label": "Cache read",
    "price_multiple": 0.1
  }
]

Pembacaan cache berbiaya 0.1 kali harga input dasar. Penulisan entri dengan masa berlaku 5 menit berbiaya 1.25 kali harga dasar, sedangkan masa berlaku 1 jam berbiaya 2 kali harga dasar. Anthropic menyatakan titik impasnya dengan jelas: caching mulai menguntungkan setelah satu pembacaan cache pada durasi 5 menit, atau setelah dua pembacaan cache pada durasi 1 jam. Titik impas untuk prompt caching adalah perhitungan yang perlu dilakukan sebelum Anda menentukan lokasi penyimpanan memori.

Kelipatan tersebut mengubah jumlah pemutaran ulang menjadi perhitungan aritmetika. Blok berikutnya merupakan perhitungan berdasarkan kelipatan yang dipublikasikan di atas, bukan pengukuran dari workload yang sedang berjalan. Blok ini menghitung biaya satu blok memori dengan tiga cara selama sesi 100 giliran, yang dinyatakan sebagai jumlah token ekuivalen yang ditagihkan pada tarif input dasar biasa.

ChartA memory block over 100 turns, expressed as base-rate input tokens
The data behind this chart
[
  {
    "label": "4,000 tokens, never cached",
    "base_rate_equivalent_tokens": "400,000"
  },
  {
    "label": "4,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "44,600"
  },
  {
    "label": "1,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "11,150"
  }
]

Blok memori 4,000 token yang tidak pernah menemukan cache selama 100 giliran ditagihkan seperti 400,000 token pada tarif dasar. Blok yang sama dengan satu penulisan cache 5 menit dan 99 pembacaan cache ditagihkan seperti 44,600. Pangkas ukurannya menjadi seperempat dan pertahankan caching, lalu biayanya setara dengan 11,150. Fitur tersebut tidak berubah pada 3 baris itu. Hanya perilaku pemutaran ulang yang berubah. Nilai tersebut masih berupa jumlah token, bukan uang, dan mengubah jumlah token menjadi angka pada tagihan bulanan Anda memerlukan satu perkalian dengan tarif per juta token model Anda. Tarif tersebut ditentukan oleh model yang Anda jalankan. Jadi, jika agent akan berjalan pada Claude Fable 5, mulai dari tarif per juta yang dipublikasikan untuk model tersebut dan jenis pekerjaan yang sesuai dengannya. Jika provider masih menjadi pertanyaan terbuka, bukan hanya modelnya, biaya pekerjaan yang sama pada API Claude dan ChatGPT menunjukkan perbedaan hasil perkalian tersebut, dan agent yang banyak menggunakan memori sangat bergantung pada sisi inputnya.

Baris kedua mengasumsikan setiap permintaan dari 99 permintaan berikutnya tiba saat entri cache masih aktif. Asumsi inilah yang paling sering menyebabkan tagihan aktual berbeda.

Mengapa pertanyaan yang sama lebih mahal setelah jeda?

Entri cache memiliki masa berlaku, dan penghitung waktunya dimulai saat request menulis atau membaca entri tersebut. Nilai default-nya adalah 5 menit. Opsi 1 jam dikenai biaya penulisan 2x seperti yang ditunjukkan di atas. Di Claude Code, masa berlaku cache adalah satu jam pada paket berlangganan dan turun menjadi lima menit setelah Anda mulai menggunakan usage credits; pada API key atau cloud provider, nilai default-nya adalah lima menit. Menetapkan ENABLE_PROMPT_CACHING_1H=1 mempertahankan masa berlaku satu jam saat Anda menggunakan usage credits.

Jadi, pertanyaan satu baris yang diketik ke dalam session yang Anda biarkan terbuka saat makan siang menjadi mahal karena entri cache kedaluwarsa selama Anda pergi. Seluruh prefix, termasuk memory, diproses kembali dengan tarif input dasar dan ditulis kembali ke cache. Durasi jeda menentukan biaya tersebut.

Anda dapat mengonfirmasinya, bukan sekadar mempercayainya. Pada paket Pro, Max, Team, atau Enterprise, rincian /usage menandai perilaku apa pun yang menyumbang 10 persen atau lebih dari penggunaan terbaru. Context yang panjang dan cache miss juga ditampilkan berdasarkan namanya. Pada API, amati cache_creation_input_tokens yang kembali naik hingga ukuran penuh prefix Anda pada request pertama setelah periode tanpa aktivitas.

Hal yang Diam-Diam Membatalkan Cache

Prefix yang di-cache memiliki urutan: tools, kemudian system, lalu messages. Perubahan pada satu tingkat akan membatalkan cache pada tingkat tersebut dan semua tingkat setelahnya. Mengedit definisi tool akan membuang seluruh cache. Mengedit system prompt akan membuang cache system dan messages.

Inilah jebakan bagi siapa pun yang menyimpan memori dalam system prompt lalu menulis ulang prompt tersebut ketika agent belajar. Setiap penulisan ulang membuang salinan cache dari semua bagian setelahnya. Akibatnya, request berikutnya harus melakukan penulisan penuh lagi. Letakkan materi yang stabil di bagian awal dan jangan mengubahnya. Letakkan materi yang sering berubah di bagian akhir daftar messages agar pembatalan cache tidak mahal.

Ada kegagalan kedua yang lebih sulit terlihat. Setiap model memiliki batas minimum prefix yang dapat di-cache: 512 token pada Claude Opus 5, 1,024 pada Claude Sonnet 5, dan 4,096 pada Claude Haiku 4.5, sebagaimana dipublikasikan pada Agustus 2026. Dokumentasi Anthropic menjelaskan secara eksplisit apa yang terjadi jika jumlahnya kurang dari batas tersebut: "Any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned." Oleh karena itu, file memori kecil yang ditandai dengan cache_control sama sekali tidak berpengaruh dan tidak menghasilkan pesan error. Gejala yang dapat dilihat adalah cache_creation_input_tokens tetap bernilai 0, meskipun prompt Anda jelas berisi breakpoint.

Pangkas memori yang tidak lagi berguna

Setiap baris memori mengonsumsi token pada setiap giliran yang memuatnya. Karena itu, untuk setiap baris, tanyakan apakah baris tersebut baru-baru ini mengubah jawaban. Claude Code membuat batas ini jelas. Usahakan agar CLAUDE.md memiliki kurang dari 200 baris, karena file yang lebih panjang mengonsumsi lebih banyak konteks dan mengurangi konsistensi Claude dalam mengikutinya. MEMORY.md dibatasi hingga 200 baris pertama atau 25KB saat dimuat. Apa pun setelah batas tersebut akan dihapus saat sesi berikutnya dimulai. Jadi, indeks yang terlalu besar mengonsumsi token tanpa memberikan informasi.

Dua kebiasaan membantu menjaganya tetap ringkas. Pindahkan detail dari indeks ke file topik. Claude akan membaca file tersebut sesuai kebutuhan, bukan saat startup. Pindahkan instruksi alur kerja dari CLAUDE.md ke skills. Skills hanya dimuat saat dipanggil. Untuk file memori yang sudah diawali frontmatter, Claude Code mencatat waktu penulisan dalam field modified sebagai timestamp ISO 8601, mulai versi 2.1.214. Timestamp tersebut adalah cara tercepat untuk menemukan fakta yang sudah tidak berlaku. Pangkas memori agent yang sudah tidak berlaku membahas proses peninjauan ini secara lebih mendalam.

Saat pengambilan lebih efisien daripada memuat semuanya ke dalam konteks

Memory tool digunakan untuk pengambilan informasi tepat saat dibutuhkan. Alih-alih memuat semuanya sejak awal, agent mencatat informasi yang dipelajarinya lalu membaca file hanya ketika tugas memerlukannya. Hal ini mengubah perhitungannya, karena pembacaan file menghabiskan token satu kali lalu berada di dalam prefix yang di-cache, sedangkan blok yang selalu dimuat menimbulkan biaya pada setiap giliran.

Aturan sederhananya dapat ditarik dari dua grafik di atas. Teks yang digunakan pada hampir setiap giliran sebaiknya ditempatkan di dalam prefix stabil yang di-cache. Teks yang hanya digunakan satu dari setiap dua puluh giliran sebaiknya ditempatkan di balik pemanggilan view. Titik impas berubah berdasarkan jumlah pemutaran ulang, bukan berdasarkan biaya yang dibebankan Anthropic.

Pada API, Anda juga dapat membiarkan platform memangkas percakapan. Context editing menghapus hasil tool lama setelah percakapan melewati ambang yang Anda tetapkan.

{
  "edits": [
    {
      "type": "clear_tool_uses_20250919",
      "trigger": {"type": "input_tokens", "value": 30000},
      "keep": {"type": "tool_uses", "value": 3},
      "clear_at_least": {"type": "input_tokens", "value": 5000}
    }
  ]
}

Nilai default-nya adalah pemicu 100,000 input token dan 3 penggunaan tool yang dipertahankan. Pahami interaksi dengan caching sebelum mengaktifkannya: penghapusan konten membatalkan prefix yang di-cache pada titik penghapusan, sehingga Anda harus membayar penulisan cache pada permintaan berikutnya. Itulah fungsi clear_at_least. Fitur ini menunda penghapusan sampai penghematannya cukup besar untuk membenarkan penulisan tersebut. Respons melaporkan secara tepat apa yang terjadi melalui context_management, dengan cleared_tool_uses dan cleared_input_tokens, sehingga trade-off dapat diukur, bukan hanya bersifat teoretis. Mengelola jendela konteks di Claude Code menerapkan gagasan yang sama pada sesi coding.

Fitur apa yang memiliki tarif tersendiri

Memory tidak dikenai biaya tersendiri, tetapi beberapa fitur memang memiliki tarif khusus, dan penting untuk mengetahui fitur mana saja. Berikut tarif Claude API yang dipublikasikan per Agustus 2026. Beberapa operasi memang sepenuhnya gratis, tetapi Claude API tidak memiliki free tier, hanya kredit kecil saat pendaftaran. Jadi, semua biaya di bawah ini merupakan pengeluaran nyata sejak permintaan pertama Anda.

  • Web search: $10 per 1,000 pencarian, ditambah biaya token biasa untuk seluruh konten yang dimasukkan hasil pencarian ke dalam context.
  • Code execution: 1,550 jam gratis per organisasi setiap bulan, kemudian $0.05 per jam untuk setiap container. Fitur ini gratis jika digunakan bersama web search atau web fetch.
  • Claude Managed Agents: runtime sesi sebesar $0.08 per jam sesi, di luar biaya token biasa.
  • Web fetch: tidak ada biaya tambahan, hanya biaya token untuk konten yang diambil.

Memory tidak tercantum pada satu pun item tersebut. Memory masuk ke jumlah input token Anda. Di situlah Anda dapat mengukurnya, dan di situlah pruning serta caching dapat menguranginya. Jika Anda menganggarkan agent yang berjalan tanpa pengawasan pada virtual private server (VPS), kontrol biaya untuk AI agent pada VPS adalah langkah berikutnya yang perlu diterapkan. Agent dengan file memory yang terus bertambah tanpa pruning akan menjadi semakin mahal setiap minggu tanpa ada laporan yang menunjukkan penyebabnya.

FAQ

Apakah ada biaya terpisah untuk fitur memori Claude?

Tidak. Daftar harga Anthropic menetapkan tarif per juta token input, per juta token output, dan kelipatan caching prompt, tanpa mencantumkan biaya memori secara terpisah. Pada Claude API, memory tool berada di sisi klien, sehingga file disimpan pada storage yang sudah Anda bayar. Memori menambahkan token input, yang ditagihkan dengan tarif input normal model pada setiap giliran yang membawanya.

Apakah menonaktifkan memori membuat Claude lebih murah?

Ini mengurangi jumlah token dalam setiap permintaan, sehingga biaya setiap permintaan juga turun. Namun, penghematan total bergantung pada proses berikutnya. Jika Claude harus membaca ulang tiga file dan mengajukan dua pertanyaan kepada Anda untuk membangun kembali informasi yang sebelumnya sudah disimpan dalam memori, token tersebut dapat berbiaya lebih besar daripada memori. Ukur hasilnya, jangan menebak: jalankan /context dalam sesi dengan auto memory aktif dan dalam sesi yang dimulai dengan CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, lalu bandingkan total token yang digunakan untuk tugas yang sama.

Mengapa penggunaan saya meningkat padahal saya tidak mengubah apa pun?

Penyebab yang paling umum adalah cache miss setelah jeda. Entri cache berlaku selama 5 menit secara default, atau satu jam pada pengaturan extended, sehingga permintaan pertama setelah jeda memproses ulang seluruh prefix dengan tarif input dasar dan menulisnya kembali. Penyebab umum kedua adalah perubahan pada prefix: perubahan pada definisi tool membatalkan seluruh cache, sedangkan perubahan pada system prompt membatalkan cache sistem dan pesan. Pada paket subscription, rincian /usage menyebutkan perilaku ini jika kontribusinya mencapai 10 persen atau lebih dari penggunaan terbaru.

Sebaiknya memori ditempatkan dalam system prompt atau di balik pemanggilan tool?

Tempatkan memori dalam system prompt jika hampir setiap giliran menggunakannya, karena memori akan berada dalam prefix yang di-cache dan dikenai tarif pembacaan cache. Tempatkan memori di balik pemanggilan view jika hanya tugas tertentu yang memerlukannya, karena file yang dibaca satu kali hanya membebankan tokennya satu kali, bukan pada setiap giliran. Angka penentunya adalah jumlah replay Anda, dan objek usage menyediakan angka tersebut secara langsung.

Apakah fitur memori diperhitungkan dalam batas penggunaan subscription?

Ya, secara tidak langsung, karena batas subscription dikonsumsi oleh token yang dibawa setiap permintaan. Dokumentasi bantuan Anthropic menyatakan bahwa percakapan yang lebih panjang dan memicu pengelolaan konteks otomatis akan mengonsumsi lebih banyak dari batas penggunaan Anda. Memori membuat setiap permintaan sedikit lebih panjang, dan sesi yang panjang mengirimkan kembali panjang tersebut pada setiap giliran. Cara kerja batas penggunaan Claude sebenarnya membahas hal yang direset dan waktunya.