Claude API vs Langganan: Mana Lebih Murah?
Bandingkan kos penggunaan token API dengan yuran pelan tetap Claude. Ketahui titik pulang modal berdasarkan kadar semasa untuk mengelakkan pembaziran.
Adakah Claude API lebih murah daripada langganan?
Claude API adalah lebih murah daripada langganan jika penggunaan berada di bawah volum tertentu, dan lebih mahal jika melebihi tahap tersebut. Bagi pembangun yang mengekod secara interaktif sepanjang hari, pelan tetap biasanya lebih menjimatkan. Bagi program yang membuat panggilan sendiri, API adalah satu-satunya pilihan, jadi kos bukan penentu utama. Selebihnya adalah pengiraan yang boleh anda lakukan dalam masa sepuluh minit.
Tiada angka titik pulang modal rasmi untuk dirujuk. Langganan dijual sebagai tingkap penggunaan dan bukannya kuota token, jadi tiada angka yang diterbitkan untuk menunjukkan di mana kedua-dua garis tersebut bersilang. Berikut adalah formula yang dikira berdasarkan kadar per-token semasa, ditambah dengan faktor tingkah laku anda sendiri yang mengubah jawapan tersebut jauh lebih besar daripada yuran pelan. Setiap angka titik pulang modal di bawah adalah pengiraan saya sendiri daripada kadar yang diterbitkan dan andaian yang dinyatakan, bukan angka yang didokumentasikan.
Jika anda masih keliru pelan mana yang perlu dibeli, pelan Claude mana yang sesuai dengan cara kerja anda memberikan jawapannya. Penulisan ini mengandaikan anda sudah tahu pelan mana yang ingin dibeli, dan ingin tahu sama ada perlu membelinya atau tidak.
Dua model pengebilan yang tidak mempunyai bentuk yang sama
Langganan adalah kapasiti yang mungkin tidak anda gunakan. Anda membayar yuran tetap dan mendapat kuota yang ditetapkan semula mengikut jadual. Dokumentasi Claude Code oleh Anthropic menyatakan bentuk untuk tempat duduk Team dan Enterprise: penggunaan "mengambil daripada kuota per-tempat duduk yang ditetapkan semula pada tingkap lima jam bergilir dan tingkap mingguan", dikongsi dengan sembang Claude dan Cowork. Pelanggan langganan menghadapi bentuk yang sama melalui jumlah mesej yang dihantar, yang memaparkan "You've hit your session limit" dan "You've hit your weekly limit". Kapasiti yang tidak anda gunakan adalah wang yang telah anda belanjakan. Kapasiti yang melebihi had akan menghentikan kerja anda sehingga tingkap ditetapkan semula, dan menukar model dengan /model tidak memulihkan akses, kerana tingkap tersebut dikongsi merentasi model.
API adalah meter yang tidak pernah berhenti. Tiada tingkap dan tiada had. Setiap permintaan dikira mengikut token, dan beberapa perkara dikira di luar token: carian web "tersedia pada Claude API untuk $10 bagi setiap 1,000 carian". Tiada apa yang terhenti pada had tertentu. Invois hanya akan terus meningkat.
Yuran pelan setakat 23 Julai 2026, dipetik dari halaman harga Claude: Pro adalah "$17 Sebulan dengan diskaun langganan tahunan ($200 dibayar di muka). $20 jika dibayar secara bulanan", dan ia termasuk Claude Code. Max disenaraikan sebagai "Dari $100 Sebulan". Tempat duduk Team bermula pada "$20 Per tempat duduk / bulan jika dibayar secara tahunan". Enterprise adalah yang paling menarik, kerana ia menjalankan kedua-dua model secara serentak: "Harga tempat duduk + penggunaan pada kadar API $20/tempat duduk". Yuran ini kerap berubah, dan kuota di sebalik setiap satu tidak pernah diterbitkan dalam jumlah token, jadi baca halaman harga pada hari anda membuat keputusan.
Apa yang anda tidak boleh dapat daripada API
Kuota pelan, dan antara muka yang dibina di sekelilingnya. Perintah /usage-credits Claude Code menguruskan kredit penggunaan langganan, dan anda menjalankannya "selepas log masuk dengan langganan claude.ai anda melalui /login; perintah ini tidak tersedia dengan pengesahan kunci API." Skrin /usage juga berbeza mengikut mod pengebilan: Blok Session miliknya "menunjukkan penggunaan token API dan bertujuan untuk pengguna API", manakala pelanggan langganan melihat bar penggunaan pelan dan pecahan penggunaan sebagai ganti.
Cache prompt yang lebih panjang dalam Claude Code. Ini melibatkan kos wang sebenar dan mudah terlepas pandang. Dokumentasi menyatakan "Jangka hayatnya adalah satu jam pada langganan dan turun kepada lima minit sebaik sahaja anda menggunakan kredit penggunaan; pada kunci API atau penyedia awan, ia adalah lima minit secara lalai". Mesej pertama anda selepas berehat lebih lama daripada jangka hayat cache akan terlepas cache, jadi keseluruhan konteks anda diproses semula dan dibilkan pada harga penulisan. Dengan langganan, anda boleh mengadakan mesyuarat selama lima puluh minit dan kembali dengan keadaan sedia. Dengan kunci API, rehat yang sama menelan kos penulisan semula sepenuhnya bagi awalan sesi tersebut.
Apa yang anda tidak boleh dapat daripada langganan
Akses programatik. Kerja cron atau pengendali webhook yang memanggil Claude memerlukan kunci API, jadi jika itu adalah beban kerja anda, perbandingan ini sudah berakhir. Membina aplikasi Claude API pertama anda pada VPS merangkumi pengendalian kunci dan skrip pertama yang berfungsi.
Diskaun Batch API. Halaman harga menyatakan dengan jelas: "Batch API membolehkan pemprosesan asinkron bagi volum permintaan yang besar dengan diskaun 50% pada kedua-dua token input dan output." Itu mengurangkan separuh kadar meter untuk sebarang kerja yang tidak memerlukan penungguan manusia. Kadar Batch bagi setiap sejuta token adalah $2.50 input dan $12.50 output pada Opus 4.8, $1 dan $5 pada Sonnet 5 pada harga pengenalan, dan $0.50 dan $2.50 pada Haiku 4.5. Pertukarannya adalah kependaman: kebanyakan batch selesai dalam masa satu jam, batch yang tidak selesai dalam masa 24 jam akan tamat tempoh, dan penstriman tidak boleh dibatch. Batch dan penangkapan cache prompt boleh digunakan bersama, dan kerana batch boleh berjalan lebih lama daripada lima minit, gunakan cache 1-jam di dalamnya.
Atribusi kos bagi setiap projek. Setiap respons API mengembalikan blok usage, jadi anda boleh merekod kos bagi satu permintaan dan menetapkannya kepada projek atau pelanggan. Langganan melaporkan satu set bar untuk pemegang tempat duduk tersebut.
Satu perkara perlu dinyatakan dengan teliti, kerana mudah untuk membuat andaian ke mana-mana arah: ini adalah permukaan pengebilan yang berbeza. Dokumentasi Anthropic menyalurkan pengebilan langganan ke sokongan claude.ai dan pengebilan Console ke platform API, dan /usage-credits tidak berfungsi di bawah kunci API. Tiada apa yang saya semak menyatakan langganan termasuk kredit API, jadi rancanglah untuk dua akaun dan dua bil.
Formula titik pulang modal
Harga satu pusingan, kemudian skala ia.
turn cost = uncached_input_tokens x base_input_price
+ cache_write_tokens x 1.25 x base_input_price
+ cache_read_tokens x 0.10 x base_input_price
+ output_tokens x output_price
monthly API cost = turn cost x turns_per_active_day x active_days_per_month
break even when: monthly API cost = flat plan feePendarab adalah diterbitkan, bukan anggaran. Penulisan cache 5-minit berharga "1.25x harga input asas", penulisan 1-jam berharga "2x harga input asas", dan bacaan cache berharga "0.1x harga input asas". Token pemikiran dibilkan sebagai token output, jadi ia termasuk dalam output_tokens walaupun pada model yang tidak memaparkan ringkasan penaakulan.
Kadar asas bagi setiap sejuta token (MTok), semasa pada 23 Julai 2026:
claude-fable-5: $10 input, $50 output. Bacaan cache $1. Penulisan cache 5-minit $12.50. 1M konteks.claude-opus-4-8danclaude-opus-4-7: $5 input, $25 output. Bacaan cache $0.50. Penulisan cache 5-minit $6.25. 1M konteks.claude-sonnet-5: $2 input, $10 output pada harga pengenalan sehingga 31 Ogos 2026, kemudian $3 dan $15. Pada kadar pengenalan, bacaan cache $0.20 dan penulisan cache 5-minit $2.50. 1M konteks.claude-haiku-4-5: $1 input, $5 output. Bacaan cache $0.10. Penulisan cache 5-minit $1.25. 200K konteks.
Tiada caj tambahan untuk konteks yang panjang: "Permintaan 900k-token dibilkan pada kadar per-token yang sama dengan permintaan 9k-token."
Contoh pengiraan, dengan andaian yang dinyatakan
Ambil satu pusingan Claude Code pertengahan sesi pada Sonnet 5 yang membawa 60,000 token konteks: 55,000 diambil dari cache, 3,000 ditulis baru ke cache, 2,000 token input segar tanpa cache, dan 1,200 token output termasuk pemikiran.
- Bacaan cache: 55,000 x $0.20/MTok = $0.0110
- Penulisan cache: 3,000 x $2.50/MTok = $0.0075
- Input tanpa cache: 2,000 x $2.00/MTok = $0.0040
- Output: 1,200 x $10.00/MTok = $0.0120
Itu adalah kira-kira $0.035 setiap pusingan. Pada 120 pusingan pada hari yang aktif, kira-kira $4.14 sehari. Pada 20 hari aktif sebulan, kira-kira $83 sebulan.
Bandingkan dengan yuran tetap di atas dan ia menyatakan dua perkara serentak. Ia adalah kira-kira empat kali ganda yuran Pro, jadi Pro lebih murah di atas kertas, dengan syarat kuotanya mencukupi untuk 120 pusingan Sonnet sehari. Syarat tersebut adalah apa yang tidak dapat diselesaikan oleh mana-mana angka yang diterbitkan untuk anda. Jumlah $83 yang sama berada di bawah yuran permulaan Max, jadi di sini kadar meter lebih murah daripada Max.
Sekarang tukar satu demi satu andaian, dan lihat bagaimana yuran pelan berhenti menjadi angka penentu.
Tiga perkara yang mengubah titik pulang modal lebih daripada harga pelan
Penangkapan prompt (Prompt caching). Jalankan pusingan 60,000-token yang sama tanpa penangkapan cache dan keseluruhan prompt dibilkan sebagai input segar: 60,000 x $2.00/MTok = $0.12, ditambah $0.012 output, jadi $0.132 setiap pusingan. Itu hampir empat kali ganda pusingan dengan cache, dan ia menukarkan $83 sebulan kepada kira-kira $317. Ini adalah satu titik pulang modal yang diterbitkan oleh Anthropic, kerana ia tidak bergantung pada beban kerja anda: "Satu padanan cache (cache hit) berharga 10% daripada harga input standard, yang bermaksud penangkapan cache membuahkan hasil selepas hanya satu bacaan cache untuk tempoh 5 minit (1.25x penulisan), atau selepas dua bacaan cache untuk tempoh 1 jam (2x penulisan)."
Dua mod kegagalan mematikan penangkapan cache tanpa memberitahu anda. Yang pertama ialah awalan (prefix) yang lebih pendek daripada panjang minimum yang boleh ditangkap cache oleh model: 512 token pada Fable 5, 1,024 pada Opus 4.8 dan Sonnet 5, 2,048 pada Opus 4.7, dan 4,096 pada Haiku 4.5. Awalan yang lebih pendek tidak ditangkap cache, dan tiada ralat yang dimunculkan. Yang kedua ialah permintaan selari, kerana "satu entri cache hanya tersedia selepas respons pertama bermula." Sepuluh permintaan identik yang dihantar serentak semuanya membayar harga input penuh. Tanda bagi kedua-duanya adalah cache_read_input_tokens berada pada sifar.
Pilihan model. Kira pusingan yang sama pada Opus 4.8, pada $5 input dan $25 output, dengan bacaan cache pada $0.50 dan penulisan 5-minit pada $6.25 setiap MTok: bacaan $0.0275, penulisan $0.0188, input tanpa cache $0.0100, output $0.0300. Itu adalah kira-kira $0.086 setiap pusingan, 2.5 kali ganda pusingan Sonnet, dan kira-kira $207 sebulan pada volum yang sama. Satu pilihan model telah mengubah kerja yang sama daripada di bawah yuran permulaan Max kepada lebih daripada dua kali ganda Max. Haiku 4.5 pada $1 dan $5 mengubahnya ke arah bertentangan untuk kerja mekanikal seperti penyisihan log.
Tahap usaha adalah bergantung pada pilihan model, kerana token pemikiran dibilkan pada kadar output. Pada Opus 4.8, tetapan lalai API adalah high, dan titik permulaan yang didokumentasikan untuk pengekodan dan kerja ejen adalah xhigh yang lebih mahal. Rendahkan ia dengan /effort dalam Claude Code atau dengan output_config.effort pada API. Satu lagi perkara mengubah anggaran lama: model yang lebih baharu menggunakan tokenizer yang lebih baharu yang "menghasilkan kira-kira 30% lebih banyak token untuk teks yang sama", jadi kiraan yang diukur pada model lama akan menyatakan jumlah yang lebih rendah bagi teks yang sama hari ini.
Kebersihan sesi (Session hygiene). API adalah tanpa keadaan (stateless), jadi setiap pusingan menghantar semula keseluruhan perbualan sebagai input yang dibilkan. Oleh itu, sesi yang panjang menelan kos lebih tinggi bagi setiap mesej berbanding sesi baharu, yang merupakan mekanisme di sebalik kebanyakan kejutan bil dan dibincangkan secara terperinci dalam apa yang sebenarnya menggunakan token dalam sesi Claude Code. Jalankan /clear di antara tugas yang tidak berkaitan, kerana konteks lama dihantar semula dan dibilkan semula pada setiap mesej seterusnya. Jalankan /compact di dalam satu tugas yang panjang, supaya sejarah diringkaskan dan bukannya dibawa sepenuhnya. Bekerja dalam tempoh berterusan, kerana cache lalai "mempunyai jangka hayat 5 minit" dan "dikemas kini tanpa kos tambahan setiap kali kandungan yang ditangkap cache digunakan". Sesi yang anda sentuh sekali setiap sepuluh minit membayar penulisan semula setiap kali. Sebuah sesi Claude Code yang berjalan dalam tmux pada VPS yang terpisah hampir tidak membelanjakan apa-apa semasa ia terbiar, tetapi terbiar melebihi jangka hayat cache tetap akan kehilangan awalan yang sedia ada.
Ukur penggunaan anda sendiri sebelum anda memutuskan
Jangan buat keputusan berdasarkan contoh saya. Buat keputusan berdasarkan seminggu penggunaan anda.
Dalam Claude Code, jalankan /usage pada akhir setiap sesi selama seminggu (/cost adalah alias untuk skrin yang sama). Ia melaporkan jumlah token sesi dan anggaran kos, dengan satu pengecualian daripada dokumentasi: "Angka dolar adalah anggaran yang dikira secara tempatan daripada jumlah token dan mungkin berbeza daripada bil sebenar anda." Jumlah akan ditetapkan semula apabila anda menjalankan /clear, jadi baca skrin terlebih dahulu. Pada langganan, angka dolar itu bukan bil anda, tetapi jumlah token di sebaliknya adalah apa yang diperlukan oleh formula ini. /context menunjukkan apa yang memenuhi tingkap tersebut.
Pada akaun API, halaman penggunaan dalam Claude Console adalah rekod yang sah. Untuk mengira harga satu prompt sebelum anda menghantarnya, client.messages.count_tokens() adalah "percuma untuk digunakan tetapi tertakluk kepada had kadar permintaan seminit berdasarkan tahap penggunaan anda", dan ia adalah satu-satunya kiraan yang menggunakan tokenizer yang akan dibilkan kepada anda.
Selepas satu panggilan, baca blok penggunaan, dan baca dengan betul:
u = response.usage
total_input = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokensinput_tokens hanya mengira baki tanpa cache, didokumentasikan sebagai "token selepas titik henti cache terakhir". Satu pusingan yang melaporkan input_tokens: 4000 bukanlah pusingan 4,000-token, dan tiga medan yang ditambah bersama adalah saiz prompt yang diperlukan oleh formula ini.
Kemudian bandingkan. Jika bulan yang diukur jatuh dengan jelas di bawah yuran pelan, ambil meter. Jika ia jatuh dengan jelas di atas, ambil pelan, selagi kuotanya mencukupi untuk hari kerja biasa anda. Jika ia jatuh berhampiran garis, ambil pelan, kerana pelan tidak boleh mengejutkan anda dan meter boleh.
FAQ
Adakah Claude API lebih murah daripada Claude Pro atau Max?
Ia bergantung pada volum, dan tiada titik pulang modal diterbitkan untuk dirujuk, kerana langganan dijual sebagai tingkap penggunaan dan bukannya kuota token. Kira harga satu pusingan tipikal daripada kadar per-token yang diterbitkan, darab dengan pusingan anda setiap hari aktif dan hari aktif setiap bulan, kemudian bandingkan angka tersebut dengan yuran pelan. Dalam satu contoh pengiraan, satu pusingan Sonnet 5 sebanyak 60,000-token berjumlah kira-kira $0.035, atau kira-kira $83 sebulan dengan 120 pusingan sehari selama 20 hari: melebihi yuran Pro, di bawah yuran permulaan Max.
Bagaimanakah saya mengira kos Claude API saya sebulan?
Jalankan /usage dalam Claude Code selama seminggu untuk mengumpul jumlah token sebenar, atau baca halaman penggunaan dalam Claude Console jika anda sudah mempunyai akaun API. Kemudian kira harga satu pusingan: input tanpa cache pada kadar asas, penulisan cache pada 1.25 kali kadar input asas, bacaan cache pada 0.1 kali kadar input asas, dan output pada kadar output, dengan mengira token pemikiran sebagai output. Darab dengan pusingan setiap hari aktif dan hari aktif setiap bulan.
Apakah yang paling mengubah bil Claude API?
Penangkapan prompt, lebih daripada perkara lain. Satu pusingan 60,000-token pada Sonnet 5 menelan kos kira-kira $0.035 apabila awalan diambil dari cache dan kira-kira $0.132 apabila ia tidak. Pilihan model adalah yang kedua: pusingan yang sama pada Opus 4.8 menelan kos kira-kira $0.086. Panjang sesi adalah yang ketiga, kerana API adalah tanpa keadaan dan setiap pusingan menghantar semula keseluruhan perbualan sebagai input yang dibilkan.
Adakah langganan Claude termasuk akses API?
Anggap ia sebagai dua akaun dengan dua bil. Panggilan API dibilkan mengikut token terhadap akaun yang anda cipta dalam Console, dan tiada apa dalam dokumentasi yang saya semak menyatakan langganan memberikan kredit API. Tanda paling jelas bahawa ia adalah permukaan yang berbeza ialah perintah /usage-credits Claude Code, yang "tidak tersedia dengan pengesahan kunci API". Ramai pembangun memegang kedua-duanya: satu pelan untuk pengekodan interaktif, satu kunci untuk perkara yang mereka bina.