SSD Nodes Learn Hosting plans →
Hướng dẫn Matt ConnorBởi Matt Connor · Cập nhật ngày 2026-08-26

Claude API có rẻ hơn gói thuê bao không?

Tính điểm hòa vốn Claude API và gói thuê bao bằng giá theo token hiện tại, kèm các yếu tố như cache, model và cách dùng có thể làm chi phí lệch đáng kể.

Claude API có rẻ hơn gói thuê bao không?

Claude API rẻ hơn gói thuê bao khi khối lượng sử dụng dưới một mức nhất định và đắt hơn khi vượt mức đó. Với một developer code tương tác cả ngày, gói cố định thường có lợi hơn. Với một chương trình tự thực hiện các API call, API là lựa chọn duy nhất nên chi phí không quyết định lựa chọn. Phần còn lại là phép tính bạn có thể tự làm trong mười phút.

Không có con số hòa vốn chính thức để tra cứu. Gói thuê bao được bán theo các khoảng thời gian sử dụng thay vì hạn mức token, nên không có số liệu công bố nào cho biết chính xác điểm giao nhau của hai mức chi phí. Phần dưới đây trình bày công thức dựa trên mức giá hiện tại theo token, cùng với những yếu tố trong cách bạn sử dụng có thể làm thay đổi kết quả nhiều hơn cả phí gói. Mọi con số hòa vốn dưới đây đều do tôi tự tính từ mức giá đã công bố và các giả định nêu rõ, không phải số liệu được tài liệu hóa.

Nếu bạn vẫn đang quyết định nên mua gói nào, bài gói Claude nào phù hợp với cách bạn làm việc sẽ trả lời câu hỏi đó. Bài này giả định bạn đã biết mình sẽ mua gói nào và muốn biết có nên mua hay không.

Hai mô hình tính phí này không có cùng cách vận hành

Subscription là dung lượng có thể bạn không dùng hết. Bạn trả một khoản phí cố định và nhận một hạn mức được reset theo lịch. Tài liệu Claude Code của Anthropic mô tả mô hình này cho seat Team và Enterprise: mức sử dụng “lấy từ hạn mức theo từng seat, được reset theo cửa sổ 5 giờ cuốn chiếu và cửa sổ hằng tuần”, dùng chung cho Claude chat và Cowork. Người đăng ký gặp đúng mô hình này qua các tin nhắn hiển thị “Bạn đã chạm giới hạn phiên” và “Bạn đã chạm giới hạn tuần”. Dung lượng không dùng hết vẫn là khoản tiền bạn đã trả. Khi vượt quá dung lượng, công việc sẽ dừng cho đến khi cửa sổ được reset. Đổi model bằng /model cũng không khôi phục quyền truy cập, vì các cửa sổ này được dùng chung giữa các model. Nếu hiện tại bạn đang thấy một trong các thông báo đó, xác định bạn đang chờ cửa sổ nào quan trọng hơn mọi phép tính dưới đây, vì giới hạn 5 giờ và giới hạn tuần cần các cách xử lý khác nhau.

API là một đồng hồ tính phí không bao giờ dừng. Không có cửa sổ và cũng không có giới hạn chặn cố định. Mỗi request được tính theo token, còn một số tính năng được tính ngoài token: tính năng tìm kiếm web “có trên Claude API với giá $10 cho mỗi 1.000 lượt tìm kiếm”. Không có gì dừng khi chạm một hạn mức. Hóa đơn chỉ tiếp tục tăng. API cũng không có free tier bên dưới, dù credit khi đăng ký và các phần không tính phí có thể đủ cho lần thử nghiệm đầu tiên trước khi các phép tính này trở nên quan trọng.

Phí plan tính đến ngày 23 July 2026, trích từ trang giá của Claude: Pro là “$17 Mỗi tháng khi đăng ký hằng năm (thanh toán trước $200). $20 nếu thanh toán hằng tháng”, và bao gồm Claude Code. Max được niêm yết là “Từ $100 Mỗi tháng”. Seat Team bắt đầu từ “$20 Mỗi seat / tháng nếu thanh toán hằng năm”. Enterprise là trường hợp đáng chú ý vì dùng cả hai mô hình cùng lúc: “Giá seat + mức sử dụng theo giá API $20/seat”. Nếu bạn đang cân nhắc mô hình kết hợp này, phí seat Enterprise thực sự bao gồm những gì sẽ trình bày mức tối thiểu của seat và các phần chỉ có trong báo giá thương lượng. Nếu bạn chỉ định giá riêng công cụ coding thay vì toàn bộ Claude, Claude Code có giá bao nhiêu trên từng plan sẽ đối chiếu các khoản phí đó với một ước tính chi phí hằng tháng cụ thể. Nếu bạn chưa chốt phần tính phí cố định của Claude, các tier này khi so với ChatGPT Go, Plus và Pro là nửa còn lại của quyết định. Các khoản phí thường xuyên thay đổi, và hạn mức phía sau mỗi plan không bao giờ được công bố theo token, vì vậy hãy đọc trang giá vào đúng ngày bạn quyết định.

Những gì bạn không thể lấy từ API

Allowance của plan và giao diện được xây dựng quanh nó. Command /usage-credits của Claude Code quản lý credit sử dụng của subscription. Bạn chạy command này “sau khi đăng nhập bằng subscription claude.ai thông qua /login; command này không khả dụng khi xác thực bằng API key.” Màn hình /usage cũng khác theo chế độ billing: block Session “hiển thị mức sử dụng API token và dành cho người dùng API”, còn subscriber sẽ thấy các thanh mức sử dụng của plan và phần phân tích mức sử dụng thay thế. Cả hai đều giả định rằng plan của bạn có Claude Code ngay từ đầu. Phần plan nào có Claude Code và những gì dùng chung cửa sổ mức sử dụng sẽ làm rõ điều này, bao gồm cả trường hợp một API key còn sót lại âm thầm tính phí thay cho bạn. Chúng cũng giả định rằng bạn có thể mở giao diện đó trên máy mình thực sự làm việc. Trên Linux, danh sách này ngắn hơn bạn nghĩ. Vì vậy, hãy kiểm tra giao diện nào chạy native trên đó và mỗi giao diện cần plan nào trước khi trả tiền cho bên nào.

Prompt cache dài hơn trong Claude Code. Tính năng này có chi phí thực và rất dễ bị bỏ qua. Tài liệu cho biết “Thời hạn là một giờ khi dùng subscription và giảm xuống còn 5 phút khi bạn sử dụng credit; với API key hoặc cloud provider, mặc định là 5 phút”. Tin nhắn đầu tiên sau khi bạn ngắt quãng lâu hơn thời hạn của cache sẽ không lấy được cache. Toàn bộ context khi đó phải được xử lý lại và tính phí theo mức giá ghi cache. Với subscription, bạn có thể họp 50 phút rồi quay lại làm việc mà cache vẫn còn. Với API key, cùng khoảng ngắt quãng đó khiến toàn bộ prefix của session phải được ghi cache lại.

Những gì bạn không nhận được từ gói thuê bao

Truy cập qua code. Một cron job hoặc webhook handler gọi Claude cần API key. Vì vậy, nếu đây là workload của bạn thì việc so sánh kết thúc tại đây. Xây dựng ứng dụng Claude API đầu tiên trên VPS trình bày cách xử lý key và script đầu tiên có thể chạy.

Mức giảm giá của Batch API. Trang pricing nêu rõ: "Batch API cho phép xử lý bất đồng bộ khối lượng lớn request với mức giảm 50% trên cả input token và output token." Mức này giảm một nửa chi phí cho mọi workload mà không cần con người chờ kết quả. Đơn giá Batch trên mỗi triệu token là $2.50 cho input và $12.50 cho output trên Opus 4.8, $1 và $5 trên Sonnet 5 theo mức giá giới thiệu, và $0.50 và $2.50 trên Haiku 4.5. Đổi lại là latency: hầu hết batch hoàn tất trong vòng một giờ, batch chưa hoàn tất sau 24 giờ sẽ hết hạn, và không thể batch streaming. Batch và prompt caching có thể dùng cùng nhau. Vì một batch có thể chạy lâu hơn năm phút, hãy dùng cache 1 giờ bên trong batch đó.

Phân bổ chi phí theo project. Mỗi API response trả về một block usage, nên bạn có thể log chi phí của từng request và gán chi phí đó cho một project hoặc customer. Subscription chỉ báo cáo một bộ số liệu cho người sở hữu seat. Khi nhân chi phí đó lên cho cả team, quyết định không còn là quyết định cá nhân. Vì vậy, Claude Code tính phí theo seat so với cùng workload được tính theo token là phiên bản so sánh nên thực hiện khi bạn mua seat cho người khác.

Cần nói rõ một điểm, vì rất dễ suy diễn theo cả hai hướng: đây là các kênh billing riêng biệt. Tài liệu của Anthropic chuyển billing của subscription đến bộ phận hỗ trợ claude.ai, còn billing của Console đến API platform; /usage-credits không hoạt động với API key. Tôi không thấy thông tin nào cho biết subscription bao gồm API credit. Vì vậy, hãy dự tính sẽ có hai account và hai hóa đơn.

Công thức hòa vốn

Tính giá cho một lượt trước, rồi mới mở rộng quy mô.

turn cost = uncached_input_tokens x base_input_price
          + cache_write_tokens    x 1.25 x base_input_price
          + cache_read_tokens     x 0.10 x base_input_price
          + output_tokens         x output_price

monthly API cost = turn cost x turns_per_active_day x active_days_per_month

break even when: monthly API cost = flat plan fee

Các hệ số được công bố, không phải ước tính. Ghi cache trong 5 phút có chi phí bằng "1.25x giá input cơ bản", ghi cache trong 1 giờ có chi phí bằng "2x giá input cơ bản", còn đọc cache có chi phí bằng "0.1x giá input cơ bản". Token dùng cho reasoning được tính như output token, vì vậy chúng thuộc output_tokens ngay cả trên những model không hiển thị bản tóm tắt reasoning.

Mức giá cơ bản trên mỗi triệu token (MTok), hiện áp dụng ngày 23 July 2026:

  • claude-fable-5: $10 input, $50 output. Đọc cache $1. Ghi cache trong 5 phút $12.50. Context 1M.
  • claude-opus-4-8claude-opus-4-7: $5 input, $25 output. Đọc cache $0.50. Ghi cache trong 5 phút $6.25. Context 1M.
  • claude-sonnet-5: $2 input, $10 output theo mức giá giới thiệu đến hết 31 August 2026, sau đó là $3 và $15. Theo mức giá giới thiệu, đọc cache có giá $0.20 và ghi cache trong 5 phút có giá $2.50. Context 1M.
  • claude-haiku-4-5: $1 input, $5 output. Đọc cache $0.10. Ghi cache trong 5 phút $1.25. Context 200K.

Không có phụ phí cho context dài: "Request 900k token được tính cùng mức giá trên mỗi token như request 9k token."

Một ví dụ cụ thể, với các giả định được ghi rõ

Xét một lượt Claude Code giữa phiên trên Sonnet 5, sử dụng 60,000 token ngữ cảnh: 55,000 token được phục vụ từ cache, 3,000 token mới được ghi vào cache, 2,000 token đầu vào mới chưa có trong cache và 1,200 token đầu ra, bao gồm cả phần suy luận.

  • Đọc từ cache: 55,000 x $0.20/MTok = $0.0110
  • Ghi vào cache: 3,000 x $2.50/MTok = $0.0075
  • Đầu vào chưa có trong cache: 2,000 x $2.00/MTok = $0.0040
  • Đầu ra: 1,200 x $10.00/MTok = $0.0120

Tổng cộng khoảng $0.035 mỗi lượt. Với 120 lượt trong một ngày hoạt động, chi phí khoảng $4.14 mỗi ngày. Với 20 ngày hoạt động mỗi tháng, chi phí khoảng $83 mỗi tháng.

Đặt con số này cạnh các mức phí cố định ở trên sẽ cho thấy hai điều cùng lúc. Chi phí này cao hơn khoảng 4 lần phí Pro, nên Pro rẻ hơn trên lý thuyết, với điều kiện hạn mức của Pro đủ cho 120 lượt Sonnet mỗi ngày. Không có số liệu công bố nào có thể giúp bạn xác định điều kiện đó. Nội dung gần nhất với câu trả lời là xem kỹ hơn Pro bao gồm những gì và các giới hạn của Pro ngăn bạn ở đâu, nên đọc phần này trước khi giả định rằng gói có phí thấp hơn luôn thắng. Cùng mức $83 này vẫn thấp hơn phí Max cấp thấp nhất, nên trong trường hợp này tính theo lượt sẽ rẻ hơn Max. Từ “cấp thấp nhất” rất quan trọng trong câu đó, vì Max có 2 mức giá, và bạn thực sự sẽ mua tier Max nào sẽ thay đổi mức $100 mỗi tháng dùng làm mốc so sánh.

Bây giờ hãy thay đổi từng giả định một, rồi theo dõi cách phí gói không còn là con số quyết định.

Ba yếu tố làm thay đổi điểm hòa vốn nhiều hơn giá gói

Caching prompt. Chạy cùng một lượt 60,000 token mà không caching thì toàn bộ prompt bị tính là input mới: 60,000 x $2.00/MTok = $0.12, cộng $0.012 output, thành $0.132 mỗi lượt. Mức này gần gấp bốn lần lượt có cache, và biến chi phí $83 mỗi tháng thành khoảng $317. Đây là điểm hòa vốn duy nhất được Anthropic công bố, vì nó không phụ thuộc vào workload của bạn: "Một cache hit có giá bằng 10% giá input tiêu chuẩn. Điều đó có nghĩa caching có lợi sau chỉ một lần đọc cache trong thời hạn 5 phút (ghi cache 1.25x), hoặc sau hai lần đọc cache trong thời hạn 1 giờ (ghi cache 2x)."

Có hai trường hợp lỗi khiến caching bị tắt mà không báo cho bạn. Trường hợp đầu tiên là prefix ngắn hơn độ dài tối thiểu model cho phép cache: 512 token trên Fable 5, 1,024 trên Opus 4.8 và Sonnet 5, 2,048 trên Opus 4.7, và 4,096 trên Haiku 4.5. Prefix ngắn hơn sẽ không được cache và hệ thống không báo lỗi. Trường hợp thứ hai là các request chạy song song, vì "một cache entry chỉ khả dụng sau khi response đầu tiên bắt đầu". Mười request giống hệt được gửi cùng lúc đều phải trả giá input đầy đủ. Dấu hiệu của cả hai trường hợp là cache_read_input_tokens luôn bằng 0.

Lựa chọn model. Tính chi phí của cùng lượt đó trên Opus 4.8, với giá $5 input và $25 output, cache read ở mức $0.50 và cache write 5 phút ở mức $6.25 mỗi MTok: read là $0.0275, write là $0.0188, input không cache là $0.0100, output là $0.0300. Tổng cộng khoảng $0.086 mỗi lượt, cao gấp 2.5 lần lượt trên Sonnet, và khoảng $207 mỗi tháng với cùng volume. Chỉ một lựa chọn model đã đưa cùng một workload từ dưới phí Max gói entry lên mức cao hơn gấp đôi phí đó. Haiku 4.5 với giá $1 input và $5 output đưa chi phí theo hướng ngược lại, phù hợp với các tác vụ cơ học như phân loại log. Fable 5 còn đẩy chi phí theo hướng đắt hơn, với giá $10 input và $50 output. Vì vậy, hãy đọc những job nào thực sự bù được mức giá của Fable 5 trước khi chọn nó làm model mặc định.

Mức effort thuộc về lựa chọn model, vì thinking token được tính theo giá output. Trên Opus 4.8, giá trị mặc định của API là high, còn mức khởi đầu được tài liệu khuyến nghị cho công việc coding và agentic là xhigh, nhưng đắt hơn. Giảm mức này bằng /effort trong Claude Code hoặc bằng output_config.effort trên API. Còn một yếu tố làm thay đổi các ước tính cũ: model mới dùng tokenizer mới, tokenizer này "tạo ra nhiều hơn khoảng 30% token cho cùng một đoạn văn bản". Vì vậy, số lượng đo trên model cũ sẽ đánh giá thấp lượng token của cùng văn bản khi chạy hiện nay.

Vệ sinh session. API là stateless, nên mỗi lượt đều gửi lại toàn bộ conversation dưới dạng input được tính phí. Vì vậy, session dài có chi phí trên mỗi message cao hơn session mới. Đây là cơ chế đứng sau phần lớn hóa đơn bất ngờ và được phân tích chi tiết trong những gì thực sự tiêu thụ token trong một session Claude Code. Chạy /clear giữa các task không liên quan, vì context cũ được gửi lại và tính phí lại trong mọi message sau đó. Chạy /compact trong một task dài để history được tóm tắt thay vì giữ nguyên toàn bộ. Làm việc theo các đợt liên tục, vì cache mặc định "có thời hạn 5 phút" và "được refresh mà không phát sinh thêm chi phí mỗi lần nội dung đã cache được sử dụng". Một session chỉ được truy cập mỗi mười phút sẽ phải ghi cache lại sau mỗi lần. Một session Claude Code chạy trong tmux trên VPS ở trạng thái detached gần như không tốn chi phí khi idle, nhưng nếu idle quá thời hạn cache thì vẫn mất prefix đang warm.

Đo usage thực tế của bạn trước khi quyết định

Đừng quyết định dựa trên ví dụ của tôi. Hãy quyết định dựa trên usage của chính bạn trong một tuần.

Trong Claude Code, chạy /usage vào cuối mỗi session trong một tuần (/cost là alias cho cùng màn hình). Lệnh này báo số token của session và ước tính chi phí, với một lưu ý trong tài liệu: "Giá trị tính bằng dollar là ước tính được tính cục bộ từ số token và có thể khác với hóa đơn thực tế của bạn." Tổng số sẽ reset khi bạn chạy /clear, vì vậy hãy đọc màn hình trước. Với subscription, con số tính bằng dollar đó không phải là hóa đơn của bạn, nhưng số token đằng sau nó là dữ liệu mà công thức này cần. /context cho biết nội dung nào đang chiếm window.

Với tài khoản API, trang usage trong Claude Console là nguồn dữ liệu chính xác. Để tính giá một prompt trước khi gửi, client.messages.count_tokens() là "miễn phí nhưng chịu giới hạn requests per minute dựa trên usage tier của bạn", và đây là bộ đếm duy nhất dùng tokenizer mà bạn thực sự sẽ được tính phí.

Sau một lần gọi API, hãy đọc usage block và hiểu đúng các trường trong đó:

u = response.usage
total_input = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens

input_tokens chỉ đếm phần còn lại không nằm trong cache, được tài liệu mô tả là "số token sau cache breakpoint cuối cùng". Một turn báo input_tokens: 4000 không phải là turn có 4,000 token, và tổng của ba trường là kích thước prompt mà công thức này cần.

Sau đó hãy so sánh. Nếu mức sử dụng đo được trong tháng thấp hơn rõ rệt phí của plan, hãy chọn tính theo usage. Nếu cao hơn rõ rệt, hãy chọn plan, miễn là quota của plan đáp ứng được một ngày làm việc thông thường của bạn. Nếu mức sử dụng gần ranh giới, hãy chọn plan, vì plan không thể tạo ra khoản phí bất ngờ còn tính theo usage thì có thể. Nếu mức sử dụng thấp hơn nhiều ngay cả phí Pro, hãy xác định plan trả phí có phù hợp hơn free tier với cách bạn làm việc hay không trước khi chọn phương án nào, vì mức sử dụng nhẹ như vậy có thể không chạm giới hạn free đủ thường xuyên để biện minh cho bất kỳ khoản phí nào. Đây cũng không phải quyết định một chiều, vì hủy plan hoặc hạ tier vẫn giữ nguyên thời gian còn lại của tháng bạn đã trả phí nếu vài tuần sử dụng thực tế tiếp theo cho thấy ước tính của bạn không chính xác. Dù chọn phương án nào, phép tính này chỉ xác định mô hình tính phí nào rẻ hơn; còn chi phí đó có được bù lại bằng số giờ tiết kiệm hay không là một phép tính riêng, cần đối chiếu với đơn giá theo giờ của bạn.

FAQ

Claude API có rẻ hơn Claude Pro hoặc Max không?

Điều này phụ thuộc vào khối lượng sử dụng. Không có mức hòa vốn được công bố để tra cứu, vì các gói thuê bao được bán theo khoảng thời gian sử dụng thay vì hạn mức token. Tính giá một lượt điển hình theo đơn giá mỗi token đã công bố, nhân với số lượt mỗi ngày có hoạt động và số ngày hoạt động mỗi tháng, rồi so sánh kết quả với phí gói. Trong một ví dụ cụ thể, một lượt 60,000 token trên Sonnet 5 có giá khoảng $0.035, tương đương khoảng $83 mỗi tháng với 120 lượt mỗi ngày trong 20 ngày: cao hơn phí Pro nhưng thấp hơn phí Max cấp thấp nhất.

Làm cách nào để tính chi phí Claude API mỗi tháng?

Chạy /usage trong Claude Code trong 1 tuần để thu thập số token thực tế. Nếu đã có API account, bạn cũng có thể xem trang usage trong Claude Console. Sau đó tính giá cho một lượt: input không được cache tính theo đơn giá cơ bản, thao tác ghi cache tính bằng 1.25 lần input cơ bản, thao tác đọc cache tính bằng 0.1 lần input cơ bản, còn output tính theo đơn giá output; token dùng cho thinking cũng tính là output. Nhân kết quả với số lượt mỗi ngày có hoạt động và số ngày hoạt động mỗi tháng.

Điều gì ảnh hưởng nhiều nhất đến hóa đơn Claude API?

Prompt caching ảnh hưởng nhiều nhất. Một lượt 60,000 token trên Sonnet 5 có giá khoảng $0.035 khi prefix được phục vụ từ cache, và khoảng $0.132 khi không được phục vụ từ cache. Lựa chọn model đứng tiếp theo: cùng lượt đó trên Opus 4.8 có giá khoảng $0.086. Độ dài session đứng thứ ba, vì API là stateless và mỗi lượt đều gửi lại toàn bộ cuộc hội thoại dưới dạng input tính phí.

Gói thuê bao Claude có bao gồm quyền truy cập API không?

Hãy xem đây là 2 account với 2 hóa đơn riêng. API call được tính phí theo token đối với account bạn tạo trong Console. Không có nội dung nào trong tài liệu tôi đã kiểm tra cho biết gói thuê bao cấp credit API. Dấu hiệu rõ nhất cho thấy đây là 2 bề mặt riêng biệt là command /usage-credits của Claude Code, vốn “không khả dụng khi xác thực bằng API key”. Nhiều developer sử dụng cả 2: một gói cho việc lập trình tương tác và một key cho các ứng dụng họ tự xây dựng.