SSD Nodes Learn
Hướng dẫn Matt ConnorBởi Matt Connor

Claude API hay đăng ký thuê bao rẻ hơn?

So sánh chi phí giữa Claude API và gói thuê bao cố định. Xem cách tính điểm hòa vốn dựa trên giá mỗi token để biết phương án nào tiết kiệm cho bạn nhất.

Claude API có rẻ hơn đăng ký thuê bao không?

Claude API rẻ hơn đăng ký thuê bao nếu mức độ sử dụng dưới một ngưỡng nhất định, và đắt hơn nếu vượt quá ngưỡng đó. Với một developer lập trình tương tác cả ngày, gói trả phí cố định thường có lợi hơn. Với một chương trình tự thực hiện các lệnh gọi, API là lựa chọn duy nhất, nên chi phí không phải là yếu tố quyết định. Phần còn lại là các phép tính toán mà bạn có thể thực hiện trong mười phút.

Không có con số hòa vốn chính thức nào để tra cứu. Phía thuê bao được bán theo cửa sổ sử dụng thay vì định mức token, nên không có con số công bố nào cho bạn biết điểm giao nhau giữa hai loại. Dưới đây là công thức, được tính dựa trên tỷ lệ mỗi token hiện tại, cộng với các yếu tố hành vi cá nhân có thể làm thay đổi kết quả nhiều hơn cả phí thuê bao. Mọi con số hòa vốn dưới đây là tính toán của tôi dựa trên tỷ lệ đã công bố và các giả định đã nêu, không phải là một con số được tài liệu hóa.

Nếu bạn vẫn đang cân nhắc nên mua gói nào, gói Claude nào phù hợp với cách làm việc của bạn sẽ trả lời điều đó. Bài viết này giả định bạn đã biết mình sẽ mua gói nào, và muốn biết liệu có nên mua nó hay không.

Hai mô hình thanh toán không cùng hình thái

Thuê bao là dung lượng mà bạn có thể không dùng hết. Bạn trả một khoản phí cố định và nhận được một định mức được reset theo lịch trình. Tài liệu Claude Code của Anthropic nêu rõ hình thái cho các seat Team và Enterprise: mức sử dụng "trích từ định mức mỗi seat được reset theo cửa sổ lăn 5 giờ và cửa sổ hàng tuần", dùng chung với Claude chat và Cowork. Người dùng thuê bao gặp cùng một hình thái thông qua số lượng tin nhắn họ gửi, với thông báo "You've hit your session limit" và "You've hit your weekly limit". Dung lượng bạn không dùng hết là tiền bạn đã chi mất rồi. Dung lượng vượt quá sẽ khiến công việc của bạn bị dừng lại cho đến khi cửa sổ reset, và việc chuyển model với /model không giúp khôi phục quyền truy cập, vì các cửa sổ này được dùng chung cho tất cả các model.

API là một đồng hồ đo không bao giờ dừng. Không có cửa sổ và không có giới hạn. Mỗi request được tính giá theo token, và một số thứ được tính ngoài token: web search "có sẵn trên Claude API với giá $10 cho mỗi 1,000 lượt tìm kiếm". Không có gì bị dừng lại ở một giới hạn. Hóa đơn chỉ đơn giản là tăng lên.

Phí thuê bao tính đến ngày 23 tháng 7 năm 2026, trích dẫn từ trang giá của Claude: Pro là "$17 mỗi tháng với giảm giá đăng ký hàng năm ($200 thanh toán trước). $20 nếu thanh toán hàng tháng", và nó bao gồm Claude Code. Max được liệt kê là "Từ $100 mỗi tháng". Các seat Team bắt đầu từ "$20/seat/tháng nếu thanh toán hàng năm". Enterprise là gói thú vị nhất, vì nó chạy cả hai mô hình cùng lúc: "Giá seat + mức sử dụng theo tỷ lệ API $20/seat". Các mức phí thay đổi thường xuyên, và định mức đằng sau mỗi gói không bao giờ được công bố bằng token, vì vậy hãy đọc trang giá vào ngày bạn quyết định.

Những gì bạn không thể có từ API

Định mức của gói thuê bao, và giao diện được xây dựng xung quanh nó. Lệnh /usage-credits của Claude Code quản lý các credit sử dụng thuê bao, và bạn chạy nó "sau khi đăng nhập bằng gói đăng ký claude.ai thông qua /login; lệnh này không khả dụng với xác thực bằng API key." Màn hình /usage cũng khác nhau tùy theo chế độ thanh toán: khối Session của nó "hiển thị mức sử dụng token API và dành cho người dùng API", trong khi người dùng thuê bao thấy các thanh mức độ sử dụng của gói và bảng phân tích sử dụng.

Prompt cache dài hơn trong Claude Code. Cái này tốn tiền thật và rất dễ bị bỏ lỡ. Tài liệu nói rằng "Thời gian tồn tại là một giờ đối với gói thuê bao và giảm xuống còn năm phút khi bạn sử dụng credit; đối với API key hoặc nhà cung cấp cloud, mặc định là năm phút". Tin nhắn đầu tiên của bạn sau một khoảng nghỉ dài hơn thời gian tồn tại của cache sẽ không tận dụng được cache, vì vậy toàn bộ context sẽ bị xử lý lại và bị tính phí theo giá write. Với gói thuê bao, bạn có thể họp trong 50 phút và quay lại với trạng thái "warm". Với API key, cùng một khoảng nghỉ đó sẽ tốn toàn bộ chi phí re-write cho session prefix.

Những gì bạn không thể có từ một gói thuê bao

Truy cập lập trình. Một cron job hoặc một webhook handler gọi Claude cần một API key, vì vậy nếu đó là khối lượng công việc của bạn thì việc so sánh kết thúc tại đây. Xây dựng ứng dụng Claude API đầu tiên trên VPS sẽ đề cập đến việc xử lý key và script hoạt động đầu tiên.

Giảm giá Batch API. Trang giá nêu rõ: "Batch API cho phép xử lý bất đồng bộ một lượng lớn request với mức giảm giá 50% cho cả token input và output." Điều đó giúp giảm một nửa chi phí cho bất kỳ công việc nào mà con người không cần chờ đợi kết quả ngay. Tỷ lệ Batch trên mỗi triệu token là $2.50 input và $12.50 output trên Opus 4.8, $1 và $5 trên Sonnet 5 ở mức giá dùng thử, và $0.50 và $2.50 trên Haiku 4.5. Sự đánh đổi là độ trễ: hầu hết các batch hoàn thành trong vòng một giờ, một batch không hoàn thành trong vòng 24 giờ sẽ hết hạn, và streaming không thể chạy batch. Batch và prompt caching có thể dùng cùng nhau, và vì một batch có thể chạy lâu hơn năm phút, hãy sử dụng cache 1 giờ bên trong đó.

Gán chi phí cho từng dự án. Mỗi phản hồi API đều trả về một khối usage, vì vậy bạn có thể log chi phí của một request duy nhất và gán nó cho một dự án hoặc một khách hàng. Một gói thuê bao chỉ báo cáo một tập hợp các thanh mức độ sử dụng cho người giữ seat đó.

Hãy lưu ý một điều quan trọng, vì rất dễ nhầm lẫn theo cả hai hướng: đây là hai bề mặt thanh toán riêng biệt. Tài liệu của Anthropic chuyển hướng thanh toán thuê bao sang hỗ trợ claude.ai và thanh toán Console sang nền tảng API, và /usage-credits không hoạt động dưới một API key. Không có gì tôi đã kiểm tra nói rằng gói thuê bao bao gồm credit API, vì vậy hãy lên kế hoạch cho hai tài khoản và hai hóa đơn.

Công thức hòa vốn

Tính giá cho một lượt (turn), sau đó nhân lên theo quy mô.

turn cost = uncached_input_tokens x base_input_price
          + cache_write_tokens    x 1.25 x base_input_price
          + cache_read_tokens     x 0.10 x base_input_price
          + output_tokens         x output_price

monthly API cost = turn cost x turns_per_active_day x active_days_per_month

break even when: monthly API cost = flat plan fee

Các hệ số nhân đã được công bố, không phải ước tính. Một lần cache write 5 phút tốn "1.25x giá input cơ bản", một lần write 1 giờ tốn "2x giá input cơ bản", và một lần cache read tốn "0.1x giá input cơ bản". Thinking tokens được tính như output tokens, vì vậy chúng thuộc về output_tokens ngay cả trên các model không hiển thị tóm tắt reasoning.

Tỷ lệ cơ bản trên mỗi triệu token (MTok), hiện tại vào ngày 23 tháng 7 năm 2026:

  • claude-fable-5: $10 input, $50 output. Cache read $1. 5-minute cache write $12.50. 1M context.
  • claude-opus-4-8claude-opus-4-7: $5 input, $25 output. Cache read $0.50. 5-minute cache write $6.25. 1M context.
  • claude-sonnet-5: $2 input, $10 output ở mức giá dùng thử đến ngày 31 tháng 8 năm 2026, sau đó là $3 và $15. Ở mức giá dùng thử, cache read $0.20 và 5-minute cache write $2.50. 1M context.
  • claude-haiku-4-5: $1 input, $5 output. Cache read $0.10. 5-minute cache write $1.25. 200K context.

Không có phụ phí cho context dài: "Một request 900k-token được tính cùng mức giá mỗi token như một request 9k-token."

Một ví dụ thực tế, với các giả định được ghi lại

Giả sử một lượt Claude Code trung bình trên Sonnet 5 mang theo 60,000 tokens context: 55,000 tokens lấy từ cache, 3,000 tokens mới được write vào cache, 2,000 tokens input mới chưa có cache, và 1,200 tokens output bao gồm cả thinking.

  • Cache reads: 55,000 x $0.20/MTok = $0.0110
  • Cache writes: 3,000 x $2.50/MTok = $0.0075
  • Uncached input: 2,000 x $2.00/MTok = $0.0040
  • Output: 1,200 x $10.00/MTok = $0.0120

Tổng cộng khoảng $0.035 mỗi lượt. Với 120 lượt trong một ngày làm việc, khoảng $4.14 một ngày. Với 20 ngày làm việc một tháng, khoảng $83 một tháng.

So sánh con số đó với các mức phí cố định ở trên, nó cho thấy hai điều cùng một lúc. Nó cao hơn khoảng bốn lần phí Pro, vì vậy Pro rẻ hơn trên lý thuyết, với điều kiện định mức của nó đáp ứng được 120 lượt Sonnet mỗi ngày. Điều kiện đó là thứ mà không con số công bố nào có thể chốt cho bạn. Con số $83 tương tự cũng nằm dưới mức phí Max khởi điểm, vì vậy ở đây API rẻ hơn Max.

Bây giờ hãy thay đổi từng giả định một, và bạn sẽ thấy phí thuê bao không còn là con số quyết định nữa.

Ba yếu tố làm thay đổi điểm hòa vốn nhiều hơn cả giá gói

Prompt caching. Chạy cùng một lượt 60,000-token mà không có caching, toàn bộ prompt sẽ bị tính như input mới: 60,000 x $2.00/MTok = $0.12, cộng với $0.012 output, vậy là $0.132 mỗi lượt. Con số đó gần gấp bốn lần lượt có cache, và nó biến $83 một tháng thành khoảng $317. Đây là điểm hòa vốn duy nhất mà Anthropic công bố, vì nó không phụ thuộc vào khối lượng công việc của bạn: "Một cache hit tốn 10% giá input tiêu chuẩn, nghĩa là caching sẽ có lợi chỉ sau một lần cache read cho thời gian 5 phút (1.25x write), hoặc sau hai lần cache read cho thời gian 1 giờ (2x write)."

Có hai lỗi khiến caching bị tắt mà không thông báo. Thứ nhất là prefix ngắn hơn độ dài tối thiểu có thể cache của model: 512 tokens trên Fable 5, 1,024 trên Opus 4.8 và Sonnet 5, 2,048 trên Opus 4.7, và 4,096 trên Haiku 4.5. Một prefix ngắn hơn sẽ không cache, và không có lỗi nào được báo lên. Thứ hai là các request song song, vì "một entry cache chỉ khả dụng sau khi response đầu tiên bắt đầu." Mười request giống hệt nhau được gửi cùng lúc đều phải trả toàn bộ giá input. Dấu hiệu nhận biết cho cả hai là cache_read_input_tokens nằm ở mức zero.

Lựa chọn model. Tính giá cho lượt tương tự trên Opus 4.8, với $5 input và $25 output, với cache reads là $0.50 và 5-minute writes là $6.25 mỗi MTok: reads $0.0275, writes $0.0188, uncached input $0.0100, output $0.0300. Đó là khoảng $0.086 mỗi lượt, gấp 2.5 lần lượt Sonnet, và khoảng $207 một tháng với cùng khối lượng. Một lựa chọn model đã đẩy cùng một công việc từ dưới mức phí Max khởi điểm lên hơn gấp đôi nó. Haiku 4.5 với $1 và $5 sẽ đẩy nó theo hướng ngược lại cho các công việc máy móc như phân loại log.

Mức độ nỗ lực thuộc về lựa chọn model, vì thinking tokens được tính theo giá output. Trên Opus 4.8, mặc định của API là high, và điểm bắt đầu được tài liệu hóa cho công việc coding và agentic là xhigh đắt hơn. Giảm nó xuống bằng /effort trong Claude Code hoặc bằng output_config.effort trên API. Một điều nữa làm thay đổi các ước tính cũ: các model mới hơn sử dụng tokenizer mới hơn "tạo ra xấp xỉ 30% nhiều token hơn cho cùng một văn bản", vì vậy một số lượng được đo trên model cũ sẽ thấp hơn thực tế của cùng văn bản đó ngày nay.

Vệ sinh session. API là stateless, vì vậy mỗi lượt sẽ gửi lại toàn bộ hội thoại dưới dạng input được tính phí. Do đó, một session dài sẽ tốn nhiều chi phí hơn mỗi tin nhắn so với một session mới, đây là cơ chế đằng sau hầu hết các hóa đơn bất ngờ và đã được giải thích chi tiết trong thực sự tiêu tốn token trong một session Claude Code. Chạy /clear giữa các tác vụ không liên quan, vì context cũ sẽ bị gửi lại và tính phí lại trong mỗi tin nhắn sau đó. Chạy /compact bên trong một tác vụ dài, để history được tóm tắt thay vì mang theo toàn bộ. Làm việc theo các đợt liên tục, vì cache mặc định "có thời gian tồn tại 5 phút" và "được làm mới mà không tốn thêm chi phí mỗi khi nội dung đã cache được sử dụng". Một session mà bạn chạm vào 10 phút một lần sẽ phải trả phí re-write mỗi lần. Một Claude Code session chạy trong tmux trên VPS tách biệt sẽ tốn gần như không đáng kể khi nó ở trạng thái idle, nhưng nếu idle quá thời gian tồn tại của cache, bạn vẫn mất đi prefix đã được warm.

Hãy đo lường mức sử dụng của chính bạn trước khi quyết định

Đừng quyết định dựa trên ví dụ của tôi. Hãy quyết định dựa trên một tuần của chính bạn.

Trong Claude Code, hãy chạy /usage vào cuối mỗi session trong một tuần (/cost là bí danh cho cùng một màn hình). Nó báo cáo số lượng token của session và ước tính chi phí, với một lưu ý từ tài liệu: "Con số đô la là một ước tính được tính toán cục bộ từ số lượng token và có thể khác với hóa đơn thực tế của bạn." Tổng số sẽ reset khi bạn chạy /clear, vì vậy hãy đọc màn hình trước. Với gói thuê bao, con số đô la đó không phải là hóa đơn của bạn, nhưng số lượng token đằng sau nó là thứ mà công thức này cần. /context cho biết cái gì đang làm đầy cửa sổ.

Trên tài khoản API, trang usage trong Claude Console là bản ghi chính xác nhất. Để tính giá một prompt trước khi gửi, client.messages.count_tokens() "miễn phí sử dụng nhưng tuân theo giới hạn rate limit requests mỗi phút dựa trên tier sử dụng của bạn", và đó là cách đếm duy nhất sử dụng tokenizer mà bạn sẽ thực sự bị tính phí.

Sau một lệnh gọi, hãy đọc khối usage, và đọc nó một cách chính xác:

u = response.usage
total_input = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens

input_tokens chỉ đếm phần còn lại chưa được cache, được tài liệu hóa là "tokens sau breakpoint cache cuối cùng". Một lượt báo cáo input_tokens: 4000 không phải là một lượt 4,000-token, và ba trường cộng lại mới là kích thước prompt mà công thức này cần.

Sau đó hãy so sánh. Nếu tháng đo được của bạn nằm rõ ràng dưới phí thuê bao, hãy chọn API. Nếu nó nằm rõ ràng trên, hãy chọn thuê bao, miễn là định mức của nó đáp ứng được một ngày làm việc bình thường của bạn. Nếu nó nằm gần ranh giới, hãy chọn thuê bao, vì một gói thuê bao không thể làm bạn bất ngờ nhưng API thì có thể.

FAQ

Claude API có rẻ hơn Claude Pro hay Max không?

Tùy thuộc vào khối lượng, và không có điểm hòa vốn công bố nào để tra cứu, vì các gói thuê bao được bán theo cửa sổ sử dụng thay vì định mức token. Hãy tính giá một lượt điển hình từ tỷ lệ mỗi token đã công bố, nhân với số lượt mỗi ngày làm việc và số ngày làm việc mỗi tháng, sau đó so sánh con số đó với phí thuê bao. Trong một ví dụ thực tế, một lượt Sonnet 5 60,000-token tốn khoảng $0.035, tức khoảng $83 một tháng với 120 lượt mỗi ngày trong 20 ngày: cao hơn phí Pro, thấp hơn mức phí Max khởi điểm.

Làm thế nào để tính chi phí Claude API hàng tháng của tôi?

Chạy /usage trong Claude Code trong một tuần để thu thập số lượng token thực tế, hoặc đọc trang usage trong Claude Console nếu bạn đã có tài khoản API. Sau đó tính giá một lượt: input chưa cache ở mức giá cơ bản, cache write ở mức 1.25 lần giá input cơ bản, cache read ở mức 0.1 lần giá input cơ bản, và output ở mức giá output, tính thinking tokens là output. Nhân với số lượt mỗi ngày làm việc và số ngày làm việc mỗi tháng.

Điều gì làm thay đổi hóa đơn Claude API nhiều nhất?

Prompt caching, hơn bất cứ thứ gì khác. Một lượt 60,000-token trên Sonnet 5 tốn khoảng $0.035 khi prefix được lấy từ cache và khoảng $0.132 khi không có. Lựa chọn model đứng thứ hai: cùng một lượt trên Opus 4.8 tốn khoảng $0.086. Độ dài session đứng thứ ba, vì API là stateless và mỗi lượt sẽ gửi lại toàn bộ hội thoại dưới dạng input được tính phí.

Gói thuê bao Claude có bao gồm quyền truy cập API không?

Hãy coi chúng là hai tài khoản với hai hóa đơn riêng biệt. Các lệnh gọi API được tính phí theo token dựa trên tài khoản bạn tạo trong Console, và không có gì trong tài liệu tôi đã kiểm tra nói rằng gói thuê bao cấp credit API. Dấu hiệu rõ ràng nhất cho thấy chúng là hai bề mặt riêng biệt là lệnh /usage-credits của Claude Code, lệnh này "không khả dụng với xác thực bằng API key". Nhiều developer sở hữu cả hai: một gói thuê bao để lập trình tương tác, và một key cho những thứ họ xây dựng.