So sánh chi phí API Claude và ChatGPT: Đâu là lựa chọn rẻ?
Không có API nào rẻ nhất cho mọi tác vụ. Bạn cần hiểu cách tính token, xem bảng giá ba khối lượng công việc thực tế để biết chính xác khi nào hóa đơn Claude sẽ cao hơn.
Câu trả lời ngắn gọn
Việc so sánh giá API giữa Claude và ChatGPT không có người chiến thắng tuyệt đối, vì hai nhà cung cấp này định giá input và output khác nhau ở mỗi bậc (tier). Tính đến tháng 8 năm 2026, hai bậc cao nhất của Claude tính phí mỗi input token tương đương với các đối thủ từ OpenAI và tính phí thấp hơn cho mỗi output token, vì vậy Claude có lợi thế hơn một chút đối với các tác vụ nặng về output. Ở bậc thấp, Claude có chi phí cao hơn gấp nhiều lần cho cùng một công việc. Bất kỳ câu trả lời nào không nêu rõ bậc và tỷ lệ token đều chỉ là phỏng đoán.
Vì vậy, trang này sẽ cung cấp cho bạn các phép tính trước, sau đó là ba khối lượng công việc được tính toán chi phí với tỷ lệ token tương ứng, và cuối cùng là các hệ số nhân làm thay đổi hóa đơn thực tế nhiều hơn so với mức giá niêm yết.
Công thức duy nhất bạn cần
Cả hai API đều tính phí văn bản theo cùng một cách. Bạn trả tiền cho các token bạn gửi đi và trả mức giá cao hơn cho các token mà model phản hồi lại.
cost = (input tokens / 1,000,000) * input rate + (output tokens / 1,000,000) * output rate
Một token tương đương khoảng 4 ký tự tiếng Anh, hoặc gần 0,75 từ. Chỉ dùng con số này để ước tính sơ bộ. Để tính hóa đơn thực tế, bạn hãy sử dụng số lượng mà mỗi API trả về trong đối tượng usage của mọi phản hồi.
# Rates are US dollars per million tokens.
def cost(in_tok, out_tok, in_rate, out_rate):
return in_tok / 1e6 * in_rate + out_tok / 1e6 * out_rate
# One support-chat turn: 1,400 tokens in, 220 tokens out, on a $2 / $10 model.
print(round(cost(1400, 220, 2.0, 10.0), 6))Script in ra 0.005, tương đương nửa xu cho mỗi lượt. Nhân con số này với số lượt bạn dự kiến trong một tháng và bạn sẽ có ngân sách. Hãy nắm vững công thức này, mọi thay đổi về giá sau hôm nay sẽ chỉ là một dòng chỉnh sửa thay vì phải phân tích lại từ đầu.
Các mức giá công bố, tháng 8 năm 2026
Đây là danh sách giá niêm yết mà cả hai nhà cung cấp đã công bố vào ngày 1 tháng 8 năm 2026. Khối này là nơi duy nhất trong bài viết có ghi giá. Hãy đối chiếu với claude.com/pricing và trang giá của OpenAI trước khi bạn chốt ngân sách.
The data behind this chart
[
{
"label": "Frontier",
"claude_input": 5,
"claude_output": 25,
"openai_input": 5,
"openai_output": 30
},
{
"label": "Workhorse",
"claude_input": 2,
"claude_output": 10,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Workhorse from September",
"claude_input": 3,
"claude_output": 15,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Small",
"claude_input": 1,
"claude_output": 5,
"openai_input": 0.2,
"openai_output": 1.2
}
]Việc ghép cặp dựa trên vị trí trong dòng sản phẩm của mỗi bên, không phải dựa trên độ phổ biến. Frontier là Claude Opus 5 so với gpt-5.6-sol. Workhorse là Claude Sonnet 5 so với gpt-5.6-terra. Small là Claude Haiku 4.5 so với gpt-5.6-luna. Cả hai nhà cung cấp đều bán các gói cao cấp hơn nằm ngoài khối này, và OpenAI vẫn giữ các thế hệ cũ trong danh sách với mức giá gốc. Việc so sánh một model flagship của bên này với một model giá rẻ của bên kia sẽ tạo ra một con số vô nghĩa, đây cũng là cách mà hầu hết các bài so sánh công khai dùng để giật tít.
Có hai điều trong khối đó cần được làm rõ. 2 và 10 của Sonnet 5 là mức giá ưu đãi giới thiệu, và Anthropic ghi chú rằng chúng sẽ kết thúc vào ngày 31 tháng 8 năm 2026, sau đó Sonnet 5 sẽ tính phí 3 và 15. Thay đổi đó biến phân khúc workhorse từ chỗ Claude thắng sát nút thành OpenAI thắng rõ rệt, và nó sẽ xảy ra ngay trong thời hạn hiệu lực của bài viết này.
Điều thứ hai là một quy luật đáng ghi nhớ: Claude tính phí output chính xác gấp 5 lần mức giá input của chính nó trên mọi hàng ở trên, còn OpenAI tính phí gấp 6 lần. Tỷ lệ đó, chứ không phải mức giá tuyệt đối, mới là yếu tố quyết định bên nào thắng dựa trên hỗn hợp token của bạn.
Tại sao giá trên mỗi triệu token không thể so sánh giữa các nhà cung cấp
Giá là số đô la trên mỗi token. Hóa đơn là số đô la trên mỗi token nhân với số lượng token, và số lượng token cho một đoạn văn bản là thuộc tính của mô hình, không phải của văn bản.
Anthropic ghi lại điều này trực tiếp: Các mô hình Claude 4.7 trở về sau, bao gồm Claude Opus 5 và Claude Sonnet 5, sử dụng bộ tokenizer mới hơn tạo ra số lượng token nhiều hơn khoảng 30% cho cùng một văn bản so với Claude Sonnet 4.6 và các phiên bản cũ hơn. Giá không thay đổi. Nhưng hóa đơn thì có.
Vì vậy, hai mức giá trông có vẻ giống hệt nhau không tạo ra hai hóa đơn giống hệt nhau. Hãy đếm token trên cả hai phía, bằng văn bản của chính bạn, trước khi bạn tin tưởng bất kỳ sự so sánh nào bao gồm cả so sánh này.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached contract."}]
}'Một phản hồi hợp lệ là một đối tượng JSON nhỏ chứa input_tokens. Một 401 có nghĩa là biến key đang trống trong shell của bạn. Hãy chạy cùng một văn bản qua bộ tokenizer của nhà cung cấp khác, chia số lượng này cho số lượng kia, sau đó nhân tỷ lệ đó với mức giá đã công bố trước khi bạn so sánh. Nếu tỷ lệ này nghiêng về một nhà cung cấp với mức chênh lệch hơn khoảng 1.2, nó sẽ vượt qua mọi sự khác biệt về giá trong khối bên trên.
Kịch bản một: tính năng chat
Một trợ lý hỗ trợ bên trong ứng dụng web. 120.000 lượt mỗi tháng. Mỗi lượt gửi một system prompt, các tool schema, hai đoạn trích từ help-desk và một vài tin nhắn trước đó, khoảng 1.400 input token, và model trả lời trong khoảng 220 token. Vì có tính tương tác, chiết khấu theo batch không bao giờ áp dụng được ở đây. Hãy chạy nó trên tier workhorse.
The data behind this chart
[
{
"label": "List price",
"claude_usd": "600.00",
"openai_usd": "652.80"
},
{
"label": "Cached prefix",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Small tier, cached",
"claude_usd": "213.60",
"openai_usd": "48.00"
}
]Theo giá niêm yết, Claude tính phí 600.00 so với 652.80 của OpenAI. Các phần input là giống hệt nhau vì mức giá input là như nhau. Toàn bộ chênh lệch nằm ở output, và Claude thắng với biên độ quá nhỏ để phải chọn nhà cung cấp dựa trên yếu tố này.
Bây giờ, hãy đánh dấu 800 trong số 1.400 input token đó là một stable prefix: system prompt và các tool schema, những thứ không thay đổi giữa các lượt. Cả hai nhà cung cấp đều tính phí 10% mức giá input cơ bản cho một cache hit. Hóa đơn của Claude giảm xuống còn 427.20 và của OpenAI là 480.00. Caching có giá trị hơn việc chọn nhà cung cấp, và cả hai nền tảng đều cung cấp tính năng này.
Đây là điểm mà Claude thua. Hầu hết các câu trả lời hỗ trợ không cần một model workhorse. Chuyển cùng lưu lượng đó sang tier small, Claude tính phí 213.60 trong khi OpenAI tính 48.00. Chia con số này cho nhau, Claude tốn kém gấp khoảng bốn lần rưỡi cho cùng một công việc. Claude Haiku 4.5 tính phí 1 cho mỗi triệu input token so với gpt-5.6-luna ở mức 0.2, và không lượng caching nào có thể khỏa lấp khoảng cách gấp năm lần. Nếu workload của bạn phù hợp với một model nhỏ, OpenAI rẻ hơn và biên độ chênh lệch là rất lớn.
Kịch bản hai: pipeline tài liệu ngữ cảnh dài
25.000 hợp đồng mỗi tháng. Mỗi yêu cầu chứa cùng một tập lệnh và schema JSON dài 9.000 token, sau đó là 12.000 token văn bản hợp đồng, và model trả về khoảng 700 token các trường dữ liệu có cấu trúc. Output chiếm dưới 4% tổng số token trong tác vụ này, và chính thực tế đó quyết định kết quả so sánh.
The data behind this chart
[
{
"label": "Chat feature",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Document pipeline",
"claude_usd": "820.00",
"openai_usd": "855.00"
},
{
"label": "Coding agent",
"claude_usd": "116.10",
"openai_usd": "124.20"
}
]Với phần tiền tố 9.000 token được cache ở cả hai bên, Claude tính phí 820.00 và OpenAI tính phí 855.00. Chi phí cho phần input khớp nhau đến từng xu, vì giá input tiêu chuẩn khớp nhau vào tháng 8 năm 2026. Toàn bộ sự khác biệt nằm ở phần output, được định giá gấp 5 lần input trên Claude và gấp 6 lần trên OpenAI.
Tác vụ này cũng hỗ trợ batch. Cả hai nhà cung cấp đều giảm 50% phí input và output cho các tác vụ bất đồng bộ, vì vậy cả hai tổng chi phí đều giảm một nửa và khoảng cách chênh lệch vẫn giữ nguyên. Batch là mức chiết khấu đơn lẻ lớn nhất trên cả hai nền tảng, và một pipeline tài liệu chạy hàng đêm luôn có thể tận dụng nó.
Điểm bất lợi của Claude nằm ở logic phân tầng tương tự như trước. Trích xuất trường dữ liệu dựa trên một schema cố định chính xác là công việc mà một model nhỏ thực hiện tốt, và input chiếm 97% số token ở đây. Việc chuyển xuống một tầng thấp hơn giúp nhân tỷ lệ input của OpenAI với 0,1 và tỷ lệ input của Claude với 0,5. Hãy kiểm thử model nhỏ trên 200 tài liệu trước khi bạn cho rằng mình cần model lớn hơn, sử dụng cùng quy trình đánh giá mà bạn sẽ chạy để chọn tầng Claude phù hợp cho công việc.
Kịch bản ba: một coding agent luôn hoạt động
Một lập trình viên chạy một agent trên VPS, khoảng 900 lượt model mỗi tháng. Mỗi lượt mang theo khoảng 60.000 token input là ngữ cảnh của repository, trong đó 80% là cache hit, và tạo ra khoảng 1.800 token cho các chỉnh sửa và giải thích. Hãy tính giá ở tier frontier, vì lập trình là nơi khoảng cách năng lực gây tốn kém chi phí thực tế.
Claude tính phí 116.10 so với 124.20 của OpenAI. Với cùng tốc độ input, cùng tốc độ đọc cache, và tốc độ output thấp hơn của Claude giúp tiết kiệm khoảng 7%.
Mức 7% đó nằm trong biên độ sai số của tokenizer đã đề cập trước đó, vì vậy hãy coi kịch bản này là hòa về chi phí. Điều không hòa là mô hình tính phí. Đối với một lập trình viên ở mức sử dụng này, một gói subscription thường có chi phí thấp hơn so với các cuộc gọi API tính phí theo lưu lượng, và toàn bộ phép so sánh sẽ thay đổi khi bạn đưa gói subscription vào. Hãy tính toán kỹ điều đó với phép so sánh chi phí API và subscription trước khi bạn đặt một agent vào chế độ tính phí theo lưu lượng. Nếu bạn thực hiện tính phí theo lưu lượng, trước tiên hãy tìm hiểu xem các token đi đâu, vì mức sử dụng token của một coding agent bị chi phối bởi ngữ cảnh được gửi lại trong mỗi lượt thay vì mã nguồn mà nó viết ra.
Các hệ số quyết định hóa đơn
Mức giá niêm yết là mục nhỏ nhất trong danh sách này. Mỗi mục dưới đây làm thay đổi hóa đơn thực tế nhiều hơn cả sự chênh lệch giữa hai nhà cung cấp ở cùng một cấp độ.
Cached input. Cả hai nhà cung cấp đều tính phí 10% giá input cơ bản cho mỗi lần cache hit. Anthropic cũng tính phí ghi vào cache: gấp 1,25 lần input cơ bản cho mục nhập 5 phút và gấp 2 lần cho mục nhập 1 giờ, và một lần hit sau đó sẽ làm mới mục nhập đó với giá đọc. Do đó, một mục nhập 5 phút sẽ tự hoàn vốn sau một lần đọc. Khối lượng công việc có khoảng cách dài giữa các yêu cầu sẽ ghi nhiều hơn đọc, và ở đó việc sử dụng cache tốn kém hơn là tiết kiệm. Lưu lượng ổn định tận dụng cache tốt. Lưu lượng không ổn định (bursty) thì không.
Batch discounts. Giảm 50% cho input và output trên cả hai nền tảng, chỉ áp dụng cho công việc bất đồng bộ. Nếu tác vụ có thể chờ đợi, điều này giúp giảm một nửa hóa đơn trên bất kỳ nhà cung cấp nào, và nó có thể cộng dồn với caching.
Output share. Claude tính phí gấp 5 lần mức giá input cho output. OpenAI tính gấp 6 lần. Càng nhiều token của bạn được ghi thay vì đọc, Claude càng có lợi thế ở mức giá input tương đương, và điều ngược lại đúng với công việc thiên về input.
Retries. Một lần retry sẽ phải trả phí cho toàn bộ input một lần nữa và không trả về kết quả hữu ích nào. Nếu 6% số lần gọi của bạn thất bại khi kiểm tra schema và bị retry, phần input của bạn sẽ lớn hơn 6% so với kế hoạch. Hãy ghi log các lần retry như một dòng chi phí, không phải dòng lỗi. Các đội ngũ thường tìm ra hệ số này sau cùng, và nó thường lớn hơn cả khoảng cách chênh lệch giữa các nhà cung cấp mà họ đã mất cả tuần để tranh luận.
Bên nào thua và ở đâu
Claude thua hoàn toàn ở phân khúc nhỏ. gpt-5.6-luna tính phí 0.2 cho mỗi triệu input token so với Claude Haiku 4.5 ở mức 1, với output ở mức 1.2 so với 5. Việc phân loại khối lượng lớn và trích xuất ngắn tốn kém gấp khoảng bốn lần trên Claude.
Claude thua ở phân khúc phổ thông từ ngày 1 tháng 9 năm 2026, khi mức giá ưu đãi kết thúc và Sonnet 5 chuyển sang 3 và 15 so với gpt-5.6-terra không đổi. Claude thắng ở phân khúc cao cấp về giá output, với biên độ mà chính số lượng token của bạn có thể xóa bỏ. Không bên nào thắng ở các tác vụ thiên về input trong tháng 8 năm 2026, vì ở mức 2 cho mỗi triệu token ở cả hai bên, các phần input có cùng con số.
Cách đo lường trên lưu lượng truy cập của chính bạn
Đọc đối tượng usage trên mỗi phản hồi và lưu trữ bốn con số cho mỗi yêu cầu: input tokens, output tokens, cache read tokens và cache write tokens. Trên Claude API, các giá trị này xuất hiện dưới dạng input_tokens, output_tokens, cache_read_input_tokens và cache_creation_input_tokens. Hãy tính tổng theo ngày, nhân với mức giá hiện tại và so sánh tổng số của bạn với hóa đơn. Khoảng cách giữa hai con số này thường là do các lần thử lại (retries) hoặc một luồng mã mà bạn quên rằng mình đã phát hành.
Hãy chạy so sánh trên một tuần lưu lượng truy cập thực tế thay vì trên một prompt mẫu, và so sánh chi phí trên mỗi tác vụ hoàn thành thay vì chi phí trên mỗi token. Một model trả lời trong một lần thử với mức giá gấp đôi sẽ rẻ hơn một model cần ba lần thử với mức giá bằng một nửa. Chi phí trên mỗi token là một mức giá. Chi phí trên mỗi tác vụ hoàn thành là hóa đơn thực tế của bạn.
Thiết lập hạn mức chi tiêu cứng trước khi bạn để bất kỳ thứ gì chạy. Cả hai nền tảng đều hiển thị giới hạn chi tiêu trong bảng điều khiển của họ, và một agent bị kẹt trong vòng lặp thử lại có thể tiêu tốn ngân sách cả tháng chỉ trong một đêm. Hãy thiết lập điều đó theo cách bạn thực hiện cho kiểm soát chi phí trên một agent luôn chạy. Nếu bạn đang xây dựng phiên bản đầu tiên trên một server mà bạn sở hữu, ứng dụng Claude API đầu tiên trên VPS sẽ bao gồm việc xử lý key và vòng lặp yêu cầu mà các phép tính này dựa trên đó.
FAQ
Claude API có rẻ hơn ChatGPT API không?
Không nhất quán. Vào tháng 8 năm 2026, các tier frontier và workhorse tính phí mỗi input token như nhau ở cả hai bên, và Claude tính phí ít hơn cho mỗi output token, vì vậy Claude rẻ hơn vài phần trăm đối với các tác vụ nặng về output. Ở tier nhỏ, gpt-5.6-luna của OpenAI có chi phí bằng một phần năm so với Claude Haiku 4.5 cho mỗi input token, vì vậy việc phân loại khối lượng lớn sẽ rẻ hơn nhiều trên OpenAI. Hãy tự tính toán con số dựa trên hỗn hợp token của riêng bạn, vì biên độ nhỏ như vậy được quyết định bởi khối lượng công việc của bạn thay vì bảng giá.
Tại sao cùng một từ ngữ lại tốn số lượng token khác nhau trên mỗi API?
Vì mỗi model có một tokenizer riêng, và số lượng token là thuộc tính của model đó. Anthropic ghi nhận rằng Claude 4.7 và các model sau này tạo ra nhiều token hơn khoảng 30% cho cùng một văn bản so với Claude Sonnet 4.6 và các phiên bản trước đó. Hãy gửi văn bản của bạn đến endpoint đếm token của từng nhà cung cấp, chia số lượng này cho số lượng kia, sau đó nhân tỷ lệ đó với mức giá đã công bố trước khi so sánh. Chênh lệch 20% về token sẽ lớn hơn hầu hết các chênh lệch về mức giá đã công bố.
Prompt caching có bao giờ làm hóa đơn tăng lên không?
Có, trên Anthropic. Một lần ghi vào cache tốn gấp 1,25 lần mức giá input cơ bản cho mục nhập 5 phút và gấp 2 lần cho mục nhập 1 giờ, trong khi một lần hit tốn 0,1 lần. Nếu traffic của bạn có tính chất bùng phát (bursty) đến mức hầu hết các mục nhập hết hạn trước khi có bất kỳ thứ gì đọc chúng, bạn sẽ phải trả phí ghi cao hơn mà không thu được lượt đọc nào. Hãy so sánh cache_creation_input_tokens với cache_read_input_tokens trong log của bạn. Tỷ lệ gần bằng 1 nghĩa là caching đang làm bạn tốn tiền, vì vậy hãy kéo dài thời gian lưu hoặc bỏ nó đi.
Tôi nên chạy coding agent trên API hay trên gói đăng ký (subscription)?
Đối với một lập trình viên với khối lượng công việc thông thường, một suất đăng ký thường tốn ít chi phí hơn so với thanh toán API theo mức sử dụng, vì một coding agent gửi lại một context lớn trong mỗi lượt và context đó bị tính phí mỗi lần. Hãy đo lường trong một tuần trước, sau đó so sánh tổng chi phí API với giá của suất đăng ký. API sẽ có lợi hơn khi mức sử dụng không ổn định, hoặc khi bạn cần quyền truy cập theo lập trình mà một suất đăng ký không cung cấp cho bạn.