SSD Nodes Learn Hosting plans →
Hướng dẫn Matt ConnorBởi Matt Connor · Cập nhật ngày 2026-08-27

Chọn model Claude nào tối ưu chi phí API?

So sánh giá Claude Opus 4.8, Sonnet 5 và Haiku 4.5 cập nhật tháng 7/2026. Phân tích chi phí thực tế cho 100.000 tác vụ và các thiết lập ảnh hưởng trực tiếp đến hóa đơn API.

Bạn nên dùng model Claude nào?

Câu trả lời ngắn gọn cho việc bạn nên dùng model Claude nào: hãy bắt đầu với Claude Opus 4.8, và chỉ chuyển sang model khác khi bạn có lý do cụ thể. Hướng dẫn của Anthropic cũng tương tự. "Nếu bạn không chắc nên dùng model nào, hãy bắt đầu với Claude Opus 4.8 cho các tác vụ lập trình agent phức tạp và công việc doanh nghiệp." Chuyển xuống Claude Sonnet 5 khi tác vụ đã được xác định rõ ràng và bạn cần chạy nhiều lần mỗi ngày. Chuyển xuống tiếp Claude Haiku 4.5 cho các công việc mang tính cơ học, khối lượng lớn mà bạn đã biết trước kết quả đúng trông như thế nào. Claude Fable 5 đứng trên tất cả, dành cho các agent chạy dài hạn.

Lựa chọn này đi kèm với chi phí. Đây là bảng giá trên Claude API (application programming interface) tính đến ngày 23 tháng 7 năm 2026, trên mỗi triệu token, được tài liệu viết tắt là MTok.

  • Claude Fable 5 (claude-fable-5): $10 / MTok đầu vào, $50 / MTok đầu ra. Context 1M.
  • Claude Opus 4.8 (claude-opus-4-8): $5 đầu vào, $25 đầu ra. Context 1M.
  • Claude Opus 4.7 (claude-opus-4-7): $5 đầu vào, $25 đầu ra. Context 1M.
  • Claude Sonnet 5 (claude-sonnet-5): $2 đầu vào, $10 đầu ra theo giá ưu đãi đến hết ngày 31 tháng 8 năm 2026. Mức giá tiêu chuẩn $3 đầu vào, $15 đầu ra có hiệu lực từ ngày 1 tháng 9 năm 2026. Context 1M.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 đầu vào, $5 đầu ra. Context 200K.

Các định danh đó đã đầy đủ như văn bản. Không có gì được thêm vào sau chúng.

Kích thước request không phát sinh phụ phí đối với các model 1M-token: “Một request 900k-token được tính cùng mức giá trên mỗi token như một request 9k-token.” Các mức giá đó cũng áp dụng ngoài API, vì Claude Enterprise tính usage theo mức giá API ngoài phí seat, nên toàn bộ phép tính dưới đây vẫn giống nhau đối với team dùng gói seat. Gói thuê bao giá cố định thay đổi cách tính usage nhưng không thay đổi quyết định này, vì cả hai tier Claude Max đều có cùng các model và chỉ khác nhau về lượng usage được cấp. Ở bậc thấp hơn, Claude Pro với giá $20 mỗi tháng cung cấp hạn mức usage thay vì mức giá trên mỗi token, nên điều ngăn bạn sử dụng tiếp là thời điểm reset limit chứ không phải hóa đơn. Nếu hiện bạn đang ở trường hợp đó, xác định bạn đang chờ cửa sổ nào cần được thực hiện trước các phép tính dưới đây, vì cách giải quyết là dùng model nhỏ hơn, context nhỏ hơn hoặc chuyển sang API thay vì tìm mức giá thấp hơn. Nếu bạn chưa bắt đầu trả phí, xác định Claude Pro có đáng với $20 ngay từ đầu hay không phụ thuộc vào mức độ thường xuyên free limit ngăn bạn sử dụng, chứ không phụ thuộc vào bất kỳ mức giá nào ở trên.

Mục đích thực tế của từng model

Anthropic mô tả dòng sản phẩm này bằng một dòng cho mỗi model, và những dòng đó định hướng tốt hơn bất kỳ bảng xếp hạng nào.

  • Claude Fable 5: "Trí tuệ thế hệ mới cho các agent chạy dài hạn." Được đánh giá là chậm nhất trong bốn model về độ trễ.
  • Claude Opus 4.8: "Dành cho các tác vụ coding agent phức tạp và công việc doanh nghiệp." Độ trễ trung bình.
  • Claude Sonnet 5: "Sự kết hợp tốt nhất giữa tốc độ và trí tuệ." Nhanh.
  • Claude Haiku 4.5: "Model nhanh nhất với trí tuệ tiệm cận ngưỡng tiên phong."

Fable 5 là model duy nhất trong bốn model mà bài so sánh này không định giá dựa trên khối lượng công việc, và với mức giá gấp đôi Opus 4.8, câu hỏi về việc công việc nào mang lại lợi nhuận 10 USD đầu vào và 50 USD đầu ra xứng đáng có câu trả lời riêng.

Haiku 4.5 cũng có các giới hạn quyết định sự phù hợp với công việc trước cả yếu tố giá cả. Context window của nó là 200K token thay vì 1M, vì vậy một repository lớn hoặc một bản ghi agent dài sẽ không thể chứa vừa. Output tối đa trên API Messages đồng bộ là 64K token so với 128K của các model còn lại, và mốc kiến thức đáng tin cậy của nó là tháng 2 năm 2025, trong khi ba model kia là tháng 1 năm 2026.

Lựa chọn này tiêu tốn bao nhiêu chi phí trên một khối lượng công việc thực tế?

Mọi model trong dòng sản phẩm đều tính phí output gấp năm lần so với rate của input. Opus 4.8 có giá 5 USD cho input và 25 USD cho output. Haiku 4.5 có giá 1 USD cho input và 5 USD cho output. Tỷ lệ này áp dụng cho toàn bộ dải sản phẩm, vì vậy model bạn chọn sẽ quan trọng nhất đối với các công việc tạo ra nhiều output.

Công việc dạng agentic thuộc loại này, vì các token suy luận (thinking tokens) được tính phí như token output và được tính vào max_tokens ngay cả khi văn bản đó không bao giờ hiển thị với bạn. Trên Fable 5, Opus 4.8, Opus 4.7 và Sonnet 5, phần tóm tắt suy luận được lược bỏ theo mặc định, nên trường thinking trả về trống. Việc tính phí vẫn không thay đổi: "Dù thế nào thì block đó vẫn bị tính phí như nhau và được truyền ngược lại như nhau trong các cuộc hội thoại đa lượt." Điều gì thực sự tạo nên hóa đơn token Claude sẽ phân tích chi tiết cơ chế đo lường này.

Việc tính năng suy luận có chạy hay không phụ thuộc vào các model bạn đang so sánh, điều này sẽ làm sai lệch kết quả kiểm tra chi phí nếu bạn bỏ qua. Trên Sonnet 5 và Fable 5, tính năng suy luận đã được bật sẵn và không cần cấu hình. Trên Opus 4.8 và Opus 4.7, tính năng này bị tắt cho đến khi bạn thiết lập thinking: {type: "adaptive"} trong request. Hãy đảm bảo cấu hình đồng nhất ở cả hai phía trước khi đưa ra bất kỳ kết luận nào từ các con số.

Tại sao model rẻ nhất lại có thể tốn kém nhất

Hãy lấy một tác vụ lập trình độc lập. Yêu cầu chứa 60,000 token ngữ cảnh và model tạo ra 8,000 token đầu ra bao gồm cả phần suy nghĩ. Không sử dụng cache, nên các phép tính vẫn hiển thị rõ ràng.

Trên Opus 4.8: 0.06 MTok đầu vào với giá $5 là $0.30, và 0.008 MTok đầu ra với giá $25 là $0.20. Lần thử này tốn $0.50. Trên Haiku 4.5, cùng tác vụ đó tốn $0.06 cộng $0.04, tổng cộng là $0.10.

Haiku rẻ hơn năm lần cho mỗi lần thử, trông có vẻ như tiết kiệm được rất nhiều cho đến khi bạn theo dõi những gì xảy ra khi một lần thử thất bại. Bạn đọc câu trả lời sai, điều này làm tốn thời gian của bạn. Bạn gửi lại nó dưới dạng ngữ cảnh trong lần thử tiếp theo, vì vậy mỗi lần thử lại lớn hơn lần trước. Và khi lần thử thứ ba vẫn sai, bạn vẫn phải nâng cấp lên model cao hơn: $0.30 của Haiku cộng $0.50 của Opus là $0.80, tức là đắt hơn 60% so với việc chạy Opus ngay từ đầu.

Vì vậy, câu hỏi quyết định là bạn có thể kiểm tra câu trả lời rẻ đến mức nào. Khi một câu trả lời sai lộ rõ trong một giây, model nhỏ là một món hời. Khi việc phát hiện lỗi đòi hỏi phải đọc kỹ diff, model nhỏ làm bạn tốn thời gian mà không bao giờ xuất hiện trên hóa đơn. Việc gán một con số cho khoảng thời gian đó cũng giống như phép tính trong việc xác định liệu gói Claude Code có đáng tiền hay không, và một khi mức lương theo giờ của bạn được đưa vào tổng chi phí, model rẻ hơn thường không còn vẻ rẻ nữa.

Khi nào mô hình nhỏ hơn chiếm ưu thế

Haiku 4.5 là lựa chọn phù hợp trong các trường hợp sau:

  • Tác vụ subagent cơ học. Một subagent thực hiện đổi tên file hoặc thu thập kết quả tìm kiếm không cần khả năng suy luận cấp cao. Đây là mô hình chuẩn khi bạn xây dựng AI agent với Claude và cung cấp cho nó các công cụ hỗ trợ.
  • Phân loại log. Việc quyết định một dòng log là nhiễu hay cần sự chú ý của con người là một đánh giá hẹp với phương thức lỗi rõ ràng.
  • Phân loại dựa trên tập nhãn cố định. Đầu ra ngắn và độ chính xác có thể đo lường được trên một mẫu thử.
  • Các yêu cầu sản xuất khối lượng lớn. Với 100.000 lượt chạy mỗi ngày, chênh lệch chi phí trên mỗi token không còn là sai số làm tròn. Đây là hình thái phổ biến của các quy trình AI tích hợp vào n8n.
  • Bất kỳ tác vụ nào mà tốc độ phản hồi quan trọng với người dùng. Haiku 4.5 được đánh giá là mô hình nhanh nhất trong dòng sản phẩm.

Một giới hạn dành riêng cho Haiku. Prompt tối thiểu có thể cache là 4.096 token, so với 1.024 trên Opus 4.8 và Sonnet 5. Dưới mức tối thiểu đó, "mọi yêu cầu cache ít hơn số lượng token này sẽ được xử lý mà không có cache và không trả về lỗi". Một khối hướng dẫn 1.500 token vốn được cache trên Sonnet 5 sẽ âm thầm không được cache trên Haiku 4.5. Dấu hiệu nhận biết là cache_creation_input_tokenscache_read_input_tokens đều bằng không, điều mà bài viết về giảm chi phí cho agent chạy liên tục đã đề cập cùng với các nguyên nhân khác khiến cache bị mất.

Các đòn bẩy thay đổi câu trả lời

Mỗi yếu tố này tác động đến hóa đơn mạnh hơn cả tên model.

Effort (Nỗ lực). output_config.effort kiểm soát khối lượng công việc model thực hiện trước khi đưa ra câu trả lời. Các mức độ là low, medium, high, xhighmax, trong đó high là mặc định: "Thiết lập effort thành high tạo ra hành vi chính xác như khi bỏ qua hoàn toàn tham số effort." Tham số này nằm bên trong output_config thay vì ở cấp độ cao nhất của request:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort ảnh hưởng đến mọi token trong phản hồi: "Nó có thể tác động đến toàn bộ lượng token tiêu thụ bao gồm cả các tool call. Ví dụ, mức effort thấp hơn đồng nghĩa với việc Claude thực hiện ít tool call hơn." Điều này tích lũy trong một vòng lặp agentic. Đây không phải là giới hạn token: "Effort là một tín hiệu hành vi, không phải là ngân sách token nghiêm ngặt." Anthropic không công bố hệ số nhân chi phí cho mỗi mức và khuyến khích bạn tự kiểm tra trường hợp sử dụng của mình, vì vậy việc chạy Sonnet 5 ở mức high so với Opus 4.8 ở mức low là một phép so sánh thực tế mà bạn có thể thực hiện ngay chiều nay. Haiku 4.5 không nằm trong danh sách các model hỗ trợ effort.

Prompt caching. Một lần đọc cache tốn 0.1x giá input cơ bản, và con số quyết định lựa chọn model là hiệu quả của nó trên các tier. Một lần cache hit trên Opus 4.8 tốn $0.50 / MTok, trong khi input không cache trên Haiku 4.5 tốn $1 / MTok, vì vậy một prefix Opus được cache tốt sẽ rẻ hơn trên mỗi token input so với một prompt Haiku chưa có cache. Việc duy trì vệ sinh phiên làm việc (session hygiene) quan trọng hơn việc chọn model đối với bất kỳ workload nào gửi lại một prefix lớn và ổn định.

Batches. Nếu không có yêu cầu nào đang chờ câu trả lời, Message Batches API chạy cùng các model đó với "mức giảm giá 50% cho cả token input và output". Nó giảm một nửa mọi hàng trong bảng so sánh bên dưới và hoạt động trên tất cả các tier: một job Opus 4.8 chạy theo batch có chi phí thấp hơn một job Sonnet 5 đồng bộ ở mức giá tiêu chuẩn từ ngày 1 tháng 9 năm 2026, đánh đổi độ trễ để lấy khả năng xử lý với cùng một mức chi phí.

So sánh chi phí thực tế

Khối lượng công việc: phân loại 100,000 email hỗ trợ, mỗi email một cuộc gọi, 2,000 token đầu vào và 300 token đầu ra mỗi cuộc gọi. Tổng cộng là 200 MTok đầu vào và 30 MTok đầu ra.

  • Haiku 4.5: 200 x $1 = $200 đầu vào, 30 x $5 = $150 đầu ra. Tổng $350.
  • Sonnet 5, giá ưu đãi: 200 x $2 = $400 đầu vào, 30 x $10 = $300 đầu ra. Tổng $700.
  • Sonnet 5, từ ngày 1 tháng 9 năm 2026: 200 x $3 = $600 đầu vào, 30 x $15 = $450 đầu ra. Tổng $1,050.
  • Opus 4.8: 200 x $5 = $1,000 đầu vào, 30 x $25 = $750 đầu ra. Tổng $1,750.

Thay đổi bốn con số để tính toán lại với giá của ngày mai. Các điều chỉnh dưới đây làm thay đổi kết quả nhiều hơn cả việc đổi tên model:

  • Batching giảm một nửa mọi dòng: $175, $350, $525 và $875. Không có tác vụ nào phải chờ đợi việc phân loại hàng đêm, vì vậy không có lý do gì để bỏ qua nó.
  • Caching tiền tố dùng chung. Giả sử 1,200 trong số 2,000 token đầu vào là cùng một khối hướng dẫn mỗi lần. Trên Sonnet 5 với giá ưu đãi, chi phí là $0.20 / MTok cho cache hit thay vì $2 / MTok, vì vậy 120 MTok tốn $24 thay vì $240. Thêm 80 MTok đầu vào mới với giá $2, tức là $160, cộng với $300 đầu ra, Sonnet 5 sẽ có giá khoảng $484 thay vì $700. Thủ thuật tương tự không có tác dụng trên Haiku 4.5, vì 1,200 token thấp hơn mức tối thiểu 4,096 token của nó.
  • Thử lại (Retries). Giả sử bạn từ chối câu trả lời của Haiku trên 8% số email và chạy lại chúng trên Opus 4.8. Thêm 0.08 x $1,750 = $140 vào $350, tổng cộng là $490. Hãy tự đo lường tỷ lệ từ chối của riêng bạn thay vì lấy con số của tôi.
  • Định nghĩa công cụ (Tool definitions), nếu công việc sử dụng chúng. System prompt mà chúng tạo ra là 290 token trên Opus 4.8 với tool_choice được đặt thành auto, 354 trên Sonnet 5 và 496 trên Haiku 4.5. Model rẻ nhất lại mang theo chi phí cố định lớn nhất.

Haiku với lộ trình leo thang (escalation path) ở mức $490 và Sonnet 5 có cache ở mức $484 có chi phí ngang nhau, và một trong số chúng hoàn thành công việc chỉ trong một lần chạy. Model chưa bao giờ là toàn bộ vấn đề.

Việc chuyển đổi model giữa chừng trong một phiên làm việc có tiết kiệm chi phí không?

Thường thì không tiết kiệm như mức giá niêm yết gợi ý, vì khoản tiết kiệm được tính trên mỗi token, trong khi thứ bạn đặt vào rủi ro là toàn bộ prefix đã được cache.

Anthropic có tài liệu về những yếu tố làm mất hiệu lực của cache. Các prefix được xây dựng theo thứ tự tools, sau đó là system, rồi đến messages, và "Những thay đổi ở mỗi cấp độ sẽ làm mất hiệu lực của cấp độ đó và tất cả các cấp độ tiếp theo." Hai thiết lập request cũng nằm trong danh sách đó: "Cấu hình thinking và cấp độ effort đã phân giải được render trực tiếp vào prompt, vì vậy việc thay đổi bất kỳ yếu tố nào trong số đó sẽ bắt đầu một cache prefix mới." Về phần effort, tài liệu còn đi xa hơn: "hãy thay đổi effort giữa các khối lượng công việc thay vì trong một cuộc hội thoại đang dựa vào cache hit".

Model không nằm trong danh sách được tài liệu hóa đó, vì vậy đừng mặc định theo bất kỳ hướng nào. Hãy đọc cache_read_input_tokens ở request đầu tiên sau khi chuyển đổi và để con số trả lời. Với một prefix 150.000 token của Opus 4.8, chi phí đọc cache là khoảng $0.08 và chi phí ghi mới là khoảng $0.94, con số này lớn hơn nhiều so với khoảng chênh lệch trên mỗi token mà bạn đang cố gắng tối ưu.

Vì vậy, hãy thay đổi những thiết lập này giữa các tác vụ, đừng thực hiện trong cùng một tác vụ. Trong Claude Code, điều đó có nghĩa là /clear trước, khi cache dù sao cũng đang bị loại bỏ, sau đó mới đến /model hoặc /effort. Cả hai lệnh này đều được nhập tại CLI, vì vậy nếu bạn đang làm việc trên Linux, việc cài đặt bản terminal là rất đáng giá, vì những gì Anthropic cung cấp cho Linux kết hợp một CLI ổn định với một ứng dụng desktop vẫn đang trong giai đoạn beta. Việc thay đổi model có xuất hiện trên hóa đơn hay không phụ thuộc vào cách bạn thanh toán cho phiên làm việc đó, vì Claude Code chạy theo gói thuê bao tháng cố định hoặc theo credit API trên mỗi token và chỉ phương thức thứ hai mới tính phí thay đổi model bằng tiền mặt. Với gói cố định, cái giá phải trả khi chọn model nặng hơn chính là hạn mức sử dụng của bạn thay vì hóa đơn, và Claude Code được bao gồm từ gói Pro trở lên và dùng chung hạn mức với các ứng dụng chat, vì vậy một giờ dùng Opus trong terminal là một giờ bạn không sử dụng trên trình duyệt.

Cách kiểm tra câu trả lời trên workload của riêng bạn

Đừng ước tính kích thước prompt dựa trên số lượng token từ một model khác. Endpoint đếm token được sử dụng miễn phí và đếm theo tokenizer của bất kỳ model nào bạn chỉ định, vì vậy hãy chọn đúng model bạn dự định gọi. Endpoint đó là một trong số ít các phần của nền tảng không tính phí, và việc xem những gì bạn có thể chạy mà không tốn phí là điều đáng làm trước khi bạn chi tiêu credit thực tế cho việc so sánh. Opus 4.7 trở lên, Fable 5 và Sonnet 5 sử dụng tokenizer mới hơn, "tạo ra nhiều hơn khoảng 30% token cho cùng một văn bản", vì vậy ngân sách được đo lường trên model cũ sẽ thấp hơn khi áp dụng cho model mới dù mức phí trên mỗi token không đổi.

Sau đó, hãy đọc kết quả trả về. input_tokens chỉ là phần còn lại không được cache, vì vậy kích thước prompt thực tế là trường đó cộng với cache_creation_input_tokens cộng với cache_read_input_tokens. Một ứng dụng Claude API đầu tiên trên VPS là nơi nhỏ nhất và trung thực nhất để thực hiện phép đo đó, và gói Claude nào phù hợp với mức sử dụng của bạn là quyết định riêng biệt về việc liệu bạn có cần trả phí theo token hay không. Nếu vấn đề trở thành việc chọn gói đăng ký nào thay vì có nên đăng ký hay không, các gói của Claude so với giá của ChatGPT sẽ cho biết cùng một công việc lập trình đó tốn bao nhiêu chi phí trên các gói của nhà cung cấp khác. Nếu phép đo khiến bạn chuyển hẳn công việc sang API, việc hạ cấp gói đăng ký hoặc hủy hoàn toàn vẫn cho phép bạn sử dụng hết thời hạn đã thanh toán, vì vậy không có hình phạt nào khi đưa ra quyết định sau khi đã có số liệu. Hãy chạy cùng phép đo đó cho một nhóm thay vì một cá nhân và tổng số sẽ thay đổi, bởi vì một tài khoản Team hoặc Enterprise phải hiệu quả hơn số tiền mà cá nhân đó đã chi trả theo token thì mới đáng để mua.

FAQ

Model Claude nào tốt nhất cho lập trình?

Claude Opus 4.8 là điểm khởi đầu được khuyến nghị cho các tác vụ lập trình agent phức tạp, với giá 5 USD cho mỗi triệu input token và 25 USD cho mỗi triệu output token tính đến tháng 7 năm 2026. Claude Sonnet 5 được định vị là sự kết hợp tốt nhất giữa tốc độ và trí thông minh, với mức giá 2 USD / 10 USD cho đến hết ngày 31 tháng 8 năm 2026, rẻ hơn một nửa so với Opus. Hãy chạy cùng một tác vụ trên cả hai model, giữ nguyên cấu hình thinking, và so sánh tổng chi phí token từ response.usage.

Claude Haiku 4.5 có đủ rẻ để thay thế Sonnet 5 không?

Xét trên mỗi token thì có: 1 USD / 5 USD so với 2 USD / 10 USD của Sonnet 5 trong giai đoạn giá ưu đãi, hoặc 3 USD / 15 USD từ ngày 1 tháng 9 năm 2026. Giới hạn kỹ thuật mới là yếu tố quyết định. Haiku 4.5 có context window 200K token thay vì 1M, giới hạn output tối đa 64K trên Messages API đồng bộ, thời điểm cắt dữ liệu huấn luyện là tháng 2 năm 2025, không hỗ trợ output_config.effort, và yêu cầu tối thiểu 4.096 token để cache, điều này sẽ tự động vô hiệu hóa cache đối với các system prompt ngắn.

Chuyển đổi giữa các model Claude rẻ hơn trong phiên làm việc có tiết kiệm chi phí không?

Ít khi hiệu quả như vẻ ngoài. Anthropic ghi nhận các yếu tố làm mất hiệu lực cache bao gồm thay đổi tools, system hoặc tiền tố messages, thay đổi cấu hình thinking, và thay đổi output_config.effort. Việc chuyển đổi model ảnh hưởng thế nào đến cache hiện có không được tài liệu hóa, vì vậy hãy coi đó là ẩn số và đọc cache_read_input_tokens trong request đầu tiên sau đó. Cần lưu ý rủi ro: với tiền tố 150.000 token trên Opus 4.8, chi phí đọc cache là khoảng 0,08 USD và ghi mới là khoảng 0,94 USD, con số này lớn hơn nhiều so với khoản tiết kiệm được từ việc giảm giá mỗi token. Hãy chuyển đổi giữa các tác vụ, sau khi /clear trong Claude Code, khi cache dù sao cũng sẽ bị xóa.

Tham số output_config.effort ảnh hưởng thế nào đến hóa đơn của tôi?

Nó thay đổi số lượng token model sử dụng cho văn bản, gọi công cụ (tool calls) và suy luận (thinking). Mức effort thấp hơn sẽ thực hiện ít lệnh gọi công cụ hơn, điều này có tác động tích lũy trong các vòng lặp agent vì mỗi kết quả công cụ đều được gửi lại trong các lượt sau. Các mức độ là low, medium, high, xhighmax, với high là mặc định. Anthropic không công bố hệ số nhân chi phí cho mỗi mức, vì coi effort là tín hiệu hành vi thay vì ngân sách token, do đó bạn cần tự đo lường trên tác vụ của mình.

Claude Batches API tiết kiệm được bao nhiêu?

Tiết kiệm 50% cho cả input và output token, đổi lại là việc xử lý không đồng bộ. Tính đến tháng 7 năm 2026, mức giá này đưa Opus 4.8 về 2,50 USD input / 12,50 USD output, Sonnet 5 về 1 USD / 5 USD trong giai đoạn giá ưu đãi, và Haiku 4.5 về 0,50 USD / 2,50 USD. Điểm đáng chú ý là sự so sánh giữa các phân khúc: một job Opus 4.8 chạy batch có chi phí thấp hơn một job Sonnet 5 chạy đồng bộ ở mức giá tiêu chuẩn từ ngày 1 tháng 9 năm 2026, vì vậy việc sử dụng batch cho phép bạn dùng model mạnh hơn với cùng một mức chi phí.