SSD Nodes Learn
Hướng dẫn Matt ConnorBởi Matt Connor

Nên dùng model Claude nào để tối ưu chi phí?

So sánh giá Claude API tháng 7/2026 giữa Opus 4.8, Sonnet 5 và Haiku 4.5. Xem bảng tính chi phí thực tế cho 100.000 jobs để chọn model phù hợp nhất.

Bạn nên dùng model Claude nào?

Câu trả lời ngắn gọn cho việc bạn nên dùng model Claude nào là: hãy bắt đầu với Claude Opus 4.8, và chỉ chuyển sang model khác khi bạn có lý do cụ thể. Anthropic cũng hướng dẫn như vậy. "Nếu bạn không chắc chắn nên dùng model nào, hãy bắt đầu với Claude Opus 4.8 cho các tác vụ coding agentic phức tạp và công việc doanh nghiệp." Hãy chuyển xuống Claude Sonnet 5 khi task đã được định nghĩa rõ ràng và bạn chạy nó nhiều lần trong ngày. Tiếp tục chuyển xuống Claude Haiku 4.5 cho các công việc lặp đi lặp lại, khối lượng lớn mà bạn đã biết trước kết quả đúng trông như thế nào. Claude Fable 5 nằm trên tất cả, dành cho các agent chạy thời gian dài.

Việc lựa chọn sẽ đi kèm với chi phí. Đây là mức giá trên Claude API (application programming interface) tính đến ngày 23 tháng 7 năm 2026, trên mỗi triệu token, mà docs viết là MTok.

  • Claude Fable 5 (claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context.
  • Claude Opus 4.8 (claude-opus-4-8): $5 in, $25 out. 1M context.
  • Claude Opus 4.7 (claude-opus-4-7): $5 in, $25 out. 1M context.
  • Claude Sonnet 5 (claude-sonnet-5): $2 in, $10 out theo giá dùng thử đến ngày 31 tháng 8 năm 2026. Mức giá tiêu chuẩn $3 in, $15 out sẽ có hiệu lực từ ngày 1 tháng 9 năm 2026. 1M context.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 in, $5 out. 200K context.

Các identifier đó được giữ nguyên như đã viết. Không có gì được thêm vào sau chúng.

Bản thân kích thước không tính thêm phụ phí cho các model 1M-token: "Một request 900k-token được tính phí với mức giá mỗi token giống hệt như một request 9k-token."

Thực tế mỗi model dùng để làm gì

Anthropic mô tả dòng sản phẩm này bằng một dòng cho mỗi model, và những dòng đó dẫn dắt tốt hơn bất kỳ bảng xếp hạng nào.

  • Claude Fable 5: "Trí tuệ thế hệ mới cho các agent chạy thời gian dài." Được đánh giá là chậm nhất trong bốn model về latency.
  • Claude Opus 4.8: "Dành cho coding agentic phức tạp và công việc doanh nghiệp." Latency trung bình.
  • Claude Sonnet 5: "Sự kết hợp tốt nhất giữa tốc độ và trí tuệ." Nhanh.
  • Claude Haiku 4.5: "Model nhanh nhất với trí tuệ tiệm cận frontier."

Haiku 4.5 cũng có các giới hạn quyết định độ phù hợp của công việc trước khi xét đến giá cả. Context window của nó là 200K tokens thay vì 1M, nên một repository lớn hoặc một transcript agent dài sẽ không vừa. Output tối đa của nó trên synchronous Messages API là 64K tokens so với 128K của các model khác, và knowledge cutoff đáng tin cậy của nó là tháng 2 năm 2025, trong khi ba model còn lại là tháng 1 năm 2026.

Lựa chọn này tốn của tôi bao nhiêu cho một workload thực tế?

Mọi model trong dòng sản phẩm này đều tính giá output gấp 5 lần rate của input. Opus 4.8 là $5 in và $25 out. Haiku 4.5 là $1 in và $5 out. Tỷ lệ này giữ nguyên cho toàn bộ dải sản phẩm, vì vậy model bạn chọn quan trọng nhất đối với các công việc tạo ra nhiều output.

Công việc agentic thuộc loại công việc đó, vì các thinking tokens được tính là output tokens và tính vào max_tokens ngay cả khi văn bản không bao giờ gửi đến bạn. Trên Fable 5, Opus 4.8, Opus 4.7 và Sonnet 5, phần reasoning summary bị bỏ qua theo mặc định, nên field thinking sẽ trả về rỗng. Việc tính phí không đổi: "Dù thế nào thì block vẫn được tính phí như nhau và được trả về như nhau trong các cuộc hội thoại multi-turn." Thực tế một hóa đơn Claude token được lấp đầy như thế nào sẽ phân tích chi tiết vấn đề này.

Việc có chạy thinking hay không khác nhau giữa các model bạn đang so sánh, điều này sẽ phá hỏng một bài test chi phí nếu bạn bỏ lỡ. Trên Sonnet 5 và Fable 5, thinking đã được bật sẵn và không cần cấu hình. Trên Opus 4.8 và Opus 4.7, nó bị tắt cho đến khi bạn set thinking: {type: "adaptive"} trong request. Hãy khớp cấu hình ở cả hai phía trước khi bạn đọc bất kỳ con số nào.

Tại sao model rẻ nhất có thể là model đắt nhất

Hãy lấy một task coding độc lập. Request mang theo 60,000 tokens context, và model tạo ra 8,000 tokens output bao gồm cả thinking. Không dùng caching, nên các phép tính vẫn hiển thị rõ ràng.

Trên Opus 4.8: 0.06 MTok input với giá $5 là $0.30, và 0.008 MTok output với giá $25 là $0.20. Một attempt tốn $0.50. Trên Haiku 4.5, cùng một attempt đó là $0.06 cộng $0.04, tức là $0.10.

Haiku rẻ hơn 5 lần cho mỗi attempt, trông có vẻ như có rất nhiều dư địa cho đến khi bạn thấy một attempt thất bại sẽ làm gì. Bạn đọc được câu trả lời sai, việc này tốn thời gian của bạn. Bạn gửi lại nó làm context khi retry, nên mỗi attempt sau lại lớn hơn attempt trước. Và khi attempt thứ ba vẫn sai, bạn vẫn phải escalate: $0.30 của Haiku cộng $0.50 của Opus là $0.80, tức là nhiều hơn 60% so với việc chạy Opus một lần.

Vì vậy, câu hỏi quyết định là bạn có thể kiểm tra câu trả lời rẻ đến mức nào. Khi một câu trả lời sai được nhận diện chỉ trong một giây, model nhỏ là một món hời. Khi việc nhận diện sai nghĩa là phải đọc kỹ một bản diff, model nhỏ sẽ tốn của bạn thời gian mà không bao giờ xuất hiện trên hóa đơn.

Nơi model nhỏ thắng tuyệt đối

Haiku 4.5 là câu trả lời đúng trong các trường hợp này:

  • Công việc subagent cơ bản. Một subagent thực hiện đổi tên file hoặc thu thập output tìm kiếm không cần reasoning frontier. Đó là pattern tiêu chuẩn một khi bạn build một AI agent với Claude và cấp cho nó các helpers.
  • Log triage. Quyết định một dòng là noise hay đáng để con người chú ý là một phán đoán hẹp với mode thất bại rõ ràng.
  • Classification dựa trên một tập label cố định. Output ngắn và độ chính xác có thể đo lường được trên một sample.
  • Các cuộc gọi production khối lượng lớn. Với 100,000 lượt chạy mỗi ngày, khoảng cách per-token không còn là sai số làm tròn nữa. Đó là hình thái thông thường của AI workflows được kết nối vào n8n.
  • Bất cứ thứ gì mà tốc độ phản hồi quan trọng với người dùng. Haiku 4.5 được đánh giá là model nhanh nhất trong dòng sản phẩm.

Một giới hạn thuộc về riêng Haiku. Minimum cacheable prompt của nó là 4,096 tokens, so với 1,024 trên Opus 4.8 và Sonnet 5, và dưới mức tối thiểu đó "mọi request để cache ít hơn số token này sẽ được xử lý mà không cache, và không có lỗi nào được trả về". Một instruction block 1,500-token được cache trên Sonnet 5 sẽ không được cache trên Haiku 4.5. Dấu hiệu nhận biết là cache_creation_input_tokenscache_read_input_tokens đều bằng zero, điều mà giữ chi phí của một agent luôn chạy ở mức thấp sẽ đề cập cùng với các cách khác để mất cache.

Các đòn bẩy làm thay đổi kết quả

Mỗi yếu tố này sẽ làm thay đổi hóa đơn nhiều hơn là tên model.

Effort. output_config.effort kiểm soát model làm bao nhiêu việc trước khi trả lời. Các mức độ là low, medium, high, xhighmax, và high là mặc định: "Setting effort thành high cho ra kết quả hành vi chính xác như khi bỏ hoàn toàn parameter effort." Nó nằm bên trong output_config thay vì nằm ở level cao nhất của request:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort tác động đến mọi token trong response: "Nó có thể ảnh hưởng đến tất cả chi phí token bao gồm cả tool calls. Ví dụ, effort thấp hơn có nghĩa là Claude thực hiện ít tool calls hơn." Điều này cộng dồn trong một agentic loop. Nó không phải là một token cap: "Effort là một tín hiệu hành vi, không phải là một token budget nghiêm ngặt." Anthropic không công bố hệ số nhân chi phí cho mỗi mức độ và khuyên bạn nên tự test use case của mình, vì vậy một lượt chạy Sonnet 5 ở high so với một lượt chạy Opus 4.8 ở low là một so sánh thực tế bạn có thể thực hiện ngay chiều nay. Haiku 4.5 không có trong danh sách các model hỗ trợ effort.

Prompt caching. Một cache read tốn 0.1x rate input cơ bản, và con số quyết định việc chọn model là những gì nó thực hiện qua các tier. Một cache hit trên Opus 4.8 tốn $0.50 / MTok, và uncached input trên Haiku 4.5 tốn $1 / MTok, vì vậy một Opus prefix được cache tốt sẽ rẻ hơn trên mỗi input token so với một Haiku prompt chưa cache. Session hygiene (vệ sinh session) thắng model choice trong bất kỳ workload nào gửi lại một prefix lớn và ổn định.

Batches. Nếu không có gì đang chờ đợi câu trả lời, Message Batches API chạy cùng các model đó với "giảm giá 50% cho cả input và output tokens". Nó giảm một nửa mọi dòng trong bảng so sánh dưới đây, và nó hoạt động qua các tier: một job Opus 4.8 dạng batch tốn ít hơn một job Sonnet 5 synchronous với giá tiêu chuẩn từ ngày 1 tháng 9 năm 2026, đánh đổi latency để lấy capability với cùng một số tiền.

Một so sánh chi phí thực tế

Workload: phân loại 100,000 email hỗ trợ, mỗi email một call, 2,000 input tokens và 300 output tokens mỗi call. Đó là 200 MTok input và 30 MTok output.

  • Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out. Tổng $350.
  • Sonnet 5, giá dùng thử: 200 x $2 = $400 in, 30 x $10 = $300 out. Tổng $700.
  • Sonnet 5, từ 1 tháng 9 năm 2026: 200 x $3 = $600 in, 30 x $15 = $450 out. Tổng $1,050.
  • Opus 4.8: 200 x $5 = $1,000 in, 30 x $25 = $750 out. Tổng $1,750.

Thay đổi bốn con số để tính lại với giá của ngày mai. Các điều chỉnh dưới đây làm thay đổi kết quả nhiều hơn là tên model:

  • Batching giảm một nửa mọi dòng: $175, $350, $525 và $875. Không có gì chờ đợi một lượt phân loại hàng đêm, nên không có lý do gì để bỏ qua nó.
  • Caching prefix dùng chung. Giả sử 1,200 trong số 2,000 input tokens là cùng một instruction block mỗi lần. Trên Sonnet 5 ở giá dùng thử, chúng tốn $0.20 / MTok dưới dạng cache hits thay vì $2 / MTok, nên 120 MTok tốn $24 thay vì $240. Cộng thêm 80 MTok input mới với giá $2, tức là $160, cộng với $300 output, và Sonnet 5 dừng ở mức gần $484 thay vì $700. Thủ thuật tương tự không có tác dụng gì trên Haiku 4.5, vì 1,200 tokens thấp hơn mức tối thiểu 4,096-token của nó.
  • Retries. Giả sử bạn reject câu trả lời của Haiku trong 8% số email và chạy lại chúng trên Opus 4.8. Cộng 0.08 x $1,750 = $140 vào $350, được $490. Hãy tự đo lường tỷ lệ reject của chính bạn thay vì mượn của tôi.
  • Tool definitions, nếu job có sử dụng chúng. System prompt chúng tạo ra là 290 tokens trên Opus 4.8 với tool_choice được set thành auto, 354 trên Sonnet 5 và 496 trên Haiku 4.5. Model rẻ nhất mang theo overhead cố định lớn nhất.

Haiku với một lộ trình escalate ở mức $490 và Sonnet 5 đã cache ở mức $484 có chi phí bằng nhau, và một trong hai cái hoàn thành công việc chỉ trong một lượt chạy. Model chưa bao giờ là toàn bộ câu hỏi.

Việc đổi model giữa session có tiết kiệm tiền không?

Ít hơn so với những gì giá niêm yết gợi ý, vì mức tiết kiệm tính trên mỗi token và thứ bạn đang mạo hiểm là cả một cached prefix.

Anthropic tài liệu hóa những gì làm mất hiệu lực của một cache. Các prefix được xây dựng theo thứ tự tools, sau đó system, rồi messages, và "Thay đổi ở mỗi level sẽ làm mất hiệu lực level đó và tất cả các level kế tiếp." Hai thiết lập request cũng nằm trong danh sách đó: "Cấu hình thinking và level effort đã được resolve sẽ được render vào chính prompt, nên việc thay đổi bất kỳ thứ gì trong số chúng sẽ bắt đầu một cache prefix mới." Về effort, docs còn nói xa hơn: "Hãy thay đổi effort giữa các workload thay vì thay đổi trong một conversation đang dựa vào cache hits".

Model không nằm trong danh sách được tài liệu hóa đó, nên đừng giả định dù theo cách nào. Hãy đọc cache_read_input_tokens ở request đầu tiên sau khi switch và để con số đó trả lời. Trên một Opus 4.8 prefix 150,000-token, một cache read tốn khoảng $0.08 và một fresh write tốn khoảng $0.94, nhiều hơn nhiều so với vài lượt chạy chênh lệch per-token mà bạn đang theo đuổi.

Vì vậy, hãy thay đổi những thứ này giữa các task, chứ không phải bên trong một task. Trong Claude Code, điều đó có nghĩa là /clear trước, khi cache đang bị hủy bỏ, sau đó là /model hoặc /effort.

Cách test câu trả lời trên workload của chính bạn

Đừng tính toán kích thước một prompt dựa trên số lượng lấy từ một model khác. Endpoint đếm token là miễn phí và đếm bằng tokenizer của bất kỳ model nào bạn gọi, vì vậy hãy gọi đúng model bạn dự định dùng. Opus 4.7 trở lên, Fable 5 và Sonnet 5 sử dụng một tokenizer mới hơn "tạo ra xấp xỉ 30% nhiều token hơn cho cùng một văn bản", nên một budget đo trên model cũ sẽ bị đọc thấp trên model mới dù rate per-token không đổi.

Sau đó hãy đọc kết quả trả về. input_tokens chỉ là phần còn lại chưa cache, nên kích thước prompt thực tế là field đó cộng với cache_creation_input_tokens cộng với cache_read_input_tokens. Một ứng dụng Claude API đầu tiên trên một VPS là nơi trung thực nhất để chạy phép đo đó, và gói Claude nào phù hợp với mức sử dụng của bạn là quyết định riêng biệt về việc bạn có trả phí theo token hay không.

FAQ

Model Claude nào tốt nhất để coding?

Claude Opus 4.8 là điểm bắt đầu được tài liệu hóa cho coding agentic phức tạp, với giá $5 cho mỗi triệu input token và $25 cho mỗi triệu output tính đến tháng 7 năm 2026. Claude Sonnet 5 được định vị là sự kết hợp tốt nhất giữa tốc độ và trí tuệ, và với mức giá $2 / $10 đến ngày 31 tháng 8 năm 2026, nó tốn ít hơn một nửa. Hãy chạy cùng một task trên cả hai, giữ cấu hình thinking cố định, và so sánh tổng chi phí token từ response.usage.

Claude Haiku 4.5 có đủ rẻ để thay thế Sonnet 5 không?

Tính trên mỗi token, dễ dàng: $1 / $5 so với $2 / $10 cho Sonnet 5 ở giá dùng thử, hoặc $3 / $15 từ ngày 1 tháng 9 năm 2026. Các giới hạn sẽ quyết định điều đó. Haiku 4.5 có context window 200K token thay vì 1M, output tối đa 64K trên synchronous Messages API, knowledge cutoff là tháng 2 năm 2025, không hỗ trợ output_config.effort, và một minimum cacheable prompt 4,096-token sẽ âm thầm vô hiệu hóa caching trên các system prompt ngắn.

Việc chuyển sang model Claude rẻ hơn giữa session có tiết kiệm tiền không?

Ít hơn so với vẻ ngoài. Anthropic tài liệu hóa các tác nhân làm mất cache là các thay đổi đối với prefix tools, system hoặc messages, thay đổi cấu hình thinking, và thay đổi output_config.effort. Việc một model switch tác động thế nào đến một cache hiện có thì không được tài liệu hóa, vì vậy hãy coi nó là không xác định và đọc cache_read_input_tokens ở request đầu tiên sau đó. Rủi ro này đáng để biết: trên một Opus 4.8 prefix 150,000-token, một cache read tốn khoảng $0.08 và một fresh write tốn khoảng $0.94, vượt quá nhiều lượt chạy chênh lệch per-token mà bạn đang theo đuổi. Hãy switch giữa các task, sau /clear trong Claude Code, khi cache đang bị vứt bỏ bất kể thế nào.

output_config.effort làm gì cho hóa đơn của tôi?

Nó thay đổi số lượng token mà model chi tiêu cho text, tool calls và thinking. Effort thấp hơn làm ít tool calls hơn, điều này cộng dồn trong các agentic loop vì mọi kết quả tool đều được gửi lại trong các lượt sau. Các mức độ là low, medium, high, xhighmax, với high là mặc định. Anthropic không công bố hệ số nhân chi phí cho mỗi mức độ, gọi effort là một tín hiệu hành vi thay vì một token budget, vì vậy hãy tự đo lường trên task của bạn.

Claude Batches API tiết kiệm được bao nhiêu?

50% cho cả input và output tokens, đổi lại là việc xử lý không đồng bộ. Tính đến tháng 7 năm 2026, điều đó đưa Opus 4.8 xuống còn $2.50 in / $12.50 out, Sonnet 5 ở mức $1 / $5 theo giá dùng thử, và Haiku 4.5 ở mức $0.50 / $2.50. Một so sánh đáng chú ý chạy qua các tier: một job Opus 4.8 dạng batch tốn ít hơn một job Sonnet 5 synchronous với giá tiêu chuẩn từ ngày 1 tháng 9 năm 2026, vì vậy batching giúp bạn mua được một model mạnh hơn với cùng một số tiền.