SSD Nodes Learn Hosting plans →
Hướng dẫn Matt ConnorBởi Matt Connor · Cập nhật ngày 2026-09-06

Claude Fable 5 giá bao nhiêu, nên dùng khi nào?

Claude Fable 5 có giá $10 mỗi triệu input token và $50 mỗi triệu output token. Xem mức giá này phù hợp với tác vụ nào và lưu ý giá Sonnet 5 đổi từ 1/9/2026.

Claude Fable 5 có giá bao nhiêu?

Claude Fable 5 có giá $10 cho mỗi triệu input token và $50 cho mỗi triệu output token trên Claude API. Đây là mức giá niêm yết do Anthropic công bố, được lấy từ trang giá vào ngày 3 August 2026. Model ID trên API là claude-fable-5. Model này được cung cấp rộng rãi từ ngày 9 June 2026 trên Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud và Microsoft Foundry.

ChartPublished Claude API list prices, US dollars per million tokens, checked 3 August 2026
The data behind this chart
[
  {
    "label": "Claude Fable 5",
    "input": "10",
    "output": "50",
    "cache_read": "1",
    "batch_input": "5",
    "batch_output": "25"
  },
  {
    "label": "Claude Opus 5",
    "input": "5",
    "output": "25",
    "cache_read": "0.50",
    "batch_input": "2.50",
    "batch_output": "12.50"
  },
  {
    "label": "Claude Sonnet 5 (intro rate)",
    "input": "2",
    "output": "10",
    "cache_read": "0.20",
    "batch_input": "1",
    "batch_output": "5"
  },
  {
    "label": "Claude Sonnet 5 (from 1 Sep)",
    "input": "3",
    "output": "15",
    "cache_read": "0.30",
    "batch_input": "1.50",
    "batch_output": "7.50"
  },
  {
    "label": "Claude Haiku 4.5",
    "input": "1",
    "output": "5",
    "cache_read": "0.10",
    "batch_input": "0.50",
    "batch_output": "2.50"
  }
]

Hãy xem các mức giá này như một bậc thang. Giá niêm yết của Fable 5 cao gấp đôi Claude Opus 5, gấp 5 lần mức giá hiện tại của Claude Sonnet 5 và gấp 10 lần Claude Haiku 4.5. Tỷ lệ này giống nhau ở cả input và output, vì mọi model trong bảng đều có giá output đúng bằng 5 lần giá input của chính model đó. Vì vậy, nếu biết tỷ lệ input token và output token của một tác vụ, bạn có thể chuyển từ mức giá này sang bất kỳ mức giá nào khác bằng phép nhân.

Một mốc thời gian làm thay đổi phép tính. Sonnet 5 đang áp dụng mức giá giới thiệu $2 và $10 cho mỗi triệu token đến hết ngày 31 August 2026. Từ ngày 1 September 2026, model này có giá niêm yết $3 và $15. Giá của Fable 5 không thay đổi, nên khoảng cách giữa hai model giảm từ 5 lần xuống hơn 3 lần một chút vào ngày đó. Nếu lập ngân sách cho mùa thu, hãy dùng các mức giá Sonnet mới hơn.

Các khoản giảm giá và hệ số duy nhất làm tăng chi phí

Prompt caching là đòn bẩy lớn nhất. Đọc cache có giá bằng một phần mười giá input cơ bản, tức $1 cho mỗi triệu token trên Fable 5. Ghi vào cache đắt hơn một input token thông thường: bằng 1.25 lần giá cơ bản với cache 5 phút và 2 lần giá cơ bản với cache 1 giờ. Cache 5 phút hoàn vốn sau một lần đọc, còn cache 1 giờ hoàn vốn sau hai lần đọc. Phép tính này chính là lý do cần tính điểm hòa vốn của prompt caching trước khi bật tính năng này cho mọi nơi.

Batch API giảm 50% cho cả input và output, nên tác vụ Fable 5 chạy theo batch có giá $5 cho input và $25 cho output trên mỗi triệu token. Các request batch chạy bất đồng bộ, nên cách này chỉ phù hợp với tác vụ không cần kết quả ngay. Hai khoản giảm giá được cộng dồn, vì vậy một tác vụ vừa dùng cache vừa chạy theo batch sẽ rẻ hơn ở cả hai phía.

Context window 1M token được tính theo mức giá tiêu chuẩn trên Claude 4.6 và các model mới hơn. Không có phụ phí context dài, nên request 900k token có cùng đơn giá mỗi token như request 9k token.

Hệ số làm tăng hóa đơn là data residency. Đặt inference_geo: "us" để giữ quá trình inference bên trong Hoa Kỳ sẽ áp dụng hệ số 1.1 cho mọi nhóm token, bao gồm cả việc đọc và ghi cache. Hãy giữ routing global mặc định, trừ khi hợp đồng yêu cầu khác.

Model này có một quy tắc tính phí riêng. Fable 5 tích hợp safety classifier có thể từ chối request. Khi đó, Messages API trả về stop_reason: "refusal" với HTTP 200 thành công thay vì trả về lỗi, và bạn không bị tính phí nếu request bị từ chối trước khi tạo ra output. Nếu retry cùng prompt trên một Claude model khác, fallback credit sẽ hoàn lại chi phí prompt cache phát sinh do chuyển model, nên bạn không phải trả phí để làm nóng cùng một cache hai lần.

Gói nào bao gồm Claude Fable 5?

Tính đến ngày 3 August 2026, trang Claude Fable của Anthropic cho biết model này khả dụng cho người dùng Pro, Max, Team và Enterprise. Gói miễn phí không được nêu tên. Pro là seat rẻ nhất trong danh sách đó, vì vậy chi phí của Pro và giới hạn usage của gói này là mức sàn cho mọi lựa chọn subscription để dùng Fable. Nếu lý do chính khiến bạn nâng cấp là quyền truy cập Fable, trước tiên hãy xem seat Pro có đáng trả tiền với usage của riêng bạn hay không, vì allowance Fable thấp không đủ là lý do thuyết phục để tự đăng ký gói. Với developer, model này thường khả dụng trên Claude API và qua các cloud marketplace đã liệt kê ở trên. Tuyến đó không có free tier, nên khoản credit nhỏ Anthropic cấp khi đăng ký là toàn bộ số credit bạn nhận được trước khi hệ thống bắt đầu tính phí.

Có trong một plan không có nghĩa là được sử dụng không giới hạn. Subscription cũng không được tính theo cách giống API, vì Pro seat hoàn toàn không có token quota được công bố mà tính usage bằng số message trong một rolling window. Vì vậy, không có mục nào trong plan có thể quy đổi trực tiếp sang các mức tính trên mỗi triệu token ở trên. Bảng so sánh plan trên trang pricing của Anthropic giới hạn quyền truy cập Fable theo một phần usage limit hằng tuần đối với một số seat và theo usage credit đối với các seat khác. Cơ chế này đã thay đổi nhiều lần trong tháng 7 năm 2026. Theo thông báo của Anthropic về việc redeploy Fable 5, model này được dùng với tối đa 50% usage limit hằng tuần đến ngày 7 tháng 7 năm 2026 trên các plan Pro, Max, Team và một số plan Enterprise; sau ngày đó, usage credit được áp dụng. Các báo cáo trong phần còn lại của tháng 7 cho biết thời hạn tiếp tục được gia hạn và cơ chế được tách theo từng loại seat.

Vì vậy, trang này sẽ không đưa ra limit cho từng gói. Không có con số nào được công bố trong tháng đó duy trì được quá hai tuần, và một con số đã lỗi thời còn tệ hơn việc không nêu con số nào. Hãy mở dòng có nhãn Fable trong bảng so sánh gói vào ngày bạn quyết định, và xem mọi con số trong bài báo là đã lỗi thời. Nếu bạn mua seat để dùng Fable nhưng allowance thực tế thấp hơn bảng dự kiến, hạ gói trước kỳ gia hạn tiếp theo sẽ giữ nguyên tháng bạn đã trả tiền.

Điều ổn định là API rate. Trên mọi tuyến, sau khi dùng hết allowance được bao gồm, usage Fable 5 tiếp theo sẽ bị tính phí theo mức giá trong biểu đồ ở trên. Enterprise thể hiện rõ cấu trúc này, vì phí Enterprise seat chỉ mua quyền truy cập, còn token vẫn được tính theo API rate ngoài khoản đó. Vì vậy, bảng giá là con số cần dùng để lập kế hoạch trong cả hai trường hợp. Đây cũng là kết luận bạn sẽ đạt được khi so sánh API billing với subscription cho bất kỳ Claude model nào khác. Nếu chưa chọn tier, hãy bắt đầu từ gói Claude nào phù hợp với usage của bạn. Nếu seat đó cũng sẽ là assistant dùng hằng ngày thay vì chỉ là cách truy cập Fable, bạn nên kiểm tra giá các gói Claude so với ChatGPT trước khi quyết định.

Vì sao hóa đơn cao hơn mức chênh lệch giá gợi ý

Có 2 cơ chế đã được ghi nhận khiến Fable 5 có chi phí cao hơn so với kết quả so sánh giá trực tiếp.

Cơ chế đầu tiên là tokenizer. Fable 5 dùng tokenizer được giới thiệu cùng Claude Opus 4.7. So với các model phát hành trước Opus 4.7, cùng một đoạn văn bản tạo ra nhiều hơn khoảng 30% token, và mức tăng chính xác phụ thuộc vào nội dung. Haiku 4.5 có trước tokenizer đó, vì vậy khoảng cách 10 lần trong bảng giá thực tế gần 13 lần khi đưa cùng một đoạn văn bản vào cả 2 model. Sonnet 5 dùng tokenizer mới hơn, nên so sánh Fable với Sonnet theo từng token là công bằng. So sánh Fable với Haiku thì không.

Cơ chế thứ hai là thinking. Adaptive thinking luôn được bật cho Fable 5 và thinking: {"type": "disabled"} không được hỗ trợ. Thinking token được tính phí như output token, theo đúng mức giá output. Raw chain of thought không bao giờ được trả về trên model này, và thinking.display mặc định là "omitted". Điều này có nghĩa là một câu trả lời hiển thị ngắn vẫn có thể chứa rất nhiều output token bị tính phí. Tài liệu của Anthropic nêu rõ: số output token bị tính phí không trùng với số token hiển thị trong response.

Hãy xem breakdown thay vì đoán. Trường usage.output_tokens_details.thinking_tokens cho biết có bao nhiêu output token bị tính phí được dùng cho reasoning:

{
  "usage": {
    "input_tokens": 25,
    "output_tokens": 348,
    "output_tokens_details": {
      "thinking_tokens": 312
    }
  }
}

Trong ví dụ đó, lấy từ tài liệu về thinking của Anthropic, 312 trong số 348 output token bị tính phí là reasoning mà người dùng không bao giờ thấy. Khi stream, breakdown này chỉ xuất hiện trong event message_delta cuối cùng. Vì vậy, client dừng đọc ở text chunk cuối sẽ không bao giờ ghi nhận breakdown này.

Thiết lập điều khiển là effort, được đặt tại output_config.effort, với các mức low, medium, high (mặc định), xhigh và max.

{
  "model": "claude-fable-5",
  "max_tokens": 32000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

Hướng dẫn của Anthropic cho model này là bắt đầu ở high, chỉ tăng lên xhigh cho các tác vụ nhạy với capability nhất, và giảm xuống medium hoặc low cho công việc thông thường. Lý do là effort thấp hơn trên Fable 5 thường hiệu quả hơn xhigh trên các model trước. Có 2 bẫy cần lưu ý. Thay đổi effort giữa các request sẽ làm prompt cache không còn hợp lệ, vì giá trị effort đã resolve được chèn vào prompt. Vì vậy, hãy chọn một mức cho từng workload và giữ cố định mức đó. Ngoài ra, max_tokens là giới hạn cứng cho tổng output, gồm cả thinking và response text. Do đó, cap được đặt theo câu trả lời không có thinking sẽ làm response bị cắt ngắn. Nếu thấy stop_reason: "max_tokens", bạn phải tăng cap hoặc giảm effort.

Chi phí trên mỗi tác vụ hoàn thành, không phải chi phí trên mỗi token

ChartCost of one job in US dollars, worked from published rates and assumed token volumes
The data behind this chart
[
  {
    "label": "Short answer (5k in, 1k out)",
    "fable_5": "0.10",
    "opus_5": "0.05",
    "sonnet_5": "0.02",
    "haiku_4_5": "0.01"
  },
  {
    "label": "Coding session (300k in, 40k out)",
    "fable_5": "5.00",
    "opus_5": "2.50",
    "sonnet_5": "1.00",
    "haiku_4_5": "0.50"
  },
  {
    "label": "Long agent run (2M in, 400k out)",
    "fable_5": "40.00",
    "opus_5": "20.00",
    "sonnet_5": "8.00",
    "haiku_4_5": "4.00"
  }
]

3 hàng đó chỉ là phép tính số học, không phải benchmark. Các mức giá đã được công bố. Số lượng token là các giả định; bạn nên thay bằng số liệu từ dữ liệu sử dụng của chính mình. Một phiên coding có quy mô như hàng giữa có chi phí $5.00 trên Fable 5, so với $1.00 trên Sonnet 5. Lần chạy dài có chi phí $40.00 so với $8.00. Cột Haiku ở hàng cuối chỉ là phép tính số học: Haiku 4.5 có context window 200k token, nên hoàn toàn không thể chứa tác vụ đó.

Chi phí trên mỗi token không phải đơn vị phù hợp để ra quyết định. Chi phí trên mỗi tác vụ hoàn thành bằng chi phí cho mỗi lần thử nhân với số lần thử. Với mức giá hiện tại, một lần thử trên Fable 5 có chi phí bằng năm lần thử trên Sonnet 5, vì vậy chỉ riêng số lần retry gần như không bao giờ đủ để justify việc nâng cấp. Sonnet phải fail hơn bốn lần trong năm lần thì phương án rẻ hơn mới kém hiệu quả về token.

Điều thực sự justify việc nâng cấp là mọi yếu tố mà hóa đơn token không thể hiện. Ở hầu hết thị trường, chênh lệch giữa hai lần chạy dài trong biểu đồ còn nhỏ hơn chi phí cho một giờ làm việc của kỹ sư. Nếu model đắt hơn giúp tiết kiệm một giờ review hoặc tránh một migration lỗi mà sau đó bạn phải gỡ lại, thì nó đã tự hoàn vốn, dù hóa đơn không bao giờ thể hiện khoản tiết kiệm đó. Hãy so sánh theo chi phí trên mỗi kết quả được chấp nhận và tính cả thời gian của chính bạn vào tổng chi phí. Biết một triệu token thực sự mua được gì sẽ giúp ước tính đó bớt trừu tượng hơn nhiều.

Ba tác vụ mà Claude Fable 5 xứng đáng với chi phí

Các tác vụ agent chạy trong thời gian dài, trong đó một hướng đi sai sẽ gây tốn kém. Fable 5 được thiết kế cho những công việc kéo dài hàng giờ: context window 1M token, tối đa 128k output token cho mỗi request và mức xhigh effort dành cho các tác vụ chạy hơn ba mươi phút với ngân sách hàng triệu token. Hãy so sánh chi phí một lần chạy với công sức dọn dẹp sau khi agent rẽ sai ở bước 40 nhưng không ai phát hiện cho đến bước 300.

Một lần migration hoặc audit trên một codebase lớn. Công việc chỉ thực hiện một lần không có đủ khối lượng để phân bổ chi phí, nên phần phí premium trên mỗi token sẽ dồn vào một hóa đơn duy nhất; toàn bộ tác vụ cũng có thể nằm gọn trong một context window. Nếu có thể chạy bất đồng bộ, Batch API giảm chi phí xuống một nửa, còn $25 cho mỗi triệu output token.

Tác vụ mà model rẻ hơn đã thất bại hai lần. Hai lần thử thất bại cộng với thời gian debug có thể tốn nhiều hơn một lần chạy Fable ở mức khối lượng nêu trong biểu đồ trên. Chuyển lên tier cao hơn là lựa chọn rẻ hơn; đó chính là mục đích của model ladder. Nếu bạn vẫn đang chọn giữa các tier nói chung, bảng so sánh capability giữa các tier Claude trả lời một câu hỏi khác với trang này.

Ba tác vụ mà Sonnet 5 hoặc Haiku 4.5 là lựa chọn hợp lý

Phân loại và trích xuất với khối lượng lớn. Các tác vụ này được đánh giá theo throughput và chi phí trên mỗi đơn vị, còn chất lượng tối đa đủ thấp để một model rẻ hơn cũng đạt được. Nếu một tác vụ được Haiku 4.5 hoàn thành chính xác với chi phí thấp hơn 10 lần, Fable 5 không mang lại lợi ích đo được nào.

Tác vụ tương tác, trong đó latency là yếu tố quyết định. Bảng model của Anthropic cho biết latency tương đối của Fable 5 chậm hơn, và không thể tắt thinking. Chat box hoặc tính năng hoàn thành trong editor sẽ cho cảm giác kém hơn trên model mạnh hơn, vì người dùng nhận thấy thời gian chờ trước khi nhận thấy chất lượng.

Mọi thứ phụ thuộc vào các sự kiện xảy ra sau January 2026. Reliable knowledge cutoff của Fable 5 là January 2026. Của Opus 5 là May 2026. Model đắt hơn lại có thông tin cũ hơn, nên với các câu hỏi cần thông tin mới, bạn phải trả gấp đôi cho knowledge cũ trừ khi cung cấp cho model các tool search hoặc fetch.

Có một hạn chế hoàn toàn không liên quan đến chi phí. Fable 5 lưu giữ dữ liệu trong 30 day và không hỗ trợ zero data retention vì được chỉ định là Covered Model. Nếu thỏa thuận của bạn yêu cầu zero retention, Fable 5 không phải là lựa chọn ở bất kỳ mức giá nào, và không có discount nào thay đổi được điều đó.

Các repo fable-method cho thấy điều gì và không cho thấy điều gì

Một số người dùng đã công bố các repo chắt lọc cách làm việc của Fable 5 thành những skill mà model rẻ hơn có thể thực hiện. Repo fable-method mô tả một skill suy luận, một vòng lặp orchestration và một trình xác minh đối nghịch chạy lại mọi kiểm tra được tuyên bố, thay vì đọc báo cáo do chính agent tạo ra. README của repo nêu rõ: "Đây là bản chắt lọc do cộng đồng thực hiện, không phải sản phẩm của Anthropic."

Hãy xem repo này đúng như vậy. Nó cho thấy cách mọi người điều khiển model, không phải tài liệu mô tả cách model hoạt động. Anthropic chưa xác thực bất kỳ nội dung nào trong repo. Ngoài ra còn có một số fork gần như giống hệt nhau nhưng dùng cách diễn đạt khác nhau. Đây là đặc điểm của truyền miệng, không phải của một spec.

Tín hiệu đáng chú ý khi quyết định về chi phí là những phần được sao chép đều mang tính quy trình. Hãy phân loại task, nêu rõ kiểm tra nào chứng minh task đã hoàn tất, thu thập bằng chứng trước khi quyết định, rồi xác minh bằng quan sát thay vì đọc bản tóm tắt. Khi được cung cấp checklist rõ ràng và một bước xác minh, model rẻ hơn có thể thu hẹp một phần khoảng cách. Vì vậy, hãy chạy thử nghiệm này trên bộ đánh giá của chính bạn trước khi chuẩn hóa việc dùng model đắt hơn. Kết quả phụ thuộc vào task của bạn, nên các con số của người khác không có nhiều giá trị đối với bạn.

Kiểm tra số liệu của chính bạn trước khi cam kết ngân sách

  • Đọc usage trong mọi response và ghi log output_tokens_details.thinking_tokens riêng với output hiển thị. Phần reasoning bạn không nhìn thấy mới là khoản mục khiến nhiều người bất ngờ.
  • Đặt effort một cách rõ ràng thay vì chấp nhận giá trị mặc định, và giữ cố định giá trị này trong mọi conversation dựa vào prompt caching.
  • Đưa stable prefix vào cache breakpoint trước. Cache read với mức giá bằng một phần mười giá input cơ bản thường tiết kiệm nhiều hơn việc hạ cấp model.
  • Chuyển mọi tác vụ không cần câu trả lời ngay sang Batch API.
  • Tính chi phí của phương án thay thế một cách thực tế. So sánh giá API của Claude và ChatGPT trên workload của chính bạn đáng để dành một buổi chiều trước khi cam kết dài hạn.

Nếu workload là một agent chạy trên server của bạn, các cơ chế kiểm soát quan trọng nhất nằm ngoài lựa chọn model. Kiểm soát chi phí agent trên VPS trình bày các giới hạn vòng lặp và mức trần chi tiêu để ngăn một session chạy không kiểm soát, còn Claude Code thực sự tiêu tốn token ở đâu giải thích các số liệu bạn sẽ thấy trong usage dashboard.

FAQ

Claude Fable 5 có giá bao nhiêu cho mỗi triệu token?

Claude Fable 5 có giá $10 cho mỗi triệu input token và $50 cho mỗi triệu output token trên Claude API, theo thông tin kiểm tra trên trang giá của Anthropic vào ngày 3 tháng 8 năm 2026. Đọc cache có giá $1 cho mỗi triệu token, bằng một phần mười mức giá input cơ bản. Batch API giảm 50% cho cả input và output, còn $5 và $25 cho mỗi triệu token khi xử lý bất đồng bộ. Giữ inference trong Hoa Kỳ bằng tham số inference_geo sẽ thêm hệ số 1.1 vào mọi nhóm giá.

Claude Fable 5 có nằm trong gói Claude Pro không?

Trang Claude Fable của Anthropic liệt kê model này là có sẵn cho người dùng Pro, Max, Team và Enterprise, nhưng không nêu gói miễn phí. Quyền truy cập đi kèm không phải là không giới hạn. Một số seat được cấp quyền truy cập Fable theo hạn mức sử dụng hằng tuần, còn những seat khác dùng usage credit. Cơ chế này đã thay đổi nhiều hơn một lần trong tháng 7 năm 2026. Hãy đọc dòng có nhãn Fable trong bảng so sánh các gói trên trang giá của Anthropic vào ngày bạn quyết định, thay vì tin vào một con số trong bài viết. Khi dùng hết hạn mức đi kèm, usage tiếp theo sẽ được tính theo mức giá API.

Vì sao hóa đơn Claude Fable 5 của tôi cao hơn so với phần output hiển thị?

Adaptive thinking luôn bật với Claude Fable 5. Thinking token được tính như output token, còn raw chain of thought không bao giờ được trả về. Khi thinking.display có giá trị mặc định là omitted, bạn thấy trường thinking trống nhưng vẫn phải trả phí cho mọi reasoning token phía sau. Đọc usage.output_tokens_details.thinking_tokens trong response để xem phần phân bổ, và lưu ý rằng khi streaming, trường này chỉ xuất hiện trong event message_delta cuối cùng. Hạ mức effort nếu tỷ lệ reasoning so với câu trả lời cao hơn nhu cầu của task.

Nên dùng Claude Fable 5 hay Claude Opus 5?

Claude Opus 5 có giá mỗi token bằng một nửa và có mốc kiến thức đáng tin cậy mới hơn: tháng 5 năm 2026, so với tháng 1 năm 2026 của Fable 5. Hãy bắt đầu với Opus 5 và chuyển lên model cao hơn khi task thất bại trên model đó, hoặc khi chi phí của câu trả lời sai cao hơn phần chênh lệch giá. Fable 5 phù hợp cho agent work có horizon dài, trong đó một nhánh sai có thể khiến bạn mất nhiều giờ cleanup, và cho các job one-off mà khoản phí cao hơn chỉ xuất hiện trên một hóa đơn thay vì áp dụng cho mọi request về lâu dài.

#claude#fable#model-selection#pricing#tokens