SSD Nodes Learn 🎉 VPS từ $4.99/tháng
Hướng dẫn Matt ConnorBởi Matt Connor

Claude Fable 5: giá bao nhiêu, khi nào nên dùng?

Claude Fable 5 có giá $10 cho mỗi triệu input token và $50 cho mỗi triệu output token. Xem mức giá này phù hợp với tác vụ nào và khi nào nên dùng model.

Claude Fable 5 có giá bao nhiêu?

Claude Fable 5 có giá $10 cho mỗi triệu input token và $50 cho mỗi triệu output token trên Claude API. Đây là mức giá niêm yết do Anthropic công bố, được lấy từ trang giá vào ngày 3 August 2026. Model ID trên API là claude-fable-5. Model này được cung cấp rộng rãi từ ngày 9 June 2026 trên Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud và Microsoft Foundry.

ChartPublished Claude API list prices, US dollars per million tokens, checked 3 August 2026
The data behind this chart
[
  {
    "label": "Claude Fable 5",
    "input": "10",
    "output": "50",
    "cache_read": "1",
    "batch_input": "5",
    "batch_output": "25"
  },
  {
    "label": "Claude Opus 5",
    "input": "5",
    "output": "25",
    "cache_read": "0.50",
    "batch_input": "2.50",
    "batch_output": "12.50"
  },
  {
    "label": "Claude Sonnet 5 (intro rate)",
    "input": "2",
    "output": "10",
    "cache_read": "0.20",
    "batch_input": "1",
    "batch_output": "5"
  },
  {
    "label": "Claude Sonnet 5 (from 1 Sep)",
    "input": "3",
    "output": "15",
    "cache_read": "0.30",
    "batch_input": "1.50",
    "batch_output": "7.50"
  },
  {
    "label": "Claude Haiku 4.5",
    "input": "1",
    "output": "5",
    "cache_read": "0.10",
    "batch_input": "0.50",
    "batch_output": "2.50"
  }
]

Hãy xem mức giá này như một bậc thang. Fable 5 có giá niêm yết gấp đôi Claude Opus 5, gấp 5 lần mức giá hiện tại của Claude Sonnet 5 và gấp 10 lần Claude Haiku 4.5. Tỷ lệ này giống nhau ở cả input và output, vì mọi model trong bảng đều định giá output đúng bằng 5 lần mức giá input tương ứng. Vì vậy, nếu biết tỷ lệ input token và output token của một tác vụ, bạn có thể chuyển từ mức giá này sang mức giá khác bằng phép nhân.

Một mốc thời gian làm thay đổi phép tính. Sonnet 5 đang được áp dụng mức giá giới thiệu là $2$10 cho mỗi triệu token đến hết ngày 31 August 2026. Từ ngày 1 September 2026, model này có giá niêm yết $3$15. Giá riêng của Fable 5 không thay đổi, nên khoảng cách giữa hai model giảm từ 5 lần xuống còn hơn 3 lần một chút vào ngày đó. Nếu lập ngân sách cho mùa thu, hãy dùng các mức giá Sonnet mới hơn.

Các mức giảm giá và hệ số duy nhất làm tăng chi phí

Prompt caching là đòn bẩy lớn nhất. Đọc từ cache có chi phí bằng một phần mười giá input cơ bản, tức $1 cho mỗi triệu token trên Fable 5. Ghi vào cache đắt hơn một token input thông thường: bằng 1.25 lần giá cơ bản với cache 5 phút và 2 lần giá cơ bản với cache 1 giờ. Cache 5 phút hoàn vốn sau một lần đọc, còn cache 1 giờ hoàn vốn sau hai lần đọc. Phép tính này là toàn bộ cơ sở để tính điểm hòa vốn của prompt caching trước khi bật tính năng này ở mọi nơi.

Batch API giảm 50% cho cả hai phía, nên tác vụ Fable 5 chạy theo batch có chi phí $5 cho input và $25 cho output, tính trên mỗi triệu token. Batch request chạy bất đồng bộ, nên chỉ phù hợp với các tác vụ không cần kết quả ngay. Hai mức giảm giá được cộng dồn, khiến một tác vụ vừa dùng cache vừa chạy theo batch có chi phí thấp ở cả input và output.

Context window 1M token được tính theo mức giá tiêu chuẩn trên Claude 4.6 và các model mới hơn. Không có phụ phí cho context dài, nên request 900k token có cùng mức giá trên mỗi token như request 9k token.

Hệ số làm tăng hóa đơn là data residency. Đặt inference_geo: "us" để giữ quá trình inference trong United States sẽ áp dụng hệ số 1.1 cho mọi loại token, bao gồm cả cache read và cache write. Hãy giữ routing global mặc định, trừ khi hợp đồng yêu cầu khác.

Model này có một quy tắc tính phí riêng. Fable 5 tích hợp các safety classifier có thể từ chối request. Khi đó, Messages API trả về stop_reason: "refusal" với phản hồi HTTP 200 thành công thay vì báo lỗi, và bạn không bị tính phí cho request bị từ chối trước khi tạo output. Nếu retry cùng prompt trên một Claude model khác, fallback credit sẽ hoàn lại chi phí prompt cache của lần chuyển model, nên bạn không phải trả phí để warm cùng một cache hai lần.

Những gói nào bao gồm Claude Fable 5?

Tính đến ngày 3 tháng 8 năm 2026, trang Claude Fable của Anthropic cho biết model này khả dụng cho người dùng Pro, Max, Team và Enterprise. Gói miễn phí không được nêu tên. Với developer, model này hiện khả dụng rộng rãi trên Claude API và qua các cloud marketplace được liệt kê ở trên.

Khả dụng trong một gói không có nghĩa là được sử dụng không giới hạn. Bảng so sánh gói trên trang pricing của Anthropic giới hạn Fable theo một phần hạn mức sử dụng hằng tuần ở một số seat và theo usage credit ở các seat khác. Cách áp dụng này đã thay đổi nhiều hơn một lần trong tháng 7 năm 2026. Tuyên bố của Anthropic về việc triển khai lại Fable 5 cho phép model này dùng tối đa 50% hạn mức sử dụng hằng tuần đến ngày 7 tháng 7 năm 2026 trên các gói Pro, Max, Team và một số gói Enterprise, sau đó chuyển sang usage credit. Các báo cáo trong phần còn lại của tháng 7 mô tả thêm các lần gia hạn và sự khác biệt giữa các loại seat.

Vì vậy, trang này sẽ không đưa ra hạn mức cho từng gói. Không có con số nào được công bố trong tháng đó giữ nguyên quá 2 tuần. Một con số đã lỗi thời còn tệ hơn việc không đưa ra con số nào. Hãy mở dòng có nhãn Fable trong bảng so sánh gói vào ngày bạn quyết định, và xem mọi con số trong bài báo là đã lỗi thời.

Điều ổn định là mức giá API. Trên mọi route, sau khi dùng hết allowance đã bao gồm, phần sử dụng Fable 5 tiếp theo sẽ được tính theo mức giá trong biểu đồ ở trên. Vì vậy, dù theo cách nào, bảng giá vẫn là cơ sở để lập kế hoạch. Đây cũng là kết luận bạn rút ra khi so sánh chi phí API với subscription cho bất kỳ model Claude nào khác. Nếu bạn chưa chọn tier, hãy bắt đầu từ gói Claude nào phù hợp với cách bạn sử dụng.

Vì sao hóa đơn cao hơn mức chênh lệch giá

Có 2 cơ chế được ghi rõ trong tài liệu khiến Fable 5 tốn nhiều hơn mức so sánh giá trực tiếp.

Cơ chế đầu tiên là tokenizer. Fable 5 sử dụng tokenizer được giới thiệu cùng Claude Opus 4.7. So với các model phát hành trước Opus 4.7, cùng một đoạn văn bản tạo ra nhiều hơn khoảng 30% token, và mức tăng chính xác phụ thuộc vào nội dung. Haiku 4.5 ra mắt trước tokenizer đó, nên khoảng cách gấp 10 lần trong bảng giá thực tế gần với gấp 13 lần khi đưa cùng một đoạn văn bản vào cả 2 model. Sonnet 5 sử dụng tokenizer mới hơn, nên so sánh Fable với Sonnet theo mỗi token là hợp lý. So sánh Fable với Haiku thì không.

Cơ chế thứ hai là thinking. Adaptive thinking luôn được bật trong Fable 5 và thinking: {"type": "disabled"} không được hỗ trợ. Thinking token được tính phí như output token, theo đầy đủ mức giá output. Chain of thought thô không bao giờ được trả về từ model này, còn thinking.display mặc định là "omitted". Điều đó có nghĩa là một câu trả lời hiển thị ngắn vẫn có thể có số lượng output token bị tính phí rất lớn. Tài liệu của Anthropic nêu rõ: số output token bị tính phí không khớp với số token hiển thị trong response.

Hãy đọc phần breakdown thay vì đoán. Trường usage.output_tokens_details.thinking_tokens cho biết có bao nhiêu output token bị tính phí đã được dùng cho reasoning:

{
  "usage": {
    "input_tokens": 25,
    "output_tokens": 348,
    "output_tokens_details": {
      "thinking_tokens": 312
    }
  }
}

Trong ví dụ đó, lấy từ tài liệu thinking của Anthropic, 312 trong số 348 output token bị tính phí được dùng cho reasoning mà không ai nhìn thấy. Khi stream, breakdown này chỉ xuất hiện trong event message_delta cuối cùng. Vì vậy, client dừng đọc sau text chunk cuối sẽ không bao giờ ghi lại thông tin này.

Thiết lập điều khiển là effort, được đặt tại output_config.effort, với các mức low, medium, high (mặc định), xhighmax.

{
  "model": "claude-fable-5",
  "max_tokens": 32000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

Hướng dẫn của Anthropic cho model này là bắt đầu ở high, chỉ tăng lên xhigh cho công việc yêu cầu capability cao nhất, và giảm xuống medium hoặc low cho công việc thường ngày. Lý do là effort thấp hơn trên Fable 5 thường cho kết quả tốt hơn xhigh trên các model cũ hơn. Có 2 điểm dễ mắc lỗi. Thay đổi effort giữa các request sẽ làm prompt cache không còn hợp lệ, vì giá trị effort sau khi resolve được đưa vào prompt. Do đó, hãy chọn một mức cho từng workload và giữ cố định. Ngoài ra, max_tokens là giới hạn cứng trên tổng output, bao gồm cả thinking và response text. Vì vậy, cap được đặt cho câu trả lời không có thinking có thể làm output bị cắt ngắn. Nếu thấy stop_reason: "max_tokens", bạn phải tăng cap hoặc giảm effort.

Chi phí cho mỗi tác vụ hoàn tất, không phải chi phí cho mỗi token

ChartCost of one job in US dollars, worked from published rates and assumed token volumes
The data behind this chart
[
  {
    "label": "Short answer (5k in, 1k out)",
    "fable_5": "0.10",
    "opus_5": "0.05",
    "sonnet_5": "0.02",
    "haiku_4_5": "0.01"
  },
  {
    "label": "Coding session (300k in, 40k out)",
    "fable_5": "5.00",
    "opus_5": "2.50",
    "sonnet_5": "1.00",
    "haiku_4_5": "0.50"
  },
  {
    "label": "Long agent run (2M in, 400k out)",
    "fable_5": "40.00",
    "opus_5": "20.00",
    "sonnet_5": "8.00",
    "haiku_4_5": "4.00"
  }
]

Các dòng 3 đó chỉ là phép tính số học, không phải benchmark. Các mức giá đã được công bố. Số lượng token là các giả định; bạn nên thay bằng số liệu từ dữ liệu sử dụng của chính mình. Một phiên coding có quy mô như dòng giữa có chi phí $5.00 với Fable 5, so với $1.00 với Sonnet 5. Lượt chạy dài có chi phí $40.00 so với $8.00. Cột Haiku ở dòng cuối chỉ là phép tính số học: Haiku 4.5 có context window 200k token, nên hoàn toàn không thể chứa tác vụ đó.

Chi phí cho mỗi token là đơn vị đo sai khi ra quyết định. Chi phí cho mỗi tác vụ hoàn tất bằng chi phí cho mỗi lần thử nhân với số lần thử. Với mức giá hiện tại, một lần thử bằng Fable 5 có chi phí bằng năm lần thử bằng Sonnet 5, nên riêng số lần retry gần như không bao giờ đủ để biện minh cho việc nâng cấp. Sonnet phải thất bại hơn 4 lần trong 5 lần thì phương án rẻ hơn mới thua về chi phí token.

Điều thực sự có thể biện minh cho lựa chọn đó là mọi chi phí mà hóa đơn token không thể hiện. Chênh lệch giữa 2 lượt chạy dài trong biểu đồ nhỏ hơn chi phí cho 1 giờ làm việc của kỹ sư ở hầu hết các thị trường. Nếu model đắt hơn giúp tiết kiệm 1 giờ review, hoặc tránh được 1 migration lỗi mà sau đó bạn phải tháo gỡ, thì nó đã tự hoàn vốn, dù hóa đơn không bao giờ thể hiện khoản tiết kiệm đó. Hãy tính theo chi phí cho mỗi kết quả được chấp nhận và đưa thời gian của chính bạn vào tổng chi phí. Biết 1 triệu token thực sự mua được gì sẽ giúp ước tính này bớt trừu tượng hơn nhiều.

Ba công việc giúp Claude Fable 5 xứng đáng với chi phí

Các lần chạy agent kéo dài, trong đó chọn sai hướng sẽ tốn nhiều công sức để khắc phục. Fable 5 được thiết kế cho các công việc kéo dài hàng giờ: context window 1M token, tối đa 128k output token cho mỗi request và mức nỗ lực xhigh dành cho các tác vụ chạy hơn ba mươi phút với ngân sách hàng triệu token. Hãy so sánh chi phí của lần chạy với công sức dọn dẹp sau khi agent rẽ sai ở bước 40 nhưng không ai phát hiện cho đến bước 300.

Một lần migration hoặc audit được thực hiện trên toàn bộ codebase lớn. Công việc chỉ thực hiện một lần không có đủ khối lượng để phân bổ chi phí, nên phần phụ phí trên mỗi token sẽ dồn vào một hóa đơn duy nhất. Toàn bộ công việc cũng có thể nằm trong một context window. Nếu có thể chạy bất đồng bộ, Batch API giảm chi phí xuống còn $25 cho mỗi triệu output token.

Tác vụ mà model rẻ hơn đã thất bại hai lần. Hai lần thử thất bại cộng với thời gian debug có chi phí cao hơn một lần chạy Fable ở các mức sử dụng trong biểu đồ trên. Chuyển lên tier cao hơn là lựa chọn rẻ hơn. Đó cũng là mục đích của model ladder. Nếu bạn vẫn đang chọn giữa các tier nói chung, bảng so sánh capability giữa các tier Claude trả lời một câu hỏi khác với nội dung của trang này.

Ba tác vụ mà Sonnet 5 hoặc Haiku 4.5 là lựa chọn hợp lý

Phân loại và trích xuất với khối lượng lớn. Các tác vụ này được đánh giá theo throughput và chi phí mỗi đơn vị. Mức chất lượng tối đa cũng đủ thấp để một model rẻ đạt được. Nếu một tác vụ đã được Haiku 4.5 hoàn thành chính xác, trả giá cao hơn 10 lần cho tác vụ đó bằng Fable 5 không mang lại lợi ích đo được.

Tác vụ tương tác mà latency là yếu tố cốt lõi. Bảng model của Anthropic cho biết latency tương đối của Fable 5 chậm hơn, và không thể tắt thinking. Chat box hoặc tính năng hoàn thành trong editor cho cảm giác kém hơn trên model mạnh hơn, vì người dùng nhận thấy thời gian chờ trước khi nhận thấy chất lượng.

Mọi tác vụ phụ thuộc vào sự kiện sau January 2026. Reliable knowledge cutoff của Fable 5 là January 2026. Của Opus 5 là May 2026. Model đắt hơn lại có thông tin cũ hơn. Vì vậy, với các câu hỏi cần thông tin mới, bạn phải trả gấp đôi cho kiến thức cũ hơn, trừ khi cung cấp cho model các tool search hoặc fetch.

Có một giới hạn hoàn toàn không liên quan đến chi phí. Fable 5 lưu giữ dữ liệu trong 30 day và không hỗ trợ zero data retention vì được chỉ định là Covered Model. Nếu thỏa thuận của bạn yêu cầu zero retention, Fable 5 không phải là một lựa chọn, dù giá là bao nhiêu. Không mức giảm giá nào thay đổi được điều đó.

Những gì các repo phương pháp fable cho thấy và những gì chúng không cho thấy

Các practitioner đã công bố những repo cô đọng cách các phương pháp của Fable 5 hoạt động thành các skill mà một model rẻ hơn có thể làm theo. repo fable-method mô tả một skill tư duy, một vòng lặp orchestration và một verifier đối nghịch chạy lại từng kiểm tra đã được tuyên bố, thay vì đọc báo cáo do chính agent tạo ra. README của repo nói rõ: "Đây là bản chắt lọc từ cộng đồng, không phải sản phẩm của Anthropic."

Hãy xem repo này đúng như vậy. Nó cho thấy mọi người đang điều khiển model như thế nào, chứ không phải tài liệu về cách model hoạt động. Anthropic chưa xác thực bất kỳ nội dung nào trong đó. Ngoài ra còn có một số fork gần như giống hệt nhau nhưng dùng cách diễn đạt khác nhau. Đây là điều thường thấy ở kiến thức truyền miệng, không phải ở một spec.

Điểm đáng lưu ý khi quyết định về chi phí là những phần mọi người thấy đáng sao chép đều mang tính quy trình. Hãy phân loại task, nêu rõ kiểm tra nào chứng minh task đã hoàn tất, thu thập bằng chứng trước khi quyết định, rồi xác minh bằng quan sát thay vì đọc một bản tóm tắt. Khi được cung cấp checklist rõ ràng và một bước verification, model rẻ hơn có thể thu hẹp một phần chênh lệch. Vì vậy, hãy chạy thử nghiệm đó trên evaluation set của chính bạn trước khi chuẩn hóa việc dùng model đắt hơn. Kết quả phụ thuộc vào các task của bạn, nên con số của người khác không có nhiều giá trị đối với bạn.

Kiểm tra các con số của chính bạn trước khi cam kết ngân sách

  • Đọc usage trong mọi response và ghi log output_tokens_details.thinking_tokens riêng với output hiển thị. Phần reasoning mà bạn không nhìn thấy là khoản mục khiến nhiều người bất ngờ.
  • Đặt effort một cách rõ ràng thay vì chấp nhận giá trị mặc định, và giữ cố định trong mọi conversation có sử dụng prompt caching.
  • Đưa prefix ổn định của bạn qua cache breakpoint trước. Cache read với mức giá bằng một phần mười giá input cơ bản thường tiết kiệm nhiều hơn hầu hết việc hạ model.
  • Chuyển mọi tác vụ không cần câu trả lời ngay sang Batch API.
  • Tính chi phí của phương án thay thế một cách thực tế. So sánh giá API của Claude và ChatGPT trên chính workload của bạn là việc đáng dành một buổi chiều trước khi cam kết dài hạn.

Nếu workload là một agent chạy trên server của bạn, các cơ chế kiểm soát quan trọng nhất nằm ngoài việc chọn model. Kiểm soát chi phí agent trên VPS trình bày các giới hạn vòng lặp và spend cap để ngăn một session chạy không kiểm soát, còn Claude Code thực sự sử dụng token ở đâu giải thích các con số bạn sẽ thấy trong usage dashboard.

FAQ

Claude Fable 5 có giá bao nhiêu cho mỗi triệu token?

Claude Fable 5 có giá $10 cho mỗi triệu input token và $50 cho mỗi triệu output token trên Claude API, theo thông tin kiểm tra trên trang giá của Anthropic vào ngày 3 August 2026. Đọc cache có giá $1 cho mỗi triệu token, bằng một phần mười mức giá input cơ bản. Batch API giảm 50% cho cả hai loại, còn $5$25 cho mỗi triệu token khi xử lý bất đồng bộ. Giữ inference trong United States bằng tham số inference_geo sẽ thêm hệ số 1.1 vào mọi danh mục.

Claude Fable 5 có nằm trong gói Claude Pro không?

Trang Claude Fable của Anthropic liệt kê model này là khả dụng cho người dùng gói Pro, Max, Team và Enterprise, nhưng không nêu gói miễn phí. Quyền truy cập đi kèm không phải là không giới hạn. Một số seat được dùng Fable trong phạm vi hạn mức sử dụng hàng tuần, còn một số seat dùng usage credits. Cơ chế này đã thay đổi nhiều hơn một lần trong tháng July 2026. Hãy đọc dòng Fable trong bảng so sánh các gói trên trang giá của Anthropic vào ngày bạn quyết định, thay vì tin vào con số trong một bài viết. Khi dùng hết hạn mức đi kèm, phần sử dụng tiếp theo sẽ được tính theo mức giá API.

Vì sao hóa đơn Claude Fable 5 của tôi cao hơn mức output hiển thị?

Adaptive thinking luôn bật với Claude Fable 5. Thinking token được tính như output token, còn raw chain of thought không bao giờ được trả về. Khi thinking.display dùng giá trị mặc định omitted, bạn thấy trường thinking trống nhưng vẫn bị tính phí cho mọi reasoning token phía sau. Đọc usage.output_tokens_details.thinking_tokens trong response để xem phần phân bổ, và lưu ý rằng khi streaming, trường này chỉ xuất hiện trong event message_delta cuối cùng. Giảm mức effort nếu tỷ lệ reasoning so với câu trả lời cao hơn nhu cầu của task.

Nên dùng Claude Fable 5 hay Claude Opus 5?

Claude Opus 5 có giá mỗi token bằng một nửa và có mốc cutoff kiến thức đáng tin cậy mới hơn: May 2026 so với January 2026 của Fable 5. Hãy bắt đầu với Opus 5 và chuyển sang model cao hơn khi task thất bại trên model này, hoặc khi chi phí của câu trả lời sai lớn hơn phần chênh lệch giá. Fable 5 phù hợp cho các agent task có horizon dài, trong đó một nhánh sai có thể khiến bạn mất hàng giờ để cleanup, và cho các job một lần mà phần phí premium chỉ xuất hiện trên một hóa đơn thay vì áp dụng cho mọi request về sau.

#claude#fable#model-selection#pricing#tokens