Claude Fable 5 价格及适用场景
Claude Fable 5 输入每百万 token 10 美元、输出 50 美元。了解提示缓存、Batch API 折扣,以及 2026 年 9 月 1 日 Sonnet 5 调价后如何选择模型。
Claude Fable 5 的价格是多少?
在 Claude API 上,Claude Fable 5 的输入价格为每百万个输入 token $10,输出价格为每百万个输出 token $50。这些是 Anthropic 公布的标准价格,数据读取自 2026 年 8 月 3 日的价格页面。API 模型 ID 为 claude-fable-5。该模型于 2026 年 6 月 9 日在 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 正式发布。
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]可以将这些价格理解为一个梯度。Fable 5 的标价是 Claude Opus 5 的两倍、当前 Claude Sonnet 5 价格的五倍,以及 Claude Haiku 4.5 的十倍。由于该价格表中的每个模型,其输出价格都正好是自身输入价格的五倍,因此输入和输出两部分账单的比例相同。如果知道某项任务的输入和输出 token 比例,就可以通过乘法将一个模型的价格换算为其他模型的价格。
有一个日期会改变计算结果。Sonnet 5 在 2026 年 8 月 31 日前采用促销价格:每百万个 token 的输入价格为 $2,输出价格为 $10。从 2026 年 9 月 1 日起,其标价变为输入 $3,输出 $15。Fable 5 的价格不会变化,因此两者之间的差距将在当天从五倍缩小到略高于三倍。如果要编制秋季预算,请使用 Sonnet 后续的价格。
折扣,以及唯一一个反向增加费用的乘数
提示缓存是影响费用最大的因素。读取缓存的费用是基础输入价格的十分之一。在 Fable 5 上,每百万个 token 的费用为 $1。写入缓存的费用高于普通输入 token:5 分钟缓存按基础价格的 1.25 倍计费,1 小时缓存按基础价格的 2 倍计费。5 分钟缓存只需读取一次即可回本,1 小时缓存读取两次即可回本。因此,在全面启用提示缓存前,计算提示缓存的盈亏平衡点即可说明其经济性。
Batch API 将输入和输出两端的费用都降低 50%,因此批量 Fable 5 任务的费用为每百万个 token $5 和 $25。批处理请求是异步的,因此只适用于不需要立即得到响应的任务。这两项折扣可以叠加,使缓存批处理任务在输入和输出两方面都很便宜。
Claude 4.6 及更高版本的模型按标准费率包含 1M token 的上下文窗口。不收取长上下文附加费,因此 900k token 请求与 9k token 请求的每 token 费率相同。
会提高账单的乘数是数据驻留。将 inference_geo: "us" 设置为在美国境内执行推理后,所有 token 类别都会应用 1.1 倍乘数,包括缓存读取和缓存写入。除非合同另有要求,否则应保留默认的全局路由。
该模型还有一条特定的计费规则。Fable 5 内置安全分类器,可能拒绝请求。发生这种情况时,Messages API 会返回 stop_reason: "refusal",HTTP 状态为成功的 200,而不是返回错误。如果请求在生成任何输出前被拒绝,则不会产生费用。如果在另一个 Claude 模型上重试相同提示,回退抵扣会退还切换模型产生的提示缓存费用,因此无需为相同缓存重复预热而付费。
哪些套餐包含 Claude Fable 5?
截至 2026年8月3日,Anthropic 的 Claude Fable 页面称,Pro、Max、Team 和 Enterprise 用户可以使用该模型。页面未列出免费套餐。Pro 是该列表中价格最低的席位,因此Pro 的费用及其使用限制决定了通过订阅使用 Fable 的最低成本。如果升级的主要原因是使用 Fable,请先了解按您的实际用量购买 Pro 席位是否值得,因为仅凭有限的 Fable 配额,通常不足以证明订阅本身值得。对于开发者,Claude API 和上文列出的云市场通常都可使用 Fable。API 途径没有免费层,因此在开始计费前,您只能使用Anthropic 注册时提供的小额赠金。
套餐可用并不等于无限制包含。订阅的计量方式也不同于 API,因为 Pro 席位完全没有公开的 token 配额,而是按滚动时间窗口内的消息数统计用量。因此,套餐中的任何内容都无法直接换算为上面的每百万单位价格。Anthropic 定价页面上的套餐对比表显示,部分席位通过每周用量限额的一定比例提供 Fable,其他席位则通过用量额度提供。该安排在 2026 年 7 月期间多次调整。Anthropic 关于重新部署 Fable 5 的声明称,Pro、Max、Team 和部分 Enterprise 套餐可在 2026 年 7 月 7 日之前使用该模型,额度最高为每周用量限额的 50%;此日期之后则使用用量额度。7 月剩余时间的报道显示,相关期限进一步延长,不同席位类型之间也出现了区别。
因此,本页不会列出各套餐的具体限额。该月发布的数字没有任何一个能持续两周,保留过时数字反而不如不提供数字。请在决定购买当天,打开套餐对比表中标为 Fable 的行,并将新闻文章中的任何数字视为过时信息。如果您为了使用 Fable 购买了席位,但实际配额比表格显示的预期更少,在下一次续费前降级不会影响您已经支付的当月使用权。
API 费率是稳定的。无论使用哪种途径,包含的配额用完后,后续 Fable 5 用量都会按照上方图表中的价格计费。Enterprise 明确体现了这一结构,因为Enterprise 席位费用只购买访问权限,token 仍按 API 费率单独计费。因此,无论采用哪种方式,都应以价格表中的数字作为预算依据;对其他 Claude 模型比较 API 计费与订阅费用时,也会得出同样的结论。如果您还没有选择套餐,请先了解哪个 Claude 套餐符合您的用量。如果该席位还会作为您的日常助手,而不只是用于访问 Fable,那么在决定之前,也值得检查Claude 各套餐与 ChatGPT 的价格对比。
为什么账单高于价格比例所显示的金额
有两种已记录的机制,会使 Fable 5 的费用高于直接比较价格所推算的金额。
第一种机制是分词器。Fable 5 使用 Claude Opus 4.7 引入的分词器。与 Opus 4.7 之前发布的模型相比,相同文本生成的 token 大约多 30%,具体增幅取决于内容。Haiku 4.5 早于该分词器,因此将相同文本分别输入两个模型后,价格表中十倍的差距实际更接近十三倍。Sonnet 5 使用较新的分词器,因此 Fable 与 Sonnet 的每 token 价格比较是公平的。Fable 与 Haiku 的比较则不是。
第二种机制是思考。Fable 5 始终启用自适应思考,并且不支持 thinking: {"type": "disabled"}。思考 token 按输出 token 计费,使用完整的输出价格。该模型不会返回原始思维链,而 thinking.display 默认为 "omitted",因此简短的可见答案也可能包含大量计费输出 token。Anthropic 的文档对此有明确说明:计费输出 token 数量与响应中可见的 token 数量并不一致。
请查看明细,不要凭猜测判断。字段 usage.output_tokens_details.thinking_tokens 报告用于推理的计费输出 token 数量:
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}该示例取自 Anthropic 的思考文档。在 348 个计费输出 token 中,有 312 个用于用户看不到的推理。使用流式传输时,此明细只会在最后一个 message_delta 事件中到达,因此在最后一个文本块处停止读取的客户端不会记录它。
控制项为 effort,设置为 output_config.effort,可用级别包括 low、medium、high(默认值)、xhigh 和 max。
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Anthropic 针对该模型的建议是从 high 开始,仅在最关注能力的工作中提升到 xhigh,而在常规工作中降至 medium 或 low。原因是,在 Fable 5 上使用较低的思考强度通常优于早期模型上的 xhigh。这里有两个容易踩坑的地方。请求之间更改思考强度会使提示缓存失效,因为解析后的强度值会写入提示内容。因此,应为每类工作选择一个级别并保持不变。另一个问题是,max_tokens 是总输出的硬上限,其中同时包含思考内容和响应文本,因此按无思考答案设置的上限会导致输出被截断。看到 stop_reason: "max_tokens" 表示需要提高上限或降低思考强度。
每项已完成任务的成本,而不是每个 token 的成本
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]这 3 行只是算术结果,不是基准测试。费率是公开的。Token 用量只是假设值,您应使用自己的实际用量数据替换。按中间一行的工作量进行一次编码会话,在 Fable 5 上的成本为 $5.00,在 Sonnet 5 上则为 $1.00。长时间运行的成本分别为 $40.00 和 $8.00。最后一行的 Haiku 列仅用于算术计算:Haiku 4.5 的上下文窗口为 200k token,因此根本无法容纳该任务。
对于决策而言,每个 token 的成本不是正确的单位。每项已完成任务的成本,等于每次尝试的成本乘以尝试次数。按当前费率计算,一次 Fable 5 尝试的成本等于五次 Sonnet 5 尝试的成本,因此仅凭重试次数几乎从来不足以证明升级的合理性。Sonnet 必须在五次尝试中失败超过四次,使用较低成本的方案才会在 token 成本上处于劣势。
真正能证明升级合理的是 token 账单未体现的所有因素。图表中两次长时间运行的成本差额,在大多数市场都低于一小时的工程师工时。如果价格更高的模型能节省一小时审查时间,或避免一次之后还要回滚整理的错误迁移,它就已经通过账单中不会显示的节省收回了成本。请按每个被接受结果的成本进行比较,并将您自己的时间计入总成本。了解一百万个 token 实际能完成什么后,这一估算会具体得多。
Claude Fable 5 物有所值的 3 类任务
错误方向代价高的长时运行代理任务。 Fable 5 面向以小时计时的工作:上下文窗口为 1M tokens,每次请求最多输出 128k tokens,并提供 xhigh effort level,适用于运行时间超过三十分钟、token 预算达到数百万的任务。评估一次运行的成本时,应将其与代理在第 40 步走错分支、直到第 300 步才被发现后所需的清理工作进行比较。
在大型代码库中只运行一次的迁移或审计。 一次性工作没有足够的执行量来摊薄成本,因此每 token 的溢价会全部计入一张账单,而且整个任务可能放入一个上下文窗口。如果任务可以异步运行,Batch API 可将每百万输出 tokens 的价格降至 $25。
更便宜的模型已经失败两次的任务。 两次失败尝试加上调试时间,其成本高于图中所示用量下的一次 Fable 尝试。升级模型是成本更低的分支,这正是模型梯度的用途。如果您仍在泛泛比较不同层级,Claude 模型层级之间的能力比较回答的是与本页不同的问题。
Sonnet 5 或 Haiku 4.5 更合适的 3 类任务
高吞吐量分类和提取。 这类任务按吞吐量和单位成本评估,质量上限足够低,廉价模型即可达到。对于 Haiku 4.5 能够正确完成的任务,如果成本是其 10 倍,Fable 5 不会带来任何可量化的收益。
交互式工作,延迟就是产品体验。 Anthropic 的模型表显示,Fable 5 的相对延迟更高,而且无法关闭思考功能。聊天框或编辑器补全使用能力更强的模型时,体验反而更差,因为用户先感受到等待,然后才感受到质量差异。
任何依赖 2026 年 1 月之后事件的任务。 Fable 5 的可靠知识截止时间是 2026 年 1 月。Opus 5 的截止时间是 2026 年 5 月。更昂贵的模型反而更新程度更低,因此对于时效性问题,除非为其提供搜索或抓取工具,否则您支付双倍费用得到的却是更旧的知识。
还有一项约束与成本完全无关。Fable 5 会保留数据 30 day,并且不支持 zero data retention,因为它被指定为 Covered Model。如果您的协议要求 zero retention,Fable 5 无论价格多低都无法使用,折扣也无法改变这一点。
Fable-method 仓库展示了什么,以及没有展示什么
一些实践者发布了仓库,将 Fable 5 的工作方式提炼为更便宜的模型可以遵循的技能。fable-method 仓库介绍了一项思考技能、一个编排循环,以及一个对抗性验证器。该验证器会重新运行每项声称已完成的检查,而不是读取代理自己的报告。其 README 直接说明:“这是社区提炼的成果,不是 Anthropic 的产物。”
应当准确地这样理解它。它可以证明人们如何驱动模型,但不能说明模型如何工作。Anthropic 没有验证其中任何内容,而且还存在多个措辞不同但几乎相同的分支版本。这更符合口述经验的特征,而不是规范文档。
对于成本决策,值得参考的信号是:人们认为值得复制的部分都属于流程性做法。先对任务分类,明确证明任务完成所需的检查,先收集证据再做决定,然后通过观察而不是阅读摘要来验证结果。为更便宜的模型提供明确的检查清单和验证步骤,可以缩小部分差距。因此,在决定统一采用昂贵模型之前,应先在自己的评估集上进行这项实验。结果取决于你的任务,所以其他人的数字对你没有多少参考价值。
提交预算前先核对您自己的数字
- 查看每次响应中的
usage,并将output_tokens_details.thinking_tokens与可见输出分开记录。您看不到的推理内容,往往才是最容易造成意外成本的项目。 - 显式设置
effort,不要接受默认值。对于依赖提示缓存的对话,请在整个对话中保持该值不变。 - 先将稳定前缀放在缓存断点之前。缓存读取价格仅为基础输入价格的十分之一,其节省的费用通常高于大多数模型降级方案。
- 将不需要立即响应的任务转移到 Batch API。
- 如实评估替代方案。在长期投入之前,根据您自己的工作负载比较 Claude 和 ChatGPT API 的价格,值得花一个下午完成评估。
如果工作负载是运行在您自己服务器上的代理,影响最大的控制项不在模型选择,而在模型之外。在 VPS 上控制代理成本介绍了可防止会话失控的循环次数限制和支出上限,Claude Code 实际将令牌用在何处则解释了您将在用量控制面板中看到的数字。
FAQ
Claude Fable 5 每百万个 token 的费用是多少?
在 Claude API 上,Claude Fable 5 的输入费用为每百万个 token $10,输出费用为每百万个 token $50。该价格于 2026 年 8 月 3 日在 Anthropic 价格页面上核实。缓存读取费用为每百万个 token $1,是基础输入费率的十分之一。Batch API 对输入和输出均提供 50% 的折扣,异步任务的费用分别为每百万个 token $5 和 $25。使用 inference_geo 参数将推理限制在美国境内时,所有类别的费用都会乘以 1.1。
Claude Fable 5 是否包含在 Claude Pro 订阅中?
Anthropic 的 Claude Fable 页面列出 Pro、Max、Team 和 Enterprise 用户可以使用该模型,但未提及免费方案。包含的使用额度并非无限。部分席位可使用每周额度中的一部分 Fable 配额,其他席位则通过使用积分访问;这一安排在 2026 年 7 月期间发生过多次变化。请在决定订阅或使用的当天,阅读 Anthropic 价格页面方案对比表中标为 Fable 的行,不要依赖文章中的旧数据。包含的额度用完后,后续使用将按 API 费率计费。
为什么 Claude Fable 5 的账单高于可见输出所显示的费用?
Claude Fable 5 始终启用自适应思考。思考 token 按输出 token 计费,原始思维链不会返回。thinking.display 使用默认值 omitted 时,您会看到空的思考字段,但后台的每个推理 token 仍会计费。请读取响应中的 usage.output_tokens_details.thinking_tokens 以查看费用或 token 的拆分。使用流式传输时,该信息只会在最后一个 message_delta 事件中到达。如果推理与回答的比例高于任务所需水平,请降低 effort 级别。
我应该使用 Claude Fable 5 还是 Claude Opus 5?
Claude Opus 5 的每个 token 费用只有一半,并且具有更新的可靠知识截止日期:Claude Opus 5 为 2026 年 5 月,Fable 5 为 2026 年 1 月。先使用 Opus 5;如果任务在该模型上失败,或者错误答案造成的损失高于价格差额,再升级到 Fable 5。对于长期运行的代理任务,如果错误分支会导致数小时的清理工作,Fable 5 更适合。对于一次性任务,如果高级模型费用只会出现在一张账单上,而不是永久增加每个请求的费用,也适合选择 Fable 5。