SSD Nodes Learn 🎉 VPS $4.99/月起
指南 Matt Connor作者: Matt Connor

Claude Fable 5 价格及适用场景

Claude Fable 5 输入每百万 token 10 美元,输出 50 美元。了解标准价格、提示缓存与 Batch API 折扣,以及哪些任务值得使用它。

Claude Fable 5 的费用是多少?

在 Claude API 上,Claude Fable 5 的输入价格为每百万个输入 token $10,输出价格为每百万个输出 token $50。这些是 Anthropic 公布的标准价格,数据读取自 2026 年 8 月 3 日的价格页面。API 模型 ID 为 claude-fable-5。该模型于 2026 年 6 月 9 日在 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 上正式发布。

ChartPublished Claude API list prices, US dollars per million tokens, checked 3 August 2026
The data behind this chart
[
  {
    "label": "Claude Fable 5",
    "input": "10",
    "output": "50",
    "cache_read": "1",
    "batch_input": "5",
    "batch_output": "25"
  },
  {
    "label": "Claude Opus 5",
    "input": "5",
    "output": "25",
    "cache_read": "0.50",
    "batch_input": "2.50",
    "batch_output": "12.50"
  },
  {
    "label": "Claude Sonnet 5 (intro rate)",
    "input": "2",
    "output": "10",
    "cache_read": "0.20",
    "batch_input": "1",
    "batch_output": "5"
  },
  {
    "label": "Claude Sonnet 5 (from 1 Sep)",
    "input": "3",
    "output": "15",
    "cache_read": "0.30",
    "batch_input": "1.50",
    "batch_output": "7.50"
  },
  {
    "label": "Claude Haiku 4.5",
    "input": "1",
    "output": "5",
    "cache_read": "0.10",
    "batch_input": "0.50",
    "batch_output": "2.50"
  }
]

可以将这些价格理解为一个梯度。Fable 5 的标准价格是 Claude Opus 5 的 2 倍、当前 Claude Sonnet 5 价格的 5 倍,以及 Claude Haiku 4.5 的 10 倍。输入和输出价格的比例相同,因为该价格表中的每个模型,其输出价格都正好是自身输入价格的 5 倍。因此,只要知道任务中输入 token 和输出 token 的比例,就可以通过乘法将一种价格换算为其他模型的价格。

其中一个日期会改变计算结果。Sonnet 5 在 2026 年 8 月 31 日前采用介绍期价格:输入和输出分别为每百万个 token $2$10。从 2026 年 9 月 1 日起,其价格分别为 $3$15。Fable 5 自身的价格不会变化,因此从当天起,两者的价格差距会从 5 倍缩小到略高于 3 倍。如果您正在为秋季制定预算,请使用 Sonnet 的后续价格。

折扣,以及唯一一个反方向的乘数

提示缓存是影响最大的因素。读取缓存的费用是基础输入价格的十分之一。在 Fable 5 上,每百万个令牌的费用为 $1。写入缓存的费用高于普通输入令牌:5 分钟缓存按基础价格的 1.25 倍计费,1 小时缓存按基础价格的 2 倍计费。5 分钟缓存只需读取一次即可回本,1 小时缓存读取两次即可回本。在全面启用提示缓存之前,先计算提示缓存的盈亏平衡点,依据就是这笔算术。

Batch API 对输入和输出都提供 50% 的折扣,因此批量处理 Fable 5 的费用为每百万个令牌 $5$25。批处理请求是异步的,因此只适用于不需要立即获得结果的任务。这两项折扣可以叠加,使使用缓存的批处理任务在输入和输出两方面都更便宜。

Claude 4.6 及更高版本的模型按标准费率包含 1M 令牌的上下文窗口。不收取长上下文附加费,因此 900k 令牌请求和 9k 令牌请求的每令牌费率相同。

会提高费用的乘数是数据驻留。将 inference_geo: "us" 设置为在美国境内执行推理后,所有令牌类别都会乘以 1.1,包括缓存读取和缓存写入。除非合同另有要求,否则应保留默认的全局路由。

此模型还有一条专用的计费规则。Fable 5 随附安全分类器,可能拒绝请求。发生这种情况时,Messages API 会以成功的 HTTP 200 响应返回 stop_reason: "refusal",而不是返回错误;如果请求在生成任何输出前被拒绝,则不会产生费用。如果在另一个 Claude 模型上重试相同提示,回退抵扣会退还切换模型产生的提示缓存费用,因此无需为相同缓存重复预热而付费。

哪些套餐包含 Claude Fable 5?

截至 2026 年 8 月 3 日,Anthropic 的 Claude Fable 页面显示,Pro、Max、Team 和 Enterprise 用户可以使用该模型。页面未列出免费套餐。对于开发者,Claude API 以及上文列出的云市场通常都已提供该模型。

套餐可用不等于无限使用。Anthropic 定价页面的套餐对比表显示,部分席位的 Fable 使用量受每周使用限额比例限制,其他席位则使用使用额度。该安排在 2026 年 7 月期间多次调整。Anthropic 关于重新部署 Fable 5 的声明称,Pro、Max、Team 和部分 Enterprise 套餐在 2026 年 7 月 7 日前可使用最高 50% 的每周使用限额,之后改为使用额度。7 月其余时间的报道显示,这一安排又有延长,不同席位类型之间也出现了差异。

因此,本页面不会列出各套餐的具体限额。该月发布的任何数字都没有持续稳定两周,在这里保留过时数字反而不如不列出。请在决定使用套餐的当天,打开套餐对比表中标为 Fable 的行,并将新闻文章中的任何数字视为过时信息。

API 速率是稳定的。对于所有使用路径,包含的额度用完后,后续 Fable 5 使用量都会按照上方图表中的价格计费。因此,无论采用哪种方式,规划时都应以价格表为依据。这与比较 API 计费与订阅套餐其他 Claude 模型时得出的结论相同。如果您还没有选择套餐,请先查看哪个 Claude 套餐符合您的使用情况

为什么账单涨幅高于价格比例显示的水平

有两项已公开说明的机制,会使 Fable 5 的成本高于直接比较价格所得的结果。

第一项是 tokenizer。Fable 5 使用 Claude Opus 4.7 引入的 tokenizer。与 Opus 4.7 之前发布的模型相比,相同文本生成的 token 数量大约多 30%,实际增幅取决于内容。Haiku 4.5 早于该 tokenizer,因此,将相同文本分别输入两个模型后,价格表中的 10 倍差距会更接近 13 倍。Sonnet 5 使用新的 tokenizer,因此 Fable 与 Sonnet 之间可以公平地按 token 比较。Fable 与 Haiku 之间则不能直接比较。

第二项是 thinking。Fable 5 始终启用自适应 thinking,并且不支持 thinking: {"type": "disabled"}。thinking token 按输出 token 计费,使用完整的输出价格。该模型不会返回原始思维链,而 thinking.display 默认为 "omitted",因此,简短的可见回答可能包含大量计费输出 token。Anthropic 的文档对此有明确说明:计费输出 token 数量与响应中可见的 token 数量并不一致。

请查看明细,不要凭猜测判断。字段 usage.output_tokens_details.thinking_tokens 报告计费输出 token 中用于推理的数量:

{
  "usage": {
    "input_tokens": 25,
    "output_tokens": 348,
    "output_tokens_details": {
      "thinking_tokens": 312
    }
  }
}

该示例取自 Anthropic 的 thinking 文档。在 348 个计费输出 token 中,有 312 个用于用户看不到的推理。使用流式传输时,这项明细只会在最后的 message_delta 事件中到达,因此,如果客户端在读取到最后一个文本块后停止读取,就不会记录这项数据。

控制项是 effort,在 output_config.effort 中设置,可选级别为 lowmediumhigh(默认值)、xhighmax

{
  "model": "claude-fable-5",
  "max_tokens": 32000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

Anthropic 对此模型的建议是从 high 开始;只有最重视能力的工作才提高到 xhigh;常规工作则降低到 mediumlow。原因是,在 Fable 5 上使用较低 effort,通常优于在旧模型上使用 xhigh。这里有两个容易忽略的问题。请求之间更改 effort 会使 prompt cache 失效,因为解析后的 effort 值会写入 prompt。因此,应为每类工作选择一个级别并保持不变。另一个问题是,max_tokens 是输出总量的硬上限,thinking 和响应文本都会计入其中;为不包含 thinking 的回答设置的上限可能导致输出被截断。出现 stop_reason: "max_tokens" 表示需要提高上限或降低 effort。

每个已完成任务的成本,而不是每个 token 的成本

ChartCost of one job in US dollars, worked from published rates and assumed token volumes
The data behind this chart
[
  {
    "label": "Short answer (5k in, 1k out)",
    "fable_5": "0.10",
    "opus_5": "0.05",
    "sonnet_5": "0.02",
    "haiku_4_5": "0.01"
  },
  {
    "label": "Coding session (300k in, 40k out)",
    "fable_5": "5.00",
    "opus_5": "2.50",
    "sonnet_5": "1.00",
    "haiku_4_5": "0.50"
  },
  {
    "label": "Long agent run (2M in, 400k out)",
    "fable_5": "40.00",
    "opus_5": "20.00",
    "sonnet_5": "8.00",
    "haiku_4_5": "4.00"
  }
]

这些 3 行是算术结果,不是基准测试。费率已经公布。token 数量只是估算值,您应替换为自己的使用数据。一次规模类似中间一行的编码会话,在 Fable 5 上的成本为 $5.00,在 Sonnet 5 上为 $1.00。长时间运行的成本分别为 $40.00$8.00。最后一行中的 Haiku 列仅是算术结果:Haiku 4.5 的上下文窗口为 200k token,因此根本无法容纳该任务。

以每个 token 的成本作为决策单位是错误的。每个已完成任务的成本,等于每次尝试的成本乘以尝试次数。按当前费率计算,1 次 Fable 5 尝试的成本等于 5 次 Sonnet 5 尝试,因此仅凭重试次数几乎没有理由升级。Sonnet 必须在 5 次中失败超过 4 次,低成本方案才会在 token 成本上处于劣势。

真正能证明升级合理的是 token 账单未计入的所有因素。图中两次长时间运行之间的成本差额,在大多数市场都低于 1 小时的工程师工时。如果更昂贵的模型能节省 1 小时审查时间,或避免一次之后还必须修复的错误迁移,它就已经通过一张不会显示这些节省的账单收回了成本。请按每个验收结果的金额进行比较,并将您自己的时间计入总成本。了解 1 million 个 token 实际能完成什么 后,这项估算就不会那么抽象。

Claude Fable 5 值得其价格的 3 类任务

错误决策代价高的长周期代理运行。 Fable 5 面向以小时计的任务:支持 1M token 上下文窗口、每次请求最多输出 128k token,并提供 xhigh 努力级别,适用于运行超过三十分钟、token 预算达到数百万的任务。请将一次运行的成本与代理在第 40 步走错分支、直到第 300 步才被发现后所需的清理工作进行比较。

在大型代码库上仅执行一次的迁移或审计。 一次性工作没有足够的调用量来摊薄成本,因此每 token 的溢价会全部计入同一张账单,而且整个任务可能放入一个上下文窗口。如果可以异步运行,Batch API 可将每百万输出 token 的价格降至 $25

更便宜的模型已经失败两次的任务。 两次失败的尝试加上您的调试时间,其成本高于按上图调用量使用一次 Fable。升级模型是成本更低的路径,这正是模型阶梯的用途。如果您仍在选择通用层级,Claude 模型层级之间的能力比较回答的是与本页面不同的问题。

Sonnet 5 或 Haiku 4.5 更合适的 3 类任务

高吞吐量分类和提取。 这类任务按吞吐量和单位成本评估,而且质量上限足够低,低成本模型即可达到。对于 Haiku 4.5 能正确完成的任务,如果成本是其 10 倍,Fable 5 不会带来可量化的收益。

以延迟为核心指标的交互式工作。 Anthropic 的模型列表显示,Fable 5 的相对延迟更高,并且无法关闭思考功能。在聊天框或编辑器补全中,能力更强的模型反而体验更差,因为用户会先感受到等待,再注意到质量。

依赖 2026 年 1 月之后事件的任何任务。 Fable 5 的可靠知识截止时间是 2026 年 1 月。Opus 5 的截止时间是 2026 年 5 月。更昂贵的模型反而更新程度更低,因此对于时效性问题,除非为其提供搜索或抓取工具,否则您支付两倍费用获得的却是更陈旧的知识。

还有一项限制与成本完全无关。Fable 5 会保留数据 30 天,并且不支持零数据保留,因为它被指定为 Covered Model。如果您的协议要求零数据保留,Fable 5 无论价格多低都不可用,折扣也无法改变这一点。

fable-method 仓库展示了什么,以及没有展示什么

一些实践者发布了相关仓库,将 Fable 5 的工作方法提炼为更便宜的模型可以执行的技能。fable-method 仓库介绍了一种思考技能、一个编排循环,以及一个对抗式验证器。该验证器会重新运行每项声称已完成的检查,而不是读取代理自己的报告。其 README 直接说明:“这是社区提炼成果,不是 Anthropic 的产物。”

请准确地按这个定位理解它。它能说明人们如何驱动模型,但不能说明模型的工作原理。Anthropic 没有验证其中任何内容,而且存在多个措辞不同但几乎相同的分支。这种情况更符合民间经验,而不是规范文档。

对于成本决策,值得关注的信号是:人们认为值得复制的部分都是流程性的。先对任务分类,明确证明任务完成所需的检查,再收集证据后做决定,最后通过观察而不是阅读摘要来验证结果。向更便宜的模型提供明确的检查清单和验证步骤,可以弥补部分差距。因此,在统一采用更昂贵的模型之前,应先在自己的评估集上运行这项实验。结果取决于你的任务,所以其他人的数值对你而言通常没有多少参考价值。

提交预算前,先核对自己的用量

  • 每次响应都读取 usage,并将 output_tokens_details.thinking_tokens 与可见输出分开记录。用户看不到的推理过程,往往才是最容易造成意外支出的项目。
  • 明确设置 effort,不要接受默认值。对于依赖提示缓存的对话,应在整个对话中保持该值不变。
  • 先将稳定的前缀放在缓存断点之前。缓存读取价格仅为基础输入价格的十分之一,节省的费用通常超过大多数模型降级方案。
  • 将不需要立即获得响应的任务转移到 Batch API。
  • 如实评估替代方案。在长期投入前,使用自己的工作负载比较 Claude 和 ChatGPT API 的价格,值得花一个下午进行测试。

如果工作负载是运行在您自己服务器上的代理,最重要的控制措施不在模型选择之外。在 VPS 上控制代理成本介绍了可防止会话失控的循环限制和支出上限;Claude Code 实际消耗 token 的位置则解释了您将在用量面板中看到的数字。

FAQ

Claude Fable 5 每百万个 token 的费用是多少?

在 2026 年 8 月 3 日查阅 Anthropic 定价页面时,Claude API 对 Claude Fable 5 的定价为:每百万个输入 token $10,每百万个输出 token $50。缓存读取费用为每百万个 token $1,是基础输入费率的十分之一。Batch API 对输入和输出均提供 50% 的折扣,异步任务的价格分别为每百万个 token $5$25。使用 inference_geo 参数将推理限制在美国境内时,所有类别都会乘以 1.1 倍。

Claude Pro 订阅包含 Claude Fable 5 吗?

Anthropic 的 Claude Fable 页面将该模型列为 Pro、Max、Team 和 Enterprise 用户可用,但未列出免费套餐。包含的访问额度不是无限的。一些席位将 Fable 作为每周使用限额的一部分提供,其他席位则通过使用额度提供;这一安排在 2026 年 7 月发生过多次变化。请在决定使用方案当天查看 Anthropic 定价页面计划对比表中标为 Fable 的一行,不要直接相信文章中的数值。包含的额度用完后,后续用量将按 API 费率计费。

为什么 Claude Fable 5 的账单高于可见输出所显示的费用?

Claude Fable 5 始终启用自适应思考。思考 token 按输出 token 计费,原始思维链不会返回。thinking.display 使用默认值 omitted 时,您会看到空的思考字段,但其中的每个推理 token 仍会计费。请查看响应中的 usage.output_tokens_details.thinking_tokens,了解费用拆分;使用流式传输时,该字段只会在最后一个 message_delta 事件中到达。如果推理与答案的比例高于任务实际需要,请降低 effort 级别。

应该使用 Claude Fable 5 还是 Claude Opus 5?

Claude Opus 5 的每个 token 费用低一半,并且可靠知识截止时间更新,为 2026 年 5 月;Fable 5 的截止时间则为 2026 年 1 月。建议先使用 Opus 5;如果任务在该模型上失败,或错误答案造成的损失高于价格差额,再升级到 Fable 5。对于长期运行的代理任务,如果一次错误分支会造成数小时的清理工作,Fable 5 更合适。对于一次性任务,如果其额外费用只会出现在一张账单中,而不是永久增加每次请求的成本,Fable 5 也更合适。

#claude#fable#model-selection#pricing#tokens