Claude模型怎么选?2026年7月各型号价格对比
Opus 4.8、Sonnet 5还是Haiku 4.5?列出截至2026年7月23日的API每百万token费率,并给出10万次任务下的成本差异,帮你根据工作负载选对模型。
应该使用哪个 Claude 模型?
关于该使用哪个 Claude 模型,简短的答案是:从 Claude Opus 4.8 开始,只有在有明确理由时才更换。Anthropic 的指导也是如此。“如果不确定使用哪个模型,请从 Claude Opus 4.8 开始,用于复杂的智能体编码和企业级工作。”当任务明确且每天需要多次运行时,可以降级到 Claude Sonnet 5。对于机械性、大批量且已知正确答案样子的工作,再降级到 Claude Haiku 4.5。Claude Fable 5 位于所有模型之上,用于长时间运行的智能体。
选择与价格挂钩。以下是截至 2026 年 7 月 23 日 Claude API(应用程序编程接口)的费率,按每百万 token 计算,文档中写作 MTok。
- Claude Fable 5 (
claude-fable-5):输入 $10 / MTok,输出 $50 / MTok。1M 上下文。 - Claude Opus 4.8 (
claude-opus-4-8):输入 $5,输出 $25。1M 上下文。 - Claude Opus 4.7 (
claude-opus-4-7):输入 $5,输出 $25。1M 上下文。 - Claude Sonnet 5 (
claude-sonnet-5):2026 年 8 月 31 日前为推广价,输入 $2,输出 $10。标准价格输入 $3,输出 $15 将于 2026 年 9 月 1 日生效。1M 上下文。 - Claude Haiku 4.5 (
claude-haiku-4-5):输入 $1,输出 $5。200K 上下文。
这些标识符按原样书写完整,不会附加任何内容。
大小本身不会对 1M token 模型产生附加费:“一个 900k token 的请求与一个 9k token 的请求,按相同的每 token 费率计费。”
各模型的实际用途
Anthropic 为每个模型提供了一行描述,这些描述比任何排行榜都更能指导选择。
- Claude Fable 5:“面向长时间运行智能体的下一代智能。”在延迟方面,是四款模型中最慢的。
- Claude Opus 4.8:“用于复杂的智能体编码和企业工作。”延迟适中。
- Claude Sonnet 5:“速度与智能的最佳组合。”速度快。
- Claude Haiku 4.5:“具备接近前沿智能的最快模型。”
Haiku 4.5 还带有一些限制,这些限制在价格之前就决定了其工作适配性。其上下文窗口为 200K 令牌,而非 1M,因此大型代码库或长智能体记录将无法容纳。在同步 Messages API 上,其最大输出为 64K 令牌,而其他模型为 128K,并且其可靠的知识截止日期为 2025 年 2 月,而其他三款模型为 2026 年 1 月。
在真实工作负载下,选择不同模型会带来多少成本差异?
整个产品线中,所有模型的输出定价均为输入价格的五倍。Opus 4.8 的输入价格为 $5,输出为 $25。Haiku 4.5 的输入价格为 $1,输出为 $5。这一比例在整个产品系列中保持一致,因此您选择的模型在生成大量输出的工作中影响最大。
Agentic 工作正是这类工作,因为思考令牌按输出令牌计费,并计入 max_tokens,即使这些文本从未发送给您。在 Fable 5、Opus 4.8、Opus 4.7 和 Sonnet 5 上,推理摘要默认被省略,因此 thinking 字段返回为空。计费方式不变:“无论哪种方式,该块的计费相同,并且在多轮对话中回传方式也相同。”Claude 令牌账单的实际构成 对此进行了详细拆解。
您正在比较的模型之间,思考功能是否运行存在差异,如果您忽略这一点,成本测试结果将失真。在 Sonnet 5 和 Fable 5 上,思考功能默认开启,无需配置。在 Opus 4.8 和 Opus 4.7 上,该功能默认关闭,直到您在请求中设置 thinking: {type: "adaptive"} 才会开启。在解读数据之前,请确保双方的配置一致。
为什么最便宜的模型可能最贵
以一个独立的编码任务为例。请求携带 60,000 个 token 的上下文,模型生成 8,000 个 token 的输出(含思考过程)。不设缓存,让计算过程保持透明。
在 Opus 4.8 上:0.06 MTok 的输入,按 $5 计费,为 $0.30;0.008 MTok 的输出,按 $25 计费,为 $0.20。一次尝试花费 $0.50。在 Haiku 4.5 上,同样的尝试是 $0.06 加 $0.04,即 $0.10。
Haiku 每次尝试便宜五倍,看起来余量很大,直到你追踪一次失败的尝试会带来什么。你阅读错误答案,这耗费你的时间。你在重试时将其作为上下文重新发送,因此每次尝试都比上一次更大。当第三次尝试仍然失败时,你最终还是升级了:$0.30 的 Haiku 加上 $0.50 的 Opus,总计 $0.80,比直接运行一次 Opus 高出 60%。
因此,决定性的问题在于你检查答案的成本有多低。当错误答案在一秒内显而易见时,小模型是划算的。当发现错误需要仔细阅读差异对比时,小模型耗费的是你永远不会出现在账单上的时间。
小型模型直接胜出的场景
在这些情况下,Haiku 4.5 是正确的选择:
- 机械性子代理工作。重命名文件或收集搜索输出的子代理不需要前沿推理能力。这是您使用 Claude 构建 AI 代理并为其配备助手后的标准模式。
- 日志分诊。判断某行日志是噪音还是值得人工关注,这是一项范围狭窄的判断,且失败模式显而易见。
- 基于固定标签集的分类。输出简短,且可在样本上衡量准确性。
- 大批量生产调用。每天运行 10 万次时,每个 token 的成本差距就不再是舍入误差了。这是接入 n8n 的 AI 工作流的常见形态。
- 任何响应速度对用户至关重要的场景。Haiku 4.5 被评为该系列中最快的模型。
有一个限制是 Haiku 特有的。其最小可缓存提示为 4,096 个 token,而 Opus 4.8 和 Sonnet 5 为 1,024 个 token,低于此最小值时,“任何缓存少于该数量 token 的请求都将被处理,但不会进行缓存,且不返回错误”。一个在 Sonnet 5 上可缓存的 1,500 个 token 的指令块,在 Haiku 4.5 上会静默地不进行缓存。其表现是 cache_creation_input_tokens 和 cache_read_input_tokens 都为零,降低常驻代理的成本一文在介绍其他缓存失效情况时也涵盖了这一点。
改变答案的杠杆
这些因素对账单的影响比模型名称更大。
努力程度。 output_config.effort 控制模型在回答前投入的工作量。级别包括 low、medium、high、xhigh 和 max,默认值为 high:"将 effort 设置为 high 与完全省略 effort 参数产生的行为完全相同。" 它嵌套在 output_config 内部,而非位于请求的顶层:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)努力程度影响响应中的每个 token:"它会影响所有 token 消耗,包括工具调用。例如,较低的努力程度意味着 Claude 会进行更少的工具调用。" 这在智能体循环中会叠加影响。它并非 token 上限:"努力程度是一个行为信号,而非严格的 token 预算。" Anthropic 未公布每个级别的成本乘数,并建议您针对自己的用例进行测试,因此,在 high 下运行 Sonnet 5 与在 low 下运行 Opus 4.8 进行对比,是您今天下午就可以进行的真实比较。Haiku 4.5 不在支持努力程度的模型列表中。
提示缓存。 缓存读取的成本是基础输入费率的 0.1 倍,而决定模型选择的数字在于该机制在不同层级的表现。Opus 4.8 的缓存命中成本为 $0.50 / MTok,而 Haiku 4.5 的未缓存输入成本为 $1 / MTok,因此,对于输入 token 而言,良好缓存的 Opus 前缀比冷启动的 Haiku 提示更便宜。对于任何重复发送大型稳定前缀的工作负载,会话管理比模型选择更重要。
批处理。 如果无需等待答案,消息批处理 API 会以"输入和输出 token 均享受 50% 折扣"的方式运行相同的模型。它使下方对比中的每一行成本减半,并且跨层级有效:从 2026 年 9 月 1 日起,以标准价格计算,批处理的 Opus 4.8 作业成本低于同步的 Sonnet 5 作业,以相同的花费用延迟换取了能力。
一次实际成本对比
工作负载:分类 100,000 封支持邮件,每封调用一次,每次调用 2,000 个输入 token 和 300 个输出 token。即 200 MTok 输入和 30 MTok 输出。
- Haiku 4.5:200 x $1 = $200 输入,30 x $5 = $150 输出。总计 $350。
- Sonnet 5,推广期价格:200 x $2 = $400 输入,30 x $10 = $300 输出。总计 $700。
- Sonnet 5,2026 年 9 月 1 日起:200 x $3 = $600 输入,30 x $15 = $450 输出。总计 $1,050。
- Opus 4.8:200 x $5 = $1,000 输入,30 x $25 = $750 输出。总计 $1,750。
换四个数字即可用明天的价格重算。以下调整对结果的影响比模型名称更大:
- 批处理使每行成本减半:$175、$350、$525 和 $875。夜间分类运行无需等待,因此没有理由跳过批处理。
- 缓存共享前缀。 假设 2,000 个输入 token 中有 1,200 个是每次相同的指令块。在 Sonnet 5 推广期价格下,缓存命中的成本为 $0.20 / MTok,而非 $2 / MTok,因此 120 MTok 的成本为 $24,而不是 $240。加上 80 MTok 的新输入,按 $2 计算为 $160,再加上 $300 的输出,Sonnet 5 的成本约为 $484,而非 $700。同样的技巧对 Haiku 4.5 无效,因为 1,200 个 token 低于其 4,096 token 的最低缓存要求。
- 重试。 假设你拒绝了 8% 的邮件中 Haiku 的回答,并在 Opus 4.8 上重新运行这些邮件。在 $350 的基础上增加 0.08 x $1,750 = $140,得到 $490。请根据你自己的拒绝率测算,而非直接使用我的数据。
- 工具定义(如果任务使用了工具)。 工具定义生成的系统提示词,在 Opus 4.8 上为 290 个 token(
tool_choice设置为auto),在 Sonnet 5 上为 354 个,在 Haiku 4.5 上为 496 个。最便宜的模型反而承载了最大的固定开销。
带有升级路径的 Haiku 成本为 $490,使用缓存的 Sonnet 5 成本为 $484,两者成本相同,而后者一次即可完成任务。模型从来都不是问题的全部。
会话中途切换模型能省钱吗?
比标价所暗示的要少,因为节省是按 token 计算的,而你冒的风险是整个已缓存的前缀。
Anthropic 记录了哪些操作会使缓存失效。前缀的构建顺序是 tools,然后是 system,接着是 messages,并且“每一层的变更都会使该层及其后续所有层失效。” 请求设置中有两项也在此列:“思考配置和解析后的 effort 级别会被渲染到提示词本身中,因此更改其中任何一项都会启动新的缓存前缀。” 关于 effort,文档进一步说明:“在不同工作负载之间改变 effort,而不是在依赖缓存命中的同一对话内改变。”
模型本身不在上述记录列表中,所以不要想当然。在切换后的第一个请求中读取 cache_read_input_tokens,让数字来回答。在一个 150,000 token 的 Opus 4.8 前缀上,一次缓存读取成本约为 $0.08,而一次全新写入约为 $0.94,这比你试图追逐的每 token 差价累积多个回合还要多。
因此,这些变更应在任务之间进行,而非任务内部。在 Claude Code 中,这意味着先执行 /clear(此时缓存反正要被丢弃),然后再执行 /model 或 /effort。
如何在自己的工作负载上测试答案
不要用其他模型统计出的数量来估算提示词大小。令牌计数端点可免费使用,并且会使用您指定模型的令牌化器进行计数,因此请指定您计划调用的模型。Opus 4.7 及更高版本、Fable 5 和 Sonnet 5 使用较新的令牌化器,“对于相同文本,生成的令牌数约多出 30%”,因此在每令牌费率不变的情况下,基于旧模型估算的预算在新模型上会偏低。
然后阅读返回的内容。input_tokens 仅表示未缓存的剩余部分,因此真正的提示词大小是该字段加上 cache_creation_input_tokens 再加上 cache_read_input_tokens。在 VPS 上构建首个 Claude API 应用 是运行该测量最简朴的环境,而 哪种 Claude 方案适合您的用量 则是关于是否按令牌付费的独立决策。
FAQ
哪个 Claude 模型最适合编码?
Claude Opus 4.8 是复杂智能体编码任务的文档化起点,截至 2026 年 7 月,价格为每百万输入 token 5 美元,每百万输出 token 25 美元。Claude Sonnet 5 定位为速度与智能的最佳组合,在 2026 年 8 月 31 日前价格为 2 美元/10 美元,成本不到前者一半。在两个模型上运行相同任务,保持思考配置不变,通过 response.usage 比较总 token 消耗。
Claude Haiku 4.5 是否便宜到足以替代 Sonnet 5?
按 token 计算,很容易:入门价格为 1 美元/5 美元,对比 Sonnet 5 的 2 美元/10 美元,或从 2026 年 9 月 1 日起的 3 美元/15 美元。限制条件决定选择。Haiku 4.5 的上下文窗口为 200K token 而非 1M,同步 Messages API 的最大输出为 64K,可靠知识截止日期为 2025 年 2 月,不支持 output_config.effort,且最小可缓存提示为 4,096 token,这会在短系统提示时静默禁用缓存。
在会话中途切换到更便宜的 Claude 模型能省钱吗?
实际省钱的情况比看起来少。Anthropic 记录的缓存失效条件包括更改 tools、system 或 messages 前缀,更改思考配置,以及更改 output_config.effort。模型切换对现有缓存的影响未被记录,因此应视为未知,并在之后的第一个请求中读取 cache_read_input_tokens。这其中的利害关系值得了解:对于 150,000 token 的 Opus 4.8 前缀,缓存读取成本约为 0.08 美元,而全新写入约为 0.94 美元,这超过了多次轮次节省的每 token 成本。应在任务之间切换,在 Claude Code 中 /clear 之后切换,此时缓存无论如何都会被丢弃。
output_config.effort 对我的账单有何影响?
它改变模型在文本、工具调用和思考过程中消耗的 token 数量。较低的 effort 会减少工具调用次数,这在智能体循环中会复合影响,因为每个工具结果都会在后续轮次中重新发送。级别包括 low、medium、high、xhigh 和 max,默认值为 high。Anthropic 未公布每个级别的成本乘数,称 effort 是行为信号而非 token 预算,因此需在自己的任务上测量。
Claude Batches API 能节省多少成本?
输入和输出 token 均节省 50%,以换取异步交付。截至 2026 年 7 月,Opus 4.8 价格为 2.50 美元输入/12.50 美元输出,Sonnet 5 入门价格为 1 美元/5 美元,Haiku 4.5 为 0.50 美元/2.50 美元。值得注意的跨层级对比:从 2026 年 9 月 1 日起,批处理的 Opus 4.8 作业成本低于标准费率的同步 Sonnet 5 作业,因此批处理能以相同费用使用更强的模型。