SSD Nodes Learn Hosting plans →
指南 Matt Connor作者: Matt Connor · 更新于 2026-08-27

Claude模型怎么选?Opus、Sonnet与Haiku成本指南

Opus 4.8、Sonnet 5 还是 Haiku 4.5?查看 2026 年 7 月各模型 API 费率,并按 100,000 次任务比较成本,了解哪些设置最影响账单。

应使用哪个 Claude 模型?

关于应该使用哪个 Claude 模型,简短答案是:从 Claude Opus 4.8 开始,只有在能明确说明原因时才换用其他模型。Anthropic 的建议相同:“如果不确定该使用哪个模型,请从 Claude Opus 4.8 开始,用于复杂的代理式编码和企业工作。”当任务定义明确,且每天需要运行很多次时,可以降级到 Claude Sonnet 5。对于机械性、高并发的工作,如果您已经清楚正确答案应是什么,可以进一步降级到 Claude Haiku 4.5。Claude Fable 5 位于所有这些模型之上,适用于长时间运行的代理。

模型选择会影响价格。以下是 Claude API(应用程序编程接口)截至 23 July 2026 的价格,按每百万 tokens 计算,文档中写作 MTok。

  • Claude Fable 5 (claude-fable-5):输入 $10 / MTok,输出 $50 / MTok。1M 上下文。
  • Claude Opus 4.8 (claude-opus-4-8):输入 $5,输出 $25。1M 上下文。
  • Claude Opus 4.7 (claude-opus-4-7):输入 $5,输出 $25。1M 上下文。
  • Claude Sonnet 5 (claude-sonnet-5):截至 31 August 2026 采用 introductory pricing,输入 $2,输出 $10。标准价格自 1 September 2026 起生效,输入 $3,输出 $15。1M 上下文。
  • Claude Haiku 4.5 (claude-haiku-4-5):输入 $1,输出 $5。200K 上下文。

这些标识符就是完整写法。不要在后面追加任何内容。

在 1M-token 模型中,规模本身不会产生附加费用:“900k-token 请求与 9k-token 请求按相同的 token 单价计费。”这些费率也适用于 API 之外,因为 Claude Enterprise 在席位价格之外按 API 费率计量用量,因此下面的计算同样适用于采用席位方案的团队。固定费率订阅会改变计量方式,但不会改变这个判断,因为 Claude Max 的两个层级使用相同的模型,区别仅在于可用量。在更低一级的方案中,Claude Pro 每月 $20 购买的是用量额度,而不是按 token 计费,因此限制因素是额度重置,而不是账单。如果您目前处于这种情况,先确定您正在等待哪个时间窗口,再进行下面的计算,因为解决方法是改用更小的模型、缩小上下文或转用 API,而不是寻找更低的费率。如果您还没有开始付费,首先判断 Pro 是否值得每月支付 $20,取决于免费额度多久会限制您,而不是取决于上面的任何费率。

各模型的实际适用场景

Anthropic 为每个模型各用一句话进行定位。这些描述比任何排行榜都更能指导选择。

  • Claude Fable 5:“面向长时间运行代理的新一代智能。”四个模型中延迟最高。
  • Claude Opus 4.8:“用于复杂的代理式编码和企业级工作。”延迟适中。
  • Claude Sonnet 5:“速度与智能的最佳组合。”速度快。
  • Claude Haiku 4.5:“具备接近前沿智能的最快模型。”

Fable 5 是这四个模型中唯一一个本比较从未按工作负载计价的模型。它的费率是 Opus 4.8 的两倍,因此哪些任务能让投入 $10 产生 $50 的回报值得单独回答。

Haiku 4.5 还存在一些会在价格之前决定任务适配性的限制。它的上下文窗口为 200K tokens,而不是 1M,因此无法容纳大型代码库或较长的代理会话记录。通过同步 Messages API 生成的最大输出为 64K tokens,其他三个模型为 128K;其可靠知识截止时间为 February 2025,而其他三个模型为 January 2026。

真实工作负载下,这个选择的成本是多少?

产品线中的每个模型,输出价格都是输入价格的 5 倍。Opus 4.8 的输入价格为 $5,输出价格为 $25。Haiku 4.5 的输入价格为 $1,输出价格为 $5。整个价格范围都遵循这一比例,因此,在会生成大量输出的工作中,模型选择的影响最大。

代理式工作就属于这类工作,因为思考 token 会按输出 token 计费,并计入 max_tokens,即使这些文本不会发送给您。在 Fable 5、Opus 4.8、Opus 4.7 和 Sonnet 5 中,默认不会返回推理摘要,因此 thinking 字段为空。计费方式不变:“无论哪种情况,该区块的计费金额相同;在多轮对话中,返回的内容也相同。”Claude token 账单实际包含哪些内容 会完整拆解这一计量方式。

您比较的模型是否执行思考,可能并不相同。如果忽略这一点,成本测试就会失去意义。在 Sonnet 5 和 Fable 5 中,思考功能已默认启用,无需配置。在 Opus 4.8 和 Opus 4.7 中,思考功能默认关闭,必须在请求中设置 thinking: {type: "adaptive"}。读取和比较数据前,请先确保两边使用相同的配置。

为什么最便宜的模型可能最昂贵

考虑一个自包含的编码任务。请求包含 60,000 个 token 的上下文,模型生成 8,000 个 token 的输出,其中包括思考内容。不使用缓存,因此计算过程保持不变。

使用 Opus 4.8 时,0.06 MTok 的输入按 $5 计算为 $0.30,0.008 MTok 的输出按 $25 计算为 $0.20。一次尝试的成本为 $0.50。使用 Haiku 4.5 时,同样的尝试成本为 $0.06 加 $0.04,即 $0.10。

Haiku 每次尝试便宜 5 倍,看起来节省空间很大。但如果考虑失败尝试带来的影响,情况就不同了。你读到错误答案需要花费时间。重试时,你会将错误答案作为上下文再次发送,因此每次尝试的上下文都比上一次更大。第三次尝试仍然失败后,你最终还是要升级:$0.30 的 Haiku 加上 $0.50 的 Opus,共 $0.80,比只运行一次 Opus 高出 60%。

因此,决定因素是你能以多低的成本检查答案。当错误答案一眼就能在 1 秒内识别出来时,小模型很划算。当识别错误需要仔细阅读 diff 时,小模型会耗费你的时间,而这部分成本不会出现在账单上。为这段时间计价,计算方式与计算 Claude Code 计划是否能收回成本相同;一旦将你的时薪计入总成本,更便宜的模型通常就不再显得便宜。

更小的模型明显胜出的场景

在以下场景中,Haiku 4.5 是正确选择:

  • 机械性的子代理任务。重命名文件或收集搜索结果的子代理不需要前沿推理能力。在使用 Claude 构建 AI 代理并为其提供辅助工具后,这就是标准模式。
  • 日志分类。判断某一行是噪声,还是值得人工关注,是范围有限的判断,且失败模式很明确。
  • 根据固定标签集进行分类。输出内容简短,准确率可以通过样本进行衡量。
  • 高并发生产调用。每天运行 100,000 次时,每个 token 的成本差距不再可以忽略。这通常也是将 AI 工作流接入 n8n后的典型形态。
  • 任何响应速度会影响用户体验的场景。Haiku 4.5 被评为该系列中速度最快的模型。

Haiku 有一个特有的限制。它可缓存提示词的最小长度为 4,096 个 token,而 Opus 4.8 和 Sonnet 5 的对应值为 1,024。低于该下限时,“任何尝试缓存少于此数量 token 的请求都会在不使用缓存的情况下处理,并且不会返回错误”。在 Sonnet 5 上可以缓存的 1,500-token 指令块,在 Haiku 4.5 上会静默地不使用缓存。判断依据是 cache_creation_input_tokenscache_read_input_tokens 都为 0;降低常驻代理的成本还介绍了其他导致缓存失效的方式。

改变结果的调节项

以下每一项对账单的影响都大于模型名称本身。

工作量。 output_config.effort 控制模型在回答前执行多少工作。级别包括 lowmediumhighxhighmax,其中 high 为默认值:“将 effort 设置为 high,其行为与完全省略 effort 参数完全相同。”它嵌套在 output_config 中,而不是位于请求的顶层:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

工作量会影响响应中的每个 token:“它可能影响所有 token 消耗,包括工具调用。例如,较低的工作量意味着 Claude 会减少工具调用次数。”在代理循环中,这种影响会进一步累积。它不是 token 上限:“工作量是一种行为信号,而不是严格的 token 预算。”Anthropic 没有公布每个级别对应的成本倍率,并建议针对自己的使用场景进行测试。因此,今天下午即可实际比较:以 high 运行 Sonnet 5,与以 low 运行 Opus 4.8。Haiku 4.5 不在支持工作量设置的模型列表中。

提示缓存。 缓存读取的费用是基础输入费率的 0.1x;决定模型选择的关键在于这一费用在不同层级之间的影响。Opus 4.8 的缓存命中费用为 $0.50 / MTok,而 Haiku 4.5 的未缓存输入费用为 $1 / MTok。因此,缓存效果良好的 Opus 前缀,其每个输入 token 的费用低于未命中缓存的 Haiku 提示。对于需要反复发送大型稳定前缀的工作负载,保持会话整洁比选择模型更重要。

批处理。 如果没有请求等待响应,Message Batches API 可以使用相同的模型,并“对输入和输出 token 均提供 50% 的折扣”。它会将下方比较中的每一行费用减半,并且适用于不同层级:按照 2026 年 9 月 1 日起的标准价格,批处理 Opus 4.8 作业的费用低于同步 Sonnet 5 作业;代价是增加延迟,但在相同费用下获得更强的能力。

一次完整的成本比较

工作负载:对 100,000 封支持邮件进行分类,每封邮件调用一次,每次调用包含 2,000 个输入 token 和 300 个输出 token。总计为 200 MTok 输入和 30 MTok 输出。

  • Haiku 4.5:200 x $1 = $200 输入,30 x $5 = $150 输出。总计 $350。
  • Sonnet 5,初始价格:200 x $2 = $400 输入,30 x $10 = $300 输出。总计 $700。
  • Sonnet 5,自 1 September 2026 起:200 x $3 = $600 输入,30 x $15 = $450 输出。总计 $1,050。
  • Opus 4.8:200 x $5 = $1,000 输入,30 x $25 = $750 输出。总计 $1,750。

替换其中 4 个数字,就可以按照明天的价格重新计算。下面的调整对结果的影响,比模型名称更大:

  • 批处理会让每一项成本减半:$175、$350、$525 和 $875。无需等待每晚的分类任务,因此没有理由跳过批处理。
  • 缓存共享前缀。 假设每次调用的 2,000 个输入 token 中,有 1,200 个属于相同的指令块。在 Sonnet 5 的初始价格下,这些 token 作为缓存命中时的价格为 $0.20 / MTok,而不是 $2 / MTok,因此 120 MTok 的成本为 $24,而不是 $240。再加上按 $2 计算的 80 MTok 新输入,即 $160,以及 $300 的输出,Sonnet 5 的成本约为 $484,而不是 $700。Haiku 4.5 无法采用同样的方法,因为 1,200 个 token 低于其 4,096-token 的最低要求。
  • 重试。 假设 Haiku 的回答有 8% 被拒绝,并使用 Opus 4.8 重新处理这些邮件。需要在 $350 的基础上增加 0.08 x $1,750 = $140,最终为 $490。应测量您自己的拒绝率,不要直接套用我的数值。
  • 工具定义(如果任务使用工具)。 在 Opus 4.8 上,工具定义生成的系统提示词在 tool_choice 设置为 auto 时包含 290 个 token;Sonnet 5 为 354 个,Haiku 4.5 为 496 个。价格最低的模型承担的固定开销反而最大。

采用升级路径的 Haiku 成本为 $490,使用缓存的 Sonnet 5 成本为 $484,两者基本相同,其中一个模型还可以通过单次处理完成任务。问题从来不只是选择哪个模型。

会话中途切换模型能省钱吗?

通常没有标价显示的那么多,因为节省的是每个 token 的费用,而可能失去的是整个缓存前缀。

Anthropic 记录了会使缓存失效的情况。前缀依次按 toolssystemmessages 的顺序构建,“每个级别发生更改时,该级别及其后续所有级别都会失效。”其中还包括两个请求设置:“thinking 配置和解析后的 effort 级别会直接写入提示词,因此更改其中任何一项都会创建新的缓存前缀。”关于 effort,文档进一步建议:“在不同工作负载之间调整 effort,不要在依赖缓存命中的同一会话中调整。”

模型不在上述文档列表中,因此不要直接假定切换模型一定会或一定不会使缓存失效。切换后发送第一个请求时读取 cache_read_input_tokens,以实际数值为准。对于包含 150,000 个 token 的 Opus 4.8 前缀,读取缓存的费用约为 $0.08,而重新写入缓存的费用约为 $0.94;这已经超过了你原本想通过每 token 价差节省的数轮费用。

因此,应在任务之间切换这些设置,而不要在同一个任务中途切换。在 Claude Code 中,这意味着先使用 /clear,因为此时缓存本来就会被丢弃,然后再使用 /model/effort。这两个命令都在 CLI 中输入。如果你使用 Linux,值得安装的是终端版本,因为Anthropic 为 Linux 原生提供的版本将稳定的 CLI 与仍处于 beta 阶段的桌面应用配套提供。切换是否会反映在账单上,还取决于该会话的付费方式,因为Claude Code 可使用固定月费套餐或按 token 计费的 API 额度,只有后者会按美元计算模型切换费用。对于固定月费套餐,使用更强模型的代价不是账单金额,而是使用窗口;并且Claude Code 从 Pro 套餐起已包含在内,并与聊天应用共用同一个使用窗口,因此在终端使用 Opus 1 小时,就意味着无法在浏览器中使用这 1 小时。

如何在您自己的工作负载上测试答案

不要使用其他模型的计数结果来估算提示词大小。令牌计数端点可免费使用,并会使用您指定模型的分词器进行计数,因此请指定您计划调用的模型。该端点是平台中少数永不计费的功能之一。在您为比较测试消耗实际额度前,值得先查看还有哪些操作无需付费。Opus 4.7 及更高版本、Fable 5 和 Sonnet 5 使用更新的分词器,该分词器“会为相同文本生成约多 30% 的令牌”。因此,如果每个令牌的价格不变,按旧模型测得的预算在新模型上会偏低。

然后查看返回的内容。input_tokens仅表示未命中缓存的剩余部分,因此真实的提示词大小是该字段加上 cache_creation_input_tokenscache_read_input_tokens在 VPS 上运行第一个 Claude API 应用是执行这项测量的最小可行环境,而哪个 Claude 方案适合您的使用量则是另一个问题,决定您是否需要按令牌付费。如果最终需要决定的是选择哪种订阅,而不是是否订阅,那么Claude 与 ChatGPT 并列比较的订阅层级会说明相同编码工作在另一家服务商的席位上需要多少成本。如果测量结果表明您将长期把工作转移到 API,将订阅降到更低层级或完全取消也不会影响您已经付费的使用周期,因此等数据出来后再决定不会产生损失。针对团队而不是个人执行相同测量时,总成本还会呈现不同的结构,因为在购买 Team 或 Enterprise 席位前,必须确认它的成本低于该人员原本按令牌支付的费用

FAQ

哪个 Claude 模型最适合编程?

根据文档,Claude Opus 4.8 是复杂智能体编程的推荐起点。截至 July 2026,其价格为每百万输入 token $5、每百万输出 token $25。Claude Sonnet 5 定位为速度与智能的最佳组合。在 31 August 2026 前,其价格为 $2 / $10,不到 Opus 4.8 的一半。让两个模型执行相同任务,保持思考配置不变,然后通过 response.usage 比较 token 总消耗。

Claude Haiku 4.5 是否足够便宜,可以替代 Sonnet 5?

单看 token 价格,完全可以:引入定价期间,Haiku 4.5 的价格为 $1 / $5,而 Sonnet 5 为 $2 / $10;从 1 September 2026 起,Sonnet 5 的价格为 $3 / $15。真正决定因素是限制。Haiku 4.5 的上下文窗口为 200K token,而不是 1M;同步 Messages API 的最大输出为 64K;可靠知识截止时间为 February 2025;不支持 output_config.effort;此外,可缓存提示词的最小长度为 4,096 token,较短的系统提示词会因此静默禁用缓存。

在会话中途切换到更便宜的 Claude 模型,能节省费用吗?

通常没有看起来那么多。Anthropic 说明,缓存失效条件包括更改 toolssystemmessages 前缀,更改思考配置,以及更改 output_config.effort。文档没有说明切换模型会如何影响现有缓存,因此应将其视为未知,并在之后的第一个请求中读取 cache_read_input_tokens。了解这一点很重要:对于包含 150,000-token 的 Opus 4.8 前缀,读取缓存的费用约为 $0.08,而重新写入缓存约为 $0.94,这会抵消多轮请求的 token 单价节省。应在任务之间切换模型,或在 Claude Code 中执行 /clear 后切换;此时缓存无论如何都会被丢弃。

output_config.effort 如何影响费用?

它会改变模型在文本、工具调用和思考过程中消耗的 token 数量。较低的 effort 会减少工具调用次数,而在智能体循环中,这种影响会累积,因为每次工具结果都会在后续轮次中重新发送。可用级别为 lowmediumhighxhighmax,默认值为 high。Anthropic 没有公布每个级别对应的费用倍数,而是将 effort 定义为行为信号,而不是 token 预算,因此应在自己的任务上进行测量。

Claude Batches API 能节省多少费用?

输入和输出 token 均可节省 50%,代价是异步交付。截至 July 2026,Opus 4.8 的价格为输入 $2.50 / 输出 $12.50,Sonnet 5 在引入定价期间为 $1 / $5,Haiku 4.5 为 $0.50 / $2.50。值得注意的是跨层级比较:从 1 September 2026 起,批处理 Opus 4.8 任务的费用低于按标准价格同步执行的 Sonnet 5 任务,因此批处理可以用相同预算获得更强的模型。