Claude Pro 包含多少 token 配额?
Claude Pro 没有固定的 token 配额。Anthropic 采用基于滚动窗口的消息数量限制,长对话和附件会显著加速配额消耗。本文详解为何无法按 token 计费,以及如何理解对话轮数对使用上限的影响。
Claude Pro 包含多少 token?
Claude Pro 不包含 token 配额。截至 2026 年 9 月,Anthropic 未发布过此类数据。Claude 订阅服务基于滚动时间窗口内的消息数量进行限制,而非扣除余额中的 token。窗口的长度取决于您选择的模型、对话的长度以及每轮对话包含的文本量。
这是该问题通常无法得到的答案,因为人们习惯将订阅计划视为 API key。API key 消耗的是以 token 计算的余额,因此您可以自行核算账单。而订阅计划销售的是 Anthropic 设置并动态调整的访问上限,该上限以消息数衡量,因此不存在固定的 token 数值。任何向您提供具体数值的人都是在凭空捏造。
因此,请换个角度提问。什么因素会导致我的消息消耗变快?这个问题有明确的答案,且您可以立即采取行动。
为什么订阅无法按 Token 数量报价
API 按 Token 数量对每项请求计费。输入 Token 涵盖您发送的所有内容,输出 Token 涵盖模型返回的所有内容,且两者费率不同,这就是为什么在进行任何估算前需要了解 输入和输出 Token 的成本差异。
消费者计划没有可供消费的余额。Anthropic 会限制您在滚动窗口内可发送的消息数量,该窗口从您的第一条消息开始计算,并在若干小时后关闭;付费计划则包含第二个更长的周期限制,按周计算。消息没有固定大小,因此对于不同用户而言,相同的消息数量代表的工作量差异巨大。Anthropic 的帮助页面以简短对话中的近似消息数来描述这些限制,并提醒长对话和大附件会更快消耗配额。该警告即是全部说明,其背后的机制几乎从未被解释过。
为什么第 20 轮对话的成本远高于第 1 轮
模型在请求之间不保留任何记忆。它是无状态的,因此每一轮对话都会重新发送整个会话内容:系统提示词、您之前编写的每条消息、Claude 之前的每条回复以及您附加的每个文件。您提出的新问题可能只有 20 个字,但承载该问题的请求却包含了整个对话记录。
因此,单轮对话的成本会随着对话长度的增加而线性增长。下表展示了基于一组假设的算术逻辑:系统提示词约为 1,000 个 token,您的每条消息约为 1,000 个 token,每条回复约为 1,200 个 token。这些数据仅用于说明机制,并非您账户的实际用量。
The data behind this chart
[
{
"label": "Turn 1",
"sent_this_turn": "2,000",
"cumulative_input": "2,000"
},
{
"label": "Turn 5",
"sent_this_turn": "10,800",
"cumulative_input": "32,000"
},
{
"label": "Turn 10",
"sent_this_turn": "21,800",
"cumulative_input": "119,000"
},
{
"label": "Turn 20",
"sent_this_turn": "43,800",
"cumulative_input": "458,000"
}
]第 1 轮发送了 2,000 个输入 token。到了第 20 轮,同样简短的问题发送了 43,800 个 token,是最初的 20 倍以上,而您的输入量却完全相同。在整个对话过程中,您总共发送了 458,000 个输入 token,其中大部分是反复发送的相同文本。
如果进行 20 次独立的单轮对话,其发送量仅为第一行所示数值的 20 倍,不会产生额外开销。同样的问题,负载却小得多。附件会进一步拉大差距,因为您在第 2 轮附加的 PDF 文件会在第 3 轮、第 4 轮以及之后的每一轮中被重复发送,无论对话是否仍与该文件相关。
这就是为什么使用相同套餐的两个用户会报告完全不同的使用量。一人整周保持同一个对话线程,周三就触及了限额;另一人针对每个任务开启新对话,几乎从未遇到限制。双方的操作都没有错,只是由于使用习惯不同,他们的 token 消耗量存在数量级差异。
在 API 中,您可以通过提示词缓存(prompt caching)来降低重复成本,它会存储请求中未更改的前半部分,从而使后续调用中该部分的计费费率降低。在订阅服务中,您无法控制缓存,因此对话长度是您唯一能掌控的杠杆。同样的机制也主导着编程会话,因为文件内容和工具定义会随每一轮对话传输,因此 保持编程会话的上下文精简 对提升限额的作用远超任何设置,且在归咎于套餐限制前,阅读 Claude Code 会话的 token 消耗去向 非常有价值。
各层级方案的相对权益
没有任何层级会公布绝对的配额。公布的仅是相对数值,但这些相对信息足以作为选择依据。免费版处于最低层级,当服务需求较高时,免费容量可能会收紧。Pro 版位于其上。Max 版提供两种规格,按 Pro 使用量的倍数描述,大约分别为 5 倍和 20 倍。Team 和 Enterprise 版按席位收费,并拥有各自的上限。
请将这些倍数视为意向说明,而非合同条款。Anthropic 会调整上限,且此类调整不会提前通知,这也是为什么没有任何诚实的页面能给出确切 Token 数值的原因。关于同类比较的费用方面,Pro 的费用及其上限限制 和 两个 Max 层级之间的差异 涵盖了相关内容,而 免费方案的实际允许范围 则说明了底线。
模型选择是叠加在层级之上的第二个乘数。对于同一个问题,使用最大模型消耗的配额比最小模型更多,因为运行更复杂的模型每个 Token 的成本更高。将常规任务从 Opus 切换到 Sonnet 或 Haiku,通常比升级方案能获得更长的工作时间,因此当您频繁达到上限时,根据任务匹配模型 是首选的尝试方案。
如何查看个人用量而非盲目猜测
您的账户是唯一权威的数据来源,只需点击两次即可查看。在 claude.ai 上打开 Settings,然后点击 Usage。此处会显示您在当前窗口内的消耗情况以及窗口重置时间。在回复开始受限时查看一次,并在长会话结束后再查看一次,您就能比参考任何公开数据更快地掌握自己的使用模式。
在 Claude Code 中,两个斜杠命令可在终端执行相同操作。/usage 会报告套餐用量及重置时间。/context 会详细拆解当前占用上下文窗口的内容,分别列出系统提示词、工具定义、文件和对话历史。当 /context 显示旧对话占据主导时,/clear 可开启一个新会话,使每轮对话的成本回落至上述图表的第一行水平。
在 API 中,计数是精确的,您可以在发送请求前进行查询:
curl https://api.anthropic.com/v1/messages/count_tokens \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached report."}]
}'正常的响应包含一个单一字段,该数值即为计费依据:
{"input_tokens": 14}每个已完成的请求在结束时都会报告相同的统计数据:
{"usage": {"input_tokens": 21430, "output_tokens": 512}}发送一个简短问题作为新请求,然后在长对话末尾发送同一个问题,并对比两个 input_tokens 的数值。其差值即为您订阅计划所计量的实际影响,以数字形式呈现。
任务中途达到限制时的应对措施
- 等待窗口重置。应用会显示重置时间,等待时间通常短于寻找替代方案的时间。如果任务没有紧迫的截止日期,这是最合适的做法。
- 切换到轻量模型。在所有方案中,小型模型的单次调用成本更低。在某些方案中,小型模型使用独立的配额,因此当大型模型受限时,工作可以继续进行。
- 开启新对话,仅保留下一步所需的信息。粘贴结论而非完整对话记录。单次调用的 Token 消耗会立即下降,且回答质量通常会提高,因为模型不再需要处理数千个已定论的 Token。
- 将任务迁移至 API。API 按请求计算 Token 并按量计费。没有等待窗口,且在每次调用前后均可查看费用。
选择哪种方案取决于你的问题是时间限制还是工作负载问题。一次性的突发任务属于时间问题。如果每周三都会遇到限制,则属于工作负载问题,此时应选择 API 或升级订阅方案,而非单纯调整时间。任务中途达到限制时的完整检查清单 分步介绍了恢复流程,滚动窗口的开启与重置机制 解释了计时逻辑。如果决定迁移至 API,请先进行成本核算:API 与订阅方案在相同工作负载下的对比 和 一百万 Token 的实际成本 提供了迁移前的计算参考。
FAQ
Claude Pro 包含多少 token?
Anthropic 并未公布 Pro 版本的 token 配额,截至 2026 年 9 月,没有任何官方数字可供参考。Pro 版本的限制基于滚动时间窗口内的消息数量,并设有周度上限;具体可发送的消息数取决于所选模型及对话长度。任何声称 Pro 版本有固定月度 token 数额的页面均属猜测。请在 claude.ai 中打开 Settings,然后查看 Usage,以了解您个人的使用情况及额度重置时间。
开启新对话会重置使用额度吗?
不会。使用量是按账户在时间窗口内累计计算的,因此开启新对话不会返还已消耗的额度。新对话改变的是后续每一轮对话的成本。由于新对话无需重新发送之前的对话记录,因此其成本从上述图表的低位开始计算,而不是继续累加。在更换话题时开启新对话是所有方案中最经济的使用习惯。
为什么我今天比昨天更快达到限制?
通常是因为今天的工作集中在一个长对话线程中。每一轮对话都会重新发送整个对话历史及所有附件,因此尽管您看到的消息条数没变,但单条消息的成本在持续攀升。另一个常见原因是模型选择:更强大的模型在每一轮对话中消耗的配额更多,因此使用最大模型度过一下午的时间,比使用较小模型度过一上午消耗得更快。
我应该转向 API 以获取精确的 token 计数吗?
如果您需要精确的数值或可预测性,请转向 API。API 会在每次调用时计算输入和输出的 token 数,提供可在发送前调用的 token 计数接口,且没有等待窗口限制。API 按 token 计费,因此高频使用比固定订阅费用更高,而轻度使用则便宜得多。在切换前,请根据您的实际工作负载对比当前方案的成本,因为答案取决于您发送的 token 总量。