SSD Nodes Learn 🎉 VPS $5.50/月起
指南 Matt Connor作者: Matt Connor · 更新于 2026-08-21

Claude 文本水印如何工作?检测结果意味着什么

Claude 文本水印通过密钥和前文 token 偏置随机选择,而非添加隐藏字符。了解 2026 年 8 月上线范围、统计检测限制,以及“未检测到标记”不等于非 AI 生成。

Claude 文本水印是什么

Claude 文本水印是在模型选择词语时施加的一种偏置。它不是附加到文件上的标签,也不是可以用正则表达式删除的一串不可见 Unicode 字符。Anthropic 在 2026 年 8 月 14 日发布的 Claude 文本水印的工作原理中说明,该方案“只改变用于在词语之间进行选择的随机性来源”,同时使用密钥和前面出现的少量词语。由于标记存在于所选词语中,因此复制和粘贴不会将其移除;但词语发生变化后,标记也会失效。

由此可以得出两点,这也是人们搜索这一主题的原因。检测是一种统计测试,需要足够多的词语才有意义,因此无法对单个句子给出有用结论。检测结果为否也不能证明任何事情:Anthropic 帮助中心说明,“未检测到标记并不意味着内容不是由 AI 生成或处理的”。

2026 年 8 月 18 日查阅的帮助页面 Claude 如何标记 AI 生成的内容列出了支持标记的产品和服务:“Claude Platform (API)、Claude、Claude Code、Claude Cowork 和 Claude Tag”,其中包括通过 AWS、Google Cloud 和 Microsoft Foundry 提供的访问方式。2026 年 8 月 2 日或之后发布的模型在上线时支持机器可读标记,较早发布的模型则仍在逐步支持中。这个日期并非巧合。欧盟《人工智能法案》第 50 条自 2026 年 8 月 2 日起适用,要求生成合成文本的系统提供商以“机器可读的格式”标记输出,并确保标记“可检测为人工生成或操纵的内容”。Anthropic 表示,该标记在全球范围内应用,而不只针对欧盟流量。

文件的处理方式不同。帮助页面说明,支持的生成文件(“.svg、.png 或 .jpg”)会按照 C2PA(内容来源与真实性联盟)标准携带经过加密签名的来源元数据。这些元数据附加在文件内容旁边,并不改变文件内容,因此很容易被移除。

水印如何影响 token 选择

在每一步中,语言模型都会为它接下来可能生成的每个 token 计算概率(token 可以是一个单词,也可以是单词的一部分)。采样器会选择其中一个 token,通常使用普通随机数源产生选择所需的随机性。水印采样器则将该随机数源替换为带密钥的伪随机函数。该函数的输入包括密钥和最近生成的几个 token,因此持有密钥的任何人都可以复现这一选择,而对其他人而言,这看起来只是普通的随机变化。

第一个被广泛引用的公开版本是 A Watermark for Large Language Models(Kirchenbauer 等,ICML 2023)。在生成每个 token 之前,密钥和前面的 token 会从词表中选择一个伪随机的“绿色”子集,采样器则为这些 token 的分数增加一个小幅奖励。没有任何 token 会被禁止,因此文本仍然流畅,但绿色 token 的出现频率会略高于随机情况下的预期。

Anthropic 的文章称,其实现基于 SynthID-Text。Google DeepMind 于 2024 年 10 月在 Nature 发表了该方法,论文题为 Scalable watermarking for identifying large language model outputs。文章还称,这一系列思想可以追溯到 Scott Aaronson 于 2022 年提出的一项方案。SynthID-Text 根据模型自身的分布抽取多个候选 token,并使用带密钥的函数对这些候选 token 进行淘汰赛评分,因此最终保留的 token 往往是密钥偏好的 token。候选 token 来自模型自身的分布,这也是已发表评估报告称质量没有可测量下降的原因。

其中最重要的影响因素是熵。只有在模型确实有多个选择时,偏置才有发挥空间。如果下一个正确的 token 只能是 Paris,任何方案都无法在不使文本出错的情况下改变它。Anthropic 明确指出,水印在“事实性段落中更稀疏,因为其中能够在不降低文本准确性的情况下做出的选择更少”;代码“通常比其他某些形式的文本包含更少的水印”,因为代码通常必须精确匹配。信号密度取决于模型的选择自由度,因此,较长的开放式 prose 会携带明显的水印,而较短的事实性回答几乎不携带水印。

以上内容还有一个需要明确的限制。截至 2026 年 8 月 18 日,Anthropic 公布了其方案所属的技术系列,但没有公布具体参数或检测器阈值。本节中的机制来自所引用的论文。应将其理解为 Anthropic 所称的已公开设计,而不是 Claude 确切配置的描述。

检测是一次假设检验,而不是盖章

检测器读取文本和密钥。它遍历文本,重新计算在每个位置上该密钥会偏好的结果,为每个词元评分,然后将所有分数相加。原假设是:文本并非使用该密钥控制的采样器生成。此时,分数的表现类似抛硬币,总分会接近其期望值。带水印的文本会偏离到更高的一侧。输出结果是一个 p 值,即从未加水印文本中观察到这么高总分的概率;所谓“检测到”这一结论,就是将该 p 值与某人选定的阈值进行比较。

这种设计在实际使用中会产生两个影响。文本越长,置信度越高,因为每增加一个词元,就多了一点微弱的证据。Anthropic 的表述是:“在样本较小时,水印检测同样无法很好地工作,因为可选词语更少,因此可用的信息也更少。”阈值也是一种权衡。将阈值设得足够低,才能标记一段文字,但这样也会开始因随机因素误标记人类撰写的段落。

您目前还无法自行运行这项检验。Anthropic 的文章称,它“很快将提供水印检测 API”,并且“正在确定其实现细节”。因此,截至 18 August 2026,Claude 尚无公开的水印检测器,Anthropic 之外的任何人都无法确认或否认某段文本是否带有该标记。

这一空白很重要,因为人们往往会改用其他工具。学校和编辑使用的商业“AI 检测器”是根据写作风格训练的分类器。它们不持有密钥,也不执行这类检验。其失败模式已有记录:AI 检测器会对非英语母语写作者产生偏见(Liang 等,《Patterns》,2023)发现,常用检测器将一组 TOEFL 非英语母语写作者的作文中超过一半判定为 AI 生成,同时正确分类了英语母语写作者的样本。水印检测器和风格分类器是两种不同的工具。不要让任何人把后者称为前者交给您。

什么会移除水印

短输出。 一行回答包含的决策太少,无法让统计结果产生明显变化。这不是实现缺陷,因此没有修复方法;这是测试本身的属性。

重写。 Anthropic 表示,轻度编辑可能仍会保留可读的标记,而“完全重写,替换每一个单词”会移除标记。每替换一个单词,密钥就少一个可以解释的单词。

通过其他模型改写。 第二个模型使用自己的采样器重新选择每个 token,且不使用该密钥。因此,输出会携带该模型自己的标记(如果它有标记),而不会携带 Claude 的标记。

翻译,但有一个例外。 将 Claude 生成的英文交给其他翻译器处理会破坏信号,因为新的采样器会重新选择每个目标词。Anthropic 指出了相反的情况:“由 Claude 生成的翻译带有水印,因为在这种情况下每个词都是由 Claude 选择的。”

代码,大多数情况下如此。 正确的代码几乎没有可互换的选择。TechCrunch 于 15 August 2026 报道称,Anthropic 预计“对实际生成的代码影响可以忽略不计”,标记更可能出现在注释中。这是媒体对公司声明的报道,而不是已发布的文档,因此应将有关注释的细节视为未经确认。注释和标识符名称是补丁中真正有选择空间的部分。

文件的元数据移除。 C2PA 溯源信息位于图像数据旁边,因此重新编码文件的操作通常会将其丢弃,除非明确要求保留。这包括普通静态站点构建中的图像优化器。Anthropic 的帮助页面将移除元数据列为标记消失的原因之一。

检测到标记实际能证明什么

它能证明的内容,比“水印”一词所暗示的要少。Anthropic 的文章明确指出:“水印只能判断 Claude 可能曾在某个阶段参与处理过内容。它无法区分‘这段内容由 Claude 撰写’和‘这段内容经过 Claude 大幅编辑’。”帮助页面还补充说明,“Claude 可能不是原始作者”,因为用户会使用 Claude 编辑自己撰写的内容,而且内容在经过 Claude 处理后还可能发生变化。

Anthropic 已发布的材料没有说明存在按账户或按用户区分的信号。根据现有文档,该标记只能表明某个 Claude 模型参与过内容处理。如果有人声称水印可以揭示某段内容由哪个用户或哪个 API key 生成,截至 18 August 2026,主要来源中没有这一说法。

这会改变从您的服务器发布 AI 辅助代码的方式吗?

对于代码,技术上的答案基本是否定的,原因已有两个:精确代码中的信号很弱,而且不存在公开的检测器。决定您是否可以发布的是政策,而政策并未改变。开源项目已经为 AI 辅助贡献编写了各自的规则,这些规则由维护者阅读您的拉取请求来执行,而不是由检测器读取您的代码令牌来执行。

对于服务器生成的散文,答案是肯定的,但仅限于一种具体情况。如果 API 调用生成了您的发行说明或产品页面,其中的文字来自 Claude,因此标记也在文字中。将 Markdown 渲染为 HTML、压缩内容、将结果存储在 Postgres 中,以及通过 CDN 提供内容,都不会改变文字,因此也不会改变标记。会削弱标记的是人工编辑重写句子。

您无法通过提示词去除水印。水印应用于采样层,位于模型生成的文本之下,因此“不要为这段内容添加水印”之类的指令没有作用对象。这与代理忽略您编写的指令的常见原因不同;在后一种情况下,指令确实传达给了模型,但被其他因素覆盖。截至 18 August 2026,API 客户没有公开记录的选择退出机制。

如果您使用 Claude 来运行服务器,而不是让它替您写作,这几乎不会改变什么。Shell 命令和配置片段较短且受约束,因此几乎不包含任何信号;标记机制也不会影响服务器上实际执行的内容。使用 Claude 进行日常系统管理工作会引出另一个问题:究竟哪些内容会离开您的计算机。请参阅编码代理实际上会从您的服务器发送哪些内容

应披露的内容

披露是规则问题,不是检测问题。水印不会产生披露义务,也不能免除披露义务。先确定哪项规则对您具有约束力,然后无论是否可能被发现,都应遵守该规则。

《欧盟人工智能法案》将这项责任分为两部分。第 50(2) 条将标记义务交给提供方,即 Anthropic,这也是本次发布所履行的义务。第 50(4) 条将另一项义务交给部署方:任何发布 AI 生成文本、旨在“就公共利益事项告知公众”的人,都必须披露该文本由人工生成。该条包含一项适用于大多数发布团队的豁免:如果“AI 生成的内容经过人工审核或编辑控制,并且由自然人或法人对发布承担编辑责任”,则可适用豁免。两项规定均自 2 August 2026 起适用。经过审核且有署名编辑负责的文章,与无人阅读便自动发布的信息流受到的规则约束不同。这是对法规文本的解读,不构成法律建议。

其他规则的适用范围可能超过法律。您的雇佣合同、客户协议、您提交补丁的项目贡献指南,以及您供稿的出版方政策,都可能要求更严格的披露。这些规则也是实际会有人检查的规则。

披露时,应说明模型做了什么,以及您核验了什么。“使用 Claude 撰写初稿,发布前已在全新 Ubuntu 24.04 安装上运行每条命令”能向技术读者提供实际信息。笼统的“使用了 AI”标记则不能,因为模型无法替您完成的部分正是核验。

不要将水印检测结果当作指控。阳性结果只能说明某个 Claude 模型曾在某个环节参与其中,包括作为他人原创文字的编辑。阴性结果完全不能说明任何问题。

FAQ

我可以关闭 Claude 的文本水印吗?

截至 18 August 2026,没有已公开说明的退出选项。Anthropic 的帮助页面介绍了 Claude、Claude Platform(API)、Claude Code、Claude Cowork 和 Claude Tag 中的水印机制,也包括通过 AWS、Google Cloud 和 Microsoft Foundry 使用这些服务的情况,但没有提到任何可禁用水印的设置。要求模型不要为答案添加水印也没有作用,因为水印由负责选择 token 的 sampler 添加,而不是模型根据指令生成。

水印会出现在 Claude 编写的代码中吗?

几乎不会。水印机制会在多个都可接受的选项之间进行选择,而正确代码通常没有太多可变选项。Anthropic 表示,代码“通常比其他一些文本形式的水印更少”,因为代码通常必须精确。TechCrunch 于 15 August 2026 报道称,Anthropic 预计水印对代码本身的影响可以忽略不计,水印更可能出现在注释中;但这是对相关声明的媒体报道,不是已发布的文档。补丁中最有可能变化的部分是注释和标识符名称。

如果检测器没有发现水印,是否能证明内容由人编写?

不能,这是人们对水印最常见的误解。Anthropic 自己的页面说明,“未检测到水印不代表内容不是由 AI 生成或处理的”。文本可能太短,无法进行检测;也可能已经过编辑或改写;可能来自在水印机制发布前推出的模型;或者完全来自其他厂商。该检测只能单向提供信息:它可以提高 Claude 参与生成的可能性,但永远无法证明 Claude 没有参与。

改写或翻译会移除水印吗?

通过其他模型改写会移除水印,因为该模型会使用自己的 sampler 重新选择每个词,并且没有相应的密钥。使用外部工具翻译也会因同样原因移除水印。例外情况相反:Anthropic 表示,“由 Claude 生成的翻译带有水印,因为在这种情况下,每个词都由 Claude 选择”,因此使用 Claude 翻译自己的文字,会添加原本不存在的水印。

我可以自行检查文档是否含有 Claude 水印吗?

目前还不行。检测需要密钥,因此无法通过阅读文本或使用离线工具完成。Anthropic 表示“很快将提供水印检测 API”,目前仍在确定具体细节。因此,截至 18 August 2026,还没有公开的检测器。如今以 Claude 检测器名义销售的任何工具,实际上都是风格分类器。这是另一种机制,并且已有文档记录显示:对于第一语言不是英语的人所写的文本,它存在误报问题(Liang et al., Patterns, 2023)。

#claude#watermarking#ai-detection#provenance#policy