商业动态 · 小互解读

Anthropic 公布 Claude 的内容标记方案:它写的每段字里都埋了看不见的水印

从 8 月 2 日起,Claude 生成的文字会带上机器可读的记号,但它证明不了「这是 AI 写的」,也证明不了「这不是」
一分钟速览
  • 从 8 月 2 日起,Claude 生成的文字里会织进一个你看不见的水印,生成的图片文件会挂上带签名的溯源信息,全球所有产品线通用。
  • 这不是 Anthropic 单独的动作,欧盟法律 8 月 2 日生效,Google、Meta、OpenAI、Microsoft 等 82 家提供方都签了同一份准则。
  • 最该记住的是 Anthropic 自己写下的那句限制:查到这个记号,并不能证明内容是 AI 写的。反过来也一样。
材料来自 Anthropic 官方帮助文档,讲的是它打算怎么做,不是已经跑起来的既成事实。水印算法未公开,检测工具原文两次写「后续文档发布」。本文补充的法律条文、签署名单、罚则来自欧盟委员会官方页面,已在文末列出。
发生了什么

Claude 写的字里,从此多了个看不见的记号

Anthropic 在帮助中心挂出了一篇官方文档,讲 Claude 从今往后怎么给自己生成的内容打标记。你让它写的每一段文字,从现在起都会带一个你看不见、机器却能查出来的水印。

官方给的承诺有四条:

01
新模型出厂就带

2026 年 8 月 2 日及以后在欧盟发布的 Claude 模型,上线当天就支持机器可读标记。文字带嵌入式水印,文件带数字签名的溯源信息。

02
用 Claude 的地方都算

Claude Platform(API)、Claude、Claude Code、Claude Cowork、Claude Tag 全线覆盖,全球所有提供 Claude 的地区都适用。部分平台或功能可能不支持某些标记类型。

03
会开放检测

准则要求提供方让用户和第三方能检出自家标记,Anthropic 说细节放在后续技术文档里。

04
老模型在补

8 月 2 日之前发布的模型有过渡期,标记支持正在补,补完会更新这篇文档。

需要先说清楚的是,这篇文档写的是承诺和设计。水印用的什么算法没有公开,能让你验证的检测工具也还没上线,原文两处都写着「后续技术文档发布」。

缘由

欧盟法律要求这么做,8 月 2 日就能罚款了

那么为什么突然要加这个东西?答案在欧盟《AI 法案》第 50 条,它管的是「透明度」,其中第 50(2) 条对做模型的公司提了一条硬要求:生成式 AI 系统的输出,必须带上「有效、可靠、稳健、可互操作」的机器可读标记,让人能检测出这是 AI 生成或篡改的。

这条义务从 2026 年 8 月 2 日起可以执法,由各成员国的市场监管机构负责。Anthropic 文档里那条「8 月 2 日及以后发布的模型」的分界线,就是从这儿来的。

1500 万欧元 / 3%

违反第 50 条的罚款上限:1500 万欧元,或全球年营业额的 3%,取高的那个。中小企业取低的那个

约 190 家

截至 7 月底签署配套《AI 生成内容透明度行为准则》的组织,其中提供方那一节 82 家

那份《行为准则》签不签是自愿的,但第 50 条的义务是强制的。签的好处能直接兑现:欧盟委员会和 AI 委员会已经认定这份准则「适当」,签署方可以直接拿它证明自己合规;不签的公司得自己向各国监管机构逐一证明替代方案够格。

这不是一家的动作

提供方那一节的 82 家签署方里,有 Anthropic、Google、Meta、Microsoft、OpenAI、Mistral、Cohere、Aleph Alpha、Black Forest Labs、Synthesia。也就是说,主流模型厂商基本都在同一份准则下面。约一半签署方是小公司和新公司。

所以 Claude 加水印这件事,读成「Anthropic 上了个新功能」是读偏了。这是一整个行业在同一个时间点被同一部法律推着走,只不过 Anthropic 把自己的做法写成了公开文档。

做法

两种记号:文字里织水印,文件上挂签名

既然是法律要求,那么 Anthropic 具体怎么做?两种技术,各管一头。

管文字
嵌入式水印

Claude 生成文字时,把一个人察觉不到的水印直接织进文字本身。它不改变回答的含义、质量和可读性。水印在模型层面施加,所以文字从哪个 Claude 产品出来的都带着它。

管文件
签名溯源元数据

Claude 生成支持的文件类型时(.svg、.png、.jpg),附上一份带数字签名的出身记录,走 C2PA 开放标准。它能证明文件被 Claude 处理过,也能查出文件后来有没有被改动。

两者的差别在哪

水印像钞票纸浆里压进去的暗纹,是纸本身的一部分,对着光才看得见;溯源元数据像快递面单上的物流记录,包裹本身没变,但单子记着它经过谁的手。差别是明摆着的:暗纹撕不下来,面单撕得下来。

这个差别决定了两者经得起的折腾完全不同。下面这个演示可以点,看它们各自经历日常操作之后还剩什么。

点一种记号,看它经得起什么
复制粘贴跟着走。水印是文字本身的一部分,粘到微信、飞书、Word 里都还在。
改几个词可能还在。文档的原话是「经过一些编辑后仍可能留存」,留存到什么程度没给数字。
整段重写大概率没了。官方把「大幅编辑、改写、翻译」列为查不出的情形之一。
只有一句话查不出。文字量太少,凑不够一个可靠信号,原因下一节会讲透。
水印的强项是黏性:它跟着文字走,换平台、换软件都不掉。弱项是长度改写
原样传输在。数字签名还能同时告诉你这个文件后来有没有被人动过。
转个格式可能没了。官方把「格式转换」列为元数据被剥掉的方式之一。
重新保存可能没了。很多软件在另存时不保留原始元数据。
截个图没了。截图产生的是一张全新的图,出身记录不会跟过来。
元数据的强项是信息量:它不光说明来源,还能验证文件有没有被篡改。弱项是,一次截图就归零。
演示内容据 Anthropic 官方文档的「局限」一节整理(本站制作)。官方没有给出各种情形下的留存率数字,所以这里只做定性说明。
机制

看不见的水印,是怎么塞进文字里的

但一个看不见、又不改变意思的记号,听起来自相矛盾:字还是那些字,记号能藏在哪儿?

先说清楚

Anthropic 没有公开自己的水印算法,官方原文只写了「把一个人察觉不到的水印织进文字本身」。下面这段讲的是同类技术的公开做法,取自 Google SynthID-Text 发表在《自然》的论文(2024),不是 Anthropic 的实现,只用来说明这类水印大致靠什么原理成立。

关键在于:模型每写一个词,本来就不是只有一个选择。它算出一堆候选词各自的概率,然后从里面挑一个。同一句话让它写两遍,出来的词可能就不一样,这个「挑哪个」的自由度,就是水印藏身的地方。

做法是在挑词这一步动手脚:拿一把密钥,加上刚写下的最近几个词,算出一个随机数;用它给每个候选词打分;让分数高的候选在一轮轮淘汰里胜出。挑出来的词依然是合理的词,句子读着照常通顺,但整串词的选择在统计上带上了一种偏向。

点一步,看水印怎么一个词一个词攒出来
这份报告的结论
很明确得分 0.91 相当清晰0.42 比较肯定0.18
模型本来三个词都说得通,概率相差不大,随便挑一个句子都通顺。
水印做的用密钥算出一个随机分数,让「很明确」胜出。读者看不出任何异样。
已攒到的统计信号
一个词的偏向说明不了任何事,换个人写也可能正好选「很明确」。
这份报告的结论很明确
0.33 0.88 0.21
种子变了刚写下的词也参与算随机数,所以每一步的打分表都不一样。
又中一次高分候选再次胜出。偏向开始累积。
已攒到的统计信号
两个词还是巧合的范围内。
这份报告的结论很明确,
数据0.79 证据0.51 材料0.30
重复几十次每一步都朝高分那边偏一点点,单看每一步都在合理范围内。
检测怎么做拿同一把密钥把整段文字重算一遍打分,看命中高分的比例是不是明显高于碰运气。
已攒到的统计信号
信号是一点一点攒出来的,攒的过程完全藏在「本来就有好几个词能用」这件事里。
这份报告的结论很明确,数据支持我们此前的判断,后续的工作可以按原计划推进。
够长了几十上百个词都朝同一个方向偏,碰巧的概率低到可以下判断。
所以水印查得出来,靠的是文字数量。这也正好解释了官方那条限制,段落太短,可靠信号所需的文字量不够。
已攒到的统计信号
反过来也说明:把文字大改一遍、翻译一遍、拆开混进别的段落里,攒起来的偏向就被打散了。
示意演示(本站制作):候选词、分数与进度均为示意值,用于说明原理,不是任何一家的真实实现。原理依据 Google SynthID-Text 的公开论文,Anthropic 未公布自家算法。

这套原理讲完,官方那几条局限就不再是干巴巴的免责声明了,它们全都是这个机制的直接后果。

局限一

但查到记号,不代表这篇就是 AI 写的

所以这套东西能拿来判定「这篇是不是 AI 写的」吗?官方的原话是:检出标记说明内容可能被 Claude 处理过,它本身并不能确认内容的完整来源。

两种情况会让这个信号失真:Claude 可能压根没参与创作,人们常拿它校对、翻译、总结、转格式,原始的想法和文字来自别处,输出照样带 Claude 的记号;内容也可能在 Claude 处理之后被改过、被摘录、被和别的材料拼在一起。

下面几个场景可以自己点,看每一种情况下记号在不在、以及该怎么解读。

点一个场景,看能不能查出记号
你把一篇别人写的英文长文,丢给 Claude 翻成中文。
查得出记号
但含义是这段文字经过了 Claude,不代表内容是 AI 想出来的。文字、观点、数据全是别人的。
误判风险拿检测结果去认定「这人用 AI 代写」,就冤枉了一个只是用工具翻译的人。
这是官方明确点名的情形:校对、翻译、总结、转格式,输出都会带记号。
让 Claude 出个初稿,你自己从头到尾重写了一遍。
大概率查不出
为什么攒在词序列里的统计偏向被改写打散了,剩下的信号不够下判断。
但含义是这篇确实是 AI 参与写的,检测却给不出证据。
这一条正好和上一条对着来:一个是没写却查得出,一个是写了却查不出。
Claude 生成了一张图,你截图之后发出去。
查不出记号
为什么截图产生的是一张全新的图,原文件那份签名出身记录不会跟过来。官方把截图、格式转换、重新保存都列为剥掉元数据的方式。
要注意这一步不需要任何技术,随手一截就完成了。
文件类记号的脆弱之处:它挂在文件上,不在画面里。
你只让 Claude 写了一句话,比如一条朋友圈文案。
查不出记号
为什么水印靠的是文字量攒出来的统计信号,一句话攒不够。
连带影响标题、口号、短评论、聊天回复这类高频用法,基本都在检测范围之外。
越短的文字越查不出,而短文字恰恰是 AI 用得最多的地方之一。
场景为本站按官方「局限」一节的条目构造的示意例子(不来自原文),判定依据是官方列出的情形;官方未提供各情形下的检出率数字。
局限二

反过来查不到,也不代表就不是 AI 写的

而且反过来那个方向,同样不成立。官方直接列了五种情况,内容确实由 Claude 生成,却查不到记号:

模型太老

标记支持之前发布的模型生成的内容,本来就没带记号。老模型的支持还在补。

改得太狠

文本被大幅编辑、改写、翻译,或者拆开混进了别的写作里。

文字太短

段落太短,凑不够一个可靠信号所需的文字量。

元数据被剥

文件经过格式转换、重新保存、截图等操作,出身记录被抹掉。

第五种是平台差异:在某个不支持该标记类型的平台、功能或文件类型上产生的内容,也不会带记号。官方在讲云平台时留了同样的口子,通过 AWS、Google Cloud、Microsoft Foundry 访问 Claude 时,文字水印照常施加,但签名溯源元数据「可能不是每个平台都支持」。

怎么理解

所以水印是来源线索,当不了查作业的工具

两个方向都不能反推,那么该怎么用它?这套机制给的是来源信号,不是AI 判定

两头都会翻车

想拿它查学生作业、查投稿、查供应商交付,两个方向都靠不住:查到了不能定罪,那人可能只是用 Claude 翻译了自己写的东西;查不到也不能脱罪,改写一遍、截个图、或者本来就没几个字,记号就没了。

上面这些限制是 Anthropic 自己写在文档里的,不是外界事后挑出来的。而且写得比多数厂商坦白:一整节标题就叫「局限」,两个方向各列一遍,连「检出标记不等于确认来源」这种对自己不利的话都摆在明面上。

「检出 Claude 的标记,说明该内容可能被 Claude 处理过。它本身并不能确认内容的完整来源。」

Claude 帮助中心,《How Claude marks AI-generated content》

放在更大的背景下看,这也是欧盟这条法律的设计意图:第 50 条要的是可检测,不是可定罪。它给信息生态加一层来源线索,让人在消费内容时多一个判断依据,而不是给谁发一把审判的锤子。

对你的影响

你拿 Claude 做产品,自己还有一份责任

所以最后一句提醒,给用 Claude 搭产品的人。文档对这一点毫不含糊:如果你把 Claude 部署进自己的产品,你要自行评估第 50 条对你的产品和服务提出了什么要求。

这句话背后是欧盟法律的责任划分。它把生成式 AI 的链条切成两头,义务不一样:

提供方(Anthropic) 第 50(2) 条 给模型输出加机器可读标记 让第三方能检测这些标记 第 50(1) 条 告知用户正在与 AI 交互 ✓ 这部分归 Anthropic 使用方(可能就是你) 第 50(4) 条 深度伪造要打标签 未经人工审核就发布的 涉公共利益 AI 文本要标注 ← 这部分归你自己 调用 模型层的标记不等于你合规了,两头的义务是分开算的
本站按欧盟委员会关于第 50 条的官方问答整理绘制。图中的条款归属以官方文本为准,具体到你的产品适用哪一条,需要自行评估或咨询法律意见。

按照准则下的承诺,Anthropic 的目标是支持你履行自己的透明度义务,技术指引会陆续放出。在那之前,模型带了水印,不等于你的产品合规了。

带走这一条

AI 水印是来源线索,当不了 AI 判定工具。查到记号,可能只是因为对方用 Claude 翻译或校对过;查不到记号,也可能只是因为文字被改写过、太短,或者截过图。两个方向都不能反推,这是 Anthropic 自己写在官方文档里的。

来源
How Claude marks AI-generated contentClaude 帮助中心(Anthropic 官方)·原文
本站说明
原文没有配图,本文全部图示与可点击演示均为本站制作。法律条文、生效日期、签署名单来自欧盟委员会官方页面,不来自原文;罚则依据 AI 法案第 99(4)(g) 条原文,该条把第 50 条的透明度义务列入 1500 万欧元或 3% 那一档(取高者),第 99(6) 条规定中小企业取低者。水印原理一节依据 Google SynthID-Text 的公开论文说明同类技术,Anthropic 未公布自家算法,演示中的候选词、分数与信号进度均为示意值。场景判断器里的四个例子为本站构造,判定依据是官方「局限」一节列出的情形。