Claude 文字水印落地:AI 内容从此可验证

发生了什么

Anthropic 宣布:未来版本的 Claude 生成的每一段文字,都会携带一个不可见水印——一种统计模式,持有密钥的人可以据此估算这段文字由 Claude 写出的概率。这不是自愿功能:8 月 2 日生效的 EU AI Act 要求面向欧盟市场的 AI 提供商标记 AI 生成内容,Anthropic 是《AI 生成内容透明度行为准则》约 190 个签署方之一。

由于暂时无法按地区精细限定,水印将在全球范围默认开启。EU 法律为 8 月 2 日前发布的旧模型留了过渡期,Anthropic 计划在未来几个月内为旧模型也补上水印。

水印怎么工作

大语言模型逐词生成。遇到 "The weather today was cold and...",下一个词大概率是 overcast 或 grey,两个都合适时由随机数决定。水印只改变这个随机性的来源:不再用任意随机数生成器,而是用一把密钥加上前文来决定选哪个词。词仍然是随机选的,而且只从 Claude 本来就会考虑的候选里选——它不会为了让水印更明显而硬塞一个生僻词。

但整段词的序列从此有了指纹。任何持有密钥的人都能检查这个选择模式是否与 Claude 的密钥随机一致,从而给出"这段文字由 Claude 生成"的概率。该方案是 Google DeepMind 2024 年发表在 Nature 上的 SynthID-Text 的变体,其思想可追溯到 Scott Aaronson 2022 年的提议。

大富翁类比

Anthropic 用大富翁游戏打比方:玩家原本掷骰子获得随机步数,假设改成从圆周率小数第 1,012,845 位开始依次取数字当"骰子"。游戏过程对玩家毫无差别——步数依然随机。但事后如果你看到全部步数序列又知道圆周率,就能反推出这局用的是 pi 而不是骰子:这局游戏就是"带水印"的。

关键点:读者的体验完全不变。Google DeepMind 曾在真实 Gemini 流量上做 A/B 测试,水印版与无水印版的点赞率无统计显著差异;人类评测者也分不出两者。

水印不做的事

  • 不影响质量与成本:不产生额外 token、不增加延迟、不改变价格。
  • 没有隐藏字符:文本里什么都没加,只是随机源变了。
  • 无法定位个人:水印不携带任何用户、组织或对话信息,只能说明"Claude 可能参与过"。
  • 不是 AI 检测器:它不能证明文本是人写的,也无法识别其他模型(各家密钥不同、方法可能不同)。

水印的边界

  • 事实性内容:比如 "Isaac Newton's most famous work was called Principia..." 之后只能接 Mathematica,没有可发挥的低风险选择,水印无从附着。
  • 校对场景:Claude 只改语法标点的话,几乎全部词仍是人写的,水印几乎没有落脚点。Claude 写得越多,信号越强。
  • 代码:"2 + 2 =" 后面必须是 "4",精确代码没有选择空间,水印基本跳过;只有注释等任意部分可能带水印,对实际代码影响可忽略。

翻译是个例外:Claude 翻译时每个词都由它选择,所以译文是完整带水印的。

产业意义

AI 内容的可验证性正在从"可选功能"变成"监管底线"。EU 强制标记加近 200 个签署方承诺,意味着溯源基础设施将成为每家前沿实验室的标配;Anthropic 表示水印检测 API 即将推出,检测能力会成为一个标准产品面。

成本结构同样关键:水印零 token、零延迟,合规成本趋近于零——这正是它胜过可见标记和事后检测工具(如 Pangram 这类靠措辞风格猜"AI 味"的工具)的原因。后者与基于密钥的校验在原理上完全不同。

你现在该做什么

  • 用 AI 写作的人:轻度编辑去不掉水印,只有彻底重写才行——而那时文本还能不能算 AI 生成,本身就有争议。
  • 基于 AI API 开发的人:把水印元数据当作输出标准字段来规划,检测 API 出来后把验证做进工作流。
  • 图片与文件:Claude 生成 PNG/JPG/SVG 等文件时会附加 C2PA 内容凭证(加密签名的元数据),任何支持 C2PA 的工具都能读取。
  • 受监管行业的团队:主动记录内容是否 AI 辅助——水印会让这类声明变得可核查。

水印是行业结构性转变的一个切面:AI 竞争正从纯能力竞赛转向信任、溯源与经济性。我们此前讨论过的 Agent 融资寒冬 显示市场可以转得有多快,而强制水印说明监管同样可以。

发表评论

滚动至顶部