
Anthropic 近日正式公开了 Claude 文本水印的技术细节。最新一批模型已全面内置该功能,旧模型也在适配中。这意味着,用户通过 Claude 生成的内容将带有可追溯的隐形标记。
官方博客核心要点总结如下:
- 实现原理:在选词环节利用密钥推导替代随机数,人类无法察觉,但持钥者可验证。
- 质量影响:官方宣称无影响。Google 对 Gemini 进行的 A/B 测试显示,用户评分无显著差异。
- 合规背景:响应欧盟《AI 法案》及全球范围内对 AI 生成内容标记的要求。
- 技术局限:在校对、翻译场景下表现不佳;短文本及纯事实陈述难以嵌入;无法区分“全篇生成”与“辅助修改”。
- 移除风险:研究显示,利用释义工具重寫可移除 98.3% 的水印,成本极低。
- 检测进度:检测 API 计划推出,但具体细节尚未确定。
水印嵌入机制:隐形的选择偏好
Claude 生成文本时,会在每个步骤计算候选词及其概率。当多个词概率相近时(如“阴沉的天空”与“灰蒙蒙的天空”),传统模型依靠随机数选择。水印技术则将此随机过程替换为基于密钥推导的确定性序列。
这种改动不会导致语句生硬或出现生僻词,但持有密钥的验证方能从文本中识别出特定的数学规律。
该思路最早由 Scott Aaronson 于 2022 年提出,随后被 Google DeepMind 转化为产品级方案 SynthID-Text 并发表于《Nature》。与市面上依赖文风猜测的检测工具不同,水印验证基于密钥,具有更高的准确性。
技术局限:并非万能“卧底”
Anthropic 明确指出,水印仅作用于 Claude 主动“选择”的词汇,这在多种场景下存在明显短板。
翻译与代码场景
在翻译任务中,虽然英文单词由 Claude 选择并嵌入了满额水印,但核心思想与观点仍归属原文作者。在代码生成中,由于逻辑和语法要求精确,水印仅能嵌入注释或变量命名等自由度较高的部分,且存在极小概率引发潜在 Bug。
短文本与事实陈述
短邮件回复因可选词汇有限,难以留下有效水印痕迹。而在纯事实陈述(如“牛顿著作《Principia》”)中,由于表达唯一性,水印几无发挥空间。
校对与权属界定
若用户仅提供初稿让 Claude 校对,整篇文章 99% 的内容源自用户,水印仅存在于少量修改处。更关键的是,水印技术无法区分内容是"AI 从头创作”还是"AI 辅助润色”,导致使用者可能面临自证清白的困境。
低成本移除风险
2026 年 7 月的研究显示,通过 AI 释义工具对带水印文本进行重写,移除率高达 98.3%。处理一篇千字文章的成本仅需约 4 美分。此外,一旦检测 API 公开,攻击者可利用“逃避预言机”原理,通过迭代修改直至水印信号低于阈值。这也是 Anthropic 检测 API 迟迟未定细节的主要原因。
伦理反思:工具不应署名作者
即便技术难题全部解决,根本性的伦理问题依然存在:如同没人会将 Word 列为文章共同作者,要求作为工具的 AI 在水印中“宣示主权”亦显荒谬。
你不会因为用 Word 写文章,就把 Word 列为共同作者。而 Anthropic 的这种水印,无异于要求一支圆珠笔宣传自己是作者。
Anthropic 官方强调,水印不改变作品所有权及法律责任归属。现实情况是,这个记号既无法确凿证明“有罪”,也难以完全保护“清白”,其实际效力仍有待观察。
参考资料:
https://www.anthropic.com/news/claude-text-watermark
编辑:摩西

