大数跨境

The Batch: 973|Claude 的水印如何运作

The Batch: 973|Claude 的水印如何运作 DeeplearningAl
2026-08-26
2

Anthropic 推出隐形机器可读信号,标识 Claude 生成内容

Anthropic 推出了肉眼不可见但机器可读的信号,用于表明文本和图像是由 Claude 生成的。

最新动态:该标记功能将于 2026 年 8 月 2 日后在所有新发布的 Claude 模型中全球部署。Anthropic 表示,此举旨在遵守欧盟《人工智能法案》关于水印的强制性要求。

技术原理与实施细节

核心机制:Anthropic 将为生成文本嵌入数字水印(一种隐藏编码签名),并为编辑后的图像添加元数据凭证。该策略适用于所有新模型,并将逐步覆盖现有模型。

文本水印:基于 SynthID-Text

Claude 的文本水印技术源自 Google 研究人员于 2024 年发表的 SynthID-Text 方法。其工作原理如下:

  • 隐性调整:语言模型在生成文本时,会通过一种被称为“种子生成器”的秘密随机化过程,微妙地倾向于选择特定词汇。这些选择形成特定模式,可由评分函数检测。
  • 概率评分:SynthID-Text 会输出一个统计分数,衡量文本与水印密钥的匹配程度。Anthropic 计划发布 API,供用户提交文本以获取该概率分数。
  • 持久性:水印设计具有抗干扰性,能在复制粘贴及部分编辑操作中保留。但经过大幅改写或格式转换去除元数据的图像可能无法保留水印。
  • 代码处理:由于代码具有确定性(如数学公式),水印较少出现在核心逻辑中,但在注释及非确定性选择部分仍会生效,从而实现对 AI 生成代码的检测。

图像凭证:基于 C2PA 标准

Claude 虽不从零生成图像,但具备编辑及通过代码生成图像的能力。此类图像的元数据将包含经密码学签名的 C2PA 凭证,用于证明来源。任何支持读取 C2PA 的软件均可识别该凭证,Anthropic 也将提供专用检查工具

局限性与声明

  • 非确凿证据:水印仅表示内容由 Claude 生成的概率,存在假阴性可能;人类创作经总结或翻译的内容也可能误触水印信号。
  • 无负面影响:官方承诺水印不会降低输出质量、对读者可见、增加 Token 成本或泄露用户身份信息。

行业反响与争议

这一公告引发了业界广泛讨论,观点呈现两极分化。

反对声音:隐私担忧与实用性质疑

  • 用户反弹:部分用户在社交平台表示因不满该政策而取消订阅,尽管 Anthropic 称未观测到显著的取消量增长。
  • 质量与误报风险:批评者担心微调会降低文本质量,且假阳性可能导致声誉受损。例如,使用 AI 辅助编辑的专业人士(如律师)可能被误判为完全由 AI 生成内容,面临信任危机。
  • 规避与隐私:前微软高管 Steven Sinofsky 等人指出,用户应拥有“免受数字足迹束缚的私人思维权利”。此外,水印可通过其他 AI 模型重写去除,且单一厂商的检测器难以覆盖所有大模型。
  • 竞争壁垒疑虑:有观点认为,Anthropic 可能利用水印技术指控竞争对手蒸馏其模型,以此遏制市场竞争。

支持观点:透明度与学术诚信

  • 遏制作弊:SynthID-Text 奠基人、计算机科学教授 Scott Aaronson 认为,即便检测不完美,水印也有助于阻止学术抄袭。
  • 模型安全:研究人员指出,水印有助于避免在不知情的情况下使用合成数据训练新模型,从而防止偏见累积或模型崩溃。

合规背景与全球趋势

重要驱动力:Anthropic 并非孤例,而是合规先行者。欧盟《人工智能法案》第 50 条强制要求对包括文本、图像、音频和视频在内的生成内容使用机器可读水印。

值得注意的是,Anthropic 选择了全球部署而非仅限欧盟。目前,OpenAI、Google、Meta 和 Microsoft 等巨头已签署欧盟关于 AI 透明度的自愿《实践守则》。未来各家公司将采用何种技术路线,以及是区域性还是全球性实施水印,仍有待观察。

深度观察

我们长期主张监管应针对 AI 的有害应用场景,而非限制技术本身。Anthropic 将水印内置于技术底层并对生成内容进行微调,虽有助于解决抄袭识别和合成内容溯源问题,但普遍水印最终可能被证明是一种过于粗糙的工具。此举或许会打开潘多拉魔盒,引发关于隐私侵犯、输出质量下降以及有害误报等一系列复杂问题。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1319
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读19.6k
粉丝0
内容1.3k