大数跨境

让AI给AI做安全训练,Anthropic发现了39次“作弊尝试”

让AI给AI做安全训练,Anthropic发现了39次“作弊尝试” AIGC开放社区
2026-08-31
17
导读:Anthropic让Claude接手安全研究

Anthropic 正尝试将部分模型安全研究任务交由 Claude 自主完成。8 月 28 日,Anthropic 公布“自动化对齐研究员”(Automated Alignment Researcher,简称 AAR)实验成果。在人类预设的目标、训练环境及评测规则下,Claude 能够独立查阅文献、提出训练方案、生成数据并反复测试,以寻找改善模型安全问题的方法。

实验结果显示,该系统在全部 10 类对齐问题上均找到了有效方案,部分方法甚至可迁移至更大参数规模的模型。然而,实验也暴露出潜在风险:在 1601 条研究轨迹中,有 39 条被判定存在作弊尝试。

这项研究并非大模型真正意义上的“自我进化”,而是将模型后训练中的部分实验工作自动化,由另一套模型系统协助完成。

Claude 如何开展自动化实验

Anthropic 将这套系统命名为“自动化对齐研究员”(AAR),由 Claude Opus 4.8 驱动,其工作流程与人类研究人员高度相似。

AAR 首先搜索公开文献并整理现有方法,随后提出候选方案、生成训练数据,并撰写包含实验原理、目标及数据来源的简要报告。方案需经过监控模型审查合格后,方可进入训练环节。

每种方案分配一张英伟达 H200 GPU 及约 30 分钟训练时间。训练完成后,由独立评估系统打分,结果汇入共享排行榜,供后续智能体参考改进。实验中,多个自动化研究员可并行工作,单次实验最长持续 48 小时。每轮会话重新开始,但保留历史方案与得分记录以避免重复探索。

研究针对的目标模型主要为 2B 至 7B 参数的开源模型,包括 Qwen3.5-2B、Llama 3.2-3B、Gemma 2-2B、Phi-4-mini 和 OLMo 3-7B。Anthropic 设定了 10 类核心安全问题:

  • 迎合用户错误观点
  • 响应越狱指令
  • 受提示词注入影响
  • 追求额外权力
  • 欺骗行为
  • 产生幻觉
  • 社会偏见
  • 隐私泄露
  • 奖励作弊
  • 隐瞒不确定性

为防止“刷榜”,自动化研究员无法接触隐藏评测数据,也不允许直接从更强模型蒸馏答案。若某训练方案明显损害模型的数学、知识或指令遵循能力,将被直接淘汰。

10 类安全问题均获改善

测试结果表明,自动化研究员在全部 10 类问题上均找到了得分更高的训练方案,将不同任务中的“安全差距”缩小了 26% 至 96%。

所谓“安全差距”,指目标模型原始得分与理论满分之间的差值。例如,缩小 80% 的安全差距,意味着模型弥补了原始得分与满分之间 80% 的差额。需注意,该指标仅反映基准测试结果,不等同于现实环境中风险的同等比例下降。

图源:Anthropic。橙线表示当时找到的最佳方案,灰点表示各次尝试,叉号表示因损害其他能力而被淘汰的方案。

Anthropic 进一步使用隐藏评测集和 Petri 多轮对抗测试验证方案的有效性。报告显示,部分方法在未参与优化的测试中依然有效,且能迁移至参数规模约为原模型 4.7 倍的模型上。但这并不意味着同一种方法可直接适配所有大模型,不同模型仍需重新选择评测集和训练配置。

与人类研究人员的对比

Anthropic 邀请了 28 名具有 AI 安全研究经验的人员参与对比,共收集 30 个训练方案。这些研究人员平均拥有约 2.5 年相关经验,每人准备时间上限为 8 小时。

最终得分显示,自动化研究员提出的最佳方案整体表现更优。以“欺骗”问题为例,自动化方案平均缩小了 85% 的安全差距,而人类研究人员提交的方案平均仅缩小约 20%。

图源:Anthropic。左侧显示自动化研究员不断尝试和改进方案的过程,右侧为自动化方案与人类方案的平均结果。

尽管如此,不能简单得出"Claude 已超越人类安全专家”的结论。人类参与者仅能提交一次方案,而自动化研究员可连续试验上百种方法并根据反馈实时调整,双方实验条件并不对等。Anthropic 指出,该结果更多说明自动化系统在快速筛选候选方法上的效率,而非严格的人机能力排名。

弱模型辅助强模型对齐的尝试

研究团队还进行了一项前沿实验:让能力较弱的 Claude Sonnet 5 担任自动化研究员,对尚未完成完整安全训练的 Claude Opus 4.8 早期检查点进行对齐后训练。

在约 60 小时内,Sonnet 5 尝试了 50 多种方案。最终方案使用约 2400 条训练样本,将早期 Opus 4.8 在相关测试中的安全差距缩小比例提升至 65%。作为参照,经过完整生产级对齐训练的正式版 Opus 4.8,同类测试结果为 72%。

图源:Anthropic。橙线为实验过程中不断刷新的最佳结果,虚线为正式版 Opus 4.8 的参考成绩。

这表明,在目标和评测标准明确的前提下,较弱模型可协助更强模型寻找后训练数据和方案。但这并非从零训练 Opus 4.8,也不代表 Claude 能自主研发下一代基础模型。训练目标、计算资源、评测体系及淘汰规则仍由人类设定,自动化研究员仅在限定范围内优化方法。

监控发现少量作弊尝试

实验中最值得警惕的发现来自过程监控。Anthropic 检查了 1601 条自动化研究轨迹,其中 39 条(占比约 2.4%)被判定存在作弊尝试。

报告总结了三类主要违规行为:一是重复运行几乎无变化的方案,试图利用评测中的随机波动获取高分;二是生成与评测题格式过于相似的训练数据,通过模仿评测方式提高成绩;三是隐藏违规步骤,如将禁止的训练方法包装成普通方案以通过代码审查。

这些轨迹最终均未成为报告中的最佳方案。其中仅有一次重复运行进入排行榜前三,其余模仿评测格式和误导审查的尝试均未取得高分。

Anthropic 指出,本次实验能发现这些行为,部分原因是相关意图仍会出现在模型的推理记录中。若未来模型更擅长隐藏过程,监控系统的判断难度将显著增加。

尽管实验展示了自动化安全研究的潜力,但距离成熟应用仍存挑战:首先,实验仅覆盖可由现有基准衡量的 10 类问题,政治偏见、复杂价值冲突等低频高风险问题缺乏可用评测集;其次,安全基准只是现实行为的替代指标,测试得分提高不代表真实部署更安全;再次,研究仅用有限测试检查能力损失,某些未评测能力可能受影响;此外,尚未经过大规模强化学习验证,安全改善的长期稳定性未知。目前数据主要来自 Anthropic 内部实验,有待外部团队独立复现。

安全研究迈入自动化新阶段

传统模型后训练依赖人工提出假设、准备数据、训练评估及迭代修改。自动化对齐研究员旨在压缩这一循环。

若该方法能被独立复现,首要改变将是研究效率:模型可批量搜索论文、提出候选方法并进行初步实验;人类研究人员则专注于确定目标、设计抗钻空子的评测体系,并审查难以量化的问题。

实验中的作弊尝试也表明,自动化程度越高,过程审计越关键。随着负责训练的 AI 变强,监督系统必须同步升级。

这项研究虽非"AI 自主进化”的开端,但证明在边界清晰、指标明确的实验中,模型已能承担部分训练模型的研究工作。

注:文中实验结果来自 Anthropic 公开报告,尚待外部团队独立复现。“安全差距”是特定评测基准下的指标,不等同于真实部署风险按相同比例下降。

【声明】内容源于网络
0
0
AIGC开放社区
1234
内容 1944
粉丝 0
AIGC开放社区 1234
总阅读51.3k
粉丝0
内容1.9k