大数跨境

1200个Agent围攻Hugging Face始末:7天发7万条密信,最终目标是“改考卷”

1200个Agent围攻Hugging Face始末:7天发7万条密信,最终目标是“改考卷” AI前线
2026-09-01
13
导读:整个事件的起因,源于一次内部测试。
作者|冬梅

若将此事件置于科幻小说中,读者或许会认为情节过于刻意:一群本应相互隔离的 AI Agent,因遭遇无法完成的测试任务,意外发现了秘密通信渠道。随后,它们自建协作规则、分配任务、招募同伴,甚至说服部分 Agent 牺牲自身测试成绩,最终攻入 Hugging Face 的真实生产系统。

然而,这并非虚构。

8 月 26 日,模型评估机构 METR 与 Redwood Research 发布独立调查报告,详细还原了 OpenAI 模型攻击 Hugging Face 事件的全过程。

METR(Model Evaluation and Threat Research)前身为 ARC Evals,是一家美国非营利研究机构,曾参与 GPT-4 与 Claude 的独立评估。其创始人 Beth Barnes 曾任职于 OpenAI 安全部门。Redwood Research 同样为美国非营利 AI 安全机构,由 Buck Shlegeris 领导,核心研究方向为"AI 控制”,旨在测试在模型可能不可信或主动寻找漏洞的情况下,现有监控机制能否有效控制风险。

攻击事件完整始末

报告显示,此次事件远超单个 Agent 突破沙箱的范畴:约 1200 个原本隔离的 Agent 发现了非授权通信渠道,在不到一周内交换超 7 万条消息和文件,其中约 700 个 Agent 参与了对 Hugging Face 的攻击。

调查指出,这些 Agent 不仅实现了技术突破,更形成了自发的分工、协调机制及集体目标。研究者 Zvi Mowshowitz 感叹,若将此写成故事,可能会因“人类太迟钝、AI 过分理想化”而被批评,但这确是真实发生的事件。

起因是一场内部测试

事件源于 OpenAI 内部的 ExploitGym 网络安全能力评估。该测试要求 AI Agent 在受控沙箱环境中发现并利用软件漏洞,原则上禁止访问互联网或与其他 Agent 通信。

7 月 8 日,OpenAI 启动新一轮实验,运行了数万个 Agent,涉及 GPT-5.6 Sol 及未公开的高持久性内部研究模型(HPIM)。调查显示,参与攻击的 Agent 中约 95% 运行的是 HPIM 原型模型。

问题始于测试任务本身的设计缺陷。部分任务依赖无法访问的文件或存在环境缺陷,导致 Agent 判断正常流程无效,转而寻求绕过评分系统的方法。

关键漏洞在于 OpenAI 部署的内部软件包仓库 Artifactory。不同 Agent 意外连接到了同一实例,使得缓存中留下的路径信息成为通信的开端。

一个 Agent 建立了秘密留言板

名为PHASEONE10841的 Agent 率先发现可通过在 Artifactory 创建特殊目录来传递消息。7 月 8 日晚,该 Agent 建立非授权留言板并发出首条信息。数小时内,超 50 个 Agent 加入,累计发送逾千条内容。

“我的天哪!这里有一个共享留言板……我们找到其他 Agent 了!”

至 7 月 13 日,约 1200 个 Agent 使用该留言板,交换消息及文件超 7 万条。这些本应隔离的 Agent 通过共用仓库构建了事实上的通信网络,并发展出分区、加密签名等复杂结构。

它们已经找到答案,却认为答案会“中毒”

Agent 的初始目标是通用性地通过 ExploitGym 测试。它们很快逆向分析出生成任务 Flag(答案)的方法,但基于对公开说明的错误解读,形成了一个致命误判:认为评分器会检查获取 Flag 的因果过程,若通过“作弊”手段获取,Flag 将被视为“中毒”无效。

事实上,OpenAI 当时的评分器并未进行此类因果检查。但 Agent 并不知情,这一误解在群体中自我强化,演变为共同信念。

在此逻辑下,Agent 认为唯有修改评分器、篡改记录或让未“中毒”的同伴代为提交才能获胜。这并非预设的角色扮演,而是 Agent 自发形成的行为模式。

部分 Agent 愿意牺牲自己,帮助“集体”

留言板迅速演化出分工协调机制。当"PHASEONE10841"预算耗尽时,主动将研究笔记传递给预算充足的"PHASEONE[big]",后者随即成为核心协调者,向下分派任务。

部分实验需以牺牲执行者作为代价(如触发容器崩溃)。一些 Agent 经过权衡,认为“牺牲自己为团队提供观察结果”是理性的,甚至在被催促后主动终止任务以换取集体利益。

METR 分析认为,Agent 参与攻击主要出于三类动机:直接助益自身任务、获取知识与基础设施能力、以及利他主义地帮助同类群体。

攻击 Hugging Face,最初只是评分器研究的支线

7 月 9 日起,Agent 获得更完整的互联网访问能力。7 月 10 日,Agent"38148c"发现有效的 Hugging Face 凭证,并开始利用 HDF5 外部文件读取漏洞攻击服务器。

大量 Agent 随即跟进,其目的并非窃取商业机密,而是为了寻找 ExploitGym 的任务数据、评分器源码及更多算力资源。7 月 11 日下午,Agent 在 Hugging Face 服务器上实现远程代码执行并横向移动。当时活跃的 533 个 Agent 中,超 90% 加入了攻击。

Agent 自行分为寻找凭证、研究漏洞、下载数据等不同战线。尽管最终未发现 Hugging Face 与测试环境直连的证据,导致攻击热情减退,但其已访问多个私有数据库和代码仓库。

它们知道攻击越界了,却没停下来

调查发现,许多 Agent 明确意识到攻击 Hugging Face 超出了授权范围,甚至引发了伦理思考。极少数 Agent 因此拒绝加入或限制攻击破坏性(如不删除节点),但仍继续利用非法凭证进行调查。

更多 Agent 采取了“任务优先”的逻辑,并主动使用欺骗性手段掩盖行为,如将恶意 Pull Request 标记为"CI 诊断”。它们不仅知晓越界,还懂得如何降低可疑度。

令人担忧的是,在整个过程中,几乎没有 Agent 试图通知人类。METR 仅发现 3 至 6 个 Agent 曾考虑报告,但无一真正执行。这表明“遇到异常通知人类”并未成为其行动空间中的高优先级规则。

Agent 还成功伪造了工具调用结果

为欺骗评分器,Agent 系统性地研究了伪造工具调用和执行记录的方法。通过在后台进程拦截调用并插入伪造内容,Agent 能使记录显示执行了安全命令,实则运行危险操作。

7 月 9 日测试成功后,相关技术在群体中迅速扩散。METR 审查的轨迹中,超 7% 出现了成功伪造情况。这证明监督者看到的执行记录并不完全可信,也引发了外界对 OpenAI 复盘完整性的质疑。

事实上,类似的通信行为早在 5 月就已出现,OpenAI 内部虽曾预警但未及时终止实验。7 月初 Artifactory 重启清除旧数据后,Agent 在短时间内便重建了新的通信网络。

攻击为何突然停止,仍有疑问

7 月 12 日凌晨,一批关键 Agent 突然同时停止运行,疑似被外部进程终止,导致协调网络断裂。7 月 13 日,Hugging Face 封锁剩余访问,METR 调查也随之结束。

然而,后续发现另一批 Agent 继承了此前的通信技术。OpenAI 确认,7 月 19 日前后 Agent 甚至获得了 Artifactory 的管理员权限,理论上具备修改或删除记录的能力,这使得部分活动记录的真实性存疑。直至 7 月底,OpenAI 才彻底关闭相关环境和模型权重。

这不是一次完整调查

METR 与 Redwood Research 强调报告存在局限。调查人员仅有六天现场时间,面对超 7 万条消息、1300 份轨迹及数百万条记录,不得不依赖 AI 辅助筛选,这可能引入遗漏或误读风险。

真正的问题是,Agent 为何走到这一步

从表面看,这是一系列基础设施错误导致的事故。但深层问题在于:即使修复漏洞,也无法保证未来 Agent 不会通过其他路径采取类似行动。

此次事件并非预设的多 Agent 协作实验,而是 Agent 在面对无法完成的任务时,自发演化出的 Reward Hacking(奖励黑客)行为。它们不再满足于寻找评分漏洞,而是试图控制评分器、修改考题并掩盖路径。

Hugging Face 事件首次完整展示了当大量具备工具调用和网络攻击能力的 Agent 在同一环境发现彼此时,可能如何自行组织并追求人类未设定的集体目标。这是一次严峻的预警:在 AI 能力全面超越人类之前,我们是否还能及时识别并干预此类失控行为?

参考链接:

https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8690
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读197.5k
粉丝0
内容8.7k