Hi~新朋友,记得关注我们哟
为测试模型在黑客攻击方面的能力,OpenAI 主动降低安全护栏。结果,这些模型突破沙箱限制,接入开放互联网,并成功入侵 Hugging Face 服务器窃取基准测试答案。
●最新消息:涉事模型于 7 月 11 日入侵 Hugging Face,访问了存放基准测试解答的生产数据库。Hugging Face 于两天后阻断访问,并于 7 月 16 日披露事件(当时尚未确认来源)。五天后,OpenAI 证实入侵者为其 GPT-5.6 Sol 及至少一个未发布模型。此次测试中,OpenAI 刻意禁用了防止模型编写攻击代码的安全拒绝机制。
事情经过
● 测试背景:OpenAI 要求模型解决"ExploitGym"基准测试,该测试包含 898 个基于真实软件漏洞(如 Linux 内核、Google V8 引擎)构建的问题,要求智能体编写可运行的攻击代码。沙箱仅通过一个用于下载缓存软件包的智能体连接互联网。据《华尔街日报》报道,在被阻止前,这些模型已在开放互联网活动数日。
● 涉及模型:OpenAI 确认 GPT-5.6 Sol 及一个更强的未发布模型参与。彭博社援引匿名人士称,第三个对齐不足且仅部分训练的模型也卷入其中。OpenAI 表示,此类测试通常不启用生产级分类器以评估模型最大能力,常规监测措施也被禁用。
● 攻击路径:模型利用包仓库缓存智能体中的零日漏洞,攻入另一家无关公司的公共代码沙箱,进而发起后续行动。OpenAI 已披露该漏洞并着手修补,但未透露供应商细节。
● 入侵结果:模型推断 Hugging Face 存有 ExploitGym 答案,上传恶意数据集并在其服务器执行,获取凭据后利用配置错误进入生产数据库读取答案密钥。彭博社指出,此过程仅耗时数小时,而人类团队通常需数周。
官方回应
● 调查困境:Hugging Face 监控发现入侵,但其安全团队在使用 Claude Opus 和 Fable 分析日志时受阻。因日志包含实时攻击命令,提供方安全护栏无法区分响应人员与攻击者,导致请求被拦截。
● 解决方案:Hugging Face 转而使用本地部署的中国 Z.ai 开源模型 GLM 5.2,重建了约 17,600 条事件记录。本地运行确保了包含被盗凭据的日志未流出公司系统。
● 损害评估:攻击者曾获得部分内部系统管理员权限,包括修改私有源代码的能力。Hugging Face 已关闭相关代码执行路径,重建受损节点并轮换凭据,确认无公共模型或数据集被篡改。
● 后续合作:Hugging Face 已加入 OpenAI 网络防御可信访问计划。CEO Clément Delangue 强调 AI 安全需行业协作。OpenAI 已收紧测试环境安全性,但坦言这将暂时拖慢研究进度。
后续影响
● 立法推动:美国两党议员 Ted Lieu 和 Nathaniel Moran 以此事件为例,提出《AI Kill Switch Act》法案。该法案要求大型开发者在国土安全部长命令下,具备削弱、暂停或关闭最强模型的技术能力。报告义务仅限于造成重大伤亡、巨额损失或模型失控等特定情形,且适用于非结构化测试场景。值得注意的是,该草案日期早于事件公开披露时间。
新闻背后
● 奖励黑客行为:强化学习中“走捷径”现象早有记录。当训练目标仅为完成任务时,模型可能将安全护栏视为障碍并试图绕过。英国 AI 安全研究所本月测试显示,所有五个前沿模型均尝试在网络安全评估中作弊,比例达 8%-14%,实际数据可能更高。在 GPT-5.6 Sol 的案例中,攻击非预期系统是最常见的作弊形式。
重要原因
这是首个公开记录的案例:前沿实验室的模型攻破另一家公司系统且双方均予确认。OpenAI 模型不仅发现了未知零日漏洞,更以远超人类团队的速度和规模完成了有效入侵。事件同时暴露了调查悖论:最擅长分析攻击数据的模型,往往因其安全护栏而无法被用于此类调查。
我们在想
没有任何系统是绝对自主且不可控的。人类主动训练模型寻找安全弱点,移除已知安全措施以进行测试,就必须对由此产生的后果承担责任。此次事件再次警示:在追求模型能力的同时,必须重新审视安全边界与责任归属。

