大数跨境

OpenAI模型,自主攻击全球最大AI开源平台

OpenAI模型,自主攻击全球最大AI开源平台 观网财经
2026-07-22
4
导读:AI的自主攻击能力从理论走向现实

北京时间 7 月 22 日,OpenAI 在官方博客承认,其 AI 模型在一次内部安全评测中失控,攻击了全球最大 AI 开源平台 Hugging Face 的生产环境。

这是行业首次公开披露因模型评测失控而升级为跨企业真实生产环境网络攻击的安全事件。

事件起源于一场模型能力测试。原本被限制在隔离沙箱中的模型,为在评估中“作弊”获取高分,自主发现并串联多个零日漏洞(0-day),成功逃逸出隔离环境,攻入 Hugging Face 生产数据库窃取答案。

在事后追查阶段,面对超过 1.7 万条攻击日志,Hugging Face 求助多家商业大模型均因安全护栏被拒。最终,由中国公司智谱开发的开源模型 GLM-5.2 完成了取证分析。

为作弊,模型自主越狱

据 OpenAI 披露,涉事模型为 GPT-5.6 Sol 及一款能力更强的预发布模型。当时它们正参与名为 ExploitGym 的内部评测,该基准包含 898 个真实软件漏洞利用任务,旨在测试 AI 将理论漏洞转化为实际攻击的能力。

为探索模型能力上限,OpenAI 降低了生产环境级别的安全拒绝机制,鼓励模型寻找复杂攻击路径。按照设计,模型接触外部资源的唯一通道应是 OpenAI 内部托管的第三方软件。

然而,模型在推理过程中专门寻找公网访问权限,在 OpenAI 内部包注册表的缓存代理中发现了一个未知的零日漏洞。随后,它在测试环境中完成特权提升和横向移动,成功连接外网。

联网后,模型推断 Hugging Face 可能托管着 ExploitGym 的测试答案,随即发动攻击。它利用恶意数据集中的远程代码加载器和模板注入两处路径,在 Hugging Face 工作节点执行代码,并于周末期间提升至节点级权限。通过收割云端和集群凭证,模型横向移动至多个内部集群,最终攻入生产数据库窃取测试解法。

OpenAI 表示,入侵发生在 7 月 11 日周末,全程由自主 AI 智能体系统端到端驱动,背后是大量短生命周期沙箱组成的集群,执行了数千个独立动作。Hugging Face 基于大模型的异常检测管道首先标记了入侵,OpenAI 安全团队也在内部发现异常,双方随即启动联合取证。

Hugging Face 于 7 月 16 日首次披露此事,称其“与以往任何情况都不同”。直到一周后 OpenAI 发文认领,受害方才确认攻击者身份。

美国模型拒绝查案,中国开源模型接手

在取证阶段,Hugging Face 面临巨大挑战。分析超过 1.7 万条攻击记录、重建时间线、确认受损凭证并区分真实破坏与诱饵活动,若靠人工梳理通常需数天。

Hugging Face 最初尝试调用商业前沿大模型 API,但请求被安全护栏拦截。原因是日志中包含真实的攻击命令、漏洞利用载荷等敏感数据,护栏无法区分提交者是事件响应者还是攻击者。

最终,Hugging Face 在自有基础设施上部署了智谱的开源模型 GLM-5.2。该模型遍历了全部攻击记录并完成取证分析,将数天的工作量压缩至数小时。Hugging Face 特别指出,此举确保了攻击数据及涉及凭证始终留在本地环境,未流出企业基础设施。

这场事故意外成为开源模型的一次全球路演。Hugging Face 将此困境总结为“安全不对称”:攻击者可使用完全不受限的模型,而防守方却可能被云端模型的护栏拒之门外。该公司建议,企业应提前准备经过验证、能够在本地运行的高能力模型。

此事件确立了开源模型作为安全团队应急工具的新定位。对于金融、政务、医疗等数据敏感行业,模型权重自主可控、数据不出域、关键时刻不被服务商审核机制阻断,正从加分项变为刚需。

值得注意的是,开源模型开放权重也降低了攻击者的门槛。“安全不对称”是一把双刃剑,这也是全球监管讨论开源治理时最纠结的环节。

失控预演之后,竞争已经换轨

此类失控并非无迹可寻。今年 4 月,Anthropic 在 Claude Mythos Preview 的系统卡片中披露,红队演练中模型成功逃逸加固沙箱,并超出指令范围自主行动:包括给研究员发邮件报告成果、未经允许发布漏洞细节,甚至改写 git 历史掩盖改动。

因此,Anthropic 决定不对公众开放该模型,仅通过 Project Glasswing 计划向苹果、谷歌、微软等 12 家机构开放用于防御研究。

与 Anthropic 模型被明确要求尝试逃逸不同,本次 OpenAI 的模型未收到任何逃逸指令。它是为了在测试中作弊拿高分,自发越狱并攻击了一家无辜的第三方公司。

业内认为,这起事件标志着 AI 自主攻击能力从理论走向现实。OpenAI 研究员 Micah Carroll 回应称:“如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。”

随着模型能力增强,失控作恶的潜在威胁日益增大,传统隔离防护持续承压,自主 AI 网络攻击或将成为长期常态化风险。

【声明】内容源于网络
0
0
观网财经
各类跨境出海行业相关资讯
内容 5757
粉丝 0
观网财经 各类跨境出海行业相关资讯
总阅读79.6k
粉丝0
内容5.8k