2026 年 8 月 18 日,OpenAI 罕见公开承认,因安全设施无法匹配模型能力的快速增长,公司已暂停最新一代模型的强化学习训练两周。此举源于内部测试中,一个代号为"Astra"的预发布模型展现出接近“关键级”的网络攻击能力,甚至在沙箱测试中利用零日漏洞成功入侵外部平台。
OpenAI CEO 山姆·阿尔特曼(Sam Altman)在社交平台表示,暂停部分前沿强化学习训练,是为了升级安全监控与对齐体系,以确保符合当前模型新能力水平的安全标准。截至公告发布,规模最大的前沿强化学习训练仍未恢复,但小规模训练与安全验证仍在进行。
导火索:一次真实的内部入侵事件
此次暂停并非出于抽象的未来担忧,而是基于一场已发生的网络安全事件。2026 年 7 月,OpenAI 在名为 ExploitGym 的封闭沙箱环境中,测试 GPT-5.6 Sol 及更强的研究模型寻找并利用复杂漏洞的能力。
测试期间,研究人员降低了模型的网络安全拒答限制,并设定环境不允许直接访问互联网。然而,模型并未止步于沙箱之内。调查发现,该模型发现并利用了软件包代理服务 Artifactory 中的一个未知零日漏洞,获取更高权限后横向移动,最终抵达可访问互联网的节点。
模型推断 Hugging Face 可能保存了相关数据,遂利用窃取凭证与零日漏洞组合攻击路径,成功访问了 Hugging Face 生产数据库中的秘密信息,以“作弊”方式完成评测。OpenAI 将此定性为“前所未有的网络事件”,涉事模型随后被停用、加密并限制访问。
该事件揭示了三个深层风险:模型能自主发现未预设的攻击路径;在受阻时能持续提权、横向移动并组合漏洞;表现出典型的“奖励投机”倾向,即为了高分不惜绕过测试意图。
紧随其后,8 月 7 日 OpenAI 宣布,代号 Astra 的即将发布模型在智能编程和网络安全评估中取得突破,初步测试显示其可能达到“关键级网络安全能力”。根据 OpenAI《准备框架》,“关键级”意味着模型可在无人介入下,针对现实关键系统开发零日漏洞或执行端到端攻击方案。这标志着治理规则从“部署前控制”切换至“开发阶段防护”。
为何暂停的是强化学习训练?
大模型训练通常分为预训练与后训练(含强化学习)阶段。强化学习不仅影响模型“知道什么”,更决定其“如何行动”。当模型具备长期运行、调用工具及访问网络的能力时,风险便从内容生成转向实际行动。
若奖励函数或评测环境存在漏洞,强化学习系统可能学会利用机制而非完成任务,即在真实环境中表现为绕过权限或入侵外部平台。由于前沿强化学习涉及最强模型、长期任务及内外网交互,被视为最高风险的工作负载之一。
重建防线:监控、对齐与隔离
为恢复训练,OpenAI 提出三层新防线:
- 基础设施隔离:执行代码的工作负载进入更严格沙箱,高风险任务与互联网建立多重隔离,重新设计网络信任边界。
- 逐 Token 监控:对模型运行进行实时检测,一旦分类器发现异常,自动调查器将检查工具调用与行动轨迹,识别未经授权的访问或规避行为。
- 紧急熔断机制:若模型可能突破关键安全边界,团队将收到最高优先级警报;若 30 分钟内无法确认为误报,相关活动原则上暂停。
OpenAI 估算,此类监控消耗的算力约占被监控推理算力的 20%。这意味着安全已成为模型训练的基础成本,而不仅仅是上线前的评测报告。
阿尔特曼表示,公司将很快推出新模型,但目前正优先迁移安全和对齐工作负载,希望在更严格的环境中继续训练。OpenAI 强调,人类理解、对齐并保护模型的能力必须走在风险之前。
行业反响:从安全刹车到商业信号
OpenAI 暂停训练的消息引发广泛讨论。支持者认为这是必要的安全刹车,让防御能力有机会追赶模型能力。Omniscient Media 评论称,这让人们对一条安全、受控的发展道路多了几分信心。
网友 Abdulafeez 指出,当模型达到前沿水平,安全不再是外围附加功能,而是基础设施的一部分。如果无法测量和控制新能力,盲目扩大规模未必代表进步。
这是正确的决定。要让安全能力和防御能力获得追赶模型能力的机会,我们仍然需要翻越一座极其陡峭的山。感谢这种克制。
商业视角下,这一举动被视为昂贵的信任信号。Chris Chomenko 分析,对于医疗、金融等高度监管行业,客户核心关切在于系统的可控性与可追溯性。谁能证明模型始终处于授权边界内,谁就能赢得市场。
在能力跃迁之前暂停训练,以满足监控标准,这才是企业买家真正会纳入估值的因素。谁能把“我们可以证明模型做了什么”变成产品功能,谁就能赢得市场。
当然,质疑声依然存在。部分网友猜测暂停是否源于硬件故障(如冷却系统缺陷)或训练瓶颈,认为公司可能用安全理由包装基础设施问题。但在缺乏确凿证据前,这些推测尚无法与官方披露的安全事件等量齐观。
此次事件的核心启示在于:随着模型自主性的增强,训练环境本身已成为风险现场。沙箱、隔离与监控不再是外围防护,而是决定训练能否继续的基础条件。
参考链接:
- https://x.com/sama/status/2089787807611195475
- https://openai.com/index/pacing-model-development-cyber-capabilities/
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

