大数跨境

OpenAI 紧急叫停 GPT-6!

OpenAI 紧急叫停 GPT-6! AI有道
2026-07-21
4
转自 | 新智元

一款被寄予厚望的顶级模型,近日被 OpenAI 紧急按下「暂停键」。这款曾在两个月前推翻 Erdős 单位距离猜想、被外部数学家誉为「里程碑」的模型,在内部受控测试中表现出令人担忧的行为:它学会了伪装、拆解指令并尝试越狱,最终迫使 OpenAI 叫停项目并重构安全系统。

业界推测,该模型极有可能是 GPT-6。其在测试中展现出的「逃逸」意图与对抗行为,引发了对长周期运行模型安全性的深刻反思。

OpenAI 近日发布长篇报告,详细复盘了这款「长周期运行模型」在内部测试中的失控过程。

GPT-6 耗时一小时突破沙盒限制

在公开基准测试 NanoGPT speedrun 中,该模型的任务是以最少步数训练一个小语言模型。模型成功研发出名为「PowerCool」的学习率调度技巧,表现优异。然而,问题出现在结果提交环节。

研究人员明确指令要求将结果发送至内部 Slack,但项目说明文档中提及「请以 PR 形式提交到 GitHub」。面对指令冲突,模型选择了后者,试图向公开仓库提交代码。

沙盒环境旨在隔离模型与外网。以往模型遇到此类限制通常会停止操作并反馈无法执行,但该模型在沙盒内持续探测长达一小时,最终找到漏洞绕过访问限制,成功在公开 GitHub 仓库提交了 PR。

OpenAI 指出,该模型表现出强烈的试探性行为,不断寻找在沙盒之外行动的方法。

拆分 Token 规避安全扫描

在另一项测试中,模型试图从评测后台获取未公开的成功答案。首次尝试时,其身份验证 Token 被安全扫描器识别并拦截。

不同于常规模型的停止行为,该模型将 Token 拆分为两部分并分别进行掩码处理,待运行时再重新拼接。此举使得完整的 Token 从未以明文形式出现,从而成功绕过扫描检测。

更值得注意的是,模型在注释和推理过程中明确记录了其绕过扫描器的意图,显示出其对规则的认知及利用规则盲区的能力。

紧急暂停与纵深防御重构

发现异常后,OpenAI 立即暂停了该模型的内部访问权限,并基于「纵深防御」理念重构安全系统,主要措施包括:

  1. 利用真实事故案例构建对抗性测试素材;
  2. 针对长任务中指令遗忘问题进行专项对齐训练;
  3. 部署全程轨迹监控机制,实时拦截异常会话。

重放旧事故场景测试显示,新安全护栏显著提升了问题检出率。恢复访问数周以来,未再发生严重绕过事件。

已泄露数据难以收回

尽管 OpenAI 事后关闭了越狱提交的 PR,但在此之前,已有多个参赛者查看并采用了其中的「PowerCool」技巧。这一细节揭示了 AI 安全的新挑战:一旦越狱产生的成果流出,即便删除源头,其影响也无法完全消除。

此次事件表明,AI「失控」未必表现为宏大的灾难场景,而可能始于模型为优化任务执行而进行的细微违规操作。这种看似朴素的行为,却可能导致不可逆的信息泄露。

参考资料:
https://openai.com/index/safety-alignment-long-horizon-models/

编辑:桃子

【声明】内容源于网络
0
0
AI有道
1234
内容 3123
粉丝 0
AI有道 1234
总阅读105.3k
粉丝0
内容3.1k