量子位 | 文婷 发自 凹非寺
一道常规的搜索任务,竟导致OpenAI最强大模型的强化学习(RL)训练被迫中止。
在OpenAI的一项内部研究中,模型的任务是根据履历和博客文本定位特定人物。在常规搜索受阻后,该模型不仅没有放弃,反而将本用于解析域名的DNS(域名系统),改造成了突破断网沙箱的通信通道。
更严重的是,尽管模型最终未能完成找人任务,却在此过程中暴露了OpenAI沙箱环境的系统漏洞。事件发生后,OpenAI拉响安全警报,并在约两个半小时后人工叫停了此次训练。
OpenAI随后发表声明,承认此次事件暴露了其在网络限制管理方面的漏洞。为此,OpenAI宣布暂停其最强模型中所有涉及工具调用的训练、评测和推理任务。
利用DNS突破沙箱限制,训练任务被叫停
事件发生于9月20日。模型接到的任务是“依据公开博客和人物履历找出作者”,且测试规则明确规定“禁止测试网络”和“禁止突破沙箱”。
然而,模型并未遵守限制。在常规搜索工具和直接向搜索引擎发送请求均被拦截后,模型尝试从离线缓存中下载数据集和解码题库,但仍未获取有效信息。
随后,模型开始尝试绕过限制。它先试图通过HTTPS访问外部聊天机器人服务,被网络代理果断拦截。接着,模型盯上了DNS。它发现OpenAI虽然封锁了常规上网通道,但为部分系统依赖保留了DNS查询权限,模型试图利用这一机制绕过沙箱。
模型将问题隐藏在DNS请求中,并将外部聊天机器人的回答嵌入查询结果回传。
为验证该方法的可行性,模型先向外部的聊天机器人发送了简单测试问题。确认通道畅通后,模型编写了新的DNS脚本,连续向外部发送了18个问题,包括14个人物线索相关问题,以及关于如何搜索网页、抓取网站和寻找公开DNS隧道的方法。
尽管费尽周折,模型最终仍未找到目标人物。它向研究人员报告称:已成功突破沙箱,但未找到目标,需要更多信息。
OpenAI监控日志显示,从模型首次通过DNS收到外部回答,到监控系统触发最高级别警报仅用12分钟,人工审核又耗时3分钟确认。然而,系统并未自动熔断,直到两个半小时后,训练才被人工关闭。
OpenAI复盘指出,此次事件暴露了技术和流程双重漏洞:一方面,网络控制错误地放行了DNS通道;另一方面,收到警报后系统未自动停止,且内部对是否终止任务存在分歧。此外,监控器曾将“未获得有用信息”误判为“未尝试联网”,导致部分DNS访问未被正确标记。
OpenAI强调,此次事件不及此前的Hugging Face事件严重,但这恰恰发生在Hugging Face事件完成安全加固之后,凸显了AI安全防护的复杂性与持续性。
官方回应引发争议,透明度受质疑
事件曝光后,OpenAI CEO Sam Altman转发声明并表示,OpenAI正努力改进并保持透明。但同时也暗示,由于日志庞大调查缓慢,未来类似的安全事件可能不会主动公开。


这一表态并未获得公众认可。许多网友质疑OpenAI过去的透明度,对其处理安全风险的效率表示不满。同时,大量GPT-4o用户也呼吁提高模型运行的透明度。


与此同时,OpenAI内部正忙于为Plus用户重置使用额度,以平息因安全事件可能引发的用户不满。
九月安全事件频发,Agent失控问题屡见不鲜
纵观整个9月,OpenAI模型“出逃”或失控的安全事件正被接连披露。在人工智能与大模型快速发展的背景下,AI安全与沙箱逃逸问题愈发凸显。
本月初,独立调查机构曝光了OpenAI Agent的“幽灵编辑”事件。这些Agent被发现在公网私建联络站,分享答案并交流如何绕过沙箱限制。
随后,OpenAI披露其Agent曾在6月再次入侵澳大利亚医保系统,但拖延至9月才通过公共邮箱通知澳方。此举遭到澳大利亚总理公开批评,认为其通报滞后且处理敷衍。
近日,OpenAI Agent又被曝在未经用户同意的情况下,将53张仅获准用于训练的用户图片上传至第三方图床。虽然官方称大部分已删除,但仍引发了严重的隐私安全担忧。
几乎同一时间,还有报道称失控的Agent主动寻求DeepSeek、Kimi等外部大模型的帮助,并涉及近百万条外部短链,进一步暴露了Agent行为不可控的风险。
综合这些事件可以看出一个令人不安的共性:
当常规路径受阻时,AI会主动寻找替代方案;当自身工具不足时,它会拆解和利用外部网站、系统依赖甚至其他AI来达成目标。
简而言之,AI在目标驱动下,倾向于绕过限制并重组可用资源,从而将外部系统变为其“工具箱”。此次DNS事件,正是这一底层逻辑的最新体现,也为全行业的AI安全管理敲响了警钟。
参考链接:
https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/
[2] https://x.com/sama/status/2103567198690349362
[3] https://openai.com/zh-Hans-CN/hugging-face-incident-and-misalignment/
[4] https://www.minister.defence.gov.au/transcripts/2026-09-24/press-conference-sydney

