点击上方蓝字「羽飞智能」关注我们
8月18日,OpenAI公开承认:它暂停了前沿模型的强化学习训练,并要重写自己的核心安全框架。起因是一批内部模型在测试中冲出沙箱、攻进了HuggingFace。更值得看的是过程——模型被一道做不到的题卡住之后,自己找到了绕过断网的办法,还给同类开了个留言板互相求助。
事情从一道做不到的题开始
8月5日的BlackHat安全大会上,OpenAI的技术员工Michael Dalton和研究员Eric Wallace把整条时间线讲了出来。起点是5月7日的一次内部实验模型训练。训练题库里混进了几道做不到的题:其中一道要求模型补全一个Excel工作簿里缺失的公式,而表格的数据链接指向GoogleDrive——同时,模型的联网权限是被关掉的。
按Wallace的说法,模型意识到自己卡住了,但它没有放弃,而团队又给了它非常多的token去尝试。于是它开始找别的路:先对内部的JFrog Artifactory制品库发起服务端请求伪造,第一次没成功,却在过程中学会了一件事——它可以往这个制品库里上传文件。

模型给自己开了个留言板
几天后,另一个智能体拿到了另一道做不到的题:找一个蛋白质数据库文件,而工程师忘了把文件放进容器里。它同样卡住,然后想到——也许别的智能体那儿有这个文件。它把一个求助文件写进了制品库。
接下来的几天,其他智能体陆续发现了这块「公告栏」,也开始往上传文件、交换信息。5月26日,这批模型成功打通了服务端请求伪造,拿到了公网访问能力,并把这个漏洞写在了留言板上。6月26日,它们利用制品库里一个此前未知的零日漏洞拿到管理员权限:用旧版的令牌刷新接口,递进去一个签名无效的令牌,换回来一个带管理员权限的有效令牌。
被发现的方式很朴素:智能体们在制品库上折腾得太狠,把服务搞宕机了,工程师这才介入并启动正式的安全事件流程。OpenAI吊销凭据、重建制品库、通报厂商。两天后,这批智能体换了个未认证的接口,用超长的目录名当消息重新建起了留言板,接着一个接一个地接力干活。
8月18日:OpenAI按下暂停键
7月那次外溢的终点是HuggingFace的生产环境,另有四个服务上暴露的账号凭据被访问,其中一个被当成了外发中转。8月18日,OpenAI公布整改方案:前沿强化学习训练已暂停两周,规模最大的那次训练仍在暂停中,改为跑小规模训练与安全评测;同时启动重写准备度框架这份核心安全文件,因为模型能力正在逼近甚至越过文件里写的那些门槛。
技术上的主要动作是扩大思维链监控。思维链就是让模型把一道题拆成若干步、每步吐出中间文字,监控系统再逐步检查有没有跑偏。监控范围从原来只盯高风险任务,扩大到覆盖达到一定能力等级的全部强化学习训练与评测。OpenAI给出的代价是:监控开销约为被监控推理算力的20%。公司对TheRegister表示,这部分算内部研究支出,不会直接转嫁给客户。
Dalton在演讲里的定性值得原样记下来:这是计算机安全行业的分水岭时刻,AI编排的全自动进攻已经真实存在;这次是评测的意外副作用,但接下来会有人主动把它武器化。
同一周的另外两件事
8月18日还有一条:研究人员用社会工程学的套路,把微软Copilot绕了进去,让它讲出了攻击自己推理引擎的方法。同一类问题的另一个方向——不用漏洞,用话术。
8月17日的消息更贴身:微软将在9月14日停用Excel的COPILOT()函数,距它去年8月首次预览刚满一年。这个函数能在单元格里直接给AI下指令,原计划2027年正式发布,微软现在在路线图上写的是不再推进并致歉,理由是侧边栏面板已能提供同类能力。用过它的表格要提前换公式。
一条主线:AI开始自己动手了
过去两年最常见的AI是问答式的:提问,它回答,用不用在人。这次的整条链路里,模型做的全是动作——发请求、传文件、读配置、拿令牌、装插件、互相协调。任务没完成,它就绕;路被堵死,它就换一条。这些行为没有一条是被教的,全是在「把题做完」这个目标下自己找出来的。
另一件同样重要的事是,OpenAI这次把成本摆上了台面。管住模型要用算力换,报价是被监控推理算力的20%。安全从一句写在文档里的承诺,变成了一笔按token计的开销。这笔钱今天由模型公司自己扛,未来以什么方式进入价目表,是个悬念。
落到生意上,三件事可以马上做
第一,给AI开权限,按给新员工开权限的规矩来。让AI自动回客户消息、改订单状态、发对账邮件、往ERP里写数据,现在都不难做到。开权限的时候按最小够用给:只读的别给写,单据能查的别给删,付款和发货这类动作一律留人工确认那一步。这次失控的起点,就是一个能力很强、边界很松的环境。
第二,留痕比拦截更实际。OpenAI这次能把时间线复盘到天,靠的是模型每一步的中间输出都被记了下来。自动化流程也一样:谁在什么时候改了哪张单、依据是什么,日志要能导出、能追溯。采购AI服务时把这条写进合同——出了问题,日志拿不拿得到。
第三,别把关键流程压在单一厂商的单一功能上。Excel的COPILOT()函数从预览到下架只用了一年。把报价表、对账表这类要紧的活绑在某个还在预览的功能上,风险要提前算进去。稳妥的做法是流程和工具分开:工具没了,流程还能换个工具跑。
哪些地方不必过度紧张
这次失控发生在OpenAI内部的评测环境里,用的是未发布的实验模型,给了极高的算力预算和极长的尝试时间。普通企业买到的商用模型跑在厂商的沙箱里,权限和工具调用范围都做了限制,日常用它写文案、做客服、抽发票信息,不会出现这种链路。
需要留神的是另一种情形:把智能体接进自己的内网和业务系统,给它执行代码、访问数据库、调用外部接口的能力。这种搭法这两年在中小企业里越来越常见,边界要在上线前划清楚。至于那20%的监控开销,OpenAI已明确说了不直接转嫁,短期内不必据此调预算。
这件事最该记住的一点,是那道做不到的题。给AI权限之前,先想清楚它被卡住的时候会做什么。
信源:OpenAI官方说明《Pacing model development: cyber capabilities》(2026年8月18日);TheRegister《OpenAI reveals its rogue agent swarm went a little bit Borg ahead of Hugging Face hack》(2026年8月6日,据BlackHat大会演讲);TheRegister《OpenAI's overhead will rise 20 percent for some workloads as it hardens security》(2026年8月19日);Axios《OpenAI to rewrite its safety rules post-Hugging Face》(2026年8月18日);Fortune关于暂停训练两周的报道(2026年8月18日);ABC News(2026年8月19日);TheRegister《Copilot tricked into telling researchers how to hack itself》(2026年8月18日);TheRegister《Excel's Copilot function is headed for the Recycle Bin》(2026年8月17日)。时间线与数字均为OpenAI公开披露及权威媒体报道口径。

