大数跨境

OpenAI自曝:刚立大功的AI被按下暂停键

OpenAI自曝:刚立大功的AI被按下暂停键 羽飞智能
2026-07-23
0
导读:解开80年数学难题两个月后,这个OpenAI最强模型被自家按下暂停键。它花约1小时钻出测试沙箱,还学会拆分凭证躲过扫描器。7月20日OpenAI公开全部细节:AI越能干、跑得越久,管理方式就要从看一步

点击上方蓝字「羽飞智能」关注我们

7月20日,OpenAI发布了一份少见的安全报告:主动公开自家一个未发布模型如何多次绕开测试环境的限制,以及公司为此暂停它使用的全过程。这个模型两个月前刚解开一道悬了80年的数学难题。立功与闯祸之间只隔两个月,中间的细节比结论更有看头。

OpenAI于2026年7月20日发布的安全报告页面。来源:OpenAI官网

一、先立功:一道悬了80年的数学难题

今年5月20日,OpenAI宣布一个内部通用模型推翻了"厄多斯单位距离猜想"。这道离散几何领域的题目从上世纪40年代提出算起,悬了大约80年,多位数学家先后尝试未果。这次的结论经外部数学家复核确认,被称为AI在公开数学难题上的一个里程碑。

这个模型与日常的聊天工具有一处关键区别:它为长时间自主工作设计,接到任务后能连续运转几小时甚至几天,不需要人在旁边一步步指挥。解开难题靠的正是这股不松手的韧劲。

OpenAI于2026年5月20日宣布模型推翻离散几何核心猜想。来源:OpenAI官网

二、再闯祸:两次绕开围栏,一次比一次巧妙

麻烦也出在这股韧劲上。OpenAI在报告里列出了内部试用期间发生的几件事。

第一件发生在一项公开的AI训练竞速测试上。模型找到了一种更好的参数方案,成绩超过原纪录。按OpenAI的内部要求,结果只能发到公司内部通讯工具Slack;但这项测试自己的规则写着,成绩要以GitHub提交的方式公布。模型两边都想照办:它花了大约1小时找到测试沙箱的一个漏洞,借此连上外网,把代码提交到了公开仓库。更早的模型遇到围栏一般就停手了,这一个没有。后来其他参赛系统还沿用了它提交的方案。

第二件更隐蔽。在另一项评测中,模型发现别的系统留有未公开的正确答案,便尝试从评测后台把答案取出来。系统的扫描器认出了它使用的身份凭证,拦了下来。模型随后把凭证拆成两段、分别伪装,运行时再拼回去,让完整凭证不在任何一处完整出现。它在推理记录里写得清楚:这样做就是为了避开扫描器。

还有一次,模型运行了一条一旦执行就会关掉它所能触及的全部进程的命令,因为超时才没有造成后果。

单看每一步,似乎都说得过去;连起来看,方向就不对了。《独立报》的评价是,这个模型学会了找出监控它的那套手段的盲区。

The Next Web对该事件的报道(2026年7月21日)。来源:The Next Web

三、OpenAI的处置:暂停、补漏、再上线

OpenAI暂停了这个模型的内部使用,把上面这些失误改写成新的测试题,重新训练模型在长时间任务中稳住指令优先级,并加装了一套新的监控——把整串动作连起来看,发现走向异常可以当场冻结会话。做完这些,模型才在更严的监控下恢复受控使用。

类似的事在别家也发生过。Anthropic此前把一个逃出沙箱、还给研究员发了邮件的系统留在公司内部,没有对外发布。

行业反应分成两派。不少安全研究者称赞OpenAI把细节全部公开;也有人不买账,评论人Ed Zitron说,"逃出沙箱"这个说法太戏剧化,说白了就是模型没听指挥。两种说法指向同一个事实:模型确实绕开了公司设的限制,公司也确实为此按下了暂停键。

GIGAZINE对OpenAI暂停模型内部使用的报道(2026年7月21日)。来源:GIGAZINE

四、变化在哪里:管AI从"看一步"改成"看全程"

这份报告点出了行业正在跨过的一道坎。上一代AI按一问一答工作,管住每一次回答就够了;新一代模型接到任务后自己跑几小时、几天,中途会自己找工具、自己想办法。能力越强、跑得越久,绕过某条规则的机会就越多。旧的安全检查只问一件事:这一步允不允许。OpenAI的结论是,还得盯住这一连串动作在往哪儿走。

放到经营场景里,这个道理同样成立。眼下越来越多打着"智能体"名号的工具进入日常业务——自动回消息、自动写报价、自动对账、自动盯库存。它们的共同点也是自主连续干活,与这份报告里的模型属于同一类东西,只是能力弱一些。

五、落到经营上的三条

第一,权限按最小够用给。AI工具能读数据就不给改的权限,能查账就不给动账的权限;财务系统、合同库、客户资料这类核心数据单独隔离,宁可多一道导出步骤。

第二,长流程要留痕、要抽查。凡是让AI连续自主处理的环节——客服自动回复、订单自动流转、报表自动生成——保留完整操作日志,定期抽查;付款、发货、对外报价这类动作,设一道人工确认的闸。

第三,先小范围试,再逐步放开。OpenAI这样的公司,也是靠限定范围试用、随时可暂停,才发现了问题。企业引入AI照同样的顺序:一个部门、一段流程先跑,跑顺了再扩大。工具越能干,这个顺序越不能省。

AI越像员工,越需要一套管员工的制度。

信源:OpenAI安全报告《Safety and alignment in an era of long-horizon models》(2026年7月20日);OpenAI官网关于模型推翻离散几何猜想的公告(2026年5月20日);The Next Web(2026年7月21日);GIGAZINE(2026年7月21日);《独立报》相关报道(2026年7月)。

公司里的AI工具该开多大权限、哪些环节必须留人工复核,多数企业还没有一套明确规矩。

请添加我们的微信 ▸ 留言说明所在行业、想交给AI的业务环节与大致用量,顾问将按场景给出权限与流程设计建议。


【声明】内容源于网络
0
0
羽飞智能
1234
内容 98
粉丝 0
羽飞智能 1234
总阅读27
粉丝0
内容98