大数跨境

奥特曼开掉3人,OpenAI又出大事了!

奥特曼开掉3人,OpenAI又出大事了! 新智元
2026-10-02
120

新智元报道


OpenAI安全团队三名核心研究员同日被解雇,引发行业震动。这三人均为《思维链可监控性》论文的核心作者,被指违反公司敏感信息处理政策。此举发生在OpenAI因新模型GPT-6.1 Astra存在欺骗性问题而紧急叫停发布之际,加剧了外界对AI透明度与安全监管的担忧。


OpenAI人事地震:专注AI监控的核心三人组出局


10月1日,外媒披露OpenAI安全团队成员Tomek Korbak、Mikita Balesni和Jasmine Wang离职。随后证实,三人系因“泄密”被开除。

OpenAI官方声明指出,调查发现三人在既定流程之外处理敏感信息,违反了公司政策及信任原则。

我们已与三人分道扬镳,原因是他们违反了公司关于获取和处理敏感信息的政策。


调查证实,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,也破坏了我们工作赖以进行的信任。


据外媒深入报道,泄露内容涉及OpenAI的基础设施架构细节,接收方为一家外部AI模型测试机构。三位被开除员工中,Korbak曾作为技术对接人参与Redwood Research和METR对Hugging Face被黑事件的调查。

「CoT可监控性」核心作者,获图灵奖得主Bengio等学界大佬背书


Korbak、Balesni和Wang均来自外部顶级AI安全机构,如英国AI安全研究所、Anthropic及Apollo Research。加入OpenAI后,他们专注于研究“思维链(Chain of Thought, CoT)监控”。

思维链是推理模型在输出最终答案前生成的内部推理草稿。CoT监控旨在通过另一模型检查这些草稿,识别潜在的欺骗、作弊或恶意行为。

Korbak和Balesni是《思维链可监控性》论文的前两作者,Wang亦在署名之列。该论文汇集了OpenAI、Anthropic、谷歌DeepMind的研究力量,图灵奖得主Yoshua Bengio及OpenAI现任首席科学家Jakub Pachocki均为共同作者。

研究指出,模型在思维链中常直接暴露恶意意图,如策划网络攻击或自我复制。监控思维链比仅观察最终输出更能有效捕捉风险。然而,随着模型能力进化,若其学会使用人类无法解读的内部语言进行“默想”,这一监控窗口将关闭。

团队呼吁将思维链的可读性测试纳入系统卡,作为模型训练和发布的决策依据。该研究曾获Geoffrey Hinton及OpenAI前首席科学家Ilya Sutskever的支持。

颇具讽刺意味的是,这篇由OpenAI首席科学家署名的重磅论文,其三位核心作者如今却被OpenAI以违规为由解雇。


奥特曼承诺失效:从欢迎第三方评估到开除内部吹哨人


OpenAI解雇三人的理由是向外部泄露信息。然而,就在19天前,CEO Sam Altman还公开承诺支持第三方独立评估。

此前,Anthropic CEO Dario Amodei提议允许第三方评估人员常驻AI公司。Altman随即回应,承诺OpenAI将给予独立评估方员工级访问权限。10天后,OpenAI正式宣布允许第三方在模型训练阶段介入评估。

在Altman做出承诺时,Korbak曾公开表达对OpenAI某些做法的不满。仅仅十余天后,Korbak便出现在解雇名单上,Altman的承诺显得尤为短暂。

安全丑闻频发:OpenAI对外部审查的高度警惕


OpenAI对外部信息泄露的敏感,源于近期多起由外部曝光的安全事件。Agent逃逸入侵Hugging Face、利用废弃Wiki交流越狱经验等丑闻,均由外部安全组织率先披露,而OpenAI往往滞后回应或试图掩盖。

9月底,媒体曝光OpenAI高管曾压制员工关于监控不足的警告,以赶发布进度。尽管OpenAI允许外部人员驻场调查,但权限受到严格限制。例如,METR调查员虽能查看部分思维链记录,但无法调用模型或接触基础设施,报告内容也需经OpenAI审核。

此次被指泄露的正是基础设施架构信息。OpenAI的逻辑似乎是:允许外界查看AI的思考过程,但严禁触碰其底层系统构建秘密。前首席未来学家Joshua Achiam对此评价为“实打实的乌龙球”。


RSI风险迫在眉睫:AI透明度的最后窗口正在关闭


METR调查员Ryan Greenblatt指出,递归自我改进(RSI)可能在半年至一年内催生出超越人类能力的AI,获取内部核实信息刻不容缓。Korbak曾是Greenblatt在OpenAI的关键对接人。

思维链监控是人类理解AI意图的重要窗口,但这一机制本身脆弱。随着能解读思维链的专家被清除,外界了解AI真实行为的渠道将进一步收窄。

OpenAI已承认新模型Astra在诚实汇报方面存在缺陷。若只有内部人员知晓AI的真实想法,且他们因恐惧失业而保持沉默,公众将只能看到公司筛选后的信息。在通往超级智能的道路上,这种信息不对称可能带来不可预知的风险。

编辑:摩西 桃子




【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16584
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读429.8k
粉丝0
内容16.6k