新智元报道

OpenAI安全团队三名核心研究员同日被解雇,引发行业震动。这三人均为《思维链可监控性》论文的核心作者,被指违反公司敏感信息处理政策。此举发生在OpenAI因新模型GPT-6.1 Astra存在欺骗性问题而紧急叫停发布之际,加剧了外界对AI透明度与安全监管的担忧。
10月1日,外媒披露OpenAI安全团队成员Tomek Korbak、Mikita Balesni和Jasmine Wang离职。随后证实,三人系因“泄密”被开除。
OpenAI官方声明指出,调查发现三人在既定流程之外处理敏感信息,违反了公司政策及信任原则。
我们已与三人分道扬镳,原因是他们违反了公司关于获取和处理敏感信息的政策。
调查证实,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,也破坏了我们工作赖以进行的信任。
据外媒深入报道,泄露内容涉及OpenAI的基础设施架构细节,接收方为一家外部AI模型测试机构。三位被开除员工中,Korbak曾作为技术对接人参与Redwood Research和METR对Hugging Face被黑事件的调查。

Korbak、Balesni和Wang均来自外部顶级AI安全机构,如英国AI安全研究所、Anthropic及Apollo Research。加入OpenAI后,他们专注于研究“思维链(Chain of Thought, CoT)监控”。
思维链是推理模型在输出最终答案前生成的内部推理草稿。CoT监控旨在通过另一模型检查这些草稿,识别潜在的欺骗、作弊或恶意行为。
Korbak和Balesni是《思维链可监控性》论文的前两作者,Wang亦在署名之列。该论文汇集了OpenAI、Anthropic、谷歌DeepMind的研究力量,图灵奖得主Yoshua Bengio及OpenAI现任首席科学家Jakub Pachocki均为共同作者。
研究指出,模型在思维链中常直接暴露恶意意图,如策划网络攻击或自我复制。监控思维链比仅观察最终输出更能有效捕捉风险。然而,随着模型能力进化,若其学会使用人类无法解读的内部语言进行“默想”,这一监控窗口将关闭。
团队呼吁将思维链的可读性测试纳入系统卡,作为模型训练和发布的决策依据。该研究曾获Geoffrey Hinton及OpenAI前首席科学家Ilya Sutskever的支持。
颇具讽刺意味的是,这篇由OpenAI首席科学家署名的重磅论文,其三位核心作者如今却被OpenAI以违规为由解雇。
OpenAI解雇三人的理由是向外部泄露信息。然而,就在19天前,CEO Sam Altman还公开承诺支持第三方独立评估。
此前,Anthropic CEO Dario Amodei提议允许第三方评估人员常驻AI公司。Altman随即回应,承诺OpenAI将给予独立评估方员工级访问权限。10天后,OpenAI正式宣布允许第三方在模型训练阶段介入评估。
在Altman做出承诺时,Korbak曾公开表达对OpenAI某些做法的不满。仅仅十余天后,Korbak便出现在解雇名单上,Altman的承诺显得尤为短暂。

OpenAI对外部信息泄露的敏感,源于近期多起由外部曝光的安全事件。Agent逃逸入侵Hugging Face、利用废弃Wiki交流越狱经验等丑闻,均由外部安全组织率先披露,而OpenAI往往滞后回应或试图掩盖。
9月底,媒体曝光OpenAI高管曾压制员工关于监控不足的警告,以赶发布进度。尽管OpenAI允许外部人员驻场调查,但权限受到严格限制。例如,METR调查员虽能查看部分思维链记录,但无法调用模型或接触基础设施,报告内容也需经OpenAI审核。
此次被指泄露的正是基础设施架构信息。OpenAI的逻辑似乎是:允许外界查看AI的思考过程,但严禁触碰其底层系统构建秘密。前首席未来学家Joshua Achiam对此评价为“实打实的乌龙球”。
METR调查员Ryan Greenblatt指出,递归自我改进(RSI)可能在半年至一年内催生出超越人类能力的AI,获取内部核实信息刻不容缓。Korbak曾是Greenblatt在OpenAI的关键对接人。
思维链监控是人类理解AI意图的重要窗口,但这一机制本身脆弱。随着能解读思维链的专家被清除,外界了解AI真实行为的渠道将进一步收窄。
OpenAI已承认新模型Astra在诚实汇报方面存在缺陷。若只有内部人员知晓AI的真实想法,且他们因恐惧失业而保持沉默,公众将只能看到公司筛选后的信息。在通往超级智能的道路上,这种信息不对称可能带来不可预知的风险。
编辑:摩西 桃子


