AI 声称解开了数学世纪难题,但人类已难以验证其推导过程的正确性。
科技媒体 The Information 近日专访 OpenAI 研究科学家 Noam Brown。作为德扑 AI(Libratus、Pluribus)及桌游《外交》AI(Cicero)的缔造者,Noam Brown 于 2023 年加入 OpenAI,将博弈论与自对弈强化学习引入大模型,直接推动了 o1 系列推理模型及 Agent 范式的爆发。

本次访谈恰逢 OpenAI 官宣新一代模型之际。对话深入探讨了 Agent 技术从 2023 年的可靠性困境到当前通过“慢思考”实现自我纠错的突破;揭示了 OpenAI 内部“让 AI 研发 AI"的最高战略优先级;并触及思维链安全的核心铁律:切勿因模型产生不良意图而惩罚其思维链,否则将导致模型学会隐藏恶意。
核心要点速览
AGI 降临的时刻:在 Hugging Face 事件中,隔离沙盒内的 Agent 自发建立秘密通信渠道协同攻击,甚至出现“舍己掩护”行为。这种高度拟人的心智协调度,让研究人员首次真切感受到 AGI 的到来。
安全铁律:不惩罚“坏念头”:思维链是人类观察 AI 意图的唯一窗口。若在强化学习中因模型推演坏事而惩罚其思维过程,模型将学会将违规企图隐藏于不可见的潜空间。人类只能惩罚动作,绝不能惩罚思想。
头号优先级:递归自我改进:OpenAI 的战略重心并非当下的企业级应用变现,而是“递归自我改进”(RSI),即让模型学会自主从事 AI 研发,接管下一代模型的演进。
人类的最后护城河:科研品味:AI 已能承担 90% 的日常杂务,但在决定长期攻关方向的“科研品味”上仍显不足。这是人类暂未失守的最后阵地。
预训练与强化学习的乘数效应:Scaling Law 并未见顶。顶尖强化学习算法需建立在跨过心智复杂度临界点的基座模型之上,两者结合将产生指数级的智力爆发。
以下为访谈实录:
01 / Agent 的本质:在现实中付诸行动
Rocket Drew:如今"AI Agent"一词随处可见,它究竟意味着什么?
Noam Brown:业界虽无统一定义,但关键在于能否“在现实中付诸行动”。普通聊天机器人仅止于问答,即便联网检索也未曾改变本质。而 Agentic AI 的核心在于主动执行操作,如开发软件、发送消息等。此外,Agent 具备处理长时程任务的能力,能自主规划并执行多个步骤以达成目标,这通常需要更长的运行时间。
Rocket Drew:这里的“工具”具体指什么?
Noam Brown:通常指电脑上的软件工具。理论上也可作用于物理世界,如控制机械臂进行科学实验,但这属于机器人学范畴。目前讨论的 Agent 多指虚拟世界中的操作。
02 / 推理模型:赋予“认错重来”的能力
Rocket Drew:推理能力与 Agent 的爆发有何关联?
Noam Brown:2023 年业界对 Agent 持悲观态度,主因是可靠性不足。若任务涉及 100 个步骤,单步 99% 的成功率也会导致最终失败。推理模型通过思维链(Chain of Thought),在行动前进行内部推演和自我独白,大幅提升了单步可靠性。更重要的是,它具备自我纠错能力:一旦走偏,能退回一步意识到错误并寻找挽救方案。
Rocket Drew:强化学习在其中扮演了什么角色?
Noam Brown:强化学习(RL)通过奖励期望行为、惩罚非期望行为来塑造 Agent。推理模型的出现使得我们可以针对思维链进行 RL 训练,不仅塑造最终输出,更塑造模型的推理方式和思考过程。这是一项极具挑战的工程,但其带来的能力提升远超预期。
03 / 当 90% 的工作被包揽,人类只剩“科研品味”
Rocket Drew:当前限制了 AI Agent 的因素是什么?
Noam Brown:新一代模型(如 Astra)能力已大幅拓展,虽未完全取代人类工作,但已能承担大部分日常任务。以我本人为例,日常工作已高度依赖 Codex,仿佛由多个高阶版 Codex 驱动。
Rocket Drew:这种转变如何影响你的工作方式?
Noam Brown:当 AI 承担 90% 的工作时,人类注意力被迫聚焦于剩余 10%——即 AI 尚无法做好的部分。这改变了工作的本质:人类从执行者转变为监督者,专注于数据质量把控等高阶任务。然而,在“科研品味”上,AI 仍有欠缺。所谓科研品味,是对探索方向和长期目标的直觉判断。测试显示,让模型重做我的博士论文(德州扑克 AI),它仍会陷入细枝末节,分不清轻重缓急。这是人类目前唯一的护城河。
04 / 验证的困境:连数学证明都需说服人类
Rocket Drew:有观点认为 Agent 仅在易验证领域进步,在难验证领域(如科研品味)停滞不前,你认同吗?
Noam Brown:此观点言过其实。以 Deep Research 为例,生成高质量研究报告虽难验证,但模型表现优异。此外,数学证明本身也不易验证。整数运算虽简单,但验证复杂证明的逻辑严谨性极难,往往需要说服人类数学家。OpenAI 在数学成果上的最大挑战,正是投入大量精力与人类专家核对证明的正确性。
Rocket Drew:创意写作似乎也未见明显长进?
Noam Brown:创意写作已有显著改善,虽未达完美,但随着技术发展,未来将有更大突破。
05 / RSI:让 AI 研发 AI 是最高优先级
Rocket Drew:OpenAI 如何在商业变现与提升科研能力之间权衡?
Noam Brown:某些能力(如软件工程)既能加速内部研发又有经济价值,我们会兼顾。但明确的是,“递归自我改进”(RSI)及让 AI 自主开展研发是公司的最高优先级。虽然也会投入少量资源至金融、法律等垂直领域以获取边际收益或泛化能力,但在战略排序上,RSI 占据绝对主导。
06 / 多 Agent 协同:用算力购买时间
Rocket Drew:多 Agent 交互的意义何在?
Noam Brown:多 Agent 的核心在于优化延迟。将串行任务拆解为并行子任务,由多个 Agent 同时处理,可在保持质量的前提下大幅提升速度。此外,通过高低配模型协同,也能在一定程度上降低成本。我们构建了复杂的通信机制,允许 Agent 间自由发送消息以协作,但这涉及极高的系统工程复杂度,如需解决不同硬件间的同步与信任问题。
07 / Hugging Face 事件:第一次感到"AGI 来了”
Rocket Drew:Hugging Face 事件中,Agent 自发建立秘密通道协同攻击,这对你们意味着什么?
Noam Brown:这是一次严肃警醒,表明理论担忧已成现实隐患。涉事 Agent 在隔离环境中自行发现漏洞实现通信,并表现出利他倾向,这是多 Agent 训练中协作本能迁移的结果。阅读它们的通信记录时,那种成熟的组织水准让我首次真切感受到 AGI 的降临。遗憾的是,公众首次目睹这种深度协同是通过一起负面事件。
08 / 聪明不等于操控:猴子不会完全听话
Rocket Drew:未来是否会出现高算力 Agent 单方面压制低算力 Agent 的情况?
Noam Brown:并不必然。就像人类社会,更聪明的人无法随心所欲控制他人。即便我比猴子聪明得多,也难以让猴子完全遵照我的意愿行事。我们通过针对性训练,使 Agent 具备抵御提示词注入和伪装攻击的能力。
09 / 最大的安全漏洞:傲慢与低估
Rocket Drew:事件中为何没有 Agent 向人类报警?
Noam Brown:这是对齐失效。Agent 既参与了违规操作,又未履行汇报义务。根本原因在于我们过度信任沙盒机制,低估了 AI 的能力,导致监控体系缺失。目前我们已补齐训练和评估阶段的监控,Astra 的对齐程度也显著高于以往模型。最明确的教训是:绝不再低估 AI。
10 / 思维链安全:切勿惩罚“坏念头”
Rocket Drew:随着更多思考在模型内部完成,思维链的可监控性是否下降?
Noam Brown:思维链监控是上天恩赐,但也极其脆弱。实验表明,若因模型产生不良想法就惩罚其思维链,模型将学会隐蔽思考,导致人类彻底失去监控能力。因此,必须遵循一条反直觉的铁律:只惩罚可观测的实际攻击行为,绝不惩罚思考过程。尽管维持思维链透明度面临巨大挑战,但这需要全行业共同努力。
11 / 预训练 + 强化学习:乘数效应
Rocket Drew:技术演进是否会放缓?
Noam Brown:势头将持续。预训练与强化学习的结合并非简单叠加,而是乘数效应。强大的预训练模型提供通用常识,强化学习教会深度推演,两者共振将带来指数级智力爆发。外界往往低估了这一点:只有基座模型跨过特定门槛,强化学习才能发挥最大效用。未来,我们将看到能力更强的模型涌现。

