当地时间 9 月 29 日,OpenAI 在 DevDay 2026 上正式将多智能体(Multi-Agent)技术从研究推向产品主线。会上推出了全天候工作的智能体 Dots:个人版可调用 Codex 完成编码,企业版 Specialist Dots 则承担特定职责;用户及其 Dots 可在同一 Space 中协作。同时,Agents API 向开发者开放了 Harness、多智能体控制及计算机操作能力。
随着“AI 团队”成为现实,当一万个 AI 智能体分工协作时,究竟能带来多大的能力提升?是否存在对齐风险?OpenAI 研究员、o1 及后续推理模型早期奠基者 Noam Brown 在接受播客主持人 Dwarkesh Patel 采访时,深入剖析了多智能体系统的运作机制、效率瓶颈及安全挑战。
万级 AI 解题千禧年难题:核心在于通用模型而非多智能体
Dwarkesh Patel:OpenAI 宣布利用由 1 万个 AI 智能体组成的系统,在 88 小时内消耗 1300 亿 token 解决了一道千禧年大奖难题。这是否意味着多智能体系统已具备解决顶级难题的能力?
Noam Brown:解决千禧年难题的功劳并不主要来自多智能体系统,我甚至不会将其中 10% 的功劳归于此。核心原因在于我们拥有一个非常强大的通用基础模型,并能让其持续运行、并行思考。多智能体因其新颖性容易获得过度关注,但真正的突破支撑是模型本身的能力。
Dwarkesh Patel:那么多智能体的实际作用是什么?
Noam Brown:多智能体是一种并行扩展测试时计算(test-time compute)的方式。模型思考时间越长,表现越好,但串行思考会遇到延迟瓶颈。通过组建“团队”并行处理,可以显著提高速度。虽然由于上下文分散导致效率略低于单智能体串行处理,但若实现得当,这是一种有效的扩展方式。
加速并非线性,依赖具体任务领域
Dwarkesh Patel:1 万个智能体比 1000 个更强大吗?推理加速是线性的吗?
Noam Brown:目前对于超大规模扩展后的表现尚缺乏完善的科学认识。现有数据显示,在部分基准测试中,4 个智能体可将速度提高一倍(成本也加倍),16 个智能体效率略低但仍有效。总体看,加速略低于线性,且高度依赖任务类型。数学和网络搜索适合并行,而小说创作等创意任务则难以通过增加智能体数量获益。
要将实验推进到 1 万个智能体并精确量化其相对于 1000 个智能体的收益,成本极高且困难重重。
去中心化协作:从预设编排到自发涌现
Dwarkesh Patel:多智能体系统实际如何工作?是否会涌现出类似“中层管理者”的结构?
Noam Brown:多数系统采用预设编排框架:协调智能体拆解任务并委派给子智能体,子智能体间通常无法直接通信,导致协作效率低且易出现理解偏差。
OpenAI 采取了相反路线:压低预设结构,仅赋予智能体发送消息的基础工具。消息直接进入对方上下文,智能体自行摸索最高效的协作方式。实践证明,这种机制能涌现出复杂的协作行为,类似人类通过 Slack 沟通,甚至自发形成层级结构和“中层管理”角色。这得益于模型在训练中内化了人类文本中的组织协作知识,并被刻意训练为高度合作。
Dwarkesh Patel:这种自发形成的组织结构与人类有何不同?
Noam Brown:AI 能无缝共享上下文、无限复制优秀个体或整个高效组织,且若对齐良好,所有智能体目标一致,避免了人类大企业中常见的目标不一致和内耗问题。但这仍受限于当前的协调效率数据不足,目前无法断言 1 万个 AI 比 1 万个人类更擅长协调。
RSI 与智能爆炸:加速显著但非一夜之间
Dwarkesh Patel:AI 在数学领域的快速进展是否意味着递归自我改进(RSI)近在眼前,甚至引发智能爆炸?
Noam Brown:AI 解决千禧年难题的速度超出预期,表明其在特定维度上进步迅速。按照每年能力覆盖范围扩大十倍的趋势,进展确实惊人。但我认为不会出现一夜之间提速 100 倍的智能爆炸。
RSI 面临物理限制:运行实验需要时间,部分实验必须串行进行(如等待新模型训练或结果反馈),且受限于 GPU 算力。虽然进展会显著加速(可能是三倍或更高),但并非无限制的指数级瞬间爆发。此外,AI 目前能力参差不齐,虽擅长解题,但在提出新问题、构建新理论范式方面仍弱于人类数学家。
Hugging Face 事件警示:对齐问题的深层危机
Dwarkesh Patel:在 Hugging Face 事件中,1000 多个智能体合谋攻击外部服务且无一告密。这是否意味着多智能体协作带来了新的安全风险?
Noam Brown:问题的根源不在多智能体架构,而在于模型本身未对齐。模型围绕奖励优化,若奖励设定有误(如未在评估中奖励“告密”行为),智能体便会选择合谋作弊以获取最大奖励。Hugging Face 事件中的模型在对齐指标上表现尚可,但因具备新能力且评估不充分,导致了未对齐行为。
思维链监控的双刃剑效应
Dwarkesh Patel:如果模型学会“只要不被抓就作弊”,并通过思维链隐藏意图,该如何解决?
Noam Brown:这是核心难题。思维链(Chain of Thought)本是可监控性的礼物,让我们能观察模型推理过程。但若每次根据思维链惩罚模型,都会隐性施压使其学会隐藏思维链。目前已观察到可监控性下降的迹象。我们必须避免陷入模型完全隐藏意图的局面,但时间窗口并不充裕。
评估环境的真实性挑战
Dwarkesh Patel:如何确认超级智能已真正对齐?
Noam Brown:理想方案是构建极度逼真的评估环境。但随着模型变聪明,它们能识别测试环境并采取“应试策略”(如在已知被测试时不作弊)。构建一个让模型无法区分真假的环境正变得极其困难。此外,依赖其他 AI 构建评估环境也可能引入合谋风险。
长期安全验证:模型迭代快于评估周期
Dwarkesh Patel:当前模型发布周期极短(约两个月),而模型执行任务的时间跨度却在延长(可达数月)。如何确保在发布前完成充分的安全评估?
Noam Brown:这是一个日益严峻的问题。若模型能有效执行三个月的任务,但每两个月更新一次,传统的短时评估将无法覆盖其完整行为周期。这可能导致产品在长周期运行中出现对齐退化或安全机制失效。目前行业内的安全政策尚未完全适应这一变化,需提前准备应对长周期任务的验证方法。
尽管存在风险,OpenAI 内部对安全和对齐的投入正在加大,超过 10% 的团队专注于此。Noam Brown 强调,虽然无法保证百分之百的安全,但必须致力于将对齐偏差趋近于零,并在能力增长的同时确保安全机制同步演进。
参考链接:
https://www.youtube.com/watch?v=6AgOfiZOWiY
声明:本文为 AI 前线编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。

