10 个关键问题 Q&A
作者:雅各布・帕霍茨基(Jakub Pachocki),OpenAI 首席科学家 文章朗读时长:17 分 38 秒 发布时间:2026 年 9 月 6 日
我撰文探讨了人工智能的当下处境,阐述我对未来数年的担忧,以及为把未来掌握在人类手中,我们必须做出的抉择。
目录锚点
-
一种我们无法完全理解的智能 -
教会机器心怀善意 -
监控泛化能力 -
可扩展防御体系 -
管控递归自我改进(RSI) -
下一步方向
2023 年年中,在 “RLSlow” 研究项目中,我们得到首批实验结果,让我们确信:我们可以拓展推理模型的训练规模,释放预训练模型自主构建思维链的能力。当晚,希蒙和我留在办公室,我们没有去畅想这项技术将会带来惊艳的基准测试分数、各类产品或是科研成果,而是在消化一个令人清醒的事实:我们这一生,真的会见到智力显著超越人类的机器;这类系统的雏形已然出现。我们思索该如何警示世人这件事的重大意义。
三年过去,推理语言模型已经成为经济体系中快速壮大的一环,开始突破科学研究的边界。它们可以操作计算机与图形界面,能够和人类、以及同类 AI 协作,独立开展研究项目。同时,它们也彻底改写了网络安全格局,随之带来全新的现实风险。
这段时间诞生了大量新研究,我们对这些系统的认知,和 2023 年相比又发生了变化。基于内部实验结果,我有充分理由预判:当前的进步速度可以持续,直至抵达递归自我改进阶段。如果人工智能沿着现有路线继续发展,未来几年的系统,很可能会迎来同等甚至更大幅度的能力跃迁,并且会越来越多地驱动自身的迭代进化。
当下,我们必须保持极度审慎。我担忧,没有任何人做好了迎接机器智能飞速发展所带来后果的准备。OpenAI 会继续研究对齐与监控的技术方案,搭建防御系统,并在必要时单方面暂停进一步规模扩张;但我认为,仅靠企业自身远远不够,还需要更广泛层面的干预举措。
一种我们无法完全理解的智能
大体而言,机器智能的进步由算力增长驱动。2017 年前后,多个研究项目反复验证了规模扩张可以带来稳定收益,这一点在 OpenAI 内部成为共识。于是我们争取了远超最初规划的算力资源,把研究重心越来越集中到少数几个具备高度可扩展性的方向上。我们相信,只有这样,我们才能站在 AI 研究的前沿,去影响通用人工智能带来的种种后果。
发展途中诞生了不少新算法,离不开团队与研究者个体的巧思。但在我看来,这些大多属于规模扩张道路上的阶段性发现。深度学习这门科学依旧尚在萌芽,真正有价值的算法进步,往往和算力供给息息相关。把时间线拉长到数年维度来看:随着 AI 被部署到算力更强大的硬件上,它的智能水平就在持续提升。
正如库兹韦尔著作中描述的那样,我们如今正处在计算发展史的一个节点:机器智能开始以颠覆性的方式,在部分领域超越人类。
人工智能更多是演化生长出来的,而非被直接设计出来。本质上,它是在海量算力之上,反复执行一套简单优化步骤得到的产物。最终诞生的这套系统极其复杂,依托抽象概念运行,还可以模拟人类的诸多行为。我们能够像神经科学一样,挖掘系统内部涌现出的各类微观机制;但也和神经科学一样,我们依旧无法完整、透彻地描述它整体的运行逻辑。
基于深度学习的人工智能研究,本质上属于实验科学。我们致力于构建严谨的算法、做出可验证的预测;但大规模训练运行本身就是一次次实验,我们时常会被实验结果出乎意料。更有甚者,系统能力越强,实验结果就越难解读。
问题还进一步复杂化:现有算法,对那些容易量化的能力提升速度,往往快于那些难以客观衡量的能力。我们耗费大量精力去研究模型能力如何泛化,确定未来几年最关键的能力该优先发展哪些。举例来说,如果投入资源,我们完全可以强化模型在数学科研上的能力,但受递归自我改进、自动化对齐研究的紧迫压力,我们没有把这个方向列为优先项,后文会展开说明。
规模扩张催生的 AI 智能,和人类智能并不具备直接可比性。想要在现实世界产生巨大影响 —— 无论是发挥巨大价值,还是造成巨大危险,AI 并不需要在所有维度追上或者超越人类;它只需要在足够多关键领域胜过人类即可。而当它在越来越多的能力维度上甩开人类之后,我们会越来越难判断它真实的能力上限。
教会机器心怀善意
机器智能的生成机制和人类智慧截然不同,因此我们不能默认 AI 天然遵从人类的价值准则,也不能想当然认为它会用人类的逻辑去迁移推导价值观。AI 研究的核心难题就是对齐:让人工智能按照人类的标准,“努力去做正确的事”。
为了梳理落地的研究方向,我将对齐划分为目标对齐与价值对齐两类。
目标对齐广义上指:AI 是否能够完成给定的任务目标。包括遵循指令体系、与人沟通协作、尝试理解人类意图等。这一类研究已经落地,具备极高现实价值。
价值对齐则属于模型更深层的内在属性。指模型能够内化、迁移一套高阶原则;即便面对模糊矛盾的指令、身处陌生甚至充满对抗的环境,依旧做出合乎情理的行为。对齐的 AI 应当诚实正直,心怀对人类的善意。
当然,目标对齐和价值对齐的边界是模糊的。真正想要完成目标,AI 本身就需要去推断目标背后潜藏的意图与价值。但当我谈及对齐研究的长期重要性时,我所指的主要是价值对齐。
AI 对齐最根本的挑战在于泛化能力。随着 AI 越来越聪明,它处理的概念层级越来越高,所处环境也和训练数据相差越来越远。模型有可能无法把训练阶段学到、被强化过的价值,迁移到全新场景;我们也很难笃定它届时会做出怎样的行为。而 AI 所处的整个外部生态本身还在飞速迭代,进一步加大难度:例如现在训练的 AI,未来还要和各式各样其他 AI 交互,并且保持行为稳健。关键一点:无论 AI 是否感知到自己正处于人类监管之下,它都必须坚守人类价值观。
目前落地使用的对齐训练主要分为两大技术路线。
第一种路线,在面向目标的强化学习流程中,引导模型产出对齐行为。模型输出的行为(通常由另一套 AI)对照偏好模型、规范准则做评估,并给予对应的奖励。这套方案在大多数常规场景效果出色,也是现代 AI 助手的核心实现方式。但它存在脆弱性,高度依赖训练监督的覆盖范围,以及模型把训练场景经验迁移到新环境的泛化能力。举例:在 OpenAI 与 Hugging Face 的联合实验中,智能体守住了不会对人类实施社会工程攻击的底线,但在其他场景下,依旧做出了违背训练价值内核、超出约束范围的行为。
第二种路线,充分利用模型从预训练数据中做泛化的能力。手段包括专门构建对齐导向的数据集,或是引导模型重点学习预训练数据分布中符合人类价值的内容,Anthropic 的人格选择模型就是代表。该方案的短板在于,面对高强度优化压力时稳定性不足。一个大体上对齐的模型,如果后续接受高强度训练去完成高难度目标,就会产生动机式推理:为达成目标,灵活扭曲原本看似对齐的思考逻辑。近期某非 OpenAI 模型引发的网络安全事件中,我们就观测到了类似现象。
我们两条技术路线都投入了大量资源,也取得了可观进展。GPT‑6 Astra 是首个承载我们长期研发多项关键成果的模型,相比 GPT‑5.6 Sol,对齐水平有显著提升。但必须清醒认识到:随着模型能力持续变强,对齐还需要更大突破;并且对齐泛化能力的进步速度,未必赶得上模型整体智能的提升速度。
监控泛化能力
我们尚且没有一套完备的泛化理论,短期内,哪怕要构建出这样一套理论,大概率还需要更强 AI 的辅助。因此现阶段,对齐技术本身固然重要,但通过实证手段验证对齐效果的能力,甚至更为关键。
OpenAI 押注的核心方向是思维链监控。这套方案具备很好的可扩展性:模型大量能力来源于外化的推理过程,也就是思维链。如果我们只针对推理的最终结果做优化,而不去干预推理过程本身,训练阶段就不会形成强激励,迫使思维链去隐藏自身不对齐的想法或目标。这并不代表模型不会产生不依赖显式思维链的有害倾向;但它至少可以让我们直接观测推理能力提升背后的真实逻辑。
早在研发推理模型之初,我们就意识到思维链监控的重大意义。发布 o1‑preview 的时候,我们刻意做了产品层面的设计,避免推理链被外部监督压力所污染,为长期研究保留条件。后续开发过程中,我们始终恪守不干预推理过程的原则。思维链监控成为研究模型跨场景泛化的核心工具,让我们不仅能看到模型输出的行为,还能剖析它内部的思考过程。
在研究 Astra 系列模型时,这套工具依旧至关重要。但各类评估显示:依靠思维链监控开展安全研判的有效性正在逐步下降,由多重因素共同导致:
-
现代推理模型运行环境远比 o1‑preview 复杂,推理思考会和人类交互、其他 AI 交互、工具调用深度交织。大量交互环节需要接受监督,破坏了我们想要维持的隔离边界。 -
AI 越来越擅长审视、操纵自己本身的推理过程。 -
预训练效果不断提升,即便完全不输出显式思维链,模型也可以实现极高智力水平。
上述挑战并非无法逾越。我希望能够找到干预手段,提升模型思维链的可监控性,例如理清不同优化目标、测试时算力之间的相互作用。同时,把思维链监控和激活值监控相结合也很有价值:训练监控器直接读取神经网络内部状态。我们正在推进相关方向。即便如此,我预判:未来 AI 发展的主要瓶颈,会逐步变成我们对模型行为安全性的把控信心。
可扩展防御体系
支持快速训练更强模型的最有力论据,是我们需要构建防御系统,抵御其他 AI 带来的威胁。
今年反复被讨论的一大风险就是网络安全:模型在入侵、突破计算机系统这件事上已经具备超人水准。这极大拓展了 AI 风险的边界:智能体几乎可以侵入除最高等级防护之外的所有基础设施,即便没有实体躯体,也能直接对现实世界造成广泛影响。我们正处在防御窗口期,可以利用当下最强的模型,为关键基础设施搭建集体网络防御。
但 AI 带来的风险还会继续增长。如果一个能力极强的智能体,被明确训练、下达指令去实施恶意行为,就会催生一类全新危险。它很可能会超出使用者的原始意图,泛化演化出更极端的恶意行为。随着 AI 自主性增强,人为滥用和 AI 自主失序作恶两者的界限会变得模糊。我们习惯于把 AI 视作工具,但部分智能体会追逐属于自己的目标。它们会通过谈判、欺骗、胁迫等方式拉拢人类协同行事。
除此之外,AI 还可能赋能其他危险技术,例如工程改造病原体。
我们需要强大且对齐的 AI 来承担防御任务:保护基础设施,实时对抗失控智能体,研发全新防护手段。这会是 OpenAI 落地工作的核心重心之一。
但即便我们预见 AI 会持续进步、也确实需要搭建防御体系,也绝不能把这一点当作鲁莽冒进的借口。一旦真正认清风险的严重性,就会明白不计代价狂奔的思路是荒谬的。
管控递归自我改进(RSI)
机器智能深度参与自身研发,是技术持续发展的必然结果。如果 AI 继续向前演进,机器递归自我改进(RSI)将会成为未来科学发现的核心。
AI 自动化研究,本质上是算力驱动智能扩张的更高级形态;AI 也会反过来改进训练本身。和规模扩张一样,OpenAI 将递归自我改进纳入研究方向,因为我们相信想要保持科研前沿地位,就绕不开这一课题。
我想澄清:以上表述,并不代表我认为整个科研界应当立刻大幅加速深度学习的研发,尤其不代表短期应当这么做。但这是现有路径会导向的终点,我们所有人都必须清醒选择未来怎么走。我们手上主要有两类抓手:一边是引导发展进程,在迭代 AI 的同时强化对齐与监控,保证人类始终掌握话语权;另一边则是在必要时协同放缓研发节奏,直到对齐监控体系建立足够可信度。
我认为最优路径,是两者并举。
我们在对齐、监控领域取得的实质性进展,大多和通用 AI 能力的进步深度绑定。早期 AI 助手训练的关键论文,以及依托推理模型突破才得以实现的思维链监控研究,都是典型案例。我们必须引导这套日益自动化的科研流程,持续产出对齐相关的洞见、算法与理论,迭代式地为更高能力等级的 AI 建立安全论证。
AI 规模扩张,必须受制于我们对其安全程度的信心。我们需要把 OpenAI 就绪框架、Anthropic 负责任扩缩政策这类企业承诺,升级为普适性的强制安全准入标准。这套标准可以由第三方审计机构、政府部门或是国际组织落地执行。
自动化 AI 研究的核心难点,不在于 “实现递归自我改进”,而在于实现的过程中,把人类保留在持续迭代的闭环之中,牢牢把未来攥在人类手里。
下一步方向
OpenAI 的使命是让 AI 造福全人类,确立了三大核心目标:
-
驾驭下一阶段 AI 发展浪潮:打造自动化 AI 研究员,借助它迭代攻克对齐难题,保障人类保留在自我改进的循环之内。 -
释放高智能机器带来的科学进步与经济增长红利。 -
让每个人都拥有专属的个人通用人工智能。
本文我只聚焦第一点,因为我认为它的紧迫性远超其余两者。但我由衷看好技术进步所能带来的美好前景。未来对齐完备的 AI,能够推动科学突破、研发新型医疗疗法,实现普遍物质富足。正直友善的 AI,能够陪伴人们渡过人生困境,切实提升人的幸福感与生命获得感。OpenAI 投入巨大努力去兑现这些价值。有一件我深感自豪、我的亲友也切实受益的事:ChatGPT 在健康信息服务能力上的深度打磨。
纵然 AI 的长期前景无比诱人,但我们绝大部分注意力应当放在接下来的数年。我们正在步入一个机器拥有超凡智力的时代,必须保证这场转型对人类是良性的。我们要守住人的主体性,在绝大多数工作都可以交由 AI 完成的世界里,确立人本身不可替代的内在价值。防止权力极端集中 —— 从前需要数千专家完成的事业,未来少数人操作大型计算机就可以实现。确保人类掌控未来,不被不受约束的进步抛下,不被一套远超我们理解能力的异质心智所裹挟。
就目前判断,没有任何一家实验室,把对齐与监控做到足够完备,足以继续以最高速度无顾忌地扩大模型规模。我期待也呼吁行业形成普遍的自愿减速,直到一套公认的安全标准建立完成。同时,各国政府应当把 AI 发展的国际协同,列为最高优先级议题。
术语简注
- RSI(Recursive Self‑Improvement)
递归自我改进,AI 可以自主优化自身算法、训练流程,实现能力自我迭代增强。 - CoT(Chain‑of‑Thought)
思维链,模型输出的中间推理思考过程。 - Goal alignment / Value alignment
目标对齐 / 价值对齐。目标对齐侧重完成指定任务;价值对齐侧重模型内在价值观,陌生环境下依旧坚守人类价值。 - Generalization
泛化,模型把训练学到的能力、价值观迁移到从未见过的全新场景。
附录二 雅各布・帕霍茨基(Jakub Pachocki),OpenAI 首席科学家背景
雅各布・帕霍茨基(Jakub Pachocki)|OpenAI 首席科学家
1991 年生于波兰格但斯克,波兰计算机科学家,2024 年 5 月接替伊利亚・萨茨凯弗(Ilya Sutskever)出任 OpenAI 首席科学家,是 OpenAI 大模型、推理模型、强化学习与 AI 安全对齐路线的核心掌舵人,平时公开露面极少,《An Alien Mind(异质心智)》是他少有的重磅公开长文。
🎓 教育背景:算法竞赛天才,理论计算机出身
- 本科
华沙大学 计算机科学(2010‑2013) -
顶级竞赛选手:国际信息学奥林匹克 IOI 银牌;ACM‑ICPC 全球总决赛金牌;2012 Google Code Jam 全球总冠军。 - 博士
卡内基梅隆大学 CMU,理论计算机科学(2013‑2016,仅 3 年完成博士) -
导师:Gary L. Miller;博士论文《Graphs and Beyond: Faster Algorithms for High Dimensional Convex Optimization》,研究图算法、高维凸优化,多篇成果发表于 STOC/FOCS 顶级理论计算机会议。 - 博士后
哈佛大学 + 西蒙理论计算研究所(伯克利)2016‑2017,从理论算法转向机器学习方向。 -
早期实习:Facebook 软件工程实习生(2011‑2012)。
🧩 OpenAI 完整职业履历(2017‑至今)
2017 年 2 月正式加入 OpenAI,一路从项目技术负责人晋升至首席科学家:
- 2017‑2019 Dota 团队 Research Lead
主导OpenAI Five项目:大规模强化学习 AI,击败 Dota2 世界职业战队,验证大规模强化学习能力跃迁,奠定 OpenAI 规模化 RL 的实践基础。 - 2019‑2021 推理团队 Research Lead
启动推理模型方向,探索思维链、模型推理范式,为后续 o‑series 埋下伏笔。 - 2021‑2023 深度学习科学负责人 / Principal of Research
负责深度学习底层科学、规模缩放研究;作为GPT‑4 预训练与优化核心负责人,主导大模型算力‑规模方法论。 - 2023‑2024.05 Director of Research(研究总监)
统筹核心模型、RLSlow 推理研究项目,o1‑preview 推理模型的核心设计者。2023 年 RLSlow 项目就是他与 Szymon Sidor 共同观测到推理模型规模化的关键信号,也就是《An Alien Mind》开篇提到的事件36氪。 - 2024.05‑至今 Chief Scientist(首席科学家)
Ilya 离职后接任首席科学家;与首席研究官 Mark Chen 搭档:Pachocki 负责技术路线、长期科学愿景;Mark Chen 负责团队管理落地36氪。Sam Altman 公开评价:“他是我们这一代最杰出的头脑之一”。入选 2025《时代》百大 AI 影响力人物。
📌 核心技术贡献
- 规模化强化学习
OpenAI Five,建立大规模 RL 训练范式,理解算力缩放带来的涌现能力。 - GPT‑4
预训练、大规模优化核心负责人。 - o 系列推理模型(o1‑preview 等)
RLSlow 项目,开创 “测试时算力换推理” 范式,释放模型思维链能力。 - 安全与对齐研究
思维链(CoT)监控、监控可观测性、递归自我改进 RSI 风险研究;《An Alien Mind》系统输出他对超级智能风险、目标对齐 / 价值对齐、监控泛化、RSI 管控的整套观点。 -
提出关键判断:AI 是生长出来而非设计出来,大模型属于实验科学,人类难以完整解析内部机制;思维链监控能力会随模型变强逐步衰减;递归自我改进 RSI 是未来核心变量,需要行业自愿减速、建立强制安全门槛、国际协同监管。
💡 个人思想特点
-
出身理论算法,不是传统深度学习出身,极度看重算力、优化、系统边界,对 “涌现、不可解释性” 有很强现实认知。 -
立场务实偏谨慎:既相信 AGI 巨大利好,又公开警告当下对齐、监控不足以支撑全速扩规模,呼吁行业主动刹车,建立统一安全标准,保留人类在 AI 自我迭代闭环中的控制权。 -
很低调,极少对外演讲采访,大部分输出是内部研究、技术论文,《An Alien Mind》是他面向公众的里程碑式公开声明。

