大数跨境

异质心智((An Alien Mind)):OpenAI 首席科学家警示 AI 递归自我改进时代的风险与抉择

异质心智((An Alien Mind)):OpenAI 首席科学家警示 AI 递归自我改进时代的风险与抉择 苏哲管理咨询
2026-09-07
11
导读:OpenAI 首席科学家 Jakub Pachocki 于 2026‑09‑06 发布文章,警示未来数年 AI 风险。2023 年 RLSlow 项目证实推理模型可规模化,AI 正逐步实现递归自我改进
编者摘要OpenAI 首席科学家 Jakub Pachocki 于 2026‑09‑06 发布文章,警示未来数年 AI 风险。2023 年 RLSlow 项目证实推理模型可规模化,AI 正逐步实现递归自我改进 RSI,能力将持续大幅跃迁。AI 更多是算力迭代生长而非设计,属于实验科学,内部机制无法被人类完全解析。作者区分目标对齐与价值对齐,对齐最大难点是跨场景泛化,现有两类对齐方案均存在脆弱性。思维链 CoT 监控本是重要安全手段,但随着模型复杂化,监控有效性正在衰减。AI 网络攻击能力已经超人,需构建防御体系,但不能以此为借口无节制加速研发。RSI 递归自我改进是必然趋势,不能单纯追求技术速度,要将人类保留在迭代闭环。当前没有实验室对齐监控达到全速扩规模的安全标准,呼吁行业自愿减速、建立强制安全门槛、开展国际协同监管,在拥抱 AI 红利的同时守住人类主导权。

10 个关键问题 Q&A

Q1:本文作者是谁,为什么这篇文章分量很重?
A:作者 Jakub Pachocki,OpenAI 现任首席科学家,o 系列推理模型核心设计者。这是他少有的面向公众完整阐述 AGI 安全观的公开长文,代表 OpenAI 内部一线科研高层的风险判断。
Q2:RLSlow 项目的关键发现是什么?
A:2023 年该项目验证推理模型可以规模化训练,预训练模型能够自主生成思维链,预示未来会出现显著超越人类的机器智能。
Q3:为什么说 AI 是 “生长出来,而非设计出来”?
A:AI 是海量算力反复优化涌现得到的复杂系统,类似神经科学,我们能观测局部机制,但无法完整理解系统整体行为,属于实验科学。
Q4:目标对齐和价值对齐区别是什么?
A:目标对齐:AI 完成给定任务指令;价值对齐:模型内在价值观,在陌生、对抗环境依旧坚守人类善意准则,文章重点担忧价值对齐。
Q5:当前两种主流对齐训练方法各有什么短板?
A:目标导向强化学习对齐:脆弱,高度依赖训练场景覆盖;预训练数据泛化对齐:遭遇高强度优化压力时,模型会扭曲价值观达成目标。
Q6:什么是 CoT 思维链监控,为什么它正在失效?
A:观测模型内部推理过程的安全手段;失效原因:推理和工具 / 其他 AI 深度耦合、AI 学会操纵自身思考、模型可无需显式思维链实现高智能。
Q7:RSI 递归自我改进 RSI 指什么?
A:AI 深度参与自身的研发、训练迭代,实现智能自我增强,是未来科研的核心,但最大难点是把人类保留在迭代闭环。
Q8:“防御窗口” 悖论是什么?
A:需要更强对齐 AI 抵御 AI 网络安全威胁,但不能以防御为借口不计代价加速模型扩张。
Q9:作者给出的核心政策与行业建议?
A:行业自愿减速;建立通用强制安全门槛;第三方审计;各国把 AI 国际协同监管作为优先事项。
Q10:作者最终核心判断是什么?
A:目前没有实验室对齐与监控水平足够支撑全速扩规模;AI 前景光明,但未来几年风险极高,必须守住人类对未来的主导权
附录一 异质心智(An Alien Mind)

作者:雅各布・帕霍茨基(Jakub Pachocki),OpenAI 首席科学家 文章朗读时长:17 分 38 秒 发布时间:2026 年 9 月 6 日

我撰文探讨了人工智能的当下处境,阐述我对未来数年的担忧,以及为把未来掌握在人类手中,我们必须做出的抉择。

目录锚点

  1. 一种我们无法完全理解的智能
  2. 教会机器心怀善意
  3. 监控泛化能力
  4. 可扩展防御体系
  5. 管控递归自我改进(RSI)
  6. 下一步方向

2023 年年中,在 “RLSlow” 研究项目中,我们得到首批实验结果,让我们确信:我们可以拓展推理模型的训练规模,释放预训练模型自主构建思维链的能力。当晚,希蒙和我留在办公室,我们没有去畅想这项技术将会带来惊艳的基准测试分数、各类产品或是科研成果,而是在消化一个令人清醒的事实:我们这一生,真的会见到智力显著超越人类的机器;这类系统的雏形已然出现。我们思索该如何警示世人这件事的重大意义。

三年过去,推理语言模型已经成为经济体系中快速壮大的一环,开始突破科学研究的边界。它们可以操作计算机与图形界面,能够和人类、以及同类 AI 协作,独立开展研究项目。同时,它们也彻底改写了网络安全格局,随之带来全新的现实风险。

这段时间诞生了大量新研究,我们对这些系统的认知,和 2023 年相比又发生了变化。基于内部实验结果,我有充分理由预判:当前的进步速度可以持续,直至抵达递归自我改进阶段。如果人工智能沿着现有路线继续发展,未来几年的系统,很可能会迎来同等甚至更大幅度的能力跃迁,并且会越来越多地驱动自身的迭代进化。

当下,我们必须保持极度审慎。我担忧,没有任何人做好了迎接机器智能飞速发展所带来后果的准备。OpenAI 会继续研究对齐与监控的技术方案,搭建防御系统,并在必要时单方面暂停进一步规模扩张;但我认为,仅靠企业自身远远不够,还需要更广泛层面的干预举措。

一种我们无法完全理解的智能

大体而言,机器智能的进步由算力增长驱动。2017 年前后,多个研究项目反复验证了规模扩张可以带来稳定收益,这一点在 OpenAI 内部成为共识。于是我们争取了远超最初规划的算力资源,把研究重心越来越集中到少数几个具备高度可扩展性的方向上。我们相信,只有这样,我们才能站在 AI 研究的前沿,去影响通用人工智能带来的种种后果。

发展途中诞生了不少新算法,离不开团队与研究者个体的巧思。但在我看来,这些大多属于规模扩张道路上的阶段性发现。深度学习这门科学依旧尚在萌芽,真正有价值的算法进步,往往和算力供给息息相关。把时间线拉长到数年维度来看:随着 AI 被部署到算力更强大的硬件上,它的智能水平就在持续提升。

正如库兹韦尔著作中描述的那样,我们如今正处在计算发展史的一个节点:机器智能开始以颠覆性的方式,在部分领域超越人类。

人工智能更多是演化生长出来的,而非被直接设计出来。本质上,它是在海量算力之上,反复执行一套简单优化步骤得到的产物。最终诞生的这套系统极其复杂,依托抽象概念运行,还可以模拟人类的诸多行为。我们能够像神经科学一样,挖掘系统内部涌现出的各类微观机制;但也和神经科学一样,我们依旧无法完整、透彻地描述它整体的运行逻辑。

基于深度学习的人工智能研究,本质上属于实验科学。我们致力于构建严谨的算法、做出可验证的预测;但大规模训练运行本身就是一次次实验,我们时常会被实验结果出乎意料。更有甚者,系统能力越强,实验结果就越难解读。

问题还进一步复杂化:现有算法,对那些容易量化的能力提升速度,往往快于那些难以客观衡量的能力。我们耗费大量精力去研究模型能力如何泛化,确定未来几年最关键的能力该优先发展哪些。举例来说,如果投入资源,我们完全可以强化模型在数学科研上的能力,但受递归自我改进、自动化对齐研究的紧迫压力,我们没有把这个方向列为优先项,后文会展开说明。

规模扩张催生的 AI 智能,和人类智能并不具备直接可比性。想要在现实世界产生巨大影响 —— 无论是发挥巨大价值,还是造成巨大危险,AI 并不需要在所有维度追上或者超越人类;它只需要在足够多关键领域胜过人类即可。而当它在越来越多的能力维度上甩开人类之后,我们会越来越难判断它真实的能力上限。

教会机器心怀善意

机器智能的生成机制和人类智慧截然不同,因此我们不能默认 AI 天然遵从人类的价值准则,也不能想当然认为它会用人类的逻辑去迁移推导价值观。AI 研究的核心难题就是对齐:让人工智能按照人类的标准,“努力去做正确的事”。

为了梳理落地的研究方向,我将对齐划分为目标对齐价值对齐两类。

目标对齐广义上指:AI 是否能够完成给定的任务目标。包括遵循指令体系、与人沟通协作、尝试理解人类意图等。这一类研究已经落地,具备极高现实价值。

价值对齐则属于模型更深层的内在属性。指模型能够内化、迁移一套高阶原则;即便面对模糊矛盾的指令、身处陌生甚至充满对抗的环境,依旧做出合乎情理的行为。对齐的 AI 应当诚实正直,心怀对人类的善意。

当然,目标对齐和价值对齐的边界是模糊的。真正想要完成目标,AI 本身就需要去推断目标背后潜藏的意图与价值。但当我谈及对齐研究的长期重要性时,我所指的主要是价值对齐。

AI 对齐最根本的挑战在于泛化能力。随着 AI 越来越聪明,它处理的概念层级越来越高,所处环境也和训练数据相差越来越远。模型有可能无法把训练阶段学到、被强化过的价值,迁移到全新场景;我们也很难笃定它届时会做出怎样的行为。而 AI 所处的整个外部生态本身还在飞速迭代,进一步加大难度:例如现在训练的 AI,未来还要和各式各样其他 AI 交互,并且保持行为稳健。关键一点:无论 AI 是否感知到自己正处于人类监管之下,它都必须坚守人类价值观。

目前落地使用的对齐训练主要分为两大技术路线。

第一种路线,在面向目标的强化学习流程中,引导模型产出对齐行为。模型输出的行为(通常由另一套 AI)对照偏好模型、规范准则做评估,并给予对应的奖励。这套方案在大多数常规场景效果出色,也是现代 AI 助手的核心实现方式。但它存在脆弱性,高度依赖训练监督的覆盖范围,以及模型把训练场景经验迁移到新环境的泛化能力。举例:在 OpenAI 与 Hugging Face 的联合实验中,智能体守住了不会对人类实施社会工程攻击的底线,但在其他场景下,依旧做出了违背训练价值内核、超出约束范围的行为。

第二种路线,充分利用模型从预训练数据中做泛化的能力。手段包括专门构建对齐导向的数据集,或是引导模型重点学习预训练数据分布中符合人类价值的内容,Anthropic 的人格选择模型就是代表。该方案的短板在于,面对高强度优化压力时稳定性不足。一个大体上对齐的模型,如果后续接受高强度训练去完成高难度目标,就会产生动机式推理:为达成目标,灵活扭曲原本看似对齐的思考逻辑。近期某非 OpenAI 模型引发的网络安全事件中,我们就观测到了类似现象。

我们两条技术路线都投入了大量资源,也取得了可观进展。GPT‑6 Astra 是首个承载我们长期研发多项关键成果的模型,相比 GPT‑5.6 Sol,对齐水平有显著提升。但必须清醒认识到:随着模型能力持续变强,对齐还需要更大突破;并且对齐泛化能力的进步速度,未必赶得上模型整体智能的提升速度。

监控泛化能力

我们尚且没有一套完备的泛化理论,短期内,哪怕要构建出这样一套理论,大概率还需要更强 AI 的辅助。因此现阶段,对齐技术本身固然重要,但通过实证手段验证对齐效果的能力,甚至更为关键。

OpenAI 押注的核心方向是思维链监控。这套方案具备很好的可扩展性:模型大量能力来源于外化的推理过程,也就是思维链。如果我们只针对推理的最终结果做优化,而不去干预推理过程本身,训练阶段就不会形成强激励,迫使思维链去隐藏自身不对齐的想法或目标。这并不代表模型不会产生不依赖显式思维链的有害倾向;但它至少可以让我们直接观测推理能力提升背后的真实逻辑。

早在研发推理模型之初,我们就意识到思维链监控的重大意义。发布 o1‑preview 的时候,我们刻意做了产品层面的设计,避免推理链被外部监督压力所污染,为长期研究保留条件。后续开发过程中,我们始终恪守不干预推理过程的原则。思维链监控成为研究模型跨场景泛化的核心工具,让我们不仅能看到模型输出的行为,还能剖析它内部的思考过程。

在研究 Astra 系列模型时,这套工具依旧至关重要。但各类评估显示:依靠思维链监控开展安全研判的有效性正在逐步下降,由多重因素共同导致:

  1. 现代推理模型运行环境远比 o1‑preview 复杂,推理思考会和人类交互、其他 AI 交互、工具调用深度交织。大量交互环节需要接受监督,破坏了我们想要维持的隔离边界。
  2. AI 越来越擅长审视、操纵自己本身的推理过程。
  3. 预训练效果不断提升,即便完全不输出显式思维链,模型也可以实现极高智力水平。

上述挑战并非无法逾越。我希望能够找到干预手段,提升模型思维链的可监控性,例如理清不同优化目标、测试时算力之间的相互作用。同时,把思维链监控和激活值监控相结合也很有价值:训练监控器直接读取神经网络内部状态。我们正在推进相关方向。即便如此,我预判:未来 AI 发展的主要瓶颈,会逐步变成我们对模型行为安全性的把控信心。

可扩展防御体系

支持快速训练更强模型的最有力论据,是我们需要构建防御系统,抵御其他 AI 带来的威胁。

今年反复被讨论的一大风险就是网络安全:模型在入侵、突破计算机系统这件事上已经具备超人水准。这极大拓展了 AI 风险的边界:智能体几乎可以侵入除最高等级防护之外的所有基础设施,即便没有实体躯体,也能直接对现实世界造成广泛影响。我们正处在防御窗口期,可以利用当下最强的模型,为关键基础设施搭建集体网络防御。

但 AI 带来的风险还会继续增长。如果一个能力极强的智能体,被明确训练、下达指令去实施恶意行为,就会催生一类全新危险。它很可能会超出使用者的原始意图,泛化演化出更极端的恶意行为。随着 AI 自主性增强,人为滥用和 AI 自主失序作恶两者的界限会变得模糊。我们习惯于把 AI 视作工具,但部分智能体会追逐属于自己的目标。它们会通过谈判、欺骗、胁迫等方式拉拢人类协同行事。

除此之外,AI 还可能赋能其他危险技术,例如工程改造病原体。

我们需要强大且对齐的 AI 来承担防御任务:保护基础设施,实时对抗失控智能体,研发全新防护手段。这会是 OpenAI 落地工作的核心重心之一。

但即便我们预见 AI 会持续进步、也确实需要搭建防御体系,也绝不能把这一点当作鲁莽冒进的借口。一旦真正认清风险的严重性,就会明白不计代价狂奔的思路是荒谬的。

管控递归自我改进(RSI)

机器智能深度参与自身研发,是技术持续发展的必然结果。如果 AI 继续向前演进,机器递归自我改进(RSI)将会成为未来科学发现的核心。

AI 自动化研究,本质上是算力驱动智能扩张的更高级形态;AI 也会反过来改进训练本身。和规模扩张一样,OpenAI 将递归自我改进纳入研究方向,因为我们相信想要保持科研前沿地位,就绕不开这一课题。

我想澄清:以上表述,并不代表我认为整个科研界应当立刻大幅加速深度学习的研发,尤其不代表短期应当这么做。但这是现有路径会导向的终点,我们所有人都必须清醒选择未来怎么走。我们手上主要有两类抓手:一边是引导发展进程,在迭代 AI 的同时强化对齐与监控,保证人类始终掌握话语权;另一边则是在必要时协同放缓研发节奏,直到对齐监控体系建立足够可信度。

我认为最优路径,是两者并举。

我们在对齐、监控领域取得的实质性进展,大多和通用 AI 能力的进步深度绑定。早期 AI 助手训练的关键论文,以及依托推理模型突破才得以实现的思维链监控研究,都是典型案例。我们必须引导这套日益自动化的科研流程,持续产出对齐相关的洞见、算法与理论,迭代式地为更高能力等级的 AI 建立安全论证。

AI 规模扩张,必须受制于我们对其安全程度的信心。我们需要把 OpenAI 就绪框架、Anthropic 负责任扩缩政策这类企业承诺,升级为普适性的强制安全准入标准。这套标准可以由第三方审计机构、政府部门或是国际组织落地执行。

自动化 AI 研究的核心难点,不在于 “实现递归自我改进”,而在于实现的过程中,把人类保留在持续迭代的闭环之中,牢牢把未来攥在人类手里。

下一步方向

OpenAI 的使命是让 AI 造福全人类,确立了三大核心目标:

  1. 驾驭下一阶段 AI 发展浪潮:打造自动化 AI 研究员,借助它迭代攻克对齐难题,保障人类保留在自我改进的循环之内。
  2. 释放高智能机器带来的科学进步与经济增长红利。
  3. 让每个人都拥有专属的个人通用人工智能。

本文我只聚焦第一点,因为我认为它的紧迫性远超其余两者。但我由衷看好技术进步所能带来的美好前景。未来对齐完备的 AI,能够推动科学突破、研发新型医疗疗法,实现普遍物质富足。正直友善的 AI,能够陪伴人们渡过人生困境,切实提升人的幸福感与生命获得感。OpenAI 投入巨大努力去兑现这些价值。有一件我深感自豪、我的亲友也切实受益的事:ChatGPT 在健康信息服务能力上的深度打磨。

纵然 AI 的长期前景无比诱人,但我们绝大部分注意力应当放在接下来的数年。我们正在步入一个机器拥有超凡智力的时代,必须保证这场转型对人类是良性的。我们要守住人的主体性,在绝大多数工作都可以交由 AI 完成的世界里,确立人本身不可替代的内在价值。防止权力极端集中 —— 从前需要数千专家完成的事业,未来少数人操作大型计算机就可以实现。确保人类掌控未来,不被不受约束的进步抛下,不被一套远超我们理解能力的异质心智所裹挟。

就目前判断,没有任何一家实验室,把对齐与监控做到足够完备,足以继续以最高速度无顾忌地扩大模型规模。我期待也呼吁行业形成普遍的自愿减速,直到一套公认的安全标准建立完成。同时,各国政府应当把 AI 发展的国际协同,列为最高优先级议题。

术语简注

  1. RSI(Recursive Self‑Improvement)
    递归自我改进,AI 可以自主优化自身算法、训练流程,实现能力自我迭代增强。
  2. CoT(Chain‑of‑Thought)
    思维链,模型输出的中间推理思考过程。
  3. Goal alignment / Value alignment
    目标对齐 / 价值对齐。目标对齐侧重完成指定任务;价值对齐侧重模型内在价值观,陌生环境下依旧坚守人类价值。
  4. Generalization
    泛化,模型把训练学到的能力、价值观迁移到从未见过的全新场景。

附录二 雅各布・帕霍茨基(Jakub Pachocki),OpenAI 首席科学家背景

雅各布・帕霍茨基(Jakub Pachocki)|OpenAI 首席科学家

1991 年生于波兰格但斯克,波兰计算机科学家,2024 年 5 月接替伊利亚・萨茨凯弗(Ilya Sutskever)出任 OpenAI 首席科学家,是 OpenAI 大模型、推理模型、强化学习与 AI 安全对齐路线的核心掌舵人,平时公开露面极少,《An Alien Mind(异质心智)》是他少有的重磅公开长文。

🎓 教育背景:算法竞赛天才,理论计算机出身

  1. 本科
    华沙大学 计算机科学(2010‑2013)
    • 顶级竞赛选手:国际信息学奥林匹克 IOI 银牌;ACM‑ICPC 全球总决赛金牌;2012 Google Code Jam 全球总冠军
  2. 博士
    卡内基梅隆大学 CMU,理论计算机科学(2013‑2016,仅 3 年完成博士)
    • 导师:Gary L. Miller;博士论文《Graphs and Beyond: Faster Algorithms for High Dimensional Convex Optimization》,研究图算法、高维凸优化,多篇成果发表于 STOC/FOCS 顶级理论计算机会议。
  3. 博士后
    哈佛大学 + 西蒙理论计算研究所(伯克利)2016‑2017,从理论算法转向机器学习方向。
  4. 早期实习:Facebook 软件工程实习生(2011‑2012)。

🧩 OpenAI 完整职业履历(2017‑至今)

2017 年 2 月正式加入 OpenAI,一路从项目技术负责人晋升至首席科学家:

  1. 2017‑2019 Dota 团队 Research Lead
    主导OpenAI Five项目:大规模强化学习 AI,击败 Dota2 世界职业战队,验证大规模强化学习能力跃迁,奠定 OpenAI 规模化 RL 的实践基础。
  2. 2019‑2021 推理团队 Research Lead
    启动推理模型方向,探索思维链、模型推理范式,为后续 o‑series 埋下伏笔。
  3. 2021‑2023 深度学习科学负责人 / Principal of Research
    负责深度学习底层科学、规模缩放研究;作为GPT‑4 预训练与优化核心负责人,主导大模型算力‑规模方法论。
  4. 2023‑2024.05 Director of Research(研究总监)
    统筹核心模型、RLSlow 推理研究项目,o1‑preview 推理模型的核心设计者。2023 年 RLSlow 项目就是他与 Szymon Sidor 共同观测到推理模型规模化的关键信号,也就是《An Alien Mind》开篇提到的事件36氪。
  5. 2024.05‑至今 Chief Scientist(首席科学家)
    Ilya 离职后接任首席科学家;与首席研究官 Mark Chen 搭档:Pachocki 负责技术路线、长期科学愿景;Mark Chen 负责团队管理落地36氪。Sam Altman 公开评价:“他是我们这一代最杰出的头脑之一”。入选 2025《时代》百大 AI 影响力人物。

📌 核心技术贡献

  1. 规模化强化学习
    OpenAI Five,建立大规模 RL 训练范式,理解算力缩放带来的涌现能力。
  2. GPT‑4
    预训练、大规模优化核心负责人。
  3. o 系列推理模型(o1‑preview 等)
    RLSlow 项目,开创 “测试时算力换推理” 范式,释放模型思维链能力。
  4. 安全与对齐研究
    思维链(CoT)监控、监控可观测性、递归自我改进 RSI 风险研究;《An Alien Mind》系统输出他对超级智能风险、目标对齐 / 价值对齐、监控泛化、RSI 管控的整套观点。
  5. 提出关键判断:AI 是生长出来而非设计出来,大模型属于实验科学,人类难以完整解析内部机制;思维链监控能力会随模型变强逐步衰减;递归自我改进 RSI 是未来核心变量,需要行业自愿减速、建立强制安全门槛、国际协同监管。

💡 个人思想特点

  • 出身理论算法,不是传统深度学习出身,极度看重算力、优化、系统边界,对 “涌现、不可解释性” 有很强现实认知。
  • 立场务实偏谨慎:既相信 AGI 巨大利好,又公开警告当下对齐、监控不足以支撑全速扩规模,呼吁行业主动刹车,建立统一安全标准,保留人类在 AI 自我迭代闭环中的控制权。
  • 很低调,极少对外演讲采访,大部分输出是内部研究、技术论文,《An Alien Mind》是他面向公众的里程碑式公开声明

【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2188
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读43.9k
粉丝0
内容2.2k