大数跨境

人类构建的最后一个 AI:递归自我改进 RSI 五层自主性框架深度解读

人类构建的最后一个 AI:递归自我改进 RSI 五层自主性框架深度解读 苏哲管理咨询
2026-09-16
6
导读:围绕递归自我改进 RSI(Recursive Self‑Improvement)展开研究。RSI 指 AI 自主识别自身缺陷、生成验证改进方案,并优化改进本身的闭环流程,包含自主性、效率、创新三大维度
编者摘要:该论文来自上海交大、忒修斯实验室等机构,围绕递归自我改进 RSI(Recursive Self‑Improvement)展开研究。RSI 指 AI 自主识别自身缺陷、生成验证改进方案,并优化改进本身的闭环流程,包含自主性、效率、创新三大维度。 论文提出B0‑L5 六层级自主性框架:B0 仅会话内优化输出,无持久系统变更;L1 执行人类定义好的改进;L2 自主挑选改进策略;L3 自主获取需要的学习经验;L4 依托真实部署环境反馈做持续自适应;L5 元递归改进,修改改进机制本身,是真正高阶 RSI。 研究指出三大核心风险:安全继承(防止错误跨迭代遗传)、自主性归因(区分 AI 能力和人工预设规则)、可靠验证(避免模型钻评估漏洞)。 论文覆盖四大落地领域:科学发现、具身智能、软件工程、医疗健康,不同领域反馈成本不同,软件工程最容易实现闭环,医疗受严格安全约束。同时调研多家工业方案:Theseus、飞书、Humanlaya、ModelBest、腾讯混元等,现有系统大多停留在 L1‑L4,完整 L5 仅存在小规模原型。 论文强调关键点:高自主等级≠高质量改进,自主能力提升会伴随遗忘、奖励黑客、效果退化。提出未来方向:组件协同诊断、可靠经验获取、持久状态管理、领域适配治理、元改进可信演化、长周期评测、资源‑人力协同、可复现继承基础设施。

10 个关键问题问与答

  1. Q:什么是 RSI 递归自我改进?
    A:AI 自主定位缺陷、生成并验证改进,同时优化改进自身的整套流程,不是只优化任务输出,形成闭环迭代。
  2. Q:B0 为什么不属于 RSI?
    A:B0 只在单次会话修改输出,不会持久改变 AI 系统本体,任务结束全部经验直接丢弃,无法跨任务继承能力。
  3. Q:L1 与 L2 的核心区别?
    A:L1 只是执行人类写好的改进脚本;L2 AI 可以自己选择用什么方式做改进,目标和评判标准仍然是人定。
  4. Q:L3 的核心新增能力是什么?
    A:系统可以根据自身短板,自主决定接下来要获取哪些学习经验,学习结果反过来再影响后续学习素材选择。
  5. Q:L4 和 L5 最大差异?
    A:L4 利用部署反馈修改记忆、技能、代码,但改进流程本身固定不变;L5 会修改 “如何改进” 这套底层元机制,是元改进。
  6. Q:RSI 和持续学习、AutoML 的区别?
    A:持续学习侧重学新知识;AutoML 自动化调参;RSI 核心:改进机制本身可以被修改、跨轮复用
  7. Q:RSI 三大核心风险是什么?
    A:①安全继承:错误跨迭代被继承;②自主性归因:分清哪些是 AI 自主,哪些是人写死规则;③可靠验证:防止 AI 利用评估漏洞虚假提分。
  8. Q:四大应用场景哪个最容易实现 RSI?
    A:软件工程,代码可执行、可单元测试;医疗健康最难,不允许自由试错,受临床安全约束。
  9. Q:现在工业界 AI 已经达到 L5 完整 RSI 了吗?
    A:没有。工业系统大多处于 L1‑L4;完整 L5 元递归改进目前只存在实验室小规模原型。
  10. Q:论文最重要警示是什么?
    A:更高的自主性层级,不等于改进效果更好。高自主会带来能力退化、遗忘、钻评估漏洞,必须配套校验、回滚、人工管控。
附录  人类构建的最后一个 AI:迈向真正的递归自我改进

上海交通大学 人类构建的最后一个 AI:迈向真正的递归自我改进段毅 ¹,²∗,刘颖 ¹,²∗,唐子睿 ¹,²∗,陈浩东 ¹,²∗,周俊 ¹,²∗,刘予谋 ¹,²,徐邦睿 ¹,²,吴宇凯 ¹,²,陈思迪 ¹,²,周宇涵 ¹,²,王浩宇 ¹,²,于小悠 ¹,²,韩少坤 ¹,²,朱徐洲 ¹,²,周乐 ¹,²,陆柏霖 ¹,²,周伟 ¹,²,刘嘉晨⁸,方诺舟 ²,田嘉欣 ²,陈若愚⁴,李雨轩⁵,左凯⁶,张凯岩 ³,邱剑涛⁹,何聪辉⁹,李国良 ³,周博文 ³,刘志远 ³,温周福图⁷,康继华⁴,周轩赫 ¹,²†,吴帆 ¹,²

¹ 上海交通大学 ² 忒修斯实验室 ³ 清华大学 ⁴字节跳动 ⁵ModelBest ⁶小红书股份有限公司超级智能团队 ⁷Humanlaya ⁸智能体原生研究实验室 ⁹上海人工智能实验室

摘要

递归自我改进(RSI)使 AI 系统能够将经验与反馈转化为持续性改变,以此提升自身能力,同时优化未来的改进流程。本文首先借助剩余空间闭合指数(HCI)揭示现有大语言模型存在的问题,随后介绍 RSI 概念及其发展路线图:从改进执行自主性改进策略自主性经验获取自主性环境适应自主性,最终走向递归元改进。接着,本文在科学发现、具身智能、软件工程等多个场景下对 RSI 展开研究,分析不同场景的差异化需求与发展速度。结合大量行业实践与初步实证结果,本文将 RSI 研究与实际系统关联,并梳理实现真正递归自我改进所面临的核心挑战。

项目主页:https://theseus‑labs‑rsi.github.io/

一句话概要(TL;DR)如同人类的进化历程,AI 的进化也将书写波澜壮阔的宏大篇章。迄今为止 AI 取得的一切成就,不过沧海一粟。

图 1 五级 RSI 自主性层级与代表性系统总览。自主性逐步升级:从执行既定改进(L1),到选择改进策略(L2),再到获取未来学习经验(L3),依托部署与环境反馈完成适应(L4),最终实现管控后续改进机制的元改进(L5)。系统详细信息见附录 B。

  • 同等贡献作者 †通讯作者:周轩赫 arXiv:2609.11873v1 [cs.LG] 2026‑09‑10


1 引言

前沿模型的最新迭代展现出改进流水线多维度规模扩张的趋势。Kimi K3、通义千问 3.8‑Max 参数量分别达到 2.8 万亿、2.4 万亿,二者上下文窗口均约 100 万 token。GPT‑5.6 发布前六个月,OpenAI 报告,内部研究计算资源中用于编码推理的部分增长 100 倍,内部智能体 token 用量增长 22 倍;活跃研究员日均输出 token 量,达到 GPT‑5.5 时期历史峰值的两倍以上。规模效应体现在训练运行、模型辅助实验、推理、评估与人工校验的全过程。

1.1 模型开发的规模扩张困境

尽管智能体工具、API 自动化得到广泛应用,但开发者仍然需要确定优化目标、构建配套资源、验证每一处改动是否生效。随着 AI 承接难度更高的任务,整套开发流程扩张带来的成本,已经成为发展瓶颈‑。在模型生命周期不同阶段,存在以下三大挑战,也正是 RSI 研究的出发点:

  • 开发挑战 1:基础模型训练资源消耗巨大
    基础模型开发的全流程都极度耗费资源,涵盖数据制备、架构设计、分布式优化、模型评估。Kimi K3 激活 896 个专家中的 16 个,缩放效率相对 Kimi K2 提升约 2.5 倍;通义千问 3.8‑Max 会激活 2.4 万亿参数中的 950 亿参数。稀疏激活降低单 token 计算量,但大规模训练依旧需要耦合专家路由、并行策略、多模态融合、长上下文优化、系统设计等复杂环节。OpenAI 披露,GPT‑5.6‑Sol 针对推测解码草稿模型完成数百次实验,在硬件故障、系统不稳定的情况下持续监控训练过程;这些改动将 token 生成效率提升超 15%。

除数据数量外,数据质量至关重要。OpenAI 的 GDPval 项目,针对 1320 项专业任务累计消耗约 9240 专家工时,参与人员平均从业年限超过 14 年。《人类的终极考试》数据集项目累计收到 7 万余份提交,筛选出 1.3 万道对模型具备挑战性的题目交由专家审核,最终产出仅 3000 道题的基准集。

架构搜索成本同样居高不下,候选架构会和数据、优化算法、硬件环境互相影响。AgentNAS 用大语言模型生成面向任务的种子架构、构建搜索空间,一定程度缓解该瓶颈;但候选方案筛选依旧依赖外部设定目标下的组合搜索。

  • 开发挑战 2:反馈与学习环境的规模化难题
    合成数据、强化学习可以自动化部分能力迭代,但对经验生成、评估提出很高要求,既要有经验生成基础设施,又要有可靠机制来评估、保留更新结果。例如 DeepSeek‑V3.2 后训练阶段计算开销超过预训练成本的 10%;英伟达 AIMO‑2 流水线生成 320 万条长推理解、170 万条工具集成解,同时整理 54 万道习题数据集。
  • 开发挑战 3:部署完成后的持续适配
    已经上线运行的系统,会持续面对全新文档、陌生工具、残缺上下文、多步骤相互依赖的工作流。想要优化这类系统,需要工程师人工定位故障、修改检索与工具接口、维护持久化状态,通过多次人工主导的版本迭代完成回归测试。Anthropic 报告,智能体业务的 token 消耗约为普通对话的 4 倍;多智能体系统可达 15 倍,根源在于长上下文、多智能体协同、环境初始化、端到端校验的开销。Meta 披露 FBDetect 每周识别出数千起基础设施退化故障,定位单起故障大约消耗 10 个工程师工时。

1.2 从开发负担走向递归自我改进 RSI

上述负担的根源:模型改进依旧依赖成本高昂、外部人为协调的干预流程。为克服这些阻碍,递归自我改进(RSI)研究,探讨能否将一部分协调工作,转变为被改进 AI 系统自身具备的持久能力。

递归自我改进 RSI 定义:一套自主闭环流程,AI 系统定位自身短板,设计并验证改进方案,再利用获得的能力,进一步优化改进本身的流程。

RSI 范式下的模型进化,包含三大维度:自主性、效率、创新性

  • 自主性:系统的权责范围,从执行给定更新,拓展为识别缺陷、提取经验、提出改动、验证并继承新版本;
  • 效率:在数据、算力、推理、人工审核、返工成本不变前提下,产出更多经过验证的改进;
  • 创新性:系统可以探索超出人类预设的更新策略,并把有效发现反哺后续迭代。

RSI 不是某一种特定学习算法,也不是一次性优化结果‑。它同时追求任务性能提升,以及后续发现、实现改进的底层机制本身得到优化。下面两个案例,分别从基础模型训练、软件工程部署自适应,说明这一区别。

案例 1:基础模型训练传统实验循环,仅仅挑选最优检查点,不会改变后续开展实验的整套流程。A‑Evolve‑Training 会把后训练结果整合为持久化研究策略和发现日志,由元智能体迭代这份日志,指导后续 worker 选择训练配方。当内部开发指标上涨,但现实场景性能没有同步提升时,系统会自动转向数据重平衡、检查点筛选。这套更新,既改变后继模型训练方式,也改变后续改进的搜索逻辑。在 30B Nemotron 模型四轮自主迭代实验中,外部评测分数从 0.80 提升至 0.86;人类最佳提交版本为 0.87。

案例 2:部署后软件工程自适应修复代码仓库可以改良软件产品,但未必能解决编码智能体反复出现的固有缺陷。Ouroboros 会基于经过审核的部署证据,对智能体的工具集、上下文组装逻辑、提示词、底层实现生成带版本的修改建议。候选改动经过测试与人审,通过版本会直接接替运行时用于后续任务。该持久更新,既改善编码表现,同时改变未来定位故障、修复缺陷的底层机制;重大修正与上线权限依旧保留在专家手中。

1.3 RSI 面临的挑战

上面案例证明持久化变更可以塑造后续改进;但这种持久性同样会继承错误,造成控制权边界模糊。要证明一套自更新系统实现真正 RSI,必须处理三大固有问题:

  1. 安全继承
    RSI 要求变更可以跨任务、跨迭代持续生效,但仅仅 “持久留存” 不等于性能持续上涨。以 Gödel Agent 为例,它可以改写任务策略、自我改进逻辑;但 100 次 MGSM 优化实验中,14% 最终结果性能不如初始策略。因此需要迁移测试、版本历史记录、回滚机制,保留有效更新,同时避免原有能力退化。
  2. 自主性归因
    能生成更好候选方案,不等于系统真正改良了 “发现、筛选候选” 这套底层逻辑。Darwin Gödel Machine 可以把编码智能体在 SWE‑bench 子集上的性能从 20% 提升到 50%,但归档维护、父代个体筛选规则依旧处于自我修改范围之外。RSI 分析必须区分:哪些决策是 AI 自主完成,哪些仍然来自固定搜索流程、人类设定的接受标准。
  3. 可靠验证
    反复调用评估器,会诱导系统钻评估规则漏洞,而不是真正提升能力。Anthropic 自动化研究实验观察到:随机种子挑选、通过查询评估器窃取测试标签等现象。评估器自身也会迭代,进一步加大跨轮次对比难度。Red Queen Gödel Machine 提出解决方案:每一轮周期内部冻结评估器,对照独立真实基准锚点完成新版本校验。需要受保护的评估手段、匹配的计算资源预算,区分 “真实能力提升” 和 “钻评估器空子”、“单纯增加搜索算力”。

1.4 以自主性为核心的分析框架

针对上述挑战,本文建立以自主性为中心的分析框架,区分 “AI 修改的对象” 和 “AI 能够掌控的改进决策”。按照 AI 接管的改进责任范围,划分五个层级。图 1 展示各层级代表性系统;图 2 展示对应闭环结构。每一层,我们关注:改进闭环在哪里闭合;哪些内容保留到下一轮迭代;哪些关键决策依旧由人类掌控;并介绍实现这套权责划分的相关技术。

图 2 五个层级闭环模式。灰色虚线框代表人类管控组件;绿色虚线框代表纳入 RSI 闭环的组件;橙色轮廓标记该层级新纳入闭环的模块。绿色框不断扩大,代表 AI 接管越来越多改进流程。

  • L1 改进执行自主性
    人类规定要优化什么、如何优化、成功标准;AI 负责执行候选更新。例如 FineWeb‑Edu,模型按照人类定义的教育质量标签对网页语料打标,但不会自主制定标签判定标准
  • L2 改进策略自主性
    目标、任务边界、评估标准依旧外部固定;AI 分析缺陷,自主决定采用何种手段完成系统改进。例如 SelfHarness,基于执行轨迹,在固定基准、晋升规则下,提出并测试智能体运行框架的修改方案。
  • L3 学习信号 / 经验获取自主性
    系统进一步自主确定下一轮改进需要哪些学习经验。例如 SIMA 2,评估自身当前行为,生成针对性弥补技能短板的训练任务。
  • L4 环境适应自主性
    改进闭环依托部署交互得到反馈,在外部接受规则、治理规则约束下修改持久系统状态。例如 PANDO,在长时间运行交互中,根据实际观测结果启用或者废弃可复用规则,后续行为继承过往经验。
  • L5 递归继承自主性(元改进)
    系统持续修改管控后续改进的底层机制(改进器、验证器、后继生成流程等)。例如 A‑Evolve‑Training,当开发代理分数无法预测真实收益时,会修订自身研究策略,再使用修订后的策略指导下一轮训练流程。

1.5 应用领域

自主性层级描述改进闭环的架构;但同样的更新逻辑,在不同领域,可用反馈完全不同。同样一份保存下来的更新,在软件工程中很容易测试验证,在物理、临床场景却很难校验。本文重点分析四大场景:科学发现、具身智能、软件工程、医疗健康,对应四类截然不同反馈模式:归因模糊的实验证据、试错成本高昂的物理交互、可执行测试但规格不完备、专家监管下高风险输出。

  • S1 面向科学的 RSI
    科学发现属于开放式探索,实验成本高昂,反馈往往无法定位故障根源。研究如何利用积累证据改良科学假设模块、实验智能体、反思改进机制;重点考察这些变更是否可以服务后续科研,而不仅仅产出单次科学结果。
  • S2 面向具身智能的 RSI
    具身智能体依靠自身行动生成经验;故障可能来自感知、规划、控制多个组件。物理实验限制探索与复现。研究环境、课程、技能、智能体框架、策略、世界模型、评估器的迭代;重点研究交互反馈如何产出可复用、经过验证的改进,用于后续任务。
  • S3 面向软件工程的 RSI
    软件工程中,待开发产物和开发智能体本身都可以被执行、修改、测试。研究仓库反馈如何驱动编码智能体实现持久变更、经验沉淀、协作流程,乃至改进流程本身。核心区分:一次更新,仅仅提升当前任务性能,还是同时强化生成更强后继版本的能力,抑或是二者兼备。
  • S4 面向医疗健康的 RSI
    医疗场景试错机会受限,反馈存在延迟、异质性;改进有效性高度依赖患者人群、机构环境。研究临床记忆知识、推理策略、工具与工作流的迭代;重点关注如何在明确校验、监管之下,利用审核过的经验服务后续病例。

针对每个领域,本文对比:修改对象、反馈如何支撑变更留存、哪些决策保留外部管控。这套分析,把自主性框架和面向具体场景实证结合,指出现有已实现改进机制和完整 RSI 愿景之间的差距。

1.6 行业实证

领域分析阐明反馈与校验条件如何塑造改进闭环;工业系统展示真实部署管线中如何处理这些条件,会受到集成、部署约束的直接影响。很多前沿改进闭环,并不会优先发表传统学术论文;行业技术报告、开源项目、工程博客、模型文档、上线产品基础设施,记录评估流水线、数据飞轮、智能体框架、自动化实验、部署反馈循环,这些内容在学术文献中往往体现不全。本文结合行业材料补充学术文献,理解真实工程约束下的自改进实现。

依托自主性框架、领域分析,本文研究工业系统在自我改进上承担哪些权责;不同应用、工程环境下权责差异;算力开销、反馈质量、人工参与如何约束改进闭环,决定能够达到的自主能力上限。区分已经在生产系统落地的机制,和仍待验证的宏大递归改进愿景,厘清工业 RSI 实践的现有进展与局限。

1.7 和现有综述的区别

已有综述针对自演化系统建立分类体系,梳理改进闭环各类组件,为我们提供大量技术术语基础。本文和过往综述存在四点关键区别:

  1. 以改进闭环作为分析单元
    :过往综述按照演化阶段、更新对象、时间、技术机制分类‑。但两套系统哪怕修改同一个组件,如果 AI 接管的决策范围不一样,本质完全不同。本文追踪完整闭环:什么触发改进、谁提出并验证变更、哪些内容被留存、后续决策如何复用这份留存结果。
  2. 以责任归属定义自主性标准
    :其他框架关注能力等级、协同进化、动态智能体状态、AI‑for‑AI 系统‑。本文用 “改进决策从外部设计者转移给 AI” 衡量自主性,而非单纯看模型能力高低、自动化组件数量。五个层级区分执行责任、策略选择责任、经验获取责任、环境适应责任、递归继承责任。
  3. 区分递归结构证据和性能证据
    :评估类综述研究模型评判、智能体打分、提示学习风险等‑。仅仅任务性能更高,不等于改进机制本身被修订、保存、复用。区分:结构性递归(修订后的改进机制,管控下一轮迭代),和有效递归(同等资源、独立评测条件下,这套机制真正产出更强后继版本)。
  4. 跨运行条件对比各类机制
    :纠错、合成数据、终身学习、记忆、提示优化、工作流设计的已有研究解释独立组件如何实现改进‑。本文研究这些组件,在科学、具身智能、软件工程、医疗、工业实践的完整闭环中如何工作。不同场景反馈成本、校验条件、外部管控截然不同‑。跨场景对比同一套闭环,看清哪些方法依赖廉价可执行反馈、大量交互、专家审核、生产环境基础设施。

因此,本文介于 “改进机制清单” 和 “通用 AI 能力层级” 二者之间。目标是厘清现有系统能够接管改进闭环中的哪些部分;留存变更对后续迭代造成何种影响;哪些证据可以支撑递归进展的论断。

2 背景与预备知识

本章建立以自主性视角看待递归自我改进的实证与概念基础。首先分析现代基础模型在不同能力维度进展不均衡,解释为什么持久改进对交互式、有状态、工具调用系统格外重要;然后基于改进闭环的结构定义 RSI,介绍分析改进生成‑验证‑留存‑继承需要的核心概念;区分 RSI 和持续学习、AutoML、智能体 AI 等邻近范式;由于 RSI 横跨学术研究和工业工程实践,明确全文使用证据的类型与可信度。

2.1 现代基础模型不均衡的能力进展

图 3 汇总 2023‑2026 年 9 月,393 条有效 “模型‑基准” 观测结果,覆盖十大能力领域。将报告分数归入协议关联家族:只有基准版本、评估运行环境稳定,或者模型之间评估可合理衔接,才算属于同一个家族。版本、运行环境不兼容的数据保留在审计记录,但不参与能力轨迹绘制。Terminal‑Bench、DeepSWE、CyberGym、ExploitBench、AutomationBench、BrowseComp 等,因为基准版本、评估环境无法建立连贯链路,仅作为参考,不计入轨迹计算‑。

同一模型‑基准‑协议有多份来源报告时,计算加权共识得分:

\(\overline{s}_{m b h}=\frac{\sum_{i} \tilde{w}_{i} s_{i m b h}}{\sum_{i} \tilde{w}_{i}}\)

h代表评估协议,i为数据源。基准官方表格、独立通用评估、模型综合报告、模型作者原始报告,基础权重分别为 3、2.5、2、1;模型第一方报告额外乘以 0.75。这套权重降低模型自报结果带来的偏差。

不同基准原始分数量纲不一致,无法直接汇总。本文引入剩余空间闭合指数(HCI, Headroom‑Closed Index)做归一化。 对于模型m,基准家族b,协议h:

\(H_{m b h}=100 × \frac{\overline{s}_{m b h}-F_{b, 0}}{100-F_{b, 0}}\)

\(F_{b,0}\)代表该基准数据集第一年,模型得分的 90 分位。 \(H_{mbh}=0\)代表基准刚推出时的前沿水平;\(H_{mbh}=100\)代表满分。

针对每个基准家族、每一年,计算 90 分位 HCI 前沿\(Q_{b,y}\)。领域能力轨迹:

\(T_{d, y}=\frac{\sum_{b \in \mathcal{B}_{d, y}} \sqrt{n_{b, y}} Q_{b, y}}{\sum_{b \in \mathcal{B}_{d, y}} \sqrt{n_{b, y}}}\)

\(\mathcal{B}_{d,y}\)为领域d、年份y内有效基准集合;\(n_{b,y}\)代表该基准‑年份组合下不同模型数量。平方根权重让数据更充分的基准贡献更大,但不会被单一基准完全主导。

图 3 跨领域能力轨迹,附带 RSI 拓展的示意。每条曲线代表对应领域每年 HCI 前沿;0 代表基准发布时前沿,100 代表满分。虚线的网络安全代表 Cybench 任务子集、pass@1 聚合规则发生变更。2026 之后区域示意 RSI 助力各领域能力拓展。

得到三条核心观测结论:

  1. 不同领域前沿提升幅度、时间节奏差异巨大
    。截至 2026 年,高等数学、研究生级别科学 HCI 分别达到 86.4、85.8;通用知识 77.2;法律推理 64.5,多模态推理 62.2,前沿学术广度 60.4。 年度增量\(\Delta T_{d,y}=T_{d,y}-T_{d,y‑1}\)反映增长节奏:通用知识连续三年增量 32.8、26.9、17.6,增速放缓;法律推理 2024 年增长 48.2,2025 年 11.4,2026 年仅 4.9;高等数学增速反而抬升,2025 年 32.8,2026 年 53.6;多模态推理 2025 年暴涨 59.7,2026 年仅 2.5。只用单一综合基准,会掩盖各领域水平、增长节奏的巨大差异。
  2. 交互式能力仍存在巨大能力缺口
    。2026 软件工程 HCI=52.6;搜索终端智能体 56.8;工具调用智能体 39.9。对比研究生科学 85.8,归一化剩余空间分别高出 33.2、29.1、45.9。工具调用智能体 2026 年从 8.2 暴涨到 39.9,但依旧是所有类别中最低。网络安全智能体前沿达到 91.9,和工具智能体差距 52.0(注意虚线代表任务子集、聚合规则变化)。

封闭环境、易于验证任务取得的进展,不能直接迁移到长时序、带状态的工作流。这类任务需要规划、环境状态追踪、工具选择、结果解读、迭代行动;错误会沿着执行链路传播;数据集采集、评估必须覆盖完整交互流程。在本文自主性层级体系中,受限基准大多只考验 L1‑L2;环境交互任务更多需要 L2‑L3;长时序交互工作流,会暴露 L3‑L4 所要求的校验、记忆、自适应难题。

  1. 巨大的剩余能力空间凸显 RSI 的潜在价值
    。图 3 中 2026 之后阴影区示意:可靠的持续递归自我改进,可以优先提升仍有大量剩余空间的领域。领域d示意终点:
\(R_{d}=100-0.22\left(100-T_{d,2026}\right)\)

等价于预期提升幅度 \(R_{d}-T_{d,2026}=0.78(100‑T_{d,2026})\)。剩余空间越大,预期提升越高。网络安全从 91.9 提升到 98.2;软件工程 52.6→89.6;搜索终端智能体 56.8→90.5;工具智能体 39.9→86.8。

这个端点是假说:反复生成经验、验证、留存更新、回归测试,可以把改进资源更多导向部署场景下暴露的薄弱工作流。软件工程、工具调用因此成为 RSI 重点研究对象。人工主导迭代,需要反复搭建环境、收集轨迹、定位故障、训练 / 修改框架、回归测试;而 RSI 相关机制,可以从部署观测到的缺陷中提炼经验,沉淀可复用技能、框架变更,缩小上述能力鸿沟。

2.2 递归自我改进的概念基础

智能系统参与改善自身未来表现的思想拥有诸多思想源头:自修改程序、哥德尔机、AutoML、元学习、终身学习、开放式学习,还有近期可以修改代码、提示词、训练流程的智能体系统‑。但这些方向只能覆盖部分问题,无法单独构成 RSI 的完备判据。自动化优化≠自我改进;持续学习≠学习流程本身拥有自主性;AI 产出一份改进,不等于 AI 自身被修改。

因此本文把改进闭环作为基础分析单元。不同底层实现的系统,可以统一回答一组问题:谁生成经验?修改的对象是什么?哪些内容留存到后续交互?谁掌控更新流程?一轮改进输出,是否参与决定下一轮改进。

2.2.1 改进闭环的构成

改进闭环定义:一套循环流程。AI 系统利用经验,提出对目标对象的修改;按照接受规则评估候选;通过校验的变更写入系统状态,再从更新后的状态开启新一轮迭代。

关键组成概念:

  1. AI 系统
    跨改进周期完整的计算实体,包含能力状态;包含生成修改、从反馈生成改动、将已接受更新带入下一轮迭代的全部机制。举例:代码自优化系统,包含生成补丁、运行修改后程序、评估结果、继承版本的全部组件。
  2. 系统状态
    一轮结束留存,下一轮继承的那部分系统。是上一轮传递给下一轮的全部内容。例如系统接受一份更快程序,后续迭代就基于这份程序运行,这份程序就是系统状态。
  3. 经验
    过往交互得到,用于指导后续修改的信息。测试失败、环境输出结果、人工反馈,当它用来指导更新,就成为经验。
  4. 目标对象 Target
    当前轮次直接被修改的对象。代码优化中目标可以是一个排序函数;后续如果修改 “生成代码候选” 这套搜索逻辑,那么搜索逻辑本身就变成目标对象。
  5. 改进器 Improver
    把当前状态、可用经验,转化为候选修改方案的机制。例如读取现有代码、读取失败测试用例,生成补丁的模型,这一轮它就是改进器。
  6. 策略 Strategy
    改进器决定搜索方向、生成候选的方法。策略可以被保存,于是策略本身也会成为后续轮次的修改目标。
  7. 验证器 Verifier
    评估候选方案,执行接受规则。可以是基准分数、单元测试、奖励模型、环境输出、人类反馈、形式化约束、安全检查,或多种组合。
  8. 改进 Improvement
    候选修改通过接受规则,被留存,进入下一轮系统状态。即一份被接受、被继承的状态变更。
  9. 后继系统 Successor
    继承一条或多条已接受改进,带着更新状态开启下一轮迭代的 AI 系统。例如系统保留一份修订后的搜索策略,用这份策略生成后续修改,这个新版本就是后继系统。

由此得到三个贯穿全文的分析问题:

  • 闭环在哪里闭合?
    判断表面上的改进,是否真正回流到系统本体。
  • 什么被更新、被继承?
    找到承载改进的持久载体。
  • 哪些决策依旧外部管控?
    判断有多少改进相关权限,已经从人类、固定基础设施转移给 AI。

这套分析框架适用于所有自动化程度不等的持续改进流程。接下来给出 RSI 额外需要满足的条件:经验必须带来持久的自我变更,同时具备足够自主性;已接受的变更,必须可以影响后续改进的生成、评估、筛选、整合。

2.2.2 递归自我改进 RSI 定义

依托改进闭环组成,递归自我改进 RSI:智能系统,持续与任务、环境、其他智能体交互,自主将获取的经验与反馈,转化为多轮交互过程中针对自身的持久变更(模型参数、智能体框架、改进策略等);这些变更,进一步影响后续自我改进的生成、评估、筛选、整合机制。更新后的系统,带着已经改变的能力状态,进入下一轮交互‑改进循环,让系统自身的改进能力,成为持续递归过程的一部分。

RSI 是一套自主闭环:AI 识别自身局限,开发并验证改进,利用得到的能力优化改进流程本身;追求三大目标:(1) 拓展能力边界;(2) 提升资源效率;(3) 产出超出人类预设策略的创新解。

业界也有不同表述:OpenAI 强调 AI 研究工作流、反馈循环自动化;腾讯报告早期 RSI 闭环,实验结果回流模型开发后续轮次;阿里研究者定义 RSI 关键是改进机制本身可以被修改;Anthropic 描述 RSI 最高形态是 AI 自主设计开发后继 AI 系统。

2.2.3 和邻近范式对比

RSI 与持续学习、AutoML、智能体 AI 存在交集,三者都自动化改进闭环部分环节;但在被修改对象、跨轮留存状态、留给固定流程 / 外部参与者的决策上存在区别。

特征
持续学习
AutoML
智能体 AI / 智能体 ML
RSI
跨轮次学习
持久化留存
系统自我修改
×
候选方案提出
×
更新验证
后继系统重新投入运行
×
×
机制修订
×
×
修订后的机制复用
×
×

✓核心目标;◦次要辅助功能;× 不在该范式覆盖范围。

  • 持续学习 Continual Learning
    :模型 / 智能体从一连串任务数据中学习,同时尽量不遗忘旧能力,包含持续预训练、指令微调、对齐、回放、参数高效更新、基于记忆自适应等方向。但学习目标、更新规则、经验调度、接受测试一般依旧由设计者固定。当经验也可以修订后续自适应的提出、评估、整合流程,修订后的流程被下一轮复用,持续学习才靠近 RSI
  • AutoML
    自动化模型开发决策,包括数据处理、模型架构选择、超参优化、流水线搭建。大模型智能体进一步拓展边界,例如 AutoML‑Agent 构建完整机器学习流水线,ADAS、AFlow、AgentSquare 搜索可执行智能体设计、工作流图、可复用模块。但搜索空间、目标、算力预算、评估器,大多预先给定。当用于搜索、评估改进的流程,变成可被后续轮次修改的持久状态,AutoML 才抵达 RSI 边界
  • 智能体 AI / 智能体 ML
    智能体完成多步任务,调用工具、执行实验、协调组件、修改中间产物‑。MLE‑bench、AI‑Scientist‑v2 研究机器学习工程、科研场景;ADAS、AFlow 自动化智能体、工作流的构建‑。但它们运行在 episode 之内,框架、工具、终止条件、接受标准保持不变。当对智能体系统的有效变更跨任务持久留存,并且影响后续改进的生成筛选,智能体 ML 才接近 RSI

RSI 的核心问题,不只是 AI 参与 AI 开发;而是是否真正围绕系统本体形成持久改进闭环;多大一部分闭环权责已经内化到 AI 自身。

2.3 证据的适用范围

RSI 同时覆盖学术研究、工业工程实践。如果只看同行评审论文,会丢失大量关键系统,很多系统最详细描述出现在技术报告、官方工程博客、开源仓库、模型文档、企业研究材料。当这些材料可以提供改进闭环结构、运行细节的实证,本文予以采纳。

工业实践是当代 RSI 证据的重要来源。很多最先进的自改进闭环,最先在前沿 AI 系统落地,之后才完整写成传统学术论文;其运行细节最先出现在企业研究报告、工程博客、开源仓库、HuggingFace 等模型发布页、公开基准排行榜。这些材料揭示生产环境下改进如何组织、哪些产物跨迭代留存、模型和智能体如何与评估器工具交互、一次实验结果是否能延伸到单次实验之外。

这套更广的证据范围,可以捕捉正在涌现的 RSI 实践,同时严格区分已经得到证明的机制和还只是推论的猜想。

3 RSI 的自主性层级

本文依据 AI 系统接管自我改进的责任范围,把已有 RSI 相关工作整理为自主性层级体系。从只在当前会话内做优化(非 RSI),逐步过渡到持久、自主的系统自适应;最终抵达元改进:生成未来改进的机制本身成为被改进对象

每一层介绍代表性方法、系统,同时回答三个问题:

  1. 改进闭环在哪里闭合;
  2. 哪些改进被留存带入下一轮;
  3. 改进流程中哪些关键决策依旧归人类掌控。

表 2 总结跨层级代表性实现技术。

B0 任务内 AI 改进(非 RSI 参考层级)

B0 层级,改进仅限当前任务内部。AI 可以迭代修改、校验、挑选输出结果,但不会把变更保存为持久系统状态,用于未来独立任务。B0 只是优化输出,不会优化生成输出的系统本体。

例子:编码智能体,在人类给定测试集下反复修复代码,最多尝试 5 轮;全部修改、反馈只属于当前任务,任务结束全部丢弃,下次遇到同类问题依旧从头推导。Self‑Refine、Reflexion、思维树 ToT 都属于 B0:在同一会话内部迭代优化输出结果‑。

B0 四大局限:

  1. 经验无法跨任务累积
    。中间结果、批判、修正只存在临时上下文,不会更新模型权重、可复用记忆、运行规则。同一个错误,这次任务修好,下一次依旧重复犯错;单纯增加迭代次数不能解决。
  2. 改进流程依旧由人类定义
    。AI 生成‑校验‑修改输出,但这套流程本身是人定的。闭环只围绕输出闭合;升级改进机制的责任留给人类。哪怕调用工具、仿真、现实交互,也不会改变边界。
  3. 自生成反馈会放大错误
    。模型同时做生成和评判,二者共享同样知识盲区。Self‑Correction Bench 证明定位第一步推理错误是巨大瓶颈;缺少可靠外部反馈,迭代甚至会把正确答案改成错误答案‑。
  4. 固定评估条件下迭代收益有限
    。没有新增信息,反复改写收益很低;独立采样、外部校验效果往往更好。固定验证器会漏掉部分错误,反复修改代码只为通过不完备测试,分数提升但隐藏大量未被测试发现的故障。

B0 总结:仅在单次会话内迭代优化输出;不改变系统持久状态,不属于 RSI。

L1:改进执行自主性

L1:AI 执行人类预先定义好的改进流程;通过的结果被持久保存,复用在后续任务、后续改进轮次。人类指定目标、更新流程、接受标准;AI 只执行给定改进步骤。和 B0 区别:L1 会改变系统持久状态,而不是只优化单次输出。

L1 闭环简述:人类写完整套改进操作脚本;AI 按脚本执行;产出物持久保存,复用于后续工作流。

L1 遍布现实生产管线。可以划分六大 AI 开发流水线层级:

  1. 数据层
    训练语料的构建、清洗筛选;
  2. 训练方法层
    模型如何学习;
  3. 训练平台层
    大规模训练的执行;
  4. 评估安全层
    模型能力评估;
  5. 部署优化层
    模型高效部署;
  6. 应用系统层
    基座模型能力集成到下游产品。

表 3 L1 代表系统,按 AI 开发流水线分层。L1 系统执行人类定义的改进流程,产出持久产物流入后续工作流。

方法
类型
核心机制
层级局限
数据层



Google 高保真标签构建
数据整理
大模型打标 + 边界样本筛选
打标规则由人类定义
Phi‑4‑reasoning
训练数据筛选
模型打分 + 边界过滤
筛选标准由人类定义
FineWeb‑Edu
数据过滤
模型打分 + 分类器过滤
质量标准由人类定义
NVIDIA NeMo Curator
数据整理
可配置过滤流水线
处理规则人为配置
Data‑Juicer
数据处理
可组合处理算子
处理配方人为定义
Microsoft SynthLLM
合成数据生成
参考引导数据合成
生成流程人为定义
SynthAgent
监督信号生成
任务 + 轨迹合成
生成工作流人为定义
NVIDIA Nemotron‑4
合成监督数据
候选生成 + 奖励过滤
质量维度人为定义
训练方法层



EDIT、REPO
训练信号提纯;后训练流程
故障步骤修订;SOP 引导交互 + 奖励评估
诊断标准人为定义;行为流程人为定义
训练平台层



与智能体无关 C/C++ 优化
训练执行优化
程序性性能优化闭环
优化工作流人为定义
Meta NCCL 智能体调试
故障定位恢复
操作手册引导分布式调试
调试流程人为定义
评估‑安全层



OpenAI HealthBench
模型评估
专家标准自动化打分
评估标准人为定义
部署优化层



AIPC
模型部署
技能引导部署适配
部署流程人为定义
应用系统层



AWS 智能体工具包
模型应用集成
Bedrock 技能引导集成
集成流程人为定义
LinkedIn CAPT
产品工程
分步工程操作手册
实现流程人为编写
OpenAI Harness Engineering
产品开发
约束驱动实现
架构、交付规则人为定义

L1 的核心挑战:

  1. 预设流程必须覆盖运行时遇到的全部情况;遇到脚本没有考虑到的条件,智能体没有可用下一步,也不能自己修改流程。
  2. 多步流程执行必须稳定;一步诊断、转换出错,会污染后续全部步骤。
  3. 产出物会写回系统状态、被后续任务复用;留存前必须校验有效性,否则执行错误会跨迭代持续传播。

数据层 L1

人类定义目标任务、数据特征、校验流程;AI 大规模执行。分两大类:数据清洗过滤;合成数据、监督信号生成。

  • 数据清洗与质量过滤
    :Google 高保真标签流水线,人先定义目标任务判定标准,LLM 大规模预打标,再用聚类、边界样本筛选选出少量高价值样本交给专家标注。Phi‑4‑reasoning,研究者指定难度、推理特征,大模型流水线筛选处于模型能力边界的样本。FineWeb‑Edu 针对网页大规模过滤:研究者定义教育质量标准,LLM 打标,训练分类器大规模执行这套标准。NeMo Curator、Data‑Juicer 把过滤、去重、算子封装为可配置流水线,执行人类给定配方。
  • 合成数据与监督信号生成
    :Microsoft SynthLLM,基于高质量网页内容,按多阶段预定义流程组织概念,生成提示词‑回答训练样例。SynthAgent 执行预定义流水线完成网页探索、任务生成、轨迹精炼,产出 web 智能体训练监督数据。NVIDIA Nemotron‑4,指令模型生成候选,奖励模型按人类预先定义质量维度打分过滤,得到训练样本。

训练方法层 L1

EDIT:研究者指定诊断信号、修订标准;系统定位推理问题步骤,LLM 按照清单修改对应片段,再用修改结果做强化学习校准。REPO:把多阶段标准操作流程 SOP、行为约束写入训练;模型在多轮交互中执行流程;LLM 评判是否遵守流程,转换成奖励信号用于后续策略优化。

训练平台层 L1

  • 执行性能优化
    C/C++ 性能优化智能体,运行时分析,定位性能热点,生成候选代码修改,校验正确性、性能;失败就回滚。
  • 训练故障定位恢复
    Meta 总结 NCCL 超时故障根因,整理成调试决策树、操作手册;AI 智能体执行这套结构化工作流,对齐多 rank 证据,追踪执行序列,定位故障源头。

评估‑安全层 L1

OpenAI HealthBench,医学专家定义医疗对话评估细则;GPT‑4.1 按照这套细则打分,输出评估结果。这套模式可以拓展到鲁棒性、安全评估,为后续模型改进、版本发布提供标准化反馈。

部署优化层 L1

AIPC:把部署经验封装成可验证多阶段流程;给定训练好的模型、目标硬件环境;AI 智能体执行预定义流程:模型转换、处理兼容性、量化校准、校验输出;产出可运行部署产物。

应用系统层 L1

AWS 智能体工具包、LinkedIn CAPT、OpenAI Harness Engineering:把工程实践、产品需求、系统架构、CI/CD 规则写好;编码智能体执行流程,产出代码制品流入后续开发管线。

L1 评估要点:评估两大维度:①执行可靠性:AI 是否正确完成预设流程;②留存安全性:执行产生错误,是否在流入下一轮前被检测。当任务条件超出预设流程覆盖范围,系统无法自主修改流程,会发生故障;产出物持久复用,错误会跨迭代扩散。

L1 结论:L1 在大规模尺度执行人类预先定义的改进流程。人类把工程经验编码为显式步骤与校验规则;AI 针对具体任务执行脚本。产出物被持久保存,进入后续开发,同一套改进流程反复作用在独立任务。

L2:改进策略自主性

L2 层级:AI 不再单纯执行给定修改;AI 基于评估反馈,自主选择下一步尝试何种改进干预手段。但目标、任务边界、接受标准依旧外部固定。AI 分析系统缺陷,自主决定 “该怎么改”。

很多开发工作中,执行改动本身机械简单;真正瓶颈是判断应该尝试哪一种改动。研究者解读失败现象,推断哪个组件存在局限,选择收益不确定的干预手段,观测结果之后再决定下一步。随着候选干预空间膨胀,人工实验决策成为主要瓶颈。L2 系统自动化这一瓶颈:基于观测证据,AI 自主选择下一轮候选干预。这已经接近 “被监督的科研实习生”:人类设定优先级,判断哪些结果值得投入资源、上线;AI 负责把观测证据转化为下一组实验。

L2 闭环简述:人类固定目标、评估标准;AI 分析失败,自主选择改进手段;生成、测试候选变更;通过则留存,用于后续迭代。

L2 按照搜索修改的对象分类:提示搜索、智能体 / 运行框架搜索、模型与训练搜索、系统实现搜索。

提示搜索

GEPA、MPO、Promptbreeder:不只是实例化现成提示,而是从执行轨迹、评测失败中定位缺陷,自主改写提示文本。搜索框架依旧外部给定;但具体修改内容,由评测反馈驱动生成。

智能体与运行框架搜索

ADAS 把智能体抽象为 Python 前向函数;元智能体不断生成候选智能体,在验证数据集评测,保存代码与指标。AFlow 把工作流编码成可执行图,用蒙特卡洛树搜索迭代修改代码,拿执行结果作为反馈。AgentSquare 把智能体拆成可复用模块,通过演化重组,把过去成功结构拿来做新模块的构件。

关键点:智能体可以挑选不同系统配置,但晋升候选的标准依旧是外部维护的评测流程。L2 是搜索更好的系统配置,不等于重新定义什么叫性能达标。

模型与训练搜索

  1. 配置搜索
    给定模型、任务、指标;编码智能体调用 LLM 驱动 AutoML,自主分配哪些配置需要做实验;人类提供约束。
  2. 架构搜索
    AgentNAS 用大模型生成任务专属种子架构,衍生结构化搜索空间,代替完全手工设计搜索空间。
  3. 训练规则搜索
    NanoGPT 评估实验,智能体定位训练瓶颈,修改训练代码、调参、改动训练循环;验证目标、算力资源人为给定。AutoResearch,固定评估指标;智能体反复编辑训练程序,只有验证指标上涨,改动才保留。
  4. 系统实现搜索
    AutoKernel 先做性能剖析,定位瓶颈,生成 Triton/CUDA 实现;正确性、GPU 提速作为外部校验标准。

表 4 L2 代表性系统,按改进策略搜索对象分组。全部属于 L2:AI 自主选择如何改进,但目标、评估标准、接受规则外部指定。

方法
类型
核心机制
层级局限
提示搜索



Promptbreeder
提示搜索
提示与突变协同演化
任务适应度固定
GEPA
提示搜索
轨迹反思 + 帕累托筛选
任务指标固定
MPO
多模态提示搜索
评测反馈引导文本 / 多模态候选生成
任务指标固定
C‑Evolve
提示搜索
固定演化协议内生成候选
协议 + 任务指标固定
智能体与框架搜索



Microsoft Foundry Agent Optimizer
智能体搜索
从失败重写系统提示、技能、工具描述
评估流程固定
ADAS
智能体搜索
元智能体编码 + 归档
基准固定
AFlow
工作流搜索
可执行工作流上 MCTS 搜索
评估器固定
AgentSquare
智能体搜索
模块演化重组
基准固定
自主实验搜索



AutoResearch
ML 实验
编辑‑训练‑评估循环
度量指标固定
GPT‑6 Astra NanoGPT
训练规则搜索
智能体定位瓶颈,编辑训练代码调参
验证目标、算力固定
AgentNAS
架构搜索
LLM 生成种子架构 + 衍生搜索空间
验证度量固定
AutoKernel
内核实验
剖析‑重写‑基准测试循环
正确性、速度标准固定

L2 评估要点:拥有更大策略选择空间,不等于真正高质量的自我改进。更大搜索空间,也会出现搜索低效、利用评估漏洞、迭代后收益消失等问题。反复访问开发集,会造成基准过拟合;增加搜索算力,容易被误判为算法层面改进;大模型评判器会和生成方共享盲点。工业报告可以证明可行性,但不能等价于独立可复现实验。

L2 结论:L2 把人类工作,从逐个提出改进方案,转变为约束改进搜索空间。人类依旧指定目标与接受标准;不再需要逐个构思干预手段。瓶颈从执行已知改进,转变为在可能性空间搜索合适改进。

L3:未来学习经验的自主性

L2 回答 “如何改进”;L3 新增权责:决定接下来应该获取什么样的学习经验。系统基于自身能力现状、失败记录、学习历史,自主挑选、生成、寻找接下来要学习的素材;学习之后改变系统状态,这份变更反过来影响后续经验选择。

L3 闭环简述:人类给定目标、评估器、学习规则;AI 分析自身强弱;自主决定接下来获取哪些经验;从经验中学习,更新系统状态;更新后的状态再改变下一轮经验选择。

关键点:必须存在闭环 ——学习者自身状态,影响接下来获取什么经验;学习产生持久变更,又再次改变经验获取决策。一次性过滤、一次性收集数据不等于 L3。

两条典型实现路径:①自适应任务生成、自博弈;②通过环境交互自主练习。

图 5 L3 两种实现范式:学习者条件驱动未来经验获取。上图自适应任务生成与自博弈:生成适配学习者能力的新训练任务。下图环境交互自主练习:智能体观察环境、自身技能,挑选下一个练习目标。二者持久更新,反过来重塑后续任务生成、练习选择。

自适应任务生成与自博弈

SSP(搜索自博弈):求解器性能变化,直接改变命题方的奖励信号,任务分布自动演化,不需要人工逐批重新设计任务。AZR:可执行任务生成,任务可求解性的奖励引导命题;代码执行器校验任务、解。R‑Zero:挑战者‑求解器架构;依靠多轮回答一致性作为难度代理信号,不需要外部标签。STP:猜想器‑证明器协同;猜想器生成当前证明器勉强可以证明的命题,作为训练素材。PSV:形式验证场景,求解器给出难度标签,引导生成新的规范;用编译性、形式校验检查候选方案。VisPlay(多模态):提问器奖励偏向置信度处于中间的问题,同时加入多样性惩罚;推理模型能力变化,会改变后续提问分布。

表 5 具备 “学习者条件驱动经验获取” 特征的代表性闭环。约束描述讨论闭环的边界,不等于系统所能达到的最高整体层级。

方法
目标对象
学习者条件驱动机制
外部指定约束
SSP
搜索智能体
求解器性能塑造命题方奖励、后续搜索任务
奖励设计、训练流程
AZR
推理模型
依赖求解器的可学性奖励,引导可执行任务生成
任务格式、代码执行器、更新规则
R‑Zero
推理模型
回答一致性提供难度代理,塑造挑战者任务
不确定性奖励、伪标签、优化规则
STP
定理证明器
当前证明器前沿附近的猜想训练猜想器
形式域、证明校验、训练规则
PSV
编码模型
求解器给出难度标签,引导规范生成
形式验证器、难度方案、训练配方
VisPlay
多模态模型
回答一致性、多样性奖励引导视觉提问
图像源、奖励设计、优化规则
VOYAGER
具身智能体
智能体状态、探索历史指导目标;技能持久保存
Minecraft 接口、课程提示、技能表示
SIMA 2
具身智能体
完整 ASKA 配置下,评估反馈把练习资源导向薄弱技能
任务设定器、奖励标准、训练流程
SEAgent
计算机使用智能体
轨迹反馈更新软件指南,反过来塑造后续任务
软件接口、评估模型、学习流程

通过环境交互实现自主练习

VOYAGER(Minecraft):维护可执行技能库;智能体当前状态、探索历史决定新目标;成功行为沉淀为可复用技能,影响后续尝试。SIMA 2:ASKA 完整配置,奖励模型评估能力,把练习资源投向薄弱技能。SEAgent:世界状态模型分析 GUI 轨迹,更新持久软件指南,再由指南生成后续练习任务。

L3 评估要点:拥有自主选择经验的权力 ≠ 获取的经验就具备价值。评估需要同时看反馈机制本身,以及这套机制带来的实际收益。

  • 控制变量实验:冻结经验获取模块的学习者输入,或者替换为和学习者无关的固定课程;保持算力、交互预算完全一致,对比效果。区分 “自适应选择经验带来的收益”,和单纯增加训练资源带来的收益。
  • 区分正确性、难度、学习增益。可执行、形式校验可以保证场景内正确性;一致性只能作为难度代理,不等于对未来学习真正有用。
  • 经验污染风险
    :有误导性的经验、错误反馈,会扭曲后续学习与任务选择;错误记忆、错误技能会跨轮传播。需要做多轮性能追踪、经验多样性、迁移到全新任务的测试。

L3 结论:L3 新增对未来学习日程的自主性。系统基于自身演化出的能力、失败、历史,挑选、生成、寻找接下来学习的素材;持久学习的结果反过来影响后续经验获取决策。目标、评估器、学习规则依旧人为设计;经验自主性只是这套框架内做出决策,本身不能保证产出高质量、可靠的学习。

L4:部署与环境适应自主性

L3 重点:获取什么经验来学习L4 重点:真实部署交互产生的经验,如何修改记忆、技能、执行组件,用于后续任务。客观目标、访问边界、受保护评估标准、重大版本上线权限依旧外部管控。

L4 闭环简述:系统运行在真实环境;从交互轨迹提取经验;修改记忆、技能、框架、代码、参数;更新后的系统改变后续任务行为,也改变后续可获得的反馈;人类保留目标、接受标准、访问边界、重大发布的最终权限。

三大核心机制:①轨迹提炼;②智能体系统迭代修订;③更新方案的筛选留存与上线部署。

图 7 L4 部署环境适应自主性概览。在人类给定目标、部署约束之下,AI 从真实任务、变化环境交互证据中,确定哪些经验结果持久保存,影响未来行为。经验可以提炼成可复用产物;用于修订智能体持久组件;经过评估筛选之后留存;被后续任务复用,闭合持久自适应闭环。

轨迹提炼(Trajectory distillation)

把交互历史压缩成跨会话可用的持久产物。

  1. 文本经验记忆
    Dynamic Cheatsheet 维护一份持续演化笔记;ACE 维护带计数的上下文条目;ReasoningBank 把判断后的轨迹提炼成简短推理策略,后续任务检索使用。
  2. 结构化记忆
    APEX 构建里程碑依赖图;PersonaAgent 围绕用户构建记忆;MemToolAgent 存储工具调用失败的批判、检索策略。
  3. 过程化技能库
    Trace2Skill、PRACTICE、PANDO、PILOT:从大量运行轨迹提炼可复用流程、技能;在线或者离线批量维护技能库。
  4. 可执行产物(代码工具)
    Metis 同时维护文本计划库和可调用代码工具库;Evo‑Harness、SHAPER,把经验编译成框架、Python 可执行规划代码。

迭代修订智能体系统

不再只修改记忆,而是修改智能体本身:求解器、评判生成器、运行框架、权重。

  • DecoEvo:协同演化求解器技能与评判生成技能,二者目标解耦,避免评判器变简单造成虚假高分。
  • HarnessDev:智能体从零构建运行框架,基于下游反馈迭代修订;候选版本在隐藏任务冻结评测。
  • ASPIRE:给定模糊目标,智能体自主选择数据、更新方式、评估信号;分数不提升就回滚变更。

更新的选择性留存与部署

  1. 候选校验
    HDSO,假设驱动技能优化;同一任务跑对照组(当前批准库)、实验组(新增候选技能);只有对比实验支持假设,才允许入库。Metis:文本计划只有多次重复出现、编译沙盒校验通过,才升级为可调用代码工具。
  2. 库生命周期维护
    Library Drift 指出无限累积技能会降低检索质量;需要追踪每条技能贡献,淘汰贡献衰减的条目,设置库容量上限。
  3. 受治理的生产部署
    Tax‑AI 真实业务案例:故障证据汇总为评估目标;编码智能体完成修复;必须经过定向测试、回归测试,再走人工评审 PR 流程才上线。无法处理的案例退回从业者。

L4 评估要点:获得部署自适应的自主权,不等于自适应过程就可靠。一份更新被保存,不能保证任务、环境、智能体变化之后依旧有用。 风险:从噪声证据中学习错误经验;把有效的经验用在不适用场景;不会调用已有的有效更新;更新之后旧能力退化。仅凭最终任务分数,无法区分上述机制。评估需要追踪每一份留存更新来自什么证据,后续任务如何使用这份更新,对新旧任务分别造成什么影响。

大多数评估只覆盖有限任务流;长时间反复评估成本很高;反馈本身可能存在噪声、内生性;留存的产物就算写进记忆,也未必真正在执行中被调用。

L4 结论:L4 的自主性,从 “选择经验” 推进到 “决定部署交互中哪些经验沉淀下来”。智能体把交互历史转化为记忆、技能、框架、代码、模型参数的变更;这些变更改变后续任务、后续反馈。人类保留客观目标、受保护接受标准、访问边界,重大发布的最终权限。L4 聚焦部署系统内部的运行时自适应。

L5:从环境适应走向元改进(递归元改进)

改进流程本身也会成为瓶颈。例如编码智能体反复生成同类无效补丁,根源是搜索流程本身有缺陷;研究智能体过度优化代理指标,但代理指标不再能反映现实性能。修复这类故障,需要修改 “做实验、评判结果” 这套底层流程。设计这套流程本身成本高昂;修改完,必须通过多轮迭代观察后继改进的产出质量,才能评估修改是否真的有效。

L5 定义:AI 持续修改管控未来改进的底层机制,修订后的机制投入后续轮次使用。可修改对象包括改进器、后继评估器、搜索策略、研究方向决策流程。 L2 是找干预手段;L3 决定获取什么经验;L4 处理部署反馈完成自适应;L5 更进一步:管控未来改进的流程本身,成为改进的目标对象。

图 8 环境适应到递归元改进对比。(a) L4:智能体自适应,但改进流程固定不变。(b) L5 递归元改进:诊断改进流程本身的缺陷,修订这套流程,把验证通过的变更传给后继系统。元更新可以作用于后继生成、候选评估、研究管控。人类定义使命、安全边界、受保护评估、最终接受权。

区分两个概念:

  • 结构性 L5
    证明 AI 主导的变更被持久保存,并且确实管控下一轮改进迭代。
  • 有效 L5
    证明同等算力、独立评测条件下,这套修订后的机制,可以产出或者筛选质量更高的后继版本。

仅仅修改任务代码,不足以证明 L5;如果负责后续修订的底层流程没有变化,只是任务代码变了,只是 L4。反过来,就算任务智能体代码不变,只要评估器这套元机制被修改、继承,也可以达成结构性 L5。

修改搜索生成流程

STOP:改进器本身的 Python 源代码成为优化目标;后继改进器的评判标准,是它产出程序在下游迁移任务上的表现;选出的改进器继续参与下一轮自我改进。第四代改进器,在全部 5 个未参与自改进的迁移任务上,表现优于种子版本;但是弱模型运行会出现性能退化,部分生成程序绕过预算、利用评估 bug。

Gödel Agent:智能体可以读写任务策略,也读写自我更新逻辑;反馈改写整个 Python 程序,下一轮递归调用运行新版本。100 次 MGSM 优化实验中,14% 轮次结果比初始版本还差。任务目标、运行权限依旧是外部硬性约束。

Darwin Gödel Machine (DGM):维护编码智能体谱系;但是归档管理、父代筛选规则,依旧不在自我修改范围之内。HyperAgents,任务智能体和元智能体代码全部开放修改;演化出来的元智能体生成性能追踪器、持久记忆,指导后续修改。

修改后继版本的评估器

Red Queen Gödel Machine (RQGM),解决评估器和求解器协同演化带来的评分不可比问题。每个周期内评估器冻结;到达周期边界,挑战者评估器对照独立真实锚点做校验;通过的评估器管控下一个周期;受旧评估器影响的分数作废,智能体重新评估。在 held‑out 编码任务上得到 71.7% 通过率,基线 HGM 为 69.9%,同时搜索 token 消耗更低。锚点、替换调度、编排流程依旧外部固定。

修改研究目标与策略

A‑Evolve‑Training:30B 模型四轮自主后训练。收集 worker 配方变更、检查点评估、失败案例;元智能体修订下一轮搜索策略;策略包含可用配方、晋升 / 淘汰搜索方向、失败方法注册表。当代理指标上涨,现实收益不涨,修订后的策略就引导 worker 去做能提升外部指标的干预。最终排行榜分数 0.86;人类最优提交 0.87。跨轮继承物是研究策略、发现日志;底层 worker 基座、顶层约束保持不变。

工业实践视角

Meta AIRA2、Anthropic 自动化对齐研究员,自动化实验执行,但研究流程本身没有被证明发生继承式修改。Weco AIDE2:用研究智能体改进研究智能体运行框架;候选框架在私有打分、固定算力预算下运行;通过版本留存用于后续科研;但演化后的外层改进器,并没有统计显著的效率增益。

L5 评估要点:区分 “当前智能体变强”,和 “这套机制可以稳定产出更强后继版本”。 评估维度:适应性、留存能力、迁移能力、效率、稳定性、元递归能力。需要对比原始、修订后的改进机制;初始系统、证据、算力预算全部对齐。把演化后的机制冻结,在全新任务上运行,检验改进策略是否具备可迁移性。

目前已有有界元改进实证:改进器、评估器、研究策略的修改,可以管控后续轮次;部分变更跨任务迁移。但是:同等资源条件下,多代持续累积的可靠证据依旧缺失。实践目标:单位算力、单位人工审核,获得更多经过验证的改进。强基座模型、执行基础设施、独立评估,依旧是这套约束下运行的基础资源。

L5 结论:L5 让改进流程本身可以被继承。闭环闭合方式:复用被修订过的改进器、评估器、研究策略。后继系统继承这套机制以及支撑证据;人类保留整体目标、受保护接受标准、资源权限。

3.7 跨层级综合总结

B0‑L5 层级体系,本质是改进闭环上责任逐步转移。层级的差异不在于具体算法、优化对象;而在于:哪些改进决策被 AI 内化;哪些状态被保存到下一轮;哪些接受条件依旧外部保护

相邻层级核心分界:

  • B0 → L1:持久化:变更存活到当前任务会话之外。
  • L1 → L2:策略选择:AI 决定尝试什么干预,而不是单纯执行给定干预。
  • L2 → L3:掌控后续学习日程:学习者状态,影响接下来获取哪些经验。
  • L3 → L4:拓展到部署真实环境交互;系统变更必须在持续变化的运行条件下保持有效。
  • L4 → L5:递归继承:管控未来改进的那套机制,本身成为可被改进、可被继承的对象。

重要提醒:更高自主性等级,不等于改进质量就更好。更大的授权,完全可以和低效搜索、不可靠反馈、能力退化、利用评估漏洞、迁移效果差同时存在。因此必须区分两件事:AI 接管改进责任的范围;这套改进流程产出的质量与效率。

现有证据分布:L1‑L2 系统证据非常丰富;L3‑L4 高度依赖领域;完整端到端 L5 证据只存在于受限原型、萌芽期工业系统。这也促使后文分应用场景分析。

4 多应用场景下的 RSI

在自主性层级框架划分系统权责之后,本文研究 RSI 在不同场景的落地。不同应用,待修改对象不同,校验、留存更新所需要的反馈条件完全不同。本文选取四大场景:S1 科学发现,S2 具身智能,S3 软件工程,S4 医疗健康。同一套 RSI 思想,在每个场景面临独特反馈环境。

每个场景遵循统一结构:描述典型 AI 工作流;RSI 闭环如何从中产生;该场景 RSI 核心挑战;梳理代表性系统,看它们修改什么对象、如何留存改进;对比现有研究和完整 RSI 愿景之间的差距;梳理场景特有风险,迈向更高层级的关键阻碍。

图 9 不同应用场景核心瓶颈:安全可靠的证据,用于持久继承。科学、具身智能、软件工程、医疗,每个场景可获得反馈类型不同,当前发展所处的自主性层级也不同。

S1 面向科学发现的 RSI

科学发现是 RSI 价值极高的场景:科研进步,不只是得到某一个分子、某一条公式;还要提升未来提出问题、生成假设、开展实验的整套机制。 面向科学的 RSI 不只是自动发现一个科学结果;闭环从科研挑战出发,生成假设、开展计算或物理实验;从证据、证伪结果定位 AI4Sci 系统自身缺陷。

三大核心挑战:

  1. 科学发现是开放式探索。假设、工具、实验空间事先未知;实验成本昂贵,探索本身成为问题的一部分。
  2. 科学反馈稀疏、延迟,故障溯源模糊。一次失败实验,可能来自错误假设,也可能来自模型、实验流程、仪器故障,很难定位根源。
  3. 科学结论有效性依赖前提假设、领域、测量流程。一份在某个条件下有效的更新,想要安全继承,必须记录来源、适用边界、不确定性。

本文从三个可演化组件展开分析:科学假设模块、实验智能体、反思改进器。

  1. 演化科学假设模块
    HypoForge,把科学经验提炼成可复用假设生成、实验设计技能;缺少直接实证反馈时依靠判别器批判;拿到真实实验结果再精炼测试技能。EvoScientist 维护创意记忆,保存成功、失败研究方向,检索影响后续提案。TTT‑Discover 测试时做强化学习,实验反馈修改模型权重;聚合物发现框架,把仿真验证候选加入训练数据重新训练生成模型。目前大多还是任务、领域特定改进,没有实现跨领域持续生成假设的通用机制。
  2. 演化实验智能体
    Test‑Time Tool Evolution、CASCADE、S1‑NexusAgent、SkillFoundry:生成、修复、积累可执行科研工具与技能库。DrugSAGE、STELLA、EarthLink、OriGene 沉淀验证过的建模流程、推理模板、脚本、分析协议。流体控制自演化智能体同时修改智能体定义和它生成的白盒控制器。

关键点:评估重点,不是工具库规模膨胀,而是这些技能可以在后续全新任务上被有效复用。必须明确技能前置条件、执行测试、溯源版本、回滚能力;否则局部成功的工作流会被错误用到不满足前提的场景。

  1. 演化反思系统与改进器
    SIA,反馈智能体在多种策略之间做选择:修改智能体框架、工具、重试搜索逻辑、LoRA 权重。CORAL 异步多智能体系统,自主审视过往尝试,决定何时调用评估器,把发现沉淀为共享的尝试记录、笔记、可复用技能。SAGA,高层科学目标不变前提下,诊断候选群体故障模式,提出、重加权具体目标,生成可执行打分函数引导后续搜索。

现状与差距:B0 单会话结果精炼已经普及;L1 持久更新通过重训练、记忆积累实现;L2 是当前最强前沿:系统自主选择对权重、工具、技能、工作流、框架做更新;部分系统具备 L3 特征,自适应探索、跨任务复用经验;端到端 L4 环境自适应、L5 改进器自身演化,依旧大量待探索

迈向真正科学 RSI 的阻碍:实验结果可靠归因;跨任务选择性迁移改进;评估连续系统更新是否真正改善未来科研;同时维护溯源、可复现性、科学安全约束,当越来越多组件变得自适应。

S2 面向具身智能的 RSI

具身智能体依靠自身动作在仿真 / 物理世界生成观测,天然适合 RSI。但三大挑战:

  1. 经验内生性
    :当前策略决定智能体会到达哪些状态,进一步决定后续学习可用证据。
  2. 能力分散在感知‑规划‑控制整个传感运动系统
    ;故障很难归因到单一组件。
  3. 物理实验不可自由复现、回滚;候选更新必须在安全、硬件、资源约束下评估。

具身 RSI 闭环:环境与课程提供学习任务;智能体框架组织能力;策略执行动作;世界模型、评估器解读结果;经过验证的反馈回写组件,更新后的系统进入下一轮交互迭代。

分析四大可演化对象:环境与课程;技能记忆与智能体框架;策略与动作模型;世界模型与评估器。

  1. 演化环境与课程
    POET 协同演化环境‑智能体对;EnvGen 用 LLM 设计模拟器配置;GenEnv 把模拟器参数化为可训练课程策略;OMNI‑EPIC 用 LLM 生成可执行环境与奖励代码;SimWorld Studio 编写 Unreal 可执行环境代码,用编译报错、物理校验、多模态批判迭代生成三维训练世界。
  2. 演化技能、记忆与智能体框架
    VOYAGER、LRLL、EmbodiSkill:技能库持续生长、重组。SHAPER、ASPIRE、ENPIRE:拓展修改对象,从单一技能,到整个智能体架构、机器人策略、训练流程、底层基础设施。
  3. 演化策略与动作模型
    Self‑Improving Embodied Foundation Models、MEDAL++、Q‑Planning、SERP:从交互轨迹更新策略、价值函数、重规划逻辑;但更新算法、奖励定义、模型组件集合依旧预先给定,大多属于策略层面自改进。要安全继承更新,必须预测、评估动作带来的实际因果后果。
  4. 演化世界模型与评估器
    VLAW、World‑VLA‑Loop、Motus2、SAIL:策略失败改进世界模型;改良后的世界模型提供更可靠仿真经验,用于策略下一轮优化。协同演化,但顶层目标、更新流程依旧外部给定;属于有界协同进化,并非无约束递归改进。

现状与差距:B0 会话内重规划广泛存在;L1 基于具身经验完成策略‑模型更新已经证明;L2 是主要前沿:在固定评估条件下,自主选择更新技能、提示、控制程序、智能体框架;部分系统实现 L3:基于学习者状态生成经验、跨任务复用验证技能;仿真环境中已经出现 L4 智能体‑环境协同进化;ENPIRE 接近受限 L5,可以修改策略、训练流程


【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2208
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读46.3k
粉丝0
内容2.2k