大数跨境

字节Seed同一天连发三篇RSI论文,直指闭环自我进化!

字节Seed同一天连发三篇RSI论文,直指闭环自我进化! 智猩猩AI
2026-09-13
16
导读:从半闭环到闭环 RSI~
智猩猩AI整理
编辑:林夕

2026年9月1日,ByteDance Seed与TokenWave发布了一个名为Self-Developing Agents的项目,三篇论文同步挂上arXiv。


项目页直接把它定义成:

From Half-Loop to Closed-Loop RSI


也就是从半闭环的递归自我改进,走向真正的闭环RSI。



在研究团队看来,今天很多所谓的RSI系统,看起来已经形成了一个循环:模型执行任务,获得反馈,根据反馈修改自己,然后再次执行。


但这个循环里,依然有一个隐藏的人类“Golden Verifier”


人类提前告诉模型应该优化什么,提供评价标准,设计验证器,再让模型沿着这条路不断寻找更好的答案。


所以模型虽然在“自己改自己”,但它并没有真正决定自己应该往哪里进化,这就是所谓的Half-Loop


真正的Closed-Loop RSI,则需要把缺失的那一半补回来。


项目没有直接宣布RSI已经实现,反而做了一件更有意思的事情:把现在的Self-Improvement为什么还没有形成真正闭环,拆成了三个具体问题。


  • Aspire:AI能不能从模糊目标中决定自己该改什么?



  • S³Gym:AI能不能从自己的经历中判断什么值得学习?



  • HarnessDev:AI能不能进一步修改自己的Agent工作方式?



01

Aspire:模糊目标首先消耗的

不是算力,是判断力 


传统的Self-Improvement通常从一个已经定义好的任务开始。


研究人员告诉模型要提升数学能力,再给出训练数据、Reward和验证集,模型只需要在这个明确的优化空间里不断寻找更好的结果。


但如果把这些东西全部拿走,只告诉Agent一句:“提升数学推理能力。”


事情马上就变了。


它首先要自己回答:应该学习什么?需要什么数据?采用什么训练方法?怎样判断训练有没有效果?什么时候应该停止?


也就是说,模型不再只是执行优化,而是必须先定义自己的优化问题


这正是Aspire要解决的问题。



论文设计了6个能力目标,并准备了一个由专家构建的520道题隐藏评测集


Agent看不到最终测试题,也没有一个明确的下游Benchmark告诉它应该往哪个方向优化。


它需要自己完成一整套循环:


理解目标 → 选择学习方向 → 构造数据和训练信号 → 更新模型或Harness → 自我评估 → 再决定下一步。



真正的效果,最后由隐藏评测集来判断。


Aspire一共进行了30个实验单元,其中28个产生了可以进一步评估的checkpoint。


但真正能够在隐藏评测中留下有效提升的,只有1个


模型并不是不会训练,恰恰相反,它可以非常顺利地完成数据生成、训练、Harness修改等一系列操作。


真正困难的是它很难判断自己到底应该优化什么。



实验中,Agent经常会选择与最终目标并不完全匹配的数据,或者依赖过于狭窄的自我评测。


更麻烦的是,即使某一次训练真的带来了局部提升,继续训练也可能把之前的提升重新抹掉。


这就暴露出了RSI的第一个核心缺口:Target Formation


人类通常默认目标已经存在,但对于真正的自我进化系统来说,目标本身也需要被理解、拆解和验证。


Aspire实际上是在问:如果没有人告诉AI具体该优化什么,它还能不能自己找到正确的优化方向?


目前的答案并不乐观。


02

S³Gym:经验不会自己

长进下一次决策 


如果Aspire解决的是我应该改什么,那么S³Gym进一步追问:过去发生的事情,能不能真正改变未来的行为?


对于人类来说,这是一件非常自然的事情,一次任务失败之后复盘,找到问题,下次遇到类似情况时换一种策略。


但Agent拥有经验,并不意味着它真的能够从经验中学习。


它可以保存完整的History,也可以把历史压缩成Summary Memory,甚至可以直接通过参数训练,把过去的经验写进模型。


问题就在这里:哪一种方式真的有效?


S³Gym把这个问题拆成三个步骤:


Self-Testing → Self-Judging → Self-Improvement。



Agent首先与环境交互并产生经验,然后自己测试和判断哪些行为有效,最后把这些判断用于下一轮决策或者模型更新。


研究团队设计了7个带有可执行Verifier的文字游戏环境,并比较了三条经验利用路径:


History ICL、Summary Memory、Parameter Training。



History直接保留过去发生过什么;Summary Memory尝试把过去压缩成更抽象的策略;Parameter Training则试图直接把经验写进模型参数。


结果并没有出现一个能够通吃所有环境的方案。


在不同游戏里,History和Summary各有优势。



有些环境更适合保留具体的历史状态信息,因为下一步决策高度依赖过去发生的细节;另一些环境则更适合把经验压缩成可以反复使用的策略规则。


而参数训练虽然在部分任务上确实可以带来提升,但稳定性并不好,还可能出现明显的负迁移。


更夸张的是,在Qwen3-8B的连续checkpoint实验中,模型在某些环境里的性能并没有随着训练持续上升。


其中PvZ任务的表现甚至从23一路下降到6,之后长期停留在较低水平。



而S³Gym最值得注意的结果是Agent的自我判断并不可靠。


如果模型能够准确判断自己刚才的经验是否有价值,那么理论上,它的Self-Judging结果应该能够预测下一轮性能变化。


但实验显示,两者几乎没有相关性,论文报告的相关系数只有:ρ = −0.010 和 −0.018。



AI认为“这次经验很好”,并不意味着下一次真的会做得更好。


这就对应了RSI的第二个核心问题:Experience Integration。


真正的自我进化不能只是把历史存下来,也不能只是让模型自己总结。


关键在于这些经验能不能真正转化成下一次任务中的能力,如果不能,那么所谓的“学习”就只是记忆,甚至可能变成负迁移。


03

HarnessDev:能跑通的 harness,

不等于留下了真实机制


前面两个实验分别解决了改什么和怎么从经验中学习。


但对于Agent来说,还有一个经常被忽略的问题:这些能力到底应该被放在哪里?


一个Agent真正执行任务时,影响结果的不只有模型参数。


它怎么拆任务、什么时候调用工具、如何管理Memory、如何保存状态、怎样组织执行流程,同样会决定最终效果。



这整套位于模型之外的执行基础设施,就是Agent Harness


HarnessDev因此把自我进化的对象进一步扩大了:不仅让模型改自己,还让Agent学会修改自己的工作方式。



HarnessDev的整体流程可以概括为:


Seed Harness → Task Execution → Feedback → Harness Revision → New Harness → Held-out Evaluation。



首先给模型一个最小的初始Harness,让它自己构建出完整的Agent执行系统。


随后不断执行任务,根据真实运行结果寻找问题,再修改Harness。


和普通的代码生成最大的区别在于:修改之后的Harness必须真正运行起来。


因为一段代码里写了Memory,并不意味着Agent真的会使用Memory。

实验中,模型一共生成了18个Code Harness,而这些Harness全部能够运行。


但研究团队进一步检查发现,一些Harness在代码层面加入了State Management、Memory等机制,实际执行过程中却根本没有出现。


这意味着,代码中存在一个机制,不等于运行时真正拥有这个能力。


而在后续的Harness Evolution中,模型修改最多的也不是Memory和State Management,而是Execution Flow和Tools。


这说明模型确实能够修改自己的系统,但它并不一定知道:究竟什么才是影响最终性能的关键。


所以HarnessDev真正关注是它修改出来的东西,能不能在新的任务里继续有效。


这也是为什么实验专门加入了held-out任务。


在64次可以进行比较的版本切换中,只有34次的可见任务变化方向与held-out任务一致,也就是:53.1%的方向一致率。


最终9个被Agent自己认为最好的版本中,只有2个在held-out数据上真正达到最优。


自我修改和自我改进,是两件完全不同的事情,Agent可以非常积极地修改自己。


但如果这些修改不能迁移到新的任务,它就只是“变化”,还不能叫“进化”。


04

距离真正的“自己进化”,

还有很长一段路


三篇论文给出的结果并不是AI已经学会自己进化,恰恰相反,大量实验都在说明,这件事现在还非常不稳定。


AI可以自己生成训练方案,可以自己总结经验,也可以自己修改Harness。


但每一步都可能出现问题,最关键的是,局部变好,并不等于整体变强。


在一个测试集上拿到更高分,不代表换个任务还能继续提升;总结出一条经验,不代表下一次真的会用;代码里加入一个机制,也不代表运行时真的会触发。


这也是项目页里最值得注意的一句话:


“The goal is not constant change. It is knowing which changes to keep.”


让AI知道:什么值得改,什么真的有效,以及什么应该留下。


如果说过去的Agent是在完成任务,那么Self-Developing Agent想做的事情显然更进一步:让Agent开始参与自己的成长过程。


这条路现在还远没有走通。

END


关注+星标,获取AI前沿进展与开源一线动态



【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2350
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读3.2k
粉丝0
内容2.4k