大数跨境

Agent“自我进化”改的是探索策略,没走过的路仍要真跑

Agent“自我进化”改的是探索策略,没走过的路仍要真跑 AI大模型智能体前沿
2026-09-27
3
导读:Dream-RSI 不改 coding agent 的模型或评测器,而是让探索策略先在历史搜索树上回放,再进入真实搜索。

导读Dream-RSI 讨论的“自我改进”,不是底层大模型改写自己的权重,而是长程 Agent 调整下一步该从哪里搜索、并行尝试多少方向、何时停止。它先把真实搜索留下的分支、代码和评测结果记录成树,再让候选探索策略在这批历史上回放比较,最后把选出的策略送回真实任务。关键边界也在这里:回放只能重新安排已经发生过的探索,没走过的路仍然要在线尝试。

本文 1635 字,阅读约 4 分钟|“Agent 自我进化”改的是哪一层 → 真实搜索先留下树,策略再在树上回放 → 回放能走旧路,不能替新路造结果 → 一组 Lasso 数据,分别回答两个问题 → 哪些工程条件值得先看

“Agent 自我进化”改的是哪一层

“自我改进”容易让人联想到模型改参数或提示词。Dream-RSI 改的是另一层:论文保留底层 coding agent 和评测器,只把决定搜索如何展开的探索策略做成可修改的程序。

这个策略管的是流程:下一轮从哪个工作区继续,要不要开一条新分支,几个尝试并行,以及什么时候停。它不负责写出最终算法,也不替评测器判定答案好坏。前者由 coding agent 生成候选,后者按任务目标运行代码、返回诊断和分数。

真实搜索先留下树,策略再在树上回放

第一步仍然是真实运行。当前探索策略安排 coding agent 从某个工作区继续,Agent 生成代码或解法,评测器执行并返回结果。系统把每次尝试连成一棵发现树:节点保留从哪里开始、生成了什么、执行结果如何、分数是多少。

图片说明:在线探索、历史回放与策略再次部署的三阶段闭环 图片来源:Dream-RSI 论文 Figure 1

有了这批记录,系统进入离线回放。它把探索策略重置到树的起点,再按策略的选择逐步揭示原来已经发生过的分支。候选策略从同一历史重新开始,在当时可见的记录范围内选择分支、安排并行或停止。由于代码执行和评测结果已保存在树里,比较这些走法时不必再次调用 coding agent 和评测器。

回放的分数也不是只看“找到过的最高分”。论文把三件事放在一起衡量:目前找到的最好结果、为此展开了多少次尝试,以及有多少尝试能并行完成。多开分支可能更快覆盖搜索空间,但也会增加生成与评测请求;过早停掉分支省了调用,也可能漏掉后续改进。策略得在这几项之间取舍。

接着,负责改进策略的 LLM Agent 查看各版本的回放轨迹和分数,修改探索策略代码,再把新版本放回同一批历史中比较。这里省去的是反复在线生成、执行候选解的开销,策略开发环节本身仍会调用模型。入选的策略才会进入下一轮真实搜索;新一轮产生的新节点,又加入之后的回放历史。闭环发生在“搜索策略”这一层,不是底层模型权重在闭环里自我训练。

论文全文: https://arxiv.org/abs/2609.14858方法说明与交互演示: https://dream-rsi.com/

回放能走旧路,不能替新路造结果

“模拟器”这个名称容易让人以为它能推演未知结果。Dream-RSI 的回放器只读取已记录节点的真实结果;遇到历史中没有后续记录的地方,就没有新结果可揭示。

因此,回放回答的是“另一套策略会怎样分配这批已发生的尝试”,不能回答“全新候选运行后会怎样”;后者仍须由 Agent 生成、再交给评测器验证。

回放也不是把完整历史摊开,让策略事后挑最高分的路线。每轮开始时,策略只看到当前已揭示的部分;它先决定从哪里继续,系统才把那一步在历史中对应的结果交出来。之后策略再根据新看到的信息作决定。这样比较的才是“在当时能看到这些结果的条件下,策略会怎么走”,而不是让它偷看尚未出现的反馈。

论文的策略选择规则也有类似边界:当前策略本身是候选之一,系统从同一批旧树的平均回放分数中选出较好的版本,因此新策略在这批历史上的分数不会低于当前版本。这是旧历史上的比较保证,不是下一次真实探索一定更好的保证。新分支能否带来新发现,仍要在线跑出来。

一组 Lasso 数据,分别回答两个问题

论文在算法工程、数学优化和 GPU kernel 等 8 项任务上测试 Dream-RSI。以 Lasso 正则化路径求解为例,在 Gemini-3.1 Pro 的同条件设置中,Dream-RSI 累计使用 317 次 Agent 调用,固定探索策略使用 550 次。两者找到的求解器再放到 6 个未参与搜索的下游数据集上运行,平均耗时分别为 2931.0 毫秒和 3587.1 毫秒。

两组数字对应不同指标:317 和 550 是发现过程中的 Agent 调用数;2931.0 和 3587.1 毫秒是求解器在下游数据集上的平均运行时间。它们说明,在这项任务和这组设置里,策略改进同时减少了搜索调用,并找到平均运行更快的程序。论文在 ConvDiv 上还观察到,随着结果提升,每轮评测尝试从 110 次降至 50 次;进展进入平台期后,尝试数又增加,并伴随新的性能提升。策略调整的是探索预算,不是单纯追求少调用。论文其他任务表现不同,这些结果不能外推成普遍节省比例。

哪些工程条件值得先看

从论文机制可以推断,要复用这条路线,系统至少得有几样东西:搜索过程能留下结构化记录,策略能明确控制分支与并行,评测器能稳定给出可比较的反馈。论文测试的是代码、数学优化和 GPU kernel 等有任务指标的发现问题;对于好坏难以客观评分的开放式创作,当前证据还不能说明同样的回放选择能可靠工作。

从工程角度看,回放能减少“为了评估策略而重跑整轮搜索”的开销;但历史覆盖不到的区域,仍要靠在线探索补充经验并验证策略。

Dream-RSI 值得关注的地方,不是它让 Agent 脱离环境、靠想象发现一切,而是它把“怎么搜索”单独抽出来,让这层策略也能接受反馈和比较。历史可以帮 Agent 重新安排走过的路;新路有没有价值,还是要实际走一遍。

参考资料

Dream-RSI: Recursive Self-Improvement through Evolving Worlds,arXiv:2609.14858: https://arxiv.org/abs/2609.14858

Dream-RSI 项目页与交互演示: https://dream-rsi.com/

— THE END —

文章仅做学术分享,如有侵权请联系删除,非常感谢!

【声明】内容源于网络
0
0
AI大模型智能体前沿
分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
内容 1139
粉丝 0
AI大模型智能体前沿 分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
总阅读20.4k
粉丝0
内容1.1k