AI Agent 自进化
前不久翁荔撰写了一篇关于 RSI(Recursive Self-Improvement,递归自我改进)概念的综述文章[1]。该文学术性较强,通过复杂公式阐述了 prompt、memory、loop 等机制,理解门槛较高(尽管内容详实全面,仍推荐阅读原文)。
本文旨在通过更简洁的视角,帮助大家理解当下热门的自进化概念。
写在前面:我认为 Agent 的发展中,工业界往往领先于学术界,或两者界限日益模糊,实践路径高度相似。下文介绍的概念,许多已成为日常开发模式。
近期,AI Agent 领域频繁出现 self-improvement、self-evolving、self-learning、adapting 等术语。这些词汇字面相近,但指向各异:有的系统优化代码算法,有的积累记忆创造工具,有的则直接更新模型参数。
为便于讨论,本文将统一使用“自进化”一词,并围绕以下三个核心问题展开:
- 系统里究竟是什么在进化?
- 进化由什么反馈驱动?
- 优化闭环如何形成?
理清这三个问题,即可看懂当前自进化研究的三条主要路线。
先把 Agent 拆成三部分
在判断系统属于哪类自进化前,可将其拆解为三个部分:Model、Harness 和 Artifact。
Model(模型):即大语言模型,负责理解输入、推理并生成结果,是 Agent 的“大脑”。
Harness(外围系统):包括系统提示词、任务循环、记忆、工具、Skills、上下文管理和路由机制等。模型仅负责生成输出,而 Harness 将模型组织成能规划、调用工具并连续执行任务的 Agent。
因此,Agent 可简化为公式:
Agent = Model + Harness
Artifact(产物):Agent 生产的成果,如代码、算法、研究报告、科学发现或机器人控制策略。它不是 Agent 的组成部分,而是 Agent 交付或优化的对象。
根据“哪一部分发生变化”,当前自进化可分为三类:
| 分类 | 发生变化的对象 | 模型参数是否更新 | 常见结果 |
|---|---|---|---|
| 产物迭代优化 | Artifact | 否 | 更好的代码、算法、论文或机器人策略 |
| Agent 外围系统进化 | Harness | 否 | 更好的提示词、记忆、工具、Skills 或子 agent 选择 |
| 无标准答案的模型学习 | Model | 是 | 模型能力或行为本身发生变化 |
这三类目标皆可称为进化,但实现路径截然不同。
第一类:产物迭代优化
这是目前最易理解且常见的路线:Agent 自身基本不变,专注于优化其生产的产物。
工作流程通常如下:
- 人类给出目标和评价标准;
- Agent 生成候选结果;
- 系统运行测试或实验,获取反馈;
- Agent 根据反馈修改结果;
- 达到标准后结束,否则继续循环。
这一过程对开发者而言十分熟悉。Coding Agent 通过“修改代码—运行测试—修复报错”的循环直至通过,本质即为“生成—验证—改进”闭环。
Google DeepMind 的 AlphaEvolve 是典型代表。它结合大模型生成代码能力与自动评估机制,用于发现和优化算法。在此系统中,不断进化的是候选算法,而非底层模型。
大语言模型带来的关键变革在于让“搜索操作”更灵活。过去需预定义有限的搜索空间和规则;现在,模型可提出方案、分析历史结果与失败原因,自主决定搜索方向,无需完全依赖人工手写策略。
此类系统的价值最终体现在 Agent 之外:更快的 GPU Kernel、更高效的软件、更好的科学假设或更可靠的机器人策略。
其边界也很明确:若 Agent 仅反复修改代码,未获得可迁移的新记忆、工具或参数,则它优化的是产物,而非自身。
第二类:Harness 系统进化
此类不修改模型参数,而是让 Agent 改进自身的 Harness。
其现实动机直接:训练模型成本高、周期长,但已部署的 Agent 可通过优化提示词、积累记忆、创造工具等方式,更好地适配特定任务。
提示词与记忆优化
最简单的做法是保存历史问答,但机械记忆难以泛化。更有效的方式是从执行记录中提炼可复用规则。例如,Agent 发现某类任务常在某步失败,便将解决方法写入提示词、Playbook 或长期记忆,避免重蹈覆辙。
虽然模型权重未变,但 Agent 整体行为已发生改变。若将 Harness 视为 Agent 的一部分,这当然算作一种自进化。
把重复过程封装成工具和 Skills
有些经验无法仅靠文字复用。例如从长视频中提取关键帧,若在上下文中反复解释流程既浪费 Token 又不稳定。合理做法是将流程写成代码,封装为可重复调用的工具或 Skill。
工具负责具体操作,Skill 则将工具、步骤、领域知识和检查规则组织成完整工作流。Agent 完成任务后,若能将成功经验沉淀为 Skill,下次即可直接复用。
Hermes Agent 便将跨会话记忆、自动创建 Skill 及使用中的持续改进纳入同一学习闭环。此类系统进化的不是模型,而是模型周围可复用的能力层。
Multi-agent
随着记忆、工具和 Skills 累积,系统可能变慢、工具选择困难或上下文干扰。与其让单一 Agent 承载所有知识,不如建立多个专家 Agent,通过 Router 分发任务。
多 Agent 系统可视为 Harness 进化的延伸,不仅是增加工具,更是重组能力和上下文。难点往往不在于创造更多专家,而在于准确判断任务归属。
第三类:无标准答案的模型学习
此类触及模型本身:系统直接更新模型参数。
这类工作常被称为自训练、自博弈、弱监督、强化学习、测试时训练、在线学习或持续学习。
共同挑战在于:没有标准答案时,模型从何获取学习信号?
一是制造“伪答案”。即使无人工标签,预训练模型的判断也优于随机猜测。系统可从多次输出、一致性、置信度等内部信号中筛选可靠答案作为训练目标(用于 SFT 或转化为 Reward 进行 RL)。
二是从环境中获取弱反馈。模型可与旧版本博弈,或在代码环境、游戏、模拟器中根据执行成败、得分高低学习。反馈未必提供正确答案,但能指示行为有效性。
持续学习则关注长期难题:学习新知识时如何避免遗忘旧能力(灾难性遗忘)。重放部分旧样本是缓解此问题的重要方法。
与前两类最根本的区别在于模型权重真的发生了变化。其潜在收益更大,但训练成本、稳定性和安全风险也更高。
三类自进化的边界正在变模糊
现实系统很少局限于单一层次。
Agent 在优化 GPU Kernel 时,最初仅改变产物。但为提高效率,可能进而修改提示词、工具、记忆和搜索策略(Harness 进化)。当 Harness 达到上限,系统还可能利用搜索产生的数据训练模型。
于是,完整闭环可能演变为:
更强的模型构建更好的 Harness;更好的 Harness 加速产物搜索;更好的产物和实验结果又提供新的训练数据与反馈。
NVIDIA 的 ENPIRE 已将类似闭环应用于真实机器人环境:Coding Agent 分析日志、查阅资料并修改基础设施与算法代码,再让机器人重新执行验证。此处既有产物优化,也有 Harness 对实验流程的组织。
判断“自进化”,只需要问三个问题
面对号称自进化的系统,可直接追问三件事:
第一,什么东西发生了变化?
是最终产物、Agent 的提示词和工具,还是模型参数?
第二,变化由什么反馈驱动?
是单元测试、自动评测、环境奖励、模型内部信号,还是人类反馈?
第三,优化闭环最终落在哪里?
若落在 Benchmark 上,得到的是更强的刷题系统;落在代码上,得到的是更好的软件;只有落在科学实验和现实环境中,才可能产生新的发现、材料和机器人能力。
自进化真正值得期待之处,不在于 Agent 学会改写提示词,而在于能否持续改善外部世界的真实产物。
综上,Model、Harness 和 Artifact 并非互相竞争的路线,而是同一系统的三个层次。今天的系统往往只优化其中一层,未来更完整的系统,很可能会让三层在同一个反馈闭环中协同进化。

