MetaRSI-v1:全球首个统一递归自我改进架构
递归自我改进(Recursive Self-Improvement,RSI)旨在让模型自主生成训练数据、优化提示词及修复代码。然而,现有 RSI 系统多局限于单一视角(如仅关注 Model、Data 或 Harness),且依赖固定不变的改进程序。
针对这一瓶颈,CosmosMind 联合斯坦福、伯克利、MIT、清华、北大等十余所海内外高校,共同发布 MetaRSI-v1。这是全球首个统一 Model-RSI、Data-RSI 与 Harness-RSI 的元递归架构,标志着 RSI 正式进入“平方时代”。
在无外部教师模型参与的情况下,MetaRSI-v1 使仅含 30 亿激活参数的小模型在四项基准测试中平均提升 10.9 分;同时助力 GPT-5.6、Claude Opus 5 等六款前沿旗舰模型平均提升 7.3 分。
MetaRSI-v1 不仅是一套技术方案,更试图构建统一 RSI 领域的架构语言,包含一个内核、两条编排轴、三个算子、元 RSI 层及五大定律。
首次统一的 Loop Kernel 范式
Loop Kernel 是 MetaRSI-v1 提出的自我改进统一形式。它将“进步如何发生”抽象为一条与对象无关的闭环:消费反馈产生的学习信号,在 Data、Harness、Model 上提出改动,经验证器裁决后,将结果回流为下一轮信号。
在此范式下,Data、Harness 和 Model 被统一为同一 Kernel 的不同实例化算子,实现了可组合与统一调度,为自我改进提供了可复用的底层骨架。
三大改进空间协同运作
基于统一的 Loop Kernel,自我改进在三个空间展开,由以下三个算子协同完成:
- Data-RSI:从运行轨迹提取学习信号,经校验合成数据供下游消费,标定并放大模型能力的正负边界。
- Harness-RSI:利用反馈信号,在 System Prompt、Skill、MCP、Tools、Memory 五个可插拔槽位上进行增减式改进。
- Model-RSI:更新模型参数与结构,将反复验证有效的行为内化为模型能力。
纵横双轴优化策略
MetaRSI 通过纵横双轴让改进过程自动寻找最优路径:
- 横轴编排(Horizontal Orchestration):RSI² Agent 根据信号反馈,在决策点选定下一个算子,并将其有机衔接送入 Loop Kernel 执行。
- 纵轴优化(Vertical Optimization):RSI² Agent 向专属的 RSI² Sub-Agent 下发指令,后者根据学习信号与环境反馈改写算子内部的 RSI 规则,从而优化系统本身。
三层递归与元层架构
该架构由四个 Agent 协调运作,且支持人类专家局部替换以形成人机协同系统:
- MetaRSI² Agent:负责学习如何进行合适的纵横优化,优化 RSI² Agent 的策略。
- RSI² Agent:在决策点选择进行横轴编排或纵轴策略改写。
- RSI² Sub-Agent:执行纵向优化指令,调整算子内部的 RSI 策略。
- Transition Agent:负责衔接横向编排中上游算子的产物与下游算子的输入。
这四个 Agent 对应形成三个优化层级:算子改进目标系统、双轴编排改进算子用法、元层改进双轴编排策略本身。
实验验证:小模型与前沿模型均实现进化
实验分为两条路线:一是使用可训练开源模型的小模型路线(启用全部三个算子);二是面向 Claude Opus 5、GPT-5.6 等顶级闭源模型的前沿路线(仅启用 Data 与 Harness 算子)。
小模型自我改进显著
以 Qwen3.5-35B-A3B(35B 总参、3B 激活)为目标模型,在 Terminal-Bench 2.1、SWE-bench Pro 等高难度基准上评测。结果显示,MetaRSI-v1 使其平均提升 10.9 分,其中 SWE-bench Pro 解决率接近翻倍,且连续自进化的累计增益显著。
前沿模型仍有巨大潜力
多款前沿模型在 Terminal-Bench 2.1 上平均提升 7.3 分,证明 MetaRSI 范式对旗舰模型同样有效,表明即使是顶级模型仍留有可观的自我改进空间。
定义机器进化的五大定律
MetaRSI 梳理出 Harness-RSI(保持权重不变)与 Model-RSI(能力内化)两条互补路线,并重新定义 Data-RSI 为能力边界的探测器与放大器。在此基础上,提炼出五条核心定律:
定律一:验证决定自我改进的前沿。领域能否形成自改进闭环,取决于任务是否可被检验及是否存在合适的验证器。
定律二:自我认知会过期。RSI 改变 Agent 能力后,旧的系统描述随即失效,重新发现能力边界是速率瓶颈。
定律三:能力与载体无关,但成本有关。成熟循环能将能力从高成本的 Harness 迁移至低成本的 Model 内部。
定律四:可信度由不可写面度量。闭环内部无法单纯靠统计纠正因放宽成功标准导致的偏差,需引入外部不可写维度。
定律五:循环不凭空创造能力。一切增益本质上是外部信息熵的输入或既有潜力的激发与重组。
迈向文明级进化引擎
CosmosMind 团队由来自清华、北大、斯坦福等名校及头部大厂的研究人员组成,致力于“改进改进本身”。团队已同步开源 RSI-Harness,旨在为不同科学领域沉淀可移植的 Harness Genome。
未来,该架构将延伸至物理世界:通过可编程仪器与自动化实验室构建执行器和验证器,形成仿真、台架、真实实验的三级推进火箭。在这一愿景下,人类只需定义问题与价值判断,机器则负责以极高速度运转“从假设到验证”的闭环。
MetaRSI 的后时代,AI 将从单纯的解题工具演变为文明级的进化引擎。
CosmosMind 官网:https://cosmosmind.ai/
项目主页:https://github.com/CosmosMind-ai/RSI-Harness
论文:https://www.cosmosmind.ai/research/metarsi-v1
arxiv:https://arxiv.org/abs/2609.06396
HuggingFace:https://huggingface.co/CosmosMind/RSI-Harness

