大数跨境

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI 量子位
2026-09-14
4
导读:小模型突破瓶颈,旗舰模型打开新空间

MetaRSI-v1:全球首个统一递归自我改进架构

递归自我改进(Recursive Self-Improvement,RSI)旨在让模型自主生成训练数据、优化提示词及修复代码。然而,现有 RSI 系统多局限于单一视角(如仅关注 Model、Data 或 Harness),且依赖固定不变的改进程序。

针对这一瓶颈,CosmosMind 联合斯坦福、伯克利、MIT、清华、北大等十余所海内外高校,共同发布 MetaRSI-v1。这是全球首个统一 Model-RSI、Data-RSI 与 Harness-RSI 的元递归架构,标志着 RSI 正式进入“平方时代”。

在无外部教师模型参与的情况下,MetaRSI-v1 使仅含 30 亿激活参数的小模型在四项基准测试中平均提升 10.9 分;同时助力 GPT-5.6、Claude Opus 5 等六款前沿旗舰模型平均提升 7.3 分。

MetaRSI-v1 不仅是一套技术方案,更试图构建统一 RSI 领域的架构语言,包含一个内核、两条编排轴、三个算子、元 RSI 层及五大定律。

首次统一的 Loop Kernel 范式

Loop Kernel 是 MetaRSI-v1 提出的自我改进统一形式。它将“进步如何发生”抽象为一条与对象无关的闭环:消费反馈产生的学习信号,在 Data、Harness、Model 上提出改动,经验证器裁决后,将结果回流为下一轮信号。

在此范式下,Data、Harness 和 Model 被统一为同一 Kernel 的不同实例化算子,实现了可组合与统一调度,为自我改进提供了可复用的底层骨架。

三大改进空间协同运作

基于统一的 Loop Kernel,自我改进在三个空间展开,由以下三个算子协同完成:

  • Data-RSI:从运行轨迹提取学习信号,经校验合成数据供下游消费,标定并放大模型能力的正负边界。
  • Harness-RSI:利用反馈信号,在 System Prompt、Skill、MCP、Tools、Memory 五个可插拔槽位上进行增减式改进。
  • Model-RSI:更新模型参数与结构,将反复验证有效的行为内化为模型能力。

纵横双轴优化策略

MetaRSI 通过纵横双轴让改进过程自动寻找最优路径:

  • 横轴编排(Horizontal Orchestration):RSI² Agent 根据信号反馈,在决策点选定下一个算子,并将其有机衔接送入 Loop Kernel 执行。
  • 纵轴优化(Vertical Optimization):RSI² Agent 向专属的 RSI² Sub-Agent 下发指令,后者根据学习信号与环境反馈改写算子内部的 RSI 规则,从而优化系统本身。

三层递归与元层架构

该架构由四个 Agent 协调运作,且支持人类专家局部替换以形成人机协同系统:

  • MetaRSI² Agent:负责学习如何进行合适的纵横优化,优化 RSI² Agent 的策略。
  • RSI² Agent:在决策点选择进行横轴编排或纵轴策略改写。
  • RSI² Sub-Agent:执行纵向优化指令,调整算子内部的 RSI 策略。
  • Transition Agent:负责衔接横向编排中上游算子的产物与下游算子的输入。

这四个 Agent 对应形成三个优化层级:算子改进目标系统、双轴编排改进算子用法、元层改进双轴编排策略本身。

实验验证:小模型与前沿模型均实现进化

实验分为两条路线:一是使用可训练开源模型的小模型路线(启用全部三个算子);二是面向 Claude Opus 5、GPT-5.6 等顶级闭源模型的前沿路线(仅启用 Data 与 Harness 算子)。

小模型自我改进显著

以 Qwen3.5-35B-A3B(35B 总参、3B 激活)为目标模型,在 Terminal-Bench 2.1、SWE-bench Pro 等高难度基准上评测。结果显示,MetaRSI-v1 使其平均提升 10.9 分,其中 SWE-bench Pro 解决率接近翻倍,且连续自进化的累计增益显著。

前沿模型仍有巨大潜力

多款前沿模型在 Terminal-Bench 2.1 上平均提升 7.3 分,证明 MetaRSI 范式对旗舰模型同样有效,表明即使是顶级模型仍留有可观的自我改进空间。

定义机器进化的五大定律

MetaRSI 梳理出 Harness-RSI(保持权重不变)与 Model-RSI(能力内化)两条互补路线,并重新定义 Data-RSI 为能力边界的探测器与放大器。在此基础上,提炼出五条核心定律:

定律一:验证决定自我改进的前沿。领域能否形成自改进闭环,取决于任务是否可被检验及是否存在合适的验证器。

定律二:自我认知会过期。RSI 改变 Agent 能力后,旧的系统描述随即失效,重新发现能力边界是速率瓶颈。

定律三:能力与载体无关,但成本有关。成熟循环能将能力从高成本的 Harness 迁移至低成本的 Model 内部。

定律四:可信度由不可写面度量。闭环内部无法单纯靠统计纠正因放宽成功标准导致的偏差,需引入外部不可写维度。

定律五:循环不凭空创造能力。一切增益本质上是外部信息熵的输入或既有潜力的激发与重组。

迈向文明级进化引擎

CosmosMind 团队由来自清华、北大、斯坦福等名校及头部大厂的研究人员组成,致力于“改进改进本身”。团队已同步开源 RSI-Harness,旨在为不同科学领域沉淀可移植的 Harness Genome。

未来,该架构将延伸至物理世界:通过可编程仪器与自动化实验室构建执行器和验证器,形成仿真、台架、真实实验的三级推进火箭。在这一愿景下,人类只需定义问题与价值判断,机器则负责以极高速度运转“从假设到验证”的闭环。

MetaRSI 的后时代,AI 将从单纯的解题工具演变为文明级的进化引擎。

CosmosMind 官网:https://cosmosmind.ai/
项目主页:https://github.com/CosmosMind-ai/RSI-Harness
论文:https://www.cosmosmind.ai/research/metarsi-v1
arxiv:https://arxiv.org/abs/2609.06396
HuggingFace:https://huggingface.co/CosmosMind/RSI-Harness

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16447
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读427.3k
粉丝1
内容16.4k