
2026 年,AI 行业最昂贵的叙事已超越“训练更大模型”,资本正直接押注于“让 AI 参与制造下一代 AI"。
从 David Silver 创办的 Ineffable Intelligence 获 11 亿美元融资,到 Richard Socher 等人领衔的 Recursive Superintelligence 携 6.5 亿美元亮相,再到 AlphaChip 联合创造者成立的 Ricursive Intelligence 估值达 40 亿美元,全球顶尖团队正竞相构建能够自我发现弱点、自我设计并持续进化的 AI 系统。仅上述案例,融资金额已超 25 亿美元,相关估值合计破百亿美元。
资本正在为同一个核心函数定价:AI 能力 → 自动实验 → 可验证结果 → 更强 AI。估值锚点已从单纯的模型能力,转向能力提升速度能否被系统自身持续加速。
RSI 不再只是科幻:前沿实验室的实战数据
递归自我改进(Recursive Self-Improvement, RSI)曾被视为关于“智能爆炸”的思想实验,如今已开始产出真实的生产数据。
Anthropic 披露,截至 2026 年 5 月,Claude 贡献了其代码库超 80% 的合入代码,小模型训练代码优化效率一年内从 3 倍提升至 52 倍。OpenAI 在 GPT-5.6 中引入 RSI 指标,其在衡量 AI 研发能力的 RSI Index 上较前代提升 16.2 个百分点。
趋势已然清晰:AI 正从辅助写代码的工具,进化为能执行实验、处理反馈并加速下一轮研发的主体。一旦 AI 能有效提升研发效率,技术进步将不再是线性增长,而是形成复利效应。
概念辨析:AI4AI、Meta-Evolution 与 RSI

图 1:AI4AI 定义优化对象,Meta-Evolution 描述经验反哺机制,RSI 要求更强的跨代递归闭环
随着热度攀升,厘清概念边界至关重要:
- AI4AI (AI for AI):描述工作对象,即让 AI 参与创造和优化 AI(如写代码、改结构、设计芯片)。
- Evolution:描述单次运行内的优化过程,通过反馈反复修改候选方案。
- Meta-Evolution:改变学习对象,不仅保留最终产物,更利用进化轨迹训练“改进者”本身,使其变强。
- RSI:要求更强的跨代闭环,升级后的 AI 能继续改进制造下一代 AI 的过程,实现能力的跨代持续增强。
简言之,AI4AI 回答“谁来做”,Meta-Evolution 回答“如何让改进者变强”,而 RSI 追问“变强的改进者能否制造更强的下一代”。从自动化实验到真正的 RSI,缺失的是一套可执行、可验证且能将经验送回模型的工程闭环。
这正是衔远科技 Frontis-MA 元智能体系列模型试图补全的关键环节。团队正式发布技术报告《Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering》,开源了面向机器学习工程的元智能体 Frontis-MA1-35B 模型权重,以及全栈开源套件 OpenMLE。

核心成果如下:
- 在 OpenAI MLE-Bench Lite 上,Frontis-MA1-35B 将基座模型平均奖牌率从 39.39% 提升至60.61%,绝对提升 21.22 个百分点。
- 结合 OpenMLE-Evo-Max 增强框架后,系统平均奖牌率达71.21%,人类排名 0.8126,22 个任务全部有效提交。
- 相比原始 AIRA-Evo,OpenMLE-Evo 使总 Token 消耗下降41.7%,每百万 Token 发现“新最优”的效率提高84.3%。
- 在 NatureBench Lite 的 10 项科学任务中,3 项超越论文 SOTA,7 项达到 SOTA。

图 2|Frontis-MA1-35B + OpenMLE-Evo-Max 达到 71.21%。橙色实心部分为标准 OpenMLE-Evo 下的 60.61%,斜线部分为 Evo-Max 带来的增益。
Frontis-MA1 押注的范式变化在于:未来的 AI 系统交付的将是一条持续上升的能力曲线,其斜率取决于系统能否将每次行动的结果转化为下一次改进的资本。
定位重塑:不是再造程序员,而是训练 AI 研发者
Coding Agent 解决的是需求确定、测试通过的相对封闭问题;而机器学习工程 Agent 面对的是无标准答案的实验场。它需在有限算力和时间内,自主检查数据泄漏、选择验证策略、调整特征与损失函数,将方案从 0.71 分持续推高至超越人类专家水平。
此类 Agent 具备四大特征:必须动手(提交代码与结果)、必须等待(接受长时反馈)、必须竞争(寻找更优解)、必须继承(记忆有效改动与失败教训)。
Frontis-MA1 体现了“通专融合”理念:以 Qwen3.6-35B-A3B 的通用能力为起点,通过专业任务环境、可验证反馈及进化搜索,将其转化为专门的机器学习工程能力。
核心机制:从自我反思到自我进化
没有可执行反馈的反思只是“自我叙事”。OpenMLE 首先构建了一个无法糊弄的世界:
环境层:OpenMLE-Gym
将异构机器学习任务封装为统一可执行包。包含 5,758 个可执行任务(含 2,240 个 Kaggle 竞赛任务),确保模型每次判断都转化为行动,每个行动都留下可量化的结果信号。

图 3|经筛选留下的 2,240 个 Kaggle 竞赛任务及统一任务目录
技术栈:任务、训练与搜索的闭环

OpenMLE 基于四类原子操作构建完整技术栈:
- Draft:生成初始方案;
- Improve:沿强方案提升;
- Debug:修复执行失败;
- Crossover:组合互补设计。
系统构建了 26,259 条监督训练样本,不仅保留高分答案,更记录修改路径与反馈。其核心设计在于训练的最小单元与进化搜索的最小单元完全对齐,确保训练时学到的动作能在推理时被精准调用。
架构升级:从 Loop 到 Graph Engineering
传统 Loop Engineering 导致历史上下文失控。OpenMLE-Evo 将线性历史重构为进化图(Graph):每个候选程序及其结果构成节点,记录操作类型、父节点及评分。成功路线继续生长,失败路线留下警告,不同路线可进行定向重组(Crossover)。
历史被压缩为结构化"Experience Card",仅在决策点提取相关祖先经验。在 nomad2018 材料预测任务中,这种机制通过重组互补分支,将 RMSE 进一步降低 11.3%。

关键跃迁:进化程序,更要进化“进化者”
OpenMLE 将经过验证的轨迹转化为监督与强化学习信号,用于增强模型执行四类操作的能力。这构成了Meta-Evolutionary Step:从改进程序(Solution)转向改进改进者(Improver)。
其工作流可概括为:Ground(建立环境)→ Evolve(搜索程序)→ Compile(编译经验)→ Consolidate(固化能力)→ Deploy(部署搜索)。虽然尚未形成全自动的跨代闭环,但已验证了“经验训练改进者、改进者进入搜索”的单轮有效性。
效能验证:模型增益与搜索增益的叠加
评测显示,在相同推理框架下,经 execution-grounded 后训练的 Frontis-MA1-35B 带来 21.22 个百分点的绝对提升。配合 OpenMLE-Evo-Max 的跨任务先验与异步搜索,系统上限进一步提升至 71.21%,进入前沿通用模型系统的竞争区间。
更重要的是效率的提升。对比实验显示,新版系统在总 Token 下降 41.7%、Prompt Token 下降 50.3% 的情况下,每百万 Token 的新最优发现率提高了 84.3%。这表明节省并非来自“少探索”,而是来自每次探索更便宜、更聚焦。

图:OpenMLE-Evo 用更少 Token 发现更多新最优
泛化能力:跨越 Kaggle 的科学探索
在 NatureBench 的 10 项科学任务评测中,Frontis-MA1-35B 实现了 3 项超越 SOTA、7 项匹配 SOTA 的成绩。固定模型更换框架或固定框架更换模型的对照实验均显示正向迁移。这证明在机器学习工程轨迹中训练出的改进能力与搜索机制,已具备跨出竞赛分布、向通用科学发现迁移的潜力。

结语:从宏大叙事到工程 Recipe
Frontis-MA1 的价值在于没有跳过工程细节,沉淀出三条可复用的 Recipe:
- 可执行反馈:让生成成为进化;
- 操作空间共享:让“改进”成为可训练能力;
- 历史压缩:把历史变为决策证据,优化单位计算的进步。
衔远科技正式发起OpenRSI by Frontis开放计划,旨在将"AI 改进 AI"转化为可执行、可测量的工程问题。未来,人类定义目标与边界,而具体的改进工作将由 AI 完成。模型不再仅仅是产品,它将走回生产线,成为制造下一代智能的参与者。
Frontis-MA1 交付的不是关于 RSI 的预言,而是一台已经开始运转的、生产“改进”的机器。
技术报告:https://arxiv.org/abs/2607.28568
GitHub 链接:https://github.com/FrontisAI/OpenRSI
HuggingFace 链接:https://huggingface.co/collections/FrontisAI/frontis-ma1

