01 引言
2026 年,递归自我改进(RSI)在软件世界已实现闭环。Karpathy 的 AutoResearch 便是缩影:AI 自主改代码、跑实验、保留有效改动,循环往复提升性能。其逻辑成立的前提是——环境已知。代码沙盒不变、编译器规则稳定、评估指标预设,智能体只需在封闭世界中寻找更优解。
然而,物理现实并无此前提。
机器狗无法预知所有障碍,工厂数字孪生会随零件磨损失真,自主实验室常出现假设外的数据。现实动态且充满意外,无法枚举或冻结,出错后也无低成本“重跑”按钮。当行业聚焦于模型初始泛化能力,试图靠训练阶段的蛮力支撑部署后表现时,一个根本问题被长期悬置:AI 进入物理世界后,如何持续自我进化?
MirroS 给出了首个完整回答。他们首创性地提出Physical RSI——首次将递归自我改进逻辑从数字环境系统性延伸至物理现实,并交付了包含概念定义、运行机制及研究路线图的完整框架。(原文见 MirroS 官方博客:Building Physical RSI Beyond the Known World)
02 Physical RSI 是什么
MirroS 的核心贡献并非制造更好的机器人或训练更大的世界模型,而是首创性地定义了 Physical RSI 这一新范式。
理解该范式,需先厘清其与数字 RSI 的结构性差异。
数字世界的 RSI 本质上是单轴进化:环境和评价机制已知且固定,智能体仅需不断改进自身策略(Actor)。AutoResearch 即为典型——代码沙盒不变,变化的仅是智能体生成的训练代码。
但在物理世界,环境既是智能系统需持续学习建模的对象,又是未知且流动的。机器狗不知下一步踩到何物,工厂控制器难测机床状态的微妙差异。若世界模型对物理特性、关键状态或因果关系理解有误,无论动作策略多么精妙,皆建立在错误前提之上。
因此,Physical RSI 必须是双轴耦合的——Actor 和 World Model 必须同步迭代,形成持续的双向反馈。
系统须先理解世界才能优化动作;而每次动作结果又会暴露世界模型盲区,驱动认知更新。双方进步互为彼此揭示下一阶段突破的前沿。
此洞察虽直觉自然,但在被清晰表述前,行业鲜有人将“改进世界模型”与“改进行动策略”作为统一的递归过程设计。过往实践多割裂为策略学习或仿真环境构建,MirroS 则将其焊接为同一递归框架。
更重要的是,MirroS 未局限于单一垂直应用。Physical RSI 面向所有需在物理世界与未知交互的智能系统——具身智能、先进制造、科学发现。其技术野心在于解决场景问题,更为物理世界智能系统提供一套 World Model 与 Agent 协同进化的底层框架。
03 将意外变成进化的燃料
宏大范式需精确机制支撑。MirroS 设计了一套以“意外”(OOD 事件)为驱动的八步演化循环,其中三层设计尤为关键。
第一层:出了事,先问“是不是我理解错了这个世界?”
若在陌生城市驾车遇导航指示左转但道路封闭,问题非驾驶技术,而在地图过期。不更新地图,换再多路线亦无法通行。
Physical RSI 面对同类问题。MirroS 的诊断逻辑一致:当系统遭遇意外(如机器狗被电缆绊住),第一反应非盲目尝试新动作,而是自检世界模型能否复现失败因果:电缆路径、接触关系、张力传导、腿部运动如何共同导致缠绕?
若世界模型无法复现,说明认知存在盲区,首要任务是补全世界模型——此为Environment Gap。仅当失败可在模拟中稳定复现时,才搜索新恢复策略——此为Skill Gap。
这套“先问认知,再问动作”的逻辑基于本质判断:世界模型是对真实世界的映射,任何映射初即不完美,须在与现实碰撞中校验、修正、扩展。世界模型本身需递归改进循环。否则,带着错误环境假设的系统,动作策略再精妙也是朝错误方向精确前进。Actor 需要 RSI,World Model 同样需要 RSI,两者叠合方为完整的 Physical RSI。
第二层:地图要能改——为什么世界模型必须用代码构建?
诊断出“地图错了”,下一步是修正。这就要求世界模型的错误可定位、可修正。
当前主流世界模型方案(视频生成、3D 神经场、端到端隐空间表征)共享致命短板:出错时难以判断黑盒内部问题所在。如同位图模糊,只见“这片糊了”,却无法定位修改。
MirroS 选择更根本路径:构建 agentic 世界模型——非像素级复制,而是将多模态经验翻译为语言抽象,借助代码等工具转化为显式、可执行结构。语言调用预训练科学与常识知识,代码将知识具象化为可调试因果规则——预测有误即可定位、修改、重验,如同矢量地图修改局部不影响全局。
此选择非偶然偏好,而是递归改进必要条件:若模型无法精确修正,改进无从谈起。同时,基于抽象与可执行规则的模型天然具备跨场景迁移能力,一套验证过的柔性线缆接触力学可从仓库无缝迁移至手术室。
第三层:不能坐等意外——主动探索未知
若系统仅被动等待意外,进化速度便取决于运气。
在 MirroS 路线图中,前三个方向(环境理解与抽象、智能体物理推理、基于经验的持续学习)解决“意外发生后如何应对”。而第四个方向——主动发现未知——才是系统从“被动应急”迈向“自驱进化”的关键闭环。
系统需感知知识边界,主动设计实验探测盲区。类比驾车:这让系统从遇封路才更新地图的驾驶员,转变为主动前往未标注路段测绘的勘探者。
完整演化循环由此闭合:遭遇→意外→诊断→抽象→模拟→求解→验证→内化。每走完一次循环,系统积累的不仅是具体解法,更是全链路经验——识别失败、修正认知、搜索策略、现实验证。这些经验规模化积累、抽象复用后,构成推动 Actor 和 World Model 持续加速改进的递归基础——系统解决第一百次意外的速度将远快于第一次。
04 经验的复利,与更难的那条路
递归自我改进已非概念。田渊栋创办 Recursive Superintelligence,Ilya Sutskever 的 SSI 获 NVIDIA 战略合作,Jeff Dean 携 Sanjay Ghemawat、Quoc Le 组建 Discovery Loop 以自动化科学实验闭环,ICLR 2026 专设 RSI Workshop。从学术界到工业界共识已收敛:让 AI 递归地改进自身,是通向下一代智能的核心路径。
但当前努力几乎都落在数字一侧——改写代码、迭代模型、加速实验。成果显著,路径清晰。然而纯语言智能的边际收益正在递减,物理世界的理解与交互才是 AI 下一个数量级的增长轴。要在物理世界实现真正的多模态智能,仅靠训练阶段蛮力不够,系统必须具备部署后持续进化能力。这正是 RSI 逻辑必须延伸至物理现实的根本原因。
代码侧的 RSI 已在路上,MirroS 要做的是让这个范式把语言中涌现的智能,搬进能感知、能推理、能行动的物理世界里。
这是一条更难的路,MirroS 选择从这里开始。

