作者丨张璐
编辑丨齐铖湧
在机器人技术飞速发展的当下,具身智能领域正面临核心困境:尽管已拥有高容量的深度神经网络,但现实世界中高昂的交互与试错成本,已成为阻碍机器人通往通用人工智能(AGI)的最大瓶颈。
虚拟世界中,游戏和代码的执行成本近乎为零,因此诞生了 AlphaGo 的奇迹和大语言模型的辉煌。然而在物理世界,机器人每一次真机试错都伴随着昂贵的时间成本、设备损耗及安全隐患。若无法降低这一高交互成本,机器人便难以像大模型那样利用海量数据实现自我进化。
在机器人顶级学术会议 RSS 现场,来自 Google 实验室和纽约大学(NYU)的助理教授 Sherry Yang 给出了破局之道。她的演讲题目为《在世界模型中评估与提升物理代理》(Evaluating and Improving Physical Agents in a World Model),提出了一种颠覆性范式:直接利用可控的视频生成模型作为真实世界的“替身”,让机器人在云端虚拟场景中完成无限次的低成本演练。
以下是 Sherry Yang 在 RSS 大会上的演讲精编内容:
真机试错成本高昂,物理世界成 AI 演化阻碍
学术界对“代理与环境交互”的标准设定早已熟悉:神经网络模型采取行动,环境给予反馈。在此设定下,AlphaGo 与大语言模型取得了超越人类的成就,关键在于两点:高容量模型与极低成本的交互环境。
然而,训练物理世界中的 AI 时,低成本基石不复存在。物理交互成本极高,必须操作真机才能知晓动作后果。若能从机器人交互数据中学习一个“世界模型”(World Model)来替代真实世界,即可将物理代理重新带回低成本跑道。通过在云端运行无数次模拟,利用强化学习不断训练改进,直至其达到超级代理水平,这正是团队近期工作的核心。
两张 A100 即可运行,World Gym 搭建云端模拟器
提升机器人的第一步是评估。现实中评估策略痛点明显:耗时久、硬件易损,且因设备差异导致结果难以标准化复现。传统软件模拟器虽可在云端运行,但在处理复杂物体交互时往往失真,难以扩展至成千上万种日常任务。
为此,团队推出了World Gym。该方案完整保留机器人原始动作的所有维度信息,采用可扩展的 Transformer 架构(具体为 Diffusion Transformer,即 DiT 架构)。模型通过接收前序图像和当前控制指令,持续生成未来视频画面。
值得注意的是,世界模型研究并非资源垄断型大厂的专利。团队仅用两张 A100 GPU,便在 Bridge 数据集下训练出泛化能力出色的模型。在包含 22 种机器人形态的多样化数据集上训练后,将预设动作输入世界模型,其生成的视频与真机执行画面表现出极高一致性。
引入图像编辑技术,云端定制调试长尾场景
拥有可控的视频世界模型后,它便成为所有机器人策略模型的标准化评估层。团队将 Octo、OpenVLA、RT-1 等主流策略放入世界模型进行滚动测试。
在“把茄子放进锅里”的任务中,各策略表现泾渭分明:OpenVLA 完美完成;Octo 动作未竟全功;而老旧模型 RT-1 因输出动作超出分布(OOD),甚至导致世界模型“崩溃”。这恰恰体现了世界模型的价值:提前预警那些在真机上会损坏设备的危险动作。
此外,无需在现实中搭建奇奇怪怪的长尾场景,世界模型允许通过图像编辑定制任意超出分布(OOD)的安全测试。例如,在场景中通过图像编辑加入画有胡萝卜的电脑屏幕,并指令模型“拔出胡萝卜”。结果显示,策略模型最终冲向电脑屏幕,暴露了其认知缺陷。
通过加入小黄鸭、玩具车等干扰物,发现策略模型成功率骤降。进一步调试显示,当前模型理解“颜色指令”的能力远优于“形状指令”。数据证明,世界模型的评估结果与真机实测成功率呈强烈正相关,从而在云端找到了廉价、可定制且 100% 可复现的质检标准。
World Gymnast:让机器人从失败中学会自我恢复
评估之后是利用世界模型提升策略。团队推出World Gymnast项目,让机器人代理在世界模型中通过强化学习(RL)进行大规模演练。
当前多数机器人学习依赖人类遥控数据进行监督微调,但大语言模型的发展历史表明,真正带来能力跨越的是利用验证器(Verifier)和强化学习(RL)大规模扩增和解决训练任务。
在 World Gymnast 中,数据集中的任意画面均可作为 RL 起点。即使是机器人操作失败的画面,也可作为起点,迫使策略模型学会如何从错误状态中恢复(Failure Recovery)。团队利用视觉语言模型(VLM)作为通用奖励模型,输入任务指令和世界模型生成的视频,由 VLM 判定成败,并通过策略梯度在线更新策略网络。
在开门、关门、放茄子等 4 个全新留存任务的真机测试中,经过世界模型强化学习的模型,表现显著优于监督微调模型,也击败了在传统物理模拟器中训练的基准模型。传统模拟器在处理复杂物体接触时常失真,而世界模型基于海量数据的最大似然学习,天然具备极强的接触动力学拟合能力。
构建“数据飞轮”,撬开通用机器人大门
尽管目前的视频世界模型偶有幻觉或颜色偏差,但已能提供足够的改进信号。展望未来,通往具身智能 AGI 的关键在于建立混合数据飞轮:
1. 内环:策略模型在参数化的视频世界模型里,进行成千上万种虚拟任务的低成本强化学习进化。
2. 外环:机器人自主探索产生失败数据,这些“燃料”可直接用于梯度更新世界模型,使其更精确。互联网上庞大的第一视角人类交互视频是巨大宝藏,人类作为最强大的物理代理,其视频可通过端到端控制转化为机器人的世界先验。
未来,通过世界模型桥接互联网视频的“广度”与机器人具身控制数据的“精度”,将真正敲开通用机器人的大门。
现场 Q&A:如何打破“死局”?
问:测试中发现,当策略模型动作过于超出分布(OOD)时,会导致世界模型产生严重幻觉甚至“崩溃”。这似乎是一个悖论:策略不工作导致世界模型不工作。当世界模型无法泛化到极端分布外的错误动作时,如何打破死局?
Sherry Yang:这是一个切中要害的问题。若动作完全超出分布且无真机数据补充,单靠世界模型确实难以打破僵局。但若将机器人视为可自主探索的自动化代理,情况则不同。在真机落地中,机器人必然会产生大量失败数据。
解决方案是:利用这些真机产生的失败数据,优先更新和微调世界模型,使其首先理解“新分布”。当世界模型的模拟边界被失败数据拓宽后,它便能反过来产生正确信号,继续指导和训练策略模型。这是一个相互促进的飞轮过程。

