大数跨境

World Tokens压缩世界模型成本:机器人可能不需要实时运行“世界模拟器”

World Tokens压缩世界模型成本:机器人可能不需要实时运行“世界模拟器” 机器人产业应用
2026-09-10
5
导读:世界模型最后给机器人留下了什么?


作者:李振


世界模型正在成为具身智能最热门的技术方向之一,原因并不难理解。

今天的VLA(Vision-Language-Action)已经可以根据视觉和语言指令直接生成机器人动作,但它更擅长回答一个问题:“看到现在这个画面,我下一步应该怎么动?”。

真正复杂的机器人任务,却往往还需要回答另一个问题:“如果我这么动,接下来会发生什么?”比如机器人伸手抓杯子,它不仅要知道杯子在哪里,还要判断夹爪接近以后是否会形成遮挡,抓住以后物体怎样移动,当前动作会不会导致碰撞,这正是世界模型想补上的能力。

于是过去一段时间,一条很自然的路线开始出现:先让机器人“想象”未来,再决定下一步动作。相比普通VLA,这种WAM(World-Action Model)拥有更强的时序和物理预测能力。

但问题也随之而来——如果机器人每执行一次动作,都要同时运行一个大型视频世界模型预测未来,这颗“大脑”是不是太贵了?

2026年8月10日,论文《World Tokens: Enhancing Embodied Policies with Training-Time World Modeling》给出了一个不同答案。研究团队没有继续追问怎样让世界模型实时跑得更快,而是换了一个问题:世界模型有没有必要一直跟着机器人运行?World Tokens的答案是未必。世界模型可以只在训练阶段出现,真正部署到机器人以后,再把它移除。

这看似只是一种模型结构优化,背后却触碰到了一个更大的问题:未来机器人的世界模型,究竟应该是一颗实时运行的“大脑”,还是一个只在训练阶段出现的“老师”?


01

世界模型为什么有用,又为什么太重?


传统VLA最大的优势是直接。摄像头获取当前画面,再结合语言指令,模型直接输出动作,机器人执行一小段动作后重新观察环境,再继续生成下一段动作。这种方式天然适合实时闭环控制。

但它存在一个短板,很多VLA的视觉能力继承自图文预训练模型,因此非常擅长理解,例如“这是一个杯子”“抽屉在左边”“把香蕉放进篮子”。但图像本身并不会充分告诉模型杯子被推动以后会怎样运动,目标被机械臂遮住以后可能在哪里,一次抓取失败之后环境状态会发生什么变化。

World Tokens的作者认为,传统视觉语言预训练拥有丰富的语义知识,但对于接触、遮挡、物体位移等与动作相关的时间变化,监督仍然不足,于是WAM开始受到关注。

它可以简单理解成:观察现在→推演未来→判断未来→再生成动作。例如Cosmos Policy不仅生成机器人动作,还会预测未来状态图像和价值信息,并利用这些预测在测试阶段进一步规划动作轨迹。这种路线最大的优势,是机器人拥有了一定的“先想后做”能力。

但代价也同样明显,视频世界模型通常规模很大,还可能涉及多步扩散或去噪。如果每个机器人控制周期都完整运行一遍,推理链路就会明显变长。

对于真实机器人来说,额外几百毫秒并不是抽象数字,目标可能已经移动,人可能已经走进机器人路径,夹爪已经接触物体,机器人却还在“想象未来”。所以世界模型真正的落地难题,并不是它会不会预测未来,而是怎样让机器人获得这种能力,同时又不让世界模型拖慢机器人。


02

World Tokens:让世界模型负责“教”,不负责“上岗”


World Tokens最有意思的地方,是它没有继续优化在线视频生成速度。它直接问机器人真的需要看到未来视频吗?如果世界模型真正有价值的部分,是训练过程中学到的物体运动、接触、遮挡和时序变化规律,那么这些规律有没有可能提前写进机器人的控制表示?

为此,World Tokens在VLM和动作专家之间加入一个World Adapter(世界适配器)。当前视觉和语言首先进入VLM,World Adapter再将原本长度不固定的多模态特征压缩成固定的256个World Tokens。

关键就在这256个Token,训练的时候,它们必须同时服务两个任务:一边进入Action Expert,回答机器人下一步应该怎么动;另一边进入视频世界模型,回答按照当前状态继续发展,世界会变成什么样。于是,动作学习和未来世界建模开始作用在同一组中间表示上,这正是整篇论文最核心的结构变化。


动作专家不能绕过World Tokens,直接读取完整VLM视觉语言特征。也就是说,如果机器人想把动作学好,就必须经过这256个同时接受了动作监督和未来视频监督的Token。

这样一来,未来视频预测带来的梯度才能真正塑造最终用于控制的表示,而不是变成一个与动作无关的辅助任务。

到了部署阶段,变化则更加彻底。视频Tokenizer、视频去噪器以及未来视频预测分支全部删除,机器人最终真正携带的只有VLM+World Adapter+Action Expert。

因此,World Tokens并不是简单意义上的把一个大世界模型蒸馏成256个Token,更准确的理解是训练阶段利用未来视频预测塑造控制表征,部署阶段再把负责视频建模的“老师”留在训练中心。机器人最终带走的不是一个视频生成器,而是世界模型留下来的动态经验。


03

世界模型的价值,可能不等于“必须生成未来”


World Tokens并不是第一个开始质疑“推理时必须生成未来”的。

今年3月发布的Fast-WAM就直接提出了一个问题:World Action Model真的需要在测试阶段想象未来吗?Fast-WAM保留训练阶段的视频联合建模,但机器人真正运行时取消了显式未来预测。

研究中的一个关键信号是取消视频联合训练造成的性能损失,比取消测试时未来生成更加明显。这意味着世界模型带来的收益,很大一部分可能已经在训练阶段发生。简单概括,世界模型(预测未来)的主要作用,不是让机器人在运行时“边干边想”,而是让它在“训练时”把能力内化成一种“直觉”。

Fast-WAM最终将推理延迟做到约190ms,相比其比较的imagine-then-execute WAM方案快4倍以上,而且在LIBERO、RoboTwin以及真实机器人折叠毛巾任务中保持了较强表现。


不过,Fast-WAM和World Tokens仍然存在一个关键区别:Fast-WAM虽然不再生成完整的未来视频,但部署时仍然保留视频DiT作为世界表征编码器;World Tokens则更进一步,连视频世界模型主干都从机器人端拿掉。

如果说Fast-WAM和World Tokens代表的是尽量减少部署端世界模型负担的方向,那么另一条路线仍然坚持机器人在真正执行动作时,应该保留对未来的在线预测能力。


NVIDIA Research 提出的Cosmos Policy就属于这一类。它并不是单纯根据当前图像直接输出动作,而是把世界模型的预测能力继续保留在推理阶段:机器人一边观察当前环境,一边预测接下来可能出现的未来状态,并利用这些预测结果辅助动作选择和轨迹规划。

为了验证这套方法,研究团队将Cosmos Policy部署到了ALOHA双臂机器人平台上,一侧是真实ALOHA机器人正在执行任务,另一侧则展示模型根据当前观测预测出来的未来画面。也就是说,机器人不是单纯“看到现在就行动”,而是在执行过程中持续利用世界模型回答如果继续这样做,接下来可能会发生什么。


因此,目前世界模型的轻量化并不是简单的“要”或者“不要”,而是在形成一条连续路线。最重的一端,是机器人运行时真的生成未来;中间路线,是不再输出完整未来视频,但继续保留世界模型内部表征;最轻的一端,则是World Tokens——世界模型只在训练的时候出现。所以未来真正的问题可能已经不再是机器人需不需要世界模型,而是机器人需要把多少世界模型真正带在身上。


04

61.85ms背后,更重要的是世界模型“消失了”


如果World Tokens只是降低计算量,却明显牺牲机器人能力,那么这条路线并没有太大意义。

但论文实验给出了一个值得关注的结果。在LIBERO四组任务中,2B规模、没有具身动作预训练的World Tokens平均成功率达到98.2%。在SIMPLER中,WidowX达到71.5%,Google Robot达到82.1%。

更值得关注的是实际机器人测试。研究团队使用Galaxea R1 Pro(星海图机器人)完成水果放入篮筐任务,在相同实验设置下,同规格纯动作基线Qwen-GR00T成功率为59.4%,World Tokens则达到76.0%。


论文报告中提到在RTX 5090 D、两路224×224视觉输入等条件下,World Tokens每个action chunk(动作指令块)的延迟约为61.85ms。这个数字本身当然重要,但比数字更重要的是这61.85ms里已经没有视频世界模型了。

也就是说,World Tokens证明了一件更值得产业关注的事情:机器人获得世界建模训练收益,并不一定意味着机器人部署时也必须承担世界模型的全部计算成本。

不过这里需要保持谨慎,61.85ms并不意味着World Tokens已经可以直接运行在廉价机器人SoC上。论文使用的是RTX 5090 D,也没有给出Jetson或国产机器人芯片上的显存、功耗和能耗测试。

所以更准确的说法是:World Tokens具有降低端侧算力门槛的潜力,但这一点尚未被真实低成本机器人硬件完全验证。


05

“训练老师”暂时还不能完全取代“实时大脑”


如果只看到推理成本下降,很容易得出一个过于激进的结论:以后所有机器人都不需要在线世界模型了。目前还不能这么说。

World Tokens的真实机器人实验主要仍然是香蕉、芒果、草莓、柠檬等物体放入篮筐。虽然物体位置和篮筐位置进行了随机化,但任务结构仍然相对明确,它还没有充分回答如果机器人第一次遇到陌生物体怎么办?如果有人在执行过程中突然移动目标怎么办?如果环境结构发生大幅改变怎么办?如果任务要连续规划几十步,而且中间不断出现意外怎么办?

World Tokens部署后依然会持续读取新的视觉观测,因此它并不是开环执行。但相比完整在线世界模型,它少了一种能力:在真正做动作以前,显式推演多个未来,再根据预测结果进行选择和重规划。

这也解释了为什么另一部分研究仍然坚持保留推理阶段的未来表征。因为在高不确定性、长时序或者失败成本很高的场景中,多花一些算力“提前想一遍”,仍然可能非常值得。

因此,两类方案未来更可能形成的是分工,而不是替代。复杂工业操作、高风险任务和开放环境,可能更愿意为实时世界模型支付算力成本。家庭服务、小型移动机器人和大量结构相对稳定的任务,则可能更倾向训练阶段重,部署阶段轻。

真正的分界线并不是要不要世界模型,而是什么任务值得为实时想象未来支付成本。


06

世界模型的竞争,可能从“生成未来”转向“留下什么”


过去讨论机器人世界模型,很容易落到几个指标:生成的视频是不是更真实?未来预测得够不够远?模型是不是足够大?World Tokens真正值得关注的地方,是它换了一个问题:世界模型最后给机器人留下了什么?

如果视频未来预测真正重要的作用,是帮助机器人理解物体怎样移动,遮挡后目标可能在哪里,一个动作如何改变环境,任务状态如何沿时间推进,那么机器人未必需要每执行一步,都重新把这些规律渲染成视频,它也可以提前把这些规律变成一种内部控制表示。

从Cosmos Policy到Fast-WAM,再到World Tokens,现在可以看到一条越来越清晰的路线:生成未来→使用未来表征→只在训练阶段学习未来

这并不意味着最终所有机器人都会走向World Tokens,相反,在线世界模型仍然可能成为高端复杂机器人的重要能力。但它意味着一个过去很少被认真讨论的问题开始出现:世界模型的计算成本,到底应该发生在训练中心,还是发生在每一台机器人身上?

如果“训练用世界模型、部署用轻量VLA”被更多真实机器人实验验证,影响就不会只停留在算法层。端侧机器人的显存、算力、功耗和散热需求都有可能随之降低。

对于大量希望进入家庭、商业和移动场景的机器人而言,这一点甚至可能比世界模型把未来视频生成得更加逼真更加重要。因为机器人最终不是为了看见未来,而是为了在现实世界里,更快、更稳、更低成本地做对下一步。


连界创新



推荐阅读



产业应用场景



·出海!中国具身智能企业在全球市场大“杀”四方!

·比人形更快进入家庭?具身智能宠物机器人迎爆发!

·文娱巨星!人形机器人“表演大乱斗”,谁赢了?

·商业导览成具身智能商业化破局点?

·巡检机器人之困,场景刚需,但这一问题亟待解决



机器人本体企业



·仿生机器人=伴侣机器人?一文为仿生机器人正名!

·乐聚Taskor,为人形机器人规模化进厂按下“快进键”

·具身智能争霸赛打响!四大核心区都有哪些“扛把子”?

·CES 2026|星动纪元携人形机器人家族亮相

·智元CES放大招!开源Genie Sim 3.0强的可怕!



供应链动态



·零部件企业跨界突围!这些企业上大分!

·夺取物理世界的入场券:具身智能操作系统拆解

·人形机器人关节生死局:执行器路线之争与技术博弈

·灵巧手赛道“激战”,新老玩家各执什么王牌?
·开源数据集图鉴!这份具身智能“军火库”请查收

【声明】内容源于网络
0
0
机器人产业应用
由连界创新具身智能中心发起,以场景应用为导向,专注具身领域科技与产业的链接。我们将围绕投资+服务双轮驱动,为科技增长赋能。业务涵盖垂直行业峰会/沙龙、私董会、标杆走访,具身智能行业研究报告与咨询,产业生态系统搭建等。
内容 558
粉丝 0
机器人产业应用 由连界创新具身智能中心发起,以场景应用为导向,专注具身领域科技与产业的链接。我们将围绕投资+服务双轮驱动,为科技增长赋能。业务涵盖垂直行业峰会/沙龙、私董会、标杆走访,具身智能行业研究报告与咨询,产业生态系统搭建等。
总阅读4.2k
粉丝0
内容558