大数跨境

89组VLA实验之后,机器人行业该重新看待“百万小时数据”了

89组VLA实验之后,机器人行业该重新看待“百万小时数据”了 机器人产业应用
2026-09-21
8
导读:VLA的数据竞争没有结束,只是评价标准正在变化。


作者:余柯


一家机器人公司准备训练VLA模型,手里有一笔数据预算,最容易做出的决定是什么?

继续采真机数据。增加设备、扩大采集团队,让机械臂反复完成抓取、放置、开门、整理等任务。数据从一万条增加到十万条,模型似乎就应该越来越强。

但实际情况并没有这么简单。模型可能越来越擅长完成训练过的动作,却仍然听不懂换了一种说法的指令;在固定工位上表现稳定,换一个物体、相机角度或者机器人型号,成功率便明显下降。

此前,RSS 2026悉尼大会上的一项大规模对照实验,正好回答了这个问题。丰田研究院与清华大学系统训练并比较了89组VLA策略,完成约5.8万次仿真和2835次真机评估。实验最值得行业关注的结论,不是找到了一个可以直接照抄的“神奇比例”,而是证明了一件事:VLA训练不能只看数据有多少,还要看不同数据分别在解决什么问题。


01

先看清“约4000小时”是怎么来的


这项研究使用了约4000小时操作数据,但其中并不全是目标机器人的真机轨迹。具体包括:



这个数据构成本身就很有代表性。研究团队没有把全部资源都投入目标机器人,而是同时使用了其他机器人数据、人类视频和通用图文数据。目标机器人数据在全部操作数据中的占比并不高,却仍然能够支撑最终模型在真机上的落地。这并不意味着真机数据不重要,而是说明:很多能力没有必要全部依靠目标机器人从头学习。


02

为什么只用机器人轨迹,模型反而可能退步?


VLA模型需要同时具备两类能力。一类是理解能力:识别物体、判断空间关系、理解人的指令。另一类是执行能力:控制机械臂移动到正确位置,以合适的速度和力度完成操作。机器人轨迹主要训练第二类能力。企业自己采集的数据,通常来自固定的机器人、固定工位和有限任务。模型反复看到的是同一张桌子、同一套相机和相似的物体,语言指令也可能长期停留在“拿起杯子”“放进托盘”等固定表达。

这类数据能够让动作变得熟练,却未必能让模型真正理解任务。例如,模型可能会执行“把红色杯子放进托盘”,但当用户改成“把装水的容器放到右边的盘子里”,它就可能无法正确对应物体和位置。论文观察到,只使用机器人轨迹继续训练后,模型在部分视觉语言、空间推理和多模态理解任务上的表现会下降。

从训练机制看,这是能力遗忘:动作目标长期主导训练后,模型原来从大规模图文数据中学到的物体语义、空间关系和语言理解能力,可能被逐渐覆盖。因此,视觉—语言数据不是机器人训练中的无关材料。它的作用,是让模型在学习动作时,不要忘记如何看懂环境和理解用户。


03

不同数据,到底分别解决什么问题?


理解这项研究,关键不是先记住几个比例,而是先弄清楚每类数据的作用。


通用视觉—语言数据不负责教机械臂如何运动,它负责保住模型的理解能力。跨本体数据也不能直接替代目标机器人的轨迹。它的价值在于让模型接触不同机械臂、相机视角和任务形式,减少对单一设备和固定场景的依赖。

人类视频不能直接作为机器人控制信号,却包含大量真实世界中的操作过程,例如整理物品、使用工具和双手协作,可以帮助模型扩大对任务的认识。目标机器人数据则负责最后一步:让模型适应真实设备的关节范围、控制频率、相机位置和接触特性。简单来说,通用数据帮助模型看懂,跨本体数据帮助模型见得更多,目标机器人数据帮助模型最终做准。


04

论文里的三阶段配比,应该怎么理解?


研究团队没有从头到尾使用同一种比例,而是把训练拆成了三个阶段。



这里的比例是训练时从不同数据池中抽取样本的比例,不是数据总量比例,也不是企业采购预算比例。以第二阶段的4∶1∶4∶1为例,每抽取10份训练样本,大约有4份来自目标机器人,4份来自其他机器人,1份来自通用视觉—语言数据,1份来自人类视频。这个阶段的重点不是立即适配某一台机器,而是让模型尽可能多地接触不同任务、设备和环境。

到了第三阶段,目标机器人数据的权重明显提高,模型开始围绕最终设备收敛。但研究团队仍然保留了少量视觉—语言和人类视频数据,没有完全切换成纯机器人轨迹训练。原因很现实:动作需要继续变准,但理解能力不能在最后阶段丢掉。所以,“黄金数据配比”并不是一个固定公式。更准确的理解是:训练前期重视能力覆盖,训练后期重视目标设备;越接近部署,目标机器人数据越重要,但通用视觉—语言数据不应被彻底拿掉。


05

对企业最直接的影响:真机数据应该重点采什么?


训练采样比不等于数据采购预算比。论文并没有告诉企业应该把多少预算用于真机、多少预算用于通用数据。但它改变了一个重要判断:真机数据不应该负责解决所有问题。当然,真机数据依然不可替代,尤其是以下几类情况:


企业应该把昂贵的真机时间,优先留给其他数据无法替代的部分。例如复杂接触、透明或柔性物体、长时序操作、极端工况、模型真实失败,以及与产品安全直接相关的边界场景。相反,如果同一个机器人在同一个工位上,围绕同一类物体和相似指令重复录制几万次,新增数据的收益很可能越来越低。这项研究并不是让企业少采真机数据,而是提醒企业:不要用最昂贵的数据,重复解决已经可以通过其他数据解决的问题。


06

离散动作token真的被证伪了吗?


先解释一下什么叫“离散动作token”。在机器人控制里,动作原本是连续的数值,比如机械臂要转到30.5度、施加2.3牛顿的力。而“离散动作token”的做法,是把这些连续数值强行切成一个个固定的“档位”或“符号”,比如只允许动作是“档位1”“档位2”……然后像大语言模型生成文字一样,一个符号一个符号地把动作“写”出来。这么做的好处是能直接套用语言模型的训练工具箱,但坏处是动作会变得不那么精细,就像把平滑的曲线变成了台阶。

回到论文的发现。他们在实验中顺手测试了FAST、VQ-VAE这类离散动作token方案,想看看在已有连续控制系统的模型里,额外塞进这些离散符号能不能辅助提升性能。结果发现,加进去并没有带来稳定、明显的整体提升,个别方案甚至让模型面对陌生任务时表现更差。

不过,这可不等于给离散动作路线判了“死刑”。这次实验的实质是:在已经用连续动作头训练好的系统里,额外加离散token当辅助信号,到底值不值? 它并没有在完全公平的条件下(同样的模型规模、同样多的数据、同样的任务),把离散架构和连续架构从头到尾重新设计一遍来一决高下。

所以更合理的结论是:别再默认离散动作token就是最优解了。像RT-2、OpenVLA这类做法,把动作硬编码成类似语言单词的token,好处是能直接套用大语言模型那套训练框架,但代价也很明显——动作会有“画质压缩”一样的量化误差,而且生成动作时一个字一个字往外蹦,反应速度慢、有延迟。反观π0用Flow Matching生成连续动作,GR00T走扩散或连续生成路线,这些方法做精细、平滑、高频控制更拿手,但对推理速度和工程落地的要求也更高。

最后给研发团队提个醒:评判哪种路线更好,别光看离线测试的成功率,更关键的是拉到真机上比比看——动作够不够丝滑?延迟高不高?出错了能不能自己救回来?长时间运行稳不稳定?这些才是硬道理。


07

数据规模仍然重要,但不能只看小时数


RSS 2026上的其他工作,也在尝试减少对大规模目标机器人数据的依赖。TactAlign利用少量人类触觉演示完成跨本体迁移;BiDemoSyn可以从一条真实双臂演示出发,扩增出大量物理可执行的数据;DexImit则尝试把人类操作视频转换成双臂机器人的训练数据。

这些工作采用的方法不同,但都在回答同一个问题:人类视频、触觉演示、跨本体数据和合成数据,能否转化成目标机器人的有效训练信号?

它们并没有证明少量数据天然优于大规模数据。这些方法能够成立,仍然依赖较强的视觉语言基础、可靠的数据对齐方法、合适的动作表示和严格的评估。

真正发生变化的是,行业开始重新判断一批数据的价值。过去更关注“又增加了多少小时”,现在还要继续追问:增加了什么新任务?覆盖了什么新物体?是否包含新的接触状态?有没有记录真实失败?能否迁移到其他机器人?一万小时高度重复的数据,未必比一百小时覆盖新任务和新失败模式的数据更有价值。


08

结语


这项89组VLA策略实验,没有给行业提供一个可以直接照抄的万能比例。


它给出的是一套更实用的数据分工方法:通用视觉—语言数据负责维持理解能力,跨本体数据负责扩大任务和设备覆盖,目标机器人数据负责提高控制精度,人类视频和合成数据负责补充任务多样性。


对机器人团队来说,真正需要回答的问题,不是今年还要再采多少小时,而是下一批数据准备解决什么问题。


在启动新一轮采集前,至少应该先问三件事:这批数据是否覆盖了新的任务和失败场景?这些知识能否从其他机器人、公开视频或视觉—语言数据中获得?训练完成后,准备通过什么评估证明这批数据确实有效?


VLA的数据竞争没有结束,只是评价标准正在变化。未来更重要的,不是谁积累的轨迹小时数最多,而是谁更清楚哪些数据值得采、应该在什么阶段使用,以及它最终改善了模型的哪一种能力。


连界创新



推荐阅读



产业应用场景



·出海!中国具身智能企业在全球市场大“杀”四方!

·比人形更快进入家庭?具身智能宠物机器人迎爆发!

·文娱巨星!人形机器人“表演大乱斗”,谁赢了?

·商业导览成具身智能商业化破局点?

·巡检机器人之困,场景刚需,但这一问题亟待解决



机器人本体企业



·仿生机器人=伴侣机器人?一文为仿生机器人正名!

·乐聚Taskor,为人形机器人规模化进厂按下“快进键”

·具身智能争霸赛打响!四大核心区都有哪些“扛把子”?

·CES 2026|星动纪元携人形机器人家族亮相

·智元CES放大招!开源Genie Sim 3.0强的可怕!



供应链动态



·零部件企业跨界突围!这些企业上大分!

·夺取物理世界的入场券:具身智能操作系统拆解

·人形机器人关节生死局:执行器路线之争与技术博弈

·灵巧手赛道“激战”,新老玩家各执什么王牌?
·开源数据集图鉴!这份具身智能“军火库”请查收

【声明】内容源于网络
0
0
机器人产业应用
由连界创新具身智能中心发起,以场景应用为导向,专注具身领域科技与产业的链接。我们将围绕投资+服务双轮驱动,为科技增长赋能。业务涵盖垂直行业峰会/沙龙、私董会、标杆走访,具身智能行业研究报告与咨询,产业生态系统搭建等。
内容 570
粉丝 0
机器人产业应用 由连界创新具身智能中心发起,以场景应用为导向,专注具身领域科技与产业的链接。我们将围绕投资+服务双轮驱动,为科技增长赋能。业务涵盖垂直行业峰会/沙龙、私董会、标杆走访,具身智能行业研究报告与咨询,产业生态系统搭建等。
总阅读5.0k
粉丝0
内容570