作者丨邓哲敏
编辑丨齐铖湧
大模型时代,数据规模决定能力上限的规律已被反复验证。然而当这一范式迁移至机器人领域,挑战随之而来:机器人不仅需要海量数据,更需要能转化为动作能力的有效数据。
人类视频凭借规模巨大、获取成本低、场景覆盖广等优势,成为研究者关注的新源泉。但人类视频缺乏机器人动作标签,且人手运动无法直接对应机器人控制信号。核心问题在于:人类视频进入机器人学习流程后,究竟应被表示为何种形式?
针对这一问题,今年 IJCAI 2026 上,来自清华大学、香港科技大学、微软亚洲研究院等机构的联合综述论文指出,不同方法的本质均是在人类视频与机器人动作之间搭建一座“表示桥梁”(representation bridge)。AI 科技评论采访了论文一作、清华大学博士生冯志远,深入拆解该技术路线与行业判断。
01 机器人为什么需要学习人类视频
语言模型与自动驾驶的进步,皆得益于互联网文本与道路数据的持续积累。相比之下,机器人数据面临成本高、效率低、硬件耦合性强等瓶颈。即便是 Open X-Embodiment、DROID 等大规模数据集,在机器学习尺度下仍显不足。
人类视频则提供了破局可能。YouTube 教程、第一视角影像(如 HowTo100M 收录超 1.36 亿片段,Ego4D 积累超 3600 小时)涵盖了丰富的操作行为,且获取成本极低。理论上,人类视频数据量可从万小时级扩展至千万小时级。
然而,人类视频不能直接用于训练。其面临三重不兼容:缺乏可执行的动作标签、缺失机器人本体感知信息(如关节角度)、人手运动学与机器人控制接口不匹配。这正是该领域亟待解决的核心难题。
02 四条技术路线:桥墩打在哪里?
该综述提出了统一的分类框架,认为现有方法本质上都是在人类视频和机器人动作之间选择中间表示层并搭建桥梁。四条路线的区别,在于“桥墩”的位置不同。
潜在动作:压缩至隐空间
代表工作如 LAPA(ICLR 2025),主张让模型从视频中自主“发现”动作,将动作压缩至隐空间。该思路引发了大量跟进,但存在解释性差的缺陷。高度压缩的离散 token 能否充分表示高自由度灵巧操作的结构,仍是未解之谜。
显式 2D:图像平面标注
此路线直接在视频画面提取可见线索,如手部关键点、物体 bounding box 或 2D 轨迹。ATM、Magma 等工作利用密集点轨迹作为监督信号。其局限在于缺乏深度信息,易受遮挡影响,通常作为辅助监督信号而非主路线。
显式 3D:还原空间坐标
该路线试图恢复手部在三维空间的完整轨迹,利用 MANO 模型将人手动作翻译为机器人可参照的 3D 坐标。EgoVLA、H-RDT 等均属此类。其优势是对齐质量高,但 3D 标注成本高,且模型需同时推断 3D 结构,难度较大。目前被视为 VLA 训练中必要的辅助监督。
世界模型:预测未来反推动作
这是当前最受关注的路线。核心思路是让模型先预测环境未来变化,再反推动作。GR-1、GR-2 及新范式 WAM(World Action Model)均采用此逻辑。尽管逻辑自洽且适配大规模视频数据,但目前面临计算成本高、知识蒸馏难等工程障碍,实际效果尚未达到理论预期。
03 四条路线并非竞争关系
四条路线的本质差异仅在于监督信号施加的层级不同,因此在实践中可叠加使用而非互斥。例如,训练世界模型时可加入 3D 关键点轨迹作为辅助 Loss;VLA 系统也可融合 2D 轨迹监督。
业界普遍认为,VLA 训练中 3D 轨迹监督是必选项,2D 为补充;世界模型路线则视情况叠加像素级或隐变量级信号。这种组合策略有助于从业者根据数据资源和任务特点灵活决策。
目前,研究界更看好世界模型的泛化逻辑,而工业界主流 demo 多由 VLA 加强化学习(RL)实现。冯志远指出,具身智能尚未找到类似 Transformer 之于 NLP 的收敛配方,“具身智能的 GPT-3.5 时刻”可能还需较长时间。
04 三个尚未解决的难题
论文指出了该领域面临的三大开放挑战:
视频切片的有效性问题
网络视频未按机器人学习粒度录制,旁白与动作对齐松散,包含大量无关片段。基于固定时间窗口的切割方式会引入噪声,未来需探索基于语义和交互状态的分割方法。
本体与视角的双重差异
人手高自由度动作映射到低自由度机械臂存在欠约束问题;网络视频多为第三人称,与机器人固定视角存在本质差异。解决方案可能在于寻找以交互结果(如物体状态变化)为锚点的表示方式。
评测基准的局限性
LIBERO、CALVIN 等现有基准的任务多样性远不及真实人类视频,导致刷榜提升未必代表泛化能力的真实进步。论文建议建立追踪迁移效率、量化鲁棒性及对比预训练效果的新一代评测体系。
05 关于人类视频的几个关键判断
围绕人类视频的数据价值与技术路线,冯志远分享了以下观点:
人类视频不会取代真机数据
两者将分阶段发挥作用:先利用海量人类视频进行预训练以获取通用操作能力和泛化性,再利用机器人数据进行 Post-training 以适配具体本体。机器人数据的角色将从全量训练转向最后的本体匹配。
本体差异是最大技术鸿沟
人手与机械臂的 Mapping 问题是核心难点。随着灵巧手技术的发展及头戴相机的普及,硬件层面的趋同将使 Mapping 过程更加简单,从而降低转换成本。
世界模型逻辑更完整,但轨迹学习收益更直接
世界模型通过预测未来反推动作,逻辑上更适合利用大规模视频数据且轨迹收敛更好。但在现阶段,直接学习动作轨迹对提升模型效果更为立竿见影。物理规律的建模将是具身 AGI 阶段的必经之路,但目前优先级低于轨迹学习。
微软的研究定位
微软亚研院聚焦于利用人类传感器数据进行灵巧手操作研究,不涉及导航或全身控制,也不自研硬件,主要通过算法开源影响行业方向。
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

