大数跨境

AdvDex:把人手、灵巧手和夹爪塞进同一动作空间,机器人数据的 “跨本体汇率” 终于有了?

AdvDex:把人手、灵巧手和夹爪塞进同一动作空间,机器人数据的 “跨本体汇率” 终于有了? 机器人产业应用
2026-09-09
3
导读:这,比某一个模型成功率再提升几个百分点,更值得产业关注。


作者:吴运熙


前言


8 月 17 日,由浙江大学、上海创智学院、复旦大学、上海交通大学及帕西尼团队联合提出的 AdvDex 灵巧操作训练框架正式公开,将具身智能领域一个长期被行业默认的底层产业痛点重新推至台前:为什么训练机器人灵巧操作模型,总要先把人类演示动作 “翻译” 成某一款特定机器人的专属动作?

在当前产业路径下,人手、多指灵巧手、传统平行夹爪三类执行本体,各自运行在完全独立的动作坐标系中。每更换一种硬件形态,数据就要重新标注、模型就要重新适配。这种 “本体壁垒” 直接导致了一个行业共识级困境:昂贵的机器人遥操作数据始终是灵巧操作训练的核心瓶颈,海量的人类自然操作数据始终无法直接注入 VLA 训练体系。

AdvDex 试图给出一套系统性解法:通过定义统一的Joint-Aligned Action Space(关节对齐动作空间,简称 JAAS)、引入 OmniShare 多模态人类数据集、叠加域对抗学习机制,在人手、灵巧手与夹爪之间建立可通用的 “动作语言”。这不仅仅是一次算法层面的迭代,更有可能撬动整个具身智能数据供给的底层逻辑,建立起机器人领域的 “跨本体汇率”。


01

跨本体迁移的真瓶颈:不是视觉差,是 “动作语言不通”



行业内通常将跨本体迁移的难点归于视觉域差异——相机视角、本体外观、场景光照的不同。但从产业实践来看,动作空间的不兼容,才是更深层、更难绕过的底层障碍

本质上,每一种执行本体都有一套专属的“动作语法”:人手拥有27个自由度,运动学链路复杂且柔顺性极强;商用多指灵巧手通常配置12-19个主动关节,驱动方式与运动特性和人手迥异;传统平行夹爪则只有1个开合自由度,运动逻辑极简。三者的关节定义、运动范围、力矩特性完全不在一套坐标系内,相当于三种互不流通的货币。

过往的主流解决方案是“一对一翻译”:针对某一款特定机器人设计专门的映射模型,将人类动作转化为该机器人的关节指令。这种方式的产业痛点十分突出:每新增一款硬件就要重做一次映射开发,数据无法跨本体复用,模型的泛化能力被彻底锁死在特定硬件形态上。

这就像三家企业分别用人民币、美元、黄金记录营收,简单拼接表格并不会自动形成统一的财务数据库。机器人数据也是同理:数据放在一起,不等于数据已经打通。这也是为什么 Open X-Embodiment 以来,跨机器人数据集越来越多,但行业依然很难像大语言模型那样,将所有数据无差别地纳入统一训练池——语言模型有天然的 Token 化底座,而机器人动作始终缺少类似的“通用中间语言”


02

JAAS:用功能对齐,搭建跨本体“动作结算层”


AdvDex 提出的核心解决方案 JAAS,本质是建立一套“通用动作语法”,在不同本体的动作空间之上,叠加一层共享的动作表示层。

这套坐标系的设计极具工程巧思,核心逻辑是放弃解剖结构的一一对应,转而采用功能对齐

·以腕部 SE(3)位姿(三维空间位置 + 朝向)作为统一的空间基准,无论前端是人手、灵巧手还是夹爪,“整只手移动到哪里、朝向哪里”都用统一标准描述;

·按照五根手指、每指三个关节的范式,构造15个标准化手指关节槽位,不同本体的动作按功能对应关系映射到这些槽位中。

具体到三类本体的映射逻辑:

·人手动作通过 MANO 人手模型直接适配到15个标准关节;
·19自由度灵巧手根据关节功能对应关系,映射到相应的标准槽位;
·仅1个自由度的平行夹爪,则将开合动作映射到拇指、食指两个功能对应的槽位,其余不存在的关节在计算损失时直接 Mask 掉。

从产业视角看,JAAS 的价值远不止“提出一种新的动作表示”,它更像建立了一套机器人动作的“统一会计制度”。

过去人类数据要适配不同机器人,需要逐款做 Human→Robot 的重定向工程;而共享动作空间成熟后,所有本体都先接入统一的动作结算层,每新增一种硬件,不再需要重建整套数据转换链路,只需完成本体到共享空间的一次映射。

这才是“跨本体汇率”的核心意义:它没有消灭不同机器人的动作空间差异,而是让分散的数据第一次有了进入同一个训练体系的可能。



03

域对抗学习:洗掉“本体口音”,让模型专注任务本身


动作空间的统一,只是解决了“语言统一”的问题。如果模型依然能通过视觉特征分辨出眼前是人手、灵巧手还是夹爪,就可能继续根据外观分别学习各自的操作规律。这样,即使动作采用了统一的表达方式,不同本体的操作经验仍可能难以相互借鉴,跨本体迁移的效果也会受到限制。

这就像大家都开始说普通话,但模型依然能通过口音判断说话人的地域,进而给出差异化的反馈。为此,AdvDex 引入了域对抗学习(Domain-Adversarial Learning)机制,在 VLA 架构中加入域判别器与梯度反转层,形成一场“猫鼠博弈”:

·域判别器的目标是精准识别数据来自人手、灵巧手还是夹爪;

·视觉编码器则通过反向梯度训练,尽量剥离与本体形态相关的视觉特征,让判别器无法识别。

最终模型保留的视觉特征,会更聚焦于物体位置、接近路径、抓取方式、任务执行逻辑等核心信息,而非执行器的外观与结构细节。如果说 JAAS 解决了动作层面的“语言不通”,域对抗学习则解决了视觉层面的“口音干扰”,二者共同构成了完整的跨本体学习基础。


04

OmniShare:重构数据供给,从“机器人小时”到“人类操作小时”


AdvDex 对产业最具颠覆性的影响,在于它试图重构灵巧操作训练数据的成本结构与计价单位,而支撑这一点的,是同步发布的OmniShare 多模态人类操作数据集

当前行业内,VLA 灵巧操作模型的训练高度依赖“机器人小时(Robot Hours)”:通过遥操作设备操控真实机器人采集数据,单小时成本可达数千元,数据规模始终受限于硬件保有量与采集成本。这也是灵巧操作规模化商用的最大门槛之一。

而 OmniShare 直接将数据来源的边界拓展到了人类自然操作。这套数据集包含约16.8万条轨迹,覆盖500余种操作任务、700余种物体,配套多视角视觉信息与密集语言描述,总视频时长超1万小时。

更关键的是,操作者佩戴集成29个磁旋转编码器与霍尔效应触觉阵列的数据手套,可精细记录人手运动学信息与接触力数据,所有数据都经过物理约束优化,统一到标准人手表示体系中。

这意味着,“人类操作小时(Human Hours)”第一次可以作为规模化的训练资产,直接参与 VLA 模型训练。这相当于给具身智能的数据体系引入了“通用汇率机制”:人类操作数据不再是无法流通的“外币”,而是可以通过统一动作空间兑换成通用的“训练货币”。

从论文披露的训练策略来看,行业已经出现清晰的数据分工趋势:

·人类数据负责“学会做事”:模型先用海量人类操作数据预训练,掌握通用的任务逻辑与动作范式;
·机器人数据负责“学会用这副身体做事”:再用少量目标机器人数据做后训练,适配真实硬件的物理动力学特性。

如果这条路线跑通,灵巧操作数据供给的规模上限将从“万台机器人年采集量”升级为“亿级人类操作小时”,训练成本有望出现数量级下降,中小厂商无需重金搭建遥操作集群也能入局 VLA 研发。

05

触觉:不止是精度加成,更是跨本体的物理锚点



在 OmniShare 的多模态设计中,触觉信息的角色容易被简单理解为“提升精细操作精度”,但从跨本体迁移的视角看,触觉承担着更核心的功能:不同本体之间动作对齐的物理锚点。

行业普遍认知中,触觉主要用于优化抓取力控制、扭矩控制等精细操作的上限。但视觉特征很容易因为本体外观、形态、视角的差异产生偏移,而抓取力、接触位置、接触面积这类触觉物理量,在人手和机械手上的物理意义是完全一致的。

它本质上提供了一套与硬件形态无关的客观物理特征,帮助模型在不同执行本体之间建立更本质的动作对应关系,而不是停留在视觉层面的表面对齐。

换句话说,只靠视觉和运动学的对齐,很容易陷入“看起来像但实际力不对”的误区;触觉的加入,才让动作空间的统一从“几何对齐”升级为“物理对齐”。

不过需要明确的是,在当前 AdvDex 框架中,触觉主要作用于数据采集与物理约束优化环节,并非直接作为 VLA 的输入模态。它更像一个数据校准器,帮助提升人类动作数据的质量与对齐精度。未来如果能进一步建立共享的“接触语义空间”,才会真正补上跨本体学习的第三块拼图。



06

边界与争议:本体差异是被解决了,还是被藏进了模型?


必须客观指出的是,统一动作空间并没有、也不可能彻底消除 embodiment gap(本体差异)。人手与机械手在自由度数量、关节力矩范围、响应速度、可达空间上的物理差异是客观存在的,不可能通过坐标系定义和算法优化彻底消除。

这也引出了行业内一个持续争议的命题:“统一动作空间”究竟是在真正解决迁移问题,还是在把本体差异隐藏到模型的黑箱里?

支持者的逻辑是,对于绝大多数工业和商业场景,任务层面的动作逻辑是共通的——拧螺丝、抓物件、插接头,核心动作序列不会因为执行器是人手还是机械手而发生本质改变。统一动作空间 + 域对抗的组合,相当于把“形态适配”这一步交给模型自动学习,无需再人工设计逐款映射规则,工程落地效率可以得到大幅提升。

质疑者则认为,物理层面的差异无法通过算法完全消弭:人手可以完成的复杂柔顺操作,刚性结构的机械手未必能实现;平行夹爪的加持力特性,也与人手的多指力分布完全不同。过度依赖模型的隐式适配,在高精度、高负载、高安全要求的场景中,可能出现不可预知的失效。

论文本身也明确承认了这一限制:当前真机评测主要集中在单一灵巧机器人平台。共享动作表示虽然统一了动作的描述方式,但没有直接描述不同本体在运动和受力时的响应差异,也没有明确规定它们接触物体时需要满足的条件,例如怎样施力才能保持抓握稳定、避免滑动。对于精细操作,仅靠人类演示数据,也未必能让模型学会适合目标机器人自身硬件特点的控制方法。

从产业视角看,这其实不是一个非黑即白的判断。AdvDex 的核心价值不在于实现 “完美的跨本体迁移”,而在于大幅降低了中低精度场景的迁移成本和数据成本。对于 3C 电子装配、物流分拣、桌面服务等大多数商用场景,这种程度的迁移能力已经足够覆盖需求,而成本的下降足以推动技术的规模化落地。

另外值得注意的是,论文中提到的“Zero-shot Human-to-Robot Skill Transfer”有明确的边界:它并非指机器人完全不用自身数据,只看人类演示就能学会技能;而是指某项具体技能没有机器人示教,但模型可以把在人类数据中学到的技能,迁移到已经熟悉的机器人本体上。换言之,它打破的是“每一个新任务都必须重新采集机器人数据”的定式,而非“完全不需要机器人数据”。


07

产业判断:数据平权时代将至,硬件定义能力的底层逻辑不变


站在产业发展的维度看 AdvDex,它的意义不止于一项学术技术突破,更在于它可能推动具身智能领域迎来一次“数据平权”。

过去,只有拥有大量机器人硬件集群的头部厂商和科研机构,才有能力采集足够规模的遥操作数据,训练出可用的灵巧操作模型。如果人类自然操作数据可以直接复用,意味着创业公司、行业方案商也可以基于公开的人类操作数据集,快速训练适配自有硬件的 VLA 模型,行业的技术准入门槛将显著下移。

但我们也要清醒地看到,统一动作空间解决的是数据流通与复用问题,没有改变“硬件定义能力上限”的底层逻辑。最终能完成多高精度、多高负载、多复杂的操作任务,依然取决于执行本体的机械性能、驱动能力和传感配置。算法可以降低迁移成本、放大数据价值,但永远无法突破物理硬件的边界。

从数据资产的角度看,共享动作空间真正改变的是数据的流动性。过去机器人数据是绑定硬件的“非流动资产”,换一款硬件价值就大幅折损;未来,可迁移、可组合、可跨本体使用的操作数据,会成为更核心的竞争资产。行业的竞争焦点,也会从“谁的机器人小时更多”,逐渐转向“谁的数据流动性更高”。

从落地节奏来看,这套技术最先受益的会是两条产业路线:一是多品类、小批量的通用灵巧手厂商,可以快速复用海量人类数据,低成本适配不同的下游场景;二是拥有大量人工操作数据沉淀的行业,比如制造业、物流仓储,可以将积累多年的人工操作经验,快速转化为机器人可执行的技能。


08

结语


大语言模型之所以能实现规模化 Scaling 效应,核心在于不同来源的文字、网页、代码都能映射到统一的 Token 空间;图像模型的爆发,同样得益于不同格式的视觉内容都能编码到共享表示中。而机器人领域的特殊之处在于,它的输出不是信息,而是动作——动作天然绑定身体。

一只五指灵巧手和一只平行夹爪面对的是同一个世界,却并不拥有同一种行动能力。因此,机器人基础模型如果真的要走向规模化,迟早都要回答一个问题:不同身体产生的动作数据,究竟应该用什么共同语言描述?

AdvDex 给出的答案是 JAAS。它显然还不是最终答案:15个规范手指关节无法覆盖所有机器人形态,运动学统一也无法替代动力学、力控与接触建模,当前实验也远不足以证明一套动作空间可以覆盖未来所有灵巧手和末端执行器。

但它提出的问题已经足够重要:过去我们一直在把“人的动作”翻译成“某一台机器人的动作”,而 AdvDex 开始尝试另一条路线——把人和机器人,都翻译成一种第三方动作语言。

前一种模式,是一个人对应一台机器人;后一种模式,则有机会逐渐变成:所有人、所有机器人,共用一个动作市场。从这个意义上说,JAAS 未必已经找到了机器人数据真正的“世界货币”,但至少,机器人行业终于开始认真讨论:不同身体之间,到底应该按照什么汇率交换经验。而这,比某一个模型成功率再提升几个百分点,更值得产业关注。


连界创新



推荐阅读



产业应用场景



·出海!中国具身智能企业在全球市场大“杀”四方!

·比人形更快进入家庭?具身智能宠物机器人迎爆发!

·文娱巨星!人形机器人“表演大乱斗”,谁赢了?

·商业导览成具身智能商业化破局点?

·巡检机器人之困,场景刚需,但这一问题亟待解决



机器人本体企业



·仿生机器人=伴侣机器人?一文为仿生机器人正名!

·乐聚Taskor,为人形机器人规模化进厂按下“快进键”

·具身智能争霸赛打响!四大核心区都有哪些“扛把子”?

·CES 2026|星动纪元携人形机器人家族亮相

·智元CES放大招!开源Genie Sim 3.0强的可怕!



供应链动态



·零部件企业跨界突围!这些企业上大分!

·夺取物理世界的入场券:具身智能操作系统拆解

·人形机器人关节生死局:执行器路线之争与技术博弈

·灵巧手赛道“激战”,新老玩家各执什么王牌?
·开源数据集图鉴!这份具身智能“军火库”请查收

【声明】内容源于网络
0
0
机器人产业应用
由连界创新具身智能中心发起,以场景应用为导向,专注具身领域科技与产业的链接。我们将围绕投资+服务双轮驱动,为科技增长赋能。业务涵盖垂直行业峰会/沙龙、私董会、标杆走访,具身智能行业研究报告与咨询,产业生态系统搭建等。
内容 558
粉丝 0
机器人产业应用 由连界创新具身智能中心发起,以场景应用为导向,专注具身领域科技与产业的链接。我们将围绕投资+服务双轮驱动,为科技增长赋能。业务涵盖垂直行业峰会/沙龙、私董会、标杆走访,具身智能行业研究报告与咨询,产业生态系统搭建等。
总阅读4.2k
粉丝0
内容558