大数跨境

机器人开始学会“三思而后行”?这家公司将世界模型接入灵巧操作,任务成功率提高至75%

机器人开始学会“三思而后行”?这家公司将世界模型接入灵巧操作,任务成功率提高至75% DeepTech深科技
2026-09-14
11
导读:机器人家务到底做得怎么样了,距离真正解放我们的双手还有多远?

拧灯泡、撕厨房纸、抽取叠放纸杯,这些对人类而言轻而易举的动作,在具身智能领域却是长期难题。过去几年,机器人基础模型已从单项任务训练转向利用视觉、语言和动作数据学习通用策略。然而,要让机器人真正进入家庭与工位,不仅需要模仿人类“完成动作”,更需让模型、数据与硬件围绕人类交互经验共同演进。

9 月 10 日,在 2026 外滩大会上,生数科技联合创始人兼 CEO 骆怡航发布了 Motus2 模型。该模型由生数科技与清华大学联合研发,面向高自由度灵巧操作,已在搭载 WUJI Hand 2、Sharpa Wave 等灵巧手的双臂机器人上完成测试。

给动作后果打分:从“想象”到“评估”

Motus2 的核心突破在于引入价值模型(VM),构建“动作生成—后果预测—价值评估”的闭环。传统工业机器人依赖预设轨迹,难以应对环境变化;现有的模仿学习与视觉语言动作模型(VLA)虽提升了泛化能力,却缺乏对动作后果及任务价值的显式判断。

世界模型为此提供了新思路:在行动前先预测未来几帧的环境变化。生数科技此前的 Motus 模型已实现视频预测与动作生成的统一,但“能想象未来”不等于“知道哪个未来更好”。Motus2 新增的价值模块,能让机器人依据任务目标,对不同行动结果的优劣进行打分,从而筛选出最优策略。

为确保训练符合真实因果逻辑,Motus2 采用“动作优先”信息流:动作仅读取历史信息,未来视频基于动作预测,价值评估则综合动作与预测结果。这一机制防止了模型在训练中“偷看答案”,确保部署时的可靠性。

在推理阶段,模型通过 Best-of-N 规划生成多个候选动作并评分择优;在训练阶段,引入基于模型的强化学习(MBRL),将高价值方案转化为策略更新信号。此外,失败数据也被重新利用,用于学习环境变化规律及修正价值判断。

真机测试数据显示,在放置手机和多指操作任务中,基础策略成功率为 65%;加入规划机制后升至 67.5%,单独使用 MBRL 达 72.5%,两者结合则达到 75%。这表明策略更新对性能提升贡献显著,而实时规划可进一步优化单次决策。

如何学习 13 万小时数据:跨越本体鸿沟

灵巧手拥有 20 个以上自由度,高质量数据采集成本高昂。为解决数据稀缺与对齐难题,Motus2 采用了分层数据扩展路径:先从约 13 万小时人类第一视角视频中提取操作先验,再逐步迁移至机器人本体。

数据体系包含三个层级:首先是超 11 万小时的单目视频,覆盖多样场景以学习广义视觉知识;其次引入 1.74 万小时同步双目素材,利用视差线索提升三维空间感知;最后通过数十小时人机对齐数据及百小时级机器人轨迹,完成从“人手”到“机械手”的映射。

实验表明,仅经人类数据预训练的模型在五项真机任务中平均成功率仅为 51%,加入机器人域中间训练后跃升至 84%。其中放置小球和贴合橡皮任务达到 100% 成功率。这证实了人类视频提供操作先验,而机器人数据负责动作落地的关键作用。

研究还发现,随着双目数据规模从 2000 小时增加至 20000 小时,人类动作预测误差呈对数线性下降。但这并不意味着数据扩张能无限带来收益,模型、数据与硬件形态之间仍存在相互制约的三角关系。

补全记忆与触觉:感知不可见信息

除视觉外,历史记忆与触觉反馈是完成复杂操作的关键。针对长序列任务中历史信息丢失的问题,Motus2 对比了全局自回归与混合记忆两种模式。测试显示,在寻找隐藏方块等任务中,保留完整历史的全局自回归在真机环境下的成功率(57.5%)显著高于压缩历史的混合记忆(25%)。

在触觉处理方面,高频传感若直接触发大模型重推理会导致延迟。Motus2 沿用轻量化“触觉专家”架构:主模型生成动作片段并缓存特征,触觉专家在执行前读取最新传感数据,对动作进行微调。这种分工既保证了全局规划的稳定性,又实现了对接触力变化的快速响应。

消融实验显示,在抽取纸杯和撕纸任务中,加入触觉模块后平均成功率从 60% 提升至 72.5%。该成果验证了触觉对于精细接触操作的重要性,目前测试平台涵盖单手 20 自由度的 WUJI Hand 2 及 22 自由度的 Sharpa Wave。

迈向 L4:通用世界模型的演进路线

生数科技同期提出了通用世界模型(GWM)五级演进路线:从 L1“生成世界”到 L5“世界组织者”。Motus2 目前已具备 L3“在世界中行动”的关键能力,即理解状态、预判未来并执行动作。更重要的是,它通过接入评估与反馈闭环,初步展现出递归自我改进(RSI)的特征。

Motus2 始终坚持以人为牵引的技术迭代路径,印证了人类经验在机器人进化中的核心地位。未来,要从 L3 迈向 L4“自主世界智能体”,仍需在长程预测、跨本体评测及规模化触觉采集等方面取得突破,实现模型、数据与硬件的深度协同演进。

注:封面及首图由 AI 辅助生成

【声明】内容源于网络
0
0
DeepTech深科技
DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
内容 5661
粉丝 2
DeepTech深科技 DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
总阅读124.9k
粉丝2
内容5.7k