大数跨境

冲刺全球首个100万小时具身数据!国产公司联手了

冲刺全球首个100万小时具身数据!国产公司联手了 量子位
2026-08-06
7
导读:采集、仿真、训练和评测,闭环了

导读

黎曼动力联合光轮智能、诺亦腾机器人,正式组建具身智能数据联盟。三方旨在打通采集、仿真、训练与评测全链路,共建行业数据底座。黎曼动力提出宏伟目标:到 2026 年底完成 100 万小时机器人训练数据采集,规模直指当前全球高质量存量数据的两倍,以此验证具身智能的 Scaling 定律。

模型渴望 Scaling,数据成为最大瓶颈

大模型的发展史本质是 Scaling 史,而具身智能的 Scaling 进程却因数据匮乏而受阻。行业共识表明,机器人技术从演示走向落地的核心卡点在于数据:既缺乏足够的“量”,也难以满足日益严苛的“质”。

与大语言模型可轻易获取万亿 Token 互联网语料不同,具身智能数据获取极为艰难。尽管真机采集、遥操作、可穿戴设备及仿真环境等手段层出不穷,但全球主流模型的训练数据量仍普遍停留在数千至数万小时区间。即便是 Physical Intelligence 训练π0 使用的 1 万小时数据,或英伟达 GR00T 1.7 披露的约 4 万小时多源数据,在大规模模型视角下仍显单薄。

此外,高质量具身数据需涵盖真机控制、人类语义理解及仿真长尾场景三类,且目前分散于不同机构手中,导致采集、训练与评测环节割裂,难以形成闭环。

具身智能亟需构建“模型发现问题—采集补充数据—仿真放大场景—评测验证效果—反馈迭代”的完整闭环。黎曼动力此次联手光轮智能与诺亦腾,正是为了让数据生产真正围绕模型需求运转。百万小时数据虽非能力涌现的绝对阈值,却是验证具身智能能否实现 Scaling 的关键起点。

三方强强联合:构建数据闭环生态

此次合作的三家企业各具核心优势,共同补齐了具身智能数据链条的关键环节:

诺亦腾机器人:人类经验的翻译者

依托动作捕捉领域的深厚积累,诺亦腾占据全球 70% 市场份额,擅长将人类动作转化为高精度机器人训练数据,是国内多家头部机器人公司的核心数据供应商。

光轮智能:物理 AI 基础设施

作为全球首个具身数据独角兽,光轮智能提供“求解—测量—生成”三位一体的仿真平台。其能力覆盖仿真合成数据生成、人类行为数据采集及工业级评测,并能将真实部署反馈回流至模型迭代,形成持续学习闭环。

黎曼动力:模型训练的核心引擎

成立于今年 7 月的黎曼动力,前身为昆仑万维 Matrix 世界模型团队。该团队历经三年研发,攻克了实时生成、动作控制与长期记忆等技术难题,从数字世界模型成功转型为物理世界行动模型。

Riemann-1.0 模型继承了 Matrix 对世界状态变化的建模能力,并将机器人动作纳入统一框架。相较于依赖固定程序的流水线场景,该模型更能适应家庭、养老等开放环境中充满不确定性的任务,通过海量数据学习通用物理规律与任务逻辑,实现真正的举一反三。

借鉴自动驾驶,打造机器人“数据工厂”

自动驾驶行业的发展路径为具身智能提供了重要参考。早期 Waymo 等企业通过构建“真实道路发现长尾场景—仿真复现生成变体—测试验证回归真实”的闭环体系,积累了数亿英里的驾驶经验。

然而,机器人行业难以简单复制此模式。由于缺乏大规模部署的天然数据入口,且试错成本高、场景重置复杂,单家企业包办全流程既不经济也不高效。因此,联合建设数据闭环成为行业必然选择。

黎曼动力、光轮智能与诺亦腾的合作逻辑与此一致:一家专注模型训练,一家补充真实动作数据,一家扩展仿真与评测,共同打通割裂链路。更重要的是,三方计划共建数据规范、标注标准与评测基准,并向行业开源部分数据集与工具

这一举措意在超越单一企业的护城河,推动整个行业加速发展。百万小时数据实验的终极意义,在于探索具身智能是否能像大模型一样,找到属于自己的 Scaling 路径,从而开启物理世界 AI 的新篇章。

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16366
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读366.4k
粉丝1
内容16.4k