大数跨境

光轮智能总裁杨海波:从仿真数据到物理真实,具身智能的「基础设施」之战

光轮智能总裁杨海波:从仿真数据到物理真实,具身智能的「基础设施」之战 潮涌AI
2026-07-20
18
导读:让数据共享共用,避免各自为政。
©潮涌AI编辑部

在世界模型、物理AI概念爆火之下,市场要面临的是具身智能预训练数据近乎空白。

具身数据需同时满足高质量、大规模、多样性三大硬性标准,物理交互真实度、场景与动作多元性成为模型泛化能力的关键约束。

作为国内具身数据基础设施的代表性企业,光轮智能成功加入Newton技术委员会,成为全球仅有的五家企业其中之一,代表中国企业定义物理AI仿真标准。

73日,光轮智能联合创始人兼总裁杨海波在“2026全球数字经济大会人工智能融合应用发展论坛”上发表了《10亿数据生成器:构建物理AI基础设施》主题演讲,面对行业数据孤岛、重复建设痛点,杨海波完整剖析具身智能数据产业底层逻辑,为国产物理AI仿真基础设施自主化、行业生态协同发展提供清晰路径。

以下是杨海波演讲实录,经潮涌AI整理发布:

具身数据三要素:高质量、大规模、多样性

从自动驾驶到大语言模型到具身,数据发挥的作用越来越重要。

特别是分阶段来看,写算法的很多。

大语言模型已经存量有一些数据,卡口更多的是算力,在不同地方寻找算力、去寻找更好的模型,大家都争夺算力。到了具身,无一例外聚焦到非常关键的卡口——就是数据。

相比这样一个情况我们可以看到,具身的数据需求我们认为至少是大语言模型的1000倍。

它和大语言模型和自驾进行对比——

大语言模型是一个被祝福的行业,存量数据是沉淀在互联网上几十年的数据,大家自取自用。

自动驾驶有成百上千的车在马路上不断跑,在回环数据。

大语言模型或者自动驾驶,他们的预训练数据,就是对数据的清洗、筛选,他们的来源并不缺。

对具身来说,预训练数据是零。没有一个成熟的本体在这个上回环数据。所以,我们认为具身数据的需求量很大。

自动驾驶取代的行业是司机,具身智能取代千行百业,需要的数据量显然更大,至少是一千倍的需求。

具身这种数据维度要求更高,有物理交互更多的需求。具体到底需要什么样的数据?我们服务国内外很多客户,有很多体会。

第一是高质量。所有的数据追求高质量,但是具身的要求显然更高,因为不仅仅是三维视觉的要求,还有物理交互、物理世界的要求。

第二是大规模。刚才规模提到是自驾或者大语言模型至少一千倍,所以再高质量的少量数据对于具身模型没有价值,必须具备大规模的供给能力。它要求你从产品设计、技术方案、运营方案都要支撑大规模,否则很难满足这样一个具身数据需求量的要求。

第三是多样性。现在很多方式在多样性考虑不太充分。举个例子,我们服务最头部的客户,对多样性要求什么级别?一个人一个场景下一项任务只能生成一个数据。他要求一个人采集的数据,通过一个人采集一条,去强制要求人的生理的特征、人的习惯动作的多样性,其实是对多样性的极致要求——一个场景只采集一条,来满足多样性的要求。

可以想象,自动驾驶没法在训练场跑一百万圈上路,本质都是对多样性的要求。

能够满足高质量的,也是我们的核心产品。

具身智能至少需要10亿个数据生成器

到底需要多大量的数据,这个问题经常会被问到,其实很难回答。

自动驾驶现在到底是否有一个多少量能够解决它的问题,其实也没有出来,因为自动驾驶还没有解决L4的问题。一百万辆车不是数据量,是数据的生成器。

具身智能是自动驾驶的一千倍,我们认为具身智能至少需要10亿个生成器来生成数据,才有可能解决这样的数据问题。

但是它的学习,数据生成又不是单点。有了数据存量消耗,更多是闭环学习的一个逻辑。这个就像人一样,人也是在循环往复的学习,通过经验反省。对具身也一样,它要通过数据、评测、落地部署循环往复地做数据训练。

所以,我们认为具身的数据并不是一个燃料性质的一次性消耗,更多的是因材施教的不断循环往复的过程,才能真正让我们的具身具备这样的能力。

数据、评测、落地部署,这是一个完整闭环。只有这个闭环运转起来,才能让具身的模型真正实现落地。

刚才提到这里面有个评测的逻辑。我们认为现在的具身数据越来越是一个评测驱动的逻辑,但是具身的评测其实挺难的。

大语言模型的评测,每个人在用,都在评测它;自动驾驶的评测,有自动驾驶汽车的驾驶员,每个驾驶动作都在评测它。

但是,具身的评测怎么来?

只能在仿真下进行,因为只有仿真才可以提供这种可量化的、可对比的、可复现的、大规模的评测能力,否则其实无法实现对具身模型的评测。

其实最近各地都在推出中试基地的建设,很好地说明了现在的具身模型真正要做到产业去部署,需要一个相当的中试能力。但是中试不能在一个确定的场景下去测一测技术能力,特别是大脑的中试,应该经过大规模的盲盒对比的测试,才能真正达到中试的效果。

仿真是一个中试必经或者必需的能力,才能真正去服务到中试的效果。

全球首个具身数据独角兽,三项交付冠军

说到这儿,我再简单介绍一下公司的情况。

我们是全球首个具身数据独角兽的企业,我们在仿真合成数据、人类视频数据、仿真评测领域三项交付冠军,也服务了国内外最头部的客户。

我们其实构建了一个刚才提到的从数据到评测到部署的整个体系。

数据基于EgoSuite,我们的评测在今年1月份在北京市的高质量发展大会上,我们发布了RoboFinals。我们落地部署是RoboStack,可以真正落地部署场景方,实现刚才提到的只有这样一个闭环的教育系统、因材施教的教育系统,才能真正能够让数据运转。

提到这么多,其实很核心的一个技术点就是仿真能力。我们很荣幸代表中国企业加入Newton技术委员会,Newton是全球最领先的仿真器,物理AI界最领先的仿真器。他的技术委员会有且仅有5家企业:英伟达、谷歌的DeepMindDisney、光轮智能和TOYOTA

只有这5家企业去定义物理AI仿真的技术发展方向、开源的标准。

为什么我们被纳入?其实其他4家都是贡献了这个行业里最头部的仿真器,Isaac SimMujoCo这些仿真器。

我们基于全栈自研的三位一体的仿真平台,去定义了仿真下的这些标准,包括仿真下模型,我们叫仿真下资产的标准、仿真下环境的标准、仿真下任务的标准等,且我们拉通了这些家,每家都在使用我们的规范和标准。我们还开源了不同家之间的资产转换算法,基于此,得到了这个行业的认可。

其实在这里我们也看到了一个机会,或者说对企业的商业机会,也是对国家的战略价值的机会——我们国家的仿真器其实比较落后。不仅仅是当下,在之前的工业仿真阶段,严重地对外依赖,西门子、达索等,到了具身物理AI时期,我们的仿真对外依赖度也很高。

基于此,企业的商业价值和国家的战略价值,我们开始自研这样一个仿真器——SimFoundry这套仿真器核心是三项技术:求解、测量和生成。

我们去自研很多现在针对具身的求解算法,去测量这个世界。

过去的仿真为什么不行?因为它不准。为什么不准?因为它的值来源于猜测或者经验。

我们去测量这个世界上摩擦力,我搬它的力的大小,都要从真实世界上一点点测量回来,去取到真实世界上的值,在仿真下进行配置,让仿真世界做到和真实世界具有同样的物理真实的效果。这是能够服务具身的最前提条件。

大家说Sim-to-Real gapgap在哪?就是物理交互是否真实。通过我们这样一个技术栈,解决了Sim-to-Real gap的问题

推“复售”作为核心指标:让数据共享共用,避免各自为政

我们希望构建的是一个开放的生态。

这个生态应该不断地贡献到这个数据上。我们其实基于具有模型的评测能力、数据的评测能力,也和很多头部厂商在Co-Design(共同设计)这个数据的需求,掌握了这些数据标准它的配方。

基于此,我们企业内部越来越推两个概念:第一个复购,我们推大企业对我们的复购,持续地对我们的数据认可。

但另外一个指标我们要推复售——我们要把同一批数据卖给不同客户的次数,作为我们一个核心指标。

为什么把这个作为核心指标?因为只有复售了,才证明数据得到了不同厂商的认可,才收敛了这个标准。

只有收敛规范,才避免在数据上各自为政、重复建设,真正把大家的数据贡献到一起,大家共享共用,才能让这个模型很好地有获得大规模的数据。

否则其实数据现在需求量这么大,大家如果各自独立产权,其实我们认为它很难加速这个行业的发展。

所以,也希望跟行业伙伴,包括硬件厂商,我们采集硬件其实很愿意和行业合作,因为我觉得头部的这些具有大规模交付经验的厂商,硬件的稳定性当然更好。

通过合作这些采集硬件厂商、合作模型厂商,我们可以构建这样一个共享共用的平台,行业通过我们去收敛这些数据的标准和范式,让数据真正能共享共用和流通起来,这是我们希望做的事情。

当然这个基础还是回到我们的标题,具身智能至少需要一个10亿级生成器的量级,这也是对这个行业巨大的机会。

2026全球数字经济大会人工智能融合应用发展论坛”由全球数字经济大会组委会主办,北京市经济和信息化局、朝阳区人民政府承办,中关村科技园区朝阳园管理委员会(北京市朝阳区科学技术和信息化局)、北京数智云科信息科技有限公司、北京信息化协会、北京人工智能产业联盟、北京数智聚联企业管理有限责任公司协办。





=
👆🏻联系我们 CONTACT US!

转载开白·商务合作·作者招聘·加入社群

请添加微信xingminghui15

【声明】内容源于网络
0
0
潮涌AI
建构AI产业的先进性。
内容 28
粉丝 0
潮涌AI 建构AI产业的先进性。
总阅读306
粉丝0
内容28