主旨报告
2026DAC全球数据资产大会
在9.9主论坛上,许杰焜老师从“编程范式”到“数据范式”的转变切入,系统阐述了数据如何驱动物理世界智能化。
为什么要“数据驱动”?
许杰焜老师指出,传统机器人需工程师逐行编写代码,将动作拆解为精确指令,开发周期长且难以应对非预设场景。而数据驱动的具身智能通过模仿人类行为数据自主习得技能,能快速适应新环境并掌握复杂的物理交互能力。
他进一步指出数字世界与物理世界的数据鸿沟:大模型坐拥约100亿小时人类文本语料,而具身智能的高质量交互数据仅约50万小时,万倍差距导致机器人泛化能力受限。唯有打破数据采集的成本壁垒,才能突破物理智能的“冷启动”瓶颈。
数据如何驱动物理智能?
三条路径的演进与融合
真机遥操作:操作员通过同构设备或外骨骼远程操控真实机器人,实时同步采集“状态-动作”精准配对数据,是VLA模型行为克隆训练的核心真值来源,但依赖人工操作导致成本高昂。
无本体采集:利用轻量化穿戴设备或手持终端,直接复刻人类操作逻辑,数据采集与机器人本体完全分离,大幅降低采集成本,全球超2/3顶尖具身智能团队已采用此模式。
仿真与合成:在虚拟空间中复刻真实物理规则,让智能体进行低成本、无风险的海量试错,覆盖长尾场景与极端工况,作为低成本、规模化的数据“燃料库”。
三者协同互补,构建低成本、高效率、高精度的数据闭环体系。
数据驱动在产业中怎么落地?
许杰焜老师分享了三个产业信号:
数据即商品:四川自贡卖出首笔具身智能数据集订单,300条“撕飞边”数据成交价3万元,100元/条;
数据即估值:光轮智能2026年估值突破150亿元,成为全球首个具身数据独角兽;
数据即基建:三大运营商集体入局,戴盟机器人获中国电信亿元投资。
他同时介绍了数据飞轮的核心逻辑:机器人部署到真实场景产生数据(尤其是失败数据)→数据回流驱动模型迭代进化→更优模型赋能更多场景与设备→采集更多高质量数据,如此往复实现智能系统的持续升级。
瓶颈与未来方向
许杰焜老师指出,数据可用性挑战依然突出:原始数据很多,但真正能进入模型并稳定复用的数据很少。世界模型与“预测驱动”正成为核心范式——从“被动反应”到“主动预测”,赋予模型“想象”能力,在行动前评估并选择最优策略。
他提出三个确定性趋势:
场景适配:无唯一解,“完全无本体”与“真机依赖”将长期共存;
商业跃迁:数据即价值,商业模式从“卖硬件”向“卖数据服务”转型;
渐进演进:数据定上限,这是一场以十年为尺度的“马拉松”。
在产业布局上,他建议关注底层·数据基础设施、中层·数据工具链、顶层·垂直场景闭环三个层次。他特别提到,厦门市已发布《具身智能产业发展三年行动方案(2026—2028年)》,明确支持打造具身智能数据集、推动数据共享。
为什么要“数据驱动”?
“数字世界坐拥100亿小时文本语料,物理世界仅有50万小时交互数据——万倍数据鸿沟,是具身智能必须跨越的冷启动瓶颈。”
“仿真并非替代真实数据,而是作为低成本、规模化的数据‘燃料库’。”
“谁能率先跑通数据飞轮,谁就能最快实现商业化落地。”
EAIA具身智能公共服务平台发布
2026DAC全球数据资产大会
精彩回顾
2026DAC全球数据资产大会
精彩内容
往期推荐
点赞关注不迷路

