2009 年,李飞飞团队发布 ImageNet,确立了大规模视觉识别任务的统一数据与评测基础设施,推动了图像识别与深度学习的飞速发展。
17 年后,李飞飞的博士生、佐治亚理工学院助理教授 Danfei Xu,正致力于为机器人学习构建类似的协作基础设施。他长期研究机器人如何从人类演示中学习,并将经验迁移至不同任务、环境及机器人本体。
这一研究最终汇聚成 EgoVerse——“第一视角人类操作数据生态”。该生态不仅包含佐治亚理工、斯坦福、苏黎世联邦理工等顶尖学府,更吸纳了 Meta、Scale AI 及光轮智能等企业。其中,光轮智能作为唯一入选的中国公司,登上了这一全球标准制定的核心舞台。
EgoVerse:构建具身智能的“活”数据标准
机器人学习长期面临数据悖论:真机遥操作成本高、效率低且场景有限,而人类行为天然蕴含丰富的视觉信息与任务策略。第一视角人类数据成为破局关键,但过往数据集多为一次性项目,缺乏统一标准,难以跨机构复用。
Danfei Xu 及其合作者将 EgoVerse 设计为一套动态协作框架,而非静态数据集。其当前版本涵盖 1362 小时人类演示、约 8 万个片段(episode)、1965 项任务及 2087 名采集者。数据不仅包含第一视角视频,还整合了相机位姿、三维手部信息及细粒度语言描述,并在多实验室、多机器人本体上验证了迁移效果。
EgoVerse 旨在建立事实标准:让全球具身数据采用共同的数据结构、任务语义与检验方法,实现真正的互联互通。
全球顶级共建方:定义具身数据新范式
具身人类数据的采集涉及研究定义、硬件、动作迁移、规模化运营及验证等复杂环节,单一机构难以独立完成。EgoVerse 集结了全球头部力量进行分工协作。
佐治亚理工:组织中枢与研究框架
作为发起人,Danfei Xu 团队负责搭建协作协议。EgoVerse 通过共享协议,使不同实验室能在统一框架下复现实验,回答数据跨实验室、跨本体及规模增长时的有效性问题。
斯坦福大学:打通“具身鸿沟”
Shuran Song 教授团队开创了 UMI(Universal Manipulation Interface),利用便携式手持夹爪采集真实环境操作,并将人类经验转化为可部署的机器人策略,解决了人类灵活性与机器人执行能力之间的映射难题。
Meta:专用采集硬件基石
Meta 提供的 Project Aria 眼镜是行业首个专为大规模基础模型设计的采集硬件。它能同步记录第一视角视频、手部动作及空间信息,将单纯的“视频记录”升级为具备三维空间感知能力的“行动数据”。
Mecka AI:降低采集门槛
Mecka AI 推动采集设备普及化,利用 iPhone 与轻量化头戴装置完成第一视角采集,并通过云端恢复三维轨迹。这使得数据采集能从实验室走向家庭、商店等更广泛的真实场景。
Scale AI:规模化数据工厂
依托在自动驾驶领域积累的基础设施能力,Scale AI 负责将异构、大规模的原始采集数据,经过清洗、标注与质检,转化为稳定可用的标准化数据产品。
光轮智能:构建高质量数据闭环
面对千万级小时数据的规模化挑战,光轮智能提供了一套贯穿端侧采集、云端处理到仿真验证的全流程质量控制体系。其方案兼容 Aria、iPhone 等多种硬件,通过统一的云端管线进行 VIO、三维姿态及动作语义标注,并利用自研仿真平台 SimFoundry 与评测平台 RoboFinals 验证数据价值,确保数据在规模化生产中依然源头可控、标准统一。
光轮智能:重新定义高质量人类数据
传统质检仅关注文件完整性,无法证明数据对机器人学习的实际价值。光轮智能将数据质量管控拆解为三个核心环节,形成完整闭环。
Agent 驱动:从事后抽检到过程控制
针对采集现场的动作遮挡、任务中断等风险,光轮智能利用 Agent 实时监测设备状态与任务流程。一旦发现异常立即纠偏或补采,并根据现有数据分布动态调控下一轮采集策略,避免样本重复,从源头保障数据多样性与完整性。
云端统一:多元硬件,一致标准
无论数据来源何种设备,均需进入光轮智能的统一云端管线。通过视觉惯性里程计(VIO)恢复空间运动,结合三维手部与全身姿态标注,以及 V7 级动作语义切分,将多源异构数据转化为符合统一标准的训练资产。
仿真验证:以学习效果检验数据价值
数据处理完成后,光轮智能将其接入 SimFoundry 仿真平台与 RoboFinals 评测平台。前者将人类数据转化为可执行的仿真任务,后者通过标准化评测验证数据在特定任务与物理条件下的有效性。评测结果反向指导采集端优化,形成持续迭代的数据质量闭环。
唯一中国身影:参与定义全球两大基础设施
随着具身智能迈向规模化,行业竞争已延伸至底层基础设施。目前两条主线日益清晰:以 EgoVerse 为代表的数据基础设施,解决学习经验的获取;以 Newton 为代表的物理仿真基础设施,解决经验的复现与验证。
Newton 由 NVIDIA、Google DeepMind、Disney Research 等联合发起,光轮智能作为技术指导委员会成员,共同定义机器人仿真与物理建模的技术路线。
光轮智能是目前唯一同时参与 EgoVerse 与 Newton 两套国际标准体系的中国企业。在 EgoVerse 中,它贡献了全流程数据质量体系;在 Newton 中,它参与了物理求解与仿真资产的核心建设。
如果说 ImageNet 奠定了视觉 AI 的基石,那么 EgoVerse 与 Newton 正在共同构建物理 AI 的全球基础设施。光轮智能的深度参与,标志着中国企业已从标准的使用者,转变为全球具身智能底层规则的共同定义者。

