大数跨境

王兴兴担心的具身智能瓶颈,京东试图补上这一课

王兴兴担心的具身智能瓶颈,京东试图补上这一课 镜相工作室
2026-08-21
7
导读:人类举一反三的能力,机器人还在学习。

文丨彭杰克
编辑丨周近屿


三年以来,具身智能飞速发展。人们不断想象机器人进入生活的各个角落,化身家政员,叠被子、刷碗、整理衣柜;走进物流仓库和便利店,和分拣员、理货员一起工作,让人类员工少一些日夜颠倒。
但真正让机器人走进这些场景,并没有想象中容易。
在一家 24 小时营业的便利店,机器人需要整理货架、补货时,可能有一只手突然伸到它面前拿走一瓶饮料,一件商品被顾客随手放到了其他地方;有人从身边经过,挡住它的视线;随着时间推移,店内光线也会发生变化。
对人来说,这些都是下意识就能处理的小插曲,机器人却像是面对全新的知识点和考卷,缺乏举一反三的能力,需要重新判断刚刚发生了什么?接下来应该怎么做?
从实验室走进日常生活,机器人面对的是一个有人、有物、不断变化的真实物理世界。它需要学会观察这些变化,也需要学会在变化中行动。
这几乎是目前所有具身智能企业面临的问题。8 月 20 日,在 2026 世界机器人大会上,宇树科技创始人王兴兴表示,目前全世界最大的瓶颈是具身智能的泛化能力不够。当通用机器人在陌生环境中,能够完成约 80% 的任务时,产业会迎来爆发的临界点。
同一场会,京东集中展示了具身智能数据生态业务的最新进展,包括京东云 JoyEgoCam 二代全身全模态采集终端、JoyAI-Sim 人机数据对齐工具链、JoyBuilder 模型开发平台、JoyAI-RA 0.5 具身操作基础模型。同时强调,依托超级供应链,京东长期深耕零售、物流、健康、工业、家政等实体产业,覆盖仓库、门店、药房、家庭服务等丰富场景。这些场景并非为了训练模型而搭建的“样板间”,而是每天持续运行的真实商业系统。这些都为王兴兴提到的具身模型泛化能力提供了天然的训练场。
● 京东集团技术委员会主席、京东云总裁曹鹏在 2026 世界机器人大会主论坛演讲。
宇树科技等具身智能企业担心的问题,京东正试图补上这一课。


机器人到底该从哪里学?

过去几年,大语言模型能够快速成长,一个重要原因是互联网已经积累了海量文字、图片和视频。模型可以从这些公开内容中持续学习,获得语言、知识以及对现实世界的理解。

机器人面对的情况有所不同。它需要学习的是用多大的力气拿杯子、怎么样把被子铺平整。这些能力很难直接从互联网现成的数据中获得,更多存在于人的身体经验和真实世界的操作过程中。
这是一块稀缺资源。据行业测算,到 2026 年初,全球高质量真实物理交互数据总量约 50 万小时,而训练通用具身智能模型可能需要千万小时级数据,供给和需求之间存在巨大缺口。
目前,行业主要通过真机遥操作和仿真训练等方式积累数据。
真机遥操作由人远程控制机器人,或者通过外骨骼等设备完成动作,机器人同步记录传感器数据。这类数据接近机器人未来的工作状态,但采集成本很高,需要投入机器人本体、场地和人工。
仿真训练可以依靠算力批量生成数据,规模更容易扩大,但虚拟世界很难复刻现实中的所有细节。光照变化、物体遮挡、材质差异、非标准摆放以及人员干扰,都可能让机器人从仿真环境走进真实世界后遇到新的问题。
行业因此开始寻找另一种数据来源:来自真实场景的人类第一视角数据(Ego Data)。
它的采集方式很简单:让人戴上摄像头,以第一视角记录自己看到的环境、身体如何移动,以及完成一项任务时手部如何操作。与只记录机器人动作的数据相比,这类数据能够保留更多人的操作过程,让模型看到人在真实环境中如何与物体、空间以及其他人互动。
● 京东云 2026WRC(世界机器人大会)展台。左边为人类第一视角数据采集,右边为真机遥操作数据采集。
今年以来,这一方向正在从研究走向产业实践。
今年 5 月,英伟达具身智能自主研究团队负责人 Jim Fan 介绍了 EgoScale 项目:先利用约 2 万小时真实场景下的人类第一视角视频进行预训练,再用 50 小时高精度模拟数据和 4 小时真实训练数据进行动作微调,让机器人进一步完成卡片分类、液体转移等灵巧操作任务——这就是王兴兴所说的泛化能力。
京东也在做类似的尝试。今年 4 月,京东云发布覆盖“采、存、标、训、评、仿、测”全链路的具身智能数据基础设施,并计划发动最多 60 万人参与数据采集,包括 10 万名内部员工和 50 万名外部行业人员,计划在两年内积累 1000 万小时人类真实场景视频数据,并建设大规模具身智能数据采集中心
京东希望通过第一视角数据保留人的视角、动作节奏和操作意图,让模型获得更多关于真实世界中“人、物与环境如何共同变化”的信息。而在 2026 世界机器人大会上,京东云 JoyEgoCam 二代的发布,正是这套数据体系向前走的一步。
● 京东云自研 JoyEgoCam 二代数据采集终端。


手把手教机器人怎么做

真正做过一次数据采集才会发现,给机器人“看懂”人类怎么做事,并没有想象中简单。

我曾亲身体验过一次数据采集工作。三天培训结束后,大半参与者放弃了。我们用的是一套还在研发中的设备,装有摄像头的头盔很笨重,数采手套的信号也不够稳定,而且只能记录手部信息。整理床铺时,采集员不能像平时一样抖被子、甩毛巾。因为小臂位置缺少摄像头和传感器,这些动作一旦发生,机器人就很难完整理解。人类觉得自然的动作,在训练数据里可能是一段缺失的信息。
这也是具身智能数据采集面临的现实问题。数据价格并不低,但真正有效的数据并没有想象中那么多。采集过程中,画面丢失、操作重复、动线不合理等问题,都可能让一段视频失去训练价值。数据采集完成后,还需要经过质检、清洗和标注。
如何提高采集效率,同时让数据记录得更完整?这是第一视角数据走向规模化后,摆在行业面前的问题。
京东从采集终端入手。
JoyEgoCam 一代让普通人的第一视角操作可以以视频的形式被记录下来。基于这套设备,京东建设了 EgoLive 数据集。目前,EgoLive 已经公开约 2000 小时数据,包含 65866 个任务片段、346 项真实世界任务,覆盖家庭服务、零售等实际场景,并收到超过百所高校和科研机构的申请使用。
但第一代设备也让一个问题变得明显:人的操作从来不只有两只手。整理床铺时,人会随着被子的位置调整身体,抬起手臂、移动脚步;从货架上拿取商品时,人也会同时改变站姿、视线和手臂位置。身体姿态、视角变化、手臂和腿部的运动轨迹,本身就是一个完整操作的一部分。
京东云 JoyEgoCam 二代因此扩大了记录范围。二代增加了手部、手臂和腿部动作捕捉能力,并扩大视野范围,让设备能够记录更加完整的身体姿态和操作空间。同时,采集信息从视觉延伸到更多感知维度,支持环境音采集、语音控制等,还可以结合触觉手套、神经腕带,进一步记录手部细微操作、全身姿态以及触觉信息。
● 图源:《机器人总动员》
对机器人而言,这些信息对应的是人在真实环境中完成一项任务时的完整过程:眼睛看到什么,身体怎么移动,手怎么操作,周围发生了什么。
设备本身的使用方式也在改进。JoyEgoCam 二代增加 Wi-Fi 和蓝牙连接,配合专属 App 可以支持众包采集模式,让数据生产从专业采集团队扩展到更多普通参与者,为京东两年积累 1000 万小时真实场景数据提供规模化路径。
采集终端变得更丰富之后,数据还需要被“翻译”成机器人能够理解的信号。京东为此加入自动化标注和“手部—上半身—全身一体化”人机对齐算法,把过去偏重局部手部动作的对齐范围扩展到更完整的全身动作。
同时,JoyAI-Sim 将人类数据、仿真数据和真机数据连接起来,用于数据生成和模型评测。京东探索研究院披露,其仿真评测与真实评测结果一致性约为 90%,结合 Isaac Lab-Arena 后,整体评测效率达到真机评测的 3.2 倍。
从 JoyEgoCam 一代到二代,京东想做的事情越来越清晰:采集的对象从一段视频,扩展为人在真实环境中完成任务时的一整套感知与动作信号,采集的人群从专业团队,逐步扩展到更大规模的参与者。


数据有没有价值,还得看机器人能不能学会

数据采集得再多,最终还是要回到一个最基本的问题:机器人到底能不能从这些数据里学会做事?

真实场景数据的价值,很大程度上体现在模型面对陌生环境时的表现。机器人在训练阶段见过的物体、货架和场景毕竟有限,如果换一个商品、改变货架布局,或者光线发生变化,它还能不能完成任务,考验的是模型能否从数据中学到更普遍的操作规律。
京东首先用自己的模型验证了这一点。
基于自采的真实场景数据,京东训练了 JoyAI-RA 0.5 具身操作基础模型,覆盖商品抓取、分类收纳、理货上架、物流搬运等高频任务。在真机具身 Benchmark 中,JoyAI-RA 0.5 在已见任务上的平均成功率达到 92.0%,在未见泛化场景下达到 75.5%。
京东正在尝试把这种能力进一步提供给其他具身智能企业。
近期,某具身智能公司接入京东云 EGO 场景数据服务,引入数万小时第一视角真人操作数据,用于其以人为中心的世界模型基座预训练。对于这家公司而言,需要学习的是人在真实环境中参与时,人与物体、环境以及机器人之间如何共同变化。
这也让第一视角数据的价值显现出来。同样一批真人操作数据,被不同的模型架构使用,产生的效果可能并不相同。对于以物体操作为中心的模型而言,视频中的人体姿态、动作节奏和意图线索可能只是辅助信息;对于以人为中心的世界模型,这些信息却可能是模型理解真实世界的重要监督信号。
换句话说,如果模型要理解“一个杯子发生了什么变化”,人的动作可能只是背景;如果模型要理解“人在拿起杯子时,杯子、人的身体和周围环境如何一起变化”,人的动作就成为世界状态的一部分。
京东云提供的 EGO 场景数据来自真实业务环境,并经过自动标注和动作对齐处理。客户接收数据后,可以直接用于训练,减少素材清洗、精准标注和动作适配等前期工作。
接入京东云 EGO 场景数据后,在原有研发团队配置和研发周期不变的情况下,这家客户公司的模型对未知物体的操作成功率大幅提升,基座预训练成本和周期得到缩短,数据预处理所需的人力投入也明显下降。
对具身智能企业来说,这种变化意味着数据生产可能逐渐成为一种可以外部采购的基础能力。随着数据服务逐渐成熟,企业可以把其中一部分工作交给专业的数据基础设施提供者,把更多研发资源投入到模型架构、训练方法、机器人本体等核心环节。
京东正在沿着这条路径继续扩展。
京东云基于 LeRobot 具身模型开发平台将真实场景数据、数据处理与训练工具、云端算力和具身模型能力整合起来,帮助企业减少自建采集、标注和训练基础设施的投入,更高效地完成模型训练、评测和迭代。
与此同时,京东具身智能数据交易平台已经覆盖家庭、餐饮、商超、零售和通用等场景,与数十家数据企业建立合作,引入数十家数据厂商入驻,累计上线数千条高质量数据集,支持企业根据具体场景、任务和数据量进行采购。
当具身智能真正从少数实验室走向零售、物流、工厂乃至家庭,机器人需要面对的场景会越来越多,数据需求也会从一次性的项目采购,变成长期、持续的基础需求。到那时,行业需要的不只是更聪明的机器人,也需要一套能够持续把真实世界转化为机器学习资源的数据基础设施
京东正在尝试成为这套基础设施的提供者。


参考资料

华尔街见闻:《Jim Fan 解读机器人“终局之战”:人类将在 2040 年彻底解锁“机器人技术树”》

酷玩实验室:《全球大厂不仅抢芯片,也开始抢你叠衣服的视频了》



版权声明】所有内容著作权归属镜相工作室,未经书面许可,不得转载、摘编或以其他形式使用,另有声明除外
 继续阅读:

【声明】内容源于网络
0
0
镜相工作室
商业世界的风向与人
内容 231
粉丝 0
镜相工作室 北京斯咏文化传媒有限公司 商业世界的风向与人
总阅读8.9k
粉丝0
内容231