9月上旬,“活力中国调研行”报道把京东宿迁具身智能数据采集中心重新带回公众视野。全职宝妈郭女士,头戴220克的采集终端,在自家客厅擦桌子、叠衣物、清扫地面,每月稳定增收近4000元。她的日常动作被记录、质检、标注,成为家用服务机器人的训练数据。
京东的计划比这个画面庞大得多:发动内部超10万名员工、外部最多50万名各行业人员,两年内积累1000万小时人类真实场景视频数据,同步采集100万小时机器人本体数据。
具身智能真正的瓶颈是数据
过去两年,具身智能的技术叙事几乎全部押在模型上:VLA、World Action Model、强化学习,参数越堆越大,演示视频越来越流畅。但一个更基础的问题被忽略——机器人的“大脑”再强,也需要见过真实世界的数据来训练。
行业的数据缺口有多大?一组数字能说明,据极目新闻援引的数据,当前具身智能行业数据缺口超过95%,行业每月的数据需求远大于产出,供给不足需求的四分之一。京东技术负责人龚义成在央广网的采访中总结了三大痛点:数据质量不一、数据多样性不足、数据孤岛。
数据采集本身是重资产。训练数据高度绑定采集时的硬件与流程,更换机型、调整产线,已有数据便大面积失效,工况每变一次就要重新投入采集成本。行业里几百款机器人整机产品,绝大多数停留在展品阶段——它们在视频里能完成一次漂亮抓取,在真实产线上却撑不过一个班次。
把数据采集做成基础设施
京东在宿迁的布局早已展开。宿迁数据采集中心2025年10月投入使用,被江苏省工信厅认定为省级具身智能机器人数据采集中心;今年3月,京东宣布建设全球最大具身数据采集中心;5月20日,全国首个具身智能数据采集社区在宿迁湖滨新区正式运行。该中心总投资超亿元、占地5000平方米,设有零售商超、物流仓储、医药康养、家庭家政四大采集板块。
为什么是京东
这场全民数据采集,只有京东这样的公司做得起来。
在京东具身智能数据采集中心,工作人员教机器人当收银员拣货
图源:极目新闻
其次是组织模式。“政府搭台、企业运营、群众参与——宿迁软件园负责对接社区、组织居民,京东负责设备、培训与标准流程,居民以劳动换取报酬。众包模式把采集成本摊薄,把规模撑大,这是自建数据工厂做不到的效率。
前置仓:数据生意的第一块试验田
数据采集的最终目的是让机器人落地干活,星海图与京东的合作给出了第一个接近商用的样本。
展会现场前置仓演示系统完成了100多单“真实履约”
图源:今日头条
星海图CEO高继扬对商业化的判断更直接:机器人行业的变现逻辑正在从卖整机转向卖“物理世界 Token”。前置仓验证的正是这条链路——数据采集喂养模型,模型驱动机器人干活,机器人干活产生新的场景数据,再回流训练。
60万人的宏大叙事之下,有几个问题尚未有公开答案。
规模不等于多样性。“1000万小时”是采集口径,其中有多少有效样本、长尾工业场景的覆盖比例,京东没有披露。众包数据大量集中在家庭、办公等生活场景,同质化风险客观存在——小时的堆叠不直接等于数据价值的堆叠。
质量管控的成本是隐性的。数据需要上传、质检、标注才能进入训练流程,众包采集员的水平参差,筛选和治理的人力与算力投入是巨大开销。训练效率提升3.5倍的基准是“较开源版本”,这个口径本身也需要更多验证。
产线见真章
END
近期活动
往期精彩

