大数跨境

所有具身智能公司,都在争夺同一个数据闭环

所有具身智能公司,都在争夺同一个数据闭环 九顶创业生态圈
2026-07-08
10
导读:未来 12 到 18 个月,谁能率先在半开放场景跑通第一个真实数据闭环,谁就掌握了下一阶段的竞争主动权 ——

未来 12 到 18 个月,谁能率先在半开放场景跑通第一个真实数据闭环,谁就掌握了下一阶段的竞争主动权 —— 这将直接影响资本与客户对行业玩家的重新估值和押注。

上海创智学院副教授、智元首席科学家罗剑岚直言:“未来 12~18 个月,行业的一个关键节点就是真实部署带来的数据闭环。不管部署规模多大,只要数据是真实的;谁能真正在半开放场景里把第一个闭环跑通,这将是决定性因素。”

今年以来,海内外头部具身智能企业都在全力冲刺,在家庭、工厂、商业三大场景争抢落地部署机会。为了抢节奏,多数公司选择走软硬件一体化路线:从机器人本体、智能大脑,到数据采集设备、灵巧手与核心关节,全部攥在自己手里,避免因依赖第三方拖慢进度,核心目标就是把数据闭环牢牢掌握在自己手中。

为什么全行业都在抢数据闭环?


赛道玩家的动作密度已经说明了一切。智元机器人完成了业务赛道的重新布局:主线侧重工业场景,实控的上纬新材以 “上纬启元” 品牌切入消费市场,同时布局灵巧手公司临界点。6 月底,智元开启工厂产线作业直播,落地龙旗科技南昌工厂;“启元 Q1” 个人机器人正式发布,主打便携可折叠,并将在深圳、上海开设线下体验店。

千寻智能的推进节奏同样迅猛。创始人兼 CEO 韩峰涛透露,公司已组建上千人的数据采集团队,年底将扩充至四千人,目标今年采集百万小时数据,明年冲击千万小时量级,战略上按 6:3:1 的比例推进家庭、商用、工业场景齐头并进,目前已拿下博世、宝马等标杆合作客户。

银河通用则从去年起落地无人零售、无人药店点位超百个,工业重载机器人进入极氪、宁德时代、奔驰等工厂,还联合智源研究院在酒店落地清洁机器人。值得注意的是,宁德时代同时是多家机器人企业的采购方,产业布局野心显著。

这股风潮并非国内独有。美国具身智能领头羊 PI(Physical Intelligence)也开始在全球包括中国大量建厂采集交互数据。业内分析,PI 受限于美国本土制造业场景不足,不得不通过海外建厂弥补数据采集短板。

全行业疯狂抢数据的底层逻辑,是对标特斯拉的 “数据飞轮” 效应


过去十年,特斯拉通过大规模部署车队构建了完整的数据飞轮:车辆行驶产生真实数据,数据回流训练模型,优化后的模型再下发车队解决更长尾的问题,循环往复形成正向闭环。这给具身智能行业的启示非常明确:真实数据是模型能力的核心来源,而真实数据只能通过真实部署获得。

当前具身智能领域的真实数据储备还极度匮乏,有业内人士形容 “连一颗黄豆的体量都没到”。而数据飞轮一旦转起来,就是极深的护城河 —— 追赶者需要投入同等的时间、资源和场景积累才能追上,但先行者已经持续向前迭代。

罗剑岚坦言,全球资本都在观望具身智能领域的爆发信号,一旦有企业真正跑通闭环,大量资金就会快速涌入。对创业公司而言,速度就是最大的优势,正如 OpenAI 在谷歌的护城河内撕开缺口,Anthropic 靠规模化成长到谷歌、Meta 都无法轻易撼动的体量。

从技术路径看,今年下半年到明年上半年将是世界模型的训练高峰期,模型泛化能力是核心竞争点 —— 没有规模化的真实数据,就没有模型泛化;没有泛化能力,就谈不上规模化商业部署。

银河通用 CTO 王鹤解释,所谓基础模型的泛化能力,就是把人类无需专门学习的通用技能做到 70%-80% 的成功率,再搭配极低的部署门槛,让普通操作人员就能一键完成模型落地。

千寻智能将行业发展分为两个阶段:第一阶段打磨基础模型泛化性,把后训练成本降到分钟级,大幅压低边际部署成本,让场景落地的后训练数据需求降低 60%;在此基础上进入第二阶段,数千万乃至上亿台机器人进入真实世界作业,数据持续回流,实现零样本解决更多问题。

有具身智能独角兽 CTO 直言,做具身智能的优先级非常清晰:先做数据,再做基础设施,最后探索模型结构。规模尚小时,基础设施的价值无法体现,投入数据采集的收益最大;等到部署量上来,再完善基础设施;两者都夯实了,再去优化模型结构才是事半功倍。

具身智能的 “大脑”,到底需要什么数据?


大语言模型靠 30 万亿 token 训练出了 GPT,具身智能则需要一整套覆盖不同场景、不同能力维度的数据体系 —— 这也是各家企业同时布局工业、家庭、商业多场景的原因,不同场景的数据对模型的训练价值、训练方式完全不同。

  • 工厂场景
    追求极致节拍与高精度,对模型的工艺适配能力要求极高。产线容错率低,一次失误就可能影响整条产线效率,因此需要针对具体场景做强化学习与后训练,保障作业成功率与生产节拍。
  • 家庭场景
    不追求作业速度,核心价值是训练模型的泛化能力与多场景适应性。每个家庭的环境都不相同,对成功率的容忍度相对更高,甚至无需大量后训练即可部署,是快速积累开放环境数据的最佳场景。
  • 无人零售、药店、酒店清洁等限定商业场景
    是当前最务实的落地路径。无需全场景泛化,即可通过数据闭环实现落地商用,一边产生收入一边积累数据,是多数企业的选择。


行业普遍有 “一旦家庭场景的活儿能干好,其他场景都能适配” 的判断,但也有观点认为,工厂要求的高成功率与家庭要求的强泛化性是两种不同的能力,当前模型层面尚无法统一,只能双线并行迭代。

落地难度上,工厂场景的门槛最高。无锡数据集团总经理陈青表示,工厂数据采集需要直接对接企业一把手,企业核心顾虑是工艺泄密,而非采集补贴。目前无锡数据集团已与 12 家工业伙伴签订长期采集协议,目标锁定 30-50 家以上市公司为主的企业,通过长期合伙人机制,从数据采集试点逐步走向产线智能装备升级。

家庭场景的独特价值,在于能让真机在开放环境中探索真实的交互数据。人类能模拟的训练环境可能不到真实世界的 1%,机器人会在什么地方犯错,只有它自己进入环境后才知道。让机器人自主探索、试错,再由人工兜底纠正,这类探索式数据的价值凌驾于其他数据之上。

数据光谱:从高精到泛化的不同价值


业内常用 “数据金字塔” 形容不同数据类型的定位,也有人将其比作 “光谱仪”—— 不同类型的数据对应不同的能力价值,全场景落地几乎需要覆盖全光谱数据。

当前行业的数据采集重心,正从传统的遥操作、仿真,转向 EGO+UMI 的 “内容数据”,用更低成本驱动更强的模型泛化与落地能力。

其中,EGO 第一视角数据今年热度极高,京东、蚂蚁、美团等企业正通过众包模式快速扩张规模,有业内人士判断未来单日采集量即可达到 100 万小时。而千寻智能副总裁丛源良认为,UMI 数据将成为未来主流 —— 它通过轻量化设备采集人类真实操作,与机器人本体解耦,同一套数据可被不同机器人复用,相比 EGO 精度更高,相比遥操作成本低得多。

触觉数据也是全行业公认的必攻方向。上海交通大学长聘教轨助理教授穆尧表示,像穿针引线这类精细操作,触觉反馈的作用至关重要。但触觉数据集的构建难度极大,穆尧团队多次尝试后转向仿真引擎,通过仿真实现了螺纹配合、齿条啮合、柔性衣物处理等复杂任务的力与触觉数据规模化生成。

数据采集模式也在发生变革。北京智源人工智能研究院理事长黄铁军认为,世界模型与具身智能时代,实时交互数据占比会越来越高,传统建数采中心、专人操控机器人的模式成本并不合理。

更可行的方向是让数据采集融入真实生产生活:比如让工厂工人佩戴采集设备边工作边采集,只需小幅增加薪资;未来智能眼镜等穿戴设备普及后,人们工作与生活的第一视角可以自然完成数字化,和自动驾驶的数据采集逻辑一致 —— 车辆在路上跑,数据就同步完成采集。甚至像乒乓球陪练机器人这类产品,在提供服务的同时就能零成本甚至盈利式地完成数据积累。

为什么非要把闭环攥在自己手里?


行业一个显著的变化是:去年还有不少企业走产业链分工路线,有人做大脑、有人做本体;今年越来越多公司转向软硬一体化,从本体、模型、数采设备到灵巧手、核心关节全部自研。

银河通用 CTO 王鹤的观点很有代表性:所有的技术秘籍,最终都会变成公共知识。行业终局一定是巨头的赛场,创业公司唯一的竞争优势就是速度。要快就必须做全链路闭环,硬件环节如果依赖第三方,就会被拖慢节奏,因此必须把核心环节控制在自己的环路里。

数据采集设备就是各家自研的重点。千寻智能从 2024 年开始研发数采设备,至今已迭代七个版本,去年 12 月正式落地,预计今年下半年成本还能实现 10 倍下降。穆尧也表示,数采设备与方案必须自己掌握,否则很多创新想法会因为硬件不匹配而无法落地 —— 从相机布置、传感器配置到人机协同方式,每一个细节都会影响数据质量

它石智航联合创始人、首席科学家丁文超将整个系统比作梯度传递的链路:具身行业尚处早期,模型与应用的需求还没有充分传导到上游硬件,市面上的通用硬件完全满足不了规模化应用的要求。因此必须自研软硬件,将末端传感器配置、硬件形态、数据采集方式、部署推理效率放在同一个系统里联合优化,这些细节才是 VLA、世界模型这些概念背后真正的技术壁垒。

数据管线,是当前具身公司比拼的另一个核心焦点。

市面上 EGO、UMI 数据供应商的质量参差不齐,优质供给极少,企业不得不自建完整的数据质检与规范体系,搭建专属数据管线。如果数据质检、过滤、标注全靠人工,成本会高到无法承受,必须靠模型闭环提升效率、降低成本。数据管线的核心目标,是把人类的单点经验沉淀进系统,让数据迭代逐步走向自主化,其中最关键的是实时性 —— 在采集过程中同步完成质检,而非事后补救。

对比海内外,海外企业在闭环上反而遇到了瓶颈。业内人士分析,海外企业普遍软硬分离,模型训练与数据采集分处不同地区,沟通成本高,数采设备也难以快速迭代,无法形成高效的数据反馈。相比之下,软硬一体化是国内具身企业的核心优势当前各家模型层面的差距并不大,真正拉开差距的是数据积累速度,而国内企业在真机数据积累上明显更快。

行业终局的时间线


对于具身智能的发展节奏,行业已经形成了初步共识:

  • 未来 3-5 年,随着真实世界数据持续积累,行业有望诞生真正的具身 “原生模型”,而非简单拼接语言、视觉、动作能力的组合模型。
  • 银河通用预计,2028 年前后模型通用能力突破关键节点后,行业将迎来第一轮出货高峰,且率先爆发在 B 端市场。
  • 千寻智能判断,大模型从爆发到收获 5 亿用户用了数年,而具身智能企业集中成立于 2023-2024 年,真正进入规模化阶段大概率要等到 2033 年前后

从轮式机器人到全人形机器人,从简单夹爪到仿生灵巧手,具身智能还有漫长的技术爬坡要走。但全行业的方向已经无比清晰 —— 谁先跑通真实场景的数据闭环,谁就能率先驶入增长的快车道。

图片免责声明来源公众号数智前线,有!递更多信息和学习之目的,如觉侵权,可回复本平台我们会尽快处理删除。另外朋友们推荐或者投稿文章给本微信公众号。
图片

关注抖音【靓哥聊创业】

抖音号|54707203975

保存二维码打开抖音扫一扫


【声明】内容源于网络
0
0
九顶创业生态圈
秉持“正道利他”价值观,提供企业咨询服务。
内容 958
粉丝 0
九顶创业生态圈 秉持“正道利他”价值观,提供企业咨询服务。
总阅读5.1k
粉丝0
内容958