大数跨境

AI时代最容易被忽视的苦力活:给机器人“擦屁股”的人

AI时代最容易被忽视的苦力活:给机器人“擦屁股”的人 亿欧网
2026-09-17
4
导读:下一个Scale AI,会出在具身智能的数据清洗吗?

下一个 Scale AI,会出在具身智能的数据清洗吗?


作者丨刘政鑫
编辑丨刘欢

具身智能赛道今年融资规模达上百亿,但鲜有人提及一个关键数据:训练一个能抓取杯子的机器人策略,背后往往需要专人耗费六个月进行数据清洗。

核心瓶颈不在采集,而在清洗。

摄像头拍摄的原始素材中,仅约三成可用于训练。其余七成包含机械臂无效抖动、传感器噪声及因果链断裂的废轨迹。湖北人形机器人创新中心数据显示:训练师每日真机操作 8 小时,最终有效数据仅两至三小时。

这意味着,前沿机器人公司的核心产能正卡在“品控”环节。该环节成本高昂:真机遥操采集有效数据每小时成本 500 至 2000 元,即便采用低成本头戴视频采集,清洗关仍无法跳过。

这一场景鲜少出现在融资新闻中,却直接决定了估值数十亿的机器人公司能否让机器真正具备作业能力。

大模型吃饱了,机器人还在挨饿

理解“擦数据”的重要性,需对比 AI 数据工程的两条轨迹。

大模型时代的数据标注已高度成熟。Scale AI 等平台按件计费,简单图像分类标注底价低至 0.012 美元/张。众包模式下,行业正被“模型预标注 + 人工审核”快速重塑,效率极高。

然而,具身智能的数据清洗处于完全不同的维度。其处理对象并非静态文本或图片,而是机器人在物理世界产生的多模态时序流——涵盖 RGB-D 视频、激光雷达点云、关节角度、力反馈及 IMU 数据。这些数据伴随时间戳不对齐、传感器漂移及物理噪音等复杂问题。

据媒体披露,Micro1 每月从全球工人手中收集 16 万小时头戴视频,但真机遥操工位硬件成本高企,单站达 5 万至 15 万美元,折算采集成本每小时 118 至 200 美元,且单人日产出不足 200 条演示数据。

具身数据具有动态连续性。与大模型单帧标注不同,具身数据是一个完整的任务回合(Episode),包含从尝试、失败、调整到成功的全过程。清洗时需理解整条轨迹的因果链,甄别偶然成功与逻辑正确的差异。例如,π0.7 模型在空气炸锅任务上的成功率飞跃,关键在于优化自然语言指令而非单纯堆砌数据量,凸显了数据中“因果清洗”的高价值。

清洗一条长达数分钟的抓取任务数据可能耗时数十分钟,而策略收敛需几十万条样本。这导致具身智能数据清洗至今仍停留在“手工作坊”阶段,规模化难度极大。

人在闭环里:为什么具身数据清洗没法外包

大模型标注可实现众包,前提是评价标准清晰且容错率高。具身数据清洗则不具备这些条件。

领域知识门槛高

清洗具身数据需深刻理解物理交互。普通标注员难以判断“抓取姿态合理性”、“关节限位”或“力控参数异常”。正如湖北人形机器人创新中心所述,训练师需将“送水”拆解为数十个动作,并逐帧标注为机器人可理解的语言。

错误成本不可逆

具身数据清洗结果直接决定下游策略成败。若将“碰巧成功但因果断裂”的轨迹误判为正样本,模型将习得错误关联(如误认为“抖动”是成功关键),导致真机部署失败。Sanctuary AI 在汽车线束插接任务中实现 99.5% 成功率,正是得益于对失败轨迹的严格剔除。

目前,绝大多数实验室和公司的数据清洗工作由内部工程师和研究生完成,形成了“采集 - 清洗 - 训练 - 验证 - 分析”的封闭闭环。某创业公司 CTO 透露,五人团队每周仅能产出约两千条有效样本,攒够中等规模策略数据需大半年,算法迭代反而退居次要地位。

此外,“数据演示工人”的法律定位尚属空白。涉及劳动关系认定、加班费支付及生物识别信息合规等问题,全行业暂无定论。DoorDash 在推广家务视频拍摄时,主动规避了加州等零工法规严苛地区;京东虽发动市民拍摄物流场景,但核心清洗环节仍保留在自有团队,未下沉至众包。

空白比机会更刺眼

大模型标注的自动化路径预示了具身数据清洗的未来,但落地难度呈数量级差异。

当前已有部分探索:火山引擎利用豆包 VLM 实现具身视频原子动作切分与语义打标,准确率超 90%;如祺出行采用三段式 AI 预处理视频;京东 JoyEgoCam 通过 AI 数据湖自动去畸变与深度重建;觅蜂科技 MEgo Engine 构建自动闭环,效率宣称提升 10 倍。

然而,具身数据清洗的自动化需模型理解物理世界的因果关系。VLM 虽能判断动作是否成功,却难区分“做对”与“碰巧对”,后者是极具误导性的噪声。此外,传感器层面的时间戳偏移、零点漂移及丢帧等问题,属于信号处理范畴,非纯 AI 模型所能解决。

尽管 Seedance 等视频生成模型可补充长尾场景数据,但生成内容仍需经过严格的物理一致性校验。现状是:自动化工具在粗筛、对齐等环节有所突破,但端到端的自动清洗管线尚未成型。这一空白既是痛点,也是巨大的市场机会。

最缺的,并不是发论文的人

具身智能行业存在微妙的人才错配:招聘页面充斥着算法岗,创始人却普遍抱怨缺乏能搭建数据管线的人才。

工信部《人形机器人与具身智能标准体系(2026 版)》虽将数据全生命周期纳入标准,但市场上既懂机器人学、信号处理,又精通分布式数据工程的“数据基础设施工程师”极度稀缺。此类人才需掌握多学科技能组合,薪资已触及算法岗上限,但供给量相差两个数量级。

趋势显示,越来越多企业将“数据基础设施”独立建制,与算法团队平级。火山引擎数据显示,国内头部具身企业中 15 家采用其数据栈;鹿明机器人推出数据超市;湖北人形机器人创新中心已完成千小时级数据交易;光轮智能凭借仿真合成数据营收激增。这些企业售卖的并非算法,而是数据供应链。

具身赛道正在复刻 Scale AI 的发展路径:当模型架构趋于同质化,拥有高质量数据飞轮的企业将掌握更高议价权。

谁先跑通,谁就是下一个 Scale AI?

回顾历史,2016 年前后数据标注同样处于手工作坊阶段。Scale AI 通过流程标准化、工具化及规模化,将人工压缩至质检位,最终成为 OpenAI、Meta 等巨头的核心供应商,2025 年营收预估达 8 亿至 20 亿美元。

具身智能数据清洗正站在类似起点:工具空白、流程非标、人才稀缺、法规定义模糊。这些特征恰恰是平台型公司的生长土壤。且具身数据单价远高于传统标注,市场天花板更高。

此次壁垒在于将物理世界的复杂性编码进自动化系统:融合 VLM 的语义理解、视频生成的画面构建以及信号处理的传感器对齐。谁能打通这三者,谁就不仅是一家数据标注公司,而是定义了具身智能时代的基础设施。

那些今日花费数月为机器人做“品控”的人,或许正在构建比想象中更重要的基石。耗材化不是终点,被耗材化才是危机。


END

【声明】内容源于网络
0
0
亿欧网
各类跨境出海行业相关资讯
内容 29752
粉丝 0
亿欧网 各类跨境出海行业相关资讯
总阅读221.1k
粉丝0
内容29.8k