大数跨境

独家解读 | 具身数采的最后一公里,求之拿出了拇指相机

独家解读 | 具身数采的最后一公里,求之拿出了拇指相机 鲸犀
2026-09-30
7
导读:十万用户戴上它,攒下的具身数据将超过所有第三方数采公司之和。
图片
十万用户戴上它,攒下的具身数据将超过所有第三方数采公司之和。

作者丨张含菁

编辑丨董子博


01
一台37克的相机,
凭什么成为具身数据的关键一步?

37克,磁吸在胸前,第一视角拍摄。云栖大会上,求之科技发布的这台名叫DEGO S1的小相机,怎么看都是个拍Vlog的“小玩意”。
不少人都在问:“一家机器人公司,怎么跑去做了一个拇指相机?”
但在求之科技数据负责人陈博远眼里,DEGO S1不只是一部相机。这位年轻的清华博士、特奖得主,负责着这家公司从数据采集到清洗标注的整条链路。DEGO S1是求之在具身数据采集上,迈出的关键一步。
在无锡,求之盖了数千平米的数据采集场;但样板间再多,求之也清楚无法在场内收集全千家万户的真实数据。通过DEGO S1,用户可以根据自己的兴趣和生活场景,自由选择有趣的数采任务。
DEGO S1究竟能起到多大作用?陈博远估了个数:十万个用户戴上DEGO S1,场外攒下的数据规模,就能超过所有第三方数采公司的总和。
02
“改变算法的增益并不显著”:
数据决定机器人的能力

求之科技2023年诞生于清华大学智能产业研究院(AIR),创立发起人兼首席科学家周谷越是港科大博士,曾在大疆主导过掌上无人机Spark的研发与量产。最近两个月,求之科技陆续完成天使轮、天使+轮融资,两轮融资合计超2亿美元。
为了让机器人走进千家万户,求之面临着行业共性的难题:机器人的大小脑需要喂数据,真实家庭场景的训练数据十分稀缺。
求之科技是少数将大脑模型、本体和数采全部自己攥在手里的公司。具身数采一度被视为“劳动密集、流程琐碎、回报周期长”的脏活,但陈博远认为,数据是具身最重要的环节之一:“比较反常识的是,目前实验下来改变算法的增益并不显著,反而是数据的数量和质量决定了机器人的能力。” 数据采集方案决定了机器人泛化的上限,也因此,在求之,数据是最重要的工作单元之一。
03
  两条腿走路:样板间打底,
真实家庭补全多样性

陈博远对雷峰网·鲸犀表示,家庭场景的数据采集,比工厂场景复杂太多了。“通用数采公司的家居数据占比,只有30%~40%,剩下的都是工厂、服务业这些场景。因为工厂好组织、好管理,家庭场景涉及千家万户,组织难度大、成本高,愿意做的公司很少。”
求之科技是行业内极少数100%聚焦家庭数采的公司。求之科技决定使用两条腿走路,场内场外采集并重。
在场内,求之建了数千平米的数采厂,里面做成类宜家的样板间,卧室、厨房、餐厅、洗衣区,跟真实家庭几乎一模一样,未来还计划扩展到数万平米。最大程度地还原场景,让机器人更好更快地适应真实家庭环境。
场外的数据用在预训练,陈博远解释,预训练数据多样性越丰富越好,比如不同家庭里的灯光、物品布局、人的习惯,越是复杂多元的环境,对模型的泛化能力越有帮助。所以第一视角数据(Ego)更适合由真实的家庭用户提供,比自己搭建场景更有效率,这也是求之选择开发DEGO S1的原因。
04
DEGO S1:先成为好用的产品,
再成为数采入口

DEGO S1的形态很像市面上的运动拇指相机,适合别在胸口上,拍摄第一视角的Vlog。
和很多全时佩戴式的相机类似,DEGO S1能够为用户提供生活记录查询、生活管家、状态总结等等效率服务。在成为一款数采入口前,DEGO S1必须先成为一款好用、易用的产品,用产品价值吸引用户。
DEGO S1的用户价值,与它的数据价值相辅相成。只有当DEGO S1能实实在在为用户提供记录美好生活的产品价值,用户才会长期留存,愿意顺便用DEGO S1采集数据,体验趣味数采任务。
在求之的设想中,DEGO S1 的目标核心用户并不是Vlog博主,而是宝妈、退休人员、大学生等有零碎时间、愿意利用业余时间打打“零工”的群体。
场外数采的质量相对不可控,镜头要录清楚人的双手在做什么事情,还需要采集合适的任务并减少重复。求之会通过明确任务类型、数采动作及操作指南来管理,帮助大量的个人用户做好高频的家务数据采集;同时,对于大量未明确定义的长尾任务,平台支持AI识别视频里的场景做聚类分析,如果出现了模型没见过的新场景(铲猫砂、浇花、磨咖啡豆等),还会鼓励数采员自发去寻找稀缺场景。
DEGO S1能够进行数小时的续航,相比使用手机采集,凭借其可穿戴的形态,能够释放双手,轻松记录;而相比AI眼镜,DEGO S1的成本则要更低、落地更快。
05
数据infra:任务定义没想清楚,
后面全是浪费

数据采集只是第一步。想要数据真正为机器人所用,还要看清洗、标注、格式统一和训练衔接这一整套数据infra的效率。
陈博远把数据infra拆成了八个环节:任务定义、采集、上云、数据格式统一、清洗、标注、训练衔接、真机评测。他强调,场内采集最关键的是采集前的“任务定义”,如果没想清楚采什么任务、怎么拆、拆成多细,后面全是浪费。
“场内数采任务有超百种任务指令, 场外用户可以通过DEGO S1的APP获取任务指引,做稀缺的任务积分会更高。”
采集回来的数据要进一步上云清洗和标注。清洗出有效可用的数据,数据越高质,后期模型训练效果越好;标注则为数据打标签,即增添更多有效信息,如语义、物体类型定义。
标注环节,目前求之正与阿里千问合作。陈博远提到,千问现在的识别率很高,场景和物体它基本能认对,切分的颗粒度通过调prompt也能很快对齐。
在上云之后的整个过程,数据的格式都要保持统一,一直衔接到AI训练的地方。比如统一画面的帧率;或是动作统一成“相对位姿变化量”等等。陈博远强调,只有数据格式统一,不同来源的数据才能混在同一个batch里喂给模型,场内场外的数据也才可能在同一个训练管线里复用。
06
训练不是终点,
真机评测才是数据闭环的最后一环

Infra链路的最末端是真机评测,求之自研评测系统,评估模型训练的成果。陈博远提到,由于现在模型侧还没有收敛的迹象,所以模型的真机评测也缺乏一个能让所有人都信服的benchmark。
求之在无锡搭建了自己的真机评测系统,让数据采集、模型训练和真机验证形成闭环。陈博远举了一个“叠衣服”的例子,“评测的一致性很重要:换一台机器、换个时间地点,成功率会不会变化?换一位操作员,叠好衣服的标准会不会改变?我们希望排除这些因素,客观评价模型。每次评测都会打上“过程分”与“结果分”,再定向反馈回数据采集和训练环节。”
07
对话陈博远|“数据是核心资产,必须把握在自己手里”

鲸犀:现在行业里有个观点,“机器人没有百万小时数据不要谈理解世界”,你怎么看?

陈博远:很多具身公司追求AGI,觉得达到AGI自然就能进家了,但求之会更进一步。我们认为家庭里面的实际操作没有大家想象的那么多、那么难,求之的数采就是对家里的任务进行拆解后定向搭建的。

鲸犀:现在求之让机器人学会一项能力,至少要采多少条数据?

陈博远:拿叠衣服来举例吧,我们在场内采1万条UMI ,短袖就能叠得很好了;想要所有类型的衣服都能叠好,至少需要采10万条数据。我们场内的数据利用率能达到70%~80%。

鲸犀:场内和场外的数据,要求差在哪?

陈博远:差别很大。首先,场内的数据用在后训练,后训练必须要有action label,得教会机器人怎么去动,但预训练不一定需要,像 World Action Model 能从像素里推出物理规律,不需要你额外标注“这只手在施加什么动作”。其次就是精度的差别,预训练允许有一些误差,比如action label就不需要标出手部骨骼,手距离相机的相对位置偏移一两厘米,有时候偏移三五厘米也能用;但后训练就需要手位置的准确率。所以预训练数据适合交给真实家庭用户,后训练数据适合我们自己建厂采。

鲸犀:你在清华的研究方向涉及本体、世界模型,为什么会选择来做数据infra ?

陈博远:数据采集是个很笨重的事情,很多人高高在上不愿意干,更愿意去研究算法和模型。但是做具身这行就是要“Get your hands dirty”,去把琐碎的工作做好。大厂模型团队的领先离不开他们数据处理和管线做得好,现在数据已经成为了具身的最大瓶颈之一,不能因为“dirty”就选择逃避,我自己也还在不断学习。

鲸犀:求之是非常坚定数据相关的业务全部自己做吗?

陈博远:数据是核心资产,必须把握在自己手里。不过我觉得,未来可能会出现像早期阿里巴巴供应链一样的,B2B数据交易平台,各种规格的数据都明码标价。全行业共同目标是让机器人走进千家万户,求之也愿意在数据互通上做出贡献。图片
//

近期热门文章

独家解读|不做垂直眼镜、不造大模型,Rokid 到底在赌什么?


独家解读|IPO 前最后一轮,Zdeer拿什么讲电动牙刷的故事?


独家 | 贝塔无限发布消费具身「多米」:目标 B to C,机器人要成为用户的「生活队友」

【声明】内容源于网络
0
0
鲸犀
各类跨境出海行业相关资讯
内容 3042
粉丝 0
鲸犀 各类跨境出海行业相关资讯
总阅读67.3k
粉丝0
内容3.0k