文丨李佳晅
在网约车和外卖领域,众包早已是成熟基建:算法调度、信用体系、保险保障一应俱全。如今,这套被验证过的模式,正被搬进Ego(第一人称视角)数采这个全新行业,从送人送餐,转向采集真实世界数据。
9月23日,觅蜂科技发布物理AI数据众包服务平台“觅蜂派”。它的关键词很猛:全品类、高质量、全球首个。
简单说,这是一个把“采数据”变成“接单”的平台。采集者戴上一套头戴设备,无论是在厨房开冰箱、在工厂拧螺丝、在农田耕地、在仓库搬箱子,只要手部动作被清晰记录下来,就可能变成机器人训练所需的真实世界数据。
觅蜂派目前覆盖22大类场景、5000多个任务和50000多个真实环境,包括物流、仓储、住宿服务、教育、养老照护、餐饮、零售、公共服务、办公、汽车服务、医疗、建筑施工、交通出行、农业生产、文旅等。任务既有取放、整理、搬运等通用操作,也有装配、检修、照护等专业任务,可用于机器人训练动态环境理解、精细动作控制、连续流程执行、风险判断和安全交互等能力。
截至当前,觅蜂派APP整体注册量已经突破2万。
01
单月佣金最高超5000元
你想不想在做本职工作的同时,顺手采集数据赚外快?
觅蜂科技公布数据显示,在过去一个月的内测中,最高有人拿到了5111元收益。这也是众包模式最直观的吸引力。
想做众包数采,设备从哪里来?答案是租借。觅蜂科技觅蜂派业务总经理张智富在采访中直言:“设备如果假设是免费的,会导致这个设备给你了但你不会用。所以我们今天收设备使用费,目的不是为了收钱,而是让领这个设备有一定门槛。”
他透露,MEgo设备原始价定在39元,发布会推广期30天内降到19元。10月23日之后,还会再公布设备整体标准。基于现在MEgo头戴式设备,未来可能还要加腕部、手套或者手环,定价会略微高一点,但“不会高得很离谱”。同时,平台会结合做单或提交任务的质量和有效率,适当做设备补贴,并联合三方建立众包信用体系,尽量做到信用免押。
但钱不是“戴上就有”。亿邦AI亲测后发现,合格数据存在门槛:头戴设备要规范,手部动作要在头戴设备视野范围内,不能动作太快。“有人头戴设备戴得偏高,所以摄像头照不到手部动作,导致数据采集无效。正确佩戴要让头环贴近眉毛的位置。”现场工作人员告诉亿邦AI。
采完数据多久结算?这是众包人员最关心的问题。
姚卯青表示:“结算我们追求的是一个平衡,它的效率还有准确度。”姚卯青说,不希望采集完数据要过很多天、过一两周才看到结果才能结算,所以觅蜂派会争取在一天之内快速反馈结果、结算相应费用。平台会用自动化方法对采集时长做有效环节提取。在后续处理中,自动化切分之后,以这个为基础结算,之后还会做更细致的数据处理、标注、轨迹提取,最终还有人工抽检。
“总的来说肯定还是不可能完全百分百最终流到模型训练这一层,但是也不会损耗太大。”姚卯青说,前面自动质检准确率和召回率都提升到比较高的水平,过了结算环节之后,超过95%的比例还是能最终被用起来。
他还强调,数据并不是大众所想的“非黑即白”。“大家可能会觉得好数据、坏数据就是一个0和1,坏数据就丢掉了,其实不是。数据质量可以分很多层,根据不同下游模型类型或者不同模型的训练阶段,其实是可以去利用不同质量等级的数据。所以我们会给它贴上一些质量标签,把它们尽可能保留下来。”
从数据采集的行业标准的层面来看,姚卯青认为,现在还不能说完全收敛,但有共性需求:
第一,场景要真实、要丰富,不能在同一个地点、同一个工作反复采,也不能在室内搭建环境里反复采桌面场景。
第二,需要比较高的空间精度。人手或用UMI设备采集,录制到的是2D视频,在2D原始素材里如何提取6D六维高精度空间信息,行业有共识性标准,比如五毫米、三毫米空间精度。
第三,需要对作业过程以自动化方式为主,进行语义动作层面的描述性标签。
在备受关注的采集者隐私方面,觅蜂派会自动化做脱敏,不是让员工手动给人脸一帧一帧打马赛克,而是在数据传输回后台之前,有一个自动化的打码过程,后台员工不会看到这些隐私信息。
在安全保障上,觅蜂派作为面向C端的众包平台,相对开放,很难管理。因此,觅蜂派将给每一个众包人员买一份意外险。“如果在众包采集任务过程中受伤了,保险可以给他提供对应的福利和权益,保障他做数据采集过程中基本安全。但觅蜂派还在不断完善体系的过程中。”张智富说。
02
为什么需要众包?
姚卯青的判断是:数据依赖越来越大,而且规模在快速突进。
“去年上半年,很少有人提几十万小时的数据规模,很多都在1万小时规模。到去年年底有人已经到20万小时,今年很快已经好多人说100万小时。实际我们接触到的用户都是在提千万小时级的需求。”姚卯青说,AI进入下一阶段,必须进入物理世界闭环决策,需要真实世界里的闭环场景数据。头部公司首要考虑的反而不是成本,而是需求响应越快越好、越多越好、越丰富越好。
这也迫使采集设备越来越专业。早期拿手机绑在头上、拿单目运动相机的方式已经被淘汰。现在需要像MEgo这样前面有专业双目摄像头,一方面便于做SLAM提取高精度空间信息做标定,另一方面也可以做深度提取,还要加腕部相机捕捉手部细节。
“而众包这种形式,在外卖、打车已经经过了接近十年的不断迭代,最终的方法论、最后整个配套体系包括产品能力,都是非常可靠的。”姚卯青说。觅蜂科技希望通过众包方式,更加灵活、便利地进入这些场景。“很多行业的发展都证明了全民参与,最后才是质量最高的。包括自媒体,每个人上传自己的生活片段才是最精彩、质量最高的。我们觉得数据的事情也是一样的。”
目前,上架任务的逻辑是“以销定产”:收集整理最新从市场端获取的订单需求,归纳、去重,看看什么样的数据需求现在库存里能满足,不能满足的再根据订单当前和长期价值,以及资源支撑能力,做优先级匹配,再分发到不同路径。
觅蜂派APP截图
“众包非常重要的价值和意义,是走进千行百业做场景渗透。”张智富说,线下全国服务网络有一个重要赋能叫场景资源赋能。场景颗粒度会放在某一个具体动作,内部也分五种类型,有大有小。比如告诉你一个任务,你就在一个房间采,这可能是很广的任务;也可以明确说你去厨房把冰箱打开,这个过程中你做几秒,这是很明确的动作。
但具体需要什么样的动作,由需求方来决定。他举了个“收麦子卖面包”的例子:觅蜂科技做的是收麦子的事情,但最终卖出去的是面包。不同客户需要不同口味的面包,也就是说,模型能力也有限,平台尽量把面包做到符合大众需求。同时要有“货架”概念,有标准SKU,尽量按标准SKU提供。如果客户需要十万量级的数据,也可以做定制化处理,更多费用给到平台,形成以销定产的大逻辑。
但场景越多,壁垒越明显。觅蜂科技副总裁殷哲表示,达到1亿小时之后,除了设备问题和采集人力问题,还有更大的场景问题。
“比如我是一个食品厂,你要来采数据,你的设备是否安全,这是第一点;第二,一个众包员带设备进入工厂,老板是否允许你采集;第三,如果有些用户需要海南采椰子(的数据),我们设备怎样去到海南,是否有人能承接这样的设备。”殷哲说,壁垒不打通,不仅采集成本高,而且很难短时间内满足客户需求。他拿页岩油打比方:这个场景有价值,但很多时候为什么不开采?因为页岩油开采成本比采出来的油还贵。
也正因如此,觅蜂科技搭建起场景联盟,联合场景方、采集网络、机器人及模型企业,推动场景需求、数据采集、模型训练和落地验证形成闭环。联盟首批成员覆盖零售商超、酒店文旅、餐饮服务、养护院、智慧生活、医疗健康、地产制造、城市物业等领域,包括东呈酒店、中旅集团、华驿酒店、陈香贵、浦商生鲜超市、普善养护院、上海德济医院、正荣集团、龙旗科技、海天瑞声、张江集团等50余家企业和机构。
按照觅蜂科技的设想,建立联盟,先把场景备好,等客户需求一来,就能随时接住。对成员来说,加入联盟后,可以优先看到数据和场景应用落地的可能性,未来也能优先部署,抢做行业领头羊;等设备成熟,还能卖给同行,长成公司发展的第二曲线。
03
众包数采,可持续吗?
Ego数据需求量到底有多大?能支持众包生意走多久?
姚卯青说,现在做具身、原生预训练,很少有人再用低质量、效率低、没什么帮助的互联网数据。众包市场缺口非常大,很多客户需求已经1000万小时级。
不仅仅是数量级,更是对于场景的细分和专业度的要求。姚卯青表示,相比原来粗放式的“有什么用什么”,现在客户对数据质量的要求已经进入新阶段,必须通过众包方式更快触达五花八门、千奇百怪的行业和场景。
“目前在训练大模型过程中,无本体数据量从绝对小时数来讲是大头。”姚卯青说,因为世界模型在预训练阶段就是训表征,预测下一个frame、下一个chunk。真机比例会在IDM组件、后训练阶段提升某些场景效果时用得相对较多。数采工厂主要是真机类数据,以真机遥操作采集为主。
Ego数据是不是不如真机数据?姚卯青说,要看目标。做任务Demo,真机数据最立竿见影,用这款Demo机器在任务里采数据直接训,定向fit这个场景,效果最明显。Ego数据不是为了某个任务Demo定向优化,而是在大模型、世界模型早期预训练阶段,提升基础模型泛化能力,也就是Zero shot零样本通用能力。它的特点是少量时候发现不了多大帮助,要到比较大规模之后,才能逐步发现涌现能力。
“做单一场景的小模型,不是最适合用Ego数据训练的。反而像大模型公司、世界模型公司做预训练,在加入不同数量级真机数据、Ego数据之后,模型对于新任务、新环境的Zero shot能力有明显提升。”姚卯青说。
谁在买Ego数据?姚卯青归纳成三类:
第一,具身公司,有本体也有算法,希望做自己的基座模型;
第二,世界模型公司,今年很多创业世界模型,自己不做本体,短期也没有实际应用,但一直在做具身相关世界模型,会用比较多的无本体数据做预训练;
第三,大模型厂商,互联网数据已经消耗完,要进一步提升模型智能能力,必须进入真实世界闭环、决策。
目前,众包数采平台已经是一门不亏本的买卖。一方面,众包平台优化了采集侧人力成本,不是专门雇人采集,而是正常日常生活或工作过程中顺便采,是额外赚补贴的概念,比专职雇人有优势。另一方面,后处理通过自建数据中心资源、自研标注切分空间信息提取模型,快速飞轮迭代,数据量越大模型效果越好,人工占比更低,自动化程度更高。
“相比市面上产品数据最终售价,即使单次出售,也已经有一个比较好的毛利率。”姚卯青说。

