大数跨境

教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

教机器人干活,光“刷课时”可不够!灵初这次较真数据质量 量子位
2026-09-24
2
导读:专治人机动作对不齐

教机器人干活的“人类示范”,竟然不是人做的?

看这组对照视频:一边是人手操作,一边是机械手操作。乍一看像是人先做一遍,机器人再照着学,但顺序恰好相反——机械手那段是真实记录,人手那段则是AI根据它生成的。

△Psi-W0将人手示范转化为机械手可执行的操作轨迹

为了让机器人向人类学习,为何要从机器人的动作开始?这指向了一个核心问题:人类每天积累的操作经验,究竟该如何高效地传授给机器人?

此前,Figure发布Helix 2.5,利用人类行为数据集Index进行预训练,并在30个未采集过数据的家庭中进行测试,验证了从人类经验中学习的能力在应对新环境时的有效性。

灵初智能在此基础上进一步追问:人类数据进入模型,不等于人的操作经验能被机器人直接使用。这中间缺失的关键环节是什么?

基于十万小时级的数据积累,灵初智能推出了模型Psi-R2.5。该模型进一步优化了数据质量与人机数据对齐方法,并推进具体任务适配。其核心不仅在于让机器人“看”更多操作,更在于如何将这些操作转化为有效的训练素材,以及降低新任务的示教门槛。

教机器人学人,这次先倒着来

人和机器人都能拿起一瓶可乐,但把两段“拿可乐”的视频放在一起,机器人就能直接学会吗?

现实中存在诸多物理差异:人手与机械手的关节结构、接触物体时的摩擦条件截然不同,加之人手姿态估计存在误差。人类能顺利完成的动作,直接转换为机器人的关节运动后往往难以成功。因此,让机器人“看懂”人类在拿可乐,与提供一份“机器人能直接执行”的动作数据,是完全不同的两回事。

灵初智能将人机执行类似任务、主要在语义上对应的数据称为“弱配对数据”。而其追求的是“强配对数据”:除了本体不同,场景基本一致,动作时序逐帧对应,且机器人端的动作能在真机上直接回放成功。

△弱Pair与强Pair的对比

强配对数据的核心在于严格对齐,即“人的这段操作,精准对应机器人这段可执行的动作”。然而,这类数据极难直接采集,让人和机器人各做一遍难以保证场景与动作时序的逐帧对应,直接照搬人类轨迹也会因物理差异而失败。

灵初智能巧妙转换思路:为何必须从人类操作出发,费力生成机器人动作?真实的机器人操作图像和动作本身就是可用数据,以此为起点生成匹配的人类数据,即可获得高质量的对照样本。

基于此思路,灵初逆向使用世界模型Psi-W0,从真实机器人数据出发,生成对应的人手操作数据。随后,利用这些高质量配对数据训练一个端到端转换器。该转换器的输入是人类操作数据,输出则是匹配的机器人图像和动作。

△高质量机器手-人手配对视频
△只需用手机在日常场景中录制一段人手操作视频,即可通过模型转换为对应的机器人数据。

值得注意的是,该转换器并非决定机器人下一步操作的策略模型,而是一个带动作输出的视频编辑模型。它不仅在画面中将人手替换为机械手,更同步生成机器人可直接使用的动作数据。

在验证环节,灵初智能设置了双重标准:一是直接在机器人上回放转换后的轨迹,检验任务完成度;二是将转换数据用于后训练,评估模型表现。评判标准从“视频逼真度”转向“数据能否支持实际操作”。目前,转换后的数据已在上述测试中得到验证,尽管部分极度复杂的任务仍需攻关,但这已大幅缩短了技术路径。

同时,Psi-R2.5对数据质量进行了重构:减少单一任务的重复堆叠,增加任务多样性,并通过自动标注管线将任务拆解为细粒度的原子动作进行标注与审核,确保数据的任务覆盖率与实际可用性。

△Psi-R2.5多任务评测效果

视频也能当机器人的Prompt

如果人类操作能转化为机器人易用的参考数据,那么它不仅能用于训练,还能作为当前任务的提示(Prompt),即让机器人“照着例子做”。

这得益于Psi-R2.5引入的上下文学习(In-Context Learning, ICL)能力。在执行任务时,机器人无需更新模型参数,即可根据当前上下文提供的线索,推断操作步骤与执行方式。

△Psi-R2.5 In-Context Learning展示

这一突破意味着,新示范无需重新训练即可影响机器人行为。难点仍在于人机物理差异,灵初的解法是利用前述“强配对数据”模型,将人类示范转化为机器人数据,再作为提示输入模型。由此,数据转换能力实现了双重价值:既用于准备训练素材,又辅助机器人理解实时示范。

在架构上,Psi-R2.5采用双层设计:上层模型负责将长程指令拆解为子任务,下层模型结合子任务与当前观测输出具体操作轨迹,实现“明确任务”与“落实动作”的分工。

当然,免重训练不等于模型未经预训练,也并非任何随手拍摄的视频都能让机器人胜任所有工作。目前展示的是特定任务中的ICL能力,其为人机交互提供了一种新范式:人类示范不仅是离线训练的数据,更可成为实时部署的交互指令。

99%成功率,不止靠预训练

预训练已消耗十万小时级数据,为何在客户现场仍需继续训练?

真实部署环境中的物品种类、规格及作业节拍具有高度定制化特征。现阶段,基础模型无法做到零适配直接落地,后训练仍是不可或缺的一环。

灵初智能在最新Tech Blog中指出,预训练的核心价值在于大幅减少后训练所需的数据量,从而降低适配与部署成本。

以手机盒装配为例,该任务步骤繁多且精细度要求高。灵初通过结合人工参与与强化学习的后训练框架,经几轮迭代,任务成功率达到约99%,耗时仅需1-2个工作日。

预训练赋予的泛化能力在此发挥关键作用:机器人无需从零学起,只需补充少量任务数据,并通过强化学习攻克易错环节。在实际部署中,系统会持续收集失败数据用于下一轮迭代,以应对复杂多变的作业情况。

示范引导与后训练并不冲突:前者提供新任务的表达与理解方式,后者攻克具体操作难点。两者共同致力于在已有能力基础上,最小化适应新需求的额外投入。Psi-R2.5正将预训练势能转化为实际生产力,通过高效利用人类经验,降低企业使用机器人的时间与资金成本。

Tech blog:https://cypypccpy.github.io/tech-blog.github.io/
https://cypypccpy.github.io/scaling-pair-data.github.io

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16473
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读448.7k
粉丝1
内容16.5k