大数跨境

机器人的“学霸”人设,塌了!

机器人的“学霸”人设,塌了! 亿欧网
2026-07-31
4
导读:背题靠数据,理解靠架构?

作者丨路永丽

2026 年被定义为“具身智能商业化落地元年”,工信部预测全年人形机器人产量有望突破 10 万台。在刚结束的 WAIC 现场,思灵机器人 H20 流畅分类玩具、极智嘉机械臂精准拣选货品,大规模商用似乎触手可及。

然而,一旦引入训练集之外的陌生物品,机器人便会出现停顿、误判甚至无法识别。这种短暂的“掉线”揭示了行业现状:展台上的从容建立在物体被提前“预习”的基础上。今天的机器人更像记忆力超群但缺乏理解的“背题高手”,能答满题库却应付不了超纲题。从“背题”到“理解”,数据如何喂养?模型架构走向何方?以下是基于 WAIC 现场观察的深度分析。

一、能干活,但不认识“超纲题”

在思灵机器人展台,H20 能基于语音指令准确完成玩具分类与归位。但当桌面出现一个从未见过的模型玩具时,机器人虽能感知物体存在,却将其错误归类为已知的“棕色小狗”。它知道“有东西”,却不知道“这是什么”,只能用已有题库的答案去套用陌生题目。

类似情况在展馆中屡见不鲜。它石智航 AWE3.5 模型在整理书包时,若放入训练集之外的物体则无法识别;极智嘉物流机器人在面对非统一规格物体混入时,依然只拣选符合预设条件的标准物。

这三个场景指向同一个核心问题:今天的机器人能在已知框架内完成复杂任务,但遇到训练集之外的变量时,仍需重新训练或人工干预。“干活”和“真干活”之间,隔着一道叫“泛化”的坎。

泛化是指模型从训练数据中学会规律,进而应对未见过的的新情况,涵盖物体、任务、场景等多个维度。目前行业对于“泛化做到什么程度算好”尚缺乏共识。北航教授焦子元指出,笼统地宣称“零样本泛化”并不可信,必须明确具体可泛化的因素和参数。

具脑磐石 CEO 朱森华比喻道:机器人学会用碗筷吃饭,若丢进原始森林会饿死,因为数据里没有椰子壳和树枝;而人类不会,因为人理解的是概念背后的功能。简言之,机器人记住的是物体的具体样子,而人理解的是抽象概念,这是“背题”与“理解”的本质区别。

智元合伙人姚卯青提出了物理 AI 落地的“三道墙”:

  • 数据墙:真实世界的交互经验稀缺,无法像爬取网页那样批量获取;
  • 表征墙:行业缺少跨任务、跨场景、跨本体通用的理解框架;
  • 闭环墙:物理世界犯错代价巨大,一次失误可能导致机器报废。

其中,“表征墙”最接近泛化的本质。机器人缺乏的是一种通用理解能力,即在遇到新事物时能调用已有经验推理,而非查阅数据库。流形空间创始人武伟举例说明,同样的动作记录,用关节角度表征精度高但泛化差,用末端空间位置表征则反之。表征是泛化的前提,而跨过这道门槛首先需要解决数据喂养问题。

二、缺数据、怕沉没,仿真是解药还是陷阱?

泛化的燃料是数据,但数据本身已成为瓶颈。据悉,具身智能数据规模目前仅为语言模型的数万分之一。智元合伙人姚卯青判断,要达到开箱即用可能需要一亿小时级别的数据。然而,流形空间创始人武伟警告:“架构未定,先采数据就是沉没成本。”若架构频繁迭代,大规模采集的数据可能随时报废。

围绕“怎么喂数据”,行业主要存在三种路线:

  • 真机数据:精度高但成本高,且对特定本体依赖性强;
  • 无本体数据:成本低、速度快,但需解决从“人能做”到“机器能做”的翻译适配问题;
  • 仿真数据:可在虚拟世界低成本生成海量数据,但面临虚实差距挑战。

三类数据各有短板,其中仿真数据的争议最大。武伟认为应完全放弃仿真,理由是用小模型(仿真器)生成的数据喂养大模型逻辑不通,无法通向真正的通用。蚂蚁灵波 CEO 朱兴则持互补观点,认为仿真若能做到高物理、高视觉、高交互真实,就能以低成本突破数据瓶颈。

谋先飞联合创始人孙家琦给出了清晰的判断逻辑:核心标准是“能否持续产生价值”。他认为真机数据优先级最低,因本体强依赖导致数据复用性差;无本体数据尤其是人类真实场景数据不绑定本体,可持续产出价值;仿真数据优先级最高,纯仿真训练效果不差于真机,且能作为多模态数据中枢融合各类数据,成本可降低一个量级。

孙家琦比喻道:“人工采集的视频、触觉数据是静态教材,仿真是交互的学校课程。”他指出仿真无需等到 100% 真实,达到 90% 即可撬动产业。同时,清华大学副教授苏航评价 UMI 将数采与本体解耦是天才设计,但也指出人机视角差异导致的动作空间不一致仍是待解难题。

行业共识逐渐清晰:三种数据并非替代关系,而是分工协作。无本体数据提供任务定义与环境分布,仿真提供高效可扩展的训练基建,真机负责参数标定与最终验证。Physical Intelligence 研究科学家任至意也印证了这一思路,主张混合多种数据以扩大本体多样性范围。

三、数据堆不出智能,架构才是天花板?

“世界模型”是今年 WAIC 的热词,但概念界定尚显混乱。具脑磐石 CEO 朱森华直言,当前各类模型刷指标好看,一到产线就“欠一口气”。谋先飞孙家琦进一步区分了当前行业的三类“世界模型”:

1. 视频预测类

基于视频预测下一帧画面,试图构建降维的环境演化模型。其局限在于纯视觉模型缺失触觉模态,在复杂物理交互中精度难以保障。

2. 场景生成类

搭建显式的 3D 虚拟世界,主要解决资产生成问题,即如何快速构建逼真的训练环境。

3. 动作规划类

基于对世界的理解和后果推演,输出机器人本体动作,业内也称世界动作模型(WAM)。

这三类系统目标不同、训练方式各异,却被混为一谈,导致外界认知模糊且技术路线未收敛。孙家琦指出,仿真平台可结合视频生成模型做渲染,利用 3D 资产搭建 SimReady 环境,为动作规划模型提供训练场,有望带来范式革新。

路线之争的背后是更深层的架构思考。流形空间创始人武伟认为,具身智能尚处架构创新阶段,远未到统一架构、堆数据就能成功的时期。他批评现有的 VLA(以语言为中心)和视频模型(以视觉为中心)偏离方向,主张建立以物理场约束为核心的具身原生预训练模型。蚂蚁灵波 CEO 朱兴也强调,物理世界交互逻辑独特,必须拥有专属模型,不能简单嫁接语言或视频模型。

纽伦堡工业大学 Burgard 教授抛出一个关键数据:人类大脑功耗仅 60 瓦,却能理解物理世界就地取材;而 AI 大模型训练动辄兆瓦级算力,遇陌生物体仍会发懵。这暗示当前的 AI 架构远未到终点,未来十到十五年或将迎来根本性变革。腾讯 RoboticsX 实验室主任张正友判断更为直接:“具身智能还在起步阶段,远未像大语言模型那样收敛到 Transformer。”

回到当下,今天的机器人更像背熟教材但未学会应变的“实习生”。从“背题”到“理解”的路还有多长?业内嘉宾给出的判断从 2 年到 5 年不等,平均共识为 3 到 4 年。正如张正友所言:“三年到五年,但是要踏踏实实去做。”

END
【声明】内容源于网络
0
0
亿欧网
各类跨境出海行业相关资讯
内容 29721
粉丝 0
亿欧网 各类跨境出海行业相关资讯
总阅读167.3k
粉丝0
内容29.7k