不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra
智东西

全球具身智能竞争已从本体比拼延伸至“大脑之战”。谷歌提出“通用大脑”,英伟达主张“世界动作模型”,谁将定义新一代通用底座?
国内厂商宇树科技率先破局。近日,其新一代通用人形机器人基础模型 UnifoLM-WLA-1.0 正式发布。该模型参数量 6B,基于约 2500 小时真机数据训练,在具身推理任务中斩获 7 项开源 SOTA,多项空间理解能力超越 GPT-6 Astra。宇树同时宣布开放模型权重、代码及数据集。
模型能力终需落地真实场景。人形机器人何时能成为“通用劳动力”?UnifoLM-WLA-1.0 单模型即可统筹 64 项任务,涵盖叠毛巾、收纳餐具、铺床、倒垃圾及衣物清洗等,验证了其强大的泛化能力。
此举旨在解决行业长期痛点:过往 Demo 多局限于单一任务与场景,难以规模化复用。宇树试图通过一套模型覆盖多任务、多场景,让国产厂商掌握“具身智能大脑”的定义权。
01. 拿下 7 项开源 SOTA,比肩 GPT-6 Astra:国产厂商抢“具身大脑”定义权
在具身推理层面,UnifoLM-WLA-1.0 的底座为 UnifoLM-ER-1-4B。该模型基于 Qwen3-VL-4B 训练,消耗超 500 万条具身推理样本,在 16 项多模态感知与理解基准中,有 7 项领先同参数量开源模型。
部分空间理解能力已逼近甚至超越头部闭源模型。在 Where2Place、BLINK、CV-Bench 和 EmbSpatial 等基准测试中,UnifoLM-ER-1-4B 表现优异。例如在 Where2Place 中得分 82.0(GPT-6 Astra 为 69.0),在 EmbSpatial 中得分 88.9(GPT-6 Astra 为 83.3)。
对机器人而言,空间理解远重于聊天能力。精准定位物体、预判环境变化是机器人走进真实世界的前提。
在执行能力上,UnifoLM-WLA-1.0 将感知、推理、未来预测与动作生成串联,单模型覆盖 64 项任务(含 54 项桌面操作与 10 项全身操作),并支持二指夹爪及多种五指灵巧手。
桌面侧任务包括叠衣、收纳餐具、电池充电及整理文具;全身侧任务涵盖倒垃圾、铺床、整理鞋物及文件归档。
宇树正将“具身智能大脑”转化为可验证的模型体系,从本体强者转型为生态构建者。其策略对标“安卓模式”:底层能力开放,吸引开发者适配不同设备与场景,共建生态护城河。
02. 先预测“哪里变”,再生成“怎么动”:让世界模型落到动作上
传统 VLA 模型多为“看图做动作”,难以应对高度动态的真实世界。宇树创新性地将“具身推理 + 未来变化预测 + 动作学习”整合,使机器人在行动前即可预判环境变化。
核心设计在于利用光流技术对比动作前后画面,单独学习“变化区域”。以机械臂包装手机为例,模型聚焦于机械臂、手机及交互区域的变化,而非重绘全图像素。
变化区域经 VQ-VAE 压缩为离散 Token,模型仅需当前画面与任务描述即可预测下一步变化,宇树称之为“以交互为中心的世界建模”。
为解决复杂动作表达难题,宇树将统一动作空间拆分为三路:末端执行器位姿、末端关节及下肢关节,分别通过 RVQ 离散化为 Token。连续运动轨迹被翻译为同步输入的“动作语言”。
基于 UnifoLM-ER-1,宇树构建了 UnifoLM-ER-Flow,将动作 Token、未来动态区域 Token 与图文信息纳入同一表示空间。随后,通过加入 MMDiT Action Expert,将离散理解解码为机器人可执行的连续动作,形成“预测变化 - 生成动作”的完整闭环。
世界模型由此深度参与动作生成,实现了环境理解、变化预测与全身控制的有机连接。
03. 2500 小时真机数据背后:模型是公开牌,数据与场景是护城河
模型参数可公开,但高质量真机数据难以复制。具身模型的核心壁垒在于数据来源的真实性。2500 小时真机数据相当于单台机器人连续采集超 100 天,且需保证每一帧的有效性。
UnifoLM-WLA-1.0 的训练数据包含两类:超 500 万条具身推理样本(覆盖图像点预测、物体检测、空间问答等)用于基础训练;约 2500 小时真机数据(覆盖多本体、多场景)用于 WLA 模型训练。
真机数据的获取依赖时间与规模化机器人产能,这是纯软件厂商难以跨越的硬投入。此外,宇树构建了“多本体 + 统一动作空间”的技术壁垒,实现不同身体部位在同一时间步的协同学习。
随着权重、代码和数据集的开放,开发者可在 64 项任务基础上进一步检验泛化边界并进行二次开发。宇树提供的不再仅是硬件,而是一套可复用的具身智能底座,其价值将延伸至行业解决方案与平台化能力。
开源“大脑”非但未削弱护城河,反而强化了宇树在真机数据、真实场景及持续迭代上的优势,吸引更多生态伙伴加入,拓宽发展路径。
04. 结语:从定义身体到定义大脑,具身智能进入“生态卡位战”
从四足到人形,宇树已完成从本体强者到“大脑”定义者的跨越。当前具身智能竞争已进入新阶段:硬件比拼持续加码,而大脑与生态的争夺战正式拉开帷幕。
当模型与代码趋于透明,稀缺的是持续产出高质量真机数据的能力及由此汇聚的开发者生态。国产厂商主导的具身智能“安卓时刻”或许由此开启。