6 月 16 日,阿里巴巴正式发布千问具身智能大模型系列 Qwen-Robot,涵盖 VLA 操作模型 Qwen-RobotManip、VLN 移动模型 Qwen-RobotNav 以及世界模型 Qwen-RobotWorld。作为千问家族首个完整的具身智能模型矩阵,该系列分别赋予机器人灵巧的操作能力、精准的导航能力与深度的推理能力。三大模型既可独立部署,亦能协同作业,为不同形态的机器人在真实场景中的落地提供了可靠的“通用底座”。
从数字对话到物理执行:具身智能的商业化临界点
大语言模型(LLM)擅长数字世界的对话与内容生成,而具身智能(Embodied Intelligence)则将这一能力延伸至现实物理世界。当前,全球具身智能行业正处在从“实验室研发”迈向“真实场景商业化”的关键节点。能否在陌生环境中准确理解指令并稳定执行,是跨越这一门槛的核心挑战。Qwen-Robot 通过三类关键模型的设计与训练,实现了对人类自然语言的深度理解、三维环境的精准感知及物理规律的掌握,从而指挥机器人在真实世界中自主完成复杂操作与精准移动,甚至胜任从未见过的任务。
Qwen-RobotManip:统一动作表征,打造通用“灵巧手”
VLA(视觉 - 语言 - 动作)模型是具身智能的核心基础,旨在融合视觉感知、语言理解与动作决策。针对传统 VLA 模型迁移能力不足、换场景性能下降的痛点,Qwen-RobotManip 从动作统一与空间统一两个维度进行突破。
首先,该模型采用一套 80 维的统一动作表征,为不同硬件定义了通用的“肢体语言”,使机器人能够习得基础物理规律与动作逻辑,而非生硬模仿。其次,Qwen-RobotManip 摒弃了繁琐的绝对坐标计算,转而基于摄像头画面中的相对位置进行操作,显著提升了环境适应性。搭载该模型的机器人只需数步反馈即可自动适配不同硬件,表现稳定高效。
图说:RoboChallenge 真机多任务全球榜单,代号 Lira 的 Qwen-RobotManip 夺得第一
在训练数据方面,Qwen-RobotManip 基于超过 38000 小时的语料完成预训练。与行业依赖私有自采数据的常规路径不同,该模型全程仅基于开源数据训练即取得优异效果。在横跨 30 项真实世界任务、覆盖 4 个机器人平台的第三方真机测评 RoboChallenge Table30 v1 中,代号"Lira"和"Atlas"的两个版本分列前两名,成功完成拧水龙头、插网线、双臂倒薯条等高难度任务,被官方评价为“基础任务稳定、高难任务可突破”。
Qwen-RobotNav:任务自适应观察,赋予机器人“认路脚”
若 VLA 模型让机器人“能动手”,则 VLN(视觉语言导航)模型使其“会跑腿”。Qwen-RobotNav 基于 Qwen-VL 构建,将语言指令导航、目标搜索、自动驾驶等五大任务族统一至同一框架,无需人工切换模型即可应对复杂任务。
针对此前 VLN 模型记忆策略死板、易陷入“记少迷路、记多混乱”的困境,Qwen-RobotNav 创新推出任务自适应观察机制,可根据任务需求灵活切换记忆策略。此外,该模型被设计为通用接口,原生支持多种智能体框架,可被上层模型直接调用,真正实现了机器人“边走、边看、边思考最佳路线”。例如,搭载该系统的宇树 Go2 四足机器人在接到“寻找不记得放在哪的行李箱”指令时,可自主巡逻并进行视觉推理,顺畅完成寻物导航。
图说:搭载 Qwen-RobotNav 的机器狗顺利完成寻物导航
Qwen-RobotWorld:模拟物理规律,构建会思考的“大脑”
为了实现更精准的操作,机器人需具备类似体操运动员在脑海中演练动作的能力,这依赖于具身智能领域的世界模型。Qwen-RobotWorld 是千问在此领域的最新尝试,基于对物理规律的深刻理解,可推理并模拟出下一时间点的合理动作与状态,引导机器人在现实世界中按图索骥。
在实际应用中,Qwen-RobotWorld 不仅能生成视频数据以缓解训练数据不足的难题,还能在执行动作前帮助机器人推演未来轨迹,显著提升操作的精准度与到位率。
图说:Qwen-Robot 系列模型在具身智能评测中夺得多项 SOTA
结语:迈向物理智能体的重要一步
Qwen-Robot 系列标志着千问大模型家族从数字智能体向物理智能体的关键跨越。无论是单独部署还是整体协同,该系列均能在统一的自然语言指令下展现一致的高性能,让具备广泛行动能力、多任务处理能力及后果预见能力的物理智能体成为可能。未来,这套“通用大脑”将搭载于更多形态的机器人,助其在复杂现实场景中实现高度自主的感知、决策与长程执行。

