编辑丨李希
GPT‑6 的发布进一步拓宽了大语言模型的能力上限,推理、编程及多模态理解的进展印证了通用智能的持续提速。然而,当模型在数字空间的能力得到充分验证后,核心问题随之浮现:具备强大世界理解能力的大模型,能否真正落地物理世界完成行动?
Robocurve 的机械臂测试给出了对照结果:在积木入碗任务中,GPT‑6 Astra 20 次尝试成功 19 次,而 Claude Fable 5.1 仅完成 8 次。这表明大模型对世界的认知可转化为现实物理操作,其价值边界正在跳出屏幕。

但测试也暴露出明显短板。在蓝色圆形拼图块对位插入凹槽等精细装配任务上,GPT‑6 Astra 成功率仅为 10%。即便拥有不错的通用认知,大模型仍只是机器人完成任务的基础,从“理解世界”到“实际执行”之间存在巨大鸿沟。空间感知、具身理解与精细动作生成,是模型走向物理世界必须攻克的难点,也是行业竞争的核心战场。
深度机智瞄准这一方向,推出物理基座模型 PhysBrain 1.5。在 28 项具身空间智能与规划基准测试中,其 8B 版本综合得分 72.5,位列参评开源模型首位,整体水平已接近 GPT‑6 Astra(73.3)、Gemini 3.6 Flash(73.0)等头部闭源模型。

这家成立仅一年多的中国公司,正通过自研架构将空间理解、动作生成、未来状态预测等多维能力统一到一个基座模型中,扎实推动“让模型理解世界并知道如何行动”的落地。
01 把“理解、动作、预测”收敛进一个闭环
物理智能的核心在于解决"Physical Loop":即“观察世界、理解空间与任务、判断动作后果、执行、再依据新观察修正下一步”的循环。真正的物理智能并非单点能力,而是该闭环能够连续、稳定运转并自我修正。
当前,构成这一循环的能力大多分散在语义理解、空间感知等割裂的专用模型中,缺乏统一的世界表征与反馈机制。深度机智的判断是:要构建能“在世界中行动并自我修正”的底座,必须围绕 Physical Loop 重建模型。PhysBrain 1.5 正是基于此理念打造。

该模型以 Qwen3-VL-8B-Instruct 为基座,扩展出专用的动作 token 与视觉状态 token。它将语言回答、结构化空间输出、末端执行器轨迹以及未来的 RGB、深度与机器人占用预测,全部表达为离散 token。在单一自回归主干和单一 next-token 预测目标下联合训练,不引入任何任务专属头。这意味着理解、动作生成与未来状态预测不再由多个模型拼接,而是在同一个物理循环中共同训练、彼此对齐,构成了能力扎实的一体化物理智能底座。
在此统一架构下,PhysBrain 1.5 的能力沿 Physical Loop 拆分为三个相互咬合的环节:
具身理解
模型通过基础 VLM 接口辅以具身监督,覆盖基础视觉空间感知、3D 与多视角空间理解、具身认知推理与规划、空间指向与可供性,以及视觉轨迹推理五类能力。它不只是“看懂”画面,而是带着空间结构与物理常识去理解场景。

动作预测
给定任务指令、当前视觉观测及可选的近期动作历史,模型直接输出下一拍末端执行器的动作块,表达为一段 ActionPiece token 序列。单臂、左腕、右腕共用同一套词表与码本,意味着一份通用模型权重即可驱动不同形态的机器人。这是“理解”落地为“行动”的关键一跃。

未来状态预测
在给定当前观测与任务指令后,模型预测约一秒后的世界状态,并以 RGB 图像、度量深度图与机器人占用掩码三种模态联合给出。这种“先想象结果、再采取行动”的能力,让模型在闭环中拥有了前瞻与纠错的依据,在动作尚未执行时即可预判环境变化。

这种“一个 token 接口贯通物理循环”的架构,指向的是一个可“感知—决策—行动—反馈”连续运转并能自我修正的物理智能基座模型。
02 人类完整经验,是物理智能循环的来源
闭环运转的第一步是“有经验可学”。模型在 Physical Loop 中的能力上限,由其消化的物理经验的质量与完整性决定。人类经验天然嵌入这一循环中:人在真实世界中持续感知、理解、行动并修正判断。在深度机智的路线里,人类经验是物理智能循环的第一性来源。
为此,深度机智构建了 Ego360 全景数采体系,尽可能完整保留人类行动过程中的环境、身体、手部交互与注视信息。模型学到的是一段连续、完整的“人类经验”,而非被割裂的局部。只有保留行动前后的因果链条,模型才能真正理解“为什么这么做”和“做完之后发生了什么”。

当模型理解了因果关系,空间关系、操作方法与纠错经验就能在不同任务间迁移复用。当前,这套体系正以每月万小时级的速度持续新增,为物理智能注入丰富的训练资源。
让数据转化为模型能力,还需打通从“看到”到“做到”的关键一环。PhysBrain 1.5 引入的 ActionPiece 机制,让模型能够同时学习“该怎样行动”和“行动之后可能发生什么”,即同时建模动作生成与状态预测。团队内部实验显示,PhysBrain 1.5 的动作预测能力实现了从 24% 到 54% 的翻倍提升。
03 72.5 分,拿下开源第一,媲美顶尖闭源
PhysBrain 1.5 本轮评测覆盖基础视空感知、空间与多视角理解、具身认知推理、空间指向与可供性、视觉轨迹推理五类能力,共 28 项基准。
结果显示,PhysBrain 1.5-8B 以 72.5 的综合均分拿下开源模型榜首,并在 28 项中的 14 项取得开源最佳,10 项位列开源模型第二。相较最强开源对手 Hy-Embodied-VLM-1.0(66.0)高出约 6.5 分,较 RynnBrain 1.1(63.1)高出 9.4 分。更受关注的是其整体水位:72.5 分与 GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距已收窄到 1 分以内。在具身智能的核心能力上,深度机智正与全球最前沿的闭源系统站在同一水位线上竞争。

深度机智同时开放了 PhysBrain 1.5 2B 与 8B 两个参数规模的权重,已上线 Hugging Face,为社区验证与下游部署提供入口。
04 Human-as-Humanoid:人类经验驱动真机行动,闭环落到执行
如果说 Ego360 解决了“人类经验从哪来”,PhysBrain 1.5 实现了“人类经验如何转化为模型能力”,那么 Human-as-Humanoid 则回答了“人类经验如何转化为真机行动”。研究证明,同步采集的第一、第三视角人类视频,可直接转化为适配 PrimeU 的动作训练数据;原始示范吞吐量达到遥操作的 4.8—7.2 倍,部分任务无需目标任务机器人示范,即实现从人类数据到真机执行的零样本迁移。

这一步的意义在于把“模型能力”真正接到了“真机执行”上:人类经验不再只是训练素材,而是能直接驱动机器人完成真实操作的动作来源。从人类经验、到模型建模、再到真机落地,深度机智由此跑通了从模型能力到真机执行的全栈链路。
这也反向验证了 Ego360 与 PhysBrain 1.5 所代表的“人类学习”路线,不只是一套训练数据或一次基准高分,而是能在真实世界里闭环运转的完整系统。大脑与身体、数据与本体,被组织在同一条主线上。
05 提前一年的路线定力,与正在重排的牌桌
全球范围内,物理基础模型的研发投入正在加速:Google DeepMind 的 Gemini Robotics、Physical Intelligence 的π系列、Figure 等,分别在具身推理、人类工作视频数据、少样本适应等方向持续加码。一个清晰的趋势已经显现:海外头部企业正在走向殊途同归,物理经验数据、空间交互能力、基础模型训练成为各家共同发力的核心方向。
回溯到一年前,深度机智就已经把这些方向纳入自身长期技术路线。2025 年 10 月 10 日,深度机智发布《源于人,超越人》技术路线图,将“人类学习”定为物理通用智能的核心研发路径,围绕“以人类数据为起点”“以动作为中心建模”“身体为 AI 设计”三大战略,完成物理智能的全栈布局。
在这套体系下,Ego360 沉淀人类经验数据,PhysBrain 基座模型不断拓展能力上限,Prime 系列机器人本体负责真实场景的交互验证与反馈。人类数据基建、模型研发、本体闭环验证三者协同,系统性完成各阶段技术积累,不断缩短从“人类经验”到“机器能力”的转化链路。
深度机智从相对早期的起点出发,跑通了“数据‑模型‑本体”完整全栈链路,也交出了可量化的模型性能成果。当下行业对物理 AI 的共识快速升温,但真正稀缺的是贯穿长期的技术判断,以及跨环节落地的执行能力。过去一年,深度机智在人类经验数据、物理智能建模、机器人验证上的持续积累,正在构筑起难以追赶的先发优势。
物理智能的终点,从来不是一个只会应答的模型,而是能够在真实世界感知、行动、并且持续自我迭代修正的完整闭环。PhysBrain 1.5 并不是这条道路的终点,但它释放出一个明确信号:在中国物理 AI 基础模型赛道,这家成立仅一年多的企业,依靠人类学习路线与全栈布局,已经跻身全球竞争第一梯队。对于整个行业来说,这是一个值得持续观察的样本。

