物理 AI 正成为 2026 年全球人工智能竞争的核心赛道。在大模型将语言能力推向极致后,行业焦点转向“模型能否走进真实世界并动手操作”。Google DeepMind 发布 Gemini Robotics 2,OpenAI 推出 GPT-6,均在探索具身智能的边界。然而,Robocurve 的实验显示,即便顶尖大模型在精细操作上仍存在显著鸿沟,这为中国企业提供了弯道超车的机会窗口。
在此背景下,源自北京中关村的中国公司深度机智于 2026 年 9 月 9 日正式发布物理基座模型PhysBrain 1.5。该模型在 28 项公开基准测试中取得 72.5 的综合均分,位居开源模型榜首,与 GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)等头部闭源模型的差距已收窄至 1 分以内。深度机智并未盲目追逐参数规模,而是坚持“人类学习”技术路线,将物理智能基础能力作为核心战略深耕。
PhysBrain 1.5 实现全面开源,向社区开放技术报告、2B 与 8B 模型权重及评测工具包,旨在降低开发者门槛,共同推动物理智能发展。
开源第一,比肩顶尖闭源:中国物理 AI 基座模型站上全球前沿
物理基座模型的评测极具挑战性。PhysBrain 1.5 经受住了包含视觉空间感知、空间与多视角理解、具身认知与规划、空间指向与可供性、视觉轨迹推理五大维度的 28 项公开基准测试。
测试结果显示,PhysBrain 1.5-8B 以 72.5 分的综合成绩位列开源阵营第一,其中 14 项指标取得开源最佳,10 项位列第二。相比其他开源对手,其优势明显:较 Hy-Embodied-VLM-1.0 高出约 6.5 分,较 RynnBrain 1.1 高出 9.4 分。更关键的是,其在具身智能核心能力上已与全球最前沿的闭源模型处于同一水位线。
分项成绩印证了其系统性领先:
- 空间理解:在 RoboSpatial-Home 测试中获 73.9 分,具备准确理解真实场景物体空间关系的能力;
- 可操作部位识别:Part-Affordance 测试获 84.0 分,不仅识别物体,更能理解“何处可操作”及“如何操作”;
- 视觉目标定位:RoboRefit 测试获 89.8 分,能在复杂场景中精准锁定目标,为动作执行提供可靠锚点。
此外,深度机智同步发布了 PhysBrain 1.5-2B 版本。虽然 2B 版本不参与官方排名,但其 66.6 分的综合得分已超过表中所有其他非 PhysBrain 开源参评模型(包括部分更大参数规模的模型)。这表明该技术在显著降低参数规模的同时,仍保留了完整的具身理解能力,为轻量级部署提供了可能。
目前,两个版本均已上线 Hugging Face,上线仅 3 天下载量即突破 3000 次,为全球开发者提供了媲美顶尖闭源模型的物理智能基座。
从人类经验到物理智能循环:Ego360 与 Physical Loop 的理念闭环
PhysBrain 1.5 的核心竞争力在于其独特的"Physical Loop"物理智能循环架构。深度机智认为,真正的物理智能并非单点能力的堆砌,而是“观察—理解—判断—执行—反馈修正”这一闭环的稳定运转。
与传统“理解模型 + 动作模型 + 预测模型”的拼接方案不同,PhysBrain 1.5 将上述五步能力重新组织进同一个基座模型中。为了实现这一闭环,团队将人类经验确立为物理智能的第一性来源,构建了Ego360 人类全景真实数据体系。该体系通过全景视频记录任务执行环境,同步保留全身姿态、手部运动与任务语音,使模型能够学习到连续的任务上下文及动作后的状态变化,而非孤立的动作片段。
这一技术路径已获得行业高度认可。深度机智创始人陈凯博士在 WAIC 2026 上系统阐述了该理念;2026 年 9 月 10 日,深度机智受邀参加由国家数据局主办的具身智能座谈会,展示人类全景真实数据与情境数采范式,标志着其技术选择已上升为行业基础设施层面的参考坐标。
理解、动作、预测:一个基座里的三大能力
PhysBrain 1.5 基于开源基础模型,将语言回答、空间坐标、动作轨迹、未来画面与深度预测纳入同一套训练框架,实现了具身理解、动作生成与未来状态预测的内在一致性。
一是具身理解:知道“此刻发生了什么”
模型通过具身监督注入物理感知能力,覆盖五大核心能力维度。它输出的不仅是语言描述,更包括结构化的空间坐标与轨迹目标,为后续动作生成提供关键锚点。
二是动作生成:指向“接下来该怎么做”
通过 Human-as-Humanoid 管线,模型从人类视频中学习手腕运动方式并转化为机器人可执行动作。给定当前画面、任务指令及历史动作,模型可直接生成后续步骤,且无需针对特定机器人形态单独训练,具备极强的泛化性。
三是未来状态预测:预见“做完之后会发生什么”
模型能预测 1 秒后的物理状态,同时输出空间对齐的 RGB 图像、深度图和机器人掩码。这种“先想象结果、再采取行动”的前瞻能力,为闭环中的纠错提供了依据。
三项能力在同一模型中互为输入、互相约束,标志着物理智能构建方式从“拼装专用模块”走向“训练统一基座”。
Human-as-Humanoid:人类动作进入模型,再走向机器人
解决人类视频动作向机器人动作转化的关键,是深度机智提出的Human-as-Humanoid 框架。该框架将人类行为数据从“可观看的记录”转化为“可训练的资源”,成为连接人类数据与动作模型的桥梁。
此前,该转换链路已在自研的 60 自由度拟人体机器人 Prime U 上完成真机验证。研究显示,其原始示范吞吐量达到传统遥操作的 4.8 至 7.2 倍,并在部分任务上实现了从人类数据到真机执行的零样本迁移。这意味着模型无需看到特定机器人的示范,即可在该本体上执行任务。
至此,深度机智已形成"Ego360 数据积累—PhysBrain 基座拓展—Human-as-Humanoid 转换—Prime 本体验证”的全栈闭环,构建起难以复制的系统性壁垒。
提前一年的路线定力:当全球共识追上深度机智的判断
GPT-6 Astra 的机械臂实验表明,通用大模型虽能提升物理行动能力,但在精细操作上仍显不足,证实了物理智能需要专门的基础模型。这侧面印证了深度机智一年前的战略判断:物理基座模型需长期投入,且必须源于人类在真实世界的交互经验。
早在 2025 年 10 月,深度机智便发布《源于人,超越人》技术路线图,确立“人类学习”为核心路径。当时行业尚未形成共识,而一年后 PI、NVIDIA 等机构的集体转向,验证了深度机智的先发优势。从 2026 年 3 月发布 PhysBrain 1.0 到此次 1.5 版本的迭代,半年一次的高频更新展示了其稳定的研发闭环与工程落地能力。
扛起行业发展重任的“黑马”
PhysBrain 1.5 的成功不仅在于评分第一,更在于其展示的三种关键能力:
- 架构的统一性:将理解、动作、预测收进同一自回归主干,实现模型内部闭环;
- 数据路线的差异化:率先利用人类第一视角数据构建物理常识,推进稀缺数据基建;
- 工程落地的全栈性:自主把控从数据采集、基座模型到本体及转换框架的全链条。
物理智能的终局是一个能在真实世界里感知、行动并自我修正的闭环。PhysBrain 1.5 的发布标志着,凭借人类学习路线与全栈布局,中国团队已在全球物理 AI 基础模型竞争中跻身第一梯队,成为中国物理 AI 发展的重要里程碑。

