大数跨境

刚刚,能预测多智能体交互的世界模型来了

刚刚,能预测多智能体交互的世界模型来了 量子位
2026-09-08
4
导读:一张图+一个动作,直接预测未来
henry 发自 凹非寺 | 量子位

输入、动作、预测这一完整链路清晰呈现的世界模型,此前并不多见。近日,Scalabot 正式发布首个世界模型HERON-World Model

该模型仅需当前画面与拟执行动作,即可推演机器人执行后的未来场景。其核心突破在于不仅支持单智能体预测,更能精准预判多智能体协作时的相互影响及环境变化

据官方披露,HERON-World Model 基于 WorldArena 1.0 Track 1 开源方案进行离线评估,综合得分(EWMScore_P)达 75.80 分。

让机器人在动手前,先预演动作后果

从演示效果来看,HERON-World Model 的核心能力可归纳为三类:物理规律理解、状态记忆与时序一致性、以及多智能体交互预测

物理规律方面,模型能准确预测物体运动轨迹。例如在抛掷网球场景中,它能完整推演小球飞出、下落、碰撞及反弹的全过程。

状态记忆与时序一致性方面,模型具备长期记忆与因果推理能力。在为杯子盖盖或绘画时,它能记住既有状态(如已盖好的杯子位置、已绘制的笔触),并依据动作逻辑推演后续变化,确保状态演化符合因果律。此外,面对视野盲区(如关闭的冰箱),模型能结合“打开”动作补全门后空间信息。

多智能体交互预测是本次发布的亮点。区别于仅关注单体“动作—状态”变化的传统模型,HERON 能处理多智能体间的配合、干扰及其与环境的共同作用。这在双人拉毛巾控球、编花绳等复杂场景中表现尤为突出,模型需同时维持人物动作、物体形变与物理结果之间的逻辑自洽。

在 WorldArena 分项测试中,该模型在物理交互、空间透视、运动动态、轨迹准确性四项指标上分别获得 95.60、99.20、92.61 和 56.66 分,验证了其在多维度的预测能力。

赋予机器人这种“预演未来”的能力至关重要。在工厂、家庭等真实场景中,机器人不仅需明确“下一步做什么”,更需预判“这样做会导致什么后果”。世界模型通过将预测转化为连续视频,使机器人能在执行前筛选最优行动路径。

为实现高精度预测,HERON-World Model 构建了从多源数据融合到 MoT+MoE 架构的完整技术路径。

数据金字塔:构建丰富的交互经验

HERON-World Model 采用了由Ego 第一视角人类视频、仿真数据和真机数据构成的三层预训练数据金字塔。

真机数据作为“真实执行锚点”,完整记录了视觉观测、动作指令、本体状态及环境变化,直接建立“动作—真实世界反馈”的关键映射。数据覆盖单臂、双臂、轮臂及人形等多种构型。

针对真机数据采集成本高、长尾场景覆盖难的问题,仿真数据被引入以补充稀有状态、危险交互及失败轨迹,拓展模型的边界经验。

Ego 数据则凭借易于规模化且包含丰富交互细节的优势,填补了日常工具使用、双手协作等真机与仿真难以全面覆盖的场景空白。

三者相辅相成:真机提供真实基准,仿真扩展极端情况,人类视频拓宽交互广度。

异构数据统一:打破设备壁垒

面对不同来源数据在时间频率、空间坐标及身体结构上的差异,HERON-World Model 通过三步实现异构数据的统一:

首先是动作信息恢复。对真机和仿真数据直接提取记录;对 Ego 视频则通过清洗、三维手部姿态估计及相机轨迹恢复,提取出可作为弱监督信号的动作线索。

其次是时空对齐。时间上以视频帧时间戳为基准同步动作与画面;空间上将不同关节轨迹转换为统一的末端执行器位姿,消除设备差异。

最后是统一编码。针对本体差异,模型配置轻量动作编码器,将各类动作映射为固定维度的 Action Token。同时,引入掩码和置信度控制机制,有效应对遮挡和视野丢失问题,避免误判。

经此处理,多源数据被整合为统一的训练流,专注于学习“动作引发世界变化”这一核心规律。

MoT+MoE:多专家合理分工

在架构设计上,HERON-World Model 采用MoT(Mixture of Transformers)+ MoE(Mixture of Experts)组合,以应对数据扩展带来的挑战。

MoT 解决“知识隔离”问题。为防止具体操作训练覆盖 VLM(视觉语言模型)已有的通用世界知识(如刚体不变性、关节约束等),模型通过单向注意力机制分离参数:生成分支可读取 VLM 知识,但反向更新受到抑制。这既利用了先验知识约束预测合理性,又避免了灾难性遗忘。

MoE 解决“生成分工”问题。针对不同动作所需建模规律的差异,模型将 DiT 生成过程拆解为两个专家:高噪声专家负责确定未来大体结构与粗粒度运动,低噪声专家专注补充局部几何、视觉细节及精细交互。这种分工有效缓解了复杂场景下的参数竞争,提升了训练稳定性与生成质量

综上,HERON-World Model 通过多源数据积累交互经验,利用异构统一技术打通数据壁垒,并借助 MoT+MoE 架构实现高效的知识复用与精细化生成,为具身智能提供了可靠的“预演未来”能力。

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16433
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读417.0k
粉丝1
内容16.4k