编辑 | 赖捷
近半年来,世界模型(World Model)成为 AI 领域的新焦点。据 Forbes 统计,2026 年上半年流向该领域的风险投资已超 200 亿元。国内大厂动作频频:蚂蚁开源 LingBot-World,腾讯、阿里相继发布混元 3D 世界模型 2.0 及“快乐生蚝”,高德、智源等也陆续推出相关产品。
8 月 17 日,智象未来(HiDream.ai)发布的 HiDream-O1-World 模型引发关注。在美团 LongCat 联合复旦大学发布的权威评测基准 WBench 上,该模型平均表现超越阿里、蚂蚁等多款知名产品,尤其在物理维度上位居行业第一。
智象未来发展势头迅猛,仅 7 月便完成 15 亿元 C 轮融资,近三个月累计融资超 21 亿元。在资本与人才密集涌入的背景下,HiDream-O1-World 有何独特之处?智象未来对世界模型又有何新解?我们与团队进行了深度交流。
不仅是可交互,更有两大核心突破
若大语言模型预测的是“下一个词”,世界模型预测的则是“世界的下一个真实状态”。这一概念涵盖物体位置、速度、属性乃至因果逻辑和物理规律。从认知科学起源,经谷歌大脑论文推动,至 2024-2025 年伴随生成式 AI 爆发,世界模型正式进入产业落地阶段。
当前市场主流世界模型主要分为三类:
- 视频派:以生成可实时交互的视频为核心,如 Adobe Research 的 RELIC;
- 3D 资产派:生成可编辑、可导入引擎的原生 3D 资产,如李飞飞 World Labs 的 Marble 平台;
- 垂直应用派:面向具身智能、自动驾驶,构建数字孪生世界以训练机器,如英伟达 Cosmos 平台。
英伟达的世界基础模型平台 Cosmos
智象此次发布的 HiDream-O1-World 是一款原生全模态交互式世界模型。它支持“漫游模式”下的自由探索,以及通过文字、语音或图片指令进行实时操控的“编辑模式”。
相关技术论文已被计算机视觉顶级会议 ECCV 2026 接收
智象未来技术合伙人潘滢炜博士指出,与传统为各模态独立编解码再融合的技术路径不同,HiDream-O1-World 基于自研的原生全模态(UiT)架构,将文本、图像、视频、空间信号统一输入同一模型管路。这一底层创新带来了两大维度的突破:
突破一:精准的物理规律理解
现有模型常在物理常识上“翻车”,而 HiDream-O1-World 在 WBench 物理维度评测中登顶,关键在于对细节的极致还原。无论是山路骑行时树木的摇动与光影折射,还是降落伞下降时气球的鼓风状态与绳结飘荡,亦或是池塘中鱼群游动的轨迹与涟漪,均展现出高度的物理真实性。
突破二:卓越的时空一致性
针对传统模型视角转换后物体消失的“记忆缺失”痛点,HiDream-O1-World 实现了灵敏顺滑的响应。在复杂地形中急速转向或频繁变换视角,画面依然保持连贯,无延迟与割裂感,细节完整保留。
基于这两大优势,智象未来提出世界模型的新定义:真正的世界模型不应仅是"model the world"(建模世界),更应是"mold the world"(塑造世界)。即不仅追求视觉真实与可交互性,更要将物理规律、因果逻辑与时空一致性深度融合,从而真正重塑虚拟世界。
赋能自动驾驶、具身智能与互动影游
尽管世界模型应用场景尚在探索,但自动驾驶与具身智能已成为两大成熟落地方向。Waymo 利用高逼真虚拟世界模拟罕见场景;李飞飞的 World Labs 收购仿真公司 SceniX,构建机器人训练闭环引擎。
智象未来已在具身智能领域展开实质性合作。针对该领域多模态数据获取难、成本高的问题,公司与诺亦腾机器人合作:利用真实人类动作数据,通过 HiDream-O1-World 进行百倍以上的精细化扩展与泛化,生成数万小时的高质量视频数据。这些数据既保留真实物理反馈,又突破场景限制,为具身智能训练开辟了新路径。
基于诺亦腾机器人动捕数据生成的高精度视频数据
此外,上影新视野基金、华策影视等机构的入局,暗示了AI 互动影游将成为另一重要赛道。传统 AI 视频难以维持长时序连贯,而基于世界模型构建的记忆、空间感与物理规则,能确保玩家在分支剧情中体验始终如一的真实现实感——物品位置固定、物理反馈真实、光影动态变化。
AI 互动影游《诡舍》
目前,世界模型仍带有浓厚的科研属性,商业化路径待明确。智象未来团队表示,现阶段更专注于技术愿景的实现。作为一群科研人员驱动的科技公司,他们的终极目标是通往 AGI(通用人工智能)。
“我们希望能一开始就把‘世界的规则’刻进模型里——让它知晓物理定律、空间关系与因果逻辑,从而真正理解、推理并重构世界。”团队强调,新发布的 HiDream-O1-World 正是通往这一终点的重要节点。

