作者丨幸丽娟
编辑丨林觉民
2026 年上半年,中国 AI 资本与人才全面涌向“世界模型”。前六个月该赛道披露融资约 300 亿元,若计入“具身智能 + 世界模型”融合领域,总额超 900 亿,同比增速超 5 倍。
在百亿资金与海量人才涌入的背景下,行业面临核心拷问:究竟有多少人真正理解了世界模型的本质?针对这一困惑,我们深度访谈了 IDEA 研究院讲席科学家、视启未来创始人张磊。
作为 IEEE Fellow,张磊的 DINO 系列曾在 COCO 霸榜五个月,Grounding DINO 及 DINO-X 更力压谷歌和 Meta,被李飞飞团队、英伟达等全球顶尖机构标配引用。2025 年,他携团队从 IDEA 孵化创立视启未来,天使轮迅速到账近亿元,背后更有张钹院士与沈向洋院士两位巨擘支持。
在众说纷纭的 2026 年,张磊给出了清晰、可操作且不妥协的答案。从微软研究院到 IDEA,再到创业,他二十余年始终聚焦同一命题:“让 AI 理解物体”。世界模型,正是这一命题在物理世界的关键答案。
以下是对话实录(经 AI 科技评论不改变原意删改)。

张磊博士,IEEE Fellow,视启未来创始人兼 CEO,现任 IDEA 研究院计算机视觉与机器人研究中心(CVR)讲席科学家,香港科技大学(广州)兼职教授,前微软亚洲研究院及总部研究院首席研究员。在计算机视觉等领域发表论文 200 多篇,Google Scholar 引用超 77000 次,H-Index 为 107,拥有 60 多项美国授权专利。
01
具身智能最大瓶颈:非本体,乃大脑
▎AI 科技评论:具身智能爆发,机器人运动控制日益惊艳,但落地应用仍显不足。您认为走向现实还需攻克哪些挑战?
张磊:机器人核心需解决两件事:成功率与泛化能力。即任务完成的可靠性,以及在环境或本体变化下的适应能力。
具体挑战有四:
第一,单一场景泛化不足。当前部分团队在特定场景成功率可达 70%-80%,但在真实应用中意味着每五次操作必有一次失败,仍需大量人力兜底,无法独立部署。
第二,跨场景通用性欠缺。应先将单点能力推至极限,再横向拓展应用广度,跨越从“实验室演示”到“真实应用”的鸿沟。
第三,“大脑”深层能力缺失。现有深度学习多学习智能“行为”而非“机理”。具身大脑需具备真正的因果推断、常识理解及自适应能力,目前尚处起步阶段。
第四,未达“终端”级应用。多数机器人依赖巨大外部算力,唯有解决“无需人工兜底”问题,方能形成“应用 - 数据 - 迭代”的良性循环。
▎AI 科技评论:业内观点分裂,硬件派主张降本,算法派认为大脑是卡脖子关键。您如何看待?
张磊:大脑更难,也更重要。
中国硬件迭代令人自豪,宇树、智元等企业通过仿真强化学习大幅优化了成本与可靠性。但本体在马拉松等场景中展现的仅是基础动物本能,尚未达到与环境深度交互的水平。
▎AI 科技评论:“大脑”之难,难在数据还是对智能的理解?
张磊:难在机制未明。人类大脑与其他动物的最大区别在于智能程度。现有突破多是从表象模仿智能,AI 实际在学习人的行为,而非智能本身。正如张钹院士所言,大语言模型能像人一样说话,但其理解语言的方式与人截然不同。
02
世界模型:沉寂二十载,今朝为何突然爆发?
▎AI 科技评论:“世界模型”概念早在 90 年代提出,为何沉寂二十年后今日成为风口?
张磊:90 年代初学者曾尝试对环境建模以辅助强化学习,但受限于当时技术难以验证。2018-2019 年,"World Models"论文出现并在游戏场景得到验证。随着 AI 在游戏中战胜人类,研究者开始思考:能否让 AI 在与环境交互中自主“学出”世界模型,将环境演化过程内化?这一设想在 2018 至 2020 年间得到完整验证。
▎AI 科技评论:具身智能是否是点燃世界模型热潮的导火索?
张磊:关联始于语言模型。行业先做了 VLA(视觉 - 语言 - 动作模型),沿用模仿学习范式。但此法很快遭遇瓶颈:一是数据收集效率低,机器人需在真实环境执行并等待反馈;二是失败成本高昂,无法像语言模型在数字世界低成本试错。
世界模型提供的虚拟环境正是破局关键。若模型能预测“执行某动作后环境的变化”,机器人即可在虚拟世界中“脑补”试错,无需在现实中打碎万个碗。
03
定义重塑:无动作输入,不称世界模型
▎AI 科技评论:行业内对“世界模型”定义混乱,视频生成、3D 建模等均被冠以此名。您认为其核心条件是什么?
张磊:世界模型必须具备动作依赖性,即Action Conditioned。模型必须能回答“若执行某动作,环境将如何变化”。
智能体与环境的交互闭环依赖于动作:动作导致环境变化,新状态反馈给智能体。因此,严谨的定义应是:Action Conditioned 的 Next State Prediction。缺少动作前提的状态预测,不符合强化学习需求。
▎AI 科技评论:Sora 等视频生成模型常被称作世界模型,按您的标准是否成立?
张磊:源自强化学习的 world model 旨在帮助智能体有效交互。纯视频生成模型(如早期 Sora)本质是生成自洽视频序列,预测像素变化,未建模“动作”,故不能称为世界模型。它虽能学到部分世界规律,但难以直接助力机器人与环境交互。
▎AI 科技评论:近期热门的 World Action Model (WAM) 是否属于此类?
张磊:WAM 利用预测未来画面辅助改进动作预测,性能优异。但其建模逻辑是“先果后因”,先生成画面再反推动作,无法用于强化学习,因此也不符合此处讨论的世界模型定义。
04
像素派 vs 隐空间派:殊途同归,表征为王
▎AI 科技评论:LeCun 代表隐空间派,Sora 代表像素派,两条路线看似对立,您如何评价?
张磊:两条路线实则共性大于差异。
像素路线(如 Stable Diffusion、Sora)同样需将图像压缩至低维表征空间处理。真正的分歧不在于是否使用隐空间,而在于进入隐空间后保留什么、丢弃什么。
隐空间路线试图排除光影纹理等非物理驱动细节,以学习本质规律,但面临表征坍塌风险;像素路线追求视觉逼真,本质是迎合人类视觉敏感点。
▎AI 科技评论:人脑推演似乎也在隐空间进行,不以画质为评判标准?
张磊:没错。人脑想象动作后果是在隐空间操作,而非逐像素渲染。因此,以人眼画质判断世界模型优劣是不充分的。像素路线若要成为世界模型,核心应追求视频序列的物理合理性,而非单纯逼真。
▎AI 科技评论:您与 LeCun 同走隐空间路线,但强调“引入物体结构”,差异何在?
张磊:我们共享第一性原理:反事实推理应在抽象表征中进行。LeCun 通过 JEPA 系列验证了预测应发生在表征空间。但在具身方向,物理空间复杂度极高,需在隐空间中引入必要结构。
基于 DINO-X 已解决的开放世界“看见物体”能力,我们主张让物体成为世界模型预测与规划的基本单元。物理规律作用于物体,让隐空间表征理解物体,能更高效地学习物理规律。
▎AI 科技评论:面对 LeCun 团队的巨额投入,您的“物体结构”改进优势何在?
张磊:DINO-X 已将“理解物体”做到全球最佳。我们在 LeCun 的基础框架上引入物体结构,并具备在真实环境闭环的能力,这是过去几年积累的核心壁垒。
05
DINO 系列何以力压谷歌与 Meta?
▎AI 科技评论:Grounding DINO 及 DINO-X 力压国际巨头,被全球顶尖机构标配,成功秘诀何在?
张磊:主要体现在两个维度。
范式上,我们是视觉领域首个将 Transformer 检测做到 SOTA 的团队。Grounding DINO 引入语言模型范式,首次将物体检测拓展至开放域,不再局限于训练类别,实现了范式级突破。
策略上,我们转向闭源路线推进 Scaling,并坚持高标准。团队耗时一年多打磨 Grounding DINO 1.5 及 DINO-X,确保发布即是大版本突破,从而获得行业高度认可。
▎AI 科技评论:视觉大模型与世界模型有何关联?
张磊:工作一脉相承。此前做物体感知旨在为机器人提供感知基础,Grounding DINO 已被广泛用于解决具身环境理解问题。世界模型偏视觉原生,团队在视觉模型机理上的深厚积累,是持续迭代世界模型的信心来源。
从 DINO 系列模型到世界模型的进化路线
06
如何让 AI 真正“看见”物体?
▎AI 科技评论:现有隐空间方案往往不真正理解物体,如何验证模型是否真的“理解”?
张磊:理解难以直接验证,通常通过行为表象判断。我们会分析中间步骤的可视化结果,若与人类直觉一致,则说明可能捕捉到了物体结构。
AI 科技评论:有无具体测试方法?
张磊:反事实测试行之有效。让模型尝试不同动作,观察结果是否符合物理规律。若轨迹微调仍能做对,说明学到了规律;反之则可能仅学到统计相关性。
简洁的范式更具迭代力量。过多人为设计短期有效,长期却会阻碍进化。
▎AI 科技评论:流沙、水流等非刚性物体无清晰边界,“物体为中心”框架是否会受限?
张磊:技术上可从 Mask 切入,分割物体区域像素。视觉领域在语义理解和 Mask 预测上已成熟,足以处理非刚性物体。我们在通用物体感知上的积累,为此提供了坚实基础。
07
EgoTwin:以人手教手机器人
▎AI 科技评论:“动作对齐”概念将不同构型动作映射至同一隐空间,是否类似为机器人做翻译?
张磊:世界模型输入包含画面与动作,动作理解至关重要。人手与机械臂对齐难度大:机械臂坐标精确,而人手数据多为 2D 视频。
我们的做法是提取 3D 关键点,将人手 2D 视频转化为 3D 操作序列,与机械臂数据对齐至同一物理空间。发布的 EgoTwin 即解决此类数采问题,目前已与百度云团队合作。
▎AI 科技评论:人类视频中隐含的“意图”信息如何处理?
张磊:高层意图理解交由世界模型或 VLA 解决,前提是数据质量足够高。数据原料至关重要。行业虽投入巨大,但利用效率常不理想。核心经验是让懂算法的人深入做数据,确保采集数据可用于训练,实现算法与数据并行迭代。
08
张钹与沈向洋:两位导师,一种底色
▎AI 科技评论:张院士与沈向洋院士对您影响深远,他们分别给予了您什么?
张磊:张钹院士永远是导师与榜样。他对新技术充满好奇,强调“理解东西要理解透"。理解不透会被骗,理解透才知底层原理。这已成为我带学生的准则。
沈向洋院士影响了我整个职业道路。从赴美到归国,他在产业方向判断、团队构建及融资等方面给予了具体建议与经验分享。
▎AI 科技评论:90 岁高龄的张钹老师仍赴团队交流,令人动容。
张磊:是的。去年 11 月,张老师上午讲课,下午便与我们团队深入交流至晚间。他视野广阔,逻辑缜密,对通用视觉与机器人方向的建议极具价值,思维深度不输年轻人。
09
浪潮自来:坚守者终被时代选中
▎AI 科技评论:历经多波技术浪潮,是否有某个时刻让您坚定“这就是我要做的”?
张磊:物体检测工作的突破性进展令我自豪。而世界模型更是值得全力投入的方向,借鉴强化学习与语言模型的成功范式,它将深刻影响 AI 行业。
▎AI 科技评论:研究者常谈高光,少提低谷。您经历过技术低谷吗?
张磊:2018 年前后,我尝试用弱监督数据做物体检测,耗时良久未果。后转至 IDEA 结合语言理解与检测能力,借 ChatGPT emergence 之势,从另一角度解决了问题。
遇到挫折正常,关键要有死磕难题的狠劲。真正的好问题值得思考多年,终将在某刻涌现质变式突破。
▎AI 科技评论:如何看待本科生创业世界模型的“后浪”现象?
张磊:开源技术降低了门槛,年轻人无包袱,易接受新范式。但解决真问题仍需前辈的洞察力与把控力。
社会热点万变,唯最能干的人永恒。只要保持好学、基础扎实,最前沿的方向自会主动找你。
10
启示:理解透的力量
此次采访最触动人心之处,并非耀眼成就,而是张磊反复提及的词:“理解透”。
三十年前,清华园里,本科生张磊在调试 AGV 小车,导师张钹坐在身旁指点:“改一改参数,看看会发生什么。”那不是检查作业,而是对未知的好奇与探索。
“理解不透就会被骗,理解透了才知道底层原理。”这句话浓缩了中国一代科研人的精神传承。
2018 年,面对弱监督检测难题,张磊未曾换题,而是吃饭睡觉都在思考,直至 2022 年底借语言模型之力实现突破。从 AGV 到世界模型,三十年间,他对每个问题都追求彻底理解,正如乔布斯所言"connect the dots"——认真做过的事,终将串联成线。
2025 年底,90 岁的张钹飞抵深圳,下午扎进视启未来办公室,听学生讲述世界模型进展。三十年时空流转,场景重现:昔日老师指导学生,今日学生汇报成果。
张钹院士在视启未来,张磊给老师讲述研究进展
人会老去,潮水会退,热点会冷,但中国科研人将世界难题“理解透”的执念,从未改变。


