作者|琪琪
编辑|星奈
媒体|AI大模型工场
今年,世界模型突然从学术圈火到了产业圈。
2026 WAIC的第三天,昆仑万维在上海西岸组了一场局,主题就是世界模型与多模态范式跃迁。

作为最早押注世界模型赛道的公司之一,昆仑万维这次不只办了个论坛那么简单,而是把这条技术路线的整条链路摆到了台面上:从底层的Matrix世界模型,到中层的Mureka音乐创作,再到黎曼动力的机器人大脑。
世界模型不再是一个抽象概念,它正在成为AI行业的下一个关键变量。
昆仑万维选择在这么一场国家级AI盛会上讨论的,不是参数量的军备竞赛,不是多模态的跑分榜,而是一个更底层的东西,AI什么时候才能真正理解物理世界。
方汉的回答斩钉截铁:就今年。2026,是世界模型元年。
过去两年,AI在卷生成,文字、图像、视频、音乐,天花板半年一换。但方汉认为,从2026年开始,核心命题变了。将从生成,转向理解与交互。世界模型,是这道题的解法。

为什么说今年是世界模型元年
方汉在台上讲了三个判断。
第一个,也是最核心的一个,世界模型不能永远困在屏幕里。
具身智能正在走出实验室,但一个机器人在真实环境里行动之前,它得先在脑子里过一遍。预判自己的动作会导致什么后果,环境会怎么变,下一步该怎么调。方汉原话是,谁能在复杂场景下让模型做到看得懂、做得对,谁就拿到了物理智能时代的入场券。
这话放在半年前,可能还是愿景。但论坛当天的两个进展,把这句话落到了实处。
一个是黎曼动力机器人发布的Riemann-1.0,一款机器人大脑模型。它的设计思路跟别人不一样。不是分开做视频生成和动作生成,而是在同一个模型里联合输出两者,让视觉和动作的信息互相流动。

黎曼动力创始人刘扬发布Riemann-1.0
其实挺好理解的。机器人需要一个模型告诉它该做什么动作,同时还得推理这个动作做完之后环境会变成什么样。把这两个问题拆开解,信息就断了。放在一起解,模型才真正学会了"看到,想到,做到"的闭环。
训练策略上,黎曼1.0采用了"三步走"。先拿20万小时以上的人类第一视角数据,让模型建立对物理世界的基本直觉。再叠加物理仿真数据,专门打磨手部动作控制。最后用高质量的真实机器人数据做多任务泛化。结果是在多个国际主流基准和真实机器人任务上,仿真和真机两端同时跑出了最好的成绩。
另一个进展来自Reactor Technologies的CEO Alberto Taiuti。他说世界模型正在经历一次本质上的跃迁。从静态、高延迟、无状态的媒体生成,变成有状态、实时交互、能推演因果的东西。它不再只是生成一张图或一段视频,而是能持续推演环境变化、与人双向互动的生成式软件雏形。
方汉的第二个判断指向游戏行业。他说游戏行业会被世界模型第一个掀翻。
过去做一个开放世界,几百号人搭好几年。未来呢,虚拟世界跟着玩家的每一步实时生长、持续演化。他的说法是,三到五年之内,世界模型会成为游戏行业的水电煤,彻底刷新内容生产方式。而国产模型已经跑在前面了。
第三个判断指向内容消费端。AI视频、AI音乐,会从技术试验品变成大众创作工具。
这个判断背后有两层意思。第一层是技术层面的,当AI音乐不再有塑料味,当AI视频能保持人物一致性,工具本身的障碍就消除了。第二层是产业层面的,创作门槛一旦降下来,被释放的不是AI的生产力,而是人的表达欲。
Mureka作为目前国内最强、全球前两名的音乐生成模型,第一个做的事就是把AI塑料味去掉,让普通人能把一个模糊的想法变成一首有温度的歌。但这不是替代音乐人,而是大幅降低创作门槛,让更多人的表达得以释放。
方汉在圆桌上说了个词“人人如龙”。这是他描述昆仑万维愿景的用词。意思是人人可以做歌,人人可以表达自己。创作不再是少数人的特权,而是人人都可以触及的基本能力。这个愿景很大,却也很值得期待。

昆仑万维董事长兼CEO方汉出席圆桌论坛
但"元年"之所以敢叫元年,不能光靠发布会上的判断。
南京大学副校长、中科院院士周志华在大会开场先纠正了一个特别普遍的误解。很多人以为具身智能就是人形机器人。其实并不是。只要AI算法加载到硬件身体里面,扫地机器人也好,工业机器人也好,甚至挖掘机加上了AI,都算是具身智能。

中国科学院院士、南京大学副校长周志华主旨演讲
目前具身智能在封闭环境已有了不错的方案,但一到开放环境就不行了,训练数据跟实际工作场景可能完全对不上。这也就是为什么我们需要世界模型。
但周志华关心的世界模型,跟我们熟悉的视频生成、图像理解不同。他把它分成了三层:最底层的感知层,精准感知世界;中间的理解层,理解视频图像中的事件逻辑;最上面的决策层,基于世界理解做出好的决策。其中最难、也最有挑战性的,是决策层的世界模型。
他认为决策不需要全局精确,关键节点精细就够了,其余地方粗一点无所谓。但决策型世界模型最微妙的地方就在于,它允许模糊。
但学术界长期以来基本默认这条路走不通,认为决策型世界模型几乎不可能学好。MIT教授Michael Kearns有个经典证明,说这类模型的误差是平方级累积的。推演100步,误差放大一万倍。
“所以大家都不碰。觉得想都不要想。''
但周志华团队做了一个很巧妙的突破。
Kearns证明成立的前提,是你关心每一步的精确状态。但如果换个思路,我根本不关心中间每一步呢。打个比方,战斗机飞出去执行任务,你真正在意的是它最后能不能平安飞回来。中间它拐了几个弯,在哪个位置抖了一下,你其实不在乎。
于是,基于这个思路,他的团队发展出一套分布匹配技术。原来的平方级误差直接消解成了线性放大。推演100步、1000步、10000步,误差都只按线性增长。这给决策型世界模型提供了最基本的可行性支撑。
还没完。他的团队还解决了少量样本泛化的问题。DeepMind曾经在论文里判定这事完全不可能,但周志华团队通过逆用贝尔曼方程,把样本复杂度降到了根号T分之一。原来需要100份样本才能学好的东西,现在10份就够了。
有了理论撑腰,用少量数据构建一个靠谱的决策型世界模型,不再是天方夜谭。

落地的两把钥匙:一个让世界模型有了记忆,
一个让AI音乐学会了留白
那元年该如何兑现。昆仑万维在论坛上发的模型,就是对这个问题的回答。
Skywork首席科学家成宇发布了Matrix-Game 3.5。这个版本解决了一个困扰世界模型很久的问题——记忆。

Skywork首席科学家成宇发布Matrix-Game 3.5
以前的办法很简单粗暴。记住最近几帧画面,据此推下一帧。但问题也很明显,相机一转,刚才看到的东西就"忘"了。画面之外的场景,模型毫无概念。
Matrix-Game 3.5,做了一个创新。它把历史帧切成无数个带3D坐标的Patch,通过深度和位姿信息把它们抬到世界坐标系里。推理的时候,根据当前相机能看到什么角度,把相关的Patch检索出来,重新拼成一幅马赛克图,作为记忆信号塞进生成模型。
你可以这样理解。以前模型记住的是几张照片。现在它记住的是一个由无数小碎片组成的3D空间。它知道东西放在哪,也记得自己从哪个方向过来的。从记几帧画面到记住一个空间,这是质变。
成宇还透露,Matrix-Game 3.5已经搭了三条自动化的数据生产线,攒了超过500万高质量视频切片,覆盖1200多个游戏场景,训练时长超过1万小时。说白了,这是在给具身智能造一个不用去真实世界就能源源不断生产训练数据的引擎。
另一个引发强烈反响的发布,来自音乐赛道的Mureka v9.5和O3。
Mureka V9.5主打一个真实感,不再像以前那样把每个音符填满,而是像真正的音乐一样留白、停顿、表达情绪。

Skywork首席科学家成宇发布Mureka v9.5 & O3
这事说起来简单,但其实是个挺根本的问题。市面上大多数AI音乐,编配很复杂,声部叠得很满,第一耳朵听着好厉害,但再听就觉得不对劲。问题出在扩散模型的机制上。它本质上是把所有样本往平均值拉,什么东西都给你拉到一个"还行"的位置,那就变成了"还行"但没有灵魂。
v9.5的做法可以概括为一个字:收。 在真实的音乐框架里,更克制地处理编配、人声、情绪和对用户意图的理解。不是我能堆多少就堆多少,而是这首歌到底需要什么我就给什么。
O3则在此基础上引入了反思机制。这个我觉得特别有意思。
大多数AI生成模型的工作方式是一锤子买卖。开了头就顺着往下走,写完拉倒。O3不一样,它在生成的过程中会反复停下来问自己几个问题:这一段旋律还在为整首歌服务吗?编配是不是把人声压住了?情绪的高潮是不是来早了?整体结构有没有跑偏?发现问题就回头修,修完再继续。
多出来的那点推理算力,没花在内容上,而是花在检查上。指令精准度从6.92拉到7.62。AI头一回在做创作的时候,学会了自己给自己当审稿人。
产品形态也在变。Mureka早已不是输入一句词、吐出一首歌的简单工具。同一个灵感可以快速衍生出好几个版本摆在一起比,哪段旋律满意就留着,哪段人声不满意单独换掉。用一段录音、一张照片就能捏出一个专属歌手,从唱歌到MV一路贯穿。
甚至在Agent模式下,用一句自然语言对话,就能把整曲生成、分轨拆解、Remix、MIDI导出、声音克隆这些活儿全串起来,不用在几个工具之间来回切换。从一个模糊的想法,到歌词、人声、角色、整首歌、MV,整条链路被收进了一个对话框里。
昆仑万维在世界模型元年写了第一笔
从2022年的All in AGI与AIGC,到2026年的世界模型元年,整整四年。
昆仑万维完成了从文字、图像、视频、音乐全模态生成能力,到现在把世界模型从能看推到能交互、能决策、能记住空间的关键一跳。先让AI学会表达,再让AI学会理解。在这两个方向上,昆仑万维确实跑在了前面。
但回看整场论坛,我们发现,五年前的WAIC,人们在聊AI到底能做什么。三年前在聊AI做得有多好。而今年,它把一个问题推到了所有人面前:AI能不能开始理解。
不是理解语法,而是理解重力的方向、事情的因果、一个物体在空间中的运动法则。
这是从语言模型到世界模型的一步跨越。不大,但很重。却也标志着属于我们的世界模型元年的故事,才刚刚开始。

■ 商汤日日新、腾讯,昆仑万维 ▍ 金融大模型案例
■ 盘古大模型,中国电信,医联 ▍医疗大模型案例
■阅文大模型,腾讯音乐大模型 ▍ 文娱大模型案例
■知乎,360大模型,火山引擎 ▍ 教育大模型案例
■ 网易,金山办公大模型 ▍ 更多行业大模型案例
上次介绍“不听劝”的印奇押注Agent手机,真正想赢的是什么?
本文由大模型领域垂直媒体「AI大模型工场」
原创出品,未经许可,请勿转载。
/
欢迎提供新的大模型商业化落地思


