大数跨境

这个新开源的世界模型只有1.3B,单卡就能实时跑!

这个新开源的世界模型只有1.3B,单卡就能实时跑! 量子位
2026-09-10
3
导读:轻量版LingBot-World 2.0
金磊 发自 凹非寺
量子位 | 公众号 QbitAI

大火的世界模型,真的无法在消费级显卡上运行吗?答案是否定的。

就在刚刚,一款国产开源世界模型实现了这一突破。

首先是第一人称射击场景演示:

在雪地科幻场景中,角色移动、转向并开火,实时呈现爆炸、火焰及能量护盾等反馈。关键在于,所有变化均发生于同一持续生成的世界中,场景随操作动态延伸。

其次是热门游戏《奥德赛》风格场景:

切换至第三人称视角,角色在巨型木马、城墙与火光间探索。随着移动,近处人物、地面纹理及远处建筑持续展开,空间关系保持高度一致。

再看一种截然不同的风格:

三个 Demo 展示了三种迥异的世界形态。支撑这些效果的,是蚂蚁灵波于今年 7 月开源的LingBot-World 2.0

此次发布的是该模型的轻量版,参数量仅1.3B。它专为消费级单卡 GPU 设计,支持本地实时生成世界。

今年 7 月开源的 LingBot-World 2.0 主模型参数量为 14B,已具备小时级持续生成能力,支持丰富动作与事件交互,在特定配置下可实现 720p/60fps 高清实时体验。当时,论文摘要中便已埋下"1.3B"的伏笔。

上周的 IFA 柏林消费电子展开幕演讲上,AMD 高级副总裁 Jack Huynh 点名了包括智谱、千问及 LingBot-World 在内的三个开源模型。他现场演示了 LingBot-World 2.0:通过一个 Prompt 生成世界后,角色可在中国小镇、欧洲乡村等环境中长时间探索互动,场景随交互持续演进。

Jack Huynh 对此评价道:"This is the future of Personal AI."

承诺今日兑现。相比再次开源的动作,更值得探讨的是:能在本地实时运行的世界模型,究竟是如何实现的?

不只是变小了那么简单

理解这一点,需先厘清世界模型与普通视频生成的区别。

传统 AI 视频生成通常输入 Prompt 后等待数十秒至数分钟,模型一次性输出完整视频。而世界模型则是生成一个持续演进的世界:用户每前进一步或转变视角,模型需即时响应并延续生成。

7 月发布的 LingBot-World 2.0 虽已实现超一小时不间断生成,涵盖水乡、城市、雪地至太空等多种场景,且保持结构稳定与画质清晰,但其背后依赖繁重的工程栈:编译器级注意力 Kernel 优化、动态 KV 缓存调度、异步流媒体传输及混合并行推理策略等,旨在确保高质量实时运行。

此前,大众接触世界模型仅限于观看官方视频或在线 Demo。1.3B 版本的核心目标,便是在有限算力下实现本地运行

从 14B 到 1.3B,并非简单裁剪大模型,而是基于一条完整的训练路线自然衍生。团队首先训练了名为Causal World的模型。所谓"Causal",指模型生成当前状态时,仅依赖过往视觉信息与用户输入,无法预知未来,符合因果逻辑。

然而,自回归模型易将自身生成结果作为后续输入,微小误差会随时间累积,导致长时生成中出现纹理模糊、几何变形甚至场景漂移。

为此,LingBot-World 2.0 引入MoBA(Mixture of Bidirectional and Autoregressive Attention Mask)。它在传统 Teacher Forcing Mask 中加入双向注意力机制,相当于增加一层正则化,使模型适应不同视频长度,缓解过拟合与画质退化问题。

这一阶段训练出的 Backbone 奠定了世界模型的基础能力。对比测试显示,在 5 秒至 60 秒的长时生成中,LingBot-World 2.0 在纹理、几何结构及场景连贯性上表现更为稳定。

但高质量 Backbone 存在速度慢的问题:作为 Teacher,其每帧需多步去噪,计算成本过高,难以直接用于实时交互。

因此,团队进行了两步蒸馏优化:

第一步是一致性蒸馏(Consistency Distillation),将 Teacher 的多步去噪轨迹压缩至少数几步,让学生模型(Student)以更少计算量完成生成,同时保留动作条件动态能力。

第二步引入分布匹配蒸馏(DMD, Distribution Matching Distillation),让学生在自身的长时 self-rollout 轨迹上继续训练。这意味着模型在训练阶段便提前“预见”实际运行中可能遇到的状态,从而减少长时自回归过程中的累计漂移。

至此,研发链路完全打通:通过 Causal Pretrain 构建稳定底座,由 Teacher 提供高质量生成,再经蒸馏压缩计算步骤,最后让学生模型适应真实运行状态。

表面看是新增小尺寸版本,实质上蚂蚁灵波开放了 LingBot-World 2.0 的核心研发路径。

世界模型的门槛也要被打下来了

回顾 LingBot-World 一年的发展,核心始终围绕降低门槛

  • 今年 1 月,LingBot-World 1.0 首次开源,解决“能否做出来”的问题;
  • 7 月,14B 版本的 2.0 挑战小时级生成、复杂交互与 720p/60fps 实时体验,解决“能否做得久、做得真”;
  • 今日,1.3B 版本推动世界模型登陆消费级单卡,解决“能否让更多人跑起来”。

此次同步开源 Causal Pretrain 与双向 Teacher 模型,延续了同一逻辑:小模型降低运行门槛,上游模型则赋能社区进行后训练、蒸馏、压缩及垂直场景适配。

若说世界模型的上半场比拼生成时长与真实度,下半场的关键则在于能否让普通人的显卡跑得动。

AI 技术发展史反复证明:真正推动技术普及的,往往不是最强版本,而是首个足够小巧、廉价且易于尝试的版本。

当世界模型试图将 AI 装入无限延展的世界时,如今随着门槛降低,这个世界终于能够装进普通人的显卡之中。

官网:
https://technology.robbyant.com/lingbot-world-v2

模型:
https://huggingface.co/collections/robbyant/lingbot-world-v2

代码:
https://github.com/robbyant/lingbot-world-v2

论文:
https://arxiv.org/pdf/2607.07534

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16433
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读417.0k
粉丝1
内容16.4k