大数跨境

114B参数、6B激活,Sand.ai刚刚把全球首个千亿MoE视频生成模型开源了

114B参数、6B激活,Sand.ai刚刚把全球首个千亿MoE视频生成模型开源了 量子位
2026-08-05
2
导读:10秒1080P,成本只要5毛钱

大模型的价值最终需经行业验证。近日,一支清华系团队 Sand.ai 推出最新力作 MAGI-2-preview,率先将 MoE 架构应用于视频生成领域,实现千亿参数规模并完全开源代码与权重。

该模型在 AI 漫剧生成、长镜头运镜及商业场景应用中表现卓越,其运镜、对焦及人物表现力已具备与闭源第一梯队模型抗衡的实力。

MAGI-2-preview 总参数量达 114B,单次前向推理仅激活约 6B 参数。基于当前 8 卡 H100 行情,生成一段 10 秒 1080P 视频的成本约为 0.5 元,仅为行业主流模型的十分之一。在 AA 视频生成榜单中,该模型排名第六,以极低的激活参数量逼近顶尖水平。

视频模型 Scaling 不能照抄 LLM

视频生成模型的 Scaling 路线面临独特挑战。与处理离散 Token 的文本模型不同,视频模型需处理动态世界,每一帧包含大量空间 Patch,连续帧还需记录动作、物体关系及镜头变化,叠加多模态信息后序列长度剧增。若沿用稠密模型,训练与推理成本将难以承受。

“模型更大、视频更长、成本可控”构成了视频生成的“不可能三角”。MoE(混合专家)架构通过解耦模型容量与计算量提供了理论解法,但在视频领域落地面临通信瓶颈与训练稳定性两大难题。传统专家并行机制在超长序列下会导致通信成本激增,且动态路由与多模态数据使得训练难度成倍放大。

Sand.ai 成为首个将视频 MoE 从理论推向千亿参数实践的团队,其核心在于从底层重构了技术架构。

让千亿 MoE 模型真正跑起来

MAGI-2-preview 的成功依赖于架构创新与系统优化的协同。

单流架构与共同建模

模型延续并优化了单流架构,文本、视频和音频进入同一 Transformer,在每一层自注意力机制中直接交换信息。这种从底层开始的音画共同建模方式,比传统的交叉注意力拼接更能捕捉细微的音画对应关系,同时天然适配 MoE 扩展,显著降低了延迟与维护成本。

极致细粒度的专家设计

模型采用 Multi-Head LatentMoE 思路,将隐藏表示拆分为多个低维 Head 并独立路由。在 36 层网络中,每层包含 3072 个独立专家单元,每个 Token 合计激活 72 个小专家。这种细粒度分工使模型能组合出更丰富的能力,专家数量远超主流 MoE 大模型。

自研 Infra 与并行策略

为支撑细粒度专家,团队自研 MagiMoE kernel 库,优化路由、排序及计算链路,减少显存搬运。重新设计的 Head Parallel 并行策略在路由前分配计算,确保通信量不随激活专家数波动,有效突破长序列瓶颈。此外,优化器采用混合设计,针对不同性质参数匹配更新节奏。

数据组织与训练分工

在数据策略上,模型从“删减”转向“组织”,扩大有效数据规模并通过精准标注强化场景、动作与声音的对应关系。预训练侧重覆盖数据分布,后训练则专注于偏好对齐、可控性及安全性,形成完整的 Scaling 系统。

开源不只是「秀肌肉」

MAGI-2-preview 的开源将改变行业游戏规则。对于研究者,这是首个可深入剖析的千亿级视频 MoE 模型,为学术界提供了宝贵的研究基础设施。对于企业,开源意味着私有化部署与行业微调成为可能,尤其满足金融、医疗等敏感行业的数据本地化需求。

从行业维度看,开闭源的竞争将从单纯的效果比拼,延伸至模型可训练性、接口控制权及开发者生态的全面较量。随着开源模型效果持续逼近闭源,两条技术路线将在更多层面正面碰撞。

Sand.ai 团队由清华大学特等奖学金获得者、Swin Transformer 共同一作曹越领衔,成员多为顶尖技术背景。团队坚持押注基础模型与底层 Infra,被李开复誉为"AI 视频生成界的 DeepSeek"。

MAGI-2-preview 不仅是一次技术发布,更是对视频模型发展路径的有力探索。它证明了千亿级 MoE 架构同样适用于视频生成领域,为行业提供了新的验证方向。

开源地址:https://github.com/SandAI-org/MAGI-2-preview

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16363
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读364.6k
粉丝1
内容16.4k