
上月,中国 AI 大模型引发全球关注。Kimi K3 与 DeepSeek-V4-Flash 凭借极致性价比,在性能对标国际顶尖模型的同时,大幅降低算力成本,推动行业格局重塑。
这些模型背后的 MoE(混合专家)架构虽提出已久,但在视频生成领域长期未能突破。如今,由清华特奖得主曹越领衔的 Sand.ai 团队正式发布并开源 MAGI-2 Preview,成功将 MoE 架构应用于音视频统一生成。

MAGI-2 Preview 是全球首个开源的千亿级 MoE 统一音视频生成模型。其总参数量高达 1140 亿,但单次前向计算仅激活 60 亿参数,推理成本仅为当前主流模型的十分之一。
不只是「让图片动起来」
MAGI-2 Preview 在视频生成的动态表现、角色表演及电影质感上实现了显著突破。
在中景演示中,模型能精准捕捉人物舞步、衣摆流动与环境声的咬合,情绪转换自然;在人物特写中,极近镜头下的微表情、口型与呼吸协调一致;在电影感场景中,雨滴、倒影与冷暖光影交织,营造出真实的叙事氛围。

从高保真音画同步到电影级运镜,MAGI-2 Preview 实现了声音、画面与情绪的统一生成,让 AI 视频具备真正的表演张力。
114B 的容量,6B 的账单
传统 Dense 模型在视频生成中面临 Token 密度高、算力成本激增的瓶颈。Sand.ai 团队选择 MoE 架构作为 Scaling 路径,通过“按需激活”机制,在扩大模型容量的同时控制计算量。

MAGI-2 Preview 采用了创新的“超细粒度 MoE"(Ultra-fine-grained MoE)结构。它将表示向量拆分为多个子空间,每个子空间独立选择专家。这种设计使得模型能针对同一 Token 的不同特征维度组合出更丰富的处理能力,而非简单地在“调用”与“不调用”间做单选。

千亿级 MoE 到底怎么跑起来?
细粒度 MoE 带来的挑战在于通信开销。传统“先路由、再通信”的模式会导致数据搬运量随激活专家数线性增长,成为性能瓶颈。
Sand.ai 提出了"Head Parallel"策略,将顺序反转为“先通信、再路由”。在路由发生前,按头分发固定形状的表示到各设备,使跨卡通信量保持恒定,不再受输入变化影响。

配合自研的高性能算子库 MagiMoE 和分布式优化器 MagiMuon,团队成功构建了从模型结构、通信机制到参数更新的完整系统路线,确保数千个细粒度专家能真正学到差异化能力。
画面和声音,是一起长出来的
区别于行业常见的“先生成视频再配乐”的分段式方案,MAGI-2 Preview 采用单流音视频架构。文本、视频和音频在同一上下文中通过 Self-Attention 直接交互,共享专家学习多模态共性,专属专家处理模态差异。

这种原生统一的生成方式,确保了口型、动作重音与环境声在生成第一步即被共同建模,实现了真正的音画同步。
榜单和账单,一起算
在性能与成本的双重考量下,MAGI-2 Preview 表现优异。其在 Artificial Analysis 图生视频榜单中位列第六,Elo 得分 1106,以约 6B 的激活参数量跻身顶尖闭源模型行列。

成本方面,基于 8 卡 H100 折算,生成 10 秒视频成本约为 0.5 元,仅为行业主流价格的十分之一。MoE 架构从理论设想走向大规模视频生成应用,标志着语言模型的发展路径正式在视频领域复现。

编辑:摩西 大卫

