大数跨境

清华校友出手!视频界首个千亿MoE开源,6B激活挤进全球第6

清华校友出手!视频界首个千亿MoE开源,6B激活挤进全球第6 新智元
2026-08-06
3
导读:算力有边界,中国AI没有

上月,中国 AI 大模型引发全球关注。Kimi K3 与 DeepSeek-V4-Flash 凭借极致性价比,在性能对标国际顶尖模型的同时,大幅降低算力成本,推动行业格局重塑。

这些模型背后的 MoE(混合专家)架构虽提出已久,但在视频生成领域长期未能突破。如今,由清华特奖得主曹越领衔的 Sand.ai 团队正式发布并开源 MAGI-2 Preview,成功将 MoE 架构应用于音视频统一生成。

MAGI-2 Preview 是全球首个开源的千亿级 MoE 统一音视频生成模型。其总参数量高达 1140 亿,但单次前向计算仅激活 60 亿参数,推理成本仅为当前主流模型的十分之一。

不只是「让图片动起来」

MAGI-2 Preview 在视频生成的动态表现、角色表演及电影质感上实现了显著突破。

在中景演示中,模型能精准捕捉人物舞步、衣摆流动与环境声的咬合,情绪转换自然;在人物特写中,极近镜头下的微表情、口型与呼吸协调一致;在电影感场景中,雨滴、倒影与冷暖光影交织,营造出真实的叙事氛围。

从高保真音画同步到电影级运镜,MAGI-2 Preview 实现了声音、画面与情绪的统一生成,让 AI 视频具备真正的表演张力。

114B 的容量,6B 的账单

传统 Dense 模型在视频生成中面临 Token 密度高、算力成本激增的瓶颈。Sand.ai 团队选择 MoE 架构作为 Scaling 路径,通过“按需激活”机制,在扩大模型容量的同时控制计算量。

MAGI-2 Preview 采用了创新的“超细粒度 MoE"(Ultra-fine-grained MoE)结构。它将表示向量拆分为多个子空间,每个子空间独立选择专家。这种设计使得模型能针对同一 Token 的不同特征维度组合出更丰富的处理能力,而非简单地在“调用”与“不调用”间做单选。

千亿级 MoE 到底怎么跑起来?

细粒度 MoE 带来的挑战在于通信开销。传统“先路由、再通信”的模式会导致数据搬运量随激活专家数线性增长,成为性能瓶颈。

Sand.ai 提出了"Head Parallel"策略,将顺序反转为“先通信、再路由”。在路由发生前,按头分发固定形状的表示到各设备,使跨卡通信量保持恒定,不再受输入变化影响。

配合自研的高性能算子库 MagiMoE 和分布式优化器 MagiMuon,团队成功构建了从模型结构、通信机制到参数更新的完整系统路线,确保数千个细粒度专家能真正学到差异化能力。

画面和声音,是一起长出来的

区别于行业常见的“先生成视频再配乐”的分段式方案,MAGI-2 Preview 采用单流音视频架构。文本、视频和音频在同一上下文中通过 Self-Attention 直接交互,共享专家学习多模态共性,专属专家处理模态差异。

这种原生统一的生成方式,确保了口型、动作重音与环境声在生成第一步即被共同建模,实现了真正的音画同步。

榜单和账单,一起算

在性能与成本的双重考量下,MAGI-2 Preview 表现优异。其在 Artificial Analysis 图生视频榜单中位列第六,Elo 得分 1106,以约 6B 的激活参数量跻身顶尖闭源模型行列。

成本方面,基于 8 卡 H100 折算,生成 10 秒视频成本约为 0.5 元,仅为行业主流价格的十分之一。MoE 架构从理论设想走向大规模视频生成应用,标志着语言模型的发展路径正式在视频领域复现。

编辑:摩西 大卫

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16466
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读339.9k
粉丝0
内容16.5k