大数跨境

ZPedia|千亿参数只花 6B 的账,Sand.ai 要改写视频生成的成本曲线

ZPedia|千亿参数只花 6B 的账,Sand.ai 要改写视频生成的成本曲线 Z Finance
2026-08-05
5
导读:视频生成 scaling 跑出新路线

AI 视频创作者手中都有一本共同的账:一条十秒成片背后,往往经历数十次生成、筛选与修改。相比模型在发布会上展示的惊艳 Demo,创作者更关注实际生产中的可用率与单位成本。

行业共识认为视频模型需持续扩大规模,但视频包含大量连续画面,展开为 Token 后涉及空间 Patch 与连续帧的堆叠,叠加音视频与反复生成,计算开销远超普通内容模型。参数翻倍往往意味着每秒成本同步倍增。

Sand.ai 最新发布的 MAGI-2 Preview 给出了新解法:模型总参数约 114B,单次前向计算仅激活约 6B,并将文本、视频和音频纳入同一 Transformer 架构,实现音画同源生成。

在第三方评测机构 Artificial Analysis 的视频生成榜单(Image to Video,含音频)中,MAGI-2 Preview 以 1106 的 Elo 分数位居第六。

Artificial Analysis 视频生成榜单(Image to Video,含音频):MAGI-2 Preview 排名第六(来源:Artificial Analysis)

这款全球首个千亿开源 MoE 模型,能否让视频模型摆脱“能力越强、每秒越贵”的增长曲线?

视频生成需要重构成本账

当 AI 视频进入规模化生产阶段,行业面临现实约束:既要抬升模型能力天花板,又不能让每秒生成成本随参数量膨胀。

稠密模型的扩展逻辑朴素却昂贵:增加层数、宽度和中间维度导致每个 Token 均需经过全部参数。视频模型序列极长,包含大量空间 Patch、连续帧及音视频信息,计算与通信代价被成倍放大。沿用文本模型的 Scaling 老路,在视频领域将导致成本高企。

Sand.ai 创始人曹越指出,在 Dense 架构下继续 Scale Up 会导致成本直线上升。视频模型存在“成本、速度、效果”的不可能三角,突破关键在于采用 MoE 架构。2025 年 11 月,Sand.ai 率先将模型架构从稠密转向 MoE,旨在解耦容量与成本。

MAGI-1 的分块自回归生成流程:视频被拆成 24 帧一组的 chunk 逐块生成,长序列是视频模型绕不开的约束(来源:SandAI-org/MAGI-1 GitHub 仓库)

MAGI-2 Preview 构建了新的成本结构:以约 114B 参数容纳能力,每次计算仅调用约 6B 参数。庞大的专家池用于学习丰富的内容、运动和声音模式,稀疏激活则将实际调用参数控制在较小范围,实现了容量与成本的解耦。

然而,MoE 并非简单移植自语言模型。传统 Expert Parallel 需先为 Token 选出 Top-K 专家再分发至设备,激活专家越多通信量越大。面对视频级 Token 规模,通信瓶颈显著。Sand.ai 为此进行了深度优化。

音画同源:从同一个模型生长

MAGI-2 Preview 的首要革新在于架构。它延续了 daVinci-MagiHuman 论文提出的单流架构:文本、视频和音频置于同一上下文,在每一层 Self-Attention 中直接交互。相较传统多流方案分别处理模态后再缝合,单流架构从内部联合建模三种信息。

这一差异显著提升了音画关系处理能力。单流架构使声音、口型、表情、动作和镜头节奏在生成伊始即被共同建模,从架构层面解决音画同步难题。Sand.ai 是继 Google Veo 3 之后,最早实现音画同出模型的团队之一。

daVinci-MagiHuman 的真实生成案例:人物口型、表情与语音由同一个模型同步生成(来源:arXiv:2603.21986 / SandAI GitHub 仓库)

该思路已于今年 3 月验证。Sand.ai 与上海创智学院 GAIR 实验室联合开源的 daVinci-MagiHuman,利用 150 亿参数单流 Transformer 联合建模三模态,在单张 H100 上 2 秒即可生成 5 秒 256p 视频。MAGI-2 Preview 将此路线推升至千亿参数级。

daVinci-MagiHuman 单流架构:文本、视频、音频进入同一个 Transformer,中间主干层共享参数(来源:arXiv:2603.21986)

细节设计上,模型内设共享专家处理三模态共性,同时保留专属专家处理差异。统一主干减少了多模型串联带来的接口、延迟与维护成本,为生产线部署带来实质工程收益。

超细粒度 MoE:将一个 Token 拆解路由

MAGI-2 Preview 的第二项核心工作在 MoE 路由机制。受 Multi-Head LatentMoE 和 Head Parallel 启发,模型先将隐藏表示拆分为多个低维子空间独立路由,并在动态路由前完成跨设备通信分发。

这一顺序调整至关重要。传统 Expert Parallel 通信量随激活专家数线性增长,而 Head Parallel 的通信量仅取决于输入表示本身,有效拆解了长序列视频的通信瓶颈,为扩大专家数量留出空间。

更深层的变化在于路由对象。传统 MoE 为 Token 完整隐藏表示选择一组专家,而 Multi-Head MoE 将 Token 分解至多个表示子空间:有的偏向动作时序,有的处理外观,有的关注声音语义。不同 Head 独立选择专家,构建了可组合的能力结构。

从标准 MLP、标准 MoE、LatentMoE 到 Multi-Head LatentMoE 的结构演进:同一个 Token 被拆到多个子空间,各自独立路由(来源:arXiv:2602.04870)

具体而言,MAGI-2 Preview 将 3072 维隐藏表示拆分为 12 个 256 维 Head,在 36 层主体网络中使用 Multi-Head MoE。每层包含 12 个 Head,每个 Head 各有 256 个专家,单层共计 3072 个独立专家单元。每个 Token 在每个 Head 内选择 6 个专家,合计激活 72 个小专家。Sand.ai 将此形态称为 Ultra-fine-grained MoE。

对比行业配置,DeepSeek-V4-Pro 为每层 384 选 6,Kimi K3 为 896 选 16。虽然定义不同难以直接比对数量,但 Multi-Head 路由和 Head Parallel 技术使得如此细粒度的专家划分在视频模型上变得可训练、可扩展。

基础设施:支撑千亿参数运行的关键

数千个细粒度专家意味着更频繁的路由、数据重排和小矩阵计算。若依赖通用 MoE 实现,新增容量易被通信和调度开销抵消。Sand.ai 为此自研了一整套基础设施。

高性能 MoE Kernel 库 MagiMoE 覆盖路由、排序和计算全链路,合并分散步骤以减少显存搬运,并针对 Multi-Head MoE 优化前后向过程。当前采用经大规模验证的 Triton/BF16 路径,并保留低精度优化空间。

分布式层面,Head Parallel 在路由前按 Head 分配计算,传输形状固定的 Head 表示而非动态变化的专家 Token。这降低了 Top-K 对通信量的影响,使跨设备流量更稳定。结合张量并行、上下文并行等技术,共同承担扩展任务。

Head Parallel 与传统 Expert Parallel 的对比:无论激活专家数 k 如何增长,HP 的延迟和显存占用几乎保持平稳,而 EP 随 k 线性上升(来源:arXiv:2602.04870)

训练优化上,MAGI-2 Preview 使用分布式 MagiMuon。它保留 Muon 处理主体矩阵参数的优势,同时以 AdamW 处理常规更新参数,并针对海量细粒度专家重新适配参数组织。这种混合设计支持从中小规模实验稳定扩展至千亿参数 MoE。

视频模型的 Scaling 不仅是增加参数,更需协同解决通信效率、计算效率、数值稳定性和训练监控。MAGI-2 Preview 验证了模型设计与系统能力在规模化训练中的一致性。

数据策略:多样性优于过度清洗

随着模型规模扩大,数据管线目标随之转变。过去行业倾向层层过滤获取“干净”数据集,但这可能移除复杂运动、特殊镜头及长尾组合等关键信息,削平模型对真实世界多样性的覆盖。

Sand.ai 将数据重点从“删减”转向“组织”:保留广泛有效数据,通过细粒度标注让模型理解主体、动作、场景及音文对应关系。保留数据多样性比追求狭窄的“完美数据集”更符合 Scaling 需求。

预训练与后训练分工也被重新定义:预训练负责完整覆盖数据分布,后训练聚焦偏好对齐与产品适配。基础模型能力越完整,产品端对后处理的依赖越少。

MAGI-2 Preview 的逻辑清晰浮现:更大的专家容量需要更丰富的数据填充、更精细的标注组织,以及更高效的 Infra 支撑。模型、数据、系统的协同扩展,才是完整的 Scaling。

结语:Preview 证明的是一条路径

MAGI-2 Preview 是 Sand.ai 算法与工程创新的双重证明,但其价值不在于孤立的 Checkpoint。单流音视频架构、Ultra-fine-grained MoE、MagiMoE、Head Parallel、MagiMuon 及数据体系已连成相互支撑的 Scaling 路线。后续模型可沿此路线继续扩大规模,无需重复搭建训练系统。

技术报告坦言,正式版发布时仍需补充生成质量、音画同步、长时一致性及单位成本等数据,并通过商业应用验证真实价值。架构和系统给出的答案是:千亿参数级统一音视频 MoE 可以训练、可扩展,且能打破“能力越强、每秒越贵”的曲线。

最终答案需在生产线中检验。视频生成的下半场,竞争焦点将从 Demo 的惊艳程度,转向谁能将反复生成、筛选的十秒视频,算成一门成立的生意。

【声明】内容源于网络
0
0
Z Finance
我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
内容 880
粉丝 0
Z Finance 我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
总阅读94.7k
粉丝0
内容880