大数跨境

Sand.ai:全球首个千亿级开源MoE视频生成模型MAGI Preview

Sand.ai:全球首个千亿级开源MoE视频生成模型MAGI Preview 极新出海
2026-09-01
3
导读:“五毛钱生成10秒视频,视频生成的成本从“烧不起”变成了“用得起”。

点击蓝字

关注我们

“五毛钱生成10秒视频,视频生成的成本从“烧不起”变成了“用得起”。”

作者|星雨

出品|极新出海

2026年8月5日,Sand.ai发布并开源了MAGI Preview这个全球首个千亿级开源MoE视频生成模型。总参数量约114B,单次前向计算仅激活约6B参数。在Artificial Analysis图生视频榜单上排名第六。生成一段10秒1080P视频的推理成本约0.5元,约为行业主流模型的十分之一。 

这组数字的组合在视频生成领域从未出现过。有媒体评价,这堪称AI视频模型赛道技术平权的“DeepSeek时刻”。 

确实,Sand.ai与DeepSeek共享同一套破局逻辑。 

DeepSeek在语言模型领域用MoE架构把训练成本降至557.6万美元,是chatGPT的约二十分之一,推理成本降低99%。而Sand.ai在视频生成领域走通了同一条路。2025年11月,Sand.ai做了一个在当时看来非共识的决定将模型架构从Dense转向MoE。八个月后,MAGI Preview给出了答案。

(图片来源:网络素材)

两者的技术路线高度一致。DeepSeek创新推出混合专家架构,将大模型的训练成本从数千万美元降低至数百万美元。Sand.ai则把这条路搬到了视频领域。视频的token规模远超文本,一张720P图片被切分成近千个patch tokens,一秒视频包含24帧,序列长度轻松达到纯文本任务的数百倍。MAGI Preview用Ultrafinegrained MoE架构回应了这个挑战。总参数114B,单次前向只激活约6B。模型可以继续扩大容量,但每次推理不必调用全部权重。

DeepSeek开源了70%的核心模型和训练框架。Sand.ai不仅开源了模型权重,还完整开源了代码和长达61页的技术报告。在视频生成领域,开源模型的参数规模此前大多停在十几B以内。千亿级MoE视频模型开源,这是第一次历史的时刻。 

Sand.ai想回答两个问题:视频模型怎样稳定扩大规模、继续抬高能力上限;模型变大之后,怎样控制训练和推理成本。DeepSeek在语言模型领域已经回答了这两个问题。Sand.ai也在视频领域给出了同样的答案。

01.视频生成的两大挑战


过去两年,视频生成模型参数规模一路飙升,但有两条路始终走不通。

一是视频生成的容量问题。模型的序列长度远超文本。一段1000字的英文短文大约对应1000多个token。视频则完全是另一个量级。一张720P的图片在视觉编码器下会被切分成近千个patch tokens,而一秒视频包含24帧。模型在处理一段几秒钟的视频时,需要同时面对几十万甚至上百万个视觉token,再叠加音频波形和文本指令,序列长度轻松达到纯文本任务的数百倍。分辨率、帧率和生成时长中任何一项增加,都会进一步推高token数量。

另一条是视频训练的成本。面对如此庞大的token规模,每一次前向计算都要处理远超文本的数据量。稠密模型里,模型参数增加,单个token的计算量同步上升;再乘上视频的超长序列,训练和推理成本很快变得难以承受。在语言模型中可行的参数扩张方式,移到视频任务上,往往先撞上成本与效率的限制。

2026年3月OpenAI停止运营Sora,背后很大一部分原因正是:以当时的架构和推理成本,大规模商用几乎不具备经济上的可行性,是一个十分烧钱但无法赚钱的模型。

(图片来源:网络素材)

语言模型缓解这一问题,依靠的是MoE混合专家模型模型保留一个庞大的专家池,每个token只激活其中一小部分,由此把总体容量和单次计算拆开。但把这套方法搬到视频模型上,困难主要出现在通信环节。传统专家并行会先为每个token选出需要调用的专家,再把token发送到专家所在的GPU。激活的专家越多、序列越长,设备之间需要搬运的数据也越多。在文本序列中这套机制尚可运转,但换成视频的token规模,跨卡通信很容易抵消稀疏计算节省下来的算力。

过去两年,开源视频生成模型的参数规模大多停在十几B以内,最大的也不过二三十B。语言模型那边,开源模型早已进入几千亿甚至万亿参数。视频模型参数规模长期停留在这个水平,主要受制于容量和成本这两项硬约束。

行业里流传着一个判断:视频模型存在一个不可能三角,成本、速度、效果,三者难以兼得。

但MAGI Preview指向了这个三角破局点在何方。

02.两个技术决策点


MAGI Preview做了两个关键的技术决策,直接回应了容量与成本的这对矛盾。

第一个决策是MoE架构。 

MAGI Preview采用了一种被称为“Ultrafinegrained MoE”的超细粒度专家架构。它将3072维的隐藏表示拆成12个256维的head,并在36层主体网络中全部使用MultiHead MoE。每个head拥有256个专家,每次选择其中6个。一个token在12个head中合计激活72个小专家,每一层由此形成3072个headlocal专家单元。 

这和传统MoE的路由方式有本质区别。粗粒度MoE中,一个完整的token整体路由给专家,一个token最多交给2个专家,专家数量通常在8到16个。而在MAGI Preview的MultiHead MoE架构下,同一个token的不同子空间可以由不同专家独立处理,同一个原始token可以同时调用4到8个专家。不同head在各自的低维子空间内独立选择专家,再将结果重新融合,为人物外观、动作时序、语言语义、语音和环境声等信息提供更细的处理单元。 

总参数114B,单次前向激活约6B。模型可以继续扩大容量,但每次推理不必调用全部权重。

但MoE搬到视频模型上,困难首先出现在通信环节。传统专家并行会先为每个token选出需要调用的专家,再把token发送到专家所在的GPU。激活的专家越多、序列越长,设备之间需要搬运的数据也越多。在文本序列中这套机制尚可运转,但换成视频的token规模,跨卡通信很容易抵消稀疏计算节省下来的算力。 

MAGI Preview的解法是引入Head Parallel机制。模型在动态路由发生前,先把固定形状的head表示分发到不同设备,数据抵达后再在本地选择和执行专家。主要通信量由输入表示决定,通信成本不随激活专家数量线性增长。 

围绕这套架构,Sand.ai还自研了MagiMoE高性能算子库,覆盖专家路由、排序和计算的完整链路,通过融合计算步骤减少中间结果和显存搬运,并针对大量小矩阵计算优化前向与反向过程。分布式优化器MagiMuon则使用Muon处理主体矩阵参数,用AdamW处理更适合常规更新的参数。模型、系统和数据三者协同设计,是千亿视频MoE首次走通的开源路线。 

(图片来源:sand.ai官网)

第二个决策是单流音视频统一架构。 

现有统一音视频模型常见两种路径。一类是多流架构,视频和音频进入不同的网络分支,再通过crossattention或专用融合模块交换信息。另一类是级联方案,分别生成画面和声音再完成同步处理。两类方案都有一个共同问题:音频与视频在生成早期分别建模,音画对齐依赖后续环节,链路越长,越容易累积延迟和误差。 

MAGI Preview延续了Sand.ai在daVinciMagiHuman论文中提出的单流架构。文本、视频和音频的token被拼接成一个统一的序列,由同一个Transformer主干处理。语言、嘴唇动作、身体运动、声音和相机节奏在整个模型中持续交换信息,而不是让不同模态仅在狭窄的crossattention接口处交互。 

模型内部还设置了共享专家与模态专属专家。共享专家处理不同模态之间的共性,专属专家分别处理语言、画面和声音独有的信息。人物说话时,模型同步生成口型、表情和身体动作;环境里出现撞击声,画面中的物体在相同时间作出反应;音乐节奏变化,人物表演和镜头推进随之调整。 

统一主干缩短了生成链路,也减少了多套模型串联带来的接口、等待和维护成本。对于广告、短剧、动画和游戏等内容,一次生成可以更接近一个同时包含画面、声音与表演的完整镜头。

(图片来源:sand.ai官网)

两个决策叠加,构成了一个完整的破局逻辑。MoE解决成本问题,单流架构解决质量问题和音画同步问题。0.5元生成10秒1080P视频这件事值得被关注,不只是因为它便宜,而是因为它的推理成本与技术能力组合在一起,意味着视频生成从“偶尔用一次”变成了“可以高频调用”。

03.更便宜的真正内涵


0.5元生成10秒1080P视频,这个数字的意义不在于便宜,而在于便宜到可以被高频调用。 

现在的生成视频很少一次就完全符合预期。人物的一个动作、镜头的一次转向、甚至一句对白的停顿,都可能影响最终效果。如果单次成本降下来,同样的预算可以测试更多提示词,调整动作、构图和风格,再从多个版本中筛选可用镜头。 

五毛钱和几块钱之间,看起来只是一个小数点的差别。但放到真实创作里,改变的是成本结构和内容生产方式。视频生成开始具备进入高频应用的条件。 

Sand.ai不仅开源了模型权重,还完整开源了代码。过去两年,开源视频生成模型的参数规模大多停在十几B以内。千亿级MoE视频模型开源,这是第一次。 

开源的分量不在于免费,而在于它降低了整个行业的实验门槛。任何人都可以用这个模型去验证自己的想法,而不需要先花几千万美元训练一个自己的模型。 

Sand.ai由清华特奖得主、Marr奖得主曹越领衔。2024年初,曹越创立Sand.ai。2026年6月,Sand.ai在三个月内连续完成两轮融资,累计金额超1亿美元,投资方包括快手创始人宿华、王慧文家族办公室、九坤创投、经纬创投等机构。公司核心营收产品为音乐视频C端创作产品VidMuse,上线仅两个月ARR已突破千万美元,验证了AI视频在特定场景下的商业化潜力。 

团队的技术路线一直很清晰:用单流音视频架构解决音画同步问题,用MoE架构解决规模与成本的矛盾。2025年11月,Sand.ai做了一个在当时看来非共识的决定——将模型架构从Dense转向MoE。八个月后,MAGI Preview给出了答案。

04.我们由此看到的三个方向


Sand.ai的发布指向了三个明确的方向。 

重新评估视频生成的使用成本。0.5元生成10秒1080P视频,意味着视频生成从偶尔用一次变成了可以高频调用。对于出海的内容团队、广告投放团队、游戏团队,这个成本线意味着可以把视频生成嵌入日常生产流程。 

开源模型可以成为技术起点。中小团队不需要从零开始训练自己的模型,可以直接基于MAGI Preview进行二次开发。视频生成的技术门槛正在从只有巨头能做变成谁都可以尝试。 

音画同步的能力正在成为标配。人物说话时有口型和表情,环境声音和画面动作同步响应。对于广告、短剧、动画和游戏内容,一次生成就可以得到一个完整的镜头,而不是画面和声音分两次拼接。 

成本决定能不能高频使用,开源决定能不能低成本起步,音画同步决定内容能不能达到交付标准。 

当视频生成的推理成本降到0.5元,当千亿级模型第一次对全球开发者开放,当音画同步第一次在同一个模型内部完成,视频生成从实验室走向生产环境的临界点可能已经到来。 

2026年3月OpenAI停止运营Sora。Sand.ai用MAGI Preview证明了另一条路是走得通的。MoE就是那个破局点。成本不再是天花板,开源不再是限制,音画同步不再是难题。 

(本文数据来源:Sand.ai官方发布信息及GitHub开源仓库;Artificial Analysis图生视频(含音频)榜单;量子位、新智元、智东西、DeepTech深科技、环球时报、第一财经等媒体公开报道。)

往期推荐

中国机器人已出海至141国,新的机会在这里

中国机器人已出海至141国,售后服务正成为新的机会

AI出海的形式除了API,还有没有更接近未来的方式

关于我们

关注「极新出海」,与我们一同追踪中国AI企业全球化的每一次技术输出、产品落地与资本动向。

点赞

收藏

分享

【声明】内容源于网络
0
0
极新出海
1234
内容 67
粉丝 0
极新出海 1234
总阅读912
粉丝0
内容67