视频生成这块,跟大语言模型比一直是另一幅光景:闭源模型长期占主导,迭代慢、生态封闭。7 月 31 日 MiniMax 发布全模态生成模型 H3 时说要开权重,今天HuggingFace 上真放出来了——58 个权重文件、两个模型变体,配套 diffusers、vLLM、ComfyUI 的部署说明都齐了。
H3 最值得说的能力:一个模型同时吃文字、图片、视频、声音四种输入,直接吐出带原生双声道的视频,最高 2K、15 秒。画面和声音由同一个主干一起生成,中间没有配音这道工序。
官方给了个例子能说明它想干什么。你可以这样下指令:"参考视频 1 的希区柯克镜头运动,让图 2 里的人物唱歌,歌声参考音频 3"。三个不同模态的素材加一句自然语言,模型自己搞清楚它们和目标视频的关系。
01它把一堆细分任务合并了
要理解 H3 的思路,得先看过去视频生成是怎么被切碎的。
图片生成里,文生图、编辑、主体参考、动作参考、风格参考各是一个专家模型;声音生成里,人声、音效、音乐分属不同领域;视频这边更碎——文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考、视频编辑,每个都是独立功能。模态之间还隔着一道墙。
MiniMax 认为这种切割既限制了用户的自由度,也从训练范式上限死了模型的泛化能力。所以 H3 的第一纲领就是任务的统一:预训练阶段就把文生图、文生视频、文生音频(不区分人声音效音乐)、以及各种"参考和编辑"(图到图、图到视频、音频到音频、音视频到音视频)混在一起训,还原生支持多镜头建模。
它对"参考和编辑"的定义值得留意:完全由真实自然数据构成,且由自然语言来表述参考和编辑的关系,不局限于有限的任务类型。官方的原话是,语言是泛化的桥梁。
过去每种玩法一个专家模型,H3 把它们混进同一次预训练
这带来的变化是使用方式——创作者可以直接用自然语言描述任务,而不只是写一段画面提示词。
02三段式系统,但开源的只是中间那段
H3 完整跑起来是三个模块串成的流水线,官方这张图画得很清楚:
MiniMax H3 系统总览:Context-IR 理解上下文 → H3-Base 生成 768p → Regenerate-2K 重生成高清(图源:MiniMax 官方 HF 模型卡)
- ▪H3-Context-IR:把你那堆自由格式的多模态输入(文字、图、音频、参考视频)读懂,理清它们之间以及它们与目标视频的关系,转成结构化的中间表示。
- ▪H3-Base:拿中间表示生成 768p 的音视频。
- ▪H3-Regenerate-2K:把 768p 结果连同原始上下文一起喂回模型,重新生成 2K 版本。
这里有个必须说清的点:开源的是 H3-Base,第一段的 Context-IR 没有开源。官方给的理由是它依赖多阶段工作流和多个托管模型服务,替代方案是提供 API,或者你照着官方的 Prompting Guidance 自己搭一套上下文处理系统。而官方自己强调 Context-IR 对最终质量非常关键、强烈建议接进流水线。
同样没在首发里的还有稀疏注意力实现——H3 原生支持稀疏注意力训练和推理,但这次开源只提供全注意力推理,稀疏版本后续更新。
所以说"开源"要打个折扣:核心生成模型给了,但要复现官方那套完整效果,你得自己补上理解层。
032K 不靠超分,靠自己重画一遍
技术上有两处选择挺有意思。
第一是 2K 的做法。 常规方案是接一个专用超分模块,H3 没这么干,而是让基模对自己的低分辨率结果做 in-context 的重新生成。好处是能复用基模已有的生成能力,更关键的是——重生成时还能再次利用原始的多模态上下文信息。官方点了个很实在的例子:传统超分靠"猜"还原不了的小文字和细节,这种方式能还原。
第二是它重做了 tokenizer。 H3-VAE 相比前代在重建和易学性上全面提升,高压缩率带来了 4 倍的序列长度收益,大幅降低训练和推理成本。这也是它能默认提供 2K 的关键。
H3-Base 架构:文本走 Qwen3-VL-32B 编码,视觉和音频各走 VAE,打包成统一序列后由 33B 的 Omni Transformer 联合去噪,最后解出同步的视频和立体声(图源:MiniMax 官方 HF 模型卡)
架构图里几个细节值得单独拎出来:文本编码器直接用了 Qwen3-VL-32B 的完整权重,取第 50 层的隐状态;主干是 33B dense 的单流 Transformer,视频和音频的 latent 由同一个主干联合去噪——这就是"原生双声道、音画同步"的来源;音频 VAE 是 32kHz 立体声。
MiniMax 还提到,他们放弃了给自己带来过显著优势的 Hailuo-02 架构,因为它在以任务泛化为核心的模型定义里会带来额外复杂度。原话是:架构技巧应为模型定义让路。这种取舍写在公开博客里,比堆参数更能说明团队在想什么。
工程侧还有一个数字:由于引入多模态上下文,序列长度方差大了 3 倍,理解和生成部分的计算负载也变得异质,他们用理解与生成异构的训练架构,端到端把训练吞吐提升了近 30%。
04打的是价格,不是跑分
这次发布有个特点:从官方博客到 HuggingFace 模型卡,全程没有一个 benchmark 分数。
没有跑分表,没有跟同行的对比图。能力主张全是定性表述——"商用级的多场景内容生成能力"、在指令遵循、文字与品牌信息呈现、V2V 动作迁移方面"表现出色"。所以别人说它 SOTA 的,你可以直接不信,官方自己都没这么讲。
它明确摆出来比的是价格:默认提供 2K 分辨率,2K 每秒价格不到主流模型的 1/3,768P 则是主流模型 720P 的一半。不过要注意,这个"主流模型"官方没有指名道姓,价格数字也是自报的。
还有一处信号值得国内读者留意:官方明说 H3 在设计初期就考虑了多款现有国产芯片的兼容性,开权重的动机之一就是加速国产芯片适配。这条比价格更有意思——它指向的是推理侧不被单一硬件卡住。
05用之前要知道的几件事
先说部署门槛。示例配置是 4 卡 BF16,家用单卡基本别想。支持 SGLang、vLLM、diffusers、ComfyUI,生态适配算给得全。
协议要看清楚。 不是 Apache 或 MIT,是 MiniMax 自定义的 H3 Community License,HF 上标的是 license: other。商用前务必自己读条款,别默认它等同于标准开源协议。
输出规格是明确的:4–15 秒、24 FPS、32kHz 立体声、短边默认 768p(2K 要走 Regenerate 模块)、支持 21:9 到 9:16 各种比例、对话语言稳定支持 11 种。参考模式下最多喂 9 张图或 3 段视频、3 段音频,所有文件加起来不超过 12 个。
难得的是官方自己列了三条不足:多模态上下文理解还有很大提升空间(后续要和 M 系列语言模型融合)、模型规模仍需 scaling、部分场景画面精细度不够。承认局限这件事,K3 和 Inkling 发布时也做过,正在成为国产模型发布的一种风格。
视频生成长期是闭源的地盘,理由也充分——训练贵、数据敏感、变现路径清晰。现在国内团队把一个能出 2K 带立体声的全模态模型的权重摆上了 HuggingFace,还顺手把国产芯片适配写进了动机。至于它到底好不好用,等第三方跑起来就知道了——权重已经在那儿,这次不用靠猜。
项目地址HuggingFace 权重:https://huggingface.co/MiniMaxAI/MiniMax-H3
官方发布博客:https://minimaxi.com/blog/minimax-h3在线体验(海螺):https://hailuoai.com

