大数跨境

AI视频全能选手:MiniMax H3开源,33B参数统一多模态,视频编辑榜第一,2K+立体声+15秒

AI视频全能选手:MiniMax H3开源,33B参数统一多模态,视频编辑榜第一,2K+立体声+15秒 努力犯错玩AI
2026-08-03
0
导读:7月31日,MiniMax 发布了新一代多模态生成模型 H3。同一天,字节的 Seedance 2.5 也全

7月31日,MiniMax 发布了新一代多模态生成模型 H3。同一天,字节的 Seedance 2.5 也全量上线,两家正面撞车。但真正让行业讨论起来的,是 H3 的定位:一个能同时读文本、图片、视频、音频,再一次性输出带原生立体声视频的通用模型。几天后,模型权重正式开源——这是视频生成领域第一个真正意义上的"全模态"开源旗舰。

此前视频生成赛道基本被闭源模型把持,Seedance、可灵、Sora、Veo,主流选项无一例外。MiniMax 官方博客直言:"长期以来,闭源模型一直占据视频生成领域的主导地位。"H3 的意义在于,它第一次让开源社区拿到一个能力逼近闭源最强的全模态视频模型,而且价格只有同行的三分之一。

MiniMax H3 系统概览
MiniMax H3 系统概览

一个模型吃掉四种输入

先看 H3 最特别的地方:输入不设限。文字、图片、视频片段、音频,可以任意组合混着给。

官方博客展示了一个很直观的例子:给模型一张人物参考图、一段希区柯克式镜头运动的参考视频、一条参考歌声的音频,然后告诉它"让图里的人按参考视频的镜头运动,用参考音频里的歌声唱歌"。H3 能一次读懂这条复合指令,直接生成一段 2K 成片,画面和声音同步出来。

这种能力在过去被拆成了七八个模型:文生视频一个、图生视频一个、首尾帧一个、主体参考一个、动作迁移一个、声音克隆又一个。MiniMax 的做法是把它们全部收进一个模型。官方把这套设计叫作"任务泛化"——不再按任务切分能力,而是用自然语言描述"参考什么、生成什么"。

MiniMax H3 官方演示:2K 性能与原生立体声
MiniMax H3 官方演示:2K 性能与原生立体声

语言在这里成了万能的中介。官方在博客里解释,参考和编辑关系不再绑定固定的任务集合,而是通过自然语言表达,语言(更广义地说是智能结构)就是通向泛化的桥梁。这也解释了为什么 H3 在指令遵循上特别强:它能听懂"把这个人放到那个场景里,用这段音乐,让口型对上这句台词"这种组合式指令。

MiniMax H3 使用场景
MiniMax H3 使用场景

视频编辑全球第一

H3 发布当天就登上了 Artificial Analysis 视频模型榜单的视频编辑第一,Elo 1130,样本量 8208,压过 Gemini Omni Flash 的 1122。文生视频第二(Elo 1238),图生视频第三(Elo 1187)。

视频编辑拿第一,靠的是"指令遵循"和"文字/品牌呈现"两个硬指标。影视片头的中英文标题、动态海报上的品牌 logo、UI 动效里的字幕——H3 能让文字真正参与视觉构图:文字贴合物体的透视,接受场景光的方向,跟随镜头运动而不畸变。把品牌 logo 放到玻璃杯上,模型要理解玻璃折射;放到墙上,要理解墙面曲率。这已经超出了"生成字体"的范畴,是模型对场景做整体理解之后的产物。

从 README 的官方示例里能看出它处理复合指令的方式。比如 Ref2VA 的一个用例:给一段粉西装青年抱着黑羊羔的视频、一条同步的背景音乐、一段男声旁白音色参考,要求"让青年开口说指定台词,背景音乐保留,人声换成参考音色"。Context-IR 会把这条指令拆解成主体定义、保留分析、详细描述三层结构——哪些元素完全保留、哪些部分复用、哪些重新生成,逐条写清楚,再交给 H3-Base 执行。文生视频的完整描述则会长到几百字,把分镜、运镜、光影、音效逐句铺开,甚至标注"第 4.5 秒镜头切到面部特写并强烈震动"这样的时间点细节。

H3 的输入规格也相当宽松。FL2VA 分支支持 0/1/2 张图输入,分别对应文生视频、首帧生视频、首尾帧生视频;Ref2VA 分支最多接受 9 张图、3 段视频片段、3 段音频,混合文件总数不超过 12 个。输出时长 4 到 15 秒,宽高比覆盖 21:9、16:9、4:3、1:1、3:4、9:16 等主流规格,24 FPS,音频 32kHz 原生立体声。对话语言稳定支持 11 种:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语。对中文创作者来说,官方明确把中文列入 11 种稳定支持语言,中英文字幕和文字渲染正是 H3 在榜单上拿第一的强项。

33B 参数的全模态架构

H3 的核心是一个 33B 参数的稠密单流 Transformer,叫 H3-Omni-Transformer。所谓单流,是视频和音频的 latent 在同一个 Transformer 里联合预测,而不是各走各的专家模块。约 13B 参数集中在 AdaLN 分支,推理时可以预计算缓存,纯部署不用全部加载。

不同模态的编码方式不一样:文本走 H3-Encoder,视觉输入同时走 H3-Encoder 和 H3-VisualVAE,音频只走 H3-AudioVAE。H3-Encoder 直接复用了 Qwen3-VL-32B 的预训练权重,取第 50 层的隐藏状态。VisualVAE 是时空因果视频自编码器,空间压缩 16 倍、时间压缩 4 倍、24 个 latent 通道,patch 化之后有效空间下采样达到 32 倍;AudioVAE 左右声道独立编解码再重组,把 32kHz 音频压成 40Hz 的 token 序列。位置关系用三维 MM-RoPE 表示,覆盖时间加两个空间维度。

MiniMax H3 全架构
MiniMax H3 全架构

三个模块分工协作

完整 H3 系统由三个模块组成,官方明确写了哪些开源、哪些没有:

  • • H3-Context-IR:预处理系统,负责理解输入的多模态素材之间、素材与目标视频之间的关系,再序列化成模型能读的结构化表示。它的内部流程包括指令解析、跨模态关联、时序理解和复杂逻辑推理。官方给了一个效率数据:一段复杂源推理平均约 10 万 token 的上下文,会被蒸馏成约 4 千 token。这个模块依赖多阶段流水线和多个托管模型,没有开源,只提供 API。
  • • H3-Base:根据 Context-IR 的输出生成 768p 音视频,这一部分权重已经开源
  • • H3-Regenerate-2K:把 768p 结果连同原始上下文一起送回 H3-Base,以 in-context 方式重生成 2K。它没有用传统的超分模块,而是让模型自己"重画一遍",所以能找回小字、细节这类超分只能靠猜的信息。未开源,提供 API。

官方还特别强调,Context-IR 对最终输出质量影响很大,强烈建议把它的行为复刻进生成流程,或者按照官方的 Prompting Guidance 自己搭一套上下文处理系统。本地部署 H3-Base 时,这一步决定你拿到的 768p 质量能贴近官方 API 多少。

上手指南:ComfyUI 直接跑

开源部分是目前最实用的切入点。权重在 Hugging Face 的 MiniMaxAI/MiniMax-H3 仓库,同时提供原始 checkpoint 和 diffusers 格式。两个任务分支:

  • • FL2VA:首尾帧模式。给 0/1/2 张图,分别对应文生视频、首帧生视频、首尾帧生视频。
  • • Ref2VA:全模态参考模式。最多 9 张图、3 段视频片段、3 段音频,混合文件总数不超过 12 个。

部署方式很灵活。SGLang 和 vLLM 都有官方 cookbook,diffusers 一行 ModularPipeline.from_pretrained 就能拉起。不想写代码的话,Comfy-Org 已经打包好了适配版,文本编码器、VAE、扩散模型分门别类放好,还有官方 R2V / T2V 工作流模板可以直接拖进 ComfyUI 用。文本编码器是 Qwen3-VL-32B 的 bf16 版,另有 int8 和 NVFP4 量化版可选,显卡吃紧的用户可以直接上量化版。

注意两点:一是当前开源版只提供 full attention 推理,稀疏注意力实现官方说后续发布;二是如果想复现官方 API 的 2K 效果,需要把本地 H3-Base 生成的 768p 结果再喂给官方 Regenerate-2K API,官方 README 里给了完整的 2K workflow 脚本。

价格只有主流的三分之一

2K 分辨率生成定价 0.8 元/秒,官方口径是"不到主流模型的三分之一";768p 的单价则不到主流 720p 的一半。Artificial Analysis 记录的 API 价格是 2K 每分钟 7.8 美元,对比 Seedance 2.0 的 1080p 每分钟 22.45 美元。

成本优势来自两个地方:一是高压缩率的 VAE,官方说有效序列长度提升了 4 倍,训练和推理成本大幅下降,这也是原生 2K 支持的关键技术;二是 H3-Omni-Transformer 把理解和生成负载分开调优,联合优化异构计算和负载均衡,端到端训练吞吐提升约 30%。MiniMax 在官方博客里说,从 Hailuo 01、Hailuo 02 到 H3,每一代的构建复杂度都比上一代高一个数量级,H3 的这些系统级优化是把成本压下来的核心。

开源协议与商用边界

H3 用的是 MiniMax Community License,商用门槛写得很清楚:

  • • 年收入低于 2000 万美元:可免费商用,但要满足署名要求,商用产品界面需显著展示 "MiniMax H3"。
  • • 年收入超过 2000 万美元:需要单独联系官方获得书面授权。
  • • 地区限制:欧盟、英国、韩国、美国被列为排除地区,这些地区要部署需另行联系授权。
  • • 不能用 H3 的输出去改进其他 AI 模型。

编码器用的 Qwen3-VL-32B 是 Apache 2.0,不冲突。对大多数团队来说,免费商用门槛是够用的。另外要注意,H3 的商用场景官方已经点明:广告、品牌、电商、产品设计、UI/UX、游戏——这些都是对"文字呈现"和"指令遵循"要求最高的领域,正好是 H3 的强项。

适合谁用、不适合谁用

把 H3 的能力和边界摊开看,适合的场景和不适用的场景其实很清楚。

适合的场景:广告片和宣传片制作,品牌 logo、标题文字可以直接生成进画面,省掉后期合成;电商产品视频,一张产品图加一段参考动作就能出片;影视和短视频的片头片尾、动态海报;需要参考指定角色、指定音色做内容的创作者;想研究全模态视频架构、在本地跑推理的开发者,官方提供了 int8 和 NVFP4 量化版,显存有限的环境也有得选。

不适合的场景:需要 30 秒以上长镜头的项目,H3 单次生成上限 15 秒,比 Seedance 2.5 短一半;要求原生 2K 直出的本地部署,2K 依赖未开源的 Regenerate-2K,本地只能跑 768p;对欧盟、英国、韩国、美国市场的商用项目,许可证有地区限制;需要把 H3 输出拿来训练其他模型的研究项目,许可证明确禁止。

总结:开源视频的转折点

H3 的意义不在于又多了个视频模型,而在于把"生成一段视频"这件事往前推了一步:输入从单一模态变成任意组合,输出从画面变成画面加立体声,任务从切分变成统一。它在视频编辑榜登顶、把价格压到三分之一、还开源了权重——这三件事同时发生,在视频生成领域是头一回。

局限也要说清楚:2K 输出依赖未开源的 Regenerate-2K 模块,本地只能跑到 768p;Context-IR 不开源意味着最强的指令理解能力只能走 API;生成时长 15 秒,比 Seedance 2.5 的 30 秒短一半;参考输入上限 12 个文件,也比竞品少。另外,H3 的版权争议还没消停——Hailuo 平台正面临迪士尼、环球、华纳的版权诉讼,H3 的商用落地绕不开这个问题。

但方向是明确的。官方博客里那句话值得记住:"任务泛化是不可逆转的趋势。"视频模型正在从"生成片段"走向"参与内容生产的全过程",H3 是这个趋势里第一个愿意开源的选择。对开发者来说,现在就能在本地跑起一个能力接近闭源旗舰的全模态视频模型;对创作者来说,一条指令让画面、声音、文字一起动起来,这本身就是值得动手试试的理由。

【声明】内容源于网络
0
0
努力犯错玩AI
为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
内容 286
粉丝 0
努力犯错玩AI 为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
总阅读2.4k
粉丝0
内容286