大数跨境

比 Seedance 便宜七成的模型,宣布开源:视频生成行业变天了?

比 Seedance 便宜七成的模型,宣布开源:视频生成行业变天了? AI科技评论
2026-07-31
13
导读:第一次,效果对标 Seedance 2.0 的视频旗舰模型交到了所有人手里。
首款效果对标 Seedance 2.0 的视频旗舰模型正式开源,行业游戏规则或将重塑。

作者丨吴海明

编辑丨李娜 马晓宁

今日,MiniMax 发布视频旗舰模型 H3。该模型不仅在效果上获得创作者广泛认可,更以仅为竞品 Seedance 2.0 三分之一的价格引发关注。尤为关键的是,H3 宣布即将开源,成为首个达到此水平的开源视频模型。

当旗舰级视频模型走向开放,是否会复刻 Stable Diffusion 在图像领域的生态爆发?MiniMax 能否借此在视频生成赛道开辟新路径?本文将从模型能力、行业定位及开源意义三个维度深度解析 H3 的核心价值。

AA 榜单:MiniMax H3 反超 Omni、Seedance

H3 不仅是一款视频模型,更是通用多模态模型。它将文本、图片、音频、视频纳入统一上下文,由模型理解创作意图,一次性完成从脚本理解、分镜生成、角色场景保持、动作迁移、音画同步,到字幕包装及局部编辑的全流程,直接输出接近商业成片的内容。

Artificial Analysis 最新榜单截图

在 Artificial Analysis 最新视频编辑排行榜中,MiniMax H3 以 1130 Elo 位居榜首,超越 Google Gemini Omni 及字节 Seedance 2.0 等模型。

榜单证明了 H3 的效果上限,而其商业价值则体现在真实场景的落地能力。相比单纯生成画面,H3 强调编辑、文字、声音与素材的一体化,其核心差异化优势如下:

1. 全模态精准编辑:支持在既有视频上进行换人、换物、换背景、绿幕合成、改台词、调光影及视频续写等操作。

2. 复杂文本保持与视觉融合:确保视频中文字在连续帧内稳定不漂移,在电影片头、产品 UI 及动态海报排版场景中表现优异。

3. 一站式成片:整合画面、声音、文字及镜头节奏生成,用户无需依赖额外后期流程即可获得完整交付片段。

Prompt 示例:两位魔术师表演互换魔术,烟雾散去后西装颜色互换但手套颜色不变,随后鞠躬致谢,背景幕布由深红渐变为深蓝。实测显示,H3(上)抽卡成功率显著高于 Seedance(下)。

此外,H3 价格仅为 Seedance 2.0 的三分之一,极高的性价比使其在高频生成和快速迭代的商业场景中更具吸引力。整体而言,H3 标志着 MiniMax 试图将视频生成、音频合成、素材参考及编辑任务统一至单一模型框架。

H3 如何统一多模态创作链路并保持泛化?

据 MiniMax 官方披露,H3 的技术目标是实现任务统一与能力泛化。面对图像、声音、视频生成中细分繁多的任务需求,H3 摒弃了多专家模型组合的传统路径,转而以语言作为泛化桥梁,将所有能力纳入同一预训练范式。

H3 生成的技术路线图

在 H3 架构中,文生视频可同步生成音画,声音不再区分人声、音效或音乐,参考与编辑关系亦通过自然语言描述。其构建了四项核心技术:

1. Contextual Omni Representation:增强多模态描述能力,使模型能深度理解素材间、素材与目标视频间以及音画间的复杂关系。

2. H3-VAE:升级视频 Tokenizer,提升重建质量与压缩效率。官方数据显示其带来 4 倍序列长度收益,是支持原生 2K 输出的关键。

3. H3-Omni Transformer:采用理解与生成异构的训练架构,通过样本间负载均衡,将端到端训练吞吐提升近 30%。

4. In-context Regeneration:区别于传统专用超分模块,H3 让基模基于低分辨率结果和上下文信息重绘 2K 细节,显著提升小文字、纹理及画面细节的还原度。

H3 卡在了行业的什么位置?

回顾视觉内容生产工具的演进,从专业软件到 AI 辅助,再到生成式模型,H3 正处于视频模型从素材生成迈向商业级成片交付的关键节点。

早期视觉生产依赖 Photoshop、After Effects 等专业软件协同,成本高且门槛高。2016 年后 AI 作为效率插件介入,但仍属辅助角色。2021 至 2023 年,Stable Diffusion 等开源模型催生了完整生态,证明了强开源模型是生态底座的逻辑。

视频模型发展初期仅能生成数秒“会动的图片”。2023 年下半年后,Runway、可灵等产品将 AI 视频推向“可用素材”阶段,分辨率与稳定性大幅提升。然而,大多数模型仍停留在素材级,创作者需回归传统软件进行剪辑、包装与合成。

随着 OpenAI Sora、Google Veo 及字节 Seedance 的出现,行业竞争标准已转向谁更接近真实生产流程。部分创作者已开始利用这些模型替代低成本实拍,用于创意预演及电商素材制作。

H3 的设计直指真实生产场景商业级交付。它将部分后期包装能力前置到模型内部,实现"AI 原生后期”。例如,开发者测试显示,H3 可通过自然语言指令为实拍视频添加匹配光影的手绘发光动画,此类工作以往属于 Adobe AE 的专业领域。

若 H3 的能力能在实际工作流中稳定复现,标志着多模态模型从“生成素材”突破至“理解内容、执行包装、完成编辑并接近交付”。H3 卡在视频模型从文娱工具转向工业生产力的拐点上,回答了工业界最关心的“能不能交付”这一问题。

开放最新视频旗舰,H3 想改变什么?

如果说商业级交付能力是 H3 的“本分”,那么开源则是其撬动行业格局的关键。在视频生成领域,具备头部能力的模型开放权重极为罕见,因训练与推理成本高昂,厂商多倾向闭源回收成本。

此前开源阵营如阿里万相、腾讯混元等与闭源旗舰存在差距。H3 的特殊性在于:它是首个效果比肩 Seedance 2.0、价格仅为三分之一且即将开源的旗舰级多模态模型。这填补了市场对强性能、可部署视频模型底座的长期空缺。

企业侧:获得部署、数据与工作流的控制权

H3 开源首先解决了企业级部署的数据安全痛点。广告、影视、游戏等行业的视频生产涉及大量未公开产品、品牌资产及商业脚本。使用闭源 API 存在数据外流与知识产权风险,正如三星、摩根大通曾限制员工使用外部生成式 AI 工具。

H3 开源后,企业可选择私有化部署,将模型运行于自有服务器或私有云。商品库、角色资产及场景素材均可留在内网调用。这不仅降低了高频生产的边际成本,更确保了数据安全、知识产权及生产流程的完全可控。

生态侧:H3 能否成为视频领域的开放底座?

私有部署仅是第一层价值。视频生产场景高度非标准化,电商、游戏、影视及广告各有侧重。闭源模型难以用统一入口覆盖所有细分需求。

开源使得企业和开发者能基于 H3 进行微调与二次开发,训练懂商品、懂角色、懂品牌语言的行业版本,并将其嵌入创作平台,形成一体化工作流。

图像生成领域的经验表明,强开源底座将催生插件、微调模型及行业应用生态。H3 开源意味着视频模型将从单一公司的封闭产品,转变为可部署、可微调、可扩展的开放基础设施

未来,视频生成的竞争将从单纯的画质与价格比拼,升级为生态密度、定制能力及产业渗透率的综合较量。H3 的开源释放了一个明确信号:视频生成已进入开放生态与产业落地的全新竞争阶段。

//

推荐阅读

MiniMax M3 实测:第一流的模型,已经对执行层动手了

国产 Coding 争霸赛:MiniMax 爆冷登顶,DeepSeek 性价比称王

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读208.8k
粉丝0
内容8.9k