做信息流素材的人,都熟悉一种绝望。
一条 AI 生成的视频,人物对、光影对、节奏对,90% 都无可挑剔,唯独产品 logo 在第三秒闪了一下。放在真实投放流程里,这 10% 的错误没有补救办法:没有工具能只改那一帧,只能整段重抽,然后祈祷下一次运气更好。生成十分钟,返工一整天。
这个细节之所以重要,是因为它揭示了视频生成行业过去两年的真实处境:技术演示足够惊艳,生产可用率却不够看。而判断一个技术行业是否成熟,从来不看演示视频,看它有没有进入客户的成本表。
7 月 31 日,MiniMax 发布视频旗舰模型 H3,并宣布将在未来几天内开放模型权重。从多方测评结果来看,H3 的实际生成效果已直接对标 Seedance。而在官方定价上,其 2K 分辨率下的每秒单价,仅为 Seedance 的三分之一不到。
它恰好落在视频模型从技术秀场跨进生产环节的临界点上。
01 买单逻辑的彻底切换:B 端不看画质,看 ROI
这场转变并非厂商自说自话,而是由供需两端共同推动的。
头豹研究院测算,2025 年全球 AI 视频生成市场规模约为 86.8 亿美元,预计到 2030 年增长至 519.3 亿美元。其中,B 端客户贡献了约 65% 至 70% 的市场份额,营销广告与影视娱乐则占据七成以上的营收。
国内市场增长更快。2025 年,中国 AI 视频生成市场规模约为 12.1 亿元,预计到 2030 年达到 1497 亿元。与此同时,广告行业的 AI 视频采用率已经达到 56%,高于其他垂直行业。
这些数据指向同一个变化:视频模型的主要买单方,正从出于好奇尝鲜的 C 端用户,转向更看重投入产出的 B 端客户。
C 端用户可以为一次“惊艳”付费,B 端客户则更关心一条素材究竟要花多少钱、能否按时交付、需要返工几次。当买单逻辑发生变化,模型的评价体系也随之重构。画质不再是唯一指标,可用率、生成成本、迭代效率,以及与现有工作流的兼容性,都开始进入采购决策。
比如,短剧和跨境电商高度依赖多语言素材。过去,一条中文口播视频要制作成英文版或日文版,通常需要重新找演员、配音、校对字幕和调整口型,单条素材的本地化成本动辄数千元。如果模型能够直接理解“把这条视频改成日文版”,并在保留人物、动作和商品的前提下完成口播、口型与字幕替换,这笔成本就会被大幅压缩。
我们通过一组测试验证了 H3 在这一场景下的实际表现。
测试素材是一条现成的中文口播视频,以及一张原视频中从未出现过的新产品图。任务是先将原视频中的商品替换为新的气泡水产品,再依次生成英文口播和英文字幕版本,同时保持人物身份、动作和背景不变。
第一轮(更换产品 + 替换英文口播)
第二轮(增加英文字幕)
三轮下来,好的一面在于人物身份和动作在三轮修改中保持稳定,新产品包装是被「搬」进画面而非重新生成,「LIME ZERO」「0 糖」等文字清晰不变;英文声线延续了原人物的年龄感和语气,字幕能按语义分段并主动避开人脸和商品。
短板也存在。口型只覆盖了大部分发音变化,情绪颗粒度比原片略平,投放级素材仍需人工做最后一道审校。
它距离专业影视级的逐音素配音仍有差距,但对于需要高频生产、快速迭代的信息流广告而言,已经越过了“可用”的门槛。
02 能力如何换算成生产价值:H3 的三层拆解
进入生产环节的竞争,本质上是能力换算成生产价值的效率竞争。
将 H3 放在 B 端的算盘上进行拆解,它的核心能力精准地击中了四笔具体的商业成本。
第一笔是“质感账”,解决的是分镜脚本的执行效率。广告与影视客户对素材的第一要求,是看起来像花了大钱拍的。行话叫“电影感”,拆开来看其实全是硬性工程指标:光影层次、镜头推移、空间关系与动作连贯性。
以“凌晨进便利店买气泡水再走入雨中”的 15 秒短片为例,H3 的镜头不再是机械拼接的独立画面,而是通过跟拍、中景与特写的自然推移,让冷光反射与动作推演融为一体,直接压缩了分镜脚本的拍摄成本。
第二笔是“工作流账”,解决的是多工具切片的接力摩擦。H3 支持图片、文字、音频和视频等最多 12 个文件的混合输入,并将它们放进同一个上下文中理解。这意味着模特、产品、品牌视觉和参考动作可以一次性提供给模型,不必在多个工具中切换。
第三笔是“品牌呈现账”,对应的是卖点信息能否被准确传递。文字渲染一直是视频生成的难点,但价格、卖点和品牌名称又是商业广告中最不能出错的信息。在海报、舞台屏幕等复杂文字场景中,H3 基本避免了明显的错字和闪烁,文字的透视、亮度与环境关系也更加自然。
第四笔是“可用率账”,对应的是局部修改与多轮漂移。在产品替换、背景调整和口型修改等测试中,H3 基本能够保留已经确认的画面,局部调整没有引发明显的整体漂移。多轮编辑不漂移、不误伤已确认的画面,这正是 AI 视频工具接轨真实工业生产线的最关键底线。
03 成本曲线才是下半场的门票
如果说能力决定了能否进入工作流,那么价格与成本控制则决定了市场的渗透深度。
H3 的定价策略相当激进:2K 分辨率下每秒单价不到主流模型 Seedance 的三分之一。支撑这一价格断崖式下跌的是一系列针对训练和推理成本的工程优化。
全新设计的 H3-VAE 带来 4 倍序列长度收益,大幅压缩了训练与推理的算力消耗;
理解与生成异构的训练架构解耦了不同任务,使端到端的训练吞吐提升了近 30%;
2K 输出摒弃了专用超分模块,改由基模对自身的低分辨率结果做 In-context Regeneration(上下文重构),不仅节省了算力,还顺带解决了传统超分无法还原小文字的顽疾。
这里有一个值得注意的细节:MiniMax 在 H3 上放弃了曾带来显著优势的 Hailuo-02 架构,理由是它在以任务泛化为核心的模型定义中会带来额外复杂性,「架构技巧应为模型定义让路」。
为长期定义牺牲短期优势的取舍在工程文化上少见,也说明厂商对终局的判断:任务泛化是不可逆趋势,围绕单一任务的架构技巧没有长期价值。
成本曲线的意义不只是便宜。语言模型的经验是,单位成本每下降一个量级,应用场景就扩展一个量级。每秒几毛钱对应的是广告投流、短剧、电商这些高频消耗场景;降到几分钱量级,进入的就是实时生成、个性化视频这些今天还不存在的市场。
04 开源是另一个层次的竞争
如果说“极致能力 + 极低价格”争夺的是原有牌桌上的筹码,那么开源,则是直接改写了牌桌的规则。
长久以来,相比于大语言模型的繁荣生态,高阶视频生成领域几乎完全被闭源模型垄断。H3 宣布将在数日内开放模型权重,使其成为首个直接触及闭源旗舰水平的开源视频模型。这释放出了极为明确的三个信号:
资产与数据主权回归:企业首次拥有了私有化部署的选项,不必再将核心资产与成本绑定在单一厂商身上;
微调自由度释放:下游产业得以基于自身的 IP、画风进行私有化微调,打造专属数字资产;
算力生态极速平摊:云厂商、芯片商与开发者的集体涌入,将以超越单家厂商内部优化的速度,极速平摊整个行业的推理成本。
纵观行业,MiniMax 是极少数将开源视作底层战略而非营销噱头的玩家。M 系列的文本模型开放、芯片适配与推理平台接入早已形成了固定的军备节奏。如今,他们将这套玩法带入了多模态领地。
作为首个吃螃蟹的旗舰玩家,先行者的红利在于定义生态位。未来的工具链、私有化微调方案以及行业适配生态,都将围绕这个最先开放的旗舰权重野蛮生长。
从 Sora 点燃人们对于 AI 视频的想象力,到完全可控、可算账、可私有化部署的工业级管线,视频生成行业终于走出了靠 Demo 惊艳世界的童年期。
当 AI 视频模型不再高不可攀,它才真正开始重塑整个内容产业的生产力格局。


