MiniMax 最新发布的新一代模型 H3,将 AI 视频编辑能力推向新高度。该模型凭借多模态全能参考能力,登顶 Artificial Analysis 视频编辑榜单。其支持 768P 分辨率下每秒 0.23 元的超低成本,并提供开源私有化部署方案,为专业内容创作带来革命性变化。
多素材融合:一键生成品牌大片
在实际品牌视频制作中,MiniMax H3 展现了强大的素材整合能力。用户只需将图片、运镜参考视频及音乐节奏等最多 12 个素材一次性输入,AI 即可将其作为统一上下文理解并生成视频。
H3 单次可生成长达 15 秒的 2K 画质视频,并支持一次输出 4 个版本供优选。实测显示,生成的视频镜头推进流畅无断点,角色形象(如优设鸡)在颜色、比例上与参考图高度一致,无变形现象。同时,模型自带原生双声道配音,音乐节奏与画面切换配合精准。
尤为突出的是其视频参考能力,H3 能直接迁移参考视频的镜头轨迹。这意味着用户可将电影或广告中的经典运镜直接复用于自身创作,极大降低了专业镜头语言的使用门槛。
精细化编辑:像剪辑师一样修改视频
传统 AI 视频修改往往牵一发而动全身,而 MiniMax H3 实现了类似专业剪辑师的局部编辑能力。用户仅需通过自然语言描述或上传新素材,即可针对特定元素进行修改,其余部分保持完美不变。
例如,将角色皮肤从棕色替换为黄色,或进行 IP 联名换肤时,场景与运镜均可完整复用。测试表明,H3 能准确执行包含场景、时间、镜头视角及旁白语言在内的多维度复合指令。其 TTS 功能支持 11 种语言及多种方言配音,无需额外寻找配音资源即可制作多语种版本。
突破文字渲染难题
针对 AI 视频长期存在的文字渲染乱码痛点,H3 表现卓越。实测中,模型能在定格画面下方精准添加指定中文 Slogan,字体风格统一、位置精确,且不影响其他元素。这一能力让电商设计师修改 TVC 标语或投放不同渠道变得极其高效,无需重新制作整个视频。
商用场景落地:降本增效的新选择
MiniMax H3 的生成与编辑能力在多个商用场景中展现出巨大潜力:
- 电商展示:仅需一张产品图,即可生成包含 360 度全景、智能界面演示及多人办公场景的完整展示视频,省去拍摄与三维动画成本。
- 游戏宣传:能够驾驭城市废墟、浓烟火光等复杂场景,HUD 元素稳定,呈现 3A 级画面质感。
- 品牌动效:品牌字效与网页动效预览效果媲美 AE 制作,大幅缩短制作周期。
极致性价比与私有化部署
H3 将 768P 视频生成成本降至每秒 0.23 元,一条 15 秒品牌片成本仅约 3.5 元,约为行业均价的三分之一。低廉的价格显著降低了试错成本,使“快速迭代、即时验证”成为可能。此外,MiniMax H3 已开放模型权重,支持企业私有化部署,确保数据安全且不受第三方平台约束。
目前,用户可通过官网 hub.minimaxi.com 免费体验 3 次 2K 视频生成服务。随着开源能力的释放,MiniMax H3 将为更多内容创作者提供广阔的应用空间。

