大数跨境

The Batch: 970 | MiniMax 的顶尖视频模型只是在最小程度上开放

The Batch: 970 | MiniMax 的顶尖视频模型只是在最小程度上开放 DeeplearningAl
2026-08-20
3

Hi~新朋友,记得关注我们哟

一款可免费下载的模型为视频生成与编辑设立了新标准,但其许可协议附带了出人意料的限制。

最新消息MiniMax 发布高清视频生成模型 H3,支持广泛的多媒体输入。该模型权重可免费下载,但美国、英国、欧盟及韩国用户需单独申请许可方可使用同等条款。目前,模型关键组件仍保持专有状态。

✴ 输入/输出:支持最多 12 个文件输入(文本 7000 字符、图片单张 30MB、音频 15MB、视频 50MB);输出为最高 2000 像素宽、15 秒长的视频,含音频及字幕。

✴ 架构:基于 Transformer,参数量约 330 亿;配备独立的文本、音频、视频编码器及预处理器,内置 2K 视频放大器。

✴ 功能:支持视频/音频编辑、多镜头输出及六种宽高比选择。

✴ 性能:在 Artificial Analysis 视频编辑榜单居首;文生视频与图生视频任务位列第二或与榜首持平。

✴ 可用性/价格:权重免费,遵循 MiniMax H3 许可协议(含商用);API 调用方面,2K 输出$0.13/秒,768p 输出$0.08/秒;输入成本依类型而定;提示词重生成模块收费为输入$0.90/百万 token、输出$3.60/百万 token。

✴ 未披露:确切参数量、训练数据集及技术报告细节。

工作原理

H3 架构解析:模型由上下文处理系统、视频/音频生成基础模型及高清放大器三大模块组成。仅基础模型开放权重下载,且附带限制。

✴ 数据训练:基于“真实自然数据”训练以确保质量与扩展性。所有音频类型(人声、音乐、音效)通过单一编码器联合建模;参考与编辑功能采用自然语言指令而非固定预设;早期即融合多模态数据。

✴ 生成模式:支持文生视频、首/末帧图片生成视频,以及图片、音频、视频参考的任意组合。例如,可指定静态图片开头,参考多段视频的运镜与音轨,并配合文字描述场景。

✴ 上下文处理(H3-Context-IR):该推理模块解读提示词与输入媒体,生成新指令指导基础模型融合内容。完整 API 用户可直接受益于此模块的自动化处理。

✴ 基础生成:基础模块输出 768p 视频(最大 21:9 宽高比下为 1792x768 像素),通过三个独立编码器分别处理文本、视频和音频,并由变分自编码器辅助视频编码。

✴ 高清放大(H3-Regenerate-2K):将 768p 视频原生重构至 2K 分辨率(宽 2000 像素,最长 4667 像素)。优化后的提示词结合原始媒体参考,有效补足细节而非简单外推。

✴ 许可限制:商业应用须显著展示模型名称;禁止基于输出蒸馏新模型;严禁违法、危害未成年人或干扰选举等用途。美、英、欧、韩被列为“排除地区”,当地用户需申请许可以确保合规。

新闻背后

MiniMax H3 在一对一人类偏好 ELO 评分中稳居前三,与 Google Gemini Omni Flash 及字节跳动 Dreamina Seedance 2.0 并列。Black Forest Labs 的 FLUX 系列虽曾有开放权重版本,但最新的 FLUX 3 转为专有 API 模式,其独立性尚待验证,不过官方测试显示其具备冲击最先进水平的潜力。Dreamina Seedance 2.5 同样处于待测阶段。

重要原因

尽管面临严格的许可限制及异常的地区壁垒,MiniMax H3 无疑是一款顶尖的视频生成模型。它为商业用户提供了强大多样的工具集,足以媲美 Google 高昂的竞品,同时也揭示了顶级视频模型的内部运作机制。MiniMax 放弃合成数据策略(尤其在高质量视频转录稀缺的背景下),并将提示词优化整合进流水线的做法,已被证明行之有效。

我们在想

在当前 AI 发展的复杂环境下,除法律合规需求外,按国家限制模型权重的获取缺乏合理依据。此举违背了“开放性”的核心定义——即任何人皆可下载、理解并使用模型。我们希望此类限制不会成为行业趋势。




点击下方阅读原文查看更多有趣内容哦~


【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1319
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读19.6k
粉丝0
内容1.3k