过去一个月,随着 MiniMax H3 视频模型的开源,社区涌现出多种旨在实现该模型实时生成的优化方案。现有方案多依赖 NVIDIA 最新的 B200/B300 高性能 GPU。
经过两周的技术攻关,我们成功在 H200 显卡上实现了 H3 模型的实时生成。以下是不同方案在生成 768P 视频时的性能对比:
*注:1 张 B 卡算力约等于 3 张 H 卡
技术优化路径
除了算法侧的步数规划与目标函数最小化外,我们在基础设施层实施了多项关键优化:
- 算子与通信优化:针对 SwiGLU、RMSNorm 等算子进行调优;在多卡执行中采用分块异步 All-Reduce、Ulysses 流水线及跨 block 调度策略,实现通信与计算重叠。
- Attention 稀疏化:对耗时最多的 Attention 机制进行稀疏化处理,并直接读写下游所需的张量布局,减少转置和内存拷贝。
- 音频质量保护:针对高稀疏性可能破坏音频 Token 读取的问题,我们对音频部分额外采用 Dense Attention 进行保护,确保音画同步与质量。
- 编码效率提升:为实现超实时生成,我们将 H.264 编码中的 YUV420 打包工作移至 GPU 完成(因 Hopper 架构不支持 NVENC),有效减轻 CPU 负载。
应用场景拓展:实时游戏生成
基于上述实时生成能力,团队在三天内快速开发了 8 款实时互动游戏。这些游戏的剧情并非固定,而是根据观众的实时投票动态决定后续发展。
本周五晚,我们将通过直播形式正式上线这些游戏,邀请观众共同改变游戏走向。
- 直播时间:9 月 11 日 19:00
- 直播嘉宾:秘塔科技首席运营官 王益为(王一快)
- 观看方式:B 站搜索【王一快】
服务上线与资费
目前,秘塔 AI 已正式开放更高画质的 H3 视频生成服务,支持直接使用或调用 API。768P 分辨率视频生成成本降至 0.09 元/秒。
参考资料:
- https://vllm.ai/blog/2026-09-01-minimax-h3-production-serving
- https://github.com/OpenVDN/vdn-minimax-h3
- https://blog.fal.ai/introducing-h3-max-by-fal/

