大数跨境

不需要 B200/B300 也能把 H3 视频做到实时生成

不需要 B200/B300 也能把 H3 视频做到实时生成 AI秘塔
2026-09-09
4

过去一个月,随着 MiniMax H3 视频模型的开源,社区涌现出多种旨在实现该模型实时生成的优化方案。现有方案多依赖 NVIDIA 最新的 B200/B300 高性能 GPU。

经过两周的技术攻关,我们成功在 H200 显卡上实现了 H3 模型的实时生成。以下是不同方案在生成 768P 视频时的性能对比:

*注:1 张 B 卡算力约等于 3 张 H 卡

技术优化路径

除了算法侧的步数规划与目标函数最小化外,我们在基础设施层实施了多项关键优化:

  • 算子与通信优化:针对 SwiGLU、RMSNorm 等算子进行调优;在多卡执行中采用分块异步 All-Reduce、Ulysses 流水线及跨 block 调度策略,实现通信与计算重叠。
  • Attention 稀疏化:对耗时最多的 Attention 机制进行稀疏化处理,并直接读写下游所需的张量布局,减少转置和内存拷贝。
  • 音频质量保护:针对高稀疏性可能破坏音频 Token 读取的问题,我们对音频部分额外采用 Dense Attention 进行保护,确保音画同步与质量。
  • 编码效率提升:为实现超实时生成,我们将 H.264 编码中的 YUV420 打包工作移至 GPU 完成(因 Hopper 架构不支持 NVENC),有效减轻 CPU 负载。

应用场景拓展:实时游戏生成

基于上述实时生成能力,团队在三天内快速开发了 8 款实时互动游戏。这些游戏的剧情并非固定,而是根据观众的实时投票动态决定后续发展。

本周五晚,我们将通过直播形式正式上线这些游戏,邀请观众共同改变游戏走向。

  • 直播时间9 月 11 日 19:00
  • 直播嘉宾:秘塔科技首席运营官 王益为(王一快)
  • 观看方式:B 站搜索【王一快】

服务上线与资费

目前,秘塔 AI 已正式开放更高画质的 H3 视频生成服务,支持直接使用或调用 API。768P 分辨率视频生成成本降至 0.09 元/秒。

参考资料:

  1. https://vllm.ai/blog/2026-09-01-minimax-h3-production-serving
  2. https://github.com/OpenVDN/vdn-minimax-h3
  3. https://blog.fal.ai/introducing-h3-max-by-fal/
【声明】内容源于网络
0
0
AI秘塔
1234
内容 206
粉丝 0
AI秘塔 1234
总阅读3.2k
粉丝0
内容206