大数跨境

视频生成比播放还快:开源VDN-H3,14秒视频11秒搞定

视频生成比播放还快:开源VDN-H3,14秒视频11秒搞定 AI工程化
2026-09-03
5

最近,网络上流传起“无限流”视频,这都来自于刚发布的MiniMax H3,有网友用它做了一个生成式视频教室。你输入任意概念,几秒后,一个叫 Tung Tung Tung Sahur 的角色就会出现在教室里,开始对着黑板讲课。

还有人把 H3 Max 接入了 Twitch 直播,搞了个"无限次元电视"频道,画面是 Rick and Morty 风格的 AI 生成动画,观众可以实时互动。

很多人对上面的案例感兴趣,希望能够自己干。OpenVDN团队刚开源了Video Delta Net(VDN)可能能实现这样的视频自由。它基于MiniMax H3,把生成速度提升了75到90倍。在8块NVIDIA B200上,生成14.4秒的768p视频只需11.23秒。生成这段视频的时间比播放它还要短。

上面这段视频就是由VDN-H3生成。画面中的人群、霓虹灯和人物的动作,细节都在。

为什么能这么快?瓶颈在注意力机制。视频生成模型里,softmax attention的计算量随序列长度平方增长。在Minimax H3上,这部分占到了总运行时间的85%以上。线性注意力快,但质量会掉,尤其难以保持主体一致性、场景布局和长时间依赖。

VDN的思路是混合:一个滑动窗口softmax分支负责局部细节,一个线性注意力分支处理长距离上下文。两个分支的输出通过门控合并。这样既保留了softmax的精细质量,又获得了线性注意力的速度。

关键在线性部分的设计。传统的delta rule是逐token更新,但视频天然以帧为单位。VDN提出了Video Delta Attention(VDA),让一帧内的所有空间token联合求解一个状态更新。这比逐token独立更新更合理,能捕捉token之间的相关性。而且这个更新在数学上是非扩张的,不会累积误差。

为了不破坏预训练模型,他们用了三阶段训练:先逐层对齐线性分支,再端到端适配,最后加LoRA联合微调。然后用DMD2蒸馏到8步生成。大部分预训练参数保持冻结。

性能数据很直接。单卡B200上,VDN-H3的每层延迟从332.5ms降到125.3ms,2.65倍加速。配合分支专用的Ulysses序列并行和FP8,8卡B200上每步只需1.4秒。8步生成总共11.23秒。

作为对比,原始dense H3在单卡B200上生成同样视频需要13.95分钟(50步)。VDN-H3在8卡B200上使用8步蒸馏只需11.23秒,速度提升74.5倍。

下面是对比视频。左边是dense H3,右边是VDN-H3。两者输出几乎无法区分,但生成时间差了74倍。

VDN-H3是Minimax H3的衍生作品,遵循MiniMax H3社区许可协议。该协议授权范围不包括欧盟、英国、韩国和美国。使用前需要读一下。

训练细节也值得注意。他们特意避免了激进的4步蒸馏,选择8步,在质量和速度之间取平衡。这种克制在现在追求极限速度的氛围里不多见。

网友评价很直接。Amazing work刷屏,也有人调侃VDN直接碾压了老一代模型。还有人问,生成速度超过播放速度后,实时推理如果卡住了,谁来负责。这个问题问得实在。

VDN-H3可能只是一个开始。团队表示会继续探索混合注意力在更长、更快、真正实时视频生成上的应用。当生成不再是瓶颈,视频生成的玩法会完全不一样。

代码、权重、训练和推理流程全部开源。

仓库在https://github.com/OpenVDN/vdn-minimax-h3,权重在HuggingFace :https://huggingface.co/OpenVDN/vdn-minimax-h3

关注公众号回复“进群”入群讨论

【声明】内容源于网络
0
0
AI工程化
专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
内容 633
粉丝 0
AI工程化 专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
总阅读4.3k
粉丝0
内容633