闻乐 发自 凹非寺
量子位 | 公众号 QbitAI
MiniMax H3 模型凭借强大的开源性能在 AI 视频领域独树一帜。随着模型底座能力的释放,开发者社区迅速跟进,涌现出大量工作流与垂直优化方案。
一站式 AIGC 创作平台 RunningHub 针对用户普遍面临的生成等待痛点,推出了 H3 Lightning 加速方案,显著提升了 MiniMax H3 的推理速度。
在创意迭代过程中,漫长的生成等待往往打断创作思路。RunningHub 通过工程优化,大幅压缩了 H3 模型的推理耗时。
测试数据显示,在 4 张 RTX 6000D 显卡环境下,生成 5 秒、分辨率 1344×768 的视频,原始 BF16 50 步方案耗时约 348.8 秒(近 6 分钟);而采用 RunningHub H3 Lightning 完整加速方案后,耗时仅需 28.7 秒。
该方案实现了约 12 倍的提速,生成时间减少约 92%,且全程保留 BF16 数值精度,未以牺牲画质为代价换取速度。目前,整套加速方案已在 GitHub 开源,支持创作者开箱即用。
(GitHub 仓库:https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/)
快 12 倍的 H3 实测体验
RunningHub H3 Lightning 不仅适用于短视频生成,在长视频及复杂任务中同样表现优异。在 8 张 RTX 6000D 环境下,生成 15 秒、分辨率 768×1344 的视频,纯文字生成约需 48 秒,双参考图生成约需 73 秒,成功将图生视频的时间尺度压缩至"1 分钟出结果”。
该方案全程保留 BF16 满血精度,确保了加速后的画面质量。实际测试中,无论是沙漠越野摩托车手的高速运动镜头,还是吉卜力风格的人物奔跑长镜头,均展现出连贯的运动逻辑与稳定的角色特征。
在 5 秒文生视频测试中,包含起步、冲坡、腾空及甩尾等大幅动作,配合多机位运镜,实际生成用时约 30 秒。画面中人物重心变化、尘土飞扬等细节真实自然,等待时间甚至不足刷完一条短视频。
在 15 秒图生视频测试中,基于一张吉卜力风格参考图,实现了人物与金毛犬从静止到奔跑、跳跃的复杂动态,镜头完成了从背后推进到侧面跟拍再到拉远的全流程。生成耗时约 88 秒,人物服饰特征与宠物形态在整个长视频中保持高度一致,背景环境也未出现崩坏。
△图片 AI 生成
即便进行二次创作,如增加下雨、撑伞及彩虹等复杂元素,生成时间也缩短至 50 秒左右。这种低延迟的反馈机制极大降低了创作者的试错成本,使灵感能够快速落地。
技术解析:人人都能用,本地可部署
RunningHub 并未依赖顶级数据中心算力或不降精度的“捷径”,而是通过三层工程优化挖掘出了性能潜力:
第一层:模型后训练加速
引入自研 RH 后训练加速模型,让 H3 学会用更少的步数生成高质量视频。将默认 50 步压缩至推荐 4 步(复杂任务可选 8 步),仅此一项便将 5 秒视频生成时间从原始水平缩短至 43 秒,实现 8 倍提速。
第二层:执行层算子优化
组合应用 SageAttention2、Cache-DiT 和 torch.compile 三项技术。SageAttention2 优化注意力计算效率;Cache-DiT 复用中间计算结果,减少重复劳动;torch.compile 对计算过程进行编译优化,降低调度开销。三者叠加,将生成时间进一步压低至 28.7 秒。
第三层:多卡并行策略优化
针对无 NVLink 高速互联、主要依靠 PCIe 通信的环境,RunningHub 测试并选用了"TP2+Ulysses4"的并行组合。相比传统方案,该组合速度快约 12%,同时减少约 14GiB 显存占用,有效解决了多卡间的通信瓶颈。
整套方案整合进 SGLang multimodal_gen 推理引擎,实现了从模型计算量压缩、执行效率提升到多卡协同优化的全链路加速。由于优化针对的是公开可购买的 RTX 6000D 及常规 PCIe 环境,中小团队与个人开发者均可在本地复现这一速度。当然,若使用更高规格硬件,速度还可进一步提升至秒级。
生态反哺:让开源模型真正具备生产力
面对开源模型,RunningHub 选择了将优化能力回馈社区的路径。从第一时间接入 H3 模型,到开源全套 ComfyUI 节点,再到如今推出 H3 Lightning 推理优化,RunningHub 致力于补齐从模型权重到实际生产力之间的缺失环节。
目前,RunningHub 平台上已围绕 H3 衍生出丰富的应用场景:包括电商多参生视频工作流、音频驱动数字人说话唱歌、以及漫剧自动化成片等。上千名创作者贡献了近万条创意工作流,形成了活跃的开源生态。
RunningHub 背后的母公司海马云,十余年来深耕 GPU 容器调度、图形虚拟化及大规模云渲染领域,拥有深厚的底层技术积累。在生成式 AI 时代,海马云将原本服务于游戏与高性能内容的工程能力迁移至 AI 推理场景,打造了原生 AI 公司的技术新落点。
RunningHub H3 Lightning 的出现,标志着开源模型优化从单纯的“可用”迈向了高效“易用”。它证明了通过工程创新,普通创作者也能在本地设备上享受到顶级的 AI 生成速度,真正让开源模型转化为可稳定复用的批量生产力。
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟

