15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了
智东西

智东西9月11日报道,MiniMax开源通用视频模型MiniMax H3后,凭借优异的生成质量与性价比,迅速登顶第三方评测平台Artificial Analysis有声视频编辑榜,Elo得分达1130。然而,模型开源仅解决了部署可行性,高昂的时间成本仍是阻碍其进入实际创作流程的关键门槛。
针对这一痛点,RunningHub近期推出并开源了H3视频生成加速方案H3 Lightning。实测数据显示,该方案将5秒视频的生成耗时从348.8秒大幅缩短至28.7秒,整体推理速度提升约12倍,等待时间减少约92%。目前,相关技术代码及复现指南已在GitHub公开,支持多卡设备本地部署,普通用户亦可直接在RunningHub平台使用。
https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning
5秒视频不到半分钟生成,等待时间减少92%
H3开源后虽受关注,但实际部署中生成速度缓慢的问题日益凸显。在RunningHub的对照测试中,基于4张NVIDIA RTX 6000D专业显卡环境,采用BF16基础方案生成一段5秒、1344×768分辨率的视频需50步计算,耗时近6分钟(348.8秒)。
RunningHub首先引入RH后训练加速模型,将生成步数从50步压缩至9步,使耗时降至60秒,提速5.8倍。在此基础上,通过叠加算子与编译优化,最终将生成耗时进一步压缩至28.7秒,相较基础方案实现约12倍的推理加速。
智东西在RunningHub平台进行了实地验证:生成一段“流浪猫吃猫粮”的5秒视频,平台仅用时28秒,过程流畅。随后测试难度升级,生成长度为15秒、包含多角色互动及台词的都市短剧场景。结果显示,画面完成度高,人物动作衔接自然,表情与情节匹配,口型与台词基本同步,音效清晰,具备较高的短剧制作水准。
▲15秒视频生成用时54秒(生成过程经倍速处理)
▲15秒视频生成用时54秒(生成过程经倍速处理)
除文生视频外,该加速方案同样适用于多参考图视频生成。在8张RTX 6000D显卡环境下,以4步生成15秒竖屏视频,文生视频耗时约48秒,基于两张参考图生成视频耗时约73秒。值得注意的是,H3 Lightning在大幅提速的同时保留了BF16数值精度,各项配置均经过严格的画质验收。
生成时长的显著缩短,意味着创作者能更快预览结果、调整提示词并进行迭代。对于依赖高频试错的AI视频创作而言,单次等待时间的降低将直接转化为整体创作效率的提升。
从50步压到9步,三层优化实现12倍提速
从近6分钟缩短至30秒以内,背后是一套涵盖模型计算与硬件协作的系统级优化方案。
第一层优化在于减少生成步数。RH后训练加速模型将测试中的生成步数从50步压缩至9步,率先实现5.8倍提速,耗时由348.8秒降至60秒。
第二层优化聚焦于提升剩余计算的执行效率。方案采用了SageAttention2加速注意力计算,利用Cache-DiT缓存复用中间结果以减少重复计算,并通过torch.compile对模型计算流程进行编译优化,使其更适配GPU执行。
第三层优化则是多卡并行策略的精细化调整。针对主要通过PCIe连接而无NVLink高速互联的环境,RunningHub选择了TP2+Ulysses4的并行组合。在8张RTX 6000D测试中,该组合相比TP4+Ulysses2速度快约12%,同时减少约14GiB显存占用。上述技术最终被统一整合进SGLang的multimodal_gen推理引擎,由同一套流程完成调度与执行,实现了约12倍的整体加速。
适配RTX 6000D多卡环境,人人可用本地可部署
加速方案的实际价值不仅取决于速度,更在于其硬件适配性与普及度。当前许多加速方案依赖B300等高端数据中心GPU,采购与部署门槛较高,难以被普通工作室复现。
RunningHub的方案基于8张RTX 6000D专业显卡,仅通过PCIe连接即可实现大幅提升,成本低且更贴近主流工作室的硬件条件。为方便本地部署,RunningHub在GitHub提供了完整的环境安装、模型下载、服务启动及推理测试指南。拥有多卡设备的用户可自行部署接入创作流,无设备用户则可直接在线使用,真正实现了“人人可用,本地可部署”。
这是RunningHub继完成模型接入、开放ComfyUI节点后,对H3开源生态的又一次重要贡献。据悉,H3上线以来,RunningHub平台上已有上千名创作者开源近万条工作流,覆盖电商、短剧、漫剧、声音克隆、动作克隆及音频驱动等多个场景。
目前,RunningHub企业级API已接入上千家企业,日均调用量达千万级。从模型接入、工具封装到推理优化,RunningHub正逐步转变为H3生态中的核心技术方案贡献者。
十年GPU调度积累,搭建AI产品矩阵
H3 Lightning的推出依托于RunningHub母公司海马云十余年的GPU工程积累。成立于2014年的海马云,是一家以GPUaaS为底座,业务覆盖基础设施、模型服务和智能体应用的原生AI公司。
过去十余年,海马云围绕GPU容器调度、图形虚拟化和实时流媒体持续投入,在国内建设60余个边缘节点,为超3000万月活用户提供云渲染服务。在此过程中积累的GPU资源调度、多任务并发及内容实时分发能力,已被成功延伸至AI推理领域。
基于此,海马云构建了从底层算力到上层应用的AI产品矩阵:RunningHub面向全球140多个国家提供服务,接入170余个模型API;HaimaAPI聚合350余个主流模型供企业调用;RHTV、RHStory和VibeX等智能体工具则将模型能力延伸至视频及其他内容生产环节。
海马云的战略重心不在于训练基础模型,而是解决模型发布后的运行难题,包括快速接入、有限硬件下的效率提升及产品化转化。H3 Lightning正是其GPU工程能力在AI推理环节的具体落地,标志着其能力演进从解决“怎么跑”转向解决“怎么调用、怎么落地”。
结语:开源之后,推理优化成为视频生成提速的关键
模型开源赋予了开发者部署与二次开发的自由,而推理优化则决定了生成的时效性与资源消耗。当视频生成从尝鲜走向规模化生产,速度、稳定性、成本及部署条件将成为创作者选择模型的核心指标。
RunningHub推出的H3 Lightning推动了模型权重向实际生产力的转化。随着开源模型数量的增加,推理加速、硬件适配及工作流生态的建设,将成为决定模型能否真正融入创作流程的关键环节。