大数跨境

用 WASD 操控 AI 视频!H3-World 开源:给 MiniMax-H3 装上键盘

用 WASD 操控 AI 视频!H3-World 开源:给 MiniMax-H3 装上键盘 路过银河AI
2026-09-08
5
导读:用 WASD 操控 AI 视频!H3-World 开源:给 MiniMax-H3 装上"键盘"本文参考魔

一、事件概述:H3-World 正式开源

H3-World 正式上线魔搭社区,成为首个基于 MiniMax-H3 构建的交互式世界模型。该模型权重已公开,技术报告同步发布于 arXiv。其核心突破在于:给定同一张首帧图像,模型能根据不同的按键序列生成对应的角色移动与相机运动,标志着 AI 视频从“被动观看”迈向“主动交互”。

二、核心玩法:键盘即控制器

W / A / S / D:控制角色移动
I / J / K / L:控制相机运动
F:触发快速相机运动

在固定首帧、随机种子及采样配置的对照实验中,仅需改变控制指令,即可实现站立、前进、侧移以及不同方向和速度的镜头运镜。同一张输入图片,因按键组合不同,可演绎出截然不同的剧情走向。

三、技术亮点:轻量化微调

极低参数占比:仅使用 8,000 段数据与 0.199% 的可训练参数(rank-32 LoRA,训练 10,000 步),即为 H3 基座模型赋予角色与相机控制能力,同时完整保留原有生成质量
文本动作接口:将按键操作转写为短句指令,复用 MiniMax-H3 预训练的文本处理路径。通过定向注意力机制,将指令与视频潜变量区间精准对齐,无需新增任何专用动作控制模块;
高效训练策略:训练过程中冻结原有参数,仅在自注意力投影与 Token Refiner 中注入 LoRA,延续 H3 原有的去噪目标函数。

四、能力边界与效果表现

动作接口包含9 类角色指令16 类相机指令,理论合法组合达 135 种,训练覆盖其中 83 种;
支持时序切换与组合控制:例如先左转镜头再右转,且能泛化至训练未见的复合动作(如角色移动叠加镜头俯仰);
具备跨场景与视角迁移能力:第一/第三人称、室内/户外、科幻/幻想等各类场景均适配同一套控制接口。

研究对比了三种动作注入方式:直接向量偏置(Additive bias)、FiLM 缩放平移以及 H3-World 的文本动作接口。实验显示,前两种方式的动作响应较弱或不一致,而 H3-World 能生成协调的角色与相机变化,证实了利用现有文本路径传递动作条件的有效性。

五、行业价值与意义

依托 MiniMax-H3 生态优势:MiniMax-H3 开源首日即获华为昇腾、沐曦、AMD 等十六家头部芯片厂商适配,被视为中国开源 AI 的重要里程碑。H3-World 作为社区创新成果,成功将视频模型的“语言动作理解”转化为“可控的世界交互”。

H3-World 的核心价值在于:以极低成本(0.199% 参数量)验证了“语言路径即控制路径”的可行性。这一突破为交互式世界模型、游戏内容生成及具身智能仿真等领域提供了低门槛的技术方案。目前,ComfyUI 生态中已出现类似工作流(如 SolarWM 节点),开源世界模型的应用场景正快速拓展。

六、部署与使用指南

H3-World 本质为LoRA 模型,需搭配 MiniMax-H3 基础权重及定向注意力补丁使用。官方推荐环境为 Python 3.10 + CUDA 12.8 + PyTorch 2.10,提供完整推理命令。默认输出规格为 832×480 分辨率、124 帧(约 5.2 秒片段),支持预设动作配置与按键脚本映射。

参考来源:

arXiv 论文(H3-World: Turning Language Understanding into World Control):https://arxiv.org/abs/2609.01560

HuggingFace 博客分析:https://huggingface.co/blog/zuanfilm/blog

模型权重(ModelScope):https://modelscope.cn/models/DANNY621/H3-World

【声明】内容源于网络
0
0
路过银河AI
1234
内容 1069
粉丝 1
路过银河AI 1234
总阅读33.9k
粉丝1
内容1.1k