大数跨境

突破视频世界模型局限!东京大学开源HelloWorld,解锁虚拟角色实时社交交互能力,一键和AI角色互动。

突破视频世界模型局限!东京大学开源HelloWorld,解锁虚拟角色实时社交交互能力,一键和AI角色互动。 AIGC Studio
2026-10-07
9
导读:突破视频世界模型局限!东京大学开源HelloWorld,解锁虚拟角色实时社交交互能力,一键和AI角色互动。
点击下方名片关注AIGC Studio公众号!获取最新AI前沿应用/AIGC实践教程!
扫描下方a二维码,加入AIGC Studio知识星球!可以获得最新AI前沿应用/AIGC实践教程/大厂面试经验/算法刷题和IT各学科入门到精通学习资料!学习/科研/工作/副业,强烈推荐!

现有视频世界模型缺少角色与人的社交交互。HelloWorld实现按键触发,让画面内角色对镜头挥手、点头,完成交互式响应。

当下视频世界模型可以生成连贯虚拟场景、支持相机轨迹控制,但场景内的角色只能被动执行预设动作,无法和观看者产生社交层面的交互。HelloWorld由东京大学与Alaya Lab联合推出,旨在补齐这一短板。用户按下按键即可触发,让视频中的角色转向镜头,做出挥手、点头、问候等社交行为。

项目采用自蒸馏训练流水线,配合无需额外训练的时序注意力掩码模块,在保证原有画面质量与相机运动效果前提下,局部激活角色交互动作。同时构建HelloWorldBench评测基准,完整开源代码与LoRA权重,为交互式虚拟视频、AI游戏、数字人内容提供新方案。

unsetunset相关链接unsetunset

  • 论文:https://arxiv.org/html/2608.05070v1
  • 仓库:https://github.com/AlayaLab/HelloWorld
  • 主页:https://github.com/AlayaLab/HelloWorld
  • 模型:https://huggingface.co/oyly/HelloWorld_V1

unsetunset内容介绍unsetunset

HelloWorld 是面向视频世界模型的社交交互增强方案,核心目标是让生成视频里面的虚拟角色可以响应外部触发指令,和镜头前的用户产生社交互动。

传统视频世界模型可以生成连续场景、跟随相机轨迹,但角色行为完全写在生成提示词中,运行过程无法临时介入交互。HelloWorld提供一套触发式交互机制:运行时按下按键,就可以让当前画面中的角色完成转头看向镜头、挥手、点头、简短问候等社交动作,并且不会破坏原本的场景画面、物体结构以及相机运动轨迹。

该项目非常适合AI交互式视频、AI原生游戏、虚拟数字人短片、沉浸式仿真场景等方向。开发者可以直接使用开源LoRA权重快速接入现有视频生成链路;研究人员可以使用配套HelloWorldBench基准数据集,定量评估角色交互效果。

unsetunset方法概述unsetunset

HelloWorld整套方案分为自蒸馏训练流水线和推理阶段免训练时序控制模块两大核心部分。

  1. 自蒸馏数据流水线:基于基础视频世界模型做自蒸馏微调,模型使用自身生成的样例进行训练。生成样本同时包含社交交互动作与相机运动,让模型同时学习相机位姿条件和角色社交行为,避免新增能力造成原有画面质量下降。
  2. 时序交叉注意力掩码模块(推理阶段,无需重训模型):当用户按下交互按键,模块修改DiT扩散Transformer的交叉注意力掩码,把交互相关提示词的注意力,仅限定在按键触发对应的一小段时间窗口。做到只在指定片段激活角色社交动作,其余帧保持原本视频内容不变,不会污染前后时序画面。
  1. 评测基准 HelloWorldBench:构建400条样本的评测集,设计ActAcc、TimeAcc、GazeDev三类社交交互专属指标,搭配传统视频质量指标,用于客观衡量角色交互是否及时、动作是否准确、视线是否合理。

unsetunset实验结果unsetunset

通过多组基线模型对比实验,HelloWorld在交互任务上综合表现优于各类对比方案,同时保留原有视频世界模型的画质与相机跟随能力。

  1. 交互触发效果优秀:按键触发后,角色可以在指定时间窗口内完成转头、挥手、点头等社交行为,动作时机匹配按键窗口,不会过早或过晚响应。
  2. 不破坏原有视频属性:触发交互的同时,保留原本场景布局、物体细节,相机轨迹不会被干扰,没有出现画面崩坏、物体错乱。
  3. 社交指标全面领先:在HelloWorldBench基准上,ActAcc动作准确率、TimeAcc时间准确率、GazeDev视线偏差指标均优于基线,角色看向镜头的姿态更加自然。
  4. 部署友好:训练产出LoRA权重,不需要完整重训庞大视频世界主干;推理阶段时序掩码是附加模块,可直接接入已有DiT视频生成流程,二次开发成本低。

unsetunset结论unsetunset

HelloWorld 解决了现有视频世界模型缺少用户‑角色社交交互的痛点,通过自蒸馏训练+推理端时序掩码的组合思路,不需要大幅改动基础视频模型,就实现按键触发式虚拟角色社交响应。

该项目开源完整代码、LoRA权重与评测数据集,对交互式AI视频、AI游戏、沉浸式数字人内容都具备很高实用价值。它也证明:可以用轻量附加模块,给成熟视频世界模型增加新交互能力,而不必从头训练完整大模型,为后续交互式视频生成研究提供可行思路。

感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

【声明】内容源于网络
0
0
AIGC Studio
一个有趣有AI的AIGC公众号:关注AI、深度学习、计算机视觉、AIGC、Stable Diffusion、Sora等相关技术。这里不仅有简单易懂的AIGC理论实践和AI学习路线,还有大厂工作经历和体会分享。如果有幸能给你一些帮助就更好啦!
内容 1270
粉丝 0
AIGC Studio 一个有趣有AI的AIGC公众号:关注AI、深度学习、计算机视觉、AIGC、Stable Diffusion、Sora等相关技术。这里不仅有简单易懂的AIGC理论实践和AI学习路线,还有大厂工作经历和体会分享。如果有幸能给你一些帮助就更好啦!
总阅读54.0k
粉丝0
内容1.3k