Vidu S1 是一款用于语音控制数字角色的实时交互式视频生成模型。用户可以随时通过语音指令引导生成的视频内容,从而实现实时互动。
关键点总结
-
语音实时控制:一句话驱动表情、手势、全身动作; -
自定义角色:单张图片生成真人 / 动漫 / 宠物数字人,支持音色克隆; -
流式输出:无时长上限持续视频对话,25FPS 标准、42FPS 峰值; -
场景适配:虚拟主播、线上教育、AI 陪伴、电商实时互动。
相关链接
-
论文:https://arxiv.org/abs/2607.03118 -
主页:https://vidu.com/vidu-stream -
Github:https://github.com/shengshu-ai/Vidu-S1
论文介绍
Vidu S1 由清华大学与生数科技联合研发,是面向实时对话、虚拟直播场景的流式视频生成模型,核心突破为语音驱动实时交互 + 无限长稳定生成。论文完整披露三层技术体系:多层过滤高质量训练数据集、双向 - 因果 - 蒸馏三阶段训练范式、滑动窗口 TwinCache 推理优化。区别传统离线扩散模型,采用因果自回归流式架构,生成时仅依赖过往音视频历史,支持中途实时接收语音指令;搭配 rCM 分步蒸馏、Sage 稀疏注意力大幅降低算力开销。评测搭建 500 样本专用基准,和多款头部数字人模型做盲测对比,在实时交互赛道实现画质、动作跟随、长时序稳定性三重领先,配套开放网页交互 Demo,开发者可通过 MaaS 平台完成接入。
方法概述
Vidu S1 引入了实时语音控制机制,用户可在生成过程中随时通过语音下达新指令(如“挥挥手”、“比个心”),模型能够即时响应并动态演化视频内容。更重要的是,它支持无限时长的连续生成,从根本上消除了长序列自回归带来的累积误差、画面崩坏与身份漂移问题。
为了实现极致的低延迟,Vidu S1 采用了专为实时场景优化的 TurboDiffusion 算法,结合 TurboServe 高效推理服务框架。这套组合拳大幅压缩了扩散模型的去噪步数与显存开销,使得在普通的消费级显卡上,也能稳定输出 540p 分辨率、高达 42 FPS 的流畅视频,完全满足实时视频通话级别的严苛延迟要求。
模型具备强大的零样本(Zero-shot)泛化能力。用户只需上传一张静态参考图像(涵盖真人、二次元动漫角色、甚至宠物),即可将其瞬间转化为可交互的动态数字生命。同时,系统支持多种音色选择,让数字人的声音与形象完美匹配,为用户提供沉浸式的个性化交互体验
数据流水线
多层筛选高清直播、影视剧素材,完成镜头切分、说话人分离、多模态标签标注;过滤水印、模糊、多主体冲突片段,区分屏幕内外人声,保证语音与肢体动作精准对齐,同时兼容二次元、非人类萌宠角色训练。
三、实验实测结果
-
定量指标:CSIM 人物一致性 0.9192、Sync-D 嘴型同步 7.847、DOVER 画质得分行业第一,超越 HeyGen、LemonSlice; -
主观盲测:56% 用户整体偏好 Vidu S1,100% 评测者认可其动作指令跟随能力; -
性能数据:RTX5090 下 3 步蒸馏可达 42FPS 标准 540P 输出,长时间对话无面部漂移、肢体扭曲; -
场景对比:竞品普遍无法同时兼顾实时帧率、长时稳定、语音动作控制三项能力,Vidu S1 实现三者统一。
四、结论
Vidu S1 重新定义实时交互式视频生成范式,跳出传统离线成片思路,依靠自研流式扩散、双缓存时序稳定、全栈加速三大创新,解决行业长视频崩坏、交互延迟、指令不响应三大核心痛点。模型兼顾学术创新与产业落地,无需专业高端服务器,普通消费显卡即可部署,同时覆盖真人、二次元、萌宠多类数字人需求。对于虚拟直播、线上教育、AI 陪伴、实时客服等交互场景,Vidu S1 提供低成本、高流畅度完整解决方案,也标志国产实时视频世界模型正式具备对标海外头部产品的综合竞争力。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

