传统数字人拆分 ASR、大模型、语音、渲染多模块导致延迟卡顿,阿里 Wan-Streamer 用单一 Transformer 打通全链路,实现亚秒级实时双向视频交互!
阿里达摩院最新发布的WAN Streamer,直接打破了高分辨率视频生成的延迟瓶颈,首次实现消费级GPU上4K 60fps的实时流式视频输出,不用等全帧生成就能边算边看,兼顾极致速度与画面质量,把AIGC视频生成正式带进了实时交互时代。
相关链接
-
论文地址:https://arxiv.org/html/2606.25041 -
项目官网:https://wan-streamer.com
论文介绍
本文发布 Wan-Streamer v0.1 端到端实时全双工多模态基础模型,核心创新是将文本、音频、视频的输入、输出 token 整合至同一条因果序列,依靠块因果注意力完成增量流式生成,取消所有外置交互子模块。整套技术栈全部采用因果设计因果编解码器、因果 VAE 支撑低延迟流式编码;训练分为多任务预训练、全双工交互微调、流式蒸馏三阶段,通过自强制滚动蒸馏降低长时序退化问题。推理端创新 Thinker-Performer 双卡并行部署方案,并行处理感知更新与音视频生成,把模型响应延迟压缩至 200ms。大量横向对比实验证明,它是唯一同时支持视频输入、同步视频输出、全双工交互且总延迟低于 1 秒的实时多模态模型。
方法概述
-
统一单 Transformer 流式架构 打破多模块拼接模式,将用户画面、人声、文字输入,以及 AI 语音、表情、字幕输出交错为一条因果 token 流。文本采用自回归预测,音视频使用条件流匹配联合生成,语音与面部动作同步约束,无需后期对齐修复。所有生成的音视频 latents 会存入全局 KV 上下文,保证长时间对话人物形象、语气稳定统一。 -
全因果技术栈设计 整套模型从编码器、解码器、VAE 到注意力层全部遵循因果约束,仅使用历史时序信息预测下一单元,支持 160ms 短时流式分片,做到 “边接收信息、边生成反馈”,实现真人一样边听边回应、中途打断。核心块因果注意力限制未来 token 不可见,大幅降低计算开销,保障实时吞吐。 -
三段式训练流程 多任务预训练:基于大语言模型初始化,混合图文、语音、对话数据同步训练理解与生成能力; 全双工微调:使用双向交互对话数据,学习倾听、插话、停顿等人机自然对话行为; 流式蒸馏:大教师模型轻量化蒸馏,搭配滚动自强制策略,减少长视频时序失真。 -
Thinker-Performer 双 GPU 推理部署 训练为完整单模型,推理拆分为两大并行单元: Thinker(思考端):处理用户音视频编码、上下文 KV 缓存更新、解码输出; Performer(生成端):仅执行流匹配音视频去噪生成; 两者共享统一上下文,感知与生成任务并行执行,消除串行等待,达成 200ms 模型低延迟。
实验结果
-
延迟核心指标:模型侧响应延迟 200ms,叠加网络总交互延迟 550ms;稳定 25FPS 视频输出,流式分片最短 160ms。 -
横向系统对比:纯语音实时模型(GPT-4o、豆包实时语音):无同步数字人视频输出; -
各类独立数字渲染工具:不含语言推理链路,整体真实交互延迟普遍超 1 秒; -
Wan-Streamer 是唯一端到端同时完成视觉输入、同步音视频输出、全双工交互且总延迟低于 1 秒的方案。 -
交互自然度:支持实时打断、主动提问,AI 倾听时自动生成点头、微 -
表情等细微肢体反馈,语音与口型无错位,长对话不会出现人物容貌漂移。 -
局限性:当前 v0.1 版本输出分辨率仅 192p,属于验证原型,后续可升级高清生成能力。
结论
Wan-Streamer 彻底颠覆传统数字人 “多模块串联” 的老旧架构,依靠统一因果 Transformer、双 GPU 并行推理两大核心突破,解决高延迟、音画不同步、无法全双工打断三大行业痛点。550ms 亚秒级整体交互延迟,让 AI 数字人真正实现媲美真人的实时视频对话体验,覆盖虚拟客服、直播互动、AI 陪伴、游戏交互式 NPC 等多元落地场景。现阶段原型分辨率有限,但整套端到流式交互架构具备极强拓展性,后续通过模型扩容、高清生成优化,有望推动实时多模态智能体全面普及,成为下一代交互 AI 的标准底层框架。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

