
PART| 让虚拟角色动起来
这不是我第一次见"图片驱动动画",说实话,这条赛道我跟了很久。
两年前 Animate Anyone 第一代出来,我也兴奋过。输入一张人物图,给一段动作视频,AI 生成对应的动画。原理清楚,效果……能看,但只能看一眼。
问题出在哪?中间有一步"提取骨架"。AI 先把驱动视频分析成一堆骨骼节点,再用这套骨架去"套"目标角色。听起来合理,实际上漏洞很多:骨架提取一旦出错,目标角色的脸就开始飘,衣服开始糊,看着像被施了什么奇怪的魔法。
业内把这叫"身份漂移",一直是这类技术的死穴。
做了两年,大家没根本解决,只是在打补丁。

PART| 让虚拟角色动起来
阿里这次,把中间那一步直接删掉了,这就是 Wan-Animate-2 做的事。
来自阿里通义实验室,8月7日开源,模型权重、推理代码、ComfyUI 插件全部放出来了。
核心思路说起来简单粗暴:既然"骨架提取"这一步会引入误差,那就不要这一步。
把驱动视频直接送进模型,让模型自己去理解动作、理解时序、理解和参考图的关系,端到端输出目标角色的动画视频。
没有中间人,没有信息损耗,没有骨架漂移。

底层用的是重新设计过的 Diffusion Transformer 架构,加了两个关键机制——一个负责让动作序列和参考图在时间维度精准对齐,另一个负责让模型选择性关注参考图里最关键的特征,而不是什么都混在一起。
效果是什么?我看了他们放出的演示:跳舞的人,发丝的飘动方向是对的;拉小提琴的角色,手指按弦的细节是对的;轮滑的动作,重心转移时衣服的形变是对的。
这些细节,以前的方案几乎必然会在某个地方崩掉。

PART| 动作保真,视角转换
有一个功能,让我觉得这次不一样
动作保真度提升,在我意料之中。
但有一个功能,是我没预料到的:用文字控制拍摄视角。
以前所有的角色动画方案,镜头角度是被驱动视频死死锁住的。驱动视频正面拍,输出就是正面;驱动视频侧拍,输出就是侧面。没有商量余地。
Wan-Animate-2 加了文本驱动的视角控制。你可以在保持动作不变的前提下,用文字指定输出的镜头角度——正面、左侧45度、俯视,模型会自己重新"架摄像机",生成对应视角的画面。

演示里有一组对比:同一个角色跳同一段舞,同时输出了四个不同机位的版本,动作完全一致,只是观察角度不同。
这意味着什么?以前一个场景要拍四个机位,你得录四遍,或者做四段不同的驱动视频。现在一遍搞定。
PART|肉眼无感延迟
实时版:延迟压到了肉眼无感
标准版已经很能打,但他们同时还发布了 Wan-Animate-2-Lite。
Lite 版是专门给实时场景设计的。

你打开摄像头,Lite 在另一个屏幕实时输出你的虚拟角色——你动,它动;你的表情变,它的表情变。延迟达到实时阈值,肉眼基本感知不到卡顿。
技术上,他们把推理步骤从标准版的 40 步压缩到了 10 步,用了一套三阶段训练方案专门解决流式生成时的误差累积问题。

我个人觉得 Lite 版的意义比标准版更大——因为它打开的场景,是以前根本不可能做到的:虚拟直播、实时 AI 会议形象、游戏里的实时 NPC 互动。这些都不只是"效果更好",而是"原来做不到,现在能做了"。
PART|自媒体的福音
我想了一下,受益最直接的大概是这几类人:
做虚拟 IP 的个人创作者。 以前想让自己的卡通形象"活"起来,要么外包给动画公司,要么自己学 Blender 搞骨骼绑定。现在的门槛是:一张图,一段你自己录的动作视频。
做短视频和直播的人。 虚拟主播这条路一直有,但实时驱动的技术门槛让很多人望而却步。Lite 版把这个门槛压低了一个台阶。
独立游戏开发者。 过场动画、NPC 对话动作,以前每一个都是成本。有了这个工具,至少原型阶段可以先跑起来。
企业的产品演示和培训视频。 做一个虚拟讲师形象,用 AI 驱动它讲课、演示操作,不需要每次都重新录制真人。

现在能用吗?
能。
模型权重已经在 HuggingFace 和 ModelScope 上公开,搜 Wan-AI/Wan2.2-Animate-2-14B 就能找到。
想先试试效果不想配环境,ModelScope 上有在线 Demo,直接上传图片和视频就能跑。
本地部署的话,最低配置大概是 2 张 A800,可以跑 480P;8 张跑 720P。对普通开发者来说门槛还在,但租 GPU 云服务器跑一次的成本并不高。
代码在 GitHub 开源:Wan-Video/Wan-Animate-2,ComfyUI 节点已经支持,对已经在用 ComfyUI 的人来说接入很顺。
最后说一句我真实的感受。
我跟过这个方向很多年,见过很多"接近可用"的方案。Wan-Animate-2 是第一个让我觉得它在解决真正的问题,而不只是在刷 benchmark 的版本。
身份保持、视角控制、实时输出——这三件事,这次被同时做对了。
技术窗口打开的速度,永远比我们预期的快。

PART|核心架构
架构核心:双分支 DiT
Wan-Animate-2 采用双分支 Diffusion Transformer 架构。一个分支处理参考图(静态外观信息),另一个分支处理驱动视频(动态运动信息),两路特征在 Transformer 层内融合,而不是在输入侧做早期融合。这样做的好处是外观信息和运动信息各自保持独立表征,不会互相污染。
Time-Align RoPE
RoPE(旋转位置编码)是现在大模型里常见的位置编码方案,原本用于语言模型的序列建模。Wan-Animate-2 对其做了时间维度的扩展,让去噪视频 token 和参考图 token 在时间轴上建立显式对应关系。简单说,就是告诉模型"当前生成的这一帧,对应参考视频的第几帧",从而保证逐帧动作的时序一致性。
Sparse-Ref Attention
标准的交叉注意力(Cross-Attention)会让生成 token 对所有参考 token 打分,但参考图里并非每个区域都同等重要。Sparse-Ref Attention 引入了稀疏化机制,让模型只选择性关注高信息量的参考特征(比如脸部、手部、服装纹理),降低了无效计算,也减少了背景噪声对生成结果的干扰。
Lite 版的三阶段训练
Wan-Animate-2-Lite 的推理步骤从 Base 版的 40 步压缩到 10 步,靠的不是简单量化,而是一套专门设计的三阶段训练方案:
第一阶段:Teacher Forcing 预训练 + 误差缓冲机制。用完整模型作为教师,训练轻量学生模型;误差缓冲机制用于防止流式生成时误差逐帧累积放大。
第二阶段:Self-Forcing 蒸馏。让学生模型在自己的输出上继续训练,减少对教师模型的依赖,提升自主生成能力。
第三阶段:分块反向传播(Chunk-wise Backpropagation)。流式生成场景中,视频是分块输出的,逐块计算梯度并更新,避免长序列带来的显存爆炸问题。
模型规模与推理配置
Base 模型参数量:14B(Wan2.2-Animate-2-14B)。推荐推理配置为 8× A800 80G,支持 720P 视频生成;2× A800 可跑 480P。Distillation 版本推理步骤 10 步,guidance_scale 设为 1.0(关闭 CFG),使用 Euler scheduler,在速度和质量之间取得平衡。

