大数跨境

视频后期革命:Netflix x Eyeline Labs开源ID-V2V,一段视频+一张风格图=全新成片

视频后期革命:Netflix x Eyeline Labs开源ID-V2V,一段视频+一张风格图=全新成片 努力犯错玩AI
2026-08-02
1
导读:拍完的视频还能后期改整体风格吗?Netflix、Eyeline Labs 和 Adobe 联合给出了一个方案

拍完的视频还能后期改整体风格吗?Netflix、Eyeline Labs 和 Adobe 联合给出了一个方案。ID-V2V 是一个视频重风格化模型,被 SIGGRAPH Asia 2026 录用,核心能力一句话:输入一段源视频加一张风格化后的第一帧图片,模型自动保持演员的面部特征、表情、眼神、口型和动作,把整段视频的风格、光影、背景变成目标风格。

这套流程叫做"先拍摄后重风格"(shoot first, restyle later)。传统视频后期改风格要么逐帧修图,要么用 AI 生成但丢失人物身份。ID-V2V 解决的就是这个矛盾——在自由改风格的同时严格保持人的身份特征。

一个视频构造训练对:没有成对数据怎么办

视频重风格化面临一个根本问题:全世界没有任何一个数据集包含"同一个人的同一段表演、两种不同的视觉风格"。如果连训练用的配对数据都没有,模型怎么学?

ID-V2V 团队的回答是——自己造。核心洞察是:人脸的表情、眼神、口型这些特征应该保持不变,唯一允许变化的是光照。那么身份保持问题可以转化为一个视频重光照问题。

训练流程是这样的。第一步,从一段普通训练视频开始(比如专业棚拍的演员表演,有精心布置的影视级光照)。第二步,把演员面部区域的光照从"影视光照"降到"普通光照"(削弱光影效果,让面部看起来像普通日光灯下拍的)。第三步,训练模型去逆转这个操作——给它"普通光照"的人脸,让它恢复"影视光照"的效果。

为什么这样能行?因为输入给模型的信息只包含人脸区域(经过重光照处理),身体、背景、场景全部被遮罩掉了。模型必须自己生成这些被遮掉的部分——从关键帧的风格中提取信息来补全整帧画面。输出就是原始视频,包含完整的面部细节和场景。每一对训练数据都是精确对齐的——人脸来自重光照处理、场景来自关键帧风格、输出是原始视频——成对监督信号天然成立。

训练好的模型在推理时的工作方式是:用户提供源视频和一张风格化后的第一帧,模型自动提取第一帧的风格特征,然后逐帧应用到整个视频序列,同时用源视频的人脸区域作为身份锚点。

还值得一提的是多人场景的支持。GitHub 仓库中有一个示例是"两个女性在聚光灯下"的场景,第一帧和最后一帧都做了风格化锚定。多人场景下每个人的面部细节都需要独立保持——模型通过为每个人物区域分别提取法线贴图和前景遮罩来实现。如果角色之间有交互(比如对话场景中一个人看向另一个人),模型需要同时保持双方的面部特征和动作一致性,这对视频生成模型来说是不小的挑战。

双分支控制信号

推理时,ID-V2V 使用一组精心设计的控制信号。

第一分支是源视频的人脸信息。模型通过 SAM3 把每一帧的人物前景分割出来,背景替换为灰色,生成一个"前景-灰色"条件视频。再配合面部法线贴图(通过 DAViD 提取),构成身份保持的核心约束。法线贴图能精确捕获面部肌肉的微小运动——眉毛上扬的角度、嘴角的弧度、眼神的方向——这些细节决定了演员的表演质量

第二分支是风格信息。用户提供一张风格化后的第一帧,模型从这张图中提取场景布局、配色方案、光照方向等风格特征,然后逐帧渲染。风格帧不需要跟源视频第一帧严格对齐——对于不完美的关键帧,ID-V2V 会让第一帧跟随风格图,但从第二帧开始自动回正到源视频的姿态和表情。

还有一个可选的深度序列分支,用于保证时序连贯性。如果源视频超过 81 帧,模型会把视频切成片段,每个片段 81 帧,片段之间通过重叠帧做平滑衔接。

默认的 idv2v 变体只用"前景-灰色"一个条件,适合大多数场景。备选变体 idv2v_with_normal_depth 增加了法线贴图和深度两个额外条件,在多人场景或复杂光照环境下效果更好。

五人机场景全支持

ID-V2V 支持五种典型使用场景,github 仓库为每种都提供了现成的脚本和示例数据。

重风格化是最通用的模式。输入一段视频和一张风格化关键帧,模型重新生成全部内容——人、背景、场景风格全部跟着变。示例中有两个坐着的女性角色从室内场景变为舞台聚光灯下的数码风格。GitHub 仓库的 teaser 图展示了多个场景的源视频与生成结果的对比——从室内人像变为赛博朋克风格、从日常场景变为电影色调。

重光照则只改光照,保持场景和背景不变。用第三方工具(比如 NanoBanana Pro)重光照第一帧,直接喂给模型,不做人物分割预处理。示例有乐队在深色背景下只改灯光颜色和方向的场景,以及一个人在封面会上用手遮住眼睛的不同光照版本。

不完美关键帧处理是技术上最亮眼的部分。如果风格图跟源视频第一帧不完全对齐——比如人脸角度不同、表情不匹配——模型会让第一帧跟随风格图,但从第二帧开始自动校正回源视频的身份和表演。这意味着用户不需要花时间精修第一帧的对齐度,大大降低了流程门槛。

长视频支持通过片段拼接实现。默认每片段 81 帧,最大帧数可通过参数控制。示例中有一个跳舞场景 240 帧,分为 3 个片段自动拼接,效果连贯没有视觉跳变。

多人场景同样支持,包括多关键帧锚定。用户可以在关键帧目录中放入任意帧号的风格化图片,模型会在对应帧上强制使用该风格,前后帧做平滑过渡。示例中有两个角色的场景在第一帧和最后一帧都做了风格化锚定,中间帧自动补全。

硬件门槛与开源范围

ID-V2V 当前的主要限制在硬件。模型权重约 96GB,官方测试平台是 8×A100-80GB。单卡 80GB 显存也能跑但会慢不少。这基本意味着个人消费级 GPU 跑不动——RTX 4090 24GB 显存不够,需要至少 A100 或 H100 级别。对于工作室和影视制作公司来说,8×A100 是合理的投入,但对个人开发者和研究者就不太友好了。

推理使用 xfuser 做序列并行,多 GPU 之间通过 torchrun 调度。代码支持 checkpoint 加载到 /dev/shm(共享内存)加速,默认开启。如果系统内存较少可以关掉这个选项。

代码和权重都已完全开源(Apache 2.0)。代码仓库包含预处理脚本、推理脚本和五种场景的完整示例数据。权重需从 Hugging Face 下载,自动脚本会拉取 idv2v.pth 和备选变体。SAM3 是门控模型,需要 Hugging Face 登录才能下载。

vivo 的 SmartPhotoCrafter 是单帧照片级别,而 ID-V2V 处理的是完整视频序列。这是当前开源视频编辑领域最完整的身份保持方案。

局限与展望

ID-V2V 尚未开源训练代码,目前只有推理代码和权重。官方承诺后续会补上。对于想用自己数据微调模型的团队来说,还需要等待。模型的推理速度也没有公开基准数据——81 帧片段在 8×A100 上的处理时间未知。

对输入视频的质量有一定要求。源视频如果是低分辨率、严重抖动或面部遮挡较多的素材,SAM3 的分割精度会下降,进而影响身份保持效果。目前的流程是针对互联网视频素材优化,对于手机随手拍的素材可能需要预处理。

从正面看,ID-V2V 展示了一条解决视频重风格化根本问题的路径——不需要成对数据。这个思路的影响可能超出视频风格化本身,延伸到视频编辑的更多领域。Apache 2.0 的开源许可也让影视公司和研究者可以放心使用和二次开发。

【声明】内容源于网络
0
0
努力犯错玩AI
为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
内容 286
粉丝 0
努力犯错玩AI 为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
总阅读2.4k
粉丝0
内容286