传统视频编辑依赖专属预训练模型,成本高、适配性差。Qwen-Video-Edit另辟蹊径,复用图像编辑模型实现高质视频编辑。
当前主流指令式视频编辑方案,均需依托专门预训练的视频扩散Transformer骨干网络,模型训练成本高昂、迁移难度大。全新开源的Qwen-Video-Edit打破固有范式,无需专属视频预训练模型,直接基于成熟的Qwen-Image-Edit图像编辑模型,通过轻量化适配改造,实现高精度、高丝滑度的指令式视频编辑。该方法将Wan2.1视频VAE潜帧重构为虚拟大图,搭配轻量投影层完成跨域适配,依托Ditto-1M数据集微调,还可通过Wan2.2模型做画质增强,全程极简高效,配套完整代码、权重、数据集及ComfyUI部署方案,大幅降低AI视频编辑落地门槛。
相关链接
-
论文:https://arxiv.org/abs/2608.14790 -
主页:https://yunpeng1998.github.io/Qwen-Video-Edit-Page -
仓库:https://github.com/yunpeng1998/Qwen-Video-Edit -
模型:https://huggingface.co/yunpeng1998/Qwen-Video-Edit -
工作流:https://github.com/yunpeng1998/Qwen-Video-Edit#comfyui
内容介绍
Qwen-Video-Edit 是一款轻量化、低成本的指令式视频编辑开源框架,核心亮点是摒弃传统专属视频预训练模型的研发思路,挖掘成熟图像编辑模型的跨域潜力,实现高质量视频智能编辑。 该框架核心能力为自然语言指令驱动的视频编辑,支持风格转换、物体增删、色彩改造、细节优化、场景重构等多元化编辑操作,兼容横版、竖版等不同比例视频,支持45帧、81帧多长度片段编辑,覆盖短视频创作、影视剪辑、自媒体内容制作、视频精细化修图等多元场景。区别于传统方案繁琐的训练与部署流程,本方案仅需少量轻量化适配层,即可复用Qwen-Image-Edit强大的编辑能力,兼顾编辑精度、画面连贯性与推理效率,同时适配本地部署、ComfyUI可视化工作流,个人开发者可快速上手落地。

方法概述
Qwen-Video-Edit 采用图像模型跨域迁移+潜空间重构+轻量化微调+后置画质增强的创新架构,全程无需训练专属视频Transformer,核心流程简洁高效:
-
视频潜空间重构:基于冻结的Wan2.1视频VAE,将视频每一帧编码为潜变量,再把多帧潜变量拼接为一张虚拟大图,完美适配图像编辑模型的输入逻辑与位置编码规则。 -
轻量跨域适配:设计一对可训练的输入/输出投影层,基于Qwen-Image-Edit原生分块、解分块层预热初始化,实现视频潜空间与图像模型特征空间的无缝衔接,静态视频可完全被图像模型原生识别。 -
数据集微调优化:依托Ditto-1M百万级视频编辑三元组数据集微调,仅学习跨域分布偏移,无需大规模预训练,快速补齐视频时序编辑的细节短板,提升帧间连贯性。 -
后置画质增强:可选接入Wan2.2模型进行少量步数去噪增强,修复编辑后视频的细微噪点、模糊问题,进一步提升画面质感与时序稳定性。 -
全场景部署适配:基于DiffSynth-Studio推理框架构建,支持LoRA微调、全参数微调双模式,兼容多分辨率模型权重,适配消费级GPU部署与可视化ComfyUI工作流。
实验结果
大量定性与定量实验验证了Qwen-Video-Edit的优越性,证明图像编辑模型可高效迁移至视频编辑任务,效果媲美专属视频模型:
-
零样本跨域能力优异:原生Qwen-Image-Edit无需微调,即可直接编辑视频潜变量,实现基础视频修改效果,证明图像与视频潜空间具备高度兼容性。 -
编辑精度与连贯性拉满:微调后的模型可精准匹配文本编辑指令,画面修改自然,无突兀变形、色彩断层,帧间过渡丝滑,有效避免传统视频编辑的闪烁、抖动问题。 -
多分辨率适配稳定:开源360P、480P、720P多档位权重,支持45帧常规片段、81帧长片段编辑,不同分辨率下均能保持高画质输出,适配不同创作需求。 -
成本与效率优势显著:无需训练庞大视频Transformer,仅微调少量投影层或LoRA参数,训练成本、算力消耗远低于传统方案,部署门槛大幅降低。 -
场景泛化性极强:在风格化改造、物体替换、细节去除、场景渲染等数十类编辑任务中均表现稳定,适配绝大多数民用视频创作场景。
结论
Qwen-Video-Edit 提出了一种低成本、高效率的视频编辑全新范式,打破了“视频编辑必须依赖专属视频预训练模型”的固有认知。通过巧妙的潜空间重构与轻量化跨域适配,充分挖掘成熟图像编辑模型的泛化能力,以极小的训练与部署成本,实现了高精度、高连贯性的指令式视频编辑效果。项目开源完整代码、多规格模型权重、训练数据集与可视化部署方案,兼顾学术研究价值与工业落地实用性,为轻量化AI视频创作、低成本模型二次开发、短视频智能剪辑领域提供了全新的高效解决方案。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

