京东开源 JoyAI‑Video‑Edit,16B 自回归扩散实现 720P 30FPS 流式视频编辑,支持边播边改,全套代码权重 Demo 开放。
传统 AI 视频编辑大多是离线模式,需要处理完整片段后才能输出结果,长视频还容易出现时序漂移、主体变形、画面闪烁。京东 JoyAI-Video-Edit 采用分块自回归扩散架构,结合 SA-DMD 源锚蒸馏与 LHAD 长时序自回归蒸馏,在单张 B200 显卡上实现 720P 约 30FPS 的端到端实时编辑能力。
该方案支持不限时长的流式输入,可完成局部修改、物体替换、背景更换、风格迁移、参考图引导编辑等任务。在 OpenVE-Bench 和自建 LongV2VBench 评测中,JoyAI-Video-Edit 均大幅领先 StreamDiffusionV2、SANA-Streaming、LiveEdit 等流式基线,同时开放完整代码、模型权重和在线 Demo,具备较强的工程落地价值。
相关链接
-
论文 HTML:https://arxiv.org/html/2608.03974v1 -
GitHub 仓库:https://github.com/jd-opensource/JoyAI-Video-Edit -
Hugging Face 模型:https://huggingface.co/jdopensource/JoyAI-Video-Edit -
ModelScope 模型:https://modelscope.cn/models/jd-opensource/JoyAI-Video-Edit -
在线 Demo:https://joyai-labs.jd.com/v2v/login -
部署文档:https://github.com/jd-opensource/JoyAI-Video-Edit/blob/main/DEPLOYMENT.md -
其他博主解读:https://mp.weixin.qq.com/s/6cOySX9rpEVI5lPeipaz-g
内容介绍
JoyAI-Video-Edit 是京东 JoyAI 团队推出的实时开放式流式视频编辑框架。
与传统离线剪辑不同,它的核心特点是:视频帧可以边流入、边编辑、边输出,不需要提前处理完整视频,也不需要等全部渲染完成,理论上支持任意时长的流式编辑。
它主要支持以下几类能力:
-
局部物体增加、删除、修改 -
人物或主体替换 -
背景更换 -
全局风格迁移 -
参考图引导的视频编辑 -
实时交互式视频内容生成
项目公开的性能显示,在单张 B200 显卡上,JoyAI-Video-Edit 可以达到 720P 约 30FPS 的处理速度;在 RTX 5090 等消费级显卡上,也可以运行 480P 约 24FPS 的视频编辑能力。
此外,系统通过滑动窗口和 KV 缓存机制控制内存占用,避免视频时间越长、显存占用越高的问题。
适用方向包括:
-
电商直播实时特效 -
数字人内容制作 -
影视分镜快速预演 -
交互式视频内容 -
仿真数据生成
方法概述
整体架构
JoyAI-Video-Edit 主要由三部分组成:
-
MLLM 多模态条件编码器负责理解文本编辑指令、参考图信息和视频条件。 -
因果视频 VAE将视频压缩到潜空间,降低计算量,同时保留画面结构和运动信息。 -
16B 多模态 MM-DiT 扩散 Transformer负责视频帧的生成和编辑,是整个系统的核心模块。
三大核心创新
1. 分块自回归自适应
JoyAI-Video-Edit 将视频分成小块处理。
-
块内使用双向注意力,保证局部画面质量 -
跨块使用因果掩码,避免看到未来帧 -
通过滑动窗口缓存近期帧和首帧全局锚点,稳定长视频生成
这种设计让系统不需要一次性加载全部视频,内存开销被限制在固定范围内,因此更适合长时间流式处理。
2. SA-DMD 源锚蒸馏
SA-DMD 的作用,是在加速推理的同时,尽量保留原始视频内容。
传统少步蒸馏可能让编辑结果更快,但容易丢失主体结构、背景细节和运动信息。SA-DMD 通过源视频特征做引导,让模型在编辑画面时,仍然参考原始视频的结构和风格。
这也是 JoyAI-Video-Edit 能在少量去噪步骤下,同时兼顾编辑能力和画面保真度的重要原因。
3. LHAD 长时序自回归蒸馏
长视频生成的难点,不只是单帧画质,而是前后帧要连贯。
LHAD 主要解决自回归过程中的误差累积问题。它通过分段滚动优化、分片段反向传播和梯度隔离,让模型在有限显存下,也能学习更长时间的视频依赖关系,减少后面帧出现漂移和变形的概率。
实验结果
成对视频编辑数据流水线:通过关键帧引导的编辑操作合成成对视频传播或潜在共享的车路协同(I2V)生成,随后经过过滤并重新生成描述
1. OpenVE-Bench 评测
在短视频编辑评测 OpenVE-Bench 中,JoyAI-Video-Edit 综合得分为 3.60,在所有流式模型中排名第一。
它在局部修改、物体移除等任务上表现突出,整体画质接近部分高质量离线视频编辑模型,明显优于 StreamDiffusionV2、SANA-Streaming、LiveEdit 等流式方案。
2. LongV2VBench 评测
在京东自建的 1 分钟长视频评测集 LongV2VBench 中,JoyAI-Video-Edit 在五大编辑任务上全部排名第一,综合得分 3.30。
相比第二名 Xmax-X2.0,总分高出 1.59,说明它在长时序场景下的稳定性确实有明显优势。
结论
JoyAI-Video-Edit 的开源,标志着视频编辑技术的一个重要拐点。它用扎实的工程实现证明:高质量的视频编辑可以和实时流式处理兼得。
对于开发者来说,这是一个可以直接部署、二次开发的完整系统;对于直播、视频会议、游戏直播、具身智能等场景来说,这是一项能够立刻产生商业价值的基础能力。从 WAIC 的现场演示到全面开源,京东在短短数月内完成了从技术验证到产品化、再到开放生态的跨越。
更值得关注的是其消费级 GPU 支持的快速落地——从发布到支持 RTX 5090 仅用了不到 20 天。这意味着,个人开发者和小团队也能在自己的硬件上运行这套系统,而不必依赖昂贵的企业级 GPU 集群。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

