大数跨境

实时视频版「Nano Banana」来了!160亿参数重磅开源

实时视频版「Nano Banana」来了!160亿参数重磅开源 新智元
2026-08-07
15

新智元报道

这个 8 月,AI 视频赛道的军备竞赛再度升级。字节跳动发布 Seedance 2.5,将单次生成时长翻倍至 30 秒;MiniMax H3 同日开源,价格仅为闭源旗舰的三分之一。整个赛道的核心指标聚焦于:谁能生成更长、更连贯且更低成本的 видео。

然而,当前模式存在一个共同痛点:用户必须等待视频完全生成后才能预览效果,若需修改则需重新排队。相比之下,语音赛道已率先突破这一限制,OpenAI 发布的 GPT-Live 实现了全双工交互,AI 可边听边说,无需等待。

语音交互证明了「实时」本身即是一种新范式。8 月 5 日,京东将这一理念引入视频编辑领域,开源了 JoyAI-Video-Edit。这是该赛道首个同时具备「流式架构、实时速度、可用质量」的模型,其部署代码、技术报告、在线 Demo 及模型权重已在 Hugging Face 和 GitHub 同步上线。

实时视频版的 Nano Banana

JoyAI-Video-Edit 在 720P 分辨率下推理速度达每秒 30 帧,系统端到端稳定在 24FPS,支持任意时长的稳定流式编辑。用户可通过语音指令实时渲染视觉特效,如变老、变年轻、转换为乐高小人或动物形象等,实现“边播边改”。

在直播场景中,该模型可实时替换卧室场景中的枕头、床单、画作及灯光,瞬间提升装修质感。这与 Seedance 2.5、MiniMax H3 等“视频生成模型”(从文本/图片创建视频)以及 Runway Aleph、VACE 等“离线视频编辑模型”(处理完整视频片段)有本质区别。

JoyAI-Video-Edit 开创了“流式视频编辑”第三赛道,能够实时处理直播、视频通话、摄像头及游戏画面等“活”的视频流。其中,“流式”指模型能挂载于实时视频流进行即时修改,“实时”则确保修改速度跟得上播放帧率。在此模型之前,业界尚无方案能达到 24FPS 的流畅播放门槛。

要「边播边改」,先过两道硬坎

实现视频播放中的实时编辑,需跨越速度与时长两大技术门槛。

第一道门槛:速度

视频本质是每秒 24 至 30 帧的画面序列,模型处理速度慢于播放即会导致卡顿。JoyAI-Video-Edit 采用“来一帧改一帧”的同声传译式架构,无需等待后续画面或预知视频长度。其底层由 MLLM 条件编码器、因果视频 VAE 及 16B 参数的多模态扩散 Transformer 组成,按自回归扩散编辑器训练部署。

针对 160 亿参数模型迭代慢的问题,团队利用 SA-DMD 训练方法进行蒸馏,将迭代步数从十几步压缩至两步。在单张 Nvidia B200 GPU 上,VAE 编码耗时 22 毫秒,DiT 去噪 185 毫秒,解码 19 毫秒,端到端延迟仅 226 毫秒,吞吐量达 30.1 FPS。

此前流式编辑器为求速度往往牺牲模型规模与画质(如 StreamDiffusionV2 仅 1.3B 参数,分辨率压至 480P)。JoyAI-Video-Edit 以 16B 大参数量实现 720P 高分辨率,速度反而提升 1.4 至 2 倍,解决了“快而废”的难题。

第二道门槛:时长

现有流式模型多局限于短时片段,长视频易出现色彩漂移、物体变形等问题。这是因为自回归模型在推理中不断消费自身输出,误差累积导致画面崩坏。此外,流式编辑需同时满足前后帧一致性、与原视频相似度及指令执行一致性三重约束,难度高于流式生成。

JoyAI-Video-Edit 提出“有界 KV 状态推理”方案,限制模型仅记忆最近几段画面及首帧参照,其余丢弃。这使得无论视频时长如何,计算量与内存占用保持恒定。配合针对性的长视频训练优化,模型在有限记忆下仍能维持画面稳定,实现无限时长的稳定编辑。

流式赛道断层领先,追平离线主流

研究团队通过两轮对比测试验证了模型性能。

短视频评测(OpenVE-Bench)

在该权威基准测试中,JoyAI-Video-Edit 总分达 3.60,远超 SANA-Streaming(2.62)、LiveEdit(2.00)等流式竞品,在五个子任务中四项居首。尤其在局部删除任务上得分 4.06,甚至超越所有离线模型。

此前流式模型得分区间为 1.23 至 2.62,基本不可用;而商业闭源模型 Runway Aleph 为 3.45,PixVerse V6 为 3.05。JoyAI-Video-Edit 以 3.60 分站进离线商业模型区间,证明实时模型画质可追平离线处理。

长视频评测(LongV2VBench)

在覆盖五大类场景的长视频基准测试中,该模型总分 3.30 位列第一,比最强对手 XMax-X2.0 高出 1.59 分。其速度达 30.19 FPS,比 XMax-X2.0 快 44.4%,是 SANA-Streaming 的两倍多。

人类盲评结果显示,JoyAI-Video-Edit 偏好率高达 81%-90%,面对强离线模型 Bernini-R 也取得微弱优势。结论明确:该模型在流式编辑赛道断层第一,并在全赛道追平主流离线水平,填平了实时与离线间的质量鸿沟。

真正改变的是干活的方式

流式实时编辑能力将从三个层面重塑工作流程:

消除「等待渲染」

226 毫秒的超低延迟让后期制作变为现场创作。调整色调、风格即刻生效,无需反复等待渲染。这使得边直播边创作成为可能,为元宇宙、VR/AR 应用奠定基础。

从「一次拍摄一个成品」到「无限变体」

依托参考图引导编辑(RV2V)技术,上传一张服装图片即可实时替换视频中人物着装,保留动作姿态。在电商直播中,这意味着可为不同观众实时生成个性化搭配版本,极大提升转化率。

构建可编程的语义层

该模型能在任何视频流(直播、通话、监控)上挂载,基于理解画面内容进行连贯修改,而非简单套用滤镜。导演与客户可在运动画面中实时调整对象、颜色与风格,快速排除错误方案,降低团队共识成本。此能力将率先应用于预演、评审及远程协作环节,并延伸至虚拟试衣、主播风格化改造及游戏实时后处理等领域。

更远的一步:从直播间到机械臂

JoyAI-Video-Edit 的应用不仅限于内容创作,更指向具身智能的数据瓶颈。机器人训练急需海量物理交互视频,但高质量数据稀缺。传统方法需串联多个模型进行人手抠除、背景补全及机械臂渲染,效率低下。

JoyAI-Video-Edit 将此流程简化为一步:在保留物体位置、空间关系及动作轨迹的前提下,实时将人手替换为机械臂形态,全程 30FPS 运行。

这与京东的 JoyAI 模型矩阵战略紧密相关:JoyAI-VL-Interaction 负责实时感知,JoyAI-Talker 实现语音交互,JoyAI-RA 专注抓取操控,而 JoyAI-Video-Edit 则批量生成训练数据。这套“看得懂、听得懂、说得出、抓得住、能造素材”的组合拳,旨在支撑京东构建“全球最大的物理世界运营中心”,服务于仓储、物流及直播等核心业务。

编辑:大卫 所罗门

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16467
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读343.4k
粉丝0
内容16.5k