大数跨境

ZPedia|视频正在从文件变成界面,Vidu S2 把 AI 视频推向实时交互

ZPedia|视频正在从文件变成界面,Vidu S2 把 AI 视频推向实时交互 Z Finance
2026-09-16
8
导读:实时视频正在吞并直播、客服与游戏

长期以来,视频被视为一种单向媒介。无论是电影、短视频还是直播回放,用户面对的均是一条既定的时间线:只能暂停、快进或退出,难以真正干预内容走向。即便生成式 AI 改变了视频的生产方式,这种“模型负责生产,用户负责观看”的静态关系并未发生根本性变革。

实时视频技术旨在打破这一僵局。视频将随用户的指令(语音、动作或图片)持续演化,用户面对的不再是预设内容,而是一个可交互、可影响的动态视觉界面。这一趋势正推动行业从“生成得像不像”向“生成后还能做什么”转变。

Google DeepMind 发布的 Genie 3 已能每秒生成 20 至 24 帧的可实时探索世界;Runway 推出的 Aleph 则尝试用自然语言对人物、背景及光照进行语义编辑。与此同时,HeyGen 与 Synthesia 等数字人企业已在商业市场验证了视频即服务的模式,ARR 分别突破 2 亿与 1 亿美元,其产品正从单次口播工具进化为可持续交互的视频系统。

生数科技推出的 Vidu S 系列正是这一趋势的具象化落地。作为最新迭代,Vidu S2 不仅提升了生成质量,更构建了可持续交互、实时修改的视频系统新形态。

双模齐发:从“实时回应”迈向“实时可改”

Vidu S1 率先实现了数字人从“播放内容”到“实时回应”的跨越,支持用户在互动中通过语音或文字触发比心、换装等动作。然而,若形象、场景等核心要素必须在开播前锁定,其本质仍是一套具备交互能力的预设内容。

Vidu S2 在 S1 发布仅 69 天后完成迭代,核心突破在于将“编辑”能力植入持续生成过程,解决了“当生成已经开始,用户能否继续修改画面”的关键问题。

S2 产品线分为两大模块:S2-Avatar 聚焦角色在互动中接收新指令以改变动作与外观;S2-Editing 则直接对运行中的视频流进行角色替换、虚拟换衣及背景重构。这标志着视频首次可在“运行中”被持续改写,并延伸至实时空间视频领域。

S2-Avatar:从“会说话”进阶为“会表演”

S2-Avatar 将实时输出分辨率从 540P 提升至 720P,并强化了动作指令执行能力。其关键创新在于支持在生成过程中动态注入新的参考图。直播开始后,用户可随时上传新商品图或服装图,数字人即可在后续画面中即时展示或换装。这种工作方式让数字人从单纯的“问答机器”进化为能根据现场信息行动的“表演者”。

S2-Editing:将后期编辑融入实时视频流

S2-Editing 面向实时视频编辑场景,支持在直播或播放过程中对画面进行角色替换、虚拟换衣、风格渲染和背景替换。与传统后期处理已完成素材不同,实时编辑要求模型在接收新画面的同时完成语义修改,并确保人物动作自然衔接、身份稳定。S2-Editing 的核心价值在于实现了“在视频发生的同时修改视频”。

两条产品线分工明确:S2-Avatar 负责实时互动与表演,S2-Editing 负责实时画面重构,共同构建了可交互、可修改、可控的视频生产闭环。

从平面视频向空间维度延伸

除 Avatar 与 Editing 功能外,Vidu S2 还探索了前沿的空间视频生成。通过生成同步的左右眼视图并流式传输至 VR 头显,该技术将人物与背景的实时变化从二维平面拓展至具有景深和空间关系的三维环境。

尽管目前尚未完全商业化,但空间视频正成为模型技术的新分支,与 VR、空间计算及交互式虚拟世界深度交融。Vidu S2 的这一布局,表明其边界已与实时世界模型及下一代内容渲染系统发生重叠。

技术攻坚:在动态变化中维持连续性

实时视频的核心难点在于缺乏“重来一次”的机会。模型需在无完整时间区间推演的情况下,根据已发生内容决定下一帧,并随时响应新指令(如转身、展示新商品),同时保持画面的连续性与一致性。

由生数科技流式视频生成负责人张金涛主导研发的 Vidu S2,通过以下四项技术创新解决上述难题:

  • 双阶段架构:主干网络(Backbone)负责低分辨率下的结构与动作走势,精炼网络(Refiner)异步生成纹理与细节,两者并发以提升画质且不牺牲实时性。
  • 动态位置编码:重新设计位置编码,使新加入的参考图(如商品、服装)能与当前推流时刻精准对齐,仅影响后续画面而不干扰既有内容。
  • 轻量化 VLM Agent:引入智能体持续判断人物状态与动作进度,确保上一轮动作结束后再执行新指令,有效减少动作抢跑与肢体穿模。
  • 强化学习应用:将强化学习直接应用于少步因果模型的最终部署,进一步提升画面质量及指令遵循度。

商业重塑:从交付“成片”到运营“连接”

实时视频的商业价值正渗透进成熟的工作流。在直播电商场景中,传统数字人依赖预设脚本,难以应对临时的商品调整或促销变更。Vidu S2 允许在 Session 中动态加入素材与修改视觉风格,赋予了数字人真正的“临场反应”能力。

在智能客服与销售转化场景中,评估指标已从“像不像真人”转向响应时延、任务完成率及最终转化效果。长期来看,该技术还将赋能互动娱乐与原生虚拟世界,构建随用户操作持续变化的视觉环境。

商业模式随之发生质变:从按条数或时长售卖静态“成片”,转向按会话时长、并发路数及 API 调用量计费云服务。这种模式拓宽了营收天花板,但也对每小时推流算力成本与系统稳定性提出了更高要求。

资本风向:押注视频模型的“交互化”未来

2026 年初,全球视频模型与虚拟人赛道融资密集。Synthesia、Runway 及 Tavus 等企业接连获得大额融资,估值屡创新高。资本市场的判断基于两层逻辑:一是 HeyGen 等公司已验证的高毛利 SaaS 闭环;二是视频正从“内容生产工具”进化为“实时交互系统”的巨大潜力。

过去两年的视频模型虽突破了清晰度门槛,但仍未跳出“输入提示词、等待交付”的单向流程。真正的变革在于将控制权归还给推流进程:当视频能维持内部状态并实时响应多模态输入时,它便从静态结果转变为可被持续调用的动态系统。

Vidu S2 代表了这一转向的产品化成果。一旦该路线规模化,衡量指标将聚焦于单小时推理成本的降低、并发规模的提升以及长时运行的稳定性。资本所押注的,正是当视频从“内容产物”变为“交互软件”后,AI 视频市场边界的无限延伸。

体验地址:https://vidu.cn/vidu-stream

API 平台:http://platform.vidu.cn/vidu-stream/doc

技术报告:https://arxiv.org/pdf/2609.11638

【声明】内容源于网络
0
0
Z Finance
我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
内容 915
粉丝 0
Z Finance 我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
总阅读107.1k
粉丝0
内容915