在直播互动或客服场景中,用户常遭遇所谓的"AI 主播”:表面拟真,一旦深入提问或中途打断,便立刻卡壳,机械地复述预设台词。

然而,若屏幕中的 AI 真正具备“生命感”,体验将截然不同。近期,Vivix 发布的 A1 与 W1 两款模型,正将这一设想变为现实。这两个模型生成的 AI 角色彻底摆脱了过往的机械僵硬感,实现了高度拟人化的实时交互。
1 秒接话:重构实时交互体验
传统数字人主播通常采用“三步走”流程:ASR(语音转文字)、LLM(大模型生成文本)、TTS(文字转语音并匹配口型)。这种串联式处理导致生成延迟高,且动作、表情与口型难以完美同步,显得生硬别扭。

尽管现有 AI 视频生成技术画质出色,但因算力需求过高,难以满足实时反馈要求,往往只能循环播放预设片段。Vivix A1 模型旨在突破这一瓶颈,实现秒级画面实时生成与即时问答。
相较于以往数字人局限于固定机位和预设手势,Vivix A1 实现了全身交互。AI 角色不仅能自由走动、变换场景,还能与周围物品产生自然互动。在直播电商等场景中,虚拟主播可根据用户反馈实时调整讲解策略、灵活过款或切换商品。
此外,A1 生成的角色动作流畅自然,有效避免了动作崩坏或逻辑混乱。虽然在极致画质上略逊于离线渲染模型,但在实时互动领域,其流畅度与清晰度已属行业颠覆性突破。
无限扩展:打造沉浸式动态世界
如果说 A1 创造了逼真的“演员”,那么 Vivix W1 模型则构建了可沉浸式体验的“世界”。W1 有望彻底改变游戏与影视的交互形态。
传统互动影视游戏(如《底特律:变人》)受限于预设剧本和分支选项。而 W1 模型支持无剧本模式:镜头切换、画面生成、配音及背景音乐均可实时产出。故事走向完全由用户指令决定,每一次体验都是独一无二的“导演之作”。
W1 的核心突破在于将多模态参考、流式生成和原生交互整合至同一模型。通过底层算法优化,它在保证秒级响应的同时,维持了顶级的画面质量与剧情连贯性。
瞬间生成未来:全链路技术重构
主流视频生成架构(如 DiT)多为离线模式,需预先设定完整提示词并耗时渲染,无法应对实时交互中的随时打断或行为变更。实时音视频场景的数据吞吐量是文本交互的千倍至万倍,对旧架构构成巨大挑战。Vivix 从模型架构、基础设施到数据平台进行了全面重构:
模型架构与交互层
Vivix 摒弃了传统的离线生成及“音视转文字”的繁琐链路,建立了原生多模态统一的流式架构。语音、文字、图片及场景上下文作为原生信号直接输入模型,W1 可在秒级内同步协调动作、对白、音效、镜头调度及剧情发展。
训练与推理架构层(Infra)
强大的基础设施是技术落地的关键:
- 训练端:重构管线支持原生 2K 10bit 长视频训练。结合自研 Sparse Attention(稀疏注意力机制)压缩时空特征,激活参数达 30B 的视频模型可在一个月内完成稳定训练。
- 推理端:实现 FP4 无损推理,支持“快思考”与“慢思考”双模式,使“打断”成为原生体验。
过去一年,Vivix 将实时视频推理成本降低了两个数量级,目前已接近云游戏及流媒体服务成本,大幅降低了使用门槛。
数据平台层
针对市场上缺乏的实时交互数据,Vivix 构建了独家的“观测—交互—生成”数据三元组,积累大规模精标数据,并通过数十个专家模型组成自动化处理管线,确保模型能精准学习人类介入后的内容演变。
当然,前沿技术仍有迭代空间。A1 在处理极高速复杂动作或精细手部抓取时,偶现物理逻辑偏差;W1 的实时画质亦有提升余地。但瑕不掩瑜,作为实时交互技术的先行者,Vivix 正推动交互式 AI 视频重塑未来的娱乐与社交方式。
随着技术成熟,实时互动 AI 将在更多场景落地。对于这项随叫随应的新技术,您最期待将其应用于何种场景?欢迎交流探讨。

