诺兰的《星际穿越》中,平行时空的交汇需依赖摩斯密码。而如今,AI 已能“附身”于任意物体或角色,使其在虚拟世界中开口说话、行动自如,并与用户进行实时视频通话。
例如,一只虚拟小猫不仅能说着俏皮话,还能同步做出弓背、摇尾、抬爪等动作,甚至在场景中自由走动,其脚下影子也会随环境实时变化。这些反应并非预设编排,而是基于用户声音输入即时生成的动态反馈。
这一能力背后,是 Vivix 最新发布的实时交互多模态模型 A1。该模型让用户能像拨打视频电话一样,与屏幕另一端的虚拟角色持续交流。
与传统数字人或视频生成模型不同,A1 赋予角色真正的“身体”。它不再局限于对着镜头说话,而是能够转身、改变姿态,并与环境中的物体持续互动,营造出仿佛连接另一个平行世界的沉浸感。
与此同时,Vivix 同步推出了世界模型 W1。W1 允许用户不再只是旁观者,而是可以随时介入剧情,改变人物的选择、行动乃至故事走向,实现真正的“实时导演”。
如此复杂的实时交互对算力要求极高。但据 Vivix 技术博客介绍,A1 虽拥有近 30B 激活参数,却通过 MJD 多维联合蒸馏、原生 NVFP4 训推策略,以及自研的通信 - 计算调度与 mega-kernel 推理基础设施,将部署门槛降至消费级 GPU。在近似画质下,其推理效率提升了近两个数量级。
数据显示,A1 流式调度器响应新输入的最短时间仅为 300 毫秒,从用户发出指令到画面呈现可见反应,平均延迟低至 0.6 秒,基本实现了话音刚落、角色即动的无缝体验。
统一流式架构与原生交互建模
要实现这种“平行世界视频电话”,首要任务并非让角色回答多么智能,而是确保其在持续生成过程中,始终保持角色身份一致、身处同一世界。
Vivix 将 A1 定位为全球首个在原生流式架构中,统一多模态参考、实时交互和流式生成的基础模型。其核心在于解决三个难题:参考条件需持续生效、新交互需随时插入、音视频需连续生成。
统一多模态参考、交互与流式生成
A1 将多模态参考、实时交互和视频生成整合进一套原生流式架构。传统基于 Clip 的视频模型通常一次性生成完整片段,易于统筹前后画面;而流式生成需在未知未来的情况下,边看已生成内容、边接收新指令,实时预测下一帧。
这如同“边铺铁轨边开火车”,极易导致角色外形漂移或空间关系破坏。若为求稳定而限制角色活动,则失去了“拥有身体”的意义。
A1 通过将图片、视频、声音、交互历史及已生成内容共同写入持续状态,利用因果时序建模和流式状态维护,既保证相邻动作的自然连续(局部连续性先验),又维持长时段内的角色身份与场景关系(全局序列先验)。这使得 A1 能在避免视觉漂移和误差累积的同时,支持角色大幅度的自由运动。
Speech、Audio、Gesture 与 Event 统一建模
现有数字人多采用"ASR 转文字 -LLM 生成回复-TTS 转语音 - 动作模型补口型”的串行流水线。这种方式不仅延迟高,且语气、环境音、手势等非文本信息在转写中易丢失。
A1 摒弃了以 ASR 文本为唯一中间表示的做法,直接对语言语义、声学特征、非语言声音、环境事件、手势及动态视觉信号进行统一建模。
模型能在约 300 毫秒的最小时间片内,基于多模态上下文(含音视频参考、系统提示、历史帧等)推理出响应 Token,实现“快思考”。上层的 Director Agent 则负责“慢思考”,异步规划长时序宏观行为。用户的语气变化、环境突发声响或画面新手势,均可成为触发信号,实时调整尚未生成的内容,实现感知、规划、控制与生成的实时链路闭环。
MJD 把 8-Step 压缩到 2-Step
视频扩散模型的采样步骤通常承担不同任务,直接减少步数往往牺牲画质与稳定性。Vivix 提出 MJD(多维联合蒸馏),将原本 8-Step 的质量基线压缩至 2-Step 推理。
MJD 同时优化三大目标:
- 短时生成质量:保留快速采样下的视觉细节与运动表现;
- 长时时序一致性:抑制连续生成中的漂移与累计误差;
- 多模态分布对齐:对齐潜空间、像素空间及语义动作分布。
通过让学生模型学习教师模型完整的动作分布,并在潜空间与原始数据空间双重优化,A1 在 2-Step 推理下仍保持了接近 8-Step 版本的画质、指令遵循度及长期稳定性。
近 30B 激活参数模型如何跑进消费级显卡
市面现有的实时视频模型多依赖小参数量或高压缩比 VAE,牺牲了模型容量,导致大运动受限或伪影频发。Vivix A1 有效激活参数近 30B,采用 8x8x4 高质量压缩率,对推理成本与实时性提出极大挑战。为此,Vivix 推出了 VMI(Vivix Model Infra)基础设施。
Encoder 与 Decoder 解耦
VMI 将多模态 Encoder(处理参考条件,适合大批量高吞吐)与 Real-Time Decoder Loop(逐帧生成,追求低延迟)拆分为独立服务,分别配置资源池与扩缩容策略,避免批量任务阻塞实时链路。
此外,VMI 在推理阶段引入 Prefill/Decode 分离,并重构 KV Cache 传输层,形成面向实时视频生成的 PD 分离架构。这套机制支持稳定连续生成、模型级打断与实时重定向,使流式调度器响应新输入最短仅需 300 毫秒,端到端平均延迟低于 0.6 秒。
原生 NVFP4 训推协同
为解决大模型在消费级显卡上的显存与计算瓶颈,VMI 采用 4-bit 精度。针对视频扩散模型对量化误差敏感的问题,VMI 将 Blackwell GPU 支持的 NVFP4 GEMM 设为目标推理路径,并在训练蒸馏阶段引入低精度感知蒸馏,让模型提前适应 4-bit 数值分布。
同时,加入专门的去噪误差校正机制,压制量化误差在时间步与连续帧间的累积。实测表明,NVFP4 相比 BF16 基线实现了近乎无损的生成质量,同时显著降低显存占用并提升吞吐。
极致的计算、通信调度与 mega-kernel
在多卡系统中,GPU、PCIe 与显存的等待是隐形瓶颈。VMI 构建计算 - 通信 - 内存协同调度引擎,将三者纳入统一推理执行图。
通过将 Attention 通信、显存 Offload 等任务运行在不同 CUDA Stream 中与计算重叠,并将计算与通信融合进 Mega Kernel 以减少状态写回,最后利用 CUDA Graphs 将数百次 Kernel Launch 压缩为少量统一提交。测试显示,VMI 单卡吞吐超 10000 video tokens/s,多卡链路 PCIe 带宽利用率达 88% 以上。
从一个角色,到一个持续演变的世界
通过统一流式架构、原生交互建模、MJD 蒸馏、编解码解耦、NVFP4 训推协同及极致调度六大技术突破,Vivix A1 成功将近 30B 参数模型带入消费级显卡的实时交互时代。
A1 交付的不仅是一个概念,而是一套已运行的原生流式多模态模型,让屏幕另一端的 AI 真正“活”了起来。而 W1 的推出,则旨在让这个角色身后的世界,随用户的选择共同演变。
虽然距离真正的“平行世界”尚有距离,但这通来自未来的视频电话,已经传来了第一声清晰的回音。

