
Tavus 近日发布新模型 Griffin,将感知、对话和视频生成整合进同一个端到端系统。在演示中,AI 能像真人一样理解用户沉默的意图,仅在必要时提供提示,展现出极高的交互自然度。
首个“人类交互模型”:打破传统级联架构
10月1日,AI视频公司 Tavus 发布了研究预览版模型 Griffin-Lite,并将其定义为首个“人类交互模型”(Human Interaction Model,HIM)。该模型专为理解和生成实时面对面交流而设计。
在 Tavus 组织的测试中,54名受试者与模型进行1分钟视频通话,其中48%的人误以为对方是真人。在英伟达全双工音视频对话基准 VideoFDB 上,Griffin 的生成得分达到3.83分(满分5分),接近真人基准的3.92分。
Griffin 是一个全双工“视频到视频”模型,支持双方同时说话、实时反应,能够像真人聊天那样互相打断、点头附和或话语交叠。演示显示,当用户分享喜讯时,AI会即时给予表情和声音反馈;在游戏互动中,它能准确识别口令并做出相应手势;在用户思考停顿时,它则保持安静等待。

图丨Griffin的架构(来源:Tavus)
传统架构的痛点与革新
当前实时数字人多采用级联式系统:语音识别转文字、大语言模型生成回复、语音合成朗读、形象模型驱动口型表情。Tavus 指出,这种架构每次交接都会增加延迟并丢失信息(如语气细微变化),导致用户必须迁就机器节奏。
Griffin 采用端到端架构,将感知、决策和生成整合,三者并行运行。该方案由 Tavus 科研团队领衔,包括伦敦玛丽女王大学教授 Ioannis Patras 和帝国理工学院教授 Maja Pantic。团队学术论文累计被引用超9万次,伦敦玛丽女王大学也参与了联合研发。
技术解析:连续对话建模与流式生成
Griffin 系统主要由两部分构成:
连续对话建模引擎
该引擎同时接收音频与视频信号,摒弃传统的轮流模式,以不足1秒的“微轮次”持续评估对话状态。它决定何时开口、倾听、让出话轮、附和或保持安静,并输出控制信号,涵盖回复内容、说话时机、肢体姿态、面部表情及情绪语气。
音视频生成引擎
负责将控制信号实时转化为声音与画面,采用流式生成架构:
- 音频方面:使用自研 Tavec 音频编解码器,将48kHz音频压缩为连续潜在表示,不使用离散码本。解码器遵循因果逻辑,以最小10毫秒数据包实现边生成边播放。上层由自回归扩散 Transformer 模型生成语音,仅需约10秒参考音频即可克隆声音。
- 视频方面:采用步数较少的自回归扩散生成器搭配 VAE 解码器。只需一张参考照片,即可输出720p、25fps动态画面。每个潜在表示对应320毫秒视频,仅需扩散3步即可完成实时渲染。模型还能接收手势、视线和情绪控制信号,逐帧渲染人物肢体与背景。
为防止长时间对话画面失真,Tavus 采用了三阶段蒸馏训练:分布匹配蒸馏(DMD)、教师强制训练和自强制训练。
性能数据显示,在英伟达 H100 上,Griffin 从音频输入到视频输出的平均延迟为0.43秒,比现有最快方案低一半。在纯音频驱动视频模式下,其在 DOVER、FID 和 THEval 三项画质指标上均居首位,口型同步指标 LSE-C 排名第二。
评测表现:逼近真人交互水平
Griffin 的评测数据主要来自两组测试:
VideoFDB 基准测试
VideoFDB 是英伟达发布的首个全双工音视频对话智能体基准,涵盖视线回避、停顿、附和等11类非语言交流场景。
- 生成赛道:Griffin-Lite 得分3.83,远超基于 Gemini 2.5 搭配 Anam 数字人的级联方案(2.80分)。在“双人情感呼应”上得分为4.40,高于真人基准(4.14分);但在“非语言线索恰当性”上得分为2.83,略低于真人(3.18分)。主要差距在于响应速度,Griffin-Lite 中位响应时间为1892毫秒,而真人约为900毫秒。
- 感知赛道:Griffin-Lite 得分3.73(真人基准4.20分),优于开源模型 MiniCPM-o 4.5(3.40分)以及 OpenAI gpt-realtime(2.75分)和谷歌 Gemini 3.1 Flash Live(2.84分)。

图丨VideoFDB 基准测试结果(来源:Tavus)
真人盲测实验
在 Tavus 组织的实测中,受试者与 Griffin-Lite 进行1分钟视频通话。结果显示,48%的受试者认为对方是真人,而上一代系统仅有2.4%。判断对方是真人的受试者平均确信度为79%,判断为AI的为81%。多数察觉异样的受试者在前20秒内产生怀疑。需要注意的是,该研究由 Tavus 自行开展,样本量有限且无真人对照组。
商业化进程与合规挑战
目前,Griffin 尚未接入 Tavus 商业化平台。该平台拥有超过15万名开发者和企业用户,包括亚马逊、梅奥诊所和 Salesforce 等,主要应用于招聘、销售、教育和客服领域。
Griffin-Lite 现阶段仅提供给少数受信任测试人员,完整版后续推出。规划应用场景包括一对一辅导、棘手对话预演及技术指导陪伴。
Tavus 暂不对外开放的原因涉及合规问题。欧盟《人工智能法案》第50条规定,与人类直接交互的 AI 系统必须明确告知用户其 AI 身份。Tavus 表示,模型过于逼真的交互特质容易让用户误判,团队正在开发“安全披露”功能并与相关安全组织合作,待解决合规问题后将尽快推出,但具体时间表和定价尚未公布。

