大数跨境

首个通过“视频图灵测试”的模型来了?视频通话1分钟,近半数人没认出它是AI

首个通过“视频图灵测试”的模型来了?视频通话1分钟,近半数人没认出它是AI DeepTech深科技
2026-10-03
4
导读:这家数字人公司把感知、对话和视频生成放进了同一个模型。

Tavus 近日发布新模型 Griffin,将感知、对话和视频生成整合进同一个端到端系统。在演示中,AI 能像真人一样理解用户沉默的意图,仅在必要时提供提示,展现出极高的交互自然度。

首个“人类交互模型”:打破传统级联架构

10月1日,AI视频公司 Tavus 发布了研究预览版模型 Griffin-Lite,并将其定义为首个“人类交互模型”(Human Interaction Model,HIM)。该模型专为理解和生成实时面对面交流而设计。

在 Tavus 组织的测试中,54名受试者与模型进行1分钟视频通话,其中48%的人误以为对方是真人。在英伟达全双工音视频对话基准 VideoFDB 上,Griffin 的生成得分达到3.83分(满分5分),接近真人基准的3.92分。

Griffin 是一个全双工“视频到视频”模型,支持双方同时说话、实时反应,能够像真人聊天那样互相打断、点头附和或话语交叠。演示显示,当用户分享喜讯时,AI会即时给予表情和声音反馈;在游戏互动中,它能准确识别口令并做出相应手势;在用户思考停顿时,它则保持安静等待。

图丨Griffin的架构(来源:Tavus)

传统架构的痛点与革新

当前实时数字人多采用级联式系统:语音识别转文字、大语言模型生成回复、语音合成朗读、形象模型驱动口型表情。Tavus 指出,这种架构每次交接都会增加延迟并丢失信息(如语气细微变化),导致用户必须迁就机器节奏。

Griffin 采用端到端架构,将感知、决策和生成整合,三者并行运行。该方案由 Tavus 科研团队领衔,包括伦敦玛丽女王大学教授 Ioannis Patras 和帝国理工学院教授 Maja Pantic。团队学术论文累计被引用超9万次,伦敦玛丽女王大学也参与了联合研发。

技术解析:连续对话建模与流式生成

Griffin 系统主要由两部分构成:

连续对话建模引擎

该引擎同时接收音频与视频信号,摒弃传统的轮流模式,以不足1秒的“微轮次”持续评估对话状态。它决定何时开口、倾听、让出话轮、附和或保持安静,并输出控制信号,涵盖回复内容、说话时机、肢体姿态、面部表情及情绪语气。

音视频生成引擎

负责将控制信号实时转化为声音与画面,采用流式生成架构:

  • 音频方面:使用自研 Tavec 音频编解码器,将48kHz音频压缩为连续潜在表示,不使用离散码本。解码器遵循因果逻辑,以最小10毫秒数据包实现边生成边播放。上层由自回归扩散 Transformer 模型生成语音,仅需约10秒参考音频即可克隆声音。
  • 视频方面:采用步数较少的自回归扩散生成器搭配 VAE 解码器。只需一张参考照片,即可输出720p、25fps动态画面。每个潜在表示对应320毫秒视频,仅需扩散3步即可完成实时渲染。模型还能接收手势、视线和情绪控制信号,逐帧渲染人物肢体与背景。

为防止长时间对话画面失真,Tavus 采用了三阶段蒸馏训练:分布匹配蒸馏(DMD)、教师强制训练和自强制训练。

性能数据显示,在英伟达 H100 上,Griffin 从音频输入到视频输出的平均延迟为0.43秒,比现有最快方案低一半。在纯音频驱动视频模式下,其在 DOVER、FID 和 THEval 三项画质指标上均居首位,口型同步指标 LSE-C 排名第二。

评测表现:逼近真人交互水平

Griffin 的评测数据主要来自两组测试:

VideoFDB 基准测试

VideoFDB 是英伟达发布的首个全双工音视频对话智能体基准,涵盖视线回避、停顿、附和等11类非语言交流场景。

  • 生成赛道:Griffin-Lite 得分3.83,远超基于 Gemini 2.5 搭配 Anam 数字人的级联方案(2.80分)。在“双人情感呼应”上得分为4.40,高于真人基准(4.14分);但在“非语言线索恰当性”上得分为2.83,略低于真人(3.18分)。主要差距在于响应速度,Griffin-Lite 中位响应时间为1892毫秒,而真人约为900毫秒。
  • 感知赛道:Griffin-Lite 得分3.73(真人基准4.20分),优于开源模型 MiniCPM-o 4.5(3.40分)以及 OpenAI gpt-realtime(2.75分)和谷歌 Gemini 3.1 Flash Live(2.84分)。

图丨VideoFDB 基准测试结果(来源:Tavus)

真人盲测实验

在 Tavus 组织的实测中,受试者与 Griffin-Lite 进行1分钟视频通话。结果显示,48%的受试者认为对方是真人,而上一代系统仅有2.4%。判断对方是真人的受试者平均确信度为79%,判断为AI的为81%。多数察觉异样的受试者在前20秒内产生怀疑。需要注意的是,该研究由 Tavus 自行开展,样本量有限且无真人对照组。

商业化进程与合规挑战

目前,Griffin 尚未接入 Tavus 商业化平台。该平台拥有超过15万名开发者和企业用户,包括亚马逊、梅奥诊所和 Salesforce 等,主要应用于招聘、销售、教育和客服领域。

Griffin-Lite 现阶段仅提供给少数受信任测试人员,完整版后续推出。规划应用场景包括一对一辅导、棘手对话预演及技术指导陪伴。

Tavus 暂不对外开放的原因涉及合规问题。欧盟《人工智能法案》第50条规定,与人类直接交互的 AI 系统必须明确告知用户其 AI 身份。Tavus 表示,模型过于逼真的交互特质容易让用户误判,团队正在开发“安全披露”功能并与相关安全组织合作,待解决合规问题后将尽快推出,但具体时间表和定价尚未公布。

【声明】内容源于网络
0
0
DeepTech深科技
DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
内容 5690
粉丝 2
DeepTech深科技 DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
总阅读134.8k
粉丝2
内容5.7k