近年来,语音助手的识别与合成能力持续提升,"听清楚"已经不再是主要瓶颈。但用户在实际使用中经常会遇到这样的困扰:话音刚落,助手要等很久才反应;想打断,它却自顾自念完一整段话;随口应一声"嗯",它却当成一条新指令去执行。
这段声音是在跟我说话吗?(还是电视声、旁人闲聊、环境噪声?)
他说完了吗?(还是在思考、还想继续说?)
他想让我做什么?(真的有请求?还是只是随口附和?)
他在打断我吗?(是完整的新问题?还是才开了个头?)
这四项判断,正是人类对话中习以为常的能力:朋友说到一半停顿思考,我们会耐心等待而不是急着插嘴;一句"嗯、好的"会被理解为在听,而不是新问题;一声"等等,换个问题"会被立刻接住;即使旁边有人聊天、电视在响,也能分辨出哪些话是对自己说的。
▎技术揭秘:多模态大模型 × 话轮决策
要实现上面这些"像人一样"的判断能力,背后需要一套精心设计的技术架构。我们的方案核心可以概括为两句话:用多模态大语言模型,直接"听"原始音频做决策;用说话人感知和对话上下文,让决策真正"懂"语境。
传统方案通常先把语音转成文字,再基于文字分析语义。但这样做有一个致命问题:转文字的一瞬间,语调、停顿、音量、韵律——这些对话轮判断至关重要的信息全丢了。同样是"好的",上升语调是疑问,下降语调是肯定,拖长音是犹豫,这些微妙的声学线索在文字世界里荡然无存。
全双工语音交互话轮决策系统没有走这条老路,而是让多模态大语言模型直接接收原始音频——语调的起伏、停顿的长短、音量的大小、声纹的特征统统保留,并在一次模型推理中同时完成交互意图判断、话轮决策与回复内容生成。模型在理解"说了什么"的同时,也感知"怎么说的"——就像人类一样,既听内容,也听语气。
由于没有转写这一中间环节,级联架构带来的信息损耗和延迟叠加也随之消除。
(图1:全双工话轮决策系统架构)
(图1:全双工话轮决策系统架构)
系统支持两种说话人管理策略:
-
注册模式:绑定特定声纹,只响应"主人"的声音——适合个人手机、智能手表等隐私设备 -
开放模式:不预设谁能说话,而是通过对话积累逐步建立"熟人圈"——家人、同事自然加入,背景中的路人自动忽略
▎上下文敏感:同样的话,不同的意思
传统方案把每句话孤立地判断,而全双工语音交互话轮决策系统始终结合完整对话历史做决策。模型知道自己刚才"说了什么"(是在陈述、还是在提问),能感知用户的"说话习惯"(这个人喜欢思考时停顿、还是习惯一口气说完),也能理解"语境中的省略"——用户说"那上海呢",模型知道这是接着刚才的天气话题在问。
一个典型的例子:AI说"明天天气不错,适合出行",用户回应"好的",这只是一个附和——"我听到了,没别的事";AI问"要不要帮你查一下航班",用户回应"好的",这就是一个明确的回答——"帮我查"。同样两个字,含义完全不同。传统方案要么两个都当指令处理(过度反应),要么两个都忽略(漏掉真正的请求);而结合对话上下文,系统能够精准区分这两种情况。这种上下文敏感性,是单纯的声学模型或规则引擎难以做到的。
传统方案把每句话孤立地判断,而全双工语音交互话轮决策系统始终结合完整对话历史做决策。模型知道自己刚才"说了什么"(是在陈述、还是在提问),能感知用户的"说话习惯"(这个人喜欢思考时停顿、还是习惯一口气说完),也能理解"语境中的省略"——用户说"那上海呢",模型知道这是接着刚才的天气话题在问。
一个典型的例子:AI说"明天天气不错,适合出行",用户回应"好的",这只是一个附和——"我听到了,没别的事";AI问"要不要帮你查一下航班",用户回应"好的",这就是一个明确的回答——"帮我查"。同样两个字,含义完全不同。传统方案要么两个都当指令处理(过度反应),要么两个都忽略(漏掉真正的请求);而结合对话上下文,系统能够精准区分这两种情况。这种上下文敏感性,是单纯的声学模型或规则引擎难以做到的。
▎打断分级:从一声"嗯"到完整提问
当AI正在说话时,用户的"插嘴"也分很多种:
这是一个从"无意的聆听信号"到"明确的完整打断"的连续光谱。有了这套分级判断,AI既不会被一声"嗯"就打断思路,也不会在用户明确打断时还自说自话。
▎交互意图门控:嘈杂环境的第一道防线
真实世界不是录音棚。客厅里电视在放新闻,厨房有人喊"吃饭了",窗外有车鸣笛——麦克风把这些声音统统收进来。
为此,系统设有一道"交互意图门控":在理解语义之前,先回答一个更根本的问题:"这段声音是在跟我说话吗?"
通过声纹特征、说话方式、内容指向等多维信号,系统能在分析语义之前就过滤掉绝大部分无关音频。就像一个老练的服务员——即使餐厅嘈杂,他也能精准捕捉到你投来的目光和话语。
(图2:方案对比流程图)
▎数据指标和真实音频示例
我们在Full Duplex Bench数据集上,对四个核心话轮场景上,与公开的双工方案做了正面对比:
-
停顿处理(Pause Handling):用户说话中途停顿思考时,AI 是否能耐心等待,而不是急着抢话;
-
平滑轮换(Smooth Turn-Taking):用户说完后,AI 能否自然、及时地接过话头;
-
用户打断(User Interruption):用户中途插话时,AI 能否准确识别并及时让出话轮;
-
用户附和(User Backchannel):用户说"嗯""好"表示在听时,AI 是否能不被干扰、继续表达;
(图3:全双工滑轮决策能力对比(准确率))
▶ 高噪办公场景下的抗干扰能力展示
▎结语
目前,我们新发布的Qwen-Audio-3.0-Realtime已集成这套全双工语音交互话轮决策系统,欢迎前往阿里云百炼体验边说边听的自然对话能力。
欢迎体验
https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr#/model-market/detail/qwen-audio-3.0-realtime-plus?serviceSite=asia-pacific-china
模型上新|Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?

