大数跨境

技术解读|复杂人声干扰下,如何让 ASR “听对人”

技术解读|复杂人声干扰下,如何让 ASR “听对人” 阿里语音AI
2026-09-03
0
导读:从身份锁定到场景判断,解析 ASR 在复杂人声中选择正确交互对象的关键。

在安静环境里,语音识别的问题很直接:用户说什么,模型就转录什么。但在会议、车内或咖啡厅里,用户的声音经常会和旁人交谈一起进入麦克风。

假设用户说“打开导航”,旁边的人同时说“我们明天几点出发”。一种常见错误不是把“导航”识别成别的词,而是把两个人的话都写进结果。

模型并非没有听清,恰恰可能是听得太清楚了。旁人的声音完整、清晰,也符合语言规律,ASR 自然倾向于把它转成文字。可对产品来说,能听见的内容并不都应该输出。系统真正需要判断的是:

在同时出现的多路人声中,谁才是这次交互的主角?

问题也由此从“听清楚”变成了“听对人”。

真正的难点,不是噪声,而是人声

空调声、风声和道路噪声通常不包含明确的语言内容,传统降噪可以尽量保留语音、抑制非语音干扰。背景人声却不同:它同样包含音素、词汇和语法,对 ASR 来说是一段合理的语音。

因此,语音增强即使成功保留了“人声”,也可能同时保留用户和旁人。VAD 可以判断有没有人说话,却无法判断这个人是否在与设备交互。

(图1:传统降噪与目标说话人选择的任务差异

这不是普通的降噪问题,而是目标说话人选择:系统不仅要理解“说了什么”,还要决定“谁的话应该进入结果”。

两种路线,使用不同的目标线索

让 ASR 听对人,一种思路是给出说话人的身份,另一种思路是让模型判断谁处在交互前景。两者没有对错之分,只是使用的目标线索不同。

Target-Speaker ASR:用身份锁定目标

Target-Speaker ASR(TS-ASR,目标说话人语音识别)会先通过注册语音获得声纹或说话人特征,再从混合语音中寻找匹配的声音。这相当于给模型一张“声音证件”:即使目标更远、更小声,也以身份匹配为主要依据。

这类方案适合个人设备、固定用户或需要持续跟踪指定说话人的场景。边界也很明确:系统需要可靠的 speaker enrollment(说话人注册);注册语音质量、声音状态变化和声学环境失配,都可能影响效果。在缺少目标身份信息时,这类方案也无法确定需要跟踪的说话人。

前景说话人转录:用场景判断目标

另一条路线不要求提前知道用户是谁,而是根据距离、能量、方向、混响、时间关系和交互上下文,判断哪一路声音更像当前交互主体。为便于讨论,本文将这种以场景线索选择交互主体的思路称为“前景说话人转录”。

它没有注册门槛,更适合共享设备和免注册入口。但它依赖场景中存在足够明确的线索。如果两个说话人的距离、音量、方向和上下文完全相同,模型就没有充分依据做出选择。这是信息不足,而不是简单增加数据就能解决的问题。

两条路线不是替代关系:身份线索擅长持续锁定一个人,场景线索擅长发现当前正在交互的人。产品能获得哪种可靠线索,决定了更适合的路线;条件允许时,两者也可以组合。

数据底座可以共用,目标定义不能混用

两条路线使用的目标线索不同,需要构造的声学世界却高度相似。单人语音、转录文本、背景说话人、环境噪声、房间混响,以及重叠关系、音量比例、距离和方向,都可以进入同一套数据流水线。

同一段包含说话人 A 和 B 的混合音频,可以分别服务两种任务:Target-Speaker ASR 输入混合音频和 A 的注册语音,标签是 A 的文本;前景转录则把 A 构造成当前交互者,标签同样是 A 的文本。

(图2:Target-Speaker ASR 与前景说话人转录的数据构造对比

但同一段混音不能机械地共用标签。比如 A 是注册用户,却站得较远;B 没有注册,但正在麦克风前发起交互。对基于注册信息的 TS-ASR 来说,目标仍是 A;对前景路线,目标可能是 B。两类任务能够共用的是数据底座,不能混用的是任务语义

前景数据的关键,是把“前景”定义清楚

    回到开头的例子:训练输入中同时出现“打开导航”和“我们明天几点出发”,如果前者来自当前交互者,标签就只保留“打开导航”。这种关系反复出现后,模型才可能学会:能够识别,不代表应该输出。

    仅将两段语音随机叠加,还不足以形成有效的前景监督。数据至少要处理好三组关系。

    • 时间关系。前景与背景既可能同时说话,也可能前后出现。重叠样本训练模型在竞争中保持目标;非重叠样本则防止模型把单独出现、内容完整的背景语音顺手转录出来。

    • 能量关系。前景通常更近、更响,但这不是绝对规则。如果背景声永远很小,模型很容易把任务简化成“转录音量最大的人”。数据需要覆盖不同能量关系,让音量只是线索之一。

    • 空间关系。远场人声不只是音量更低,还包含距离、混响、拾音方向和设备响应等特征。只把背景语音调小,无法还原真实空间感。

    比混音参数更重要的,是标签定义始终一致。前景数据设计不是制造尽可能困难的干扰,而是在各种变化中持续表达同一件事:谁属于这次交互。

    ‍▎模型学到的不是“静音”,而是“选择”

    数据驱动方案不一定需要先从波形中彻底分离背景人声。目标不是生成纯净音频,而是得到正确文本;只要模型能降低背景内容的输出概率,就可以在识别层面实现目标说话人选择。

    训练希望模型形成的,是一套隐式的转录优先级:综合音量、距离、混响、时间关系和声学连续性,判断谁更像当前交互主体。训练中还要主动制造线索冲突,例如让背景不总是更小声,避免模型把“听对人”退化成一条脆弱的音量规则。

    即使一句话被听见、被听清,也不一定属于这次交互。

    ‍▎从识别内容,走向理解场景

    目标说话人选择是 ASR 从内容识别走向场景理解的一步。未来的语音系统不仅要知道“说了什么”,还要理解说话人的距离、角色、意图和交互关系,判断每段声音是否需要响应。

    让 ASR 在复杂人声干扰中“听对人”,只是开始。好的语音系统,不仅要听得清,还要知道自己在听谁。


     往期推荐 
     Recommend 






























































                                
    记得关注

    【声明】内容源于网络
    0
    0
    阿里语音AI
    阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
    内容 146
    粉丝 0
    阿里语音AI 阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
    总阅读1.1k
    粉丝0
    内容146