大数跨境

技术漫谈|语音识别的"幻觉":听不清的时候,AI 为什么开始编

技术漫谈|语音识别的"幻觉":听不清的时候,AI 为什么开始编 阿里语音AI
2026-08-27
1
导读:衡量语音识别是否可靠,不止于听清多少,更在于未听清时是否懂得留白。

很多人第一次遇到语音识别的"幻觉",是在一段几乎没有人声的录音里。

会议散场后忘了关录音,最后十分钟只有空调声和收拾东西的动静。转写结果却工整地写着一句:"谢谢观看,请点赞订阅。"

没有人说过这句话。模型也不是听错了某个字,而是凭空写出了一整句完全通顺、完全不存在的话。

这类错误和我们熟悉的"听错"不一样。听错,是听清了但写错了词,而幻觉则是音频里没有对应内容,模型却依然生成了文字。随着越来越多的语音识别系统引入生成式模型,这类问题也值得被单独拿出来讨论。

幻觉长什么样

真实系统里的幻觉,大致有三种面孔。

无中生有:输入是静音、纯噪声、音乐或者一声咳嗽,输出却是一句完整的话。而且往往不是随机乱码,而是训练数据里的高频句式——"谢谢大家"、"下期再见"、"字幕由某某提供"。模型在没有信息可依的时候,退回到了它最熟悉的口头禅。

停不下来的复读一句话说到一半被打断,或者尾音拖得很长,模型就可能开始循环——"我们下周再确认一下我们下周再确认一下我们下周再确认……"。这时,它已经不完全是在跟随音频,而是在顺着自己刚刚生成的内容继续往下写。

顺滑的改写:这一种最危险。原话是"这个指标大概涨了两三个点吧,我记不太清",转写成了"这个指标涨了三个点"。听起来更干净,读起来更专业,但犹豫被抹掉了,数字被确定了,原本的不确定性随之消失,语义被悄悄改变了。

前两种一眼就能看出不对,第三种通常要回去听录音才能发现。而现实中,大多数人不会逐句回听录音。

为什么它会“编”

要理解幻觉,得先看清生成式 ASR 到底在做什么。

传统语音识别更强调声学信号与文字之间的对应关系:什么时间出现了什么声音,对应什么音素、字或词。它当然也会错,但错误通常和输入音频有更直接的关系——漏字、错字、同音词,或者干脆识别不出来。

生成式 ASR 换了一套逻辑:它一边参考音频,一边像语言模型那样预测"下一个字最可能是什么"。这带来了巨大的收益——口语里的省略更容易被理解,中英夹杂和专业术语可以借助上下文识别得更准确,长段落里的表达也更连贯。但它也带来了一个副作用:当音频提供的证据变弱,语言模型自身的先验就可能变得更强。

这就像一个经验极其丰富的速记员。大部分时候,经验让他又快又准,但当一句话没听清时,他会不自觉地按"这种场合通常会说什么"把空白补上,而且补得毫无破绽。

更根本的原因藏在训练数据里。我们喂给模型的,绝大多数都是"有人在说话,并且对应一段文字"的样本。模型从头到尾学到的隐含规则是:给我一段音频,你就要产出文字。但“这里没有人说话,正确答案就是什么都不输出”同样是一种重要能力。如果静音、噪声、音乐和各种非语音片段在训练中覆盖不足,模型就很难真正学会:沉默本身,也可以是正确答案。

评价方式也可能进一步放大这个问题。词错误率这类传统指标主要关心整体上漏了多少、错了多少,却很难单独体现“在不该输出的时候生成了一段内容”有多严重。一段静音里凭空多出一句话,放进几万字的整体统计中,可能并不起眼。于是我们长期更关注模型”说得准不准“,却很少单独追问它”该不该说“。

编一句话的代价,不止一句话

如果语音转写只是给人看的文字稿,幻觉的代价还相对可控。但今天的语音识别,越来越多地处在一条链路的最前端。

会议记录后面接着摘要、行动项提取、责任人识别、知识库沉淀和后续问答。语音识别提供的是这条链路上的第一层事实。第一层错了,后面每一层都会在错误的地基上继续加工——而且加工得越精致,越不容易被质疑。

一句幻觉出来的"这个方案我们下周上线",可能变成会议摘要里的一条结论,变成待办列表里的一个任务,变成周报里的一行进展。整个链路上没有任何一环显示"此处存疑",因为幻觉最麻烦的地方,恰恰在于它看起来毫无问题。

识别错一个字,人一眼能看出来;凭空“编”出一句话,人常常看不出来。这才是它真正棘手的地方。

怎么让模型学会“闭嘴”

这件事没有单点解法,但方向已经比较清楚了,大致可以分成四层。

数据层:把"沉默"当成正经答案来教。在训练数据里认真加入静音、纯噪声、音乐、环境声,以及咳嗽、笑声、椅子响这些非语音的声音,并且明确告诉模型:这些的正确输出就是空。听起来朴素,但效果往往最直接——模型会“编”,很多时候只是因为从没人告诉过它可以不说。

解码层:给自由发挥加上约束。限制重复、对输出长度和音频时长的关系做校验、要求每段文字对得上时间锚点。如果模型声称有人在第 12 分 30 秒说了一句话,那这段时间里至少应该存在相应的语音活动或声学证据。这类一致性检查能拦掉相当一部分明显的无中生有。

能力层让模型学会表达不确定。一个成熟的系统应该能说"这里我不确定",而不是永远给出一个确定的答案。输出置信度、保留时间戳、把低置信度的位置标出来交给复核,比硬着头皮生成一段通顺的错误要有价值得多。这需要在训练目标里就为"承认不确定"留出位置。

评测层:把幻觉率单独拎出来看。词错误率会把幻觉平均掉,所以需要专门的幻觉指标:静音和噪声输入的空输出率、重复片段的出现率、无对应音频的文本比例。不被单独度量的问题,通常不会被认真解决。

不止是语音识别

语音识别的幻觉,其实是生成式模型的一个共性问题在音频领域的显影。

只要一个模型的训练目标是"给出下一个最可能的输出",它就永远有把"我不知道"翻译成"一个听起来合理的答案"的倾向。文本大模型编造参考文献,代码模型调用不存在的函数,语音模型面对模糊甚至不存在的语音时,也可能补出一句“这里似乎应该出现的话”。它们面对的是不同任务,但问题很相似:生成一个流畅的结果相对容易,知道什么时候证据不够、应该停下来,却需要被专门训练和约束。

语音识别又有一点不同:它的输入是物理世界的声波,是有客观答案的。这既让幻觉显得格外不该发生,也给了我们一个别的领域羡慕的抓手——我们可以拿音频本身去核对文本,时间对得上不对得上,能量有没有,这些都是可验证的。

因此,衡量一个语音识别系统是否可靠,不应该只看“它听清了多少”,还要看“它没听清的时候,会怎么做”。真正可靠的系统,不是任何时候都能给出一个完整答案,而是在证据不足时,知道哪里该停下来、哪里该保留不确定。

听清的,准确记录;没听清的,如实留白。对语音识别来说,学会“不说”,和学会“说对”同样重要。



 往期推荐 
 Recommend 






























































                            
记得关注


【声明】内容源于网络
0
0
阿里语音AI
阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
内容 146
粉丝 0
阿里语音AI 阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
总阅读1.1k
粉丝0
内容146