说话时不自觉地在中文里夹几句英文——"这个 project 的 deadline 快到了""帮我订一个 meeting room 讨论一下"——这种语言现象叫做"语码转换"(Code-Switching)。在全球化语境下,它已经成为日常交流的一部分。但对语音识别(ASR)系统而言,准确理解这类混搭表达至今仍是公认的难题。
这个project的deadline快到了
好,帮我订一个meeting room讨论一下
过去几年,语音识别的准确率在大语言模型的推动下有了质的飞跃——纯中文或纯英文场景下,主流系统已经做得相当不错。但语码转换场景不同:一句话里从中文切到英文再切回中文,系统需要同时掌握两套语言规则,还得准确判断每一个"切换点"。更关键的是,传统训练方法在优化目标上就与语码转换的需求存在结构性错位。Fun-ASR 的研究者们引入强化学习与多维度奖励设计,试图从根本上弥合这一差距。
▎传统训练为什么难以处理语码转换的场景?
要理解这个难题的根源,需要先看清传统方法的局限。
目前训练语音识别模型的主流方法叫"交叉熵损失"。这个名字听起来很专业,但核心思想其实很简单:让模型在每个时刻都尽量猜对下一个字。然而,评价语音识别质量的核心指标是"词错误率"(WER),即转录文字与原文之间的不一致比例。这就出现了一个结构性矛盾:训练时优化的是A指标,但实际考核的是B指标。就好比你平时练的是投篮,但比赛比的是运球过人——两者虽然相关,但并不完全一致。
在语码转换场景下,这种错位被进一步放大:模型不仅要把每个字说对,还要把短语结构识别对,甚至要能判断当前说的是哪种语言。训练目标与评价标准之间的差距,在这里被拉到了最大。
那有没有办法让模型直接学习我们真正关心的指标呢?答案是强化学习(RL)。
强化学习的思路非常直接:就像训练小狗一样,做对了给奖励,做错了不给奖励。具体到语音识别,我们可以让模型对同一段语音生成多个不同的转录结果,然后用"词错误率"来打分——转录越准确,奖励越高。模型通过不断尝试和调整,逐渐学会生成更好的转录。这个过程跟人类学习说话其实有几分相似。婴儿学说话时,并不是靠一本"发音教材"逐字练习的,而是通过观察周围人的反应——说对了会得到微笑和鼓励,说错了会被温柔地纠正。心理学家把这种学习方式叫做"社会影响",而强化学习正是对这一过程的数学化模拟。
(图1:Fun-ASR 强化学习训练流程)
(图1:Fun-ASR 强化学习训练流程)
▎不止看一个字:多维度奖励与动态权重
不过,如果只用"词错误率"一个标准来打分,就像考试只看总分——你很难知道学生到底是阅读理解不行,还是作文没写好。
最近Fun-ASR就在这个方向上迈出了一步。Fun-ASR的研究者们认为,评价一段语码转换的转录质量,不能只看"字对了没有"这一个维度。好的转录还应满足:短语和词组保持完整(比如"deadline"是一个整体,不该被拆成"dead"和"line"),语言切换点被正确识别,声音发生的环境被合理感知,音频内容被准确理解。于是他们设计了一套多维度奖励系统,从字词准确度、短语完整性、语言识别能力、音频理解能力等层面同时给出反馈。这就像给学生安排了多个不同科目的老师分别点评,而不是只靠一个班主任给个笼统的分数。
此外,他们还引入了动态权重调整机制:如果某个维度的评分差异很小(说明该维度对当前模型来说区分度不足),系统就会降低它的权重;反之,评分差异越大的维度,权重越高。这种策略让模型能够将学习资源集中在最有信息量的方向上。
▎效果验证:准确率提升,泛化能力超预期
研究者们在多个数据集上验证了这个方案的效果,包括学术公开数据集和真实的工业场景。结果显示,相比传统训练方法,强化学习带来的改进相当显著,不仅整体识别准确率有明显提升,在公认的难度基准上还刷新了纪录。值得注意的是,部分测试中的语码转换模式甚至没有出现在训练数据里,说明模型确实学到了"举一反三"的能力,而非仅仅记忆训练样本。
(图2:SEAME 语码转换基准的评测对比图)
(图2:SEAME 语码转换基准的评测对比图)
▎更大的图景
这项研究的意义不止于让语音识别在"夹杂外语"时更准。它揭示了一个更具普遍性的思路:当AI系统有明确的、但跟训练目标不完全一致的评价标准时,强化学习可以成为连接两者的桥梁。


