大数跨境

The Batch: 975|语音识别迎来智能体时代

The Batch: 975|语音识别迎来智能体时代 DeeplearningAl
2026-08-28
3

Hi~新朋友,记得关注我们哟

大多数语音转文字系统仅支持一次性转写,难以修正输出错误。研究人员最新构建了一种支持交互式纠错的系统。

最新消息:来自上海交通大学、浙江大学、复旦大学及微软分拆公司 Xiaoice 的研究团队(Zixuan Jiang、Yanqiao Zhu、Peng Wang 等),设计了一套将自动语音识别(ASR)引擎与大语言模型(LLM)配对的工作流。该系统能在每轮对话中检测并纠正转写错误,被命名为 Agentic ASR。

关键见解

传统自动语音识别系统通常结合 LLM 重写输出来处理错误,但直接追加用户更正或要求 LLM 全文重写均存在引入新错误的风险,尤其在处理独特词汇(如人名 Megan 与 Morgan)时。Agentic ASR 将纠错拆解为“定位错误”、“理解意图”和“应用修正”三步,使 LLM 扮演编辑而非改写者角色,显著提升了修改成功率

工作原理

Agentic ASR 将转写视为多轮优化过程:用户口述后,可在后续轮次中确认或更正内容。

  • 初始生成:语音引擎(Qwen3-ASR-1.7B)生成初步猜测,LLM(Qwen3-32B)基于现有结果进行优化。
  • 意图分类:LLM 将用户输入归类为三种意图:(i)确认(接受当前结果);(ii)新输入(继续添加内容);(iii)更正(修改已有内容)。
  • 精准修正:针对“更正”意图,LLM 识别需编辑片段,解析用户修正指令(如“不是 Morgan,是 Megan"),并执行局部修改,保留其他正确内容。

测试结果

研究团队在多语言语音转文字基准上评估了该工作流。由于基准缺乏纠错样本,团队利用 LLM 和文本转语音引擎模拟了“口述 - 纠正”的多轮交互过程,并提出 S²ER 指标衡量语义错误保留比例。

  • 整体表现:多轮交互在所有基准上持续降低语义错误,主要提升集中在前几轮。
  • GigaSpeech 基准:S²ER 从第 0 轮的 21.5% 降至 10 轮后的 3.5%;词错误率(WER)从 11.9% 改善至 10.4%。
  • AISHELL-NER 基准(含大量实体信息):S²ER 从 19.9% 大幅降至 2.0%;命名实体错误率从 2.4% 降至 1.2%。
  • ASRU2019 基准(多语言混合):S²ER 从 28.6% 降至 1.4%;混合错误率从 6.6% 降至 3.3%。

重要原因

许多语音输入系统核心在于理解用户意图,而非逐字识别。Agentic ASR 在此方面表现优异,同时在需要高精度逐字记录的场景中,也能以自然交互方式提升鲁棒性。随着语音交互界面的普及,这一能力愈发关键。

行业展望

将纠错流程拆解为“定位 - 理解 - 应用”的三步工作法,不仅优化了语音转写,更为文档编辑、代码审查及设计方案迭代等交互式任务提供了潜在的技术蓝图。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1319
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读19.6k
粉丝0
内容1.3k