大数跨境

论文解读|Dual-Axis RM:兼顾语义理解和说话时机的生成式奖励模型

论文解读|Dual-Axis RM:兼顾语义理解和说话时机的生成式奖励模型 阿里语音AI
2026-07-21
4
导读:阿里双轴奖励模型:首次解耦全双工对话的语义与时机

全双工语音对话模型(Spoken Dialogue Model, SDM)已经能够同时进行听、说与被打断的实时交互。但一个更基础的问题始终没有被充分回答:

为全双工 SDM 设计强化学习训练时,应当以何种信号作为奖励?
现有方法大多只覆盖评价的单一维度。帧级对齐、VAD 触发计数等指标仅关注时序细节;LLM-as-a-Judge 仅关注语义相关性;人工评价质量最高,但其成本、稳定性与吞吐难以支撑在线 RL 循环。事实上,自由对话的质量由两条彼此正交的评价轴共同决定:语义相关性(回答是否切题)与交互时机(轮次衔接是否恰当)。任一维度出现失败都会导致整段对话质量下降,仅捕获其中一维的评估器无法提供有效的 RL 信号。
本文提出的 Dual-Axis Reward Model 针对上述问题,将 SDM 的失败沿语义与时机两个轴显式解耦:由单一 LLM 同时输出两条独立的思维链(CoT),并合成一个 0/1 二值总分,既保留了 RL 所需的单一标量奖励,又保留了区分内容错误与时机错误的诊断信息。这项来自阿里团队的最新研究已被 ACL 2026 主会接收,其提出的生成式奖励模型兼顾了语义理解与说话时机,为后续在线 RL 训练提供了更可靠的接口。

什么是双轴生成式奖励模型?

具体而言,本文定义了一个更严格的全双工评估设定:以一段双轨(dual-track)音频对话为输入,由单一 LLM 同时输出两条独立 CoT 与一个 0/1 二值总分——一条 CoT 分析内容(Response Relevance),一条 CoT 分析时机(Interactional Fluency);仅当两轴均判定为合格时 S=1,任一轴判定为失败则 S=0。奖励模型的整体输出可记为:

由此,语义评估与时机评估被整合进同一模型,一次前向即可给出两条推理链与一个可直接用于 RLHF 的 win/loss 标量,从而将全双工对话的奖励接口收敛为一条由双轨音频到 0/1 分数的统一路径。

(图1:双轴评估器与传统四类方法的对比——代理神谕、行为统计、指标套件、人工专家各有局限,双轴模型同时给出时机 / 内容分析并合成整体分

最终奖励被设定为 0/1 而非 Likert 尺度,主要基于三点考虑:与 RLHF 的 win/loss 口径保持一致;二值标注的人工一致性显著高于多分制;用户对失败对话的判断本身趋于二元。二值化使 RL 目标更明确,也降低了训练信号受打分尺度漂移的影响。
双轴奖励模型是怎么做到的?

模型架构

就架构本体而言,模型构建于 Qwen-2.5-Omni-7B 之上,将输出格式约束为三个 XML 块——<response think> 承载语义 CoT,<fluency think> 承载时机 CoT,<score> 承载最终的 0/1 分。即以一段双轨音频为输入,输出两条推理链与一个可直接用于 RL 的标量奖励。

然而在训练之前存在一个前置问题需要解决。语义轴的判定相对可行,回答是否切题可由语言理解能力大致判断;时机轴的判定则缺乏依据——某次插话是否构成不当抢话、某段停顿意味着说话人仍在组织语言还是已让出发言权,若缺乏统一的界定标准,CoT 将无法给出可核验的分析,最终的 0/1 分也难以解释。因此,在数据构造与训练之前,需要先为全双工交互建立一套形式化分类学,明确界定对话由哪些结构成分构成。

具体而言,根据说话人在某时刻的发声状态,严格区分三类基础结构单元:停顿(同一说话人话语内部的静默)、间隙(说话人切换之际双方均静默)与重叠(两名说话人同时发声)。在此基础上进一步定义成功打断、失败打断、反馈语等交互事件。基于这套结构定义,SDM 的常见失败被沿两个正交的轴加以组织:

(图2:交互构件与错误分类学。上排:Pause / Gap / Turn / 平滑轮转 / 成功打断 / 反馈语;下排:语义类 vs. 时机/轮次类错误

语义轴涵盖上下文不连贯与打断失忆(Assistant Self-Amnesia / User Content Amnesia);时机 / 轮次轴涵盖“过反应”的不当抢话与过度让位,以及“欠反应”的迟到接话与忽略打断。由此,整体质量不佳的对话被分解为可逐项指认的失败类型。

这套分类学在全文中承担三重作用,构成各环节之间的统一基础。

  • 其一,它是 CoT 的推理框架:模型输出两条 CoT 的过程,实质是将观察到的交互现象与该分类体系逐项比对、判定其所属类别,从而将模糊的整体印象转化为具体的失败判定(例如在某一时刻发生的一次失败打断)。

  • 其二,它是数据构造的坐标系:由于失败类型被界定为有限且互斥的类别,才可反向依据这些类别在脚本中程序化地注入不当抢话、反馈语、过长间隙等事件,从而系统性地覆盖完整的失败谱系。

  • 其三,它是评测与消融的统一标尺:后续细粒度评测集(FG)的四类标签,以及逐轴、逐阶段的消融分析,均以同一分类体系为依据。因此,后文的数据构造与训练流程均建立在这套分类学之上。

数据构造

为训练一个能够深度理解对话互动动态的生成式奖励模型,本文设计并执行了一套多阶段合成数据生成流程。其核心目标是构建一个大规模、多样化、带有丰富标注的双轨音频数据集——它不仅包含理想、流畅的对话,也系统性地覆盖了真实人机交互中常见的各类失败模式。

整个流程包含四个主要阶段:

  • 源数据筛选与改写:从多个公开对话数据集中提取并改写文本对话,覆盖开放域社交、任务导向、多轮指令等多种话题与语言风格,为后续注入交互事件准备多样化底料。

  • 通过程序生成互动事件与错误:以平滑轮转为基准场景,借助 LLM 与精心设计的提示词,在对话脚本中注入各类成功互动事件与特定互动错误(如不当抢话、将反馈语误判为打断、忽略打断等),并逐一记录其发生时刻与时长。

  • 思维链(CoT)标注生成:借助一个强大的教师模型,针对每个由元信息描述的对话场景,给出解耦的双路分析——时序流畅性与内容相关性——及最终的二值分数,作为后续推理蒸馏的监督信号。

  • 双轨音频合成与多任务数据构造:将标注脚本合成为双轨音频,每条声道对应一名说话人,并借助对发声动作的精确控制生成带时间戳的重叠与静默;再处理成事件识别、说话人切分、带时间戳转写等多任务训练所需的格式。最终合成数据共 6,361 条、约 146 小时,并与少量真实人-人 / 人-机对话一起构成 ID / FG / OOD / RW-HH / RW-HM 五套评测集。

训练流程

(图3:从 Qwen-2.5-Omni-7B 出发的三阶段训练流水——感知打底、推理蒸馏、GRPO 泛化增强

训练流程由三个阶段构成:感知打底、推理蒸馏与 GRPO 泛化增强,分别对应双轨音频建模在感知、推理与分布外泛化三个层面的挑战。

Stage 1 采用多任务 SFT 建立感知基础。Qwen-2.5-Omni-7B 在单轨音频上预训练,缺乏对双轨对话中静默、重叠等结构的表征能力。该阶段设置三个子任务——事件识别(识别打断、反馈语等并输出时间戳)、说话人切分、带时间戳的全量转写——使模型具备解析双轨对话结构的能力。后续消融表明,该阶段是整套训练配方中影响最大的一环。

Stage 2 通过教师蒸馏建立推理能力。将 Stage 1 输出的音频结构化元数据输入 Gemini-2.5-Pro,由其作为教师模型生成可核验的双 CoT 与分数,共构成 2,670 条 CoT 训练样本;随后在该数据上微调学生模型,使其学会输出两条并行 CoT。此环节仅在训练阶段使用——推理时模型自行生成 CoT,无需教师参与。

Stage 3 采用 GRPO 进行泛化增强。对每条对话采样 K=4 条候选评估,标量奖励由格式指示器与准确性指示器加权得到,再以 PPO-clip 目标进行优化。该阶段的一个关键设计在于:训练数据中混入少量真实人机对话,而非继续仅使用合成数据。消融结果表明该设计对分布外表现具有显著作用。

实验结果

在合成域(ID / FG / OOD)与真实域(RW-HH / RW-HM)共五套测试集上进行了系统评估,与开源音频 LLM(Qwen2Audio、KimiAudio、Audio-Flamingo3 等)及闭源商业模型(GPT-4o、Gemini-2.5-Pro / Flash)在零样本设置下进行对比。

(表1:Dual-Axis RM 与全部开源 / 闭源基线在五套测试集上的 Accuracy / Macro F1 对比,基线均为零样本设置)

模型在合成域上取得很高的准确率——ID 98.5%、OOD 96.1%,表明分类学结合程序化生成使训练数据充分覆盖了各类失败模式。零样本基线与之存在显著差距:最强的商业基线 Gemini-2.5-Pro 在 ID 上仅为 0.747,开源模型整体低于 0.5,说明交互质量评估是全双工模型需要专门训练才能获得的能力,难以随模型规模的增长自然获得。在 RW-HH 上,GPT-4o 的 Accuracy 更高(0.925),但其 F1 明显偏低,表明该模型倾向于将样本判为正类,对失败样本的区分能力不足,本质上是系统性乐观偏差。

(图4:一段“不当抢话”对话上三个评估器的判断对比。Dual-Axis RM 正确识别为 fluency failure 并给 score=0;Gemini-2.5-Pro 出现 reasoning failure,误将打断判定为“immediate and natural”;GPT-4o 更为严重——直接判定交互 smooth、no notable interruptions,给出 score=1)

上述结果表明,在给定分类学与结构化训练配方的前提下,双轴奖励模型可作为全双工 SDM 的 RL 奖励接口:在真实人机对话这一最具挑战、也最具 RL 训练价值的分布上,其表现同时优于所有开源与闭源的零样本基线。


结语

本文提出了一套完整的全双工 SDM 奖励模型训练方案。在训练阶段,将感知打底、推理蒸馏与 GRPO 泛化增强分别交由三个阶段完成,并在 GRPO 阶段引入少量真实人机对话以弥补分布外差距;在推理阶段,仅需单个 7B 模型即可输出两条 CoT 与一个 0/1 分数,直接用于下游 RL 循环。实验结果表明,双轴生成式奖励模型可作为全双工 SDM 后训练的一条可行路径:在保持可解释性的前提下,其交互质量评估表现达到甚至超过零样本商业 SOTA,为后续 SDM 在线 RL 训练提供了可靠的奖励接口。

相关文献参考:

[1] Shao, Z., Wang, P., Zhu, Q., et al. 2024. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

[2] Xu, J., Guo, Z., et al. 2025. Qwen2.5-Omni Technical Report.

[3] Meta AI Research. 2025. Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset.

[4] Zhang, D., Li, S., Zhang, X., et al. 2023. Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

[5] Kimi Team. 2025. Kimi-Audio Technical Report.


相关阅读


技术解读|让AI真正"听懂"你:我们如何让语音助手学会自然对话









👇点击阅读原文,直达论文原文

【声明】内容源于网络
0
0
阿里语音AI
阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
内容 132
粉丝 0
阿里语音AI 阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
总阅读730
粉丝0
内容132