全双工语音对话模型(Spoken Dialogue Model, SDM)已经能够同时进行听、说与被打断的实时交互。但一个更基础的问题始终没有被充分回答:
▎什么是双轴生成式奖励模型?
具体而言,本文定义了一个更严格的全双工评估设定:以一段双轨(dual-track)音频对话为输入,由单一 LLM 同时输出两条独立 CoT 与一个 0/1 二值总分——一条 CoT 分析内容(Response Relevance),一条 CoT 分析时机(Interactional Fluency);仅当两轴均判定为合格时 S=1,任一轴判定为失败则 S=0。奖励模型的整体输出可记为:
由此,语义评估与时机评估被整合进同一模型,一次前向即可给出两条推理链与一个可直接用于 RLHF 的 win/loss 标量,从而将全双工对话的奖励接口收敛为一条由双轨音频到 0/1 分数的统一路径。
(图1:双轴评估器与传统四类方法的对比——代理神谕、行为统计、指标套件、人工专家各有局限,双轴模型同时给出时机 / 内容分析并合成整体分)
(图1:双轴评估器与传统四类方法的对比——代理神谕、行为统计、指标套件、人工专家各有局限,双轴模型同时给出时机 / 内容分析并合成整体分)
模型架构
就架构本体而言,模型构建于 Qwen-2.5-Omni-7B 之上,将输出格式约束为三个 XML 块——<response think> 承载语义 CoT,<fluency think> 承载时机 CoT,<score> 承载最终的 0/1 分。即以一段双轨音频为输入,输出两条推理链与一个可直接用于 RL 的标量奖励。
然而在训练之前存在一个前置问题需要解决。语义轴的判定相对可行,回答是否切题可由语言理解能力大致判断;时机轴的判定则缺乏依据——某次插话是否构成不当抢话、某段停顿意味着说话人仍在组织语言还是已让出发言权,若缺乏统一的界定标准,CoT 将无法给出可核验的分析,最终的 0/1 分也难以解释。因此,在数据构造与训练之前,需要先为全双工交互建立一套形式化分类学,明确界定对话由哪些结构成分构成。
具体而言,根据说话人在某时刻的发声状态,严格区分三类基础结构单元:停顿(同一说话人话语内部的静默)、间隙(说话人切换之际双方均静默)与重叠(两名说话人同时发声)。在此基础上进一步定义成功打断、失败打断、反馈语等交互事件。基于这套结构定义,SDM 的常见失败被沿两个正交的轴加以组织:
(图2:交互构件与错误分类学。上排:Pause / Gap / Turn / 平滑轮转 / 成功打断 / 反馈语;下排:语义类 vs. 时机/轮次类错误道)
语义轴涵盖上下文不连贯与打断失忆(Assistant Self-Amnesia / User Content Amnesia);时机 / 轮次轴涵盖“过反应”的不当抢话与过度让位,以及“欠反应”的迟到接话与忽略打断。由此,整体质量不佳的对话被分解为可逐项指认的失败类型。
这套分类学在全文中承担三重作用,构成各环节之间的统一基础。
其一,它是 CoT 的推理框架:模型输出两条 CoT 的过程,实质是将观察到的交互现象与该分类体系逐项比对、判定其所属类别,从而将模糊的整体印象转化为具体的失败判定(例如在某一时刻发生的一次失败打断)。
其二,它是数据构造的坐标系:由于失败类型被界定为有限且互斥的类别,才可反向依据这些类别在脚本中程序化地注入不当抢话、反馈语、过长间隙等事件,从而系统性地覆盖完整的失败谱系。
其三,它是评测与消融的统一标尺:后续细粒度评测集(FG)的四类标签,以及逐轴、逐阶段的消融分析,均以同一分类体系为依据。因此,后文的数据构造与训练流程均建立在这套分类学之上。
数据构造
为训练一个能够深度理解对话互动动态的生成式奖励模型,本文设计并执行了一套多阶段合成数据生成流程。其核心目标是构建一个大规模、多样化、带有丰富标注的双轨音频数据集——它不仅包含理想、流畅的对话,也系统性地覆盖了真实人机交互中常见的各类失败模式。
整个流程包含四个主要阶段:
源数据筛选与改写:从多个公开对话数据集中提取并改写文本对话,覆盖开放域社交、任务导向、多轮指令等多种话题与语言风格,为后续注入交互事件准备多样化底料。
通过程序生成互动事件与错误:以平滑轮转为基准场景,借助 LLM 与精心设计的提示词,在对话脚本中注入各类成功互动事件与特定互动错误(如不当抢话、将反馈语误判为打断、忽略打断等),并逐一记录其发生时刻与时长。
思维链(CoT)标注生成:借助一个强大的教师模型,针对每个由元信息描述的对话场景,给出解耦的双路分析——时序流畅性与内容相关性——及最终的二值分数,作为后续推理蒸馏的监督信号。
双轨音频合成与多任务数据构造:将标注脚本合成为双轨音频,每条声道对应一名说话人,并借助对发声动作的精确控制生成带时间戳的重叠与静默;再处理成事件识别、说话人切分、带时间戳转写等多任务训练所需的格式。最终合成数据共 6,361 条、约 146 小时,并与少量真实人-人 / 人-机对话一起构成 ID / FG / OOD / RW-HH / RW-HM 五套评测集。
训练流程
(图3:从 Qwen-2.5-Omni-7B 出发的三阶段训练流水——感知打底、推理蒸馏、GRPO 泛化增强)
训练流程由三个阶段构成:感知打底、推理蒸馏与 GRPO 泛化增强,分别对应双轨音频建模在感知、推理与分布外泛化三个层面的挑战。
Stage 1 采用多任务 SFT 建立感知基础。Qwen-2.5-Omni-7B 在单轨音频上预训练,缺乏对双轨对话中静默、重叠等结构的表征能力。该阶段设置三个子任务——事件识别(识别打断、反馈语等并输出时间戳)、说话人切分、带时间戳的全量转写——使模型具备解析双轨对话结构的能力。后续消融表明,该阶段是整套训练配方中影响最大的一环。
Stage 2 通过教师蒸馏建立推理能力。将 Stage 1 输出的音频结构化元数据输入 Gemini-2.5-Pro,由其作为教师模型生成可核验的双 CoT 与分数,共构成 2,670 条 CoT 训练样本;随后在该数据上微调学生模型,使其学会输出两条并行 CoT。此环节仅在训练阶段使用——推理时模型自行生成 CoT,无需教师参与。
Stage 3 采用 GRPO 进行泛化增强。对每条对话采样 K=4 条候选评估,标量奖励由格式指示器与准确性指示器加权得到,再以 PPO-clip 目标进行优化。该阶段的一个关键设计在于:训练数据中混入少量真实人机对话,而非继续仅使用合成数据。消融结果表明该设计对分布外表现具有显著作用。
(图2:交互构件与错误分类学。上排:Pause / Gap / Turn / 平滑轮转 / 成功打断 / 反馈语;下排:语义类 vs. 时机/轮次类错误道)
语义轴涵盖上下文不连贯与打断失忆(Assistant Self-Amnesia / User Content Amnesia);时机 / 轮次轴涵盖“过反应”的不当抢话与过度让位,以及“欠反应”的迟到接话与忽略打断。由此,整体质量不佳的对话被分解为可逐项指认的失败类型。
这套分类学在全文中承担三重作用,构成各环节之间的统一基础。
其一,它是 CoT 的推理框架:模型输出两条 CoT 的过程,实质是将观察到的交互现象与该分类体系逐项比对、判定其所属类别,从而将模糊的整体印象转化为具体的失败判定(例如在某一时刻发生的一次失败打断)。
其二,它是数据构造的坐标系:由于失败类型被界定为有限且互斥的类别,才可反向依据这些类别在脚本中程序化地注入不当抢话、反馈语、过长间隙等事件,从而系统性地覆盖完整的失败谱系。
其三,它是评测与消融的统一标尺:后续细粒度评测集(FG)的四类标签,以及逐轴、逐阶段的消融分析,均以同一分类体系为依据。因此,后文的数据构造与训练流程均建立在这套分类学之上。
数据构造
为训练一个能够深度理解对话互动动态的生成式奖励模型,本文设计并执行了一套多阶段合成数据生成流程。其核心目标是构建一个大规模、多样化、带有丰富标注的双轨音频数据集——它不仅包含理想、流畅的对话,也系统性地覆盖了真实人机交互中常见的各类失败模式。
整个流程包含四个主要阶段:
源数据筛选与改写:从多个公开对话数据集中提取并改写文本对话,覆盖开放域社交、任务导向、多轮指令等多种话题与语言风格,为后续注入交互事件准备多样化底料。
通过程序生成互动事件与错误:以平滑轮转为基准场景,借助 LLM 与精心设计的提示词,在对话脚本中注入各类成功互动事件与特定互动错误(如不当抢话、将反馈语误判为打断、忽略打断等),并逐一记录其发生时刻与时长。
思维链(CoT)标注生成:借助一个强大的教师模型,针对每个由元信息描述的对话场景,给出解耦的双路分析——时序流畅性与内容相关性——及最终的二值分数,作为后续推理蒸馏的监督信号。
双轨音频合成与多任务数据构造:将标注脚本合成为双轨音频,每条声道对应一名说话人,并借助对发声动作的精确控制生成带时间戳的重叠与静默;再处理成事件识别、说话人切分、带时间戳转写等多任务训练所需的格式。最终合成数据共 6,361 条、约 146 小时,并与少量真实人-人 / 人-机对话一起构成 ID / FG / OOD / RW-HH / RW-HM 五套评测集。
训练流程
(图3:从 Qwen-2.5-Omni-7B 出发的三阶段训练流水——感知打底、推理蒸馏、GRPO 泛化增强)
(图3:从 Qwen-2.5-Omni-7B 出发的三阶段训练流水——感知打底、推理蒸馏、GRPO 泛化增强)
训练流程由三个阶段构成:感知打底、推理蒸馏与 GRPO 泛化增强,分别对应双轨音频建模在感知、推理与分布外泛化三个层面的挑战。
Stage 1 采用多任务 SFT 建立感知基础。Qwen-2.5-Omni-7B 在单轨音频上预训练,缺乏对双轨对话中静默、重叠等结构的表征能力。该阶段设置三个子任务——事件识别(识别打断、反馈语等并输出时间戳)、说话人切分、带时间戳的全量转写——使模型具备解析双轨对话结构的能力。后续消融表明,该阶段是整套训练配方中影响最大的一环。
Stage 2 通过教师蒸馏建立推理能力。将 Stage 1 输出的音频结构化元数据输入 Gemini-2.5-Pro,由其作为教师模型生成可核验的双 CoT 与分数,共构成 2,670 条 CoT 训练样本;随后在该数据上微调学生模型,使其学会输出两条并行 CoT。此环节仅在训练阶段使用——推理时模型自行生成 CoT,无需教师参与。
Stage 3 采用 GRPO 进行泛化增强。对每条对话采样 K=4 条候选评估,标量奖励由格式指示器与准确性指示器加权得到,再以 PPO-clip 目标进行优化。该阶段的一个关键设计在于:训练数据中混入少量真实人机对话,而非继续仅使用合成数据。消融结果表明该设计对分布外表现具有显著作用。
▎实验结果
在合成域(ID / FG / OOD)与真实域(RW-HH / RW-HM)共五套测试集上进行了系统评估,与开源音频 LLM(Qwen2Audio、KimiAudio、Audio-Flamingo3 等)及闭源商业模型(GPT-4o、Gemini-2.5-Pro / Flash)在零样本设置下进行对比。
(表1:Dual-Axis RM 与全部开源 / 闭源基线在五套测试集上的 Accuracy / Macro F1 对比,基线均为零样本设置)
模型在合成域上取得很高的准确率——ID 98.5%、OOD 96.1%,表明分类学结合程序化生成使训练数据充分覆盖了各类失败模式。零样本基线与之存在显著差距:最强的商业基线 Gemini-2.5-Pro 在 ID 上仅为 0.747,开源模型整体低于 0.5,说明交互质量评估是全双工模型需要专门训练才能获得的能力,难以随模型规模的增长自然获得。在 RW-HH 上,GPT-4o 的 Accuracy 更高(0.925),但其 F1 明显偏低,表明该模型倾向于将样本判为正类,对失败样本的区分能力不足,本质上是系统性乐观偏差。
(图4:一段“不当抢话”对话上三个评估器的判断对比。Dual-Axis RM 正确识别为 fluency failure 并给 score=0;Gemini-2.5-Pro 出现 reasoning failure,误将打断判定为“immediate and natural”;GPT-4o 更为严重——直接判定交互 smooth、no notable interruptions,给出 score=1)
上述结果表明,在给定分类学与结构化训练配方的前提下,双轴奖励模型可作为全双工 SDM 的 RL 奖励接口:在真实人机对话这一最具挑战、也最具 RL 训练价值的分布上,其表现同时优于所有开源与闭源的零样本基线。
▎结语
相关文献参考:
[1] Shao, Z., Wang, P., Zhu, Q., et al. 2024. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.
[2] Xu, J., Guo, Z., et al. 2025. Qwen2.5-Omni Technical Report.
[3] Meta AI Research. 2025. Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset.
[4] Zhang, D., Li, S., Zhang, X., et al. 2023. Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.
[5] Kimi Team. 2025. Kimi-Audio Technical Report.

