早期 AudioLM 后训练通常以多任务 SFT 为主:通过混合音频理解、语音生成与对话数据,建立基础的音频指令能力。对于功能验证和常规任务覆盖,这一路径足够直接;但随着底座语言能力增强、音频任务边界扩展,单一 SFT 目标开始面临一个更复杂的问题:
如何在扩展音频能力的同时,尽可能保留原有语言能力,并让文本能力与音频原生能力在同一模型中稳定协同?
问题并不在于 SFT 本身失效,而在于其监督边界。SFT 能够将预训练能力组织为可用行为,却难以覆盖模型自身的生成轨迹,也难以将不同领域形成的能力增量稳定汇聚到同一模型。AudioLM 后训练因此由单阶段监督拟合,逐步转向参数回补、SFT 与 on-policy distillation 相结合的复合训练体系。
在这套体系中:
Core-Cocktail SFT 控制参数迁移;
M²-OPD 包含两条互补路径:
Multimodality OPD 完成语言能力的跨模态迁移
Multi-Teacher OPD 完成音频领域能力的统一汇聚
构建 AudioLM 并非在 Text LLM 上简单增加语音输入与输出接口。音频序列在长度、语义密度和时序结构上都与文本存在显著差异。模型既要完成模态适配,又要保留已有的知识、推理和指令遵循能力;语气、情绪与环境声还引入了文本监督无法完整覆盖的信息。
AudioLM 通常继承 Text LLM 的能力基础,因为通用知识、推理和指令能力已经在文本预训练中形成。但在后训练阶段,实际加载的初始化 checkpoint 是已完成音频预训练的 AudioLM,而非 Text LLM。
这意味着,后训练需要同时处理两类已有能力:一类是 Text LLM 中成熟的语言智能,另一类是预训练 AudioLM 中已经建立、但尚未充分转化为任务行为的音频能力。而这两类能力,并不会在后训练中自动协同。
因此,AudioLM 后训练的核心问题可以进一步拆分为两个方向:一是弥补音频预训练期间 Text LLM 知识、推理和指令遵循能力的损失;二是将预训练 AudioLM 的音频理解与生成能力转化为稳定、可控的任务行为,并继续扩展情绪、语用与声学场景等音频原生能力。
据此,AudioLM 后训练可概括为两类能力目标:
语言能力的跨模态迁移。Core-Cocktail SFT 用于回补音频预训练带来的语言能力衰减,Multimodality OPD 则使 Audio Input 条件下的行为分布接近 Text Teacher。
音频原生能力的专精与汇聚。不同领域专家分别学习文本难以覆盖的声音能力,再通过 Multi-Teacher OPD 将多种专家行为同时蒸馏到单一主模型。
其中,M²-OPD 包含两种互补的 on-policy distillation:
Multimodality OPD 面向可文本化语义的跨模态能力迁移
Multi-Teacher OPD 面向音频领域专家的能力汇聚
(图1:AudioLM 后训练的两类能力目标。M²-OPD 分别以 Multimodality OPD 迁移跨模态共享能力,以 Multi-Teacher OPD 汇聚领域 Expert Teacher 的音频能力)
第一类目标由两个连续环节实现。Core-Cocktail SFT 从预训练 AudioLM checkpoint 出发,建立可用的 Audio Policy,并控制参数迁移导致的语言能力退化;Multimodality OPD 在行为分布上进一步缩小 Audio Student 与 Text Teacher 的差异。
第二类目标则先以领域化数据和奖励信号形成若干音频专家,再由 Multi-Teacher OPD 将分散的能力增量压回统一的主模型。
(图1:AudioLM 后训练的两类能力目标。M²-OPD 分别以 Multimodality OPD 迁移跨模态共享能力,以 Multi-Teacher OPD 汇聚领域 Expert Teacher 的音频能力)
第一类目标由两个连续环节实现。Core-Cocktail SFT 从预训练 AudioLM checkpoint 出发,建立可用的 Audio Policy,并控制参数迁移导致的语言能力退化;Multimodality OPD 在行为分布上进一步缩小 Audio Student 与 Text Teacher 的差异。
第二类目标则先以领域化数据和奖励信号形成若干音频专家,再由 Multi-Teacher OPD 将分散的能力增量压回统一的主模型。
▎Core-Cocktail SFT:从预训练 AudioLM 到可用 Audio Policy
Core-Cocktail SFT 可视为后训练的 cold-start 阶段。需要首先明确的是,其初始化 checkpoint 并非 Text LLM,而是已经完成音频预训练的 AudioLM。也就是说,模态适配在这一阶段之前已经发生,后训练不再负责重新建立声音表示,而是将现有的音频能力组织为稳定的指令遵循与任务行为。
为什么需要参数回补?
预训练 AudioLM 由 Text LLM 初始化,二者具有同源的参数基础。持续的音频预训练使模型获得声音理解与生成能力,也会推动参数向音频数据分布迁移,使部分知识调用、推理稳定性和文本指令能力出现衰减。这类损失并不意味着语言能力需要从头学习,而是原有语言先验在模态预训练过程中受到不同程度的扰动。
Core-Cocktail Training 利用这种同源关系,将源 Text LLM 作为语言先验的参数参照,与预训练 AudioLM 进行参数调和。融合的目的不是再次完成音频适配,也不是向 AudioLM 注入一套无关能力,而是对音频预训练引起的参数漂移进行有限回补,使模型在保留已获得音频能力的同时,恢复被削弱的语言行为。
完成参数融合之后,再进入受控 SFT,将预训练阶段形成的能力转化为可用的 Audio Policy。训练重点是能力平衡:音频与文本指令数据共同约束更新方向,避免后训练再次放大语言能力损失。
因此,参数融合更接近对同源能力的重新锚定,而非一般意义上的模型能力拼接。其中:
Text LLM 保存音频预训练之前的语言参数参照;
预训练 AudioLM 保存模态扩展后的能力状态;
二者之间的调和用于选择一个更适合后训练的参数起点。
也因此,Core-Cocktail SFT 的评价不应仅依据音频指标,还需要同时考察知识、推理和文本指令能力的恢复程度。当然,参数融合也无法替代高质量数据或自动消除任务冲突,其作用是在 SFT 开始前提供更稳健的能力基线。
Core-Cocktail SFT 主要约束的是参数迁移,但参数状态得到控制,并不能保证音频路径已经完整复现了 Text LLM 的行为能力。SFT 完成后,AudioLM 在知识调用、推理、指令遵循和工具调用等任务上,仍可能低于原始 Text LLM。Multimodality On-Policy Distillation(Multimodality OPD)的作用,就是进一步缩小这一行为差距。
“能听懂”不等于完成了语言能力迁移
同一问题以文本输入时可能得到稳定回答,换成音频输入后,则可能出现语义理解偏移、推理链缩短、工具调用格式错误,或对口音、停顿和背景噪声过度敏感。因此,音频路径可用,并不等于语言能力迁移完成。
对于可靠转写的用户问题,音频与文本可视为同一语义任务的两种输入形式。在 Multimodality OPD 中:Audio Student 接收原始音频,Text Teacher 接收语义等价的文本问题。这一设置可以直接利用 Text Teacher 已具备的通用能力,无需为音频任务重新构造同等规模的能力标签。
为什么不是传统离线蒸馏?
传统离线蒸馏通常使学生模仿教师预先生成的回答,监督主要集中在教师轨迹上。问题在于,当 Audio Student 的回答开始偏离教师样本时,静态答案对后续生成的校准作用随之减弱。
Multimodality OPD 直接以 Audio Student 的实际生成轨迹作为蒸馏载体。训练时,Audio Student 根据原始音频完成 rollout;随后将这条学生轨迹与语义等价的文本问题一同 prefill 到 Text Teacher,取得各 token 位置上的 teacher logits,形成针对学生轨迹的稠密监督信号。换句话说,轨迹由 Audio Student 生成,Text Teacher 只在该轨迹上提供续写分布。
Text Teacher 之外,还需要 Audio Ref Model
在对齐过程中,还会同时保留一份由 Audio Student 自身冻结得到的 Audio Ref Model。它在相同音频上下文和学生轨迹上提供 reference logits,用于约束音频相关行为的漂移。二者承担的角色不同:Text Teacher 负责迁移知识、推理和指令能力,Audio Ref Model 则维持预训练 AudioLM 已有的声音能力,避免对齐过程将模型过度拉向纯文本行为。
该设计不要求 Text Teacher 处理音频,而是将其已形成的知识调用、推理和行为决策能力迁移到语义等价的 Audio Input 条件下。
因此,Multimodality OPD 对齐的不是单纯的 Audio Feature 与 Text Feature,而是两种输入条件下的生成行为分布。特征距离接近不能直接保证最终的任务决策一致。
这套方法有一个明确边界:只有能够被文本完整表达的信息,才适合由 Text Teacher 进行对齐。
例如,“帮我查一下明天的天气”可以被稳定转写,文本教师能够提供充分的任务监督;而“我没事”所表达的平静、压抑或反讽,则可能在转写中丢失。若将所有音频任务统一蒸馏到 Text Teacher,模型可能忽略语气、节奏和环境声信息,退化为以语音为输入的文本模型。
因此,Multimodality OPD 的目标是迁移跨模态共享能力,而非消除模态差异。Core-Cocktail SFT 约束参数迁移,Multimodality OPD 校准行为迁移;文本无法覆盖的信息则由后续音频原生优化处理。
▎Ability Beyond Text:音频输入带来的额外能力增益
如果说 Core-Cocktail SFT 与 Multimodality OPD 均以 Text LLM 的既有能力为锚点,那么 Ability Beyond Text 关注的是另一个问题:
当模型以原始音频为输入时,能否利用转写文本中缺失的声学与副语言信息,在相关任务上取得优于纯文本输入的表现?
这种增益不一定体现为事实问答的准确率提高,而更多体现在对说话者状态、语用意图和声学环境的判断上。典型任务包括:情绪感知与共情回应、言外意图与语用判断、非语言事件与声学场景理解。
这些任务的共同点是,决定性信息存在于原始音频中,并可能在转写时丢失。因此,单一 Text Teacher 无法提供充分监督:语义一致的两段响应,可能在共情程度、语气和节奏上存在明显差异;同一转写文本也可能对应不同的说话者状态。
为什么需要领域专家?
不同音频能力依赖的样本、评价尺度与优化目标并不相同。将其全部压入同一套训练信号,容易造成能力之间的相互稀释。更合适的组织方式,是以同一阶段的 AudioLM 为基础,分别形成面向情绪与共情、语用意图和声学场景的领域专家。每个专家只承担相对明确的能力边界,并在对应数据分布上建立稳定行为。
GRPO 可用于领域专家的能力专精。对同一音频上下文采样多个候选响应,再依据领域评价进行组内相对优化,使专家在各自任务上获得更清晰的行为偏好。这里需要区分两个问题: GRPO 负责形成能力增量,并不直接解决多个专家如何合并的问题。能力汇聚由 Multi-Teacher OPD 完成。
Multi-Teacher OPD 把专家能力重新汇聚到主模型。在 Multi-Teacher OPD 中,主 AudioLM 首先基于原始音频生成自己的回答轨迹;多个领域专家随后以相同的学生轨迹作为 prefill,提供行为分布监督,并在同一训练过程中蒸馏回主 AudioLM。
这一过程延续了 Multimodality OPD 的基本原则:监督以学生实际生成轨迹为载体,而不是仅模仿教师预先生成的离线答案。区别在于,两者对应的 Teacher 不同:Multimodality OPD 使用 Text Teacher 迁移跨模态共享能力;Multi-Teacher OPD 使用多个音频领域专家,汇聚文本世界之外的能力增量。M²-OPD 由此覆盖单一跨模态 Teacher 与多领域 Teacher 两种配置。
因此,这几个概念之间的关系可以进一步明确为:
领域专家是能力形成的载体,
GRPO 是能力专精的一种手段,
Multi-Teacher OPD 才是多种领域能力进入主模型的汇聚机制。
完成蒸馏后,推理阶段仍只部署一个 AudioLM,不依赖多专家并行推理。
如果说 Core-Cocktail SFT 与 Multimodality OPD 均以 Text LLM 的既有能力为锚点,那么 Ability Beyond Text 关注的是另一个问题:
当模型以原始音频为输入时,能否利用转写文本中缺失的声学与副语言信息,在相关任务上取得优于纯文本输入的表现?
这种增益不一定体现为事实问答的准确率提高,而更多体现在对说话者状态、语用意图和声学环境的判断上。典型任务包括:情绪感知与共情回应、言外意图与语用判断、非语言事件与声学场景理解。
这些任务的共同点是,决定性信息存在于原始音频中,并可能在转写时丢失。因此,单一 Text Teacher 无法提供充分监督:语义一致的两段响应,可能在共情程度、语气和节奏上存在明显差异;同一转写文本也可能对应不同的说话者状态。
为什么需要领域专家?
不同音频能力依赖的样本、评价尺度与优化目标并不相同。将其全部压入同一套训练信号,容易造成能力之间的相互稀释。更合适的组织方式,是以同一阶段的 AudioLM 为基础,分别形成面向情绪与共情、语用意图和声学场景的领域专家。每个专家只承担相对明确的能力边界,并在对应数据分布上建立稳定行为。
GRPO 可用于领域专家的能力专精。对同一音频上下文采样多个候选响应,再依据领域评价进行组内相对优化,使专家在各自任务上获得更清晰的行为偏好。这里需要区分两个问题: GRPO 负责形成能力增量,并不直接解决多个专家如何合并的问题。能力汇聚由 Multi-Teacher OPD 完成。
Multi-Teacher OPD 把专家能力重新汇聚到主模型。在 Multi-Teacher OPD 中,主 AudioLM 首先基于原始音频生成自己的回答轨迹;多个领域专家随后以相同的学生轨迹作为 prefill,提供行为分布监督,并在同一训练过程中蒸馏回主 AudioLM。
这一过程延续了 Multimodality OPD 的基本原则:监督以学生实际生成轨迹为载体,而不是仅模仿教师预先生成的离线答案。区别在于,两者对应的 Teacher 不同:Multimodality OPD 使用 Text Teacher 迁移跨模态共享能力;Multi-Teacher OPD 使用多个音频领域专家,汇聚文本世界之外的能力增量。M²-OPD 由此覆盖单一跨模态 Teacher 与多领域 Teacher 两种配置。
因此,这几个概念之间的关系可以进一步明确为:
领域专家是能力形成的载体,
GRPO 是能力专精的一种手段,
Multi-Teacher OPD 才是多种领域能力进入主模型的汇聚机制。
完成蒸馏后,推理阶段仍只部署一个 AudioLM,不依赖多专家并行推理。
▎训练目标与方法分工
回到整个后训练体系,可以把不同方法的作用进一步归纳为两类能力目标。
第一类:语言能力的跨模态迁移
Core-Cocktail SFT 与 Multimodality OPD 共同服务于语言能力的跨模态迁移。
Core-Cocktail SFT 作用于参数状态:源 Text LLM 回补音频预训练期间衰减的语言先验,受控 SFT 再将融合状态转化为稳定的 Audio Policy。
Multimodality OPD 作用于跨模态行为分布:对语义可文本化的问题,使 Audio Input 复用 Text Teacher 已验证的知识、推理与指令能力,并在 Audio Student 生成的轨迹上完成校准。
第二类:音频原生能力的专精与汇聚
领域专家与 Multi-Teacher OPD 共同服务于音频原生能力的专精和汇聚。
不同 Expert Teacher 分别吸收情绪、语用与声学场景信号,再把这些分散能力同时蒸馏到统一的 AudioLM。其中,Multimodality OPD 与 Multi-Teacher OPD 共同构成文中的 M²-OPD,两者分别负责跨模态共享能力迁移与音频领域能力汇聚。
它们之间存在一条清晰的分组与递进关系:
预训练 AudioLM│├─ 语言能力迁移│ ├─ Core-Cocktail SFT:约束参数迁移│ └─ Multimodality OPD:跟随 Text Teacher 校准行为迁移│└─ 音频原生能力扩展├─ 领域专家:通过领域数据与 GRPO 完成能力专精└─ Multi-Teacher OPD:将多专家能力汇聚到主 AudioLMMultimodality OPD + Multi-Teacher OPD = M²-OPD
这些方法并非同一层级的并列关系。Core-Cocktail SFT 控制参数迁移,领域训练与 GRPO 形成能力增量;M²-OPD 则提供两条互补的行为迁移路径:Multimodality OPD 迁移 Text Teacher 的共享能力,Multi-Teacher OPD 将多个领域专家的增量统一写回主模型。
▎结语
AudioLM 后训练遵循从能力继承、领域专精到统一汇聚的连续逻辑。Core-Cocktail SFT 首先回补音频预训练引起的语言参数漂移,Multimodality OPD 随后将 Text Teacher 的行为能力迁移到 Audio Input;不同音频领域专家进一步建立文本无法覆盖的能力增量,Multi-Teacher OPD 最终将这些增量收敛到单一主模型。
相应的评估重点依次是:Text LLM 能力保持程度、Audio Input 与 Text Teacher 的行为一致性、各领域专家的能力上界,以及能力汇聚后主模型的综合增益与干扰程度。
未来 AudioLM 的性能差异将不仅取决于预训练规模和 Audio Token 效率,也取决于后训练能否在保持语言智能的同时,建立对情绪、语用线索和环境声的稳定建模与优化能力。
AudioLM 的目标并非以语音形式复述文本答案,而是在保持语言智能的基础上,对文本之外的声音信息进行建模,并将分散的领域能力统一为可部署的交互能力。


