大数跨境

技术解读|AudioLM 后训练:语言智能的跨模态迁移与原生能力扩展

技术解读|AudioLM 后训练:语言智能的跨模态迁移与原生能力扩展 阿里语音AI
2026-08-28
0
导读:从参数回补到 M²-OPD,拆解 AudioLM 如何在保留语言能力的同时,进一步扩展音频原生能力。

早期 AudioLM 后训练通常以多任务 SFT 为主:通过混合音频理解、语音生成与对话数据,建立基础的音频指令能力。对于功能验证和常规任务覆盖,这一路径足够直接;但随着底座语言能力增强、音频任务边界扩展,单一 SFT 目标开始面临一个更复杂的问题:

如何在扩展音频能力的同时,尽可能保留原有语言能力,并让文本能力与音频原生能力在同一模型中稳定协同?

问题并不在于 SFT 本身失效,而在于其监督边界。SFT 能够将预训练能力组织为可用行为,却难以覆盖模型自身的生成轨迹,也难以将不同领域形成的能力增量稳定汇聚到同一模型。AudioLM 后训练因此由单阶段监督拟合,逐步转向参数回补、SFT 与 on-policy distillation 相结合的复合训练体系。

在这套体系中:

  • Core-Cocktail SFT 控制参数迁移;

  • M²-OPD 包含两条互补路径:

    • Multimodality OPD 完成语言能力的跨模态迁移

    • Multi-Teacher OPD 完成音频领域能力的统一汇聚

构建 AudioLM 并非在 Text LLM 上简单增加语音输入与输出接口。音频序列在长度、语义密度和时序结构上都与文本存在显著差异。模型既要完成模态适配,又要保留已有的知识、推理和指令遵循能力;语气、情绪与环境声还引入了文本监督无法完整覆盖的信息。

AudioLM 通常继承 Text LLM 的能力基础,因为通用知识、推理和指令能力已经在文本预训练中形成。但在后训练阶段,实际加载的初始化 checkpoint 是已完成音频预训练的 AudioLM,而非 Text LLM。

这意味着,后训练需要同时处理两类已有能力:一类是 Text LLM 中成熟的语言智能,另一类是预训练 AudioLM 中已经建立、但尚未充分转化为任务行为的音频能力。而这两类能力,并不会在后训练中自动协同。

因此,AudioLM 后训练的核心问题可以进一步拆分为两个方向:一是弥补音频预训练期间 Text LLM 知识、推理和指令遵循能力的损失;二是将预训练 AudioLM 的音频理解与生成能力转化为稳定、可控的任务行为,并继续扩展情绪、语用与声学场景等音频原生能力。

据此,AudioLM 后训练可概括为两类能力目标:

语言能力的跨模态迁移。Core-Cocktail SFT 用于回补音频预训练带来的语言能力衰减,Multimodality OPD 则使 Audio Input 条件下的行为分布接近 Text Teacher。

音频原生能力的专精与汇聚。不同领域专家分别学习文本难以覆盖的声音能力,再通过 Multi-Teacher OPD 将多种专家行为同时蒸馏到单一主模型。

其中,M²-OPD 包含两种互补的 on-policy distillation:

  • Multimodality OPD 面向可文本化语义的跨模态能力迁移

  • Multi-Teacher OPD 面向音频领域专家的能力汇聚

(图1:AudioLM 后训练的两类能力目标。M²-OPD 分别以 Multimodality OPD 迁移跨模态共享能力,以 Multi-Teacher OPD 汇聚领域 Expert Teacher 的音频能力

第一类目标由两个连续环节实现。Core-Cocktail SFT 从预训练 AudioLM checkpoint 出发,建立可用的 Audio Policy,并控制参数迁移导致的语言能力退化;Multimodality OPD 在行为分布上进一步缩小 Audio Student 与 Text Teacher 的差异。

第二类目标先以领域化数据和奖励信号形成若干音频专家,再由 Multi-Teacher OPD 将分散的能力增量压回统一的主模型。

Core-Cocktail SFT:从预训练 AudioLM 到可用 Audio Policy

Core-Cocktail SFT 可视为后训练的 cold-start 阶段。需要首先明确的是,其初始化 checkpoint 并非 Text LLM,而是已经完成音频预训练的 AudioLM。也就是说,模态适配在这一阶段之前已经发生,后训练不再负责重新建立声音表示,而是将现有的音频能力组织为稳定的指令遵循与任务行为。

为什么需要参数回补?

预训练 AudioLM 由 Text LLM 初始化,二者具有同源的参数基础。持续的音频预训练使模型获得声音理解与生成能力,也会推动参数向音频数据分布迁移,使部分知识调用、推理稳定性和文本指令能力出现衰减。这类损失并不意味着语言能力需要从头学习,而是原有语言先验在模态预训练过程中受到不同程度的扰动。

Core-Cocktail Training 利用这种同源关系,将源 Text LLM 作为语言先验的参数参照,与预训练 AudioLM 进行参数调和。融合的目的不是再次完成音频适配,也不是向 AudioLM 注入一套无关能力,而是对音频预训练引起的参数漂移进行有限回补,使模型在保留已获得音频能力的同时,恢复被削弱的语言行为

完成参数融合之后,再进入受控 SFT,将预训练阶段形成的能力转化为可用的 Audio Policy。训练重点是能力平衡:音频与文本指令数据共同约束更新方向,避免后训练再次放大语言能力损失。

因此,参数融合更接近对同源能力的重新锚,而非一般意义上的模型能力拼接。其中:

  • Text LLM 保存音频预训练之前的语言参数参照;

  • 预训练 AudioLM 保存模态扩展后的能力状态;

  • 二者之间的调和用于选择一个更适合后训练的参数起点。

也因此,Core-Cocktail SFT 的评价不应仅依据音频指标,还需要同时考察知识、推理和文本指令能力的恢复程度。当然,参数融合也无法替代高质量数据或自动消除任务冲突,其作用是在 SFT 开始前提供更稳健的能力基线。

Multimodality OPD:把 Text Teacher 的能力迁移到 Audio Input

Core-Cocktail SFT 主要约束的是参数迁移,但参数状态得到控制,并不能保证音频路径已经完整复现了 Text LLM 的行为能力。SFT 完成后,AudioLM 在知识调用、推理、指令遵循和工具调用等任务上,仍可能低于原始 Text LLM。Multimodality On-Policy Distillation(Multimodality OPD)的作用,就是进一步缩小这一行为差距。

“能听懂”不等于完成了语言能力迁移

同一问题以文本输入时可能得到稳定回答,换成音频输入后,则可能出现语义理解偏移、推理链缩短、工具调用格式错误,或对口音、停顿和背景噪声过度敏感。因此,音频路径可用,并不等于语言能力迁移完成。

对于可靠转写的用户问题,音频与文本可视为同一语义任务的两种输入形式。在 Multimodality OPD 中:Audio Student 接收原始音频,Text Teacher 接收语义等价的文本问题。这一设置可以直接利用 Text Teacher 已具备的通用能力,无需为音频任务重新构造同等规模的能力标签。

为什么不是传统离线蒸馏?

传统离线蒸馏通常使学生模仿教师预先生成的回答,监督主要集中在教师轨迹上。问题在于,当 Audio Student 的回答开始偏离教师样本时,静态答案对后续生成的校准作用随之减弱。

Multimodality OPD 直接以 Audio Student 的实际生成轨迹作为蒸馏载体。训练时,Audio Student 根据原始音频完成 rollout;随后将这条学生轨迹与语义等价的文本问题一同 prefill 到 Text Teacher,取得各 token 位置上的 teacher logits,形成针对学生轨迹的稠密监督信号。换句话说,轨迹由 Audio Student 生成,Text Teacher 只在该轨迹上提供续写分布。

Text Teacher 之外,还需要 Audio Ref Model

在对齐过程中,还会同时保留一份由 Audio Student 自身冻结得到的 Audio Ref Model它在相同音频上下文和学生轨迹上提供 reference logits,用于约束音频相关行为的漂移。二者承担的角色不同:Text Teacher 负责迁移知识、推理和指令能力,Audio Ref Model 则维持预训练 AudioLM 已有的声音能力,避免对齐过程将模型过度拉向纯文本行为。

该设计不要求 Text Teacher 处理音频,而是将其已形成的知识调用、推理和行为决策能力迁移到语义等价的 Audio Input 条件下。

因此,Multimodality OPD 对齐的不是单纯的 Audio Feature 与 Text Feature,而是两种输入条件下的生成行为分布。特征距离接近不能直接保证最终的任务决策一致。

这套方法有一个明确边界:只有能够被文本完整表达的信息,才适合由 Text Teacher 进行对齐。

例如,“帮我查一下明天的天气”可以被稳定转写,文本教师能够提供充分的任务监督;而“我没事”所表达的平静、压抑或反讽,则可能在转写中丢失。若将所有音频任务统一蒸馏到 Text Teacher,模型可能忽略语气、节奏和环境声信息,退化为以语音为输入的文本模型。

因此,Multimodality OPD 的目标是迁移跨模态共享能力,而非消除模态差异。Core-Cocktail SFT 约束参数迁移,Multimodality OPD 校准行为迁移;文本无法覆盖的信息则由后续音频原生优化处理。

Ability Beyond Text:音频输入带来的额外能力增益

如果说 Core-Cocktail SFT 与 Multimodality OPD 均以 Text LLM 的既有能力为锚点,那么 Ability Beyond Text 关注的是另一个问题:

当模型以原始音频为输入时,能否利用转写文本中缺失的声学与副语言信息,在相关任务上取得优于纯文本输入的表现?

这种增益不一定体现为事实问答的准确率提高,而更多体现在对说话者状态、语用意图和声学环境的判断上。典型任务包括:情绪感知与共情回应言外意图与语用判断非语言事件与声学场景理解

这些任务的共同点是,决定性信息存在于原始音频中,并可能在转写时丢失。因此,单一 Text Teacher 无法提供充分监督:语义一致的两段响应,可能在共情程度、语气和节奏上存在明显差异;同一转写文本也可能对应不同的说话者状态。

为什么需要领域专家?

不同音频能力依赖的样本、评价尺度与优化目标并不相同。将其全部压入同一套训练信号,容易造成能力之间的相互稀释。更合适的组织方式,是以同一阶段的 AudioLM 为基础,分别形成面向情绪与共情、语用意图和声学场景的领域专家。每个专家只承担相对明确的能力边界,并在对应数据分布上建立稳定行为。

GRPO 可用于领域专家的能力专精。对同一音频上下文采样多个候选响应,再依据领域评价进行组内相对优化,使专家在各自任务上获得更清晰的行为偏好。这里需要区分两个问题: GRPO 负责形成能力增量,并不直接解决多个专家如何合并的问题。能力汇聚由 Multi-Teacher OPD 完成。
Multi-Teacher OPD 把专家能力重新汇聚到主模型。在 Multi-Teacher OPD 中,主 AudioLM 首先基于原始音频生成自己的回答轨迹;多个领域专家随后以相同的学生轨迹作为 prefill,提供行为分布监督,并在同一训练过程中蒸馏回主 AudioLM。

这一过程延续了 Multimodality OPD 的基本原则:监督以学生实际生成轨迹为载体,而不是仅模仿教师预先生成的离线答案。区别在于,两者对应的 Teacher 不同:Multimodality OPD 使用 Text Teacher 迁移跨模态共享能力;Multi-Teacher OPD 使用多个音频领域专家,汇聚文本世界之外的能力增量。M²-OPD 由此覆盖单一跨模态 Teacher 与多领域 Teacher 两种配置。

因此,这几个概念之间的关系可以进一步明确为:

  • 领域专家是能力形成的载体,

  • GRPO 是能力专精的一种手段,

  • Multi-Teacher OPD 才是多种领域能力进入主模型的汇聚机制。

完成蒸馏后,推理阶段仍只部署一个 AudioLM,不依赖多专家并行推理。

训练目标与方法分工

    回到整个后训练体系,可以把不同方法的作用进一步归纳为两类能力目标。

    第一类:语言能力的跨模态迁移

    Core-Cocktail SFT 与 Multimodality OPD 共同服务于语言能力的跨模态迁移。

    Core-Cocktail SFT 作用于参数状态:源 Text LLM 回补音频预训练期间衰减的语言先验,受控 SFT 再将融合状态转化为稳定的 Audio Policy。

    Multimodality OPD 作用于跨模态行为分布:对语义可文本化的问题,使 Audio Input 复用 Text Teacher 已验证的知识、推理与指令能力,并在 Audio Student 生成的轨迹上完成校准。

    第二类:音频原生能力的专精与汇聚

    领域专家与 Multi-Teacher OPD 共同服务于音频原生能力的专精和汇聚。

    不同 Expert Teacher 分别吸收情绪、语用与声学场景信号,再把这些分散能力同时蒸馏到统一的 AudioLM。其中,Multimodality OPD 与 Multi-Teacher OPD 共同构成文中的 M²-OPD,两者分别负责跨模态共享能力迁移与音频领域能力汇聚。

    它们之间存在一条清晰的分组与递进关系:

    预训练 AudioLM   │   ├─ 语言能力迁移   │    ├─ Core-Cocktail SFT:约束参数迁移   │    └─ Multimodality OPD:跟随 Text Teacher 校准行为迁移   │   └─ 音频原生能力扩展        ├─ 领域专家:通过领域数据与 GRPO 完成能力专精        └─ Multi-Teacher OPD:将多专家能力汇聚到主 AudioLMMultimodality OPD + Multi-Teacher OPD = M²-OPD

    这些方法并非同一层级的并列关系。Core-Cocktail SFT 控制参数迁移,领域训练与 GRPO 形成能力增量;M²-OPD 则提供两条互补的行为迁移路径:Multimodality OPD 迁移 Text Teacher 的共享能力,Multi-Teacher OPD 将多个领域专家的增量统一写回主模型。

    ‍▎结语

    AudioLM 后训练遵循从能力继承、领域专精到统一汇聚的连续逻辑。Core-Cocktail SFT 首先回补音频预训练引起的语言参数漂移,Multimodality OPD 随后将 Text Teacher 的行为能力迁移到 Audio Input;不同音频领域专家进一步建立文本无法覆盖的能力增量,Multi-Teacher OPD 最终将这些增量收敛到单一主模型。

    相应的评估重点依次是:Text LLM 能力保持程度、Audio Input 与 Text Teacher 的行为一致性、各领域专家的能力上界,以及能力汇聚后主模型的综合增益与干扰程度。

    未来 AudioLM 的性能差异将不仅取决于预训练规模和 Audio Token 效率,也取决于后训练能否在保持语言智能的同时,建立对情绪、语用线索和环境声的稳定建模与优化能力。

    AudioLM 的目标并非以语音形式复述文本答案,而是在保持语言智能的基础上,对文本之外的声音信息进行建模,并将分散的领域能力统一为可部署的交互能力。



     往期推荐 
     Recommend 






























































                                
    记得关注










    👇点击阅读原文,查看完整技术报告



    【声明】内容源于网络
    0
    0
    阿里语音AI
    阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
    内容 146
    粉丝 0
    阿里语音AI 阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
    总阅读1.1k
    粉丝0
    内容146