摩尔线程开源首个国产 GPU 训练音频大模型 MooER
摩尔线程正式宣布开源音频理解大模型"MooER"(摩耳),代码已托管至 GitHub。首批开源内容包含推理代码及基于 5000 小时数据训练的模型,后续将陆续开放训练代码及基于 8 万小时数据训练的增强版模型。此举旨在推动语音大模型的技术演进与落地应用。
技术架构与训练策略
MooER 是业界首个基于国产全功能 GPU 完成训练与推理的大型开源语音模型。依托摩尔线程夸娥(KUAE)智算平台及自研创新算法,该模型仅耗时 38 小时即完成了 5000 小时音频数据及伪标签的训练。
模型结构
MooER 采用 Encoder-Adapter-Decoder(LLM)三段式架构:
- Encoder:对原始音频进行建模,提取特征并生成表征向量。
- Adapter:对 Encoder 输出进行下采样,每 120ms 输出一组音频 Embedding。
- LLM:接收拼接后的音频 Embedding 与文本 Prompt Embedding,执行语音识别(ASR)、语音翻译(AST)等下游任务。
训练配置
模型初始化采用开源 Paraformer 作为语音编码器,Qwen2-7B-instruct 作为大语言模型,Adapter 模块随机初始化。训练过程中固定 Encoder 参数,仅更新 Adapter 与 LLM 参数。基于夸娥智算平台,利用 DeepSpeed 框架与 Zero2 策略,在 BF16 精度下完成训练。
为提升效率,项目引入 LoRA 技术,仅更新 2% 的 LLM 参数。实验表明,微调 LLM 参数能显著提升音频理解任务效果。
数据来源
训练数据集 MT5K 由部分开源数据与内部数据组成。内部数据的语音识别标签源自第三方云服务生成的伪标签,经文本翻译模型处理后转化为语音翻译伪标签,未经人工筛选。
性能表现与评测
摩尔线程将 MooER 与 Paraformer、SenseVoice、Whisper-large-v3 等多个主流开源模型进行了对比。结果显示,MooER-5K 在六个中文测试集上的字错误率(CER)为 4.21%,在六个英文测试集上的词错误率(WER)为 17.98%,整体表现优于或持平于同类模型。
特别是在 Covost2 中译英测试集中,MooER 的 BLEU 分数达到 25.2,显著领先其他开源模型,效果媲美工业级系统。基于 8 万小时数据训练的 MooER-80k 模型表现更佳,中文 CER 降至 3.50%,英文 WER 降至 12.66%。
关键实验结论
针对资源有限的开发者,摩尔线程总结了以下核心发现:
Encoder 选型策略
对比无监督(W2v-bert 2.0)、半监督(Whisper v3)及有监督(Paraformer)训练的编码器后发现:无监督训练的 Encoder 必须参与微调否则难以收敛。综合考量效果、参数量及效率,最终选定 Paraformer 作为 Encoder。
音频建模粒度
实验测试了 240ms、180ms 和 120ms 三种建模粒度。结果表明,该参数直接影响音视频融合效果、模型性能及收敛速度。最终确定每 120ms 输出一个音频 Embedding 为最优解。
垂类快速适应
仅使用 140 至 150 小时英文数据训练,模型即可在多个不同来源的英文测试集上取得良好效果,并成功迁移至语音翻译任务。该方案同样适用于小语种、方言等低资源场景。
LLM 对任务的影响
采用 LoRA 技术更新 LLM 参数可加速收敛并提升最终效果。此外,音频理解任务的性能随基础 LLM 能力的提升而同步增长。
更多技术细节请参阅学术文档:https://arxiv.org/pdf/2408.05101

