大数跨境

小米开源MiLMMT-46翻译模型:12B参数支持46种语言,性能对标Google Translate和Gemini 3 Pro

小米开源MiLMMT-46翻译模型:12B参数支持46种语言,性能对标Google Translate和Gemini 3 Pro 努力犯错玩AI
2026-07-31
1
导读:多语言机器翻译正在经历一场从封闭到开放的转变。小米研究院和厦门大学联合发布 MiLMMT-46-12B-v1

多语言机器翻译正在经历一场从封闭到开放的转变。小米研究院和厦门大学联合发布 MiLMMT-46-12B-v1.0,一个基于 Gemma3-12B 的多语言翻译模型,支持 46 种语言的相互翻译,以 Apache 2.0 许可开源。

论文核心结论:在 46 种语言的评测上,MiLMMT-46-12B 全面超越同级别的开源模型,性能与 Google Translate 和 Gemini 3 Pro 处于同一水平。开源模型与商用翻译系统的差距正在被抹平。

模型训练分三个阶段:持续预训练在 143B tokens 的多语言数据上完成基线提升,监督微调用 26 万高质量翻译对精调,最后用强化学习进一步优化。论文还系统研究了模型规模和数据规模对多语言翻译的影响——这是目前针对开源 LLM 多语言翻译最全面的一次扩展性分析。

三阶段训练:从基座模型到专业翻译

MiLMMT-46 的基座是 Gemma3-12B。小米团队没有从头训练模型,而是在 Google 公开的 Gemma3 上做了三阶段专项优化。

第一阶段是持续预训练。训练数据包括单语数据和双语平行数据。单语来自 DCAD-2000 数据集(覆盖 2000 多种语言,经过异常检测清洗)。平行数据来自 OPUS 语料库,包含所有英中和中英翻译对,截止到 2025 年 8 月。清洗后得到约 49 亿句对,覆盖 46 种语言。

数据混合策略是论文的一个关键贡献——Parallel-First Monolingual-Second(PFMS)。优先使用平行句对做训练,因为平行数据直接对应翻译能力。在平行数据不足的语言上,再补充单语数据到目标 token 数。每种语言的 token 预算根据语言资源丰富程度分为多个档次——高资源语言 3B tokens,低资源语言低至 0.1B tokens。额外还有 0.1N 的增量用于保持长上下文能力。

团队还研究了 tokenizer 的效率。NLLB 在各语言上的 tokenization 效率最高(即非英文文本分词后的 token 数最接近英文)。Gemma3 在开源模型中表现最均衡——Qwen2.5 和 Qwen3 在低资源语言(缅甸语、老挝语、高棉语)上的 tokenization 效率显著低于 Gemma3。这也是选择 Gemma3 作为基座的原因之一——token 效率差异会在 143B tokens 的训练规模下放大,直接影响各语言的实际训练量。

最终第一阶段产出 143B tokens 的训练量,得到 MiLMMT-46-12B-Pretrain。这个 checkpoint 本身不是一个可用的翻译模型——它只是拥有了多语言理解的基座能力。

第二阶段监督微调。筛选了约 26.4 万句高质量翻译对,覆盖 192 个翻译方向。数据来源包括 FLORES+ dev 集、NTREX-128 dev 集、TowerBlock、BOUQuET、OLDI Seed、WMT15-23 测试集。用 Gemini 3.0 Pro 和 GPT-5 为每个源句生成多个候选翻译,再用 XCOMET 和 COMETKiwi 打分,取最优结果。

论文发现一个有意思的结果:大约 10 万句高质量翻译对就足够覆盖全部 46 种语言的效果,超过这个规模后边际收益递减。这说明数据质量比数量更重要。

第三阶段强化学习。在前两阶段产出的 MiLMMT-46-12B-v0.1 基础上做 RL 优化,得到最终版本 v1.0。RL 阶段进一步提升了翻译流畅度和准确性,特别是在低资源语言上的表现。模型的代码、训练脚本和权重全部以 Apache 2.0 许可公开。

开源方案与商用系统正面硬刚

论文在多个评测维度上做了详细对比。WMT24++ 参考无关评测有 21 种语言和 46 种语言两档设置。在 21 种语言设置下,MiLMMT-46-12B 的 XCOMET 得分为 86.28,COMETKiwi 得分为 82.47。Tower-Plus-9B 是 80.00/77.75,Seed-X-7B 是 83.32/80.62,GemmaX2-9B 是 81.27/78.68。MiLMMT-46-12B 领先约 3-6 个百分点。

在全部 46 种语言的设置下,Google Translate 的 XCOMET/COMETKiwi 是 84.73/81.48,Gemini 3 Pro 是 86.52/82.85。开源模型与商用系统在 46 种语言全量评测上的差距已经很小。

FLORES+ 基准采用 spBLEU 和 COMET 指标,使用 8-shot 上下文学习范式。英文到其他语言方向上,MiLMMT-46-12B 的 spBLEU 得分 38.25,COMET 88.66。其他语言到英文方向 spBLEU 44.34,COMET 88.73。这些数据是在 Gemma3-12B 零样本基础上通过三阶段微调提升的结果——Gemma3-12B 原始基座相应数据是 30.91/79.29 和 39.63/84.82。微调带来的提升相当显著。

开源模型间对比

在与同级别开源翻译模型的对比中,MiLMMT-46-12B 几乎全面领先。在 21 种语言的重叠评估中,Tower-Plus-9B 的 XCOMET/COMETKiwi 分别是 80.00/77.75,Seed-X-7B 是 83.32/80.62,GemmaX2-9B 是 81.27/78.68。MiLMMT-46-12B 的 86.28/82.47 领先约 3-6 个百分点。Tower-Plus 和 Seed-X 此前被认为是开源翻译的标杆,MiLMMT-46 在这一代上实现了明显超越。

26 种语言设置的结果类似:MiLMMT-46-12B 的 XCOMET 85.37,比 GemmaX2-9B 的 79.97 高 5 个点以上。28 种语言设置下 86.90 对 GemmaX2-9B 的 81.85。42 种语言(剔除日语、韩语、粤语、繁体中文)下 83.98 对 HY-MT-1.5 的 79.29 和 Tower-Plus-9B 的 78.00。涵盖了目前开源翻译模型主流的几种语言配置,MiLMMT-46 在每种配置下都是最优的。

FLORES+ spBLEU 和 COMET 提供了翻译质量的详细对比。英文到其他语言方向,MiLMMT-46-12B 的 COMET 达到了 88.66,对比 Gemma3-12B 原始基座的 79.29——三阶段微调带来了近 10 个点的提升。其他语言到英文方向 COMET 88.73,对比基座 84.82。对比商用系统,在 46 种语言的全量设定下,Gemini 3 Pro 的 xx→en 翻译 COMET 得分 89.44,Google Translate 是 89.42——MiLMMT-46-12B 的 88.73 差距在 1% 以内,几乎持平。

这篇论文的价值不止于一个模型。它系统地回答了三个核心问题:在持续预训练阶段,模型规模和数据规模各自贡献多少?在监督微调阶段,数据质量比数量重要多少?多语言翻译模型在当前开源 LLM 基座上的天花板在哪里?回答是:更大的模型和更多的数据都有效,但存在明显的边际效应。模型从 1B 扩展到 4B 再到 12B,每个规模下训练都能带来一致的翻译质量提升。数据方面,高资源语言的提升更依赖于数据质量(更好的筛选、更准确的翻译),低资源语言则还处在数据数量说话的阶段——加数据就有效果。强化学习对高资源语言的效果最显著,对低资源语言的提升相对有限。

研究还发现在监督微调阶段,大约 10 万句高质量翻译对就已经足够覆盖全部 46 种语言的基本效果,超过这个规模后边际收益明显递减。这个结论对实际部署有价值——不需要海量标注数据就能训练出可用的翻译模型。

46 种语言包括什么

覆盖的语言跨越了多个语系:阿拉伯语、阿塞拜疆语、保加利亚语、孟加拉语、加泰罗尼亚语、捷克语、丹麦语、德语、希腊语、英语、西班牙语、波斯语、芬兰语、法语、希伯来语、印地语、克罗地亚语、匈牙利语、印度尼西亚语、意大利语、日语、哈萨克语、高棉语、韩语、老挝语、马来语、缅甸语、挪威语、荷兰语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、瑞典语、泰米尔语、泰语、他加禄语、土耳其语、乌尔都语、乌兹别克语、越南语、粤语、简体中文、繁体中文。

几个值得注意的亮点:粤语被单独列为一门语言而非中文方言,这在开源翻译模型中比较少见;繁体中文和简体中文分开处理,覆盖了港台和大陆的不同用语习惯;中亚语言(哈萨克语、乌兹别克语、阿塞拜疆语)的加入让语言版图从主流语种延伸到欧亚大陆更多地区。

模型支持多对多翻译——任意两种支持的语言之间都可以做双向翻译,不需要针对特定语言对单独部署。翻译 prompt 格式简单:Translate this from [源语言] to [目标语言] + 原文即可。

局限与展望

MiLMMT-46 目前只支持这 46 种语言,官方明确标注超出此范围的翻译质量不做保证。许多常见语言如乌克兰语、塞尔维亚语、立陶宛语、拉脱维亚语、爱沙尼亚语、格鲁吉亚语、亚美尼亚语等都不在支持列表中。非洲语言完全缺失。

模型推理速度受 Gemma3-12B 基座限制。12B 参数在消费级 GPU 上推理需要一定的硬件投入。vLLM 支持已提供,但没有量化版本发布。对于生产部署,建议使用 vLLM 或自行量化。

部分语言对上的翻译质量差距较大。高资源语言(英、中、日、韩、法、德、西)的效果最好,低资源语言(如老挝语、缅甸语、高棉语)的翻译质量相对偏低。这是训练数据量分布不均导致的——团队在论文中也提到了这个问题。

从正面看,MiLMMT-46 是第一个在 46 种语言范围内系统对比开源翻译模型与商用系统性能差异的公开工作。Apache 2.0 许可让企业可以对模型做定制和商用部署。模型使用的训练框架是基于最常用的 LlamaFactory,微调和部署的门槛都不高。随着 46 种语言翻译能力的开源,多语言 NLP 应用的门槛正在降低。

获取方式

模型以 Apache 2.0 许可发布在 HuggingFace(xiaomi-research/MiLMMT-46-12B-v1.0)。GitHub 仓库(xiaomi-research/gemmax)提供完整训练脚本和数据样例。在线 Demo 可在 HuggingFace Spaces(xiaomi-research/milmmt-46-translation)直接体验。

【声明】内容源于网络
0
0
努力犯错玩AI
为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
内容 286
粉丝 0
努力犯错玩AI 为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
总阅读2.4k
粉丝0
内容286