语音克隆这几年进步很快,但多数开源模型的边界很清楚:要么只支持少数几种语言,要么克隆的效果经不起细听,要么只能"复制"不能"创造"。想要一个既能克隆任意音色、又覆盖大量语言和方言、还能用文字描述凭空设计新声音的模型,选择非常有限。
小红书 FireRedTeam 在 8 月 13 日开源的 FireRedTTS3 把这些能力收进了一个系统。它支持 24 种语言和 21 种中文方言的零样本克隆,在 MiniMax-MLS-Test 多语言评测里平均词错误率 3.75%、全场最低。更特别的是 Instruct 变体:不需要任何参考音频,用一句自然语言描述就能设计出一个全新的声音;还能对已有语音做语义编辑和声学编辑,比如"把猫换成狗"或者"语速调到 0.5 倍"。模型 Apache 2.0 协议开源,Base 和 Instruct 两个权重都已放出。
二十四语言与方言克隆
FireRedTTS3-Base 主打零样本克隆:给一条参考音频,就能用这个声音朗读任意文本。它的覆盖面在开源 TTS 里属于第一梯队——24 种语言里除了主流的中英日韩,还包含阿拉伯语、捷克语、荷兰语、芬兰语、希腊语、印地语、印尼语、波兰语、葡萄牙语、罗马尼亚语、泰语、土耳其语、乌克兰语、越南语等。完整清单里还有粤语——虽然它被归在语言类,但官方把粤语和普通话这类中文变体都做了专门处理。
对于多语言应用来说,覆盖广只是第一步,关键是每种语言都读得准。FireRedTTS3 在 MiniMax-MLS-Test 评测里把 24 种语言的词错误率全部列了出来,多数语种都控制在了 5% 以内,阿拉伯语 1.75%、捷克语 3.17%、德语 0.69%、希腊语 1.24%、日语 3.60%、韩语 2.42%——这是逐语种都有实测数据支撑的覆盖,不是"宣称支持但没验证"。
中文方言是它最突出的差异化能力。21 种方言包括四川、河南、山东、湖南、湖北、河北、陕西、山西、辽宁、甘肃、贵州、云南、安徽、福建、江西、上海、天津、温州、闽南、吴语、宁夏。对国内创作者来说,这意味着可以用家乡话做配音——方言内容的短视频、有声书、地方文化节目,以前只能靠真人录音,现在有了本地化的克隆方案。方言覆盖面直接决定了一个 TTS 在国内内容生态里的实用价值,这一点 FireRedTTS3 给得相当足。
官方评测里,FireRedTTS3 在 MiniMax-MLS-Test 多语言测试集的平均 WER/CER 是 3.75%,优于 Minimax(3.77%)、ElevenLabs(10.95%)、VoxCPM2(6.79%)、FishAudio S2(4.40%)这些对手。泰语 1.87%、乌克兰语 0.55%、越南语 0.86% 都是单语种最低。另一个独立评测 Seed-TTS-eval 里,它的平均词错误率 3.04%、说话人相似度 78.8%,同样是所有对比模型里的最佳。Seed-TTS-eval 的中文测试集上,它的相似度 80.9%,在对比模型里也排第一。
自然语言设计新声音
FireRedTTS3-Instruct 是更激进的能力:它把"设计声音"变成了一项文本任务。传统语音克隆需要参考音频,Instruct 模型不需要——你直接描述想要的声音,比如"一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮",模型就能凭空生成这样一个声音,然后用它朗读你的文本。
背后的机制是显式文本规划。模型接到声音描述后,会先写出一份"声音属性计划"(返回给调用方),再按计划合成音频。这个中间步骤让声音设计有迹可循:用户能看到模型理解成了什么,不满意可以调整描述重新生成。这也是它和其他"盲生成"模型的关键区别——可解释、可迭代、可控。
声音描述可以覆盖的维度包括性别、年龄、音色、情绪、语速、口音等。这意味着创作者可以快速试听不同的人设声音——给虚拟偶像设计声线、给游戏角色配置配音、给有声书安排旁白风格,不用再翻找音色库或者录制参考样本。官方声音设计评测里,FireRedTTS3-Instruct 在中文和英文上都拿到了全场最高分:中文的 APS(音频质量/风格匹配)85.8、英文 80.7,明显高于 Qwen3-TTS-VD(中文 83.7)和 MOSS-VoiceGenerator(中文 71.6)。
用指令编辑已有语音
Instruct 模型还支持语音编辑,分语义和声学两类。这两类编辑在同一个模型里统一实现,是它区别于"只能生成、不能修改"的纯 TTS 模型的核心能力。
语义编辑是内容层面的修改:插入、删除、替换。比如对一段音频说"把'cats'替换成'dogs'",模型会重写对应片段并保持说话人音色一致。官方评测里,语义编辑的平均词错误率 6.97%(中文),明显低于对比模型 Ming-UniAudio-Edit 的 8.53%;编辑准确率 87.27% 对 82.91%。这意味着做播客、有声书时,改错字、换句子不用整段重录,直接文字指令修。删除和替换场景下的优势尤其明显——替换任务的中文词错误率 2.92%,对比模型是 4.52%。
声学编辑是属性层面的修改:语速、音高、音量。语速可以调到 0.5 到 2.0 倍,音高可以上下移调若干步,音量在 0.3 到 2.0 范围调节。评测里语速编辑的词错误率 2.27%(中文),对比模型是 5.88%;音量编辑的音频重建误差 3.58%,对比模型高达 14.9%。注意声学编辑目前只支持固定的指令模板,自由措辞还不支持——比如语速要说"adjust the speed to 0.5x"这种格式。
架构与技术底座
FireRedTTS3 构建在"语义增强的连续语音表示"之上,底层组件都是经过验证的技术。语言模型和音频理解基于 Qwen3 和 Qwen2-Audio;声学建模采用 DiTAR 的 patch 级扩散自回归框架;音频编解码器的判别器设计参考了 X-Codec;说话人嵌入用 CAM++ 提取。
和上一代 FireRedTTS-2 相比,这一代的升级点集中在表示学习上。FireRedTTS-2 走的是传统语义 token 路线,FireRedTTS3 则强调"语义增强的连续表示"——在保留语义信息的同时用连续表示承载更细腻的声学细节,这也是它能在 24 语言上保持低词错误率的原因之一。评测数据也印证了代际差异:FireRedTTS-2 在 Seed-TTS-eval 上的平均 WER 是 4.02%,FireRedTTS3-Base 降到 3.04%。
推理时支持两种文本归一化前端:默认的 wetext 支持中英文(把"19:30"转成"十九点三十分"这类口语形式),其他语言只做基础清洗;如果想全语言覆盖,可以启用基于 LLM 的文本归一化,配置任意 OpenAI 兼容端点、模型不低于 30B 即可。语言识别是可选的:Base 模型依赖显式语言标签效果最好,不确定文本语言时可以接 Meta 的 FastText 语言识别自动检测。
社区还有一个观察值得注意:有开发者对比权重结构后发现,FireRedTTS3 的模型结构和 VoxCPM2 一致——两者都采用了类似的语义 token 加连续表示路线。如果这个判断成立,说明小红书团队选择了一条被验证过的技术路线,并在数据和多语言扩展上做出了自己的差异化。当然这只是社区推测,技术报告发布后才能确认细节。
本地部署上手
部署流程很轻。克隆仓库后用 pip 装依赖,然后从 HuggingFace 下载权重——Base 和 Instruct 是两个独立的模型文件,按需下载。初始化时选择文本归一化前端,然后调用生成接口。
零样本克隆的用法:准备一条参考音频(prompt audio)和对应的参考文本,输入要合成的文本,指定语言,就能得到克隆语音。官方提示,用目标语言或方言的 prompt 效果最好——合成日语用日语 prompt,合成四川话用四川话 prompt,因为输出会继承参考音频的说话风格。语言标签可以显式指定,也可以传 None 让模型自动检测。这个"prompt 语言和目标语言一致"的技巧对效果影响很大,是官方 README 里明确强调的最佳实践。
Instruct 模型在克隆基础上多了三个接口:generate_voice_design(声音设计)、generate_semantic_edit(语义编辑)、generate_acoustic_edit(声学编辑),全部走自然语言指令。代码结构清晰,Python API 几行就能跑通。声音设计接口会额外返回模型生成的"声音属性计划"文本,方便你检查模型的意图;语义编辑接口会返回改写后的文本和编辑掩码,方便核对修改位置。
硬件方面官方没有给出显存门槛,从模型结构推测(Qwen3 系语言模型加扩散模块),本地推理可能需要 24GB 级别的显存,具体门槛要等社区实测验证。依赖安装走 pip,requirements.txt 里列好了所有包。
开源许可与使用边界
FireRedTTS3 采用 Apache 2.0 协议,代码和权重都可以自由使用、修改、商用。但仓库里有一段明确的免责声明必须重视:项目包含零样本语音克隆功能,官方声明该能力仅限学术研究用途,禁止用于任何非法活动。
这个声明在语音克隆项目里很常见,但也意味着商用前要谨慎评估——如果你想把它接进商业产品,建议先联系团队确认授权边界,或者至少仔细阅读免责声明的完整措辞。另外技术报告还没放出(Roadmap 里标注了待发布),目前的架构描述主要来自 README 和社区解读,深度技术细节等论文出来再补。
还有一个时效性的提醒:这个项目 8 月 13 日才发布,到今天还不到两天,GitHub 星标数还很少,社区生态(第三方整合包、教程、量化版本)都还在萌芽期。喜欢尝鲜的可以立刻上手,追求稳定性的可以等社区反馈沉淀几周。
总结与展望
把 FireRedTTS3 放在一起看,它做的是三件事:把零样本克隆的覆盖面扩到 24 语言和 21 种中文方言;把"设计声音"从参考音频依赖变成自然语言描述;把语音编辑从"重录"变成"文字指令"。方言覆盖和 Instruct 能力是它和同类模型拉开差距的两个支点。
从生态位置看,FireRedTTS3 和刚开源的 IndexTTS-2.5、CosyVoice3、Qwen3-TTS 形成了差异化竞争:IndexTTS-2.5 强在情感控制和语速调节,FireRedTTS3 强在语言/方言覆盖和编辑能力。对创作者来说,选哪个取决于场景——做多语言出海内容选 FireRedTTS3,做情感丰富的单语配音可以多对比几家。多一个选择总是好事,尤其这些模型都开放权重、可以本地跑。
局限也要说清楚。粤语在评测里的表现偏弱(WER 40.32%,明显高于其他语种),部分语言和方言的效果还有提升空间;声学编辑只支持固定模板;官方把零样本克隆限定为学术研究用途,商用路径不明确;技术报告未发布,评测细节待论文补充验证。
但方向很清楚:语音合成正在从"克隆一个声音"走向"设计和编辑声音"。当方言覆盖、声音设计、指令编辑这些能力在一个开源模型里齐备时,有声内容的生产方式会迎来一轮重构。接下来值得关注的是技术报告的发布,以及社区基于这两个权重能做出什么。
获取方式
- • GitHub 代码仓库:https://github.com/FireRedTeam/FireRedTTS3
- • HuggingFace 模型:https://huggingface.co/FireRedTeam/FireRedTTS3

