8 月 25 日,BreezeBlue 开源了 Breeze TTS 2。这个约 3.5B 参数的开放权重语音合成模型,在 Artificial Analysis 盲测榜单上以 1213 Elo 拿下开源第一,把语音克隆、语音设计、语音引导三种能力塞进了一个模型,还做到了实时流式输出。
语音合成领域正在换赛道。
过去几年,开源 TTS 的比拼焦点是"像不像人":自然度、音色还原、多语言支持。但真正做语音产品的团队都清楚,光像人不够——游戏里要给成千上万个 NPC 配出各不相同的声音,客服机器人要在同一句话里切换语气,语音助手要像真人对话一样边说边响。这些需求指向的不是"更自然的朗读",而是"可设计的角色声音"和"实时的交互响应"。
这也是为什么近半年的 TTS 开源项目,从 IndexTTS 到 FireRedTTS,都在往"可控性"和"实时性"上发力。模型再自然,如果只能照着文本念,就还是"朗读机";只有当声音可以被设计、被指挥、被实时生成时,TTS 才真正成为语音产品的基础设施。
BreezeBlue 这次开源的 Breeze TTS 2,瞄准的正是这个方向。它把语音克隆、语音设计、语音引导三种能力放进同一个模型,用自然语言就能操控声音,同时把流式输出的延迟压到了百毫秒级。在 Artificial Analysis 的 TTS 盲测排行榜上,它以 1213 Elo 成为排名最高的开源权重模型——总榜第 6,排在它前面的全部是闭源商业系统。
开源榜单登顶
先说这个榜单的分量。Artificial Analysis 的 TTS 排行榜采用盲测 Elo 机制:用户听同一段文字由不同模型生成的语音,选出更自然的一方,反复对战后得出分数。这是目前 TTS 领域引用最广泛的第三方评测之一。
Breeze TTS 2 以 1213 Elo 位列开源权重模型第一,在全部 100 个模型中排第 6。它比开源第二名 Fish Audio S2 Pro(1127)高出 86 分,也超过了 Google Gemini 3.1 Flash TTS(1211)、ElevenLabs Eleven v3(1178)这些闭源系统。榜单前五名——Sonic 3.6、Simba 3.2、Qwen-Audio-3.0-TTS-Plus、Luna TTS、v3 Conversational——全是商业 API,Breeze TTS 2 是开源阵营里离它们最近的一个。
需要注意的是,这个第一来自"Provider Voices"轨道,即各家用自己的原生音色参赛。Artificial Analysis 还设有"Controlled Voices"轨道,用同一个参考说话人来考验模型的还原能力,Breeze TTS 2 在那里与 Fish Audio S2 Pro 持平(1002 Elo)。两轨的差异说明它的优势更多来自自研音色的质感,而非纯粹的声学还原——这恰好与它"为角色造声音"的产品定位一致。
另外,榜单快照每天都会变:Elo 分数会随着盲测投票累积而小幅波动,排名也可能被新发布的模型刷新。但"开源第一、总榜前六"的位置,足以说明 Breeze TTS 2 在自然度上已经站到了闭源模型的同一梯队。
克隆设计引导
Breeze TTS 2 的核心是三种能力合一,对应三条命令。
语音克隆(Voice Clone)是最传统的一种:给一段干净的参考音频和它的精确文字稿,模型就能保留说话人的音色、节奏、情感和风格。官方示例里,英文和中文都能直接克隆。
语音设计(Voice Design)则是它的独门绝技:不需要任何参考音频,只用一句自然语言描述,就能生成一个全新的声音。想要"一位温柔自信的年轻女性,声音清晰,语气亲切"?把这句话作为指令传给模型,它就能合成出符合描述的声音来。
语音引导(Voice Direction)介于两者之间:先给一段参考音频锁定说话人身份,再用自然语言和行内标签指挥这段声音怎么演——语气、情感、节奏、表达方式都能调,但声音还是那个声音。
除此之外,模型还支持情绪与动作标签,英文是括号形式,中文是方括号:(sigh)、(laugh) 对应 [叹气]、[笑]。写剧本时把这些标签插进文本,模型就会在对应位置叹气、咳嗽或清嗓子。别小看这些细节——在角色扮演、有声书和游戏对白里,"在正确的位置喘一口气"往往就是表演有没有灵魂的分界线。
三种能力共用同一套推理代码和同一个模型权重——官方把语音设计、语音引导与低延迟流式生成整合进了单一模型。对开发者来说,这意味着不用为了克隆、设计、引导分别部署三套系统,一条推理管线全部覆盖。
上手体验
想本地跑 Breeze TTS 2,流程不复杂。克隆官方推理仓库,安装依赖,模型权重直接走 Hugging Face 下载(所有组件都包含在一个 checkpoint 里)。官方提供了 Docker 镜像构建脚本,默认面向 H100/Hopper 架构,A100 用户加一个环境变量即可。
语音设计只需一条命令,指令语言要与目标文本一致,中文就用中文描述:
python infer.py ../breeze-tts-2 \
--text "[笑] 欢迎来到今晚的故事时间,让我们一起开始吧。" \
--instruction "一位温柔自信的年轻女性,声音清晰,语气亲切,表达轻快而富有感染力。" \
--cfg-scale 4 \
--output outputs/voice_design_zh.wav
--cfg-scale 4 是官方建议的参数,用来加强指令遵循。语音克隆和语音引导也各有一条对应的命令,区别只在于是否传入 --ref-audio 参考音频。
一句话造声音
语音设计是 Breeze TTS 2 最值得细看的能力,因为它解决的是行业里一个真实的痛点:音色库永远不够用。
传统方案里,要一个新角色声音,要么从预设音色库里挑(往往找不到完全合适的),要么花钱请人录(周期长、成本高)。语音设计把这件事变成了写提示词:描述角色的年龄、性别、音色、语气、说话节奏,模型直接生成。对游戏和动画团队来说,这意味着数千个 NPC 可以各有各的声音,而不用请一个配音工作室。
官方自研的 TTS Voice Design Benchmark 显示,Breeze TTS 2 的 Role Fit(角色贴合度)得分 78.02,领先第二名 MiMo-V2.5-TTS 的 72.78 有 5.24 分;Voice Diversity(声音多样性)708,比最接近的竞品多出 39% 的可区分声音;Transcript Pass 率 98.5%。官网还放出了大量示例:从低沉沙哑的外星教官,到气若游丝的精灵骗子,再到喘着气播报的新闻记者——都是纯文字描述生成的。
需要说明的是,这套基准是 BreezeBlue 自己发布的,属于厂商自测数据,参考时要心里有数。不过它的评测思路值得肯定:Role Fit 考察"描述的声音和生成的声音是否贴合",Transcript Pass 考察"生成语音能否被准确转写回来",这比单纯比自然度更贴近"为角色造声音"的真实目标。BreezeBlue 还把这三个基准(语音设计、语音引导、延迟)连同评测代码一起开源了,后续其他模型也能在同一把尺子下比较。
导演级引导
语音引导解决的是另一个问题:声音有了,怎么让它演?
同一个角色,高兴时和愤怒时说话方式完全不同。语音引导允许在保留音色身份的前提下,用自然语言指挥表演:指定语气、情感、语速,甚至可以在文本里插入 [gasps] 这类动作标签让模型在特定位置喘气。官方示例里,一段从"自信安抚"到"突然惊恐"的转折,通过指令就能在一句话内实现。
在官方 TTS Voice Direction Benchmark 上,Breeze TTS 2 的引导得分 4.25,比第二名 MiMo-v2.5-TTS 的 3.76 高出 13%;同时说话人相似度 SPK_SIM 保持在 0.67,说明"换表演不换声音"这件事它确实做到了。
这个能力对有声内容生产意义很大。想象一个播客节目:主播声音不变,但每期要根据内容切换严肃、轻松、激动的状态;或者一个游戏角色,战斗时语速急促、对话时放松——过去这需要配音演员反复录制或者后期调音,现在一段文字指令就能完成。配合前面说的语音设计,工作流就变成了:先用文字"造"出角色声音,再用文字"指挥"它在每个场景里怎么演。
速度与流式
Breeze TTS 2 生来就是给实时交互用的,流式能力是它的第三个支柱。
官方实时 SDK 保持一个 WebSocket 连接跨越多轮对话:文本边输入边追加,模型边生成边把原始 PCM 音频流回客户端,不用等整句话说完。这在语音助手、游戏角色对话这类场景里是刚需——用户等不了"整段生成完再播放"的旧模式。服务端也提供了对应的流式 API,一条 curl 命令就能把文本和参考音频发过去,直接拿回 24kHz 的 PCM 音频流。
延迟方面,第三方评测(AlphaSignal 引用 Artificial Analysis 数据)给出的数字是:首字节 p50 119.4 毫秒,首音频 p50 133.6 毫秒、p95 163.3 毫秒,在同一基准上快于 ElevenLabs Flash v2.5 和 Fish Audio S2.1 Pro。本地推理还支持 --fast-all 参数,为文本编码、骨干网络 prefill/decode、深度解码器、编解码器等各阶段启用 CUDA Graph 加速,进一步压低首字延迟。不想折腾命令行的,也可以直接用官方托管的流式 API——不过要留意它的定价是 34 美元/百万字符,在开源模型里不算便宜,自部署才是长期划算的路子。
需要提醒的是,低延迟不等于高吞吐:Breeze TTS 2 的合成速度约 45 字符/秒,慢于 Fish Audio S2 Pro 的 102 字符/秒。对实时对话场景这不是问题,但如果你要批量合成超长文本,这个差异值得留意。
架构与许可
看一眼配置就能明白 Breeze TTS 2 的底子:骨干是 Qwen3 风格的 LLM(约 1B 配置),配合一个约 100M 的深度解码器,音频编解码器采用 Kyutai 的 Mimi(24kHz、32 量化器、生成使用 16 个 codebook),总参数约 3.47B——这个数字直接来自官方权重文件的元数据。输出采样率 24kHz,流式 API 返回单声道 16 位 PCM。
许可证方面要重点说清楚,因为 Breeze TTS 2 是"双轨制":源码采用 Apache 2.0,随便改随便用;模型权重则适用 BreezeBlue Research and Non-Commercial License v1.0——免费用于研究和非商业用途,但这不是开源许可证,不授予任何商业权利,微调、LoRA、量化、蒸馏等衍生模型同样受限。商用需要向 RESONIA, INC.(BreezeBlue)申请书面授权。也就是说,个人研究和学习完全没问题,想把它用在商业产品里,得先联系官方拿许可。
多语言方面,官方宣称支持 50 种语言,并支持口音控制来适配不同地区听众。考虑到模型同时服务中英文的克隆、设计和引导场景,对国内做语音应用的团队来说,中文支持程度会是实际选型时的关键考察项——建议上手后先用中文语料实测一轮,再决定是否接入生产。
局限与展望
客观地说,Breeze TTS 2 的短板也清晰:吞吐偏低(约 45 字符/秒),批量长文本场景不占优;Controlled Voices 轨道的 1002 Elo 说明它在"复刻任意给定声音"上的通用还原能力与顶尖闭源模型仍有差距;托管 API 定价 $34/百万字符,在开源模型里偏贵,好在权重可以自己部署。另外,模型官方明令禁止未授权的语音克隆、冒充与欺诈用途,做语音产品的团队需要自行把关合规。
但对开发者来说,Breeze TTS 2 的意义在于把"设计声音、指挥表演、实时响应"三件事第一次完整地打包进一个可下载的模型:游戏 NPC、虚拟陪伴、客服语音、多语言内容管线,都能在本地跑起来。官方还配套了 BreezeBlue Creator 这个免费浏览器工具,不想写代码也能在线体验语音设计和引导;Voice Galaxy 里则沉淀了超过一万五千个角色声音,可以当提示词灵感库用。开源 TTS 的竞争,正在从"谁读得更像人"转向"谁更能被指挥",Breeze TTS 2 在这个新赛道上抢到了第一的位置。
参考资源:
-
• Hugging Face:https://huggingface.co/BreezeBlue/Breeze-TTS-2 -
• GitHub 仓库:https://github.com/breezeblue-ai/breeze-tts -
• 官方博客:https://breezeblue.ai/breeze-tts-2

