大数跨境

全球第一,碾压谷歌!中国版Thinking Machines诞生,语音赛道变天了

全球第一,碾压谷歌!中国版Thinking Machines诞生,语音赛道变天了 新智元
2026-08-14
2
导读:语音与交互赛道,中国队站上世界之巅

导读

全球语音与交互领域迎来重磅突破,中国初创公司宇生月伴(VUI Labs)及其核心模型 Luna-TTS 强势崛起。在 Hugging Face TTS Arena 榜单上,该模型击败 ElevenLabs、MiniMax 等国内外巨头登顶全球第一;在 Artificial Analysis Speech Arena 榜单中超越谷歌位列全球第三。VUI Labs 以高精度 TTS 为切入点,致力于构建全双工 Voice Agent 闭环,其技术路线与 Thinking Machines Lab 不谋而合,展现出引领下一代自然交互范式的巨大潜力。

击败巨头登顶全球 TOP 1,Luna-TTS 模型凭什么?

Luna-TTS 生成的语音在自然度与真实感上已达到难以分辨真假的程度。无论是影视片段配音、体育赛事解说,还是自然纪录片旁白,其听觉体验均极为流畅,彻底摒弃了传统 AI 语音在情绪激动时的生硬感与机械播音腔。

主流自回归(AR)模型因采用“从左到右逐字生成”的逻辑,难以捕捉声音中情绪、音色、呼吸等多维度的全局交织变化,且易产生累积误差。VUI Labs 推出的 Luna-TTS 颠覆了这一传统架构,将“逐 Token 生成”改造为类扩散模型的语音生成系统,并专门设计了实时流式分支 Luna-TTS Realtime。该系统先将声音压缩为离散 Token,利用基于 Qwen3 改造的 Diffusion LM 并行预测大量语音 Token,从而实现了音质与效率的双重突破。

六项指标全球第一

Luna-TTS 在“拟人化”的五个维度上表现卓越:发音准确连贯、语流抑扬顿挫、语境情绪切换自然、细微情感(如换气、轻笑)还原度高,且在长文本表达中依然稳定。此外,其音视频克隆能力极强,仅需几分钟样本即可复刻音色、语气甚至呼吸节奏。

六个第一的含金量:四项语音质量 + 两项模型效率

最新技术报告显示,Luna-TTS 在 Seed-TTS-Eval 评测的四项语音质量指标中全部排名第一,显著优于字节 Seed、MiniMax、智谱及 Qwen 系列;同时在 CV3-Eval“野外”复杂环境评测中展现了惊人的抗噪与纠错能力。

除音质外,该模型在首包延迟和端到端实时率(RTF)两项效率指标上同样位居全球第一。实测数据显示,在双卡 H20 GPU 部署下,首包延迟低至 41.6 毫秒,实时倍率仅为 0.024(生成 1 秒语音仅需 24 毫秒),完全满足全双工实时对话需求。

架构演进:从预训练 AR 到 Block Diffusion

团队基于 Qwen3-0.6B 基座模型,设计了渐进式改造路线。针对 AR 模型在处理长句和不规则文本时易出现的跳字、重复问题,Luna-TTS 采用了双向掩码扩散架构。该架构允许模型在去噪过程中同时感知全局上下文,通过多步置信度精炼动态修正局部错误,大幅消除了暴露偏差。

Tokenizer 创新:Luna-Codec 的语义锚定

Luna-Codec 采用 8 码本架构,创新性地引入 WavLM 语义蒸馏 Loss,将语言/语义信息强制“锚定”在第一层码本(CB1)中,构建稳定的字音骨架;其余码本则专注于捕获音色、环境声道及情绪韵律细节。这种“语义到声学”的层次化设计,显著降低了扩散模型的预测难度。

强化学习突破:GRPO 迁移至离散掩码扩散模型

Luna-TTS 成功将基于 GRPO 的强化学习后训练迁移至非自回归离散掩码扩散模型上。通过轨迹感知与字典序奖励机制,解决了并行生成模式下无法直接按链式法则计算输出概率的难题,进一步提升了生成质量。

Block Diffusion 与工程落地

为满足实时交互需求,Luna-TTS Realtime 方案将语音切分为 1.28 秒的小块。块内采用 8~16 步并行去噪,块间采用自回归方式并支持 KV Cache 加速。配合 vLLM-Omni 框架实现的显存解耦与流式 Chunk 递交,以及针对特殊符号的文本正则化预处理,确保了长时推理的稳定性与响应速度

数据工程与真实情感控制

模型基于百万小时级的多语言精调语料库训练,并精选 10 万小时高质量子集进行退火训练。特别是在第三阶段,引入了包含行内非语言发音标签(NVV,如笑声、叹息、喘息)的精细标注数据。这些标签直接作为文本提示输入,使模型能自然地演绎呼吸与情绪起伏,无需额外的风格编码器。

左手顶尖科学家,右手商业操盘手:一支造梦铁军

VUI Labs 的成功源于“科研 + 商业”的双核驱动模式。

科研核心由创始人兼董事长钱彦旻教授领衔。作为上海交通大学特聘教授、教育部长江学者,钱教授在端到端语音模型领域成果丰硕,近五年论文引用量居全国第一、全球第三,曾荣获吴文俊人工智能自然科学一等奖,是国际语音技术界的领军人物。

商业核心由创始人兼 CEO 梅杰担纲。这位连续创业者曾在 Aircourse 任职期间,三年内将公司年营收提升至 5 亿元以上。他擅长将前沿技术转化为可交付的行业产品,打通从概念验证到规模化落地的关键环节。

目前,VUI Labs 拥有一支近 50 人的研发团队,博士占比高达 50%,是一支兼具算法深度、工程实力与商业洞察的全能战队。

7400 亿美元的市场:让 AI 真正打工赚钱

VUI Labs 构建了清晰的三层产品体系,直指真实商业场景:

  • 模型 API:提供全球顶尖的语音生成、声音克隆、识别转写及实时翻译能力;
  • 创作者和开发者平台:覆盖从创意到成片的完整流程,支持配音创作、多角色演绎及多模态内容生成;
  • 语音 Agent 平台:提供从场景梳理、知识库配置到低延迟对话编排的全流程服务,助力企业快速搭建可执行任务的语音智能体。

该务实打法已在物流调度、互联网保险、酒旅 SaaS 等场景规模化落地,累计完成超 100 万次真实业务对话。测算显示,到 2030 年,相关市场规模可达 2660 亿至 7400 亿美元,VUI Labs 正稳站这一入口。

中国 AI 的下一场战役:成为人类的"AI Teammate"

未来的交互需要的是像人类一样自然呼吸、思考与协作的 AI 语音。宇生月伴凭借全面 SOTA 的技术实力,证明了中国团队在 AI 语音赛道上的全球领导力。随着“中国版 Thinking Machines Lab"的成型,最自然的语音交互正转化为商业世界中最强大的生产力,在各行各业的隐秘角落悄然上岗。

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16463
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读338.4k
粉丝0
内容16.5k