大数跨境

刚刚,中国语音AI连拿多项全球第一!

刚刚,中国语音AI连拿多项全球第一! 新智元
2026-09-15
7

新智元报道

地铁急刹的金属尖叫、广播提示、人群骚动与孩童哭声交织,甚至能感知到车厢的晃动。这并非电影原声,而是 AI 通过一句 Prompt 一次性生成的音频。

再看一首歌曲:从一段无伴奏的清唱开始,AI 仅需一句“温暖柔和的 City Pop 男声,带爵士与轻摇滚感”的指令,便补齐了编曲、和声与节奏,将干涩的人声转化为呼吸感完整的作品。

音频大模型进入“体系化”竞争时代

过去两年,语音 AI 赛道热度空前。Suno 发布 v6 系列,OpenAI 将实时语音推理提升至 GPT-5 级别,Google 则强化了多语言流式翻译能力。然而,行业普遍存在“单项比拼”现象:合成比真人度、识别比准确率、音乐比好听程度。

现实场景的需求往往是复合的。短视频制作需同时处理配音、音效与背景音乐;Voice Agent 的运行依赖识别、生成、推理与工具调用的协同;音乐创作常需基于清唱进行二次编曲。这些场景要求的不再是单一模型,而是一套完整的能力体系。

9 月 15 日,阶跃星辰正式发布 StepAudio 3 系列五款模型,涵盖语音生成(TTS)、完整音频生成(Gen)、实时交互(Realtime)、语音识别(ASR)及音乐创作(Music)。这是国内首家以完整矩阵形态推出的音频大模型系列,标志着行业竞争从“单点突破”转向“全栈体系”。

第三方榜单数据显示,StepAudio 3 在多项核心指标上斩获全球第一:

  • 对话节奏感:在 Artificial Analysis Conversational Dynamics 榜单中,StepAudio 3 Realtime 综合得分 98.9%,位居全球第一。该指标衡量模型在对话中把握插话、停顿与倾听时机的能力。
  • 语音推理准确率:在 Speech Reasoning 榜单中,StepAudio 3 Realtime 以 99.7% 的准确率位列全球第一,展现了原生语音模型直接理解音频并执行复杂推理任务的能力。
  • 识别准确性:在非流式语音识别榜单中,StepAudio 3 ASR 的词错误率(WER)仅为 1.7%,并列全球第一,接近专业速记员水平。

像人一样交流:从“声音自然”到“表达自然”

当前语音模型的基础能力已趋成熟,但真正的差距在于能否还原人类交流的真实状态:听懂语境、自然表达,并在持续对话中完成理解与行动。

StepAudio 3 TTS:还原真实语感

市面上的 TTS 模型多能模拟“播音员”般的字正腔圆,却缺乏真实人类交流中的不完美感。StepAudio 3 TTS 不仅追求音色逼真,更着重于表达方式的拟人化。

在生成的语音样本中,模型能够自主判断语义,还原叹气、口语化重复(如“多个,多个四千”)、语气上扬及无奈的发声细节。这些副语言特征并非预设标签,而是基于语义的自主生成。相比前代产品在 Artificial Analysis Speech Arena 取得的国产第一成绩,StepAudio 3 TTS 实现了从“音色像”到“说话方式像”的跨越。

StepAudio 3 ASR:从“听清”进阶“听懂”

传统 ASR 仅依赖声学信息,易出现同音错字。StepAudio 3 ASR 将高精度声学建模与大语言模型的语境理解相结合,不仅能处理方言、口音、中英混说及背景噪音,更能通过上下文推理纠正识别错误。

实测显示,在面对带有压缩感和失真的机场广播录音时,StepAudio 3 ASR 能准确转写"MU 5127"、"C17"等关键字母数字组合,展现出极高的鲁棒性。这种端到端的完整理解能力,使其从单纯的转写工具进化为语音理解基础设施,大幅提升了在会议、客服及车载场景的可用性。

StepAudio 3 Realtime:边聊边想边做

2026 年,全双工与低延迟已成为实时语音的标配。StepAudio 3 Realtime 的核心优势在于推理与生成的并行处理能力。它支持在对话中随时打断,且能在中断后无缝衔接上下文,无需重启话题。

在实测中,用户在一分钟内四次修改需求(如变更时间、交通工具),模型均能即时响应并准确理解意图(如将“直飞”理解为“直达高铁”),同时严格遵守不擅自执行预订操作的规则。这种“听、说、想、做”同步在线的能力,是 Voice Agent 从演示走向商业落地的关键。

从“出片段”到交付“作品”:Gen + Music

StepAudio 3 系列的 Gen 和 Music 模型,标志着音频生成从输出素材向交付完整作品的转变。

StepAudio 3 Gen:搭建完整声音场景

传统声音制作需人工拼接配音、音效与背景音乐,耗时费力。StepAudio 3 Gen 可通过自然语言描述,一次性生成包含人声、音效、环境音及背景音乐的完整场景,并自动完成时序编排。

该模型具备精细的控制粒度,支持对多角色的音色、情绪、方言及副语言细节进行独立设定。在一段废弃 KTV 的复仇戏 Demo 中,模型不仅生成了连贯的情绪弧线,还通过声场位置的变化构建了清晰的空间叙事。这种能力将显著降低影视、游戏及有声书的声音制作门槛。

StepAudio 3 Music:辅助专业音乐创作

针对音乐创作中常见的“基于 Demo 完善作品”的需求,StepAudio 3 Music 支持歌词、干声、哼唱等多种输入方式。它不仅能“一句话成歌”,更能根据详细的 Prompt(如调式、BPM、配器、动态变化)进行精细化控制。

其“清唱配乐”功能尤为突出:模型能理解清唱中的旋律与情绪,自动补充和声与编曲,将简单的哼唱转化为结构完整的成品。这种对音乐制作层面的深度介入,使其成为创作者得力的辅助工具。

全栈体系构建产业新壁垒

StepAudio 3 系列五款模型的推出,构建了覆盖“理解→生成→交互→创作”的完整音频能力栈。对于开发者与企业客户而言,这意味着无需再拼凑多家供应商的技术方案,一套体系内的模型在接口设计与能力协同上更具优势。

随着单点能力逐渐拉平,体系化的覆盖与协同将成为决定竞争力的关键。当 AI 生成的音频具备电影级的层次感,当 AI 作曲能响应专业的制作指令,声音领域的 AI 应用已正式进入“玩真的”阶段。

编辑:所罗门

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16549
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读404.1k
粉丝0
内容16.5k