大数跨境

全球第一!阶跃星辰发布StepAudio 3 系列语音大模型

全球第一!阶跃星辰发布StepAudio 3 系列语音大模型 华军AI产品榜
2026-09-15
7

2026年9月15日,阶跃星辰正式发布新一代语音大模型StepAudio 3系列


image.png

覆盖实时语音交互、语音识别、真人级语音生成、音频生成和音乐创作等场景。

StepAudio 3 Gen Technical Report

多款模型在权威第三方评测机构Artificial Analysis榜单中位列全球第一。


1



带来了哪些全新变化


1、从“对话”升级为“对话+推理+执行”

StepAudio 3 Realtime面向实时语音交互场景,支持原生全双工对话,可在持续交流中判断回应和等待时机,处理临时打断和连续反馈。

模型可同时理解语义、语气、情绪及环境声音,支持推理与语音生成并行;Tool Call和长任务可异步执行,在任务运行期间不打断当前对话。

在Artificial Analysis Conversational Dynamics榜单中,以98.9%的综合得分排名全球第一;在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。

StepAudio R1 (Overview / Abstract / Leaderboard / Samples)

2、识别精度进入1.7%时代

高精度语音识别与大语言模型的上下文理解能力相结合,支持中文、英文、方言、中英混说、长音频及专业领域识别,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。

在Artificial Analysis非流式语音识别准确性榜单中,其WER(词错误率)仅为1.7%,并列全球第一。

Artificial Analysis (@ArtificialAnlys) on X

3、从“念出文字”变为“演出表达”

StepAudio 3 TTS面向真人级语音生成,核心变化是在音色、语调、节奏、停顿和情绪控制之外,还能生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。

StepAudio 3 Gen Technical Report

4、从“单点生成”变为“统一音频生成”

将人声、音效、环境声和背景音乐等原本分散的生成环节整合到统一框架中。

StepAudio 3 Gen基于StepAudio Tokenizer构建,以12.5 Hz的帧率在共享残差码空间中联合量化语义和波形级声学特征,每个码层均保留这两类信息。

5、从“一句话生成”变为“多轮协作创作”

面向音乐创作,不再局限于“一句话生成一首歌”,而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于ABC记谱法的多轮交互创作。

图片


2



如何用


1、我们先上阶跃星辰语音体验中心,按需求选 Realtime、ASR、TTS、Gen 或 Music 在线试效果。

2、要接入自己应用,去阶跃星辰开放平台。


3、Realtime 用 WebSocket 长连接调用,ASR/TTS/Gen/Music 用 HTTP API 传文本或音频,按对应文档接入。


3



全新kimi

尝鲜体验

图片










华军软件园新媒体矩阵
关注我们


华军软件园
官方@官网
华军软件园
官方@知乎
华军软件园
官方@百家号
点点赞
点分享
点喜欢
















【声明】内容源于网络
0
0
华军AI产品榜
华军软件园出品,每月发布国内AI产品排行数据丨发现最受欢迎的先进工具丨统计维度业内最多
内容 166
粉丝 0
华军AI产品榜 华军软件园出品,每月发布国内AI产品排行数据丨发现最受欢迎的先进工具丨统计维度业内最多
总阅读2.9k
粉丝0
内容166