大数跨境

一套模型覆盖识别、合成与实时对话,Qwen-Audio-3.1来了

一套模型覆盖识别、合成与实时对话,Qwen-Audio-3.1来了 AIGC开放社区
2026-09-24
3
导读:Qwen-Audio-3.1覆盖听说与创作

语音模型正从“语音转文字”向“理解声音、生成声音并直接完成任务”演进。阿里最新发布的Qwen-Audio-3.1系列,全面覆盖语音识别(ASR、ASR-Next)、语音合成(TTS、TTS-Next)及实时交互(Realtime)五大核心方向。其中,Qwen-Audio-3.1-TTS-Next的突破尤为显著,实现了人物对白、环境声与动作音效的一站式生成。

语音转写:结构化处理与智能润色

Qwen-Audio-3.1-ASR聚焦上下文与结构化处理,支持30种语言及16种中文方言的流式识别。模型不仅能输出说话人标签、时间戳和精准转写,还能结合上下文识别专业术语,并具备转写润色功能,自动剔除语气词、重组口语,输出适合阅读的文本。这极大提升了会议纪要、直播字幕等场景的实际体验。

ASR-Next:从人声识别到全场景声音理解

ASR-Next将识别范围从“人声”扩展至“完整声音场景”。它能同时处理人物对话、背景音及环境噪音,实现声音描述、事件定位与音频问答。例如,在转写采访的同时识别笑声或掌声,或辅助判断设备录音中的异常声音。这为会议分析、视频理解及客服质检拓宽了应用边界。

TTS-Next:一站式融合对白、环境声与音效

Qwen-Audio-3.1-TTS-Next是内容创作领域的重大突破。它支持文本与参考音频输入,能将配音、音效和环境声合并至一次生成中。用户只需输入脚本,即可生成包含多角色对白、情绪控制及环境音效的完整音频,广泛适用于播客、有声书、影视与游戏制作,大幅压缩短视频等内容的音频后期流程。

TTS模型:跨语言合成与音色一致性

Qwen-Audio-3.1-TTS主攻语音合成,支持多语种及方言,并致力于在不同语言间保持音色的一致性。用户可通过自然语言精准控制语速、情绪与表达方式。该能力有效解决了跨语言内容制作中需重新配音的痛点,为虚拟角色、智能客服及跨语言配音提供了高效解决方案。

Realtime模型:实现无缝的实时双工交互

Qwen-Audio-3.1-Realtime专为实时语音交互设计,支持音视频双向输入输出,并集成函数调用、联网搜索与声音克隆功能。其核心的“边听边说”双工模式,允许用户随时打断或补充,交互体验媲美真人通话,高度适配车载、智能眼镜及办公助手等场景,使语音助手向具备持续执行能力的Agent迈进。

价格下调:大幅降低语音应用落地门槛

伴随新系列发布,阿里云大幅下调了语音识别、合成及实时交互模型的调用成本。这使得开发者能更顺畅地将AIGC音频能力集成至智能硬件、会议记录等实际业务中。当然,企业级应用仍需综合考量并发量、响应速度及稳定性等因素。

结语:构建全栈音频处理工具链

Qwen-Audio-3.1系列并非简单的模型叠加,而是构建了一套完整的音频处理工具链:ASR负责听清与整理,ASR-Next理解环境声,TTS生成自然语音,TTS-Next制作完整音频,Realtime保障实时交互与工具调用。从“识别声音”到“生成完整声音世界”,Qwen-Audio-3.1正推动语音应用向真正的智能化工作入口演进。

参考资料

阿里云:全栈AI战略与Qwen-Audio系列更新
Qwen-Audio-3.1官方技术文档

【声明】内容源于网络
0
0
AIGC开放社区
1234
内容 1958
粉丝 0
AIGC开放社区 1234
总阅读58.0k
粉丝0
内容2.0k