9月23日,千问正式发布Qwen-Audio-3.1系列语音大模型。此次升级对三大核心模型进行全面进化,并推出两款全新模型,构建起完整的音频能力栈。同时,全线模型价格大幅下调,降幅最高达95%。
核心模型升级与完整能力栈构建
五大模型协同发力
本次升级对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型进行全面进化,并重磅推出全新音频创作模型Qwen-Audio-3.1-TTS-Next与音频理解模型Qwen-Audio-3.1-ASR-Next。五款模型共同打造出覆盖“理解-生成-交互-创作”的完整音频能力栈。
全线大幅降价降低使用成本
为进一步降低开发门槛,Qwen-Audio全线语音模型价格均大幅下调。其中,TTS降价约70%,Realtime降幅约85%,ASR降幅高达95%。

