大数跨境

修仙、互怼、演志怪: 千问语音模型真实测评

修仙、互怼、演志怪: 千问语音模型真实测评 AI前线
2026-09-23
10
导读:大模型的更新,已经从聊天框一路卷到了耳机里。
作者 | Arwen

大模型的演进,已从文本对话一路延伸至语音交互。

9月23日,在2026云栖大会上,阿里发布了Qwen-Audio-3.1系列语音大模型,全面升级语音转写(ASR)、语音合成(TTS)及实时语音交互能力。其中,主打音频创作的Qwen-Audio-3.1-TTS-Next模型备受瞩目。

传统有声书制作需主播、音效师、混音师等多工种接力协作。而Qwen-Audio-3.1-TTS-Next将上述环节整合至单次生成中:输入脚本,即可同步输出人声、音效及环境声,并精准编排声音的出场顺序。

一个模型,重构了传统音频制作流水线。

面对创作者对场景演绎、角色区分及声场构建的高阶需求,千问语音模型距离“一人音频工作室”还有多远?我们对其进行了三场真实的“声音试镜”。

声音试镜 Round 1:都元婴期了,怎么还得上交手机?

首项测试聚焦修仙漫剧的反差演绎。我们设计了一段“满级大佬重回新手村”的喜剧脚本:修士苦修两千年成就元婴,重返地球却仍需像大一新生般上交手机。

【修士】:闭关三百年,今日,本座终于——

【老师】:手机交一下。

【修士】:此乃传音法器。

【老师】:法器也不能带进考场。

【修士】:本座渡过九重雷劫。

【老师】:那正好,这张卷子也是九道大题。

【修士】:……能补考吗?

这段戏的难点在于角色气场的对立:修士需具备威严,老师则需展现出极度平静的敷衍。我们上传了原角色30秒音频作为音色参考,并将新台词与表演要求输入模型。不到一分钟,一段27秒的音频生成完毕。

测试亮点:音色还原与情绪表达的完美融合。

模型不仅高度还原了角色音色,更将音效、背景音与语气词自然交织。人物表演与环境音效配合默契,听感上已具备漫剧片段的完整性。这种设计大幅降低了创作者分别配音、搜集音效并逐项拼接的成本,可作为高质量的声音初稿。

声音试镜 Round 2:让 AI 聊“活人感”,谁先绷不住?

漫剧可依靠音效烘托戏剧张力,而播客则极度依赖人声的自然度。为测试模型的“活人感”,我们模拟了一段三人播客对话,探讨“活人感是新的伪人感”这一话题。

测试要求三人具备鲜明的声音特征与表达方式:A认真解释,B一本正经地拆台,C冷不丁补刀。背景仅保留轻微底噪,且未提供任何角色参考音频。这极大考验了多人声音的一致性与上下文语境的控制力。

测试亮点:自然对话流与微表情级声音细节。

生成的音频中,角色间的接话、抢话、忍笑及含混的尾音处理得极为自然,甚至连提示词中要求的轻微方言感也恰到好处。答案是:这三位“熟人脸”,声音均完全由Qwen-Audio-3.1-TTS-Next生成。AI成功演绎出了真实的“活人感”。

声音试镜 Round 3:AI 志怪短片的悬疑感,能从声音里单独成立吗?

最后一轮测试提升了空间构建的难度,要求纯靠声音撑起悬疑场景。我们原创了一段志怪短剧:年轻人搭上末班渡船,船夫警告离岸后不可答应任何呼唤,此时岸上却传来了母亲的声音,随后脚步声更在耳畔响起。

【船夫】坐稳。离了岸,谁叫你,都别应。

【年轻人】要是家里人呢?

【船夫】尤其是家里人。

【岸上女人】小远——饭都凉了,怎么还不回来?

【年轻人】妈?她怎么找到这儿了……

【船夫】别回头。你听,她在岸上走。

【年轻人】那怎么了?

【船夫】船都划出去这么远了,脚步声怎么还在你耳边?

【女人,近处】问你话呢,怎么不应啊?

核心难点在于母亲声音的空间变化:从岸边远景的呼唤,到近景在耳边的低语,需保持身份认同,同时改变发声方式与距离感。此外,水声、船行与脚步声需建立准确的空间对照,以凸显异常感。

测试亮点:精准的空间距离感与环境声叙事。

模型出色地完成了这道“空间题”。母亲的声音在远景与近景间自然切换,老船夫沧桑笃定的音色也完美立住了人设。环境声不仅用于铺垫气氛,更精准地承担了叙事线索。这意味着创作者可直接围绕剧情编排声音,让环境音成为故事的核心驱动力。

能听懂、能创作、能聊天之后,语音还能做什么?

回顾三轮试镜,Qwen-Audio-3.1-TTS-Next展现了从音色复刻、自然对话到空间声场构建的全面进化。创作者已能直接通过文本描述场景,快速获得高质量的声音初稿。对于个人及中小团队而言,这极大降低了音频试错与打磨的门槛。

放眼整个Qwen-Audio-3.1系列,其能力边界仍在不断拓宽。按照发布信息,三大模块同步升级:转写端增强了上下文理解与文本润色处理;创作端实现了跨语言合成的自然音色保持;实时交互端则支持边听边说、随时打断及工具调用。

当这些能力接入同一应用,创作者可以口述故事,让AI整理脚本并生成声音小样,甚至通过自然语言随时调整细节。机器开始迁就人的节奏,技术拼图已基本备齐。

能听懂、能创作、能聊天,正让语音成为连接人、内容与AI的自然入口。

当语音不再仅仅是输入方式,而是能够表达需求、开启创作并推动任务执行的协作媒介时,大模型的语音交互能力已真正迈入了一个新的阶段。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8723
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读221.8k
粉丝0
内容8.7k