过去十年,人类与机器的交互大多围绕文字展开:人输入文字,机器理解文字,再以文字反馈结果。但真实世界并不只由文字组成。一场两小时的会议,除了“说了什么”,还有谁在说、语气如何、观点如何变化;一次实时对话,也不只是把语音转成文字,还要理解情绪、环境和上下文,判断什么时候该倾听、什么时候该回应;一次声音创作,则不只要求发音正确,还要让音色、角色、情绪和节奏真正服务于内容。
当声音被压缩成一段文本,许多重要信息也会随之丢失。随着语音大模型的发展,声音正在从一种“等待被转换的信息”,逐渐成为 AI 理解世界、连接用户和创造内容的原生媒介。
最近发布的 Qwen Audio 3.0 系列,围绕真实语音场景形成了三项核心能力:Qwen-Audio-3.0-ASR-Flash 负责把话听准、把内容写清;Qwen-Audio-3.0-TTS 负责生成自然、可控且具有表现力的声音;Qwen-Audio-3.0-Realtime 则让 AI 能够边听、边想、边说,并在对话中调用工具完成任务。三类模型共同覆盖“识别—生成—交互”的完整链路,也让会议记录、内容创作、智能客服、情感陪伴、教育与无障碍等应用拥有更坚实的技术底座。
这一次,语音不再只是 AI 的输入和输出格式,而正在成为人与智能系统协作的新入口。
这一次,语音不再只是 AI 的输入和输出格式,而正在成为人与智能系统协作的新入口。
▎Qwen-Audio-3.0-ASR-Flash:不只“听清”,更要结合上下文“听懂”
实验室里的语音识别常常比拼字准率,真实世界的问题却复杂得多。会议里会出现人名、产品名和企业黑话;医疗、金融、法律等场景包含大量专业术语;自然口语中还有停顿、重复、自我纠正和中途改口。真正可用的语音识别,既要准确还原声音,也要理解上下文,并把口语整理成可继续使用的信息。
Qwen-Audio-3.0-ASR-Flash 将语音识别从单句转写推进到面向真实场景的上下文理解。
首先是更稳定的长音频上下文一致性。模型在识别当前片段时,可以参考前文已经出现的话题、人物和关键词,减少同一个姓名或技术概念在不同片段中反复“变写法”的问题。上下文随对话自动积累,不需要用户提前准备完整词表,特别适合会议、访谈、课程和长时间口述。
其次是更强的行业词与专属热词识别。模型针对医疗、IT 编程、股票等领域进行了专项增强;企业还可以按业务场景配置产品名、人名、项目代号等专属热词,并通过分级机制兼顾命中率与误触发率。团队内部评测显示,医疗场景行业词“听中率”达到 95.36%,热词在各测试集上的“听中率”均超过 90%,多数场景超过 99%。这意味着语音识别可以更快适应企业自己的知识语境,而不是让用户反复手工纠错。
更进一步,模型把语音润色直接纳入识别过程。面对“然后、那个、不是,我的意思是……”这类自然口语,模型能够去除无意义填充、合并重复表达、保留自我纠正后的真实意图,并输出更接近书面表达的文本。团队评测中,润色文本的平均可读性评分由 2.55 提升至 3.43,优秀可读率由 30.75% 提升至 59.27%,效果与“先识别、再调用文本模型润色”的两步方案基本持平,却减少了一次额外处理。
在多语种方面,模型将中文、英语、日语、泰语、越南语、阿拉伯语等 30 种语言集成在同一套能力中,并支持多语言混合识别。对于跨国会议、国际客服和多语言内容生产,用户不必频繁切换模型,也能获得连贯的转写体验。
语音识别结果:공개매수는 경영권 확보를 위해 주식을 장외에서 정해진 가격으로 사는 건데 공개매수가 발표되면 해당 주식의 주가는 보통 상승합니다.
(公开收购是指为了取得经营权,在场外按照指定价格购买股票。公开收购发布后,相关股票的价格通常会上涨。)
语音识别结果:Apakah perasaan anda apabila pertama kali mengetahui anda akan mewakili sekolah ataupun negeri ke peringkat kebangsaan?
(当你第一次得知自己将代表学校或所在州参加全国级别的活动时,你是什么感受?)
▎Qwen-Audio-3.0-TTS:从“正确发音”走向“真实表达”
如果说语音识别解决的是“AI 能否听懂人”,语音生成解决的就是“AI 能否像人一样表达”。当合成语音跨过发音准确的及格线,真正决定体验的,开始变成声音是否自然、情绪是否到位、角色是否稳定,以及在复杂环境和多语言场景下能否保持一致。
Qwen-Audio-3.0-TTS 面向生产级语音生成,在多语种、可控性、声音复刻和长音频质量等维度进行了系统升级,并提供 Plus 与 Flash 两种版本:Plus 更适合有声书、广告、品牌内容等重视音质和表现力的场景;Flash 更适合语音助手、智能客服和快速预览等对响应速度更敏感的场景。
模型支持 16 种语言,并针对广东、重庆、东北、上海、四川等 20 个中文方言地区进行强化。Plus 版本在 16 种语言的说话人相似度评测中均排名第一,平均相似度达到 82.75。对于内容出海、跨语言配音和地方化表达,这不仅意味着“能说更多语言”,也意味着同一个声音在跨语种生成时仍能保持可辨识的音色特征。
在控制方式上,Qwen-Audio-3.0-TTS 同时提供两种互补路径。通过 Free-style 自然语言指令,用户可以直接描述“温柔但克制”“像悬疑片旁白一样压低声音”“语速稍快、带一点兴奋”等表达目标,无需掌握专业声学参数;通过 [gasp]、[giggles]、[angry] 等细粒度标签,创作者又可以对某一句、某个词甚至一次呼吸进行局部控制。宏观风格与微观细节可以组合使用,让声音不只是朗读文字,而是在表演内容。
声音复刻也更加适应真实素材。通过声学仿真训练,模型将语音增强能力融入复刻流程:即使参考音频存在噪声、混响或清晰度不足,仍能尽量保留目标音色并输出高质量语音。音频采样率由 24kHz 提升至 48kHz,单次可生成最长 3 分钟的内容,减少长篇叙事中频繁切段造成的音色和韵律跳变。
从有声书和播客,到游戏角色、影视配音、广告素材与短视频出海,Qwen-Audio-3.0-TTS 正在让“声音创作”从专业制作环节变成可以被自然语言直接驱动的生产能力。
▎Qwen-Audio-3.0-Realtime:边听、边想、边说,也能在对话中把事办完
传统语音助手通常采用“语音识别—文本模型—语音合成”的串联流程:等用户说完,再逐步处理并回复。每一层都可能增加等待,也会在转成文字时损失语气、情绪和环境信息。真正自然的实时交互,需要 AI 在同一个连续过程中理解声音、组织回答并生成语音,还要知道何时倾听、何时回应,以及用户中途插话时该如何调整。
Qwen-Audio-3.0-Realtime 将实时交互的目标从“更快回复”推进到“更懂对话”。模型可以根据上下文动态调整语气、节奏、音调和情绪:讨论中保持逻辑与口语感,角色扮演时遵循人物设定,面对用户的犹豫或低落时以更合适的方式回应。声音中的副语言信息不再被简单丢弃,而会参与模型对意图和关系的判断。
自然对话的另一个关键是双工控制。双方可以同时说话,模型则综合声学信号、语义内容和说话人特征,区分背景噪声、无意义附和与真正的插话。其智能语义轮次能力可以减少“用户还没说完,AI 就抢答”或“用户已经改口,AI 仍沿着旧问题继续说”的情况;通过传入目标用户的参考音频,还可以在多人或嘈杂环境中增强对主说话人的锁定。
Qwen-Audio-3.0-Realtime 还将工具调用带入实时语音对话。模型可以根据口语指令判断何时继续交流、何时查询外部信息或触发业务系统,并在多轮对话中处理条件补充、临时改口和多步骤任务。一个智能客服不再只是回答“怎么查账单”,而是可以在获得授权后直接调用账单接口;一个车载助手也不只是告诉用户路线,而是能够结合途中新增条件重新规划并执行后续操作。
在模型能力背后,多教师 On-Policy Distillation 架构分别吸收口语多轮偏好、通用问答与推理、Agent 工具调用以及音频理解等能力,让模型在对话自然度、推理能力、任务执行和声音理解之间取得平衡。面向不同业务需求,系列同样提供 Plus 与 Flash 版本,并通过 WebSocket 进行流式音频输入和语音、文本输出。
▎从三类模型到千行百业:让声音成为可沉淀、可执行、可创造的生产力
当语音识别、语音生成和实时交互分别成熟,声音的价值便不再局限于“转写一段录音”或“朗读一篇文章”。围绕 Qwen Audio 3.0 系列,一批新的下游应用正在变得可行。
在企业协作与知识沉淀中,会议、访谈、培训和随手口述可以被实时转写、整理并生成摘要与待办;行业词、企业热词和长上下文能力,让语音资料能够更可靠地进入知识库和工作流。在服务与业务执行中,智能客服、销售助手、营销外呼、车载助手和设备控制可以通过全双工对话理解临时补充与打断,并连接订单、账单、日程或工单系统完成任务。在内容生产与全球化中,播客、有声书、游戏角色、广告、短视频配音和多语言本地化可以通过自然语言控制声音风格,显著降低试音、录制和返工成本。在教育、陪伴与无障碍场景中,具有情绪感知和表达能力的语音系统,也能为语言学习、阅读辅助、老年陪伴与视障服务提供更自然的交互方式。未来,家居、汽车、可穿戴设备与机器人同样可能通过声音获得更低门槛、更贴近人的智能入口。
CosyVoice Studio 应用系列,是这套能力走向具体生产场景的一组代表性实践。其中:
CosyFlow 面向语音记录与理解,可将口述、会议和访谈转成结构化文本、章节纪要与待办事项;
CosyCreative 面向 AI 音频创作,将声音复刻、音色选择、播客、有声书和专业编辑整合到同一工作台;
CosyAgent 则面向实时语音助手搭建,让用户通过角色设定、知识库、工具和音色配置创建专属 Agent,并接入售前咨询、售后服务、营销外呼等业务场景。
目前,Qwen Audio 3.0 系列相关能力已陆续通过千问 AI 平台(阿里云百炼)开放,其中 Qwen-Audio-3.0-TTS 与 Qwen-Audio-3.0-Realtime 均提供 Plus、Flash 版本;面向终端用户,CosyVoice Studio 则进一步把模型能力封装为可直接使用的产品体验。对开发者而言,这是一套从 API 到应用的语音技术底座;对普通用户而言,它意味着不必理解模型之间如何切换,只需要开口,声音就能被理解、被执行,也能被重新创造。
从“听见”,到“听懂并回应”,再到“用声音完成工作与创作”,Qwen Audio 3.0 系列正在推动语音从交互方式升级为新的生产力入口。


