我们是阿里巴巴 Token Foundry 的 Qwen Audio 团队,致力于通用人工智能(AGI)在音频大模型领域的前沿探索与产业落地创新,团队自研的 Qwen Audio 系列语音模型已正式上线千问AI平台和阿里云百炼平台,包括语音识别大模型 Qwen-Audio-3.0-ASR、语音合成大模型 Qwen-Audio-3.0-TTS、实时交互对话大模型 Qwen-Audio-3.0-Realtime。在全球权威AI评测平台 Artificial Analysis 今年 7 月的语音排行榜上,我们的模型斩获了语音识别、语音合成、实时交互三个赛道的全球第一,拿下“大满贯”。三款模型背后的技术栈不仅应用于阿里生态产品如千问 App、Qoder、千问办公和高德地图,还服务于汽车、教育、智能硬件等多个行业。
阿里巴巴 2027 届校招正式开启,欢迎有才华、有志趣的你加入 Qwen Audio 团队!
如果你也对语音工作充满热忱,乐于和一群聪明且真诚的人并肩作战,在快速迭代中持续突破,保持对新技术的敏锐和动手验证的冲动,更期待把自己的名字写进全球顶尖的工作中,真诚欢迎你加入 Qwen Audio!
在这里,你的每一行代码都可能影响数亿用户的交互体验,每一个实验结果都可能改写行业的技术标杆。如果你准备好了,欢迎投递你的简历!
我们致力于语音通用大模型方向的前沿探索与产业落地创新。一方面,在迈向通用语音智能的长期路径中,随着语音基座模型能力的持续进化,语音感知、语义理解、语音生成与韵律建模等关键问题日益凸显,成为构建通用语音智能系统的核心挑战;另一方面,围绕典型行业场景(如智能语音交互、高质量语音合成、跨语种语音理解、实时对话系统等),如何将现有语音大模型能力有效转化为可落地、可扩展、可持续的解决方案,也成为当前研究与工程实践的重点方向。
如果你对语音生成式 AI 、通用语音智能前沿探索、语音大模型建模与智能语音交互系统有浓厚兴趣,并渴望深入参与下一代语音通用大模型的研发与演进,欢迎加入我们,共同定义未来语音 AI 的能力边界,牵引千行百业在智能时代的深度变革。
参与语音生成/语音识别/语音合成/声纹/语种/情感等方向的算法研究和开发,参与语音信号处理的相关算法研究和开发,和口语语言理解/用户意图理解/对话模型/语音交互等算法研究和开发;推动语音统一多模态大模型通用技术范式的研发,实现文本、语音、视觉模态的联合建模。
聚焦语音大模型核心业务场景,利用 Agent 等前沿技术推动 AI 落地。你将参与从需求洞察到系统构建的全流程,通过研发智能应用与工具,提升业务效率与效果,实现技术驱动业务增长的完整闭环,推动智能规模化演进,实现技术价值转化。
欢迎打开阿里巴巴校招官网https://campus-talent.alibaba.com/campus/index,搜索上述岗位,投递到 Token Foundry。热切期盼优秀的你,和我们一起探索语音 AI 的更多可能!
(专属二维码)

