
今天,亚马逊宣布推出Amazon Nova Sonic。这是一款全新的基础模型,将语音理解与生成能力统一于一体,旨在支持更具拟人感的语音对话应用。该模型通过Amazon Bedrock新API提供,可简化客户服务自动化及旅游、教育、医疗、娱乐等行业AI代理的开发流程。
一个能把握语气、风格和节奏的语音系统
传统语音应用开发通常依赖多个模型的复杂编排:先通过语音识别转文本,再用大语言模型(LLM)生成回复,最后经文本转语音技术输出音频。这种碎片化方式不仅增加了开发难度,还难以保留对自然对话至关重要的语气、韵律和风格等声学细节。
Nova Sonic采用统一架构解决了上述痛点。它将理解与生成能力整合至单一模型,使其能根据输入语音的语气、风格等声学语境动态调整响应,实现更自然的交互。此外,Nova Sonic还能敏锐感知人类对话中的停顿、犹豫及插话,并据此选择恰当的发言时机。
基于Amazon Nova Sonic构建的旅游AI代理示例:
在该场景中,客户与虚拟旅行助理商讨夏威夷行程。当客户语气从兴奋转为对费用的担忧时,AI会自动切换为安抚性语调,同时精准提取相关价格信息予以回应。
基于Amazon Nova Sonic构建的企业AI助手示例:
在此示例中,仪表板AI助手展示了Nova Sonic基于企业数据生成回答的能力。它能以自然对话的方式提取报告、分享准确数据,并主动提出后续问题。流畅的多轮交互支持无需用户显式设定上下文,极大提升了使用体验。
随着Nova Sonic的发布,亚马逊持续通过顶尖基座模型推动创新,致力于为每一位客户带来切实价值。
开始使用Amazon Nova,了解更多关于亚马逊如何利用AI进行创新的信息。

