亚马逊推出基础模型系列新品Nova Sonic,基于语音理解与生成技术打造,旨在实现类人对话体验。该模型通过整合理解与生成能力,可根据声学背景及语音输入动态调整响应,使交互更自然。
Nova Sonic能精准识别对话中的停顿、犹豫等细微差别,主要服务于自动客服、AI虚拟助手等语音应用开发。目前该模型已集成至Amazon Bedrock平台,提供双向流式API,重点赋能旅游、教育、医疗及娱乐等行业。
亚马逊通用人工智能高级副总裁Rohit Prasad表示,Nova Sonic将显著提升语音交互的精准度与自然感,进一步优化用户体验。
Nova Sonic:语音风格识别与性能优势
Nova Sonic具备多风格语音识别能力,可理解口齿不清、含糊表达及非标准停顿。当前仅支持英语,后续将扩展多语言支持。其音频上下文窗口达32,000 tokens,并配备扩展窗口以处理长对话。
在实时对话质量方面,Nova Sonic表现稳健,对标OpenAI GPT-4o(实时版)及Google Gemini Flash 2.0等同类产品。ASAPP、Education First、Stats Perform等企业已率先接入,分别应用于客户服务、语言学习及体育数据分析场景,普遍反馈其准确性高、延迟低且易于集成。
Nova Reel 1.1:支持最长2分钟视频生成
亚马逊同步发布Nova Reel 1.1模型,支持根据文本生成长视频。作为前代升级版,该模型单次生成6秒片段,最多拼接20个片段,输出长达120秒的视频内容,开发者及用户均可通过Bedrock平台调用。
Nova Reel 1.1旨在提升创意生产效率,降低视频制作成本与周期。适用于营销活动、产品设计及社交媒体内容创作,兼顾高效产出与创意可控性。

