
今天,我们介绍了 Alexa+,即下一代 Alexa。这一全新版本从底层重新构建,采用最先进的架构,能够自动大规模连接各种大型语言模型(LLM)、智能体能力、服务和设备。这使得 Alexa+ 更加对话自然、更智能、更具个性化,并能为客户完成更多任务。
面对如此规模的工程,团队在开发过程中必须解决许多技术挑战。以下是我们在打造 Alexa+ 并推出由生成式 AI 驱动的下一代助手方面取得的五项重大突破。
一、构建全新架构,连接数万个服务和设备
大型语言模型擅长对话,但本身不支持 API——而 API 是在聊天窗口之外、在现实世界中为客户完成任务的核心协议,例如查找和预约 appointments 或订购杂货。为了增强 LLM 的原生能力,我们构建了一套全新的架构,用于大规模编排 API。
正是这套架构,让客户能够快速且无缝地连接他们日常生活中已经使用的服务:GrubHub、OpenTable、Ticketmaster、Yelp、Thumbtack、Vagaro、Fodor’s、Tripadvisor、Amazon、Whole Foods Market、Uber、Spotify、Apple Music、Pandora、Netflix、Disney+、Hulu、Max,以及来自 Philips Hue 和 Roborock 等公司的智能家居设备等,不胜枚举。
此外,我们还使 LLM 不仅能与 API 集成,还能将多个此类调用串联起来。这让我们能够充分利用 LLM 在自由形式对话方面的天然优势,通过处理复杂的多方面请求,使其变得更加实用。
最终带来的体验更像是一位现实生活中的私人助理。例如,你可以请 Alexa+ 帮助在你最喜欢的餐厅预订午餐,并将该计划分享给你的朋友;Alexa+ 不仅会完成预订,还会向你指定的联系人发送短信。
二、构建系统,提供准确、实时的信息
LLM 面临的最大挑战之一是,尽管它们表现出色,但行为往往不可预测。它们对同一问题可能给出不同的答案,有时甚至会产生幻觉。这在某些聊天场景中或许可以接受,但在控制家中设备或询问新闻事件时则不可行。因此,我们构建了全新的系统,帮助 Alexa+ 在回答客户问题时利用“接地”(grounding)技术。
三、最小化延迟
客户期望 Alexa 响应迅速,但在平衡准确性与速度时存在固有的张力。
为了管理这种权衡,我们构建了一个复杂的路由系统,该系统使用了来自 Amazon Bedrock 的最先进模型——包括 Amazon Nova 以及 Anthropic Claude——即时将每个客户请求与最适合当前任务的大模型进行匹配,在确保清晰、对话式体验的同时平衡各项需求。
四、保留 Alexa 的个性,并提供个性化回复
长期以来,客户告诉我们,他们和他们的家人都喜欢 Alexa 的个性。从一开始,我们就将我们的 AI 助手打造得聪明、体贴、富有同理心且包容——并拥有幽默感。因此,我们优化了架构中内置的每个模型,以确保它们体现 Alexa 的性格。
我们还希望 Alexa+ 能够与客户共同成长——根据您希望 Alexa 记住的内容(例如您喜爱的音乐艺人、想阅读的书籍或您不喜欢的食物类型)来个性化体验。Alexa+ 通过匹配常见模式、偶尔询问以确认您的偏好,以及回忆您要求 Alexa 记住的具体事实,以隐式和显式的方式实现这一点。底层系统随后会整合这些偏好,从而使 Alexa+ 能够为每项请求提供最相关的响应——这意味着,您使用 Alexa+ 越多,体验就会越好。
五、增加代理能力
为了让 Alexa+ 成为一款极其有用的 AI 助手,我们不能将体验局限于仅支持当前存在的 API。并非每家公司都拥有现成的外部化 API 集,或者至少没有能处理客户希望执行的每一项操作的 API。
因此,我们增加了代理能力,本质上就是教 Alexa+ 像人一样在数字世界中导航。这意味着客户可以要求 Alexa+ 执行某项操作,而 Alexa 可以接受客户的请求,导航至开发者的网站,并完成客户要求的任务。
Alexa+ 不仅仅是另一个 AI 聊天机器人。它是我们的下一代 AI 助手,具有更强的对话能力、更智能、更个性化,并且能够为客户完成更多任务。我们迫不及待希望您来体验它。

