过去几年,人工智能(AI)黄金时代已至。Alexa从白板草图演变为全新计算范式,彻底改变了全球用户的家庭交互方式。销量突破5亿台、每小时处理数千万次交互后,它已成为数百万家庭的“成员”。自2014年推出以来,我们持续优化体验,致力于让对话接近自然交流;随着生成式AI发展,这一愿景触手可及。今天,很高兴分享对未来形态的早期预览。
这是由生成式AI驱动的更智能、更具对话能力的Alexa初步展示。基于专为语音交互定制优化的全新大语言模型(LLM),融入获取实时信息、高效控制智能家居及最大化家庭娱乐等核心功能。这将推动Alexa未来发展,增强五项基础能力:
1. 对话
真正的对话远不止文字。我们在任何对话中都会处理肢体语言、眼神交流等非语言线索。为此,我们将Echo设备传感器输入(摄像头、语音、存在检测)与理解非语言线索的AI模型融合,并降低延迟,使回复简洁流畅、适合语音输出。例如询问热门新闻时,Alexa仅提供最相关信息,用户可进一步追问。
2. 现实世界的应用价值
Alexa需在现实中采取行动。全新LLM通过API连接数十万设备和服务,增强处理细微差别和模糊性的能力,像人类一样智能行动。例如,用户可通过语音设置复杂自动化场景:“Alexa,每个工作日晚9点宣布孩子睡觉、调暗楼上灯光、打开门廊灯并开启卧室风扇”,系统将自动编程确保准时执行。
3. 个性化与上下文
家用LLM需针对个人及家庭定制。新一代Alexa能根据偏好、使用服务及环境信息提供独特体验,并在对话中保留上下文。如同人类交谈,用户可使用代词或口头禅连续追问(如博物馆开放时间、展览内容),无需重复提及名称或日期等背景信息。
4. 个性
客户喜爱Alexa的个性,这也是其被广泛采用的原因之一。新LLM赋予Alexa观点,使对话更引人入胜:它能评论奥斯卡获奖影片、庆祝测验答对,或撰写热情留言祝贺朋友毕业。
5. 信任
可信度与性能不应权衡。尽管生成式AI带来无限可能,我们保护隐私安全、给予用户控制权与透明度的承诺不变,继续创造受喜爱且值得信赖的家庭体验。
这是迄今最大规模的LLM、实时服务及设备整合,且不仅限于浏览器标签页。借助生成式AI,我们还将增强多个核心组件:
首先是交互启动升级:选择“视觉身份验证”的用户面向Echo Show屏幕即可直接对话,无需唤醒词。其次是全新基于大模型的对话式语音识别(CSR)引擎,能适应自然停顿和犹豫,实现更流畅对话。最后是增强文本转语音技术,利用Transformer模型让表达更丰富契合语境。
Alexa将根据线索调整回应语气:若球队获胜则欢快回应,失利则具同理心;发表意见时则像朋友般热情。
以下为首次推出时的声音回顾:
以下为明年年初的声音效果:
这些增强将使全球最佳个人AI助手更出色。过去数月体验新功能,其变革性不亚于十年前初次对话。虽仍会犯错,但体验将随时间持续改进。
这是生成式AI驱动新版Alexa的起点。作为免费预览的一部分,即将在美国向用户开放。我们期待收到大量反馈。
敬请期待更多消息,现提前展示新功能。

