Rohit Prasad,Alexa AI 副总裁兼首席科学家
Prasad 解释说,Alexa 的研发工作分为五大类别。第一类是能力,即学习新技能并提升现有技能的表现。第二类是情境感知,利用关于世界状态以及客户过去与 Alexa 互动信息,来决定如何最佳地处理特定请求。第三类是扩展 Alexa 对事实和事件的知识,第四类是实现与 Alexa 语音服务更自然的交互。“践行我们对客户的承诺——让 Alexa 每天变得更好,” Prasad 表示,第五类是自我学习,即自动化 Alexa 从经验中学习的流程。
“大多数 Alexa AI 研究由机器学习技术驱动,这些技术利用了大规模 AWS 计算能力和丰富、异构的数据集,”Prasad 解释道。以下是 Alexa 研究人员如何将这些技术应用于这五个研究领域。”
能力
“Alexa拥有由第三方开发者构建的超过50,000项技能,”Prasad表示。“我们正通过我们的Alexa Skills Kit。”同时,Prasad表示,在过去12个月里,Alexa团队降低了Alexa的错误率。
“因为我们在这方面的技能有了巨大的提升,”Prasad说,“仅仅保持准确性就已经很好了。但团队更进一步,在Alexa推出的每一个地点和每一种语言中,都降低了错误率。”
Prasad 解释说,促成这一改进的技术之一是主动学习,在该方法中,自动化系统会对训练数据进行筛选,提取出最有可能显著提升准确性的样本。Prasad 表示,Alexa 的研究人员发现,主动学习可将训练机器学习系统所需的数据量减少多达 97%,从而使得 Alexa 的自然语言理解系统得以更快速地改进。
Alexa 的研究人员也在快速开发新的深度学习网络方面取得了普拉萨德所称的“突破”,这些机器学习系统由成千上万甚至数百万个密集连接的(虚拟)处理单元组成。这一突破将用于自然语言理解的深度学习与迁移学习相结合,迁移学习是指一个为拥有大量训练数据的数据集上完成某项任务而训练的模型,随后在相关但可用数据较少的任务上进行重新训练。
“这将使自定义技能的准确率相对提升15%,且第三方开发者无需额外工作,”Prasad表示。“我们将在未来几个月内向所有技能推出这一功能。”
上下文感知
Prasad解释说,Alexa已经具备上下文感知能力,能够根据客户正在交互的设备来定制其决策。例如,“播放《饥饿游戏》”这条指令在带有屏幕的设备(如Echo Show)上更可能启动电影播放,而在仅支持语音的设备上则会播放有声书。
但在9月宣布的两项新功能——允许Alexa Guard识别烟雾报警器、一氧化碳报警器和玻璃破碎的声音检测技术,以及用于Whisper Mode的耳语检测——扩展了Alexa对客户听觉环境的感知范围,超越了单纯的词语识别与理解。
“这两个系统都使用一种称为长短期记忆(LSTM)的机器学习网络,”Prasad解释道。传入的音频信号被分解为超短片段,长短期记忆网络按顺序处理这些片段。它对任意给定片段的判断(这是耳语吗?这是警报吗?)会结合对 preceding 片段的判断,从而学习时间上分离的音频段之间的系统性关系。
这些网络自动学习用于检测声音事件或耳语语音的音频信号特征。例如,它们会自动学习耳语语音的频率特征,而不是依赖为耳语检测手动设计的特征。
知识
“在过去12个月里,亚马逊的知识团队向Alexa的知识图谱添加了数十亿个数据点,该图谱是对命名实体及其属性和关系的表示,”Prasad解释道。
他还指出,由于缺乏在所有主题上都具有权威性的单一知识来源,Alexa研究人员正在整合异构知识源,以提供针对客户查询的最佳答案。
自然交互
“一项让与Alexa的语音交互更加自然的技术是上下文延续,即跨多轮对话追踪指代关系,”Prasad说。例如,客户可能会问:“Alexa,今天会下雨吗?”然后接着说:“那明天呢?”Alexa目前就能处理这种模糊指代。
“我们实现这一点的方法是,再次将长短期记忆网络应用于不同的对话轮次,以合并前几轮的假设,从而给出最佳答案,”Prasad解释道。
Alexa 也在向 Prasad 所描述的“自然技能交互”方向迈进。过去,与 Alexa 互动的用户必须明确指定他们希望调用的技能名称。现在,一个机器学习系统会自动选择最能满足特定客户请求的那个技能。该系统包含两个组件:第一个组件根据客户的请求生成候选技能的短名单;第二个组件则利用更详细的信息在短名单中的技能之间做出选择。
Prasad 表示:“目前,美国已有数千个技能支持‘自然技能交互’,全球范围的推广将随后展开。”
自我学习
Prasad 说:“回到我们对客户的承诺,我们希望 Alexa 能够以更快的速度进行学习。”
为了提高 Alexa 从互动中学习的能力,Alexa 团队正在开发自我学习技术,而不是依赖需要人工逐条标注数据的“监督式”训练。
其中一项技术是自动等价类学习,Alexa 将在未来几个月内开始使用该技术。它利用了这样一个事实:经验丰富的 Alexa 用户往往会重新表述最初未能成功执行的请求。例如,如果西雅图地区的一位 Alexa 用户请求播放卫星广播电台 Sirius XM Chill,但该请求失败,她可能会将其重新表述为 Sirius 频道 53。自动化系统可以识别出这两个请求共享一个关键词(“Sirius”),第二个请求成功了,并且应将这两个名称视为指向同一实体。
未来
Prasad 表示:“我们将通过把更复杂任务中的认知负担从客户转移到 Alexa 身上,继续让 Alexa 变得更实用、更令人愉悦。我对我们在 AI 栈各层级的持续投资充满信心,这些投入将继续推动 Alexa 以惊人的速度变得更加智能。”

