唤醒 Alexa 并与她聊天。只需说“Alexa,我们聊聊”或“Alexa,我们来聊天”。
我们会等待。
在普通蜂鸟振翅三次所需的时间不到一瞬,Alexa 就被唤醒,听到了你的初始请求,理解其含义并生成了回应。
你可能会听到类似这样的回复:“嘿,周五快乐,云端最近有点凉飕飕的。”
Alexa 的这段语音回复大约持续三秒钟,而在这期间发生了以下过程,才将回复呈现给你。
- 在 Alexa “居住”的云端,共执行了 2700 亿次浮点运算(FLOPS——即计算机处理数学计算的方式),以生成使 Alexa 的回复听起来更自然的词汇、语调、停顿和重音。
- 为了让 Alexa 通过扬声器以高清音频回应你,大约将 72,000 个声音片段拼接在一起,组成了该短语。
- 你查看手机、电脑或智能手表,确认当天确实是星期五,并且秋季天气已经到来。
为了一句话做这么多工作似乎工作量很大,坦白说,确实如此。现在想象一下,数千万 Alexa 用户提出类似的请求,每周达数十亿次。这是一项庞大的工作量。对于 Alexa 服务而言,这项工作归结为使用复杂的机器学习模型进行大量计算。而在 Alexa 所达到的规模下,这些模型和计算都会产生成本——包括处理单元的运行时间和用于运行及冷却这些单元的电力消耗。
这些成本正是 Alexa 团队大约在一年前遇到的问题。让 Alexa 说话更自然、更像人类而非机械地拼接词语,所需的巨大计算负载成本高昂。
为什么对人类来说自然的语音对机器而言颇具挑战
当你向 Alexa 提问时,答案会迅速出现。她的回应方式看似与人类回答问题的方式相似,但实际上并非如此(除非你把问题和自己的回答都写下来,再读一遍)。设备检测到唤醒词后,Alexa 会录制并将你的请求——例如“播放一首歌”、“打开灯”、“订购披萨”——发送到云端。自动语音识别和自然语言理解模型会对请求进行解析,然后生成合适的回应。
但棘手之处在于,Alexa 回复中的文字是以文本字符串的形式生成的。任何学过外语的人都清楚,仅仅按正确顺序读出正确的单词并不等于真正的语音。这是一种交流,但不是自然的对话。
让 Alexa 在任何语言中的语音听起来更自然——即文本转语音(Text-to-Speech)部分——关键在于改善语调。这意味着要在正确的节奏和位置对合适的词语进行重读。我们通常不假思索地做到这一点,但如果你尝试分析自己的语调,就会发现精确建模是多么困难,也难怪它是实现自然语音的关键。正如 Alexa 的文本转语音团队所发现的,这也意味着高昂的成本。
跟我说话
为这个痴迷于语调优化的文本转语音团队带来解决方案的,是一款新的微处理器或芯片——名为 AWS Inferentia ——在 2019 年 re:Invent 大会上宣布。由亚马逊云科技(AWS)团队设计的 Inferentia 是亚马逊首款专为运行机器学习模型而定制的芯片。发布近一年后,Inferentia 芯片现已成为 Alexa 服务中所谓“推理”部分的计算引擎,承担了 Alexa 在处理用户问题和陈述时绝大部分的工作。通过在 Amazon EC2 Inf1 上运行的 AWS Inferentia——这些是通过云端访问的虚拟服务器或计算实例——这款定制芯片将 Alexa 推理任务的成本降低了近三分之一。
成本节约带来了两大好处:
- Alexa 可以用更少的能量完成这些计算密集型任务,从而节省资源。
- Alexa 可以部署更复杂的机器学习模型,从而使与 Alexa 的对话体验越来越好。
Inferentia 和 Inf1 实例并不局限于文本转语音任务。任何处理大量图像、视频、语音或文本数据,并在这些数据上运行大规模机器学习的应用,都能从这项芯片创新中受益。Snap、Autodesk 和 Anthem 等 AWS 客户已经使用 Inferentia 和 Inf1 实例来运行视频和图像分析、语言和文本处理(如翻译、搜索和情感提取),并优化推荐引擎。这种机器学习能力的提升带来的成果包括:为用户提供更精准的音乐和电影推荐,以及构建能够支持真正自动驾驶的复杂模型。
Alexa 用户将在更好、更准确的语音助手响应中体验到 Inferentia 引擎的力量。那个棘手的问题——自然语调——也将随着 Alexa 文本转语音模型的不断进步而得到改善。你与 Alexa 的聊天将变得越来越自然,而这正是最佳技术的核心价值所在。这就是更优、更快、更低成本的三重优势组合。

