自推出以来,Astro家用机器人一直备受瞩目。去年秋天亚马逊发布了这款设备,顾客可以命令这只宠物大小的机器人在家中巡逻、查看宠物状况、处理视频通话、订购杂货,甚至取来饮料。但很少有人比赋予它生命的科学家更对其能力感到惊叹。
"即使作为一名以从事此类工作为生的人,它也感觉像魔法一样,"亚马逊音频工程师Wontak Kim说道,他的团队帮助教会了Astro准确处理音频。
"人类无法容忍音频延迟,"Kim团队的声学科学家Mrudula Athi表示。"即使是20毫秒的延迟也会立即被察觉。因此,对于Astro,我们需要每秒处理和清理125个音频信号帧。"
魔力在于解开声波的纠缠
Astro的音频功能利用了亚马逊的Alexa——该公司的语音AI。在任何支持Alexa的设备上,当有人对我们说话时,Alexa并不会像我们那样自动识别语音。当你发出语音请求时,声波在到达设备的麦克风之前会在墙壁和天花板上反弹。
对于Astro来说,这一挑战因机器人在家中移动而变得更加复杂。为了满足客户需求,它需要准确处理语音请求,而不受宠物或其他常见家庭噪音、驱动它的电动机的细微声音或它播放的音乐或其他音频的干扰。例如,桑尼维尔团队的高级首席科学家Amit Chhetri表示,当Astro在瓷砖地板上移动时,"麦克风处的轮子噪音水平甚至比语音还要高。"
魔力在于消除所有额外的声音。
"如果你将所有这些噪音发送给语音识别应用程序,它的表现不会很好,"Athi说。"我们的工作就是处理这些麦克风信号,确保它们被清理到足够干净的程度,使Alexa能够达到提供良好客户体验的性能水平。"
所有这些声音分类还必须快速完成。
这是一个棘手的问题,亚马逊集结了强大的智力资源来攻克它。Astro音频团队包括精通声学物理的声学科学家、开发用于操控声波的算法的应用研究人员,以及将这些算法编织成强大代码的软件工程师。
将AI驱动的算法推向新高度
团队首先专注于在音视频通话中消除背景噪音,以便机器人在嘈杂环境中移动时,人们仍能清晰交谈并相互理解。为了实现所需的高速处理,团队采用了一种称为深度神经网络(DNN)的AI驱动算法,该算法通常用于解决音频和计算机视觉问题。但他们将其提升到了一个新的高度。Chhetri特别设计了一种新的网络架构,既能降低背景噪音,又能消除语音混响,从而使Astro能够处理通话。
使用模拟数据
DNN——尤其是Chhetri、Athi及团队开发的这种先进模型——通常需要大量数据进行训练。这时,团队的音频仿真专家派上了用场。Athi表示,得益于他生成的数据,工程师们得以依赖“在不同类型房间的不同位置、以不同水平的人工房间噪音说话”的模拟语音。亚马逊的音频科学家通常在诸如帮助设备定位声源等项目中使用模拟数据。但在Astro项目中,团队需要更进一步。由于机器人自身会产生噪音,他们需要更多针对Astro的数据来构建语音增强模型。
另一个亚马逊团队记录了Astro在各种家庭场景中移动时产生的独特噪音。Athi表示,这些数据非常适合他们的语音增强问题。因此,她将这些数据与她收集的语音数据集混合,用于训练机器人,从而解决了这一问题。
"业界领先"的解决方案
音频团队对结果感到满意,但现在他们必须将所有这些代码嵌入到机器人内部,这又是一个独特的挑战。但同样,来自全美亚马逊音频实验室的团队挺身而出。Athi表示,最终成果极其先进。
"我们获得的降噪效果,结合我们在设备上而非云端实时运行的语音增强性能……整体而言相当处于业界领先水平,"她说。
Athi表示,将Astro的语音增强功能适配到设备上是她职业生涯中最引以为豪的事情之一。但Kim、Athi、Chhetri以及音频团队的其他成员并不会就此止步。他们仍在持续改进Alexa的语音识别和Astro的语音增强功能,并且手头有多个令他们兴奋、即将面向客户推出的项目。
Kim说:“我们非常自豪能为亚马逊、为客户从事这一音频领域的工作。”
想了解Astro带来的所有乐趣、便利和安全保障吗?查看亚马逊宣布的更新,在设备和服务秋季发布活动中亮相的家庭机器人。
Mojo Wang绘制。

