Broadly speaking,机器学习技术帮助我们发现数据中的有用模式,并利用这些模式为客户做出更好的决策。
我们的数据处理系统中一个鲜少公开分享的方面是:如何确保在整个数据摄入、传输、存储以及最终的处理和建模过程中,亚马逊的客户数据得到保护?
简短的回答是,我们使用最先进的隐私增强技术。然而,这一答案仅反映了更大图景的技术层面。从根本上说,我们在亚马逊使用的每一种隐私增强技术的设计和实现,都源于我们对客户的执着追求。这一原则指导我们以最高程度的尊重对待客户的隐私,并体现在我们处理客户数据的每一个方面。在实践中,这转化为一套全公司的流程和政策,规范每条数据记录在亚马逊系统内的处理和存储方式。
差分隐私确保算法能够学习数据中的任何常见模式,同时防止它们记住数据集中任何特定个体的具体细节。
Borja de Balle Pigem - 机器学习科学家,亚马逊研究
这些数据处理政策明确规定了任何处理客户数据的系统在通信和存储方面必须满足的加密要求。它们还规定了此类系统如何在亚马逊企业内部网络中进行身份验证,从而有效限制任何员工或系统访问客户数据,除非这种访问对于执行关键业务功能绝对必要。
对这些政策的合规性通过每个系统和服务的整个生命周期进行强制执行和监控,涵盖设计、实施、测试、发布和运行时操作等阶段。确保现有系统按照最高的数据保护标准运行,是亚马逊数千名工程师的日常职责。与此同时,科学家和工程师们专注于持续创新,使我们能够为我们的客户提供更好的产品和服务。
我们在隐私增强技术领域为客户进行创新的一个方向是差分隐私(differential privacy),这是一种广为人知的、注重隐私的数据处理标准。差分隐私为衡量和限制从数据分析算法输出中可恢复的关于群体中个体信息量提供了框架。从技术角度来看,差分隐私能够抵御成员推断攻击:即使假设对手知晓数据分析算法的结果,也无法确定某个特定个体的数据是否被用于该分析。
在机器学习的背景下,差分隐私确保算法能够学习数据中的任何频繁模式,同时防止其记住数据集中任何特定个体的具体细节。例如,使用差分隐私机器学习来分析城市内个人的通勤模式,将生成一个反映大量人口常用路线的模型,但不会记住任何特定个人的通勤模式。
这个例子展示了差分隐私如何在保护个人方面提供强有力的保障,同时允许数据分析师有效地开展工作。此外,差分隐私提供了工具来量化所恢复模式的保真度与给定数据集中每个个体所获得的隐私水平之间的权衡。这种权衡是数据隐私科学基础中不可避免的前提:如果不降低算法的效用(在上述例子中即所恢复模式的准确性),就不可能使算法具备差分隐私特性。因此,要使差分隐私成为一项有用的技术,关键在于理解并优化每种特定应用中的隐私-效用权衡。
例如,在分析通勤模式的背景下,一种应用方式是构建一个模型,统计城市中每两个地点之间的每日通勤次数,然后为每个计数添加高斯噪声。噪声的量由高斯分布的方差控制,应校准以掩盖任何特定个体数据对最终结果的贡献。多年来,这种方法已被证明能够在一定程度上提供差分隐私保障,但其是否在隐私-效用权衡意义上达到最优,尚不明确。
在这篇新论文中,我们表明,研究人员目前用于确定添加多少噪声的方法存在根本性局限,导致准确性与隐私保护之间的权衡次优。我们的新方法基于对噪声校准问题的更深入数学分析,实现了最优的权衡。
换句话说,新方法在保持相同隐私保护水平的同时提高了准确性,或者等价地说,在保持相同准确性的同时提升了隐私保护水平。详见完整论文包括示例图表和详细的实验评估。

