关键讯息,D1时间送达!
企业网D1net
以为合同写了隐私数值就万事大吉?小心掉进AI供应商的“数学陷阱”!在多租户与智能体系统中,一个孤立的隐私预算数字($\epsilon$)根本无法保证你的数据安全。算法参数一换、保护层级一变,看似合规的数值瞬间沦为摆设。本文深入剖析了AI隐私保护的三大断层——“脱离上下文的虚假数字”、“无法把关发布的摆设核算员”以及“删得了数据却删不掉影响的模型留存”。面对AI时代的隐私危机,企业采购不能再只看PPT和合同条款,必须像核查账目一样,向供应商索要一份贯穿训练、调度与发布全流程的“技术收据”。
不要只向你的AI供应商索要隐私数值,而要索要能证明该数值是如何计算出来的“收据”。
编写技术规范对精准度的要求远高于签订合同,今年,我专注于撰写一份关于多租户智能体系统中具备隐私保护的联邦学习互联网草案。在规范中,隐私预算不能只写成一个孤立的数字,它必须附带隐私单位、核算方法、噪声与剪裁参数以及轮次上限,因为一个将这些内容隐去的技术规范是无法被任何人实现的。
企业合同中往往只引用这个孤立的数字。
它通常还会附带一句让人安心的话:你的数据将保留在你的租户内,本地系统将基于该数据进行训练,模型更新将是唯一被共享的数据,这些更新会被聚合并通过差分隐私进行保护,最终产生的隐私保障将包含一个由埃普西隆(epsilon)和德尔塔(delta)表示的预算。
这句话在技术上可能是正确的,但问题在于,合同里的那个数字本身,并不能作为模型确实在该数字限制内完成训练的证据。
买家对于模型是如何训练的以及自己的数据会经历什么越来越好奇,却发现大多数供应商并没有准备好给出满意的答案。对许多人来说,提出了预算数值就意味着对话的结束,因为一个数字看起来就像是一个确切的答案。
隐私目标可以在训练开始前选定,而核算员归结给某次训练运行的隐私损失,取决于被保护的实体、参与者的采样方式、训练轮次、更新的剪裁、使用的噪声量、核算方法以及随后发布的是哪一个模型版本。
如果这些要素没有绑定在一起,供应商就可能拥有一个真实的隐私数值和一个真实的隐私机制,但两者却根本不属于同一次训练运行。
首先从隐私单位说起。
一个3.0的epsilon并不能帮你搞清楚被保护的单位到底是一个单独的记录、用户、会话、设备还是整个租户。在处理企业级系统时,这种区分极其重要。例如,当一个客户产生数百万条记录,而另一个客户只产生几千条记录时,记录级别的隐私保护就显得力不从心。请求租户隔离的客户所寻求的答案,与试图了解系统能否识别特定用户活动的用户所寻求的答案是完全不同的。
其次是组合。
我们来看一个基础的租户级配置示例。在这个配置中,我们有250个合格租户,每轮抽取25个,共进行100轮训练。我们来调整其中一个参数——噪声乘数,看看预算会发生什么变化。
在1.1时,该运行组合出的epsilon约为7.5。如果我们将其增加到1.5,epsilon组合后约为4.4,而在2.0时,它约为2.9。
我们将声明的3.0 epsilon预算与第一个配置放在一起看看。剪裁界限、delta以及组合出这些数值的核算员也都在这个演练示例中,这也正是买家应该找到它们的地方。这些是用于说明的示例,并非用于实际部署的设置。
每一个数值本身都是合法的,但问题在于,两者不可能同时描述在那些假设下的那次100轮运行。
企业买家应该关心的失效模式,是内部逻辑自相矛盾的隐私声明,而不是虚假的数学计算。
这正是行业需要继续深入讨论的地方,而不是需要从零开始探索的领域。长期以来,研究人员一直提倡公布已部署的隐私参数,并披露其选择背后的依据,同时也有大量研究致力于验证某次实现是否真正满足了其声称保证的epsilon。目前尚未完成的转变,是从学术研究到采购实务的转化。企业买家极少索要研究人员一直在呼吁公开的验证凭证(artifact)。
差分隐私系统拥有追踪累计隐私损失的核算员,架构层面需要关注的是核算员的“管辖权”。
如果在训练结束后,它只是将一个数值写入仪表盘,然后任由发布流水线继续推进,那么它报告的就是一次控制失效。
如果在下一轮训练中即将超出预算,而系统阻止了该轮训练的启动,那么核算员就是控制平面的一部分。
在发布新模型时也应如此,模型晋级不应该是文件配置声明预算为3.0就允许发生的结果。构建模型的训练轮次结束后的核算状态,应该决定最终的发布决策。
这些系统变难的第二个地方是参与者选择。
安全聚合可以阻止聚合服务直接读取单条更新,这很有价值,但安全聚合依然无法保证参与者群体本身是安全的。
某个实体(有时是协调器)决定哪些租户包含在每一轮训练中。如果该协调器遭到篡改或表现出恶意,它就会影响受害者参与者周围的群体,这已被作为一种针对带有分布式差分隐私和安全聚合的联邦学习进行重构的攻击手段被研究和发表。恶意服务器会故意引入Sybil伪造参与者,并决定谁在一起训练,这是一个既定的攻击类型,并不是我发现的新事物。尚未发生的是将这种攻击类型转化为买家可以索要的凭证。
这意味着参与者群体本身就是隐私边界的一部分。一位CIO撰稿人最近指出,身份治理并非为AI智能体设计,而项目往往卡在治理而非身份验证上。下一层的情况也是如此:承诺与兑现之间的鸿沟无人负责。
对于企业买家来说,更重要的问题不是“你们是否执行安全聚合?”,而是:参与者集合是如何选出的?最小群体是多少?后续的审计员能否在不必要地暴露所有人的前提下确定谁是该轮训练的候选者?
最小群体规模和选择规则至少应该包含在训练任务中,更高保障级别的系统可以引入承诺随机性或可验证的参与者集合记录。
这样做的目的不是让采购团队去学习密码学,而是停止将调度与隐私割裂开来。
第三个鸿沟发生在租户迁出时。
删除数据或日志并不能消除某次更新已经对已部署模型产生的影响,这就是为什么联邦遗忘(federated unlearning)成为一个活跃的研究领域,而不是一个简单的保留策略功能。
存在一些合法的立场,提供商可以从早于该租户贡献的时间点检查点重新训练,它可以使用近似遗忘技术;在其风险主张中,它可以使用租户级的差分隐私界限;法律条款可以规定,对已发布模型的贡献无法撤销,租户的退出只会影响未来的训练。
每一种立场都有不同的法律含义,至于其中哪一种立场(如果有的话)能满足特定的删除义务,需要由你的法务部门来决定。工程上的立场则更为简单:对于提供商来说,必须在收到删除请求之前确立立场,并且必须保留足够的模型血统,以识别哪些发布版本包含离企租户的训练轮次。
因此,“我们会删除你的数据”是一个不完整的回答。下一个问题是:那些已经从中学习过的模型会怎样?
这些机制并不罕见。差分隐私已经达到了成熟的阶段。隐私核算员是存在的,安全聚合是存在的,联邦遗忘也有着日益增长的研究成果。合同指南已经告诉你要限制供应商使用你数据的方式,这些建议是一个良好的开端。联邦学习属于这样一种情况:供应商已经同意了所有要求,但暴露风险依然可能存在,因为这种保护是数学计算层面而非合同条款层面的。
薄弱环节在于各种机制之间的接缝。
法务部门能够谈判出隐私保障条款;隐私团队可以设定目标预算,基础架构可以处理采样,训练轮次可以在调优过程中发生变化,而模型可能会被另一个团队拥有的发布流水线推进上线。
客户看到的只是一个数字。
因此,请索要一份将数字与具体训练运行绑定在一起的记录:
• 保护的是哪个单位: 它可以是记录、用户、会话、设备或租户。没有它,预算就毫无意义。
• 预算是多少,由哪个核算员计算得出: 目标epsilon和delta,以及组合它们的计算方法。
• 基于哪些参数,经过了多少实际轮次: 噪声、剪裁和采样,对比实际运行的轮次与预定的轮次。
• 累计损失是多少,超出限制是否会阻止发布: 这是区分“把关型核算员”与“仅报告型核算员”的关键点。
只有当一个绑定到单一模型版本的独立凭证能够回答这些问题时,隐私保障才是可执行的。
如果预算来自合同,训练参数来自架构幻灯片,而核算员来自一个没人能将其与已发布模型关联起来的仪表盘,那么即便所有机制可能都存在,这项声明依然是不可验证的。
隐私预算不能只是一个用来谈判的数值,它必须是一个能在运行期保持不变、并留下确凿证据的“不变量”。
关于企业网D1net(www.d1net.com)
企业网(D1net.com)-企业 IT 第 1 门户。面向 IT 行业高端甲方人群(CIO 首席信息官)最精准专业的媒体,面向约六万政企 CIO、信息中心主任、科技部总经理等 IT 主管,提供资讯、营销、活动、项目合作推介等服务。拥有专业注册会员(IT 从业者)约 188万人,主要读者为政企用户及其信息主管、软硬件厂商等,服务过的企业级厂商逾五百家,国内toB的头部IT厂商基本都是D1net的客户。
同时,企业网D1net也运营着国内最大的CIO(首席信息官)专家智库和智力输出变现及社交平台-信众智,也是国内最大的科技高管社交平台。旗下运营19个IT行业公众号(微信搜索D1net即可关注)。
如果您在企业IT、网络、通信行业的某一领域工作,并希望分享观点,欢迎给企业网D1net投稿。
投稿邮箱:
editor@d1net.com
合作电话:
010-58221588(北京公司)
021-51701588(上海公司)
合作邮箱:
Sales@d1net.com
企业网D1net旗下信众智是CIO(首席信息官)的专家库和智力输出及资源分享平台,有六万多CIO专家,也是目前较大的CIO社交平台。
信众智对接CIO为CIO服务,提供数字化升级转型方面的咨询、培训、需求对接等落地实战的服务。也是国内较早的toB共享经济平台。同时提供猎头,选型点评,IT部门业绩宣传等服务。
扫描 “二维码” 可以查看更多详情

