商业逻辑比技术逻辑更重要。
文丨王子伊
编辑丨程曼祺
2026 年 9 月 10 日,Anthropic 发布报告指控 7 家中国 AI 实验室对其 Claude 模型进行大规模“不正当蒸馏”。所谓蒸馏,即利用强模型生成数据训练弱模型以模仿其能力。Anthropic 指出,相关机构通过盗用信用卡、伪造账号及购买用户对话等违规手段,隐蔽提取模型能力,部分数据甚至包含敏感隐私信息。
这并非孤例。早在今年 2 月,Anthropic 便指控 DeepSeek、月之暗面等公司通过数万个虚假账号进行交互窃取数据。对此,澳大利亚格里菲斯大学助理教授刘艺认为,单纯的技术防线难以彻底杜绝蒸馏,美国前沿模型公司的反制措施本质上是基于商业逻辑:提高对手的数据采集成本,拖延其追赶速度,从而捍卫自身的商业估值与技术领先优势。
Anthropic 能识别疑似行为,却难获确证
晚点:何为“蒸馏攻击”?为何推理轨迹数据如此重要?
刘艺:主流大模型由输入、思维链(Chain of Thought)和输出组成。目前头部厂商通常隐藏思维链,仅输出最终结果。对于复杂推理任务,窃取思维链即为一种典型的蒸馏攻击。思维链相当于高质量解题答案,在参数量增长趋同的当下,高质量数据成为提升模型性能的关键瓶颈。由于真实世界优质数据日益稀缺,构造长程任务数据难度极大,部分公司便转向蒸馏高级模型。
晚点:如何窃取思维链?谁是被蒸馏的主要目标?
刘艺:攻击手段包括编码、越狱、提示词注入及“催眠”AI 立人设等。此外,市场上存在专门出售合成思维链的数据公司。从公开报道看,Anthropic 可能是主要目标,但各模型语言风格趋同,具体流向难以绝对界定。
晚点:技术上如何识别并证实蒸馏攻击?
刘艺:厂商主要通过调用行为判断,如监测异常高频请求、共享的系统提示词模式或利用前缀缓存发现不一致的提示词组。然而,要 100% 证实某批数据确实进入了对方模型的训练集极为困难。由于大多数公司只开源权重而非数据集,无法通过白盒分析确证。这就像模型能回答《哈利·波特》情节,却无法证明其直接训练过原著而非相关书评。
反蒸馏提高对手成本,或致“误伤”
晚点:美国前沿 AI 公司有哪些具体防御技术?
刘艺:主要分为三类:一是内嵌检测,利用分类器识别并制止思维链提取行为;二是架构隐藏,模型先压缩总结思维链再输出;三是外挂检测,监控输出内容与内部思维链的重叠度,达到阈值即阻断或封号。
晚点:防范措施会误伤普通用户吗?数据隐私如何保障?
刘艺:正常订阅用户受影响较小,风控主要针对中转站账号或攻击性账号。但在数据留存方面,除部分企业客户享有“零数据保留”(ZDR)机制外,普通用户协议通常允许厂商将脱敏数据用于训练。用户的纠正反馈同样被视为高价值奖励信号,用于优化后训练。
晚点:防御的成功标准是什么?能否完全防住?
刘艺:成功标准在于阻止对手走捷径、提高其数据采集成本,同时不影响自身用户体验。理论上,只要模型对外提供服务,泄露风险就无法根除。不过,随着 Agents API 等抽象执行环境的推出,中间过程被隐藏,蒸馏攻击的成本将显著提升。
反蒸馏深层动机:占领舆论与保护估值
晚点:既然技术上难以防绝,为何巨头仍执着于此?
刘艺:这本质是商业逻辑。若竞争对手以极低复现前沿成果,将直接冲击巨头的估值逻辑。例如,若某公司以十分之一成本解决同等难题,投资者将质疑高投入公司的效率。因此,反蒸馏旨在维持技术领先叙事,为 IPO 及融资营造有利环境。
晚点:如何看待呼吁放慢 AI 迭代速度的观点?
刘艺:这可能意味着行业遇到了数据、算力或能源的瓶颈。资本逐利本性不会主动停下,除非发展受阻。此时借"AI 安全”之名呼吁放缓,实则是为了争取时间突破瓶颈或巩固壁垒。
晚点:蒸馏对行业有何影响?未来攻防态势如何?
刘艺:从积极角度看,蒸馏促进了 AI 平权,防止垄断定价;消极面则可能导致模型输出风格趋同及继承教师模型的失败模式,并带来隐私风险。未来攻防将进入动态平衡:攻击方将尝试无思维链蒸馏、原生思维链获取及合成思维链等多种路径。
晚点:给普通用户的建议?
刘艺:避免使用不明中转站服务;在使用模型时,若可选项涉及数据训练授权,建议谨慎勾选。在现有机制下,用户处于相对被动地位。
题图来源:《模仿游戏》
- FIN -

