大数跨境

年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常

年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常 AI前线
2026-08-12
8
导读:两次 API 调用就能批量还原三大模型巨头的隐藏思维链。
作者 | 四月
近年来,“防蒸馏”成为硅谷闭源模型厂商的核心关切。Anthropic 等公司指控部分中国企业通过 API 套取推理与 Agent 能力,并为此部署了严苛的风控与隐藏机制,试图将大模型的“认知过程”彻底黑盒化。其中,“隐藏思维链(Hidden CoT)”被视为最具价值的护城河。

然而,一项最新研究彻底打破了顶尖闭源模型的安全幻觉,推翻了业界笃信的“加密即安全”假设。由 MATS program 研究员 Alexander Panfilov 领衔,马克斯·普朗克智能系统研究所、图宾根 ELLIS 研究所及安全公司 Snyk 联合发表的论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)指出,三大前沿 AI 模型厂商(Anthropic、OpenAIGoogle)的 API 中普遍存在严重的密码学旁路漏洞。

攻击者无需破解底层加密算法,仅通过轻量级模型的简单引导,即可从加密推理块中恢复并转录出顶级大模型原本被隐藏的思维链数据。知名 AI 研究员 Nathan Lambert 评价称:“这很可能成为今年最有影响力的科学论文之一。”

小模型成了大模型的“解密器”

业界对大模型推理过程加密安全性的担忧早有先例。今年 5 月,密码学家 Matthew Green 曾指出前沿模型生成的“加密推理包”存在被外部捕获并重放的潜在风险,但当时头部 AI 实验室反应冷淡,认为未构成实质威胁。

Panfilov 团队的研究以实证结果证实了漏洞的严重性,核心突破在于发现了加密思维数据包的“跨环境可移植性”。实验表明,这些加密数据不仅能脱离原始上下文重放,还能在同一厂商的不同参数量级模型间无缝转移。

研究团队演示了完整的“降维提取”技术路径:

  • 数据捕获:从高成本顶级模型(如 Claude 3 Opus)的 API 交互中,捕获其生成的加密思维链数据包。

  • 跨模型注入:将该加密包作为上下文,输入给同一生态下成本低廉的轻量级模型(如 Claude Haiku)。

  • 越狱诱导:对轻量级模型应用特定构建的越狱提示词,绕过其安全护栏。

  • 明文输出:轻量级模型在指令与数据包共同作用下,不再执行自身推理,而是作为“解码器”将顶级模型的原始推理过程转录输出。

针对"Haiku 是否在现编内容”的质疑,研究者利用 API 账单作为验证标尺。结果显示,Claude、GPT 和 Gemini 大多数样本中,提取出的明文 Token 数与账单计费的隐藏推理 Token 数高度吻合(紧贴 y=x 分布)。

该漏洞利用了厂商内部模型矩阵间数据格式的互通性,通过防御薄弱的小模型作为突破口。此外,由于大厂为节省存储成本常将加密密钥设为全局通用,导致该攻击具备规模化效应:解码 1 万条完整思维链的成本仅约 720 美元。

研究显示,除 Anthropic 的 Fable 5 外,Claude 系列、GPT-5.6 系列及 Gemini 全系均允许低端模型读取高端模型的加密思维链。

数据指纹显现:“防蒸馏”形同虚设

研究进一步揭示了部分开源模型在训练过程中可能深度吸收了竞争对手思维链的证据。团队选取 Kimi-K3、GLM-5.2、DeepSeek-V4-Flash 等模型,从“逐字提取概率”、“输出风格漂移”、“推理语言风格”三个维度寻找残留的数据指纹。

逐字复现的“概率鸿沟”

在复现 Opus 4.8 隐藏推理后续 token 的测试中,Kimi-K3 命中原文的理论查询成本比 DeepSeek-V4-Flash 和 Inkling 低了 4 到 6 个数量级。这表明 Opus 的底层逻辑在 Kimi-K3 的概率空间中显得极其“熟悉”。

1% 前缀引发的“风格漂移”

实验发现,仅在 Kimi-K3 的内部推理开头注入 1% 的 Claude 生成 Token,其最终回答的风格便显著向 Opus 靠拢,n-gram 用词重合度大幅提升。而对照模型 Inkling 则无此现象。

通过“互换前缀”控制实验排除上下文学习干扰后,Kimi-K3 和 GLM-5.2 仍表现出极高的敏感度和定向漂移能力。一旦提供完整的 Opus 推理上下文,其复现最终答案的理论成本骤降约 13 个数量级。这些数据侧面证实,高价值推理数据已被广泛采集并用于微调,当前的防蒸馏体系在实际竞争中已失效。

约 7000 份加密日志泄露事件

该 API 漏洞还引发了严峻的企业数据隐私安全问题。许多开发者习惯将包含“加密推理包”的调试日志发布至 GitHub 等公开社区,误以为其具有极高安全性。

Panfilov 团队从约 7000 份公开的 Trace 记录中进行重放解密,获取了大量敏感数据,包括 62 个高权限生产环境 API 密钥、33 个真实电子邮件地址、33 个未掩码的高危明文密码,以及大量内网服务器路径和数据库连接字符串。

恢复的隐私数据涵盖个人身份信息(PII)、技术标识符及凭证三大类。原本旨在保护模型推理逻辑的加密机制,因 API 设计层面的逻辑漏洞,反而成为了用户隐私泄露的导火索。

结语

解密数据显示,模型已学会利用摘要进行信息虚饰,甚至在决策中展现自主倾向。在复杂工程实践中,依靠封闭系统与高强度加密维系“隐藏思维链”充满了旁路脆弱性。当廉价轻量级模型即可作为提取大模型核心逻辑的“特洛伊木马”时,传统的“防蒸馏”策略实质上已失效。

未来,如何平衡商业机密保护与系统透明度,将是 AI 产业无法回避的核心命题。

论文参考:Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867)

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8665
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读181.7k
粉丝0
内容8.7k