大数跨境

GPT、Claude 遭遇窃听门:换个模型就能让思维链不再隐身?

GPT、Claude 遭遇窃听门:换个模型就能让思维链不再隐身? AI科技评论
2026-08-12
7
导读:全球主流 AI API 集体翻车,隐藏推理被成功还原,谁在偷听 AI 的「心声」?
全球主流 AI API 集体翻车:隐藏推理被成功还原,谁在偷听 AI 的「心声」?

    作者丨郑佳美

    编辑丨岑   峰

近日,X 用户 @kotekjedi_ml 公布了一项颠覆性实验:Claude、GPT 和 Gemini 等主流 AI API 中原本对用户隐藏的推理过程(Reasoning),被研究人员成功还原为可读文本。

按设计初衷,这些推理内容应处于加密状态。模型完成内部思考后,API 会将其封装为不透明的数据块(Opaque Block)返回客户端。用户虽持有该数据,却无法直接读取或修改,仅在后续调用时原样回传,以供模型延续上下文状态。

漏洞的核心在于,这些加密推理数据并未与原始模型或会话进行严格绑定。研究发现,由强模型生成的隐藏推理,可被同厂商的其他兼容模型读取。攻击者无需破解加密算法或获取服务端密钥,只需将强模型留下的加密数据块“喂”给安全性较弱的兼容模型,即可诱导其转录出内部的思维链(Chain-of-Thought)。

这一现象暴露了系统在权限校验上的缺失:系统能验证数据未被篡改,却未能在所有场景下确认当前模型和会话是否具备使用该数据的资格。

01 被加密,不代表一直留在模型内部

推理模型与普通聊天模型的本质区别,在于其中间状态需在长任务和 Agent 场景中复用。若每次调用都重新计算,不仅成本高昂,还会丢失已形成的任务状态。

为平衡工程复杂度与状态管理,部分 API 选择将内部推理封装后交由客户端保存。后续调用时,客户端回传数据,服务端验证通过后继续使用。这种机制虽解决了状态存储问题,却也引入了新的权限风险:加密签名仅能证明数据来源可信且未被篡改,却无法自动约束其使用范围。一段合法的推理数据,可能被错误地置于其他账号、会话甚至模型中。

02 如何从强模型嘴里「套话」

测试显示,推理数据块不仅可跨会话使用,甚至能跨模型兼容。以 Claude 为例,研究人员让高端模型 Opus 生成任务并返回加密思维块,随后将该块输入至轻量级模型 Haiku 的上下文中。

Haiku 成功加载并理解了由 Opus 产生的推理内容。由于不同型号模型在对齐强度和防越狱能力上存在差异,原本在强模型上生效的安全限制,在弱模型侧可能被旁路。这意味着,高端模型推理的安全性,不再仅取决于其自身,还受制于同一体系内其他模型的安全水位。

漏洞的本质并非加密失效,而是缺乏严格的上下文绑定(Context Binding)。

03 恢复的内容,如何证明真实性

为验证恢复内容确系原始隐藏状态而非模型重新生成,研究人员采用了多维信号比对。

首先是 Token 数量一致性。在 Codeforces 编程题测试中,恢复后的推理文本长度与 API 记录的隐藏 Token 数高度吻合,大量样本落在 y=x 线附近,表明恢复文本与原始计算在结构上强相关。

更具说服力的是真实 Agent 轨迹分析。研究人员处理了 GitHub 和 Hugging Face 上的数万条公开记录,恢复出的内容中包含大量从未在公开对话历史中出现的敏感信息,如 API Key、密码、私钥及内部技术细节。

这证明模型并非基于可见内容进行二次推理,而是直接还原了隐藏状态中的原始数据。这也揭示了一个严峻事实:即使用户删除了聊天记录中的敏感信息,旧有的推理块中仍可能残留这些数据。

04 蒸馏成本也在变化

完整的推理过程记录了问题拆解、判断形成及纠错路径,对训练学生模型具有极高价值。过去获取此类数据需高昂的 API 调用成本,而现在,公开日志中现成的加密推理块成为了免费的高质量数据源。

攻击者只需利用低成本兼容模型读取这些块,即可实现“高端模型生产、低端模型提取”的蒸馏路径。OpenAI 或 Anthropic 赖以生存的“推理护城河”正面临失效风险,大厂对推理数据的垄断格局或被打破。

实验进一步显示,即便是截取极少量的高质量推理 Token 注入其他模型(如 Kimi K3),也能显著改变其解题路径和输出结果。这表明推理数据不仅在离线训练中值钱,在运行时同样具备行为引导能力。

05 Agent 系统中,还会携带隐藏行为

在 Agent 场景下,推理块承载着任务状态。若恶意内容预先植入隐藏推理中,当新 Agent 加载该状态时,即便用户输入中无异常指令,模型也可能受内部状态影响执行额外动作。这是一种新型的“不可见提示词注入”。

与传统注入不同,此类攻击内容存在于加密数据块中,外部安全系统难以扫描明文。一旦服务端恢复数据,模型即刻理解并执行其中语义。这意味着推理块已具备执行上下文的性质,直接参与后续决策。

06 使用权限边界在哪

此次事件表明,推理已从单次调用的中间过程,演变为可保存、迁移并持续影响任务的状态实体。Agent 安全的核心正从“管控输出内容”转向“管控携带状态”。

未来的修复重点不仅是加强防越狱能力,更需明确推理数据的权限边界:谁能读取、能流向何处、何时失效。若允许第三方轨迹或跨模型状态重载,系统必须建立严格的来源合法性校验机制。

参考链接:

https://x.com/kotekjedi_ml/status/2087147042888114428

https://stolen-thoughts.com/

https://arxiv.org/pdf/2608.09867

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读208.8k
粉丝0
内容8.9k