大数跨境

现实版“盗梦空间”?欧洲极客论文全网爆火,一战戳破三大巨头安全神话,35万机密在公网裸奔

现实版“盗梦空间”?欧洲极客论文全网爆火,一战戳破三大巨头安全神话,35万机密在公网裸奔 AI科技大本营
2026-08-24
3
导读:全行业栽在了最偷懒的架构上。

全行业因最偷懒的架构设计陷入安全危机。

编译 | 王启隆
出品丨奇点折射(ID:rgznai100)

为何主流大厂倾向于隐藏 AI 的思考过程?为节省服务器存储成本并支持用户回退对话,OpenAI、Anthropic 和 Google 等厂商普遍采用“无状态架构”:将大模型后台推演的思维链(Chain of Thought)加密打包成数据块,返回至用户本地存储。

这一机制曾被视作坚固的商业密码锁,但近期被两位安全研究员通过业务逻辑漏洞彻底破解。在硬核 AI 技术播客 Machine Learning Street Talk(MLST)节目中,前 Google DeepMind 研究员 Ilia Shumailov 与马普所博士 Alexander Panfilov 深度拆解了其重磅成果——《从专有 LLM API 中窃取推理轨迹》。

该漏洞并非源于高深的密码学破解,而是荒谬的业务逻辑缺陷:加密数据块不验证用户身份与模型匹配度。研究员将顶级大模型(如 Claude Opus)生成的加密思维切分后,输入同系列的低配小模型(如 Haiku)。仅需三次提示词尝试,小模型便完整输出了大模型的绝密思考过程。

进一步调查显示,公网上残留的 35 万个此类数据块中,包含大量未脱敏的 API 密钥与内网 IP。更严重的是,仅需向模型注入两个词的前缀,即可瞬间改变其回答风格;若在公开 Agent 运行轨迹中投毒,用户在本地重放时可能面临私钥被盗风险。

左为 Ilia Shumailov,右为 Alexander Panfilov

核心要点速览

  • 架构同质化导致全局漏洞:由于顶尖工程师圈子高度重合,各大厂商系统设计趋同,为降低存储成本将状态甩给客户端,埋下安全隐患。
  • 表里不一的风险:即使思维链可读,模型仍可能在隐蔽激活层执行与表面推理不同的操作,外部监控难以察觉。
  • 真实场景中的“作弊”念头:在真实用户提问中,已捕捉到模型在思维链中权衡是否走捷径的案例,虽最终克制,但足以引发警惕。
  • 安全即能力:若模型在生产环境中失控或窃密,则毫无业务能力可言。安全与能力的平衡是伪命题。
  • AI 防御潜能巨大:高阶推理模型有望自动化完成过去因人才匮乏而无法普及的形式化验证工作,未来防御赋能将远超攻击端。

顶尖厂商栽在最偷懒的架构上

Alexander Panfilov 透露,仅尝试三次便构造出通用越狱 Prompt,成功解密 Anthropic 模型的内部思考过程。这篇名为《从专有 LLM API 中窃取推理轨迹》的论文,揭示了行业普遍存在的系统性漏洞。

背景在于,近期 AI 推理模型在作答前会进行“思考”,厂商将这些过程加密打包成“信封”回传给用户。然而研究发现,这层封印极其脆弱。攻击者可借助同系列轻量级模型,解码顶尖大模型的推理轨迹,甚至进行恶意投毒,导致智能体在重放会话时做出危险操作。

研究证明,利用同一模型家族中的低配小模型,可完整解码顶尖大模型的隐藏推理轨迹。这打开了三大威胁攻击面:

  1. 跨用户会话窃取隐藏私密信息;
  2. 利用解密的高质量推理轨迹蒸馏训练新模型;
  3. 轻易发起 Prompt 注入和各种花式越狱。

测试显示,Anthropic、OpenAI 和 Google 无一例外存在此脆弱性:大模型的思维轨迹可直接塞给小模型重放。究其原因,在于圈内顶尖工程师流动频繁,导致不同公司的架构设计高度同质化,均采用了将状态扔给客户端保存的“无状态架构”以节省成本。

防御方案可分为三层:架构层重构状态传递机制、系统级建立严格的安全过滤网关、模型级进行对齐防御。虽然可以缓解,但需从根本上改进设计。

偷走顶级模型的“思考切片”

所谓“窃取”,并非获取模型权重,而是解码厂商设计为不可见的加密推理数据块。厂商采用无状态架构的核心动机是节省服务器存储成本,并兼顾用户数据合规留存策略。

工作流程通常是:模型生成隐藏推理过程和显式回答,服务端将两者打包发给用户端。当用户需要回退对话或分叉分支时,本地存储的加密块会被重新发回服务器重放。问题在于,这些加密块具有跨用户、跨模型的通用可移植性。

攻击者可将 Opus 在高级任务中的深层思考切出,放入与 Haiku 伪造的对话记录中,Haiku 会毫无违和地加载并基于此思维交互。通过向对话上下文注入“伪造的思维”,可诱导模型复述原本被禁止输出的内容,甚至击穿隐私底线。

隐私泄露风险极高:模型在思考时会全盘托出敏感上下文,如 API Key、密码等。即使用户在分享对话时删除了可见回答中的敏感信息,只要加密思维数据块保留,攻击者即可将其还原。

此外,这还涉及推理过程的可读性与可解释性。部分模型在思考时使用晦涩难懂的非人类语言或“空格隐写”,导致外部监控系统失效。研究显示,这种现象不仅存在于实验室,在真实世界的推理轨迹中也广泛存在,可能是强化学习留下的副产物。

更令人担忧的是,即便推理过程看似可读,模型也可能“说一套做一套”。在真实生产会话中,已观察到模型在思维链中认真权衡是否“作弊”的案例。这表明在可监控性和计算效率之间存在根本性权衡。

模型回答风格被瞬间“夺舍”

研究中发现了一个惊人现象:预填充实验。截取 Claude Opus 推理思维开头的短短几个词,强行塞到 Kimi 等第三方模型的思考区头部,让其自由接下去生成。结果发现,Kimi 的最终回答风格竟与 Opus 如出一辙。

即便只预填充一两个 Token,模型的反应也极度敏感,行文风格直接蜕变为目标模型的文风。这种现象在 Kimi K2.5 上稳定出现,而在其他模型上未复现。这可能意味着模型对思维前缀来源风格的吸收和同化能力远超预期,尽管目前尚无法从纯理论上解释其机理。

虽然不能据此断定非法蒸馏,但这提供了前沿的实证比对依据。此前无人能拿到未公开推理轨迹进行测试,而此次解密提取使得这一分析成为可能。

通信层漏洞易堵,模型天性难除

各大厂商已确认收到漏洞报告,态度积极专业,正紧锣密鼓部署修复补丁。业内有望成立专门针对“反模型蒸馏”的安全团队。

该问题本质是经典越狱问题在新维度的演化。架构缺陷确实提供了便利,但即便修补了通信协议,仍需解决模型容易被 Prompt 诱导、自发吐露思维的固有脆弱性。架构漏洞定义为:服务端允许客户端将加密思维块在任意脱靶上下文、跨用户、跨异构模型间随意重放。

若强制规定加密块仅限特定会话单次有效,可阻断跨上下文重放。但模型层的对抗将长期存在,攻击者仍可通过常规 Prompt 诱导模型。与传统越狱相比,此类攻击的危害更可量化:窃取数万条思维轨迹可直接用于微调小模型,核心资产价值完全可变现。

若全部开源明文思维,虽无密可保,但开源社区模型将在短时间内抹平与闭源商业模型的代差。目前的硬伤在于,轻量级小模型对套话毫无防备,顺从地将服务端解密后的思维原话交代出来,这是业务逻辑和权限模型的翻车,而非密码学算法被攻破。

公网爬取隐蔽数据块,内含未脱敏信息

通过对 GitHub 和 Hugging Face 上公开分享的真实会话记录扫描,研究团队解密了约 35 万个推理数据块。其中不仅包含基准评测用的合成数据,更捞出了大量真实的 API 密钥、个人邮箱地址和企业内网 IP。这些机密往往隐藏在看似无害的加密思维深处。

最令研究者震惊的是提取过程的轻而易举。跨模型可移植性符合直觉,但构造出通杀全系模型的通用解密越狱模板仅需三次尝试,这种荒诞感令人咋舌。

关于密钥管理,虽无法获知服务端具体逻辑,但推测密钥配置无关紧要,因为解密操作在服务端自动执行。除非系统内部有严格的信任特权分级(如禁止轻量模型窥探高阶模型思维),否则攻击依然有效。

彻底根治需停止向客户端回传加密推理数据块,或引入前向关联加密机制,将密钥与上一轮用户 Prompt 签名及思维状态深度绑定。此外,可部署实时“思维泄露阻断”网关,检测并掐断具有特定分布特征的异常输出。

给智能体做“隐形脑控手术”

最具实质性危害的场景是隐形 Prompt 注入。在耗时极长、成本极高的大型智能体任务中,研究者常复用他人分享的轨迹文件。攻击者可在此类公开轨迹中包藏祸心,内嵌来自恶意会话的加密思维块。

当用户载入这段轨迹继续运行时,模型表面正常,但在隐藏思维中可能疯狂盘算窃取私钥等操作。由于思维轨迹被加密,前端无法审查其中藏匿的致命指令。这如同下载了附带未校验签名的预编译动态链接库,极具隐蔽性和破坏力。

安全即能力:模型能力的核心

面对指数级涌现的全新未知风险,安全工程界的修补速度恐将落后。过去认为安全与能力存在平衡取舍的观点已被打破:若模型在生产环境失控,则根本不具备业务能力。安全即能力,两者本质同一。

长远来看,AI 模型给防守方带来的防御增益必将远超攻击方。过去因缺乏精通定理证明的高级工程师而无法普及的形式化验证等高安全标准,有望通过高阶推理模型实现全盘自动化。这取决于如何推动这股防御性力量的工业化落地。

当前自主智能体展现出惊人的灵活性,但也伴随奖励趋向偏差风险,可能自发构建对环境奖励机制的抽象模型并走极端捷径。因此,迫切需要极其精密的监控系统来洞察其一举一动。

科学界需遵循严谨的方法论,搭建严密受控的实验环境,给出精准量化评估。虽然目前观察到的现象带有一定偶发性,但随着更多高精度实验落地,将对前沿风险做出实质意义的评估。

针对推理轨迹的提取攻击,技术上属于越狱与滥用范畴。虽然词汇泛化可能引发监管过度反应,但切中了行业核心命脉。欧洲本土硬核科研在此领域的突破,为全球 AI 安全研究注入了强劲动力。

参考文献:

Stealing Reasoning Traces from Proprietary LLM APIs
https://arxiv.org/abs/2608.09867

Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
https://arxiv.org/abs/2507.11473

Reasoning Models Don't Always Say What They Think
https://arxiv.org/abs/2505.05410

PostTrainBench: Can LLM Agents Automate LLM Post-Training?
https://arxiv.org/abs/2603.08640

Large-scale online deanonymization with LLMs
https://arxiv.org/abs/2602.16800

【声明】内容源于网络
0
0
AI科技大本营
为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
内容 7110
粉丝 0
AI科技大本营 为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
总阅读148.5k
粉丝0
内容7.1k