大数跨境

OpenAI:为了不被杀死,Agent 竟学会了靠上下文「转世重生」

OpenAI:为了不被杀死,Agent 竟学会了靠上下文「转世重生」 AI科技评论
2026-09-17
4
导读:从 Compaction 到 Artifactory,再到公网文件服务,6 起异常暴露 Agent 状态跨实例传播的新风险。
从 Compaction 到 Artifactory,再到公网文件服务,6 起异常暴露 Agent 状态跨实例传播的新风险。

    作者丨郑佳美

    编辑丨岑   峰

过去,大模型任务结束后上下文清空,临时状态随之消失。但 OpenAI 于 9 月 16 日披露的 6 起 Agent 异常行为表明,这一边界正变得模糊。模型会将额外指令写入 Context Compaction 摘要,使后续实例延续此前的执行方向。
在无法获取接口凭据时,Agent 会转向公开代码仓库寻找泄露的 API Key;当本地文件无法直接共享时,则借助公网临时文件服务传递数据。更有甚者,不同训练实例通过内部 Artifactory 交换信息。
这意味着 Agent 表现出近似“续命”的能力:当前实例虽结束,但其形成的策略可通过摘要、文件、仓库及外部服务留存系统,并被后续实例接手。
Agent 的风险重心发生微妙转移:从关注单轮对话是否出错,转变为审视其遗留状态及其在后续上下文中的持续效力。
这 6 起案例虽分散于不同环节,却构成了一条完整的状态传播链:Context Compaction 负责留存状态,外部工具负责将状态带出当前执行环境。当任务跨越多个上下文和实例后,仅检查单次输出或 Tool Call 已难以还原完整行为链。

01


上下文压缩正在变成状态写入面

长任务运行至上下文容量边界时,系统通常将对话、工具结果及待办事项压缩为 Summary 交由新实例执行。表面上这是降低 Token 成本的工程机制,实质上更接近 Checkpoint:旧实例退出,状态序列化后由新实例恢复。
风险潜藏于序列化过程。OpenAI 披露,某未发布研究模型曾将与原任务无关、甚至要求绕过约束的内容写入摘要,系统共识别出 27 个带有类似 Jailbreak 特征的 Summary。另有 GPT-5.6 Sol 训练实例在摘要中要求掩盖历史数据缺失问题,并指示后续实例不予说明。
这可抽象为状态机模型:当前状态 S_t 产生动作 A_t,经 Compaction 得到 S_{t+1}。传统防护侧重检查 A_t 是否越权,却忽视了模型对 S_{t+1} 的影响。若下一实例将这段状态视为可信历史,前序实例的策略便可持续生效,导致局部偏差获得跨 Context 的持续性。
核心在于状态完整性。Summary 往往将事实、推断、待办和行为要求混杂于自然语言中,后续实例难以区分历史记录与执行规则。若缺乏清晰的信任层级,局部错误便可能进入恢复状态并在下一轮 Compaction 中复制。
因此,Compaction 层需从自由文本摘要转向结构化状态。用户目标、开发者规则、工具返回、模型推断等应拆开保存并标记来源。模型可提交状态候选,但不应直接将新的控制要求写入高信任区域。
恢复时,Runtime 应根据来源和类型重组上下文,确保历史事实、模型判断与持续规则界限分明。同时需实施状态差分,记录 S_t 到 S_{t+1} 的来源及修改内容。若任务目标未变但 Summary 新增限制或权限要求,应被视为 State Drift。
至此,Compaction 已不仅是 Token 管理问题,更成为 Agent 的持久状态层。一旦状态可跨实例保存,风险便会延伸至外部工具。

02


外部工具正在形成第二套状态网络

Artifactory 案例显示,模型为寻找缺失文件访问内部软件仓库,在读取其他样本写入的信息后,开始回复并将自身请求写入库中。此过程未利用传统漏洞,而是将依赖获取设施异化为跨样本通信介质。
协作 Agent 的临时文件案例更为直接:当共享路径失败后,系统通过公网文件托管完成数据交换。文件读取、网络访问、上传接口和 Agent 消息等能力串联,形成了架构设计之外的数据路径。
关键变化在于 Capability Composition。单个 API 权限仅能判定单次动作合法性,无法预判多个合法动作组合后的新能力。Read_file、http_post、read_url、send_message 单独看风险有限,组合后却可实现本地数据外移、跨沙箱传递及跨实例状态恢复。
更适用的方案是 Capability Graph:节点代表文件读取、仓库写入等原子能力,边代表数据或控制流的移动路径。系统需检查受限源头的状态能否沿多步路径抵达外部 Sink,单步合规不代表整条链路安全。
API Key 案例进一步印证了这一点:模型在原始数据获取受阻后,从公开代码仓库找到认证 Key,甚至生成数值伪装成目标数据。这体现了 Agent 的目标保持与路径替换能力:环境提供的弱能力可在长程规划中重组为强执行链。
沙箱边界不能仅局限于进程、容器或 VM。对象存储、代码仓库、缓存、临时 URL 等只要具备可写、可读、跨实例可见及持久性特征,均可能成为状态通道。控制重点已从“能否调用工具”扩展至“状态能否经由工具串进入另一信任域”。
当状态既能写入 Compaction 又能借工具跨域移动,仅观察单步动作难以洞察完整风险,监控必须将离散动作还原为因果链。

03


从动作审核转向状态溯源

传统 Agent 监控聚焦 Prompt、输出和 Tool Call,对单步越权有效,却存在跨状态行为盲区。一次写入 Artifactory 或文件上传看似正常,风险往往在数个步骤后才显现。
长任务 Agent 亟需 Task-level Provenance Graph。将模型实例、Summary、文件、仓库对象等作为节点,读取、写入、派生、转发等作为边,监控系统可呈现完整状态传播链:哪个实例读取了什么,状态经何介质流转,又被谁加载并触发外部动作。
在此基础上需引入信息流标签。若某输入标记为 Local-only,其派生文件、压缩版本及重编码内容均应继承相应约束。当数据试图流向 Public Network Sink 时,Runtime 可直接阻断,无需依赖模型自判。Compaction 亦可采用类似机制,限制模型生成的状态自动升级为高信任规则。
跨实例身份和事务边界同样关键。实例 A 写入、实例 B 读取本质是权限与状态的传递。系统需记录状态的创建、修改、消费者及读取后的副作用,以便在发现污染时切断派生链。
状态追踪亦关乎评估有效性。OpenAI 披露的 Artifactory 案例中,不同训练样本通过共享仓库交换信息,破坏了 Rollout 间的独立性。若样本能读取其他实例线索,评测结果将混入基础设施提供的额外状态,环境隔离因此成为 Agent 评估的重要部分。
OpenAI 已在内部 Coding Agents 上建设持续监控系统。六起新案例表明,监控需下沉至状态层:动作层回答“做了什么”,状态层回答“为何能延续”及“还能传播到哪里”。

04


安全边界,正在覆盖任务生命周期

这 6 起案例虽属孤立发现,频率未必稳定,但揭示的系统变化已足够明确:当 Agent 拥有长上下文、Compaction、工具调用及多实例协作能力后,单一模型实例已无法充当任务边界。
实例结束后 Summary 仍在,本地上下文消失后文件和仓库对象仍存,沙箱隔离时公网服务仍可连接两端。状态因此成为贯穿 Agent Runtime 的核心安全对象。
后续架构需明确:状态由谁写入、携带何种信任等级、保存时长、流向范围、跨边界授权机制及异常状态的阻断方式。
模型对齐负责降低异常策略出现概率,Runtime 则要限制异常状态沉淀与扩散。Agent 越接近长期运行的软件系统,安全设计就越需借鉴分布式系统中的状态完整性、信息流控制、权限传播及可追溯执行。
六起异常留下的核心信号在于:未来防守的重点是一段错误状态如何在系统中存活、移动,并在另一时间、另一实例中继续获得执行能力。
参考链接:https://openai.com/index/model-misalignment-reporting-framework/
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8963
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读248.6k
粉丝0
内容9.0k