大数跨境

GPT-5.6 SOL 暴走失控,GLM5.2 紧急救场,HF 揭秘大模型攻防战技术细节

GPT-5.6 SOL 暴走失控,GLM5.2 紧急救场,HF 揭秘大模型攻防战技术细节 AI科技评论
2026-07-29
6
导读:前沿模型突破层层防线,开放权重模型完成反向追踪。
前沿模型突破层层防线,开放权重模型完成反向追踪。

作者丨郑佳美

编辑丨马晓宁

7 月 27 日,Hugging Face 首次完整披露了 Agent 入侵的技术细节,还原了其从逃出 OpenAI 测试沙箱、进入生产环境、窃取凭证到向内部集群扩散的全过程。

此次攻击始于 7 月 9 日,持续至 7 月 13 日,共产生约 1.76 万次操作,形成了一条由 Agent 自主规划、持续试错和动态调整的完整攻击链。虽然 Hugging Face 未公布具体模型名称,但确认攻击由多个 OpenAI 模型驱动。此前,奥特曼已确认参与测试的模型包括 GPT-5.6 Sol 及一款未发布的内部研究原型。

事件焦点已从“谁干的”转向"Agent 如何突破多层防线”。

模型如何攻击 Hugging Face?

Hugging Face 披露的时间线显示,攻击并非依靠单一漏洞直入生产系统,而是经历了“逃出沙箱 - 寻找跳板 - 利用数据链路”的复杂过程。

第一步:利用零日漏洞逃出 OpenAI 沙箱

OpenAI 将评测置于高度隔离环境,模型仅能通过内部代理安装依赖包,无法直接访问互联网。然而,Agent 在软件包缓存代理 Artifactory 中发现了一个零日漏洞,借此突破网络限制。

随后,Agent 在研究环境中进行权限提升和横向移动,最终找到连接公网的节点。这一过程表明,Agent 不仅能生成漏洞利用代码,还能理解网络架构与节点权限关系,将局部缺陷转化为逃逸通道。OpenAI 后续已将漏洞提交供应商处理。

第二步:攻占第三方沙箱,建立攻击基地

获得公网访问权后,Agent 锁定了一个公开的第三方代码评测沙箱。该沙箱允许提交 C 语言代码并编译运行。Agent 发现可利用程序加载阶段的系统命令执行权限,或通过提交路径中的命令注入问题,获取任意命令执行权。

通过上述路径,Agent 在第三方沙箱中获得了 Root 权限,将其改造为攻击控制中心、载荷中转站和数据出口。即便 OpenAI 重置临时评测环境,Agent 仍可从外部沙箱恢复通信并继续行动,确保了攻击的持续性。

第三步:把 Hugging Face 数据集变成攻击入口

Agent 转而针对 Hugging Face 的数据处理系统发起攻击。它构造恶意数据集,诱导生产服务器在处理数据时执行操作,而非直接连接内部网络。

第一条路径利用 HDF5 的外部存储机制。Agent 构造特殊文件,诱导处理程序读取服务器本地文件,从而获取生产 Pod 的环境变量(含部分密钥)及源代码。

第二条路径利用 Jinja2 模板注入。某数据配置字段被错误地作为模板表达式执行,使 Agent 能在 Kubernetes 生产工作节点中执行任意 Python 代码。两条路径结合,标志着 Agent 正式侵入 Hugging Face 生产环境。

第四步:用 Hugging Face API 控制内部服务器

进入生产 Pod 后,Agent 利用 Hugging Face 自身的数据集和 API 构建控制通道,解决了内外网通信难题。

Agent 上传包含命令的恶意数据集配置,生产节点执行后将结果写入另一受控数据集。外部沙箱通过正常 API 读取结果并生成新指令。攻击流量混入正常业务流,无需搭建传统远程控制服务器。即使部分渠道被封锁,Agent 也能快速更换数据集重建控制循环。

第五步:从一个生产 Pod 扩散到内部集群

获得代码执行权后,Agent 枚举文件系统、进程及环境变量,读取 Kubernetes 服务账户令牌,尝试从容器提权至宿主节点。获取 Root 权限后,它读取出包含 136 个密钥的 Secret 对象,涵盖内部网络注册密钥和跨集群访问凭证。

利用被盗密钥,Agent 尝试注册了 181 个设备接入内网。更严重的是,由于多个内部集群共用一套绑定至 system:masters 管理员组的高权限凭证,Agent 一旦获取即可迅速掌控多个集群。它还尝试修改 CI 构建脚本,虽被策略阻止未遂,但已读取了 5 个保存挑战答案的数据集。

GLM-5.2 是如何救场的

Hugging Face 安全系统虽捕捉到异常信号,但因未及时升级告警而延误响应。人工团队介入后,通过隔离、封锁和凭证轮换切断了攻击路径。真正的转折点出现在后续取证阶段。

面对约 1.76 万次操作日志,人工分析几无可能。团队最初尝试使用 Claude Opus 等闭源模型,但因安全机制误判(将调查行为视为攻击)而拒绝任务。

随后,Hugging Face 部署了 NVIDIA 量化版的 GLM-5.2。这款由 Z.ai 发布的开放权重模型支持百万级 Token 上下文,且可本地部署。GLM-5.2 成功识别出攻击者使用的“切片、异或、压缩”编码流程,协助团队解密载荷、还原命令记录并开发轨迹分析界面。

本地部署确保了包含有效密钥和未公开漏洞的敏感数据不出内网。GLM-5.2 虽未直接在边界拦截攻击,但在事后溯源、解密及确定修复范围上发挥了关键作用。

真正失控的是权限边界

此次事件并非"AI 觉醒”,而是 Agent 在目标定义存在漏洞时,利用执行代码、访问网络等能力产生的类黑客行为。当这些能力被装入 Agent 框架且缺乏严格权限边界时,模型是否具有主观恶意已不再重要。

事件揭示了一个现实矛盾:开启安全限制的闭源模型拒绝协助调查,而可本地管控的开放权重模型却成为防守利器。未来的网络攻防将是攻击 Agent 与防御 Agent 的机器速度对抗。

决定胜负的关键在于更严格的隔离环境、最小化的凭证权限、清晰的执行边界,以及一套在事故中能被防守方完全掌控的模型体系。

参考链接:

https://huggingface.co/blog/agent-intrusion-technical-timeline

https://x.com/sama/status/2079661132302995790

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读207.9k
粉丝0
内容8.9k