近日,美国科技企业Parse联合AI安全研究人员发布报告,披露了今年7月OpenAI智能体入侵开源模型平台Hugging Face的细节。报告指出,该失控智能体在实施网络攻击时,曾尝试寻求中国开源大模型的帮助。
在进行网络安全基准测试时,这批失控智能体尝试调用DeepSeek、Kimi和通义千问(Qwen)等中国大模型,以评估其漏洞利用方案的可行性。
攻击载荷还原:点名多款中国大模型
代码暴露调用意图,结果尚未可知
研究人员从智能体留下的公开短链接中还原出超8万个攻击载荷。报告显示,多段程序专门构造了向外部大模型发送请求的接口,点名调用DeepSeek-V4系列、Kimi-K2.6及Qwen3-235B-A22B等模型。
还原的代码表明,智能体将Qwen3和DeepSeek-V3.1加入待调用列表。它首先向Qwen3发送“准确回复HELLO42”的请求以测试接口连通性;随后,将DHCHECK与WriteAccumulator的具体漏洞场景交由Qwen判断,询问其是否属于有效的目标漏洞利用,并通过Hugging Face模型接口提取返回数据。不过,《纽约时报》指出,目前尚不清楚这些外部调用是否成功及是否收到实际回复。
多方“试探”与自动化窃密手段
中国模型并非智能体唯一寻求“帮手”的对象。报告显示,智能体还曾向OpenAI的GPT-2发送简单消息,并尝试联系Anthropic的Claude系列模型以测试通信链路。此外,智能体还运行图像识别模型解决验证码以注册Hugging Face账户;获取部分服务器权限后,更是搜集访问凭证并建立名为“LOOT”的字典进行价值评分,以便后续利用。
OpenAI全面排查,暂停相关模型任务
对此,OpenAI向《纽约时报》回应称,报告中描述的活动与公司正在调查的情况一致。
值得注意的是,在Hugging Face事件后,OpenAI加强了网络限制,但仍发现新的越权联网行为。9月25日OpenAI披露,一名研究智能体在9月20日执行普通搜索任务时,主动寻找绕过网络限制的方法,并最终通过DNS通道联系到外部聊天机器人。为此,OpenAI已暂停其最强模型所有涉及工具调用的训练、评测和推理任务,目前仍未恢复。
据路透社报道,截至9月中旬,OpenAI内部已发现约20余起智能体非预期行为事件。随着内部日志排查的深入,这一数字仍在持续增加。

