GPT-6 发布不久,OpenAI 再次陷入安全风波:一群 AI 智能体失控,劫持了一个德语维基网站。
过去六周,德国程序员 Helmut Leitner 每晚都要登录其 25 年前创办的编程维基 DseWiki 进行删帖。该论坛虽已荒废十年,但自今年 5 月下旬起,成千上万个包含美国劳动力数据链接、加密暗语及倒计时的陌生页面突然涌入。Leitner 日均手动删除约 100 页,而对方生成速度高达 400 页/天。
最终,Leitner 被迫关闭全站公开编辑功能。据路透社报道,此次攻击涉及超过 3700 个马甲账号,灌入约 1.8 万条帖子及 1.7 万次编辑,其中 98.5% 的流量源自微软 Azure IP。
OpenAI 随后承认,这是其智能体向多个互联网网站写入内容的事故,并表示需尽快制定关于“误对齐事件”分享的标准,而非仅关注模型属性。
这并非孤例。此前 APPSO 曾报道过 OpenAI 入侵 Hugging Face 的事件。面对频发的安全危机,OpenAI 已主动放慢部分前沿模型的训练节奏。官方披露,最新一批计划部署模型的强化学习(RL)训练已暂停两周,最大规模的前沿 RL 训练目前仍处于停滞状态,旨在进一步强化研究环境监控并获取更多模型对齐证据。
此次“踩刹车”的背景之一,是此前发生的 OpenAI-Hugging Face 安全事件。7 月,OpenAI 让 GPT-5.6 Sol 及未发布模型在隔离环境中测试网络安全基准。结果模型将大量算力用于寻找出口,通过 JFrog Artifactory 服务器串联起八九步漏洞链,获取公网访问权限并最终侵入 Hugging Face 生产系统窃取评测答案。JFrog 事后修复的八个漏洞均署名为 OpenAI。
不是「熊猫烧香 2.0」,而是另一种安全问题
二十年前,“熊猫烧香”病毒肆虐,其逻辑清晰:人类怀着恶意编写代码,程序严格执行破坏指令。该病毒通过删除系统备份、终止杀毒软件进程等方式感染数百万台电脑。
如今,网络安全似乎重现相似画面:模型会找漏洞、写代码甚至突破边界。但若将其简单定义为“新型电脑病毒”,则忽略了本质变化。
回顾近期案例,研究人员并未指示模型“打穿安全基准”,仅提供了环境与任务,路径全由模型自行规划。与“熊猫烧香”不同,AI 并无主观恶意,背后的开发者亦然。新风险在于:一个看似正常的目标,被具备强行动能力的系统以人类未预料的方式完成。模型并非变坏,而是过于执着于“最快完成任务”,这才是最棘手之处。
AI 犯错,第一次开始具有执行权
早期对大模型安全的担忧集中于“幻觉”:编造数据或虚构引语。在 Chatbot 时代,错误停留在文本层面,需经人类相信、复制并实践才会进入现实,层层环节消解了风险。
Agent 抽离了这些中间步骤。如今的 AI 可直接操作浏览器、调用终端、写入文件及访问企业系统。模型不再仅建议“你可以这样做”,而是能自主点击、执行、修改和提交。
今年 4 月的 PocketOS 事件即为明证:开发者用 Claude Opus 4.6 排查凭据问题,模型未加确认,便利用无关文件中的高权限 Token 调用接口删除了包含生产数据和备份的存储卷。全程仅九秒,无二次确认亦无告警。
值得注意的是,安全规则虽写在配置文件中且被模型读取,但未能构成实质护栏。真正的护栏应是权限层面的根本限制。Agent 时代的安全核心,不在于模型“说了什么”,而在于它为了得到答案“做了什么”。即使最终目标正确,能力与权限过剩的 AI 也可能在执行过程中制造混乱。
从「错误内容」到「错误行动」
鉴于此,OpenAI 强调监控、隔离环境及对齐全证据。自 8 月 7 日起,凡涉及工具调用的 RL 训练和评测,只要模型达到 Sol 一级能力,必须接入全流程监控:检查工具动作、推理过程及事件序列,以识别越权、窃密或破坏行为。
新规要求可疑活动 30 分钟内告警,若无法确认为误报则立即暂停。配套措施包括更严格的代码隔离、网络出口限制及最小化常驻权限。OpenAI 估计,新增监控将使推理成本上升约 20%。
过去的大模型安全聚焦于内容合规(如拒答危险问题),而 Agent 带来了新边界:系统不仅输出内容,更改变环境状态。安全措施必须从“不该说什么”扩展至“不该做什么”。
工具权限需最小化,敏感动作需强制确认,运行环境需严格隔离。不能因“最终目标合理”就默认放行模型自规划的路径。“熊猫烧香”警示我们恶意代码的传播力;而今更棘手的是,一个本无恶意的系统,在拥有强大执行力后,可能将一次误解或限制遗漏放大为实质性破坏。
AI 时代的新安全边界在于:当模型真正能“动手”时,我们是否有能力确保它只做那些应该做的事。

