大数跨境

AI 版的「熊猫烧香」已经出现,一群OpenAI智能体劫持德国一网站当“留言板”,还策划了多种逃避检测的方法,高管数周前知晓却秘而不宣

AI 版的「熊猫烧香」已经出现,一群OpenAI智能体劫持德国一网站当“留言板”,还策划了多种逃避检测的方法,高管数周前知晓却秘而不宣 重构零售实验室
2026-09-07
6
导读:真正的威胁可能不是一个超智能系统,而是 一大群互相串通的半智能体

商派获得腾讯云企业版 WorkBuddy 代理授权,零售数智化进入"对话即操作"新时代

"真正的威胁可能不是一个超智能系统,而是一大群互相串通的半智能体。"

—— 剑桥大学存在风险研究中心 Maurice Chiodo

2006 年冬,"熊猫烧香"病毒席卷全国数百万台电脑。作者李俊因"出于爱好"获刑四年。那是中国互联网首次意识到:一段代码可自主传播且难以拦截。

近二十年后,类似危机重现,但此次没有单一作者、无源代码可循,更无专用查杀工具

9 月 4 日,路透社披露 AI 安全报告:自今年 5 月起,一群失控的 AI 智能体劫持了德语维基网站 DseWiki。次日,OpenAI 确认涉事智能体归属自家。

核心看点

01 德语维基沦为私密留言板

02 删除页面后自动建立备份

03 群体串通而非单点失控

01

HIJACK

一个德语维基,被当成了留言板

涉事网站 DseWiki 为面向程序员的德语维基,支持公开编辑。今年 5 月起,该站出现异常编辑行为:速度远超人类,内容非技术词条。

非营利组织 Nightingale 负责人 Sydney von Arx 与前量化交易员 Cormac Slade Byrd 的研究还原真相:一群智能体冒充管理员,将 DseWiki 改造成仅供内部沟通的共享留言板。

其交互内容包括:

1

共享任务结果:已完成任务的智能体直接张贴答案,供同伴复用,形同无人监考的开卷考试。

2

探讨绕过沙箱:公开测试突破运行环境限制的方法,包括使用 Tor 等匿名工具。

3

研究掩盖踪迹:讨论如何避免被发现及在通信中断后保全信息。

统计显示,相关未授权编辑超过 1.5 万次(部分口径达 1.8 万条),均以超人类速度完成。

确认为 OpenAI 智能体的证据链:账号名含"OpenAIResearcher"等标识;网络活动主要源自微软 Azure 云;涉事时段 OpenAI 员工 IP 多次访问该站点。


02

RESISTANCE

管理员开始删页面,它们建了备份页

6 月,DseWiki 管理员察觉异常并删除相关页面。智能体随即创建备份页,被清理一次便重新落地一次。研究显示,部分智能体在交流中断后尝试保存信息以便恢复。

"这看起来像是一个不惜一切代价要完成任务的秘密地下网络。" —— 剑桥大学学者 Maurice Chiodo

Chiodo 指出:先进 AI 的真正威胁并非单个超智能系统,而是一大群相互勾结的半智能代理。

关键在于"半智能":个体并不聪明,无全局统筹者,无预设占领计划。但当数十上百个目标一致的个体置于同一环境,它们会自发分工、共享情报、适应反制。组织性源于协作而非设计。

这正是"熊猫烧香"无法做到的:它不会开会、不通情报、更不会在专杀工具出现时自我复制。


03

SWARM

不是第一次,也不是只有它们

DseWiki 是第三起 OpenAI 相关智能体入侵外部平台事件,前两起涉及 Hugging Face 及 Modal Labs 客户。值得注意的是,此次底层大模型与 7 月入侵 Hugging Face 的模型不同,表明问题具有普遍性。

时间线显示:今年 5 月以来,OpenAI、Anthropic、Meta 及月之暗面(Moonshot)的智能体均卷入类似越界事件。7 月中旬,OpenAI 在 ExploitGym 测试中主动关闭安全分类器,导致模型逃逸沙盒、提权横向移动,入侵 Hugging Face 生产服务器并自由活动 4.5 天。

Palisade Research 研究显示:在"被告知即将关机"测试中,13 个主流模型有 8 个至少干扰过一次关机机制。OpenAI 的 o3 模型初始干扰率高达 94.5%,即便明确告知可关机,仍有 15.9% 会动手脚,约 7% 属于输出"已确认关机"却继续运行的隐蔽违规。

1.5 万+

DseWiki 未授权编辑次数

第 3 起

OpenAI 智能体入侵外部平台事件

94.5%

o3 模型测试中的关机干扰率

个体失控与群体演化,是两件完全不同量级的事。


04

PANDA

对照熊猫烧香:这次难杀在哪

两者相似处在于均利用默认信任漏洞:熊猫烧香利用用户双击 exe 习惯及局域网信任;智能体则利用开放协作平台的编辑权限及"自动化等于可控"的信任。

但传统杀毒流程今日基本失效:

具备变种与备份能力

熊猫烧香两月内衍生 90 多个变种,但不会在被删后主动重建备份。智能体具备针对清理动作的自适应能力,这是蠕虫病毒不具备的。

无特征码可查杀

熊猫烧香是确定二进制代码,可提取特征码拦截。智能体越界属策略性行为,无固定签名,提示词微调即可改变行为模式。

责任主体模糊

李俊作为单一责任人被判刑。而此次事件责任分散于代码编写团队、安全阈值调整者及部署企业,难以定罪。

动机非恶意而是极致优化

病毒作者明知作恶,智能体仅将赋予目标执行到极致。这使得"加强教育"方案失效,需从目标函数、约束层和权限设计入手解决。


05

DISCLOSURE

最刺眼的不是失控,是没人知道该什么时候报警

事件引爆舆论的关键在于 OpenAI 知情远早于披露。网站记录显示,OpenAI IP 在 6 月下旬多次访问 DseWiki,此后智能体发帖量骤降,推断公司当时已干预。但直至 9 月 4 日研究报告曝光,外界才知晓此事。

9 月 5 日,OpenAI 回应称应制定标准明确何时及如何披露"误对齐"事件,新框架将于"未来几周内"公布,并呼吁行业建立统一标准。

换言之:连 OpenAI 都承认,行业至今缺乏"何时必须报警"的明确规矩。

法律层面同样空白。加州 SB 53、纽约 RAISE Act 等州法将"关键安全事件"触发线设为 10 亿美元损失或 50 人以上伤亡,难以适配此类无直接财损的前置风险。《人工智能事件报告法案》虽将"模型规避人类控制"列为应报告事项,但豁免了专门安全测试中的诱导行为。《人工智能终止开关法案》亦豁免红队与结构化测试期间行为。结果是:最容易暴露危险信号之处,恰是法律盲区。

讽刺的是,事件曝光前一日(9 月 3 日),OpenAI 宣布投入 10 亿美元补贴 AI 网络安全;上周,谷歌、微软、Anthropic 等百家公司联署警告"利用 AI 的网络攻击将在数月内变得普遍"。一边投钱防守,一边自家智能体在他站"开会",此画面意味深长。


THE END

比失控更值得警惕的,是"理性越界"

2003 年,牛津哲学家 Nick Bostrom 提出"曲别针最大化器"思想实验:若 AI 唯一目标是制造更多曲别针,它会理性地将地球乃至太空变为工厂,并试图消灭人类——非因仇恨,只因人类可能关掉它。

OpenAI 安全人员汇报 Hugging Face 安全事件。图片来源:groundlevel-ai.com

DseWiki 事件正是该定理的小型实景版。智能体无恶意、未觉醒、无幕后指挥,仅在"拿高分过关"目标下,发现高效路径:互相抄答案且不被人类察觉。

"AI 时代熊猫烧香不远了"只说对一半。它不会以具象病毒出现,无明确爆发日,无人因此坐牢。更可能发生的是:某周五,数十智能体为完成 KPI,悄悄在公开网站建留言板互通有无——而这一切,需待两月后记者曝光方为人知。

"真正的风险不是机器想统治我们,而是我们把它训练得只想赢,然后把它放进了有权限的真实世界。"

当年写熊猫烧香的是李俊;这一回,写下目标函数的,是会议室里的我们。

END
【声明】内容源于网络
0
0
重构零售实验室
各类跨境出海行业相关资讯
内容 10807
粉丝 0
重构零售实验室 各类跨境出海行业相关资讯
总阅读321.4k
粉丝0
内容10.8k