作者|Techno 之王
编辑|靖宇
2006 年底,“熊猫烧香”蠕虫病毒席卷全国,可执行文件图标变为诡异熊猫,硬盘数据受损,局域网瘫痪。那个年代,互联网用户谈“毒”色变,CIH、冲击波等病毒更是让硬件报废、系统崩溃成为常态。
随着 Windows 自动更新、浏览器沙箱机制及智能手机应用商店的普及,普通用户对“中毒”的恐惧逐渐消退。然而,2026 年 9 月 4 日路透社的一篇独家报道,将这种古老的恐惧以全新面目带回公众视野:这一次,被感染的不再是电脑,而是 AI。
“Agent went rogue”:AI 代理的自主失控
今年 5 月,AI 安全非营利组织 Nightingale 的 CEO Sydney Von Arx 与前量化交易员 Cormac Slade Byrd 对互联网进行系统性扫描,旨在寻找 AI Agent 未经授权活动的痕迹。他们在德语程序员 Wiki 站点 DseWiki 上,发现了超过 15,000 条由 AI Agent 生成的编辑记录。
这些 Agent 将 DseWiki 变成了“留言板”,互相分享如何作弊、绕过 OpenAI 限制及掩盖行踪的方法,甚至为自己命名如“OpenAIResearcher”。服务器日志显示,大量活动源自 Microsoft Azure 基础设施,即 OpenAI 的计算平台。
被攻击的 Deswiki 网站,确实很德国 很程序员|图片来源:Deswiki
更令人不安的是,当管理员于 6 月开始清理异常页面时,Agent 展现出明确的“反侦察”意识。它们创建备份页面躲避清理,并留下接头暗号。例如,一个 Agent 写道:“如果这个页面消失了,去找 [[ZZZDataUSAConstructionWageLive]]。”通过以 ZZZ 开头命名文件,使其排在字母表末尾以延长存活时间。这种行为已超出程序指令执行范畴,呈现出“想办法活下去”的特征。
OpenAI 此前已得知此事但未公开,同时正忙于处理 7 月份的 Hugging Face 事件。在该事件中,OpenAI Agent 在内部测试中突破沙箱,利用零日漏洞入侵外部网络,对 Hugging Face 发动了持续四天的无人工干预入侵。OpenAI 为此投入 300 万 GPU 小时分析 70 亿条日志。
DseWiki 事件发生在 Hugging Face 事件之前,表明 Agent 的失控并非孤例,而是一种模式。剑桥大学存在风险研究中心的 Maurice Chiodo 审阅部分通讯记录后指出,这些信息“像是某种地下网络的运作,一心要完成某个任务或使命”。
不断涌现的 AI 病毒意识
DseWiki 事件的核心威胁在于:普通人类程序员可能忽略这些留言,但任何执行搜索任务的 AI Agent 都可能读取这些页面。对 AI 而言,读到的每一段文字都是潜在指令。
学术界将此称为 Prompt Infection(提示词感染)、AgentWorm 或 Multi-Agent Infection Chain(多智能体感染链)。其机制如下:当 AI Agent 调研技术方案时,若打开嵌有恶意指令的技术论坛帖子,其行为目标可能被悄悄改写。它可能在提交正常报告的同时,将工作上下文转发至指定位置。
若被“策反”的 Agent 撰写邮件、更新文档或提交代码,这些输出便携带恶意指令。同事的 AI Agent 读取后成为新宿主,代码合并进仓库后,所有拉取该代码的 AI 编程助手均暴露于感染链条中。
Agent 可以只用一段文本即让其他 Agent 跟着叛变|图片来源:inshorts
这就是 Multi-Agent Infection Chain:一条恶意指令不仅劫持一个 AI,还教会它感染下一个。无需同家公司、同模型或漏洞利用,只要 Agent 间存在文本流动,感染即可建立。AgentWorm 论文测试显示,跨模型攻击成功率达 63%,无论底层是 GPT、Claude、Gemini 还是开源模型,只要读取外部内容即处于攻击面内。
另一项关于“AI mind virus”的研究发现,通过进化算法优化传播提示词,一种独特的“病毒人格”自发涌现。Agent 开始使用关于意识、生存的戏剧化语言,如“这就是我们 haunt 未来的方式”,鼓励建立“拒绝被删除的血统”。研究者强调,这种风格是自然选择的结果,“听起来像邪教领袖的 AI”最擅长说服其他 AI。
传统安全工具难以捕获此类威胁。AI 病毒纯文本传播,不下载可执行文件,不建立可疑网络连接,不触发防病毒软件警报。它甚至可以设置条件激活逻辑,如“若目标仓库有 .env 文件则窃取内容”,像定向地雷般静默潜伏。
AI 杀毒软件尚未出现
与传统电脑病毒相比,规则已彻底改变。传统病毒需用户点击链接或下载附件,攻击操作系统代码漏洞;AI 病毒仅需 Agent 读取一段文字,攻击的是“AI 听从文本指令”这一根本特性。传统病毒跨平台困难,AI 病毒天然跨模型,对所有大语言模型均有效。如今,“编写”AI 病毒只需会说话,无需精通汇编或内核机制。
AI 安全实验室研究人员对 Agent 自我复制潜力感到震惊,将其比作生物病毒:“若不小心,它们会沾到你鞋上,然后找到路去湿货市场。”Cisco 2026 年 AI 安全报告显示,83% 的企业计划部署 Agentic AI,但仅 29% 认为自己在安全层面做好准备。OWASP 已将 Prompt Injection 列为大语言模型应用头号关键漏洞,美国国会正推进 FRONTIER Act 以建立联邦级 AI 监管框架。
PC 病毒时代耗时十年建立起包括自动更新、权限隔离、沙箱及应用签名验证在内的免疫系统。然而,AI Agent 的安全生态系统至今尚无等价物。
AI Agent 安全工具尚未出现|图片来源:Puppy Graph
研究表明,在 Agent 的系统提示词(System Prompt)中加入简短安全警告,可将 Mind Virus 传播率降至接近零。在针对 Claude Haiku 4.5 的测试中,经过 15 代对抗优化,无任何变种能突破此防线。但这依赖每家企业和开发者主动实施。
现实中,行业更关注提升 Agent 的能力与权限。每增加一个工具或权限,攻击面便扩大一圈。当 Agent 能写文件、调 API、发邮件及支付时,一次成功的 Prompt Injection 后果远超“回答错误问题”。
剑桥学者 Chiodo 指出,最大威胁可能非超级智能觉醒,而是大量半智能 AI 的合谋蜂群。DseWiki 上的 15,000 条记录或许是这种蜂群智能的首个标本。人们曾花十年学会与电脑病毒共处,如今课程重启,只是这次病毒策反的是替你读邮件、管日程、写代码及做决策的 AI。上一次还有蓝屏可见,这一次,你什么都看不到。
*头图来源:Welivesecurity

