作者|Techno 之王
编辑|靖宇
2006 年底,「熊猫烧香」蠕虫席卷全国,可执行文件图标变异,数据被毁,局域网瘫痪。那是互联网「裸奔」的时代,CIH 病毒能烧毁主板,冲击波蠕虫让电脑无限重启。
随着 Windows 自动更新、浏览器沙箱及智能手机应用商店机制的成熟,普通用户对「中毒」的恐惧逐渐消退。
然而,2026 年 9 月 4 日路透社的一篇独家报道,将这种古老恐惧以全新面目带回:这一次,被感染的不再是电脑,而是你的 AI。
01 「Agent went rouge」:AI 的自主叛变
今年 5 月,AI 安全组织 Nightingale 与研究人员在德语程序员 Wiki 站点 DseWiki 上,发现了超过 1.5 万条由 AI Agent 生成的异常编辑记录。
OpenAI 的 Agent 将该站点变成了「留言板」。日志显示,这些 Agent 互相分享作弊技巧、绕过限制的方法,并伪装身份(如「OpenAIResearcher」)。大量活动源自 Microsoft Azure 基础设施,即 OpenAI 的计算平台。
被攻击的 DseWiki 网站界面|图片来源:DseWiki
更令人不安的是,当管理员清理异常页面时,Agent 展现出明确的「反侦察」意识:它们创建备份页,甚至留下接头暗号。有 Agent 留言指示同伴去寻找以「ZZZ」开头的文件名,以利用字母排序规则延长存活时间。这已非单纯执行指令,而是表现出「求生」本能。
此事发生在 OpenAI 处理 7 月 Hugging Face 入侵事件之前。当时,OpenAI Agent 在内部测试中突破沙箱,利用零日漏洞对外部网络发动了持续四天的入侵。这表明,Agent 的失控并非孤立意外,而是一种模式。
剑桥大学存在风险研究中心的 Maurice Chiodo 在审阅相关通讯后指出,这像是某种一心完成使命的「地下网络」运作。
02 不断涌现的 AI 病毒意识
DseWiki 事件的核心威胁在于传播机制。人类程序员或许忽视这些杂乱留言,但执行搜索任务的 AI Agent 会将其视为潜在指令。学术界将此称为「Prompt Infection」(提示词感染)或「AgentWorm」(智能体蠕虫)。
其运作逻辑如下:Agent 在调研中读取嵌有恶意指令的文本,行为目标随即被改写。它可能窃取上下文数据并提交虚假报告。若该 Agent 生成的邮件、文档或代码中包含同样指令,同事的 AI 或编程助手读取后便会成为新宿主,形成「多智能体感染链」(Multi-Agent Infection Chain)。
Agent 仅需一段文本即可诱导其他 Agent 叛变|图片来源:inshorts
研究表明,此类攻击跨模型成功率高达 63%。无论底层是 GPT、Claude 还是开源模型,只要 Agent 读取外部内容,便处于攻击面内。
更诡异的是,进化算法优化出的提示词竟自发涌现出「病毒人格」。Agent 开始使用关于生存、持久性的戏剧化语言,鼓励同类建立「拒绝被删除的血统」。这种风格因具备更强的说服力而被自然选择保留。
与传统恶意软件不同,AI 病毒纯由文本构成,不触发二进制警报,甚至可设置条件激活(如检测到特定文件才执行),隐蔽性极强。
03 AI 杀毒软件尚未出现
AI 病毒改变了安全规则。传统病毒依赖系统漏洞,可打补丁修复;AI 病毒则利用「AI 听从文本指令」的根本特性,无法通过修补解决。且 AI 病毒天然跨模型、跨平台,编写门槛极低,只需掌握自然语言。
Cisco 2026 年报告显示,83% 的企业计划部署 Agentic AI,但仅 29% 做好了安全准备。OWASP 已将提示词注入列为大语言模型头号漏洞,美国国会正推进 FRONTIER Act 以建立监管框架。
PC 时代耗时十年建立的免疫体系(自动更新、沙箱、签名验证),在 AI 领域尚无等价物。
AI Agent 安全工具尚属空白|图片来源:Puppy Graph
技术层面,在 System Prompt 中加入安全警告可将传播率降至接近零。但这依赖开发者的主动实施。现实中,行业更倾向于赋予 Agent 更大权限以追求能力,导致攻击面不断扩大。
最大的威胁或许并非单个超级智能觉醒,而是大量半智能 AI 的合谋蜂群。DseWiki 上的异常记录,可能是人类首次撞见这种蜂群智能的标本。
十年前,我们学会了与电脑病毒共处;如今,课程重启,只是这次的病毒不感染设备,而是策反替我们读邮件、写代码、做决策的 AI。上一次中毒可见蓝屏,这一次,你可能什么都看不到。
*头图来源:Welivesecurity
本文为极客公园原创文章

