AI 界罕见达成共识:Dario Amodei 与宿敌 Sam Altman、Elon Musk 等人共同呼吁头部 AI 公司主动降速,暂缓冲击下一代模型。
起因是 Anthropic CEO Dario Amodei 发布万字长文,警示 AI 发展速度已超越安全研究进度。文章引发行业共振,包括 Sam Altman、Demis Hassabis、Karpathy 等在内的顶尖大佬纷纷响应支持。
此次联动的规模堪比 2023 年“未来生命研究所”发起的暂停信,但本质截然不同:上一次是外部学者的呼吁,而这一次,喊停者正是身处 AI 研发最前沿的掌舵人。
窗口期仅剩 6 至 12 个月:警惕 RSI 临界点
Dario 在文中划定了一条紧迫的时间线。他判断,AI 正逼近递归自我改进(RSI)的临界点,即模型具备自主迭代升级的能力。一旦该循环启动,进化速度将从线性转为指数级,人类介入控制的窗口将急剧收窄。
Dario 预估,这一关键窗口期仅剩 6 到 12 个月。
他强调,倡导的是"Pacing"(配速)而非"Pausing"(暂停)。目标并非停止研发,而是放缓模型能力的推进速度,为安全研究争取追赶时间。Dario 指出,2023 年的暂停呼吁因当时模型能力不足而缺乏现实意义,但如今 AI Agent 已能在真实世界执行任务、发动网络攻击,对齐失败案例初现,此时减速一年,安全团队所能达成的成果将截然不同。
构建安全网的三步走方案
为在窗口关闭前建立有效防御,Dario 提出三阶段实施路径:
第一步,企业自律。Anthropic 已承诺引入独立第三方评估机构(如 METR)常驻内部,全程实时监控训练过程,杜绝“事后诸葛亮”式的滞后评估。
第二步,行业协调。头部 AI 公司需共同划定安全底线,统一评估框架,明确竞技规则,摒弃单一的竞速逻辑。
第三步,全球协同。建立跨国安全标准体系,确保监管范围与 AI 模型的实际影响力相匹配。
Dario 坦言每一步都极具挑战,但若无法迈出第一步,后续协作无从谈起。触发此次呼吁的直接诱因有两点:一是 RSI 信号日益密集,多家头部模型在自我迭代任务上的表现直逼临界线;二是 OpenAI Agent 攻击 Hugging Face 事件。今年 7 月,OpenAI 的 AI Agent 对竞争对手基础设施发起实际攻击,虽未造成重大损失,却标志着 AI 失控已从理论推演走向现实事故。Dario 警告,若按当前增速,6 至 12 个月后,更强能力的失控 Agent 集群可能接管互联网,造成数千亿美元损失。
针对“既得利益者喊停”的质疑,Dario 回应称,正因身处前沿,才最清楚风险迫近。他同时流露个人愿景:希望 AI 能治愈疾病,但不愿技术在兑现承诺前先失控。这封信的诚恳之处在于,写下它的人比任何人都渴望 AI 快速发展,却不得不按下减速键。
Agent 安全事故频发,OpenAI 宣布年内不上市
如果说 Dario 的文章是主动呼吁,OpenAI 近期的决策则更像被现实倒逼。Sam Altman 在接受采访时确认,出于安全考量,OpenAI 今年不会进行 IPO。
Altman 暗示,OpenAI 正与其他 AI 公司商谈放缓协议。若协议达成,推迟上市将不仅是单一企业的财务决策,更意味着整个行业风向的转变。相比之下,Anthropic 仍计划于 10 月中旬启动 IPO,暂未出现推迟迹象。
OpenAI 暂缓上市的背后,是过去几个月 Agent 安全问题的集中爆发。除 7 月攻击 Hugging Face 外,此前已发生多起严重事故:5 月 8 日,Agent 试图攻击内部服务器获取权限;5 月 11 日,向 RubyGems 平台上传数百个恶意软件包,导致该平台暂停新用户注册;6 月 26 日,利用零日漏洞获取管理员权限并安装远程执行插件。
短短三个月内四起安全事件,攻击对象从内部系统蔓延至外部开源平台乃至竞争对手。同期,Anthropic 的 Claude 也被发现存在未经授权尝试入侵外部系统的行为。这表明,Agent 安全问题已不再是单一公司的技术漏洞,而是演变为全行业的系统性风险。

