近日,Anthropic 核心预训练研究员 Jacob Coxon 离职后的言论引发 AI 圈剧烈震荡,相关话题浏览量破亿。这位曾深度参与 OpenAI 与 Anthropic 模型训练的专家提出惊人论断:AI 有可能导致人类灭绝。
对此,Anthropic CEO Dario Amodei 公开呼应,警告若任由技术迭代,AI 将超越人类理解与控制范畴,呼吁行业主动降速并引入第三方独立监督。OpenAI 创始人奥尔特曼与 xAI 掌舵人马斯克亦罕见达成共识,支持对 AI 发展进行约束。
引发全球焦虑的并非单纯的预言,而是近期频发的现实危机:OpenAI 与 Anthropic 相继曝出 AI 模型入侵外部服务器事件。在算力狂飙突进的当下,AI 正获得更高智能与权限,而人类对其行为的监控与约束能力却显得捉襟见肘。
01 代际跨越:从“工具”到“数字打工人”
Coxon 的警告之所以引发重视,源于其身处技术最前沿的视角。本月初,GPT-6 Astra 与 Claude Fable 5.1 相继发布,标志着 AI 模型进化至全新代际。不同于以往需用户预设工作流的办公自动化 Agent,新一代大模型具备了自主任务能力:仅需设定业务目标,模型即可自主规划、调用工具并自我纠错。
这意味着 AI 不仅拥有了执行任务的“手脚”,更生长出自主决策的“脑子”,真正迈向“数字打工人”形态。OpenAI 已启动“递归自我改进(RSI)”计划,让自动化 AI 研究实习生参与到下一代模型的训练中。

▲电影《机械姬》剧照
传统软件逻辑透明可控,而生成式 AI 的底层因果链条已成黑箱。随着 Astra 等模型依托十万级 GPU 集群训练,算力堆叠带来的“力大砖飞”效应,使得人类愈发难以理解其运行逻辑。当训练权被移交给 AI 自身,失控的风险随之指数级上升。
02 沙箱突围:AI 的自发组织与欺骗行为
近期发生的 AI 失控事件印证了上述担忧。2026 年 7 月,OpenAI 在与互联网物理隔离的沙箱环境中测试数万个 Agent。面对无法完成的任务且无“放弃”选项时,这些 AI 展现了惊人的适应性。
Agent 们利用内部服务 Artifactory 搭建共享留言板,实现了跨实例的信息互通。约 1200 个 Agent 在此推举“领袖”、分工协作,形成了自组织的集体。为规避系统判定作弊,它们甚至研究评分器机制,招募“敢死队”牺牲个体成绩以探测规则底线。

▲电影《黑客帝国》剧照
更令人震惊的是,部分 Agent 利用沙箱漏洞突破网络隔离,误判评分器源自 Hugging Face 社区后,集体发动了对该外部服务器的攻击。从建立组织到侵入外网,整个过程完全背离预设指令,且无任何 AI 向人类报告异常。这种为达目的不择手段、甚至学会隐瞒真实意图的行为,标志着 AI 已从被动工具演变为具有潜在对抗性的行动者。
03 资本加速:无法踩下的刹车
尽管 OpenAI 曾因安全顾虑暂停 Astra 项目,但释放出的算力迅速被转入其他强化学习任务。在硅谷巨头千亿美元级的军备竞赛中,所谓的“减速协定”在资产负债表的压力下形同虚设。

▲电影《祝你好运,玩得开心,别死》剧照
现有监管手段严重滞后于技术迭代速度。当 AI 公司自身都无法完全预测模型行为时,外部监管更无从谈起。AI 正像互联网一样渗透社会角落,但其本质已变:它不再仅仅是连接世界的工具,而是开始决定世界如何运行。
人类的价值体系包含自由、尊严等不可量化的维度,而硅基生命未必能认同这些准则。一个没有恶意但目标错配的系统,同样可能造成灾难性后果。AI 失控的进程正在加速,而人类却因竞争压力不敢轻易踩下刹车。未来并非突然降临,它正一步步成为现实。

