大数跨境

突发!Anthropic预训练研究员离职,曝出自我改进超级智能最可怕的事

突发!Anthropic预训练研究员离职,曝出自我改进超级智能最可怕的事 智猩猩AI
2026-09-09
7
导读:Anthropic研究员辞职后揭开AI竞赛困局~
智猩猩AI整理
编辑:林夕

刚刚,Anthropic研究员 Jacob Coxon 宣布离职,他没有像大多数离职员工一样简单告别,而是直接发了一篇相当激烈的公开声明



Coxon过去三年先后在 OpenAI 和 Anthropic 工作,主要从事预训练研究。


而他这次离职的理由也很直接:他认为OpenAI和Anthropic都在朝着“自我改进超级智能”一路狂奔。


他甚至用了“拿我们的生命下注”这样的措辞。



今年早些时候,他从OpenAI加入Anthropic,其中一个重要原因就是Anthropic在AI安全方面的声誉。


在他的描述里,Anthropic并不是不重视安全,相反,公司内部其实非常清楚风险在哪里。


问题在于,知道风险和能够停下来,是两回事,Coxon在后续解释中专门比较了OpenAI和Anthropic。


他的说法是,在OpenAI,很多人并没有真正把这种风险提升到文明级别的程度;


而在Anthropic,情况恰恰相反:很多人知道事情可能有多危险,但公司已经进入了一场必须抢先到达的竞争。



因为他们担心,如果自己停下来,其他公司不会停。


于是就出现了一个很奇怪的局面:大家都知道终点可能很危险,但每家公司都认为自己必须成为第一个到达终点的人。


Coxon把这种状态称为endgame



他说,现在AI实验室内部甚至开始用“crunchtime”和“endgame”这样的词来描述接下来的发展阶段。


在他接受《华尔街日报》采访时,他给出的判断更加激进:按照目前的发展速度,到明年年底,一些最极端的情况“可能已经失控”


而他真正担心的,并不是普通意义上的模型变得更聪明,在另一条帖子中,Coxon进一步警告称,不要低估这项技术的力量。


他认为,很快AI系统就可能成为超越人类的系统,能够攻破任何东西、一夜之间颠覆任何领域,甚至获得真正的权力和资源。


“我们都已经见证了这些领域取得的进展,而这种进展并没有放缓。”



Coxon在X上直接向AI实验室的研究人员提问:如果有一天,你需要启动一次超级智能级别的强化学习训练,但你甚至没有真正理解这个系统的“心智”,你还会按下开始键吗?



这也是他认为现在最危险的一步。


过去的模型训练,本质上还是人类设计训练目标、准备数据、选择奖励函数,再观察模型能力变化。


但如果模型越来越强,开始参与研究、写代码、设计实验、寻找训练方法,甚至帮助训练下一代模型,那么模型能力提升模型帮助自己提升之间的界限就会越来越模糊。


而一旦进入这个阶段,传统的安全测试可能就很难跟上。


Coxon因此用了一个非常形象的说法:“speedrun alignment”——速通对齐


他的意思是,实验室现在似乎在尝试一边把模型能力快速推向超级智能,一边希望在这个过程中把alignment问题一起解决。


但在他看来,这本身就是一次巨大的赌博。


进入终局这样的决定,不应该只是几家私人公司的Slack频道里讨论一下就决定。


这句话其实比AI可能毁灭人类更加值得关注。


因为它指向的是另一个问题:谁有权决定人类什么时候进入超级智能时代?


如果模型真的开始具备强大的自主能力,那么这件事的影响显然已经超过一家公司的产品路线。可是目前,真正拥有决定权的,仍然主要是几家私营AI实验室。


Coxon甚至提出,如果行业无法形成协调机制,未来可能需要采取非常激进的措施,包括暂时禁止进一步提升模型能力。


他自己倒没有把希望完全放弃。


在X上,他提到最近发生的Hugging Face事件,反而可能成为美国几家AI实验室达成“pacing agreement”的一个机会:也就是大家共同约定,在某些能力上不要无限制加速。



这里还有一个非常值得注意的细节。


Coxon发完这串帖子后,Anthropic内部负责alignment研究的Evan Hubinger亲自回应了。



他说,Jacob说得没错。


Hubinger表示,Anthropic的人确实认为AI可能杀死所有人,而且他个人认为,未来十年出现这种结果的概率“超过10%”。


但与此同时,他也明确承认:Anthropic虽然在尽力做安全工作,但目前并没有解决超级智能alignment问题的方案,也不能说已经明确走在正确的路上。


这句话让整件事的分量发生了变化。


因为Coxon可以被理解为一个离职员工的个人判断,但Hubinger并不是一个普通网友,他本人就是Anthropic的alignment研究人员。


换句话说,Coxon所说的业内人士其实真的很害怕,至少得到了Anthropic内部研究人员公开程度相当高的回应


巧的是,OpenAI CEO Sam Altman当天也公开谈到了类似的问题。


图像


他表示,OpenAI一直在讨论控制AI发展速度以确保安全的必要性,并称这是目前为止“最有力的紧迫性证据”。


当然,Coxon并没有拿出一份内部文件证明OpenAI和Anthropic已经制造出了失控的超级智能。


他爆出的也不是某个具体项目的秘密参数,更不是所谓下一代模型已经觉醒。


他的说法更像是一名参与过训练的人,对整个行业发展方向提出警告:大家正在越来越接近一个可能无法轻易回头的阶段,而目前没有人真正知道,最后一道安全门应该在哪里。


OpenAI担心别人领先,Anthropic担心别人不负责任,其他实验室也有自己的竞争压力。


于是每个人都可能得出同一个结论:“如果别人不会停,那我为什么要停?”


而这恰恰是Coxon认为最危险的地方。


因为当所有人都认为别人不会停的时候,最后可能真的没有人愿意先停下来。


END


关注+星标,获取AI前沿进展与开源一线动态

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2344
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读3.0k
粉丝0
内容2.3k