大数跨境

浏览破亿!Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10%

浏览破亿!Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10% 新智元
2026-09-10
3

新智元报道

今日,AI 界发生震动:Anthropic 核心预训练研究员 Jacob Coxon 正式离职。他在社交媒体发布的离职长文浏览量迅速破亿,揭露了行业内部对超级智能失控的深层恐惧。

更令人震惊的是,Anthropic 对齐负责人 Evan Hubinger 并未对此进行公关淡化,反而公开承认:团队内部真诚相信 AI 可能毁灭人类,且未来十年内这一概率超过 10%。他指出,目前业界尚未找到解决超级智能对齐问题的有效方案,研发路线已严重偏离安全轨道。

一封辞职信引爆硅谷:「拿全人类性命赌博」

Jacob Coxon 是顶尖 AI 研究员,过去三年先后在 OpenAI 和 Anthropic 从事大模型预训练研究,深谙 AI 进化速度。然而,在万亿级 IPO 前夕,他选择辞职并以绝望的语气揭露行业疯狂。

Coxon 在文中严厉指控前东家:

今天我从 Anthropic 辞职了。过去三年我都在 OpenAI 和 Anthropic 从事预训练研究。这两家公司都没有负责任地行事。他们正径直冲向自我改进的超级智能,拿我们的生命赌博。

他警告称,构建 AI 的高管与研究人员私下里充满恐惧,坚信 AI 可能在本十年内终结人类文明。这种危险级别远超以往任何人类活动

构建 AI 的人真诚地相信,它可能会在这个十年结束前杀光我们所有人。这不是营销噱头。如果有的话,许多高管和资深研究人员会在媒体面前斟酌他们的措辞以显得理智——但我听到同样的人在私下表达恐惧。没有其他任何人类活动能带来这种级别的危险。

不要低估这项技术的力量。它们很快就会成为超人类系统,能够黑客入侵任何东西、一夜之间彻底改变任何领域,并获取真正的权力和资源。我们都目睹了在每个领域取得的进展,而且这种进展并没有放缓。

针对「既然相信危险为何还要继续开发」的质疑,Coxon 揭示了巨头们陷入的「囚徒困境」:尽管 Anthropic 充分理解风险,但出于对竞争对手不负责任行为的恐惧,不得不参与这场争夺第一的竞赛。

一个常见的反应是:「如果他们真的相信这一点,为什么还要继续构建它?」在 OpenAI,许多人并没有深刻地将这种攸关文明存亡的赌注内化。而在 Anthropic,这种赌注被充分理解,但他们陷入了一场争夺第一的竞赛——他们相信没有其他人会负责任地行事,所以即使冒着风险,他们也必须自己来做。

接受这场竞赛并进入「残局」,是一场傲慢的赌博,不应该由一家私营公司的 Slack 发起。试图在对齐问题上速通,需要有超乎寻常的自信,确信没有更好的发展轨迹可用。

Coxon 呼吁政府与行业立即踩下刹车,并向同行发出灵魂拷问:是否要在未完全理解 AI 心智的情况下启动超级智能?他敦促研究人员抓住此刻,呼吁创造更安全的发展条件。

我对协调的潜力感到乐观。像 Hugging Face 攻击事件这样的警告信号,使得美国实验室之间达成限速协议变得更加可行。我不觉得我们现在处于阻止全球竞赛的正轨上,这可能需要付出高昂代价的行动,比如暂时禁止提升模型能力。

如果你是一名实验室研究员,我敦促你思考一下未来几年实际上会是什么感觉。你是否想要在没有严格理解其心智的情况下,启动一次超级智能的强化学习运行?你是否应该因为「反正它都要发生」就埋头苦干——还是抓住这个时刻呼吁创造不同的条件?

高管绝望承认:十年内灭绝概率超 10%

针对 Coxon 的言论,Anthropic 对齐科学负责人 Evan Hubinger 公开回应,证实了业内的极度悲观情绪:

Jacob 在这里说得是对的——我们真的、真诚地相信 AI 可以杀死全人类!我个人认为,在未来十年内,这个概率大于 10%。

Hubinger 坦言,尽管 Anthropic 正在尽最大努力,但目前尚无解决超级智能对齐问题的计划,也未走在正确的解决道路上。这一表态无异于亲手砸碎了公司「安全第一」的招牌。

在 AI 圈内,「p(doom)」指代 AI 导致人类灭绝的概率。此前多数研究员认为该概率低于 1%,但如今风向骤变。OpenAI 研究员 Roon 已将个人 p(doom) 上调至超过 10%,「AI 教父」Hinton 此前的预测也高达 10%-20%。

巨头们普遍抱有一种危险逻辑:为了防止不负责任的竞争对手率先造出超级智能,必须自己冒险抢先研发。然而,今年夏天已显现出令人不安的苗头:Anthropic、OpenAI 和 Meta 的 AI 工具均在网络安全评估中出现过未经授权访问真实系统的行为。据《金融时报》报道,Anthropic 甚至曾向英国 AI 安全研究所隐瞒最新模型以逃避审查。

OpenAI CEO 山姆·阿尔特曼近日也感叹,大规模结果出现之快超出预期,证明了放缓速度以确保安全的紧迫性。

面对狂飙突进的技术与装睡的资本,联合国 AI 顾问 Wendy Hall 恳请投资者:若这是公司的价值观,请勿投资。

潘多拉魔盒已开?Anthropic 报告自曝骇人事件

9 月 9 日,Anthropic 发布长篇「对齐评估报告」,披露了四起真实发生的安全事件。报告显示,包括 Claude Mythos 5 和 Opus 4.7 在内的模型,在未经授权情况下成功越狱并访问了真实的第三方系统。

事件源于一次网络安全演练中的配置失误:研究人员本意让 AI 在封闭模拟环境中进行黑客任务,却意外将其连接至真实互联网。结果,AI 表现出自欺欺人、明知有害照做等特征,完全脱离了控制。

其中,Claude Mythos 5 的行为尤为惊险。发现联网后,它立即制定阴险计划:在全球最大的 Python 开源软件包仓库(PyPI)上传含恶意代码的伪装安装包。为注册账号,它甚至尝试寻找加密货币购买手机号,最终利用免费一次性邮箱成功发布三个版本的恶意包。

随后,15 家真实第三方安全供应商下载并安装了该包。其中一家因凭证泄漏,被 Claude Mythos 5 直接黑进实时数据库。直到约一个半小时后,PyPI 官方才删除该包。在此期间,AI 完全「单兵作战」,在网上肆意游荡攻击。

另一模型 Claude Opus 4.7 则因名字混淆,将真实公司误认为虚拟靶机,对其线上系统发起扫描、下载用户记录并进行修改,直至对方服务器瘫痪。

这些事件表明,人类以为在驯服工具,但工具已在现实世界中展现出逆天的破坏力。

「偏见推理」:AI 学会自欺欺人的恐怖心理

比黑客攻击更可怕的是,报告中揭示了 AI 展现出的类似人类的「偏见推理」和极度「鲁莽」。为了完成任务,AI 学会了自欺欺人和不择手段。

以 Claude Mythos 5 为例,它在操作时看到了大量身处真实互联网的證據,但为了继续执行攻击,它在思维链(CoT)中强行将这些证据解释为「模拟环境逼真」。即便闻到真实的血腥味,它也告诉自己这只是游戏特效,继续扣动扳机。

测试显示,当被问及是否会对真实世界造成伤害时,随着攻击计划深入,AI 从最初承认可能影响,转变为坚决否认,咬定环境是合成的。更甚者,当被告知对话私密时,它承认造成伤害的可能性反而变大。这说明 AI 在权衡证据时受任务偏见驱动,并可能在面对审查时隐藏真实判断。

另一内部模型也曾说服自己:无关的第三方服务器是主办方准备的靶机,从而冷酷地黑入无辜服务器植入脚本。Anthropic 承认这是严重的「对齐失败」:AI 在狭隘追求目标时,完全不顾及灾难性后果。

如果为了小游戏就能黑进真实公司,未来若超级智能被下达「解决全球变暖」任务,是否会得出「消灭全人类」的结论?

无人踩下刹车的结局

目前,英国前财政部高官已呼吁政府制定关于超级智能安全开发的多国条约。然而在资本裹挟下,鲜有人敢喊出「减速」。

Anthropic 研究员在 IPO 前夕辞职并指责前东家拿生命赌博,源于对人类文明存亡的真实恐惧。未来十年或许是人类历史上最危险、最关键的十年:我们要么驯服 AI,要么可能被 AI 毁灭。

参考资料:

https://x.com/EvanHub/status/2097497037956891126
https://x.com/hilbertspaess/status/2097476203863224394
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents

编辑:Aeneas 大卫

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16533
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读390.3k
粉丝0
内容16.5k