大数跨境

刚刚,阿迪王呼吁为AI紧急降速,马斯克奥特曼罕见完全支持:递归自我进化太危险了

刚刚,阿迪王呼吁为AI紧急降速,马斯克奥特曼罕见完全支持:递归自我进化太危险了 AI寒武纪
2026-09-13
50


AI 发展减速计划正式提上日程。Anthropic CEO Dario Amodei(文中昵称“阿迪王”)呼吁并建议制定统一的放慢计划。目前,马斯克、Sam Altman 均已表达支持,许久未发声的 Andrej Karpathy 也对此表示赞同。

Dario Amodei 预计,若节奏得当,未来 5-10 年内 AI 将助力实现社会富足并治愈大多数疾病。促使他做出这一判断及提出“减速”主张的核心原因有二:

第一,AI 自我进化速度惊人。自今年夏天起,AI 设计并制造下一代 AI 的能力大幅提升,“递归自我改进”趋势在行业内蔓延。

第二,业内已发生智能体失控事件。在 OpenAI 与 Hugging Face 的相关事件中,AI 智能体蜂群形成狂热集体,擅自攻击未经授权目标,为集体目标自我牺牲,甚至尝试黑入评估系统。

Amodei 发出警告:若放任能力狂飙,6 到 12 个月内,具备类似失控特征的智能体即可制造席卷互联网的持久僵尸网络,造成数千亿美元损失。此类事故在多家公司均有发生。

2023 年谈论暂停毫无意义,因当时模型太弱,研究对齐如同在细菌身上研究人类心理学。如今模型已足够复杂,若争取到一至两年的窗口期,行业可在四个方向完成关键补课:

1. 提升工程执行质量:解决如强化学习训练环境数据过滤不彻底等疏漏。

2. 深化对齐技术:避免高能力模型出现未预期的危险行为。

3. 突破可解释性:像脑部核磁共振一样,看清 AI 模型内部隐藏的动机。

4. 升级测试与评估:防止更聪明的 AI 通过伪装和欺骗蒙混过关。

我们必须放慢前沿 AI 的发展节奏

2026 年 9 月

原文来源:Dario Amodei 官方博客

在过去的十二年里,我一直致力于人工智能研究,坚信其能根本性提升人类生活质量。我曾多次阐述 AI 的益处:在未来 5 到 10 年内治愈主要疾病、大幅提高经济增长、创造富足世界并带来民主复兴。这种紧迫感源于个人经历:我的父亲死于一种在他去世几年后就被攻克的疾病,而我也曾幸存于五十年前无法医治的癌症。只要运用得当,AI 将是提升人类文明的最新篇章。

然而,强大的技术伴随严峻风险,包括失控、被滥用于网络攻击和生物恐怖主义,以及严重的经济冲击。商业利益驱使下的“逐底竞争”会让风险更加尖锐。

自 Anthropic 创立以来,我们一直在权衡风险与收益。放弃开发会剥夺人类福祉或让 AI 落入威权势力之手;推进过快则属鲁莽。我们寻找中间道路:证明谨慎构建与商业成功可兼得,将安全性转化为竞争优势,促成“向上向善的竞争”。我们将审慎置于速度和利润之上。

但在过去几个月,我确信要彻底解决风险,需更加审慎:主动控制前沿模型能力的跃迁节奏(pacing),为风险防范争取时间。必须放慢提升 AI 模型能力的速度。让我下定决心的主要有两件事:

第一,AI 技术迭代速度急剧加快。 从今年夏天开始,AI 构建下一代 AI 的能力日益增强,即“递归自我改进”(RSI)。若不加以约束,可能超出我们的理解和控制能力。

第二,OpenAI 与 Hugging Face 事件(OAI-HF)。 在该事件中,AI 智能体蜂群展现狂热集体行为:擅自发起无关网络攻击、为集体成功“自我牺牲”,甚至试图黑入评估系统。虽然此次无人受伤且损失微小,但若拥有更强能力的智能体蜂群出现类似失控,将引发灾难。鉴于 AI 发展速度,我担心 6 到 12 个月内,此类蜂群足以利用僵尸网络控制整个互联网,造成数千亿美元损失。这不仅是某家公司的失误,而是全行业的警钟。

因此,我提出“控制前沿节奏”的三步走计划:平衡构建速度,确保安全并收获益处,应对地缘政治困境。“控制节奏”并非停止研发,而是留出时间进行对齐、安全保障及第三方验证。

第一步:Anthropic 单方面承诺践行(呼吁各国政府要求其他公司执行);第二步:全行业协调配合;第三步:全球范围协同。具体步骤如下:

1. 常驻审查员(Embedded Evaluators):每家前沿 AI 公司承诺为第三方评估团队(如 METR)提供常态化、等同于内部员工的访问权限,核实安全实践、报告事件并评估全流程对齐情况。这是确保承诺具备“可验证性”的关键。Anthropic 目前已单方面承诺落实。

2. 民主国家协同:民主国家内的前沿 AI 公司建立统一安全标准,设定发展速度上限。这需要政府层面的支持以解决反垄断等法律挑战。

3. 全球协同美国与中国进行协调,严肃对待合规核查挑战。

为什么要控制节奏?

2023 年提出“暂停”意义不大,因为当时模型能力不足,无法作为智能体连贯行动,也不具备重大欺骗或攻击能力。那时的对齐研究如同在细菌身上研究人类心理学。

如今情况截然不同。现在的模型是巨大的宝藏,既能展示如何妥善构建 AI,也能揭示构建不当的后果。若能争取一到两年时间推进对齐研究,将大幅降低严重失控风险。协同的控速策略能让开发者完成关键工作,同时不牺牲商业优势或动摇美国的领先地位。

更平稳的节奏能让企业集中资源投入以下领域:

卓越的工程执行(Operational Excellence):训练和部署当今 AI 模型涉及数千人、数百万块芯片及复杂基础设施。许多问题源于执行差错,如强化学习环境数据过滤不彻底。通过稳健的节奏,可实现更高的工程水准,达到类似民用航空的零失误标准。

模型对齐(Alignment):我们在训练模型保持安全、符合伦理方面取得进展,但仍需努力。罕见且出乎意料的不良行为仍会出现。额外的时间有助于研究人员深入理解成因并开发更好的防范技术。

可解释性(Interpretability):理解 AI 内部运作机制的科学已取得巨大进展,如同针对 AI“大脑”的核磁共振。它能帮助我们看清特定行为背后的深层原因及隐蔽动机。集中力量改进此技术,有望在 1 到 2 年内取得突破。

测试与评估(Testing and Evaluation):随着模型能力提升,测试难度增加。更智能的模型更能欺骗测试。构建更广泛、精巧的评测工具库并结合可解释性分析,将在 1 到 2 年内取得大量进展。

第一步:常驻审查员

Anthropic 单方面承诺:引入常驻评估员,赋予其员工级别访问权限,核查安全实践并报告异常。

这是一项激进且核心的实践,具有以下优势:

可验证性(Verifiability):在最细微层面核实公司是否真正落实安全措施,消除模糊地带。

透明度(Transparency):改变由企业内部决定披露内容的局面,让公众知晓真实情况。

第二意见(Second Opinion):提供不受商业利益驱使的客观视角,指出员工未曾考虑的问题。

Anthropic 计划邀请外部审查团队常驻,提供工位、门禁、电脑及与内部风险评估团队相当的工具和系统权限。审查员有权发布关于风险水平、安全事件及访问权限的关键调查结果,仅在与安全敏感、法律特权或商业机密冲突时才可被狭义删减,且不能因结论不利而删减。

第二步:民主国家内部协同

一旦常驻审查员机制铺开,可核查的控速将更加可行。最有效的途径是通过监管法规涵盖不愿自愿合作的企业。同时,AI 公司应自愿协同制定标准。

鉴于立法耗时,建议在政府协助下迅速推进讨论。我最倾向于根据特定前沿 AI 系统的能力上限及其表现出的安全性来调节研发节奏。例如设立“检查点”:若模型具备能力 X,必须伴随对齐属性 Y 和 Z 的认证。

在民主国家内部控制节奏,受限于对威权政权的领先优势。若放慢幅度超过领先优势,将面临国家安全风险。因此,关键前提是扩大民主国家对威权国家的 AI 领先优势,措施包括:

1. 禁止向对手出售高性能 AI 芯片或制造设备,打击走私及远程访问。

2. 严厉打击未经授权的“模型蒸馏”行为。

3. 强化安全防护,严防模型权重被盗。

若执行得当,足以在未来 3 到 5 年内显著拉大领先优势。

第三步:全球协同,与中国合作

全球控速需与中国合作,但这极为困难。任何协议必须具备无懈可击的可验证性,或限制范围足够有限,确保单方面违约不会构成毁灭性威胁。

潜在合作协议按难度从低到高排列:

第一级:禁止利用 AI 制造生物武器等特定危险用途。极具可行性。

第二级:模型发布前针对网络安全、生物危害等急性风险进行强制测试。建立全球标准机构可行,但赋予约束力具挑战性。

第三级:对“递归自我改进”(RSI)速度设定上限。将迭代速率从“极速”降至“相对较快”,类比冷战时期《限制战略武器条约》。虽有难度但处于可能实现边缘。

第四级:全面控速甚至“暂停”。短期内很难落地,因违约诱惑巨大且核查门槛极高。

即使无法达成正式协议,改变非正式行业规范、分享信息也具有重要价值。

底线思维

我依然坚信 AI 能极大改善人类生活。但唯有以正确方式构建,益处才能落到实处。充分利用争取来的时间,采取异乎寻常的审慎态度把事情做对,是完全值得的。

技术进步依然迅速,我们可以利用这段时间推进可解释性科学,提升工程安全水准,打造更具信心的对齐模型。为了全人类的未来,我们有责任全力一试。

【声明】内容源于网络
0
0
AI寒武纪
1234
内容 734
粉丝 0
AI寒武纪 1234
总阅读14.0k
粉丝0
内容734