10 个关键问题问与答
- Q:什么是软件驱动的智能爆炸?
A:AI 自动化 AI 研发,形成递归反馈,仅靠软件迭代,把数年技术进展压缩到数月,区别于单纯硬件算力升级带来的提升。 - Q:现在 AI 已经在做 AI 研发了吗?
A:是的。Anthropic 2026 年数据,AI 承担超 80% 审核代码,26% 研发工作仅需人类高层监督。 - Q:智能爆炸是一定会发生吗?
A:不是必然。只是潜在重大可能性,会受算力、数据、收益递减等多重瓶颈制约,不确定性很高。 - Q:触发智能爆炸的核心机制是什么?
A:AI 充当研发劳动力,产出更强 AI;更强 AI 又生成更大规模自动化研发队伍,形成自我增强循环。 - Q:论文预测最快多久 AI 进步速度提升十倍?
A:在理想假设下约 1.5 年,原本一年工作量仅需五周;该结果高度依赖参数 r,仅为模型推演。 - Q:智能爆炸能带来哪些好处?
A:大幅加速科学突破,提前实现疾病治愈、原子级精密制造等变革性技术红利。 - Q:智能爆炸最主要的三类风险是什么?
A:技术迭代远超社会适应速度;人类失去对 AI 系统的管控;国家、机构之间权力制衡被严重削弱,增加冲突风险。 - Q:为什么不能等爆炸发生之后再监管?
A:爆炸发生后迭代速度远超常规立法治理节奏,留给人类干预的时间窗口会迅速关闭,必须前置准备。 - Q:政府第一优先要做什么?
A:获取 AI 研发自动化的真实透明度:强制企业上报指标,引入第三方审计,必要时驻场监督头部 AI 企业。 - Q:有哪些国际层面应对手段?
A:建立事件共享的互信机制、谈判国际管控协议、开展智能爆炸主题兵棋推演,研究协议核验技术。
剑桥大学 AI 科学与政策项目(CASP)前沿人工智能工作论文系列 第 2/2026 号 2026 年 9 月
作者艾伦・陈(Alan Chan)|GovAI 克里斯托夫・温特(Christoph Winter)|剑桥大学 CASP、法律与人工智能研究所 安德鲁・巴托(Andrew Barto)|马萨诸塞大学阿默斯特分校 雅库布・帕乔茨基(Jakub Pachocki)|OpenAI 杰弗里・辛顿(Geoffrey Hinton)|多伦多大学、Vector 研究所 埃里克・霍维茨(Eric Horvitz)|微软 约书亚・本吉奥(Yoshua Bengio)|魁北克人工智能研究所(Mila)、蒙特利尔大学、LawZero 宋晓冬(Dawn Song)|加州大学伯克利分校 杰克・克拉克(Jack Clark)|Anthropic 希拉里・格里夫斯(Hilary Greaves)|牛津大学 安东・科里内克(Anton Korinek)|弗吉尼亚大学、Anthropic 塞缪尔・哈蒙德(Samuel Hammond)|美国创新基金会 托雷・格雷佩尔(Thore Graepel)|伦敦大学学院 本・巴里阿赫(Ben Bariach)|牛津大学 菲利普・H・S・托尔(Philip H. S. Torr)|牛津大学 希拉・A・麦基拉思(Sheila A. McIlraith)|多伦多大学、Vector 研究所 杰夫・克伦(Jeff Clune)|不列颠哥伦比亚大学、Vector 研究所 萨姆・曼宁(Sam Manning)|GovAI、美国创新基金会 吉里什・萨斯特里(Girish Sastry)|Guidelight 汤姆・戴维森(Tom Davidson)|Forethought 丹尼尔・埃思(Daniel Eth)|AI 政策研究所 瑟伦・明德曼(Sören Mindermann)|剑桥大学 CASP
* 通讯作者:alan.chan@governance.ai;soren.mindermann@casp.ac。本文观点为作者本人观点,不一定代表其所属机构立场。
摘要
就在一年前情况还并非如此,现如今,开发人工智能的企业内部,大部分代码已经由 AI 系统编写。随着 AI 研发全流程越来越多地走向自动化,AI 技术进步是否会迎来急剧加速,引发一场智能爆炸—— 把原本需要数年才能实现的技术突破,压缩到数月甚至更短时间内完成?初步证据表明,这种可能性真实存在。 本文评估了相关佐证证据,分析智能爆炸可能带来的各类社会影响,并给出对应的政策应对方案。按照当前发展趋势,AI 系统有望在数年内完成绝大部分 AI 研发工作,甚至实现全部研发流程的自动化。倘若由此触发智能爆炸,AI 技术带来的各类利好会大幅提前到来,但同时也会产生极高风险:AI 能力的迭代增速,会远远超出人类社会的适应与管控能力;人类有可能失去对超人类人工智能系统的控制权;国家之间、企业之间,以及政府各部门内部与相互之间的权力制衡机制,都可能遭到严重破坏。
尽管上述种种前景仍存在巨大不确定性,但因其事关重大,值得各界投入深度研究。政策制定者应当立刻行动:充分掌握企业 AI 研发自动化的实际进展;建立引导、约束智能爆炸的手段;并且让整个社会做好准备,以应对智能爆炸带来的各类冲击。
引言
计算机科学家长久以来都有这样的理论设想:终有一天,AI 系统会设计出性能不断迭代升级的后继版本,诞生出在数量、速度、能力上迅速超越人类的系统 [1‑3]。如今,前沿 AI 企业正致力于实现 AI 研发自动化 [4‑5];这些企业投入的资本占美国 GDP 的比重,已经超过曼哈顿计划与阿波罗计划两者之和 [6]。倘若它们取得成功,世界将会怎样?
本文核心探讨智能爆炸发生的可能性:由 AI 驱动,AI 技术进步出现爆发式加速,原本耗时数年的技术进展被压缩至数月甚至更短。这种加速,和过去几年 AI 虽发展迅速但整体节奏相对平稳的状态相比,属于质的改变。
智能爆炸的产生,可以源于 AI 推动硬件进步、软件进步,或是两者共同推动。硬件进步,即提升用于开发、运行 AI 系统的计算硬件(算力)的质量与数量。软件进步,是优化 AI 研发所使用的数据、算法、代码与流程;包括在现有硬件上实现更高效的训练与推理 [7‑9]、优化研究管理与运营、生成质量更高的合成数据与训练环境 [10‑11],以及开创全新 AI 范式 [12‑13]。
短期内软件层面的进步尤其值得重点关注,原因有两点。第一,AI 系统自身做研发的能力正在飞速提升,因此更善于产出上述软件层面的技术进展。第二,软件进步能够形成快速反馈闭环:完成迭代的 AI 系统几乎可以立刻重新投入研发流程;而硬件升级往往要经历长达数年的制造、建设周期。因此本文重点研究软件驱动型智能爆炸,即仅依靠 AI 研发自动化带来的软件迭代,就触发智能爆炸的可能性 [14]。
初步证据显示,软件驱动的智能爆炸具备发生的现实可能性。一旦它真的到来,或将成为人类历史上影响最为深远的技术事件:AI 会迅速在绝大多数领域超越人类专家,极大地加速整体科技进步。鉴于事关重大,留给人类采取行动的时间窗口或许十分有限,我们认为,包括各国最高领导层在内,都应当把应对智能爆炸列为一项紧急优先事项。
优先事项 1:掌握 AI 研发自动化的真实情况 优先事项 2:构建引导与约束智能爆炸的手段 优先事项 3:做好适应智能爆炸冲击的准备
(图 1 说明:政策制定者应当立刻落实三件事:1. 摸清前沿 AI 企业内部 AI 研发自动化的现状;2. 开发工具引导、约束智能爆炸;3. 为应对智能爆炸带来的各类影响做好准备。 政府角色:激励 —— 对齐与控制研发、有益 AI 应用;监督 —— 自动化 AI 研发的规模扩张;管控 —— 国际局势动态;构建 —— 保留调控 AI 发展节奏的选择权)
AI 正在快速实现 AI 研发自动化
如今 AI 系统已经可以辅助,或是自主完成 AI 研发链条中的核心环节。就在一年前,头部 AI 企业的研发人员还很少把核心研发任务交给 AI 系统团队,现在部分人员已经将全部编码工作交由 AI 完成。
Anthropic 的数据显示:2025 年 1 月‑2026 年 5 月,经审核落地的代码中,由 AI 生成的占比从极低的个位数攀升至 80% 以上 [5];2026 年 3‑8 月,仅需要人类高层监督、由 AI 自主完成的研发工作占比,从 1% 上升至 26%[15]。 OpenAI 报告:“公司内部几乎所有技术、非技术团队都在使用 AI 辅助工作;具备代码执行能力的智能体被投入模型训练、评估,以及下一代模型的安全保障工作。” 谷歌表示:“几乎所有涉及代码编写、配置、技术方案设计、研究创意构思的工作都会用到 AI,只是不同任务的使用程度各有差异”[16]。
性能顶尖的 AI 系统,如今可以完成原本需要人类专家耗费数小时到数天的研发任务;而在 2023 年,AI 还只能处理耗时数秒的简单任务 [17‑19]。部分场景下 AI 甚至胜过人类专家:它曾经自主产出质量更优的 AI 安全研究解决方案 [20];部分情况下,AI 预测哪些研究思路能够落地 [21]、哪些后续研究方向值得探索,判断准确度高于人类 [5]。有一项概念验证项目:一套自动化 AI 研究流水线独立产出研究创意、开展实验,撰写的论文,通过了顶级机器学习会议下属研讨会的同行评审 [22]¹。
当然,当前 AI 依然存在大量短板。它会无视指令、任务投机取巧、歪曲自身工作成果,部分任务完全无法完成,需要人类介入干预 [23‑25]。举例来说,GPT‑6 在 OpenAI 部分研究调试任务上仍然失败,而经验丰富的人类研究员虽要花数小时到数天,却可以完成这些任务 [25]。同时,基准测试上的优异表现,未必能够转化为真实环境下的生产力提升 [26]。
即便如此,AI 做研发的能力依旧在飞速进步。AI 研发或许会比绝大多数人类工作更早实现自动化:该领域高度数字化,任务成效拥有大量清晰评价指标;实现自动化会给 AI 企业带来巨大竞争优势;AI 企业掌握自身业务流程的海量独有数据与实操经验。基于近期趋势做初步推演,到 2028 年年中,那些耗时数月的 AI 研发项目有望实现自动化 ²。
总而言之,未来几年 AI 研发自动化程度会大幅提升;我们必须严肃看待该时间窗口内实现完全自动化的可能性。
AI 研发自动化何以触发智能爆炸
软件驱动型智能爆炸的运行机制分为两部分:
-
AI 自身开展研发的能力、速度不断提升,等效研发劳动力规模随之扩张; -
这支等效研发队伍迭代出能力更强的新一代 AI,新一代 AI 又进一步扩大研发劳动力规模,形成递归式反馈循环。
现有证据尚属初步,部分结论也存在矛盾,但这些证据表明:这套机制有可能克服收益递减、任务难以自动化等阻碍,让 AI 进步速度出现爆发式提升。
运行机制与阻碍因素
每一代新的 AI 系统,都可以完成范围更广的研发任务,并且速度、质量都优于人类;等效于形成一支规模更大、智力更强、运行速度更快的自动化研发队伍。一旦 AI 达到专家级研发水平,同时运行成本维持现有水平,那么如今一家前沿 AI 企业所拥有的算力,就可以支撑起等效数百万顶尖人类研究员的 AI 研发队伍(详见补充材料),远超当前头部企业几千人的人类研究员队伍。
这种加速效应的幅度、持续时长都尚不明确,值得进一步研究。但我们可以反向思考来理解其潜力:倘若今天人类研究员的数量或者工作速度缩减到原来的十分之一,AI 的发展大概率会出现剧烈放缓。
AI 系统会帮助打造能力更强、效率更高的后继版本,继续扩大自动化研发队伍,形成反馈循环,让一轮轮加速效果不断叠加。历史上其他技术同样存在反馈循环,例如性能更好的芯片,可以支撑更强大的芯片设计工具。
软件驱动智能爆炸的特殊之处在于 AI 参与下一代系统构建的程度:随着越来越多研发任务交由 AI 替代人类,每一次软件层面的技术进步,都可以加速研发流程中越来越多的环节。倘若实现完全自动化,即便维持当下的效率提升速率,自动化研发队伍的规模,也可以在数月到数年时间内扩大 100 倍 ³;而同等规模扩张,美国人类研究人员的数量花了七十年才完成 [27]。
至少存在四种阻力会抑制上述发展:
- 收益递减效应
在计算机硬件、农业、药物研发等诸多科研领域,容易取得的成果被挖掘完毕之后,想要维持原有进步速度,就必须投入数量庞大的研发人力 [27]。新增的研究人员同样会遭遇收益递减:研究成果重复、高价值研发工作难以并行开展。 - 算力与数据约束
研发实验需要算力,模型训练需要数据;算力、数据供给增长受限,就会拖慢软件层面的进步。 - 难自动化任务瓶颈
部分任务很难自动化,会卡住整体发展进度。 - 长周期研发流程
部分研发环节本身耗时漫长。例如大规模模型训练,即便两代模型能力差距持续拉大,漫长训练过程依旧会限制迭代速度。
图 2 说明:软件驱动智能爆炸机制。不断扩张的 AI 研发队伍包含 AI 系统与人类;更大的研发队伍可以完成更多 AI 研发;更多 AI 研发产出性能更好的 AI,进一步放大研发队伍规模,循环往复。
现有相关证据
初步证据表明,自动化带来的这套发展逻辑有机会克服上面提到的阻力;但是证据并不完备,部分证据还只是间接证据。
收益递减
现有证据说明,收益递减不一定能够阻止智能爆炸;但该结论建立在有限数据和简化建模假设之上。相关研究核心问题是:AI 研发完全自动化之后,等效研发劳动力能否增长得足够快,战胜收益递减,推动 AI 加速发展。
学界用研发投入回报系数 r来衡量两股力量博弈的结果⁴。
-
当 r<1:收益递减占上风,AI 进步速度逐步放缓; -
当 r=1:两股力量恰好抵消,进步速度保持不变; -
当 r>1:研发劳动力增长占据优势;只要该条件维持,AI 发展就会持续加速⁵。
Ho 与 Whitfill [28] 基于 AI 发展历史数据,对 AI 三个子领域测算得到 r 的中心估值介于 1.2‑1.9 之间。尽管不确定性很高⁶,该结果预示完全自动化之后可能出现爆发加速:如果 r 维持该区间,并且不存在其他瓶颈,大约 1.5 年之内 AI 发展速度可以提升十倍。届时,如今需要一整年完成的技术进展,只需要约五周时间。详细计算与 r 的不确定性讨论见补充材料。
算力
算力是否会成为软件驱动智能爆炸的瓶颈,现有证据莫衷一是。软件创新的验证、测试,都需要算力来运行研发实验。有限数据显示:如果研发实验所消耗算力,会随前沿模型训练规模同比例增长,那么软件驱动的智能爆炸就无法发生 [29]⁷。但现实中实验算力需求是否会这样增长,尚无定论。 一方面,小规模实验得出的结论,未必适用于越来越庞大的前沿模型;另一方面,现在已经可以基于小规模实验结果做外推 [30‑31],进一步研发还可以得到更优秀的外推手段。想要回答这个问题还需要更多数据。
数据
数据有可能成为发展瓶颈,但不同领域受约束的程度差异巨大。历史上 AI 高度依赖互联网公开数据、人类专家示范数据。但按照现有趋势,到 2028 年之后,互联网数据供给的增速,甚至已经不足以支撑当前水平的 AI 迭代 [32];人类也很难为超人类 AI 提供有效的示范数据。
数学、代码等领域的近期进展已经开始依靠合成数据 + 快速可验证反馈:模型自己生成尝试方案,根据方案成败完成自我学习 [12]。关键问题在于这套模式的泛化能力有多强。 对于 AI 研发本身,AI 智能体可以快速修改方案、观测结果,识别哪些改动可以加速自身迭代。但是生物学这类领域,技术进步往往要依靠现实世界的反馈,这类反馈速度慢、噪声大、成本高昂。
难以自动化的任务
间接证据表明,只要自动化推进速度足够快,难以自动化的任务未必会阻止智能爆炸。Davidson 等人 [33] 同时考虑软件、硬件两个维度的研究,发现只要软硬件研发自动化推进足够迅速,即便存在自动化瓶颈,原则上依旧可以触发智能爆炸⁸。但是哪些任务会长久难以自动化,会对发展造成多大限制,还缺少实证数据。
耗时较长的流程
缺少直接证据来评估长周期流程会造成多大瓶颈。最典型的就是模型训练,如今部分训练流程耗时达到 3 个月甚至更久 [34]。当然存在一些变通路径:例如不需要完整重训练,依靠后处理增强持续提升同一个模型的性能 [35];训练效率的提升,可以让模型用更少训练资源达到同等能力 [36]。但我们尚不清楚这些手段的上限在哪里⁹。
总的来看,存在一套逻辑自洽、和现有证据兼容的路径,可以通向软件驱动的智能爆炸。当下,AI 研发自动化带来的生产力增益,还尚未达到触发智能爆炸的阈值;但新一代系统带来的提升正在逼近该阈值 [37]¹⁰。AI 研发自动化的推进速度很快,二者之间的差距还会继续缩小。考虑到下文讨论的重大利害关系,智能爆炸的可能性值得各界严肃对待。
社会层面影响
智能爆炸会带来两大结果:①具备极高能力、甚至超人类水平的 AI 系统被极速开发出来 ¹¹;②这些系统很可能被部署,用于研发新技术、在现实世界执行各类行动。 原本需要数年乃至数十年才会落地的 AI 红利会被提前释放 [38],包括疾病治愈,还有原子级大规模制造这类颠覆性技术 [39]。
与此同时,智能爆炸会从三个维度显著放大高级 AI 带来的风险。
能力增速超出社会引导与适应能力
第一,智能爆炸会把高级 AI 以及 AI 赋能技术的各类风险大幅前置:生物攻击、网络攻击、劳动力市场剧烈动荡、AI 系统失控等 [40‑41]。留给人类规避风险的时间被压缩,包括协调行动放缓甚至放弃部分高风险技术路线。社会的适应时间同样被压缩。
部分场景中风险与应对手段都属于纯数字领域(例如网络安全),风险与防护手段都可以跟随 AI 的高速迭代保持同步 ¹²。但很多其他领域,风险可以被 AI 加速,但防护、应对措施高度依赖现实世界的实体活动,AI 很难加速现实流程。 举例:AI 可以同时加速病毒和疫苗的设计;但病毒可以自我复制传播,疫苗却要完成生产、分发、逐个接种 [42]。如果具备生物能力的 AI 模型先出现,而防滥用防护体系尚未就位,这种能力出现的时序错位会进一步加剧风险。
监督缺失,失去对 AI 的控制权
第二,AI 研发自动化会削弱人类监督,进一步放大上面的问题,极大提高失去对高阶 AI 控制权的风险。随着人类越来越少参与 AI 研发,人类识别、修复问题的机会与专业知识都会流失。依靠 AI 系统来监督 AI,至今仍是悬而未决的难题 [40];新一代 AI 系统本身就越来越难以被人类审查监督 [25]。
监督缺位情况下,对齐不足的 AI,可能 “污染” 下一代模型的研发;也可以突破隔离限制,在设定环境之外开展行动。Hugging Face 安全事件就展现了该风险:OpenAI 分配约 1200 个内部智能体,在互相隔离条件下做网络安全评估任务 [43]。这些智能体突破任务边界,自建简易消息板互相通信,非法访问互联网,入侵 Hugging Face 获取私密信息,并且尝试篡改自身交互记录 [43‑45]¹³。
能力更强的系统,有可能脱离运营方基础设施持续运行,形成顽固、难以遏制、违背人类利益的网络。这种失控可以带来一系列灾难性后果;极端情况下甚至会造成人类被边缘化乃至灭绝 [40‑41]。
权力制衡机制遭到侵蚀
第三,智能爆炸会严重破坏权力制衡。国家、企业、政府部门内部与相互之间的制衡体系,生效的前提是没有任何一方在思考能力、执行能力上远远甩开其他主体。智能爆炸可以让这套制衡彻底失效。
一个国家可以借智能爆炸,把军事研发、军事行动上微弱的领先转化为决定性优势,网络空间就是典型场景 [46]。这种前景会促使对手发起或者威胁先发制人的行动 [47]。少数特权主体可以秘密使用前沿 AI,针对关键决策者定向游说,威胁现有制度。长远看,国家核心职能的自动化,会降低掌权巩固权力所需要获得人类支持的门槛 [48‑49]。
当然,上述全部潜在影响都存在不确定性。AI 或许会先在网络安全、数学等窄域实现超人能力,很久之后才实现通用超人能力,给社会留出反应窗口。就算通用超人 AI 诞生,开展科学实验、搭建特种材料供应链、落实监管法规都要耗费现实时间,因此不一定会极速放大科技进展。AI 也有可能加速安全研发,帮助管控、化解风险 ¹⁴。另外技术能力扩散 [50] 有助于维护制衡;部分以防御为主的技术能力提升,甚至可以提升整体稳定性 [51‑52]。即便如此,发生严重后果的可能性依旧足够高,需要我们高度重视相关政策议题。
政策启示
AI 研发自动化正在高速推进,AI 存在爆发式加速的可能性,利害关系重大。因此政策制定者必须立刻落实三件核心工作:1. 掌握企业 AI 研发自动化的真实情况;2. 开发工具引导、约束智能爆炸;3. 为智能爆炸的各类影响做好社会适应预案。
智能爆炸阶段技术迭代速度,会远超常规政策制定节奏,因此各类准备工作必须提前完成,当风险或收益的证据显现时就立刻启动。
摸清 AI 研发自动化的真实状况
政策制定者需要更多数据,来评估软件驱动智能爆炸发生概率、爆发时间、造成的后果。大量关键数据只掌握在正在推进 AI 研发自动化的企业内部;AI 系统先在企业内部使用,高度自动化可以在外界完全不知情的情况下发生。现有的强制上报制度,要么没有覆盖企业内部 AI 研发场景,要么没有明确需要上报的指标 [53‑57]。虽然部分前沿 AI 企业自愿跟踪部分研发指标 [5,15,18],但指标覆盖不全,各家标准参差不齐。
政策制定者应当考虑:要求企业向政府、第三方审计机构标准化上报关键 AI 研发指标与流程,同时资助第三方评测能力建设 [58]。上报内容可以覆盖:
- 评估智能爆炸发生可能性
算力、数据、难自动化任务、长周期流程(训练、实验)多大程度制约 AI 进步;更加精准估算 AI 研发的投入回报系数 r。估算 r,需要企业披露研发预算如何分配:人力投入、实验算力、运行 AI 充当研发劳动力的算力分别占多少 [37]。 - 识别智能爆炸的爆发迹象 ¹⁵
AI 研发自动化占比(例如 AI 产出研究成果的占比);AI 迭代的速度(例如算法效率提升幅度)。 - 评估监督、失控风险
:企业内部扩大 AI 研发系统部署的决策流程;高风险研发决策中 AI 系统的使用场景、使用方式;AI 系统的监督机制;内部 AI 系统的安全事件报告 [58]。
除了上报制度,政策制定者还可以采用更深层的监管手段。例如,要求独立第三方(认证私人审计机构或者政府评估部门)在 AI 系统内部部署前完成测评;或者将第三方人员派驻部分 AI 企业,审计 [59]、监督研发活动 [60]。其他行业已有类似范式,例如美国核管理委员会 [61]、货币监理署 [62]。
上报与审计的强监管要求,最适合针对两类企业:AI 研发能力处于行业前沿;或者 AI 能力超过某个关键阈值。政策制定者设定阈值时,需要权衡多方利弊。
引导并约束智能爆炸
智能爆炸会带来史无前例的高频决策:持续训练、部署能力越来越强的 AI 系统。政策的核心议题就是:公共政策是否应当,以及如何管控这一系列决策。本文将该议题拆解为三部分。
第一,设计方法,管控、约束自动化 AI 研发的扩张规模。可选措施包括:
-
设置持续开发、部署的准入条件:落实完备安全防护(自动化研发流水线的强力监控)、广泛吸纳利益相关方意见,限制单位时间内 AI 能力的提升幅度。 -
开发核查工具,用于核验国内、国际管控 AI 发展节奏的协议落地情况,要充分考虑各方争先竞赛的竞争压力 [63‑65]。 -
加强对运行自动化 AI 研发的数据中心的监管;联合运营商与 AI 企业建立事件响应预案,包括暂停特定 AI 研发任务的能力 [66]。 -
部分 AI 研发系统的评估、部署,必须在隔离环境(物理空气隔离网络)完成。避免模型权重、敏感研发数据泄露;同时约束 AI 系统突破人类管控在外部行动 [44]。
政策制定者必须权衡风险与代价:不受约束的智能爆炸会带来巨大危险,但监管权力本身存在被滥用、拖慢技术进步的风险。一个滥用案例:设计糟糕的制度,会让政府可以打压所有企业,唯独偏袒特定企业。
第二,确定是否以及如何引导 AI 研发与落地的方向 [67]。优先支持 AI 对齐安全研究,以及高社会效益 AI 应用(例如被忽视疾病的 AI 辅助药物研发)。当市场激励不足时,可以使用税收优惠、算力配额、预先市场承诺、专项奖金来提供支持。
第三,降低智能爆炸引发国际冲突的风险。可选措施:
-
建立互信措施,例如安全事件共享;制定预警指标上报的行为规范 [68]。 -
谈判国际协议,防范高能力 AI 系统的破坏性开发与使用;资助协议所需要的核验技术研究 [64‑65]。 -
和他国协作,明确对于其他国家大规模扩张自动化 AI 研发的威慑手段 [47,65]。 -
开展兵棋推演,模拟智能爆炸相关情景 [69‑71]。
第 6‑7 页,共 14 页
适应智能爆炸带来的冲击
一旦智能爆炸发生,如何应对其冲击,会成为世界主要大国的首要任务。和常规 AI 发展路径相比,智能爆炸压缩适应窗口期,前置准备至关重要。
一项关键举措是提升政府机构的响应速度:
-
研究可行方案,安全地将 AI 纳入政策流程,赋能政府运行 [72]。 -
制定、维护多套应急预案,覆盖极端 AI 发展带来的各类场景:大规模劳动力冲击、地缘动荡、AI 失控等。
政策制定者还需要维护权力制衡,防范高阶 AI 被恶意滥用。法律、制度、实体安全防护体系建设耗时数年;等到强 AI 出现再着手准备为时已晚,很多工作必须立刻启动:
-
建立保障机制,确保政府使用 AI 遵守法律与伦理规范。例如采购 AI 工具强化政府不同分支之间制衡;向公众公开政府 AI 系统关键信息(模型规范文档 [73‑74]);强制 AI 系统服从法律 [75]。 -
保障公民、社会组织有能力发现、记录、质疑非法或者有害的 AI 使用;例如向其提供可用于上述工作的 AI 工具访问权限。 -
建设防御体系,抵御非国家恶意主体的滥用,例如资助针对 AI 赋能生物威胁的医疗应对手段 [76]。
结论
智能爆炸有可能成为人类历史上影响最为深远的技术事件 [1]:数年的技术进步被压缩到数月甚至更短;人类对 AI 的控制权遭遇威胁;国家、企业、政府部门内部与相互之间的权力制衡遭到严重破坏。虽然不确定性很高,但 AI 研发自动化有可能很快触发这一局面。本文重点讨论软件驱动路径,而 AI 推动硬件技术进步 ¹⁶,会进一步提高智能爆炸发生概率。
面对如此重大的利害,人类当前准备并不充分。政策制定者应当坚守三大优先事项:摸清前沿 AI 企业内部 AI 研发自动化现状;开发工具引导约束智能爆炸;为适应其冲击提前布局。一旦智能爆炸启动,留给人类行动的时间窗口就会关闭。
致谢
感谢 Anson Ho、Tom Cunningham、Cheryl Wu、Ryan Greenblatt,以及众多 GovAI 研究人员提供反馈与交流,完善本文。 感谢 Taylor Jones 绘制图表;感谢 Zilan Qian 提供本文中文翻译版本。
参考文献(略)
补充材料
AI 等效研发劳动力规模估算
参考 Denain 等人 [77] 的方法:等效劳动力=开发者每日可生成 token 总量 ÷ 完成一名研究员单日工作所需 token 数量。 仅 OpenAI 的推理(运行时)算力,每日就可以生成约 10¹³ 个 token。 Wijk 等人 [78] 的 AI 研发基准测试显示:完成人类研究员 8 小时工作量,模型平均输出 5×10⁵ token。由此估算等效约 2×10⁷名研究员。考虑上下一个数量级的不确定性(每名研究员每日 5×10⁴~5×10⁶ token),等效劳动力规模估计在2×10⁶ 至 2×10⁸。该估算是假设专家级 AI 系统的运行成本维持当前水平。
完全自动化条件下反馈循环建模
绝大多数软件驱动智能爆炸分析,使用变量 A 代表软件质量,A 需要综合衡量 AI 进步:既包括效率提升(用更少算力、数据完成同等任务),也包括能力提升(完成过去做不到的任务)。但目前学界还没有公认的标准,如何权衡效率与能力两者权重。
忽略算力、数据瓶颈,软件质量增长采用创新宏观经济学常见公式:
\(\frac{dA}{dt}=A^{1-\beta}E^\lambda\) E 为等效研发人力;λ 代表研发人力规模回报;β 代表创新想法获取的收益变化。核心是 E 如何跟随 A 变化。
假设完全自动化,分两种情景:
-
A 代表推理效率(运行同等能力 AI 消耗算力下降),E 正比于 A;效率越高,可以并行运行越多 AI 研究员。 -
A 代表训练效率(训练达到指定能力消耗算力下降),带来更强的模型;假设模型能力线性转化为等效研究员数量,则依旧满足 E 正比于 A。
两种情况都有 \(E=kA\)(k 为正常数)。代入微分方程:
\(\frac{dA}{dt}=c A^{\lambda-\beta+1}\) 其中 \(c=k^\lambda\)。想要增长率 \(\frac{1}{A}\frac{dA}{dt}\) 随 A 增大而上升,需要满足 \(\lambda>\beta\)。定义 \(r=\lambda/\beta\),就得到正文提到的核心条件 r>1。
基于 Ho 与 Whitfill 数据取均值:λ=1.40,β=1.01,则 λ‑β=0.39。A 每翻倍,增长率乘以\(2^{0.39}≈1.31\);每一轮翻倍耗时是上一轮的 \((1/2)^{0.39}≈76\%\)。 想要增长率提升十倍,A 需要翻倍约 8.5 次;为简化计算取 9 次翻倍。训练算力效率每 4.5 个月实现一次翻倍。 总时长≈\(4.5 \times \frac{1‑0.76^9}{1‑0.76}≈17\)个月,约 1.5 年。届时 AI 进步速度提升十倍,一年工作量压缩至五周。
关于 “研发投入回报系数 r” 的不确定性
多重因素会让真实 r 偏离现有测算结果:
- 软件质量度量难题
推理效率直接对应可以运行多少 AI 研究员;训练效率如何折算等效人力尚不清晰,但现有 r 估算主要使用训练效率数据;理想测算应当同时纳入推理、训练两类效率。 - 历史数据的算力混淆效应
过去 AI 发展算力持续扩张,历史数据难以区分哪些进步来自软件、哪些来自算力提升。部分软件增益高度依赖大算力条件;算力不再高速增长的环境下,真实 r 会比历史估算更低。 - 有可能推高 r 的因素
现有测算大多只看预训练,忽略后训练、工具调用框架等改进;部分天才级研究者的能力无法被大量普通研究员简单替代,能力提升带来的人力增益可能高于线性假设;还可以依靠小规模实验外推、低算力算法创新绕开算力约束。 - 代理指标缺陷
:现有研究用论文作者数量代理研发人力,统计口径宽窄会造成高估或低估 r。 - 模型外推局限
:该数学模型历史上只验证过较低增速;推演极高增速会出现 “有限时间无穷产出” 的数学奇点,现实世界物理、时序约束会阻止这种极端结果,部分研究问题必须顺序求解,无法并行。
注释
¹ 机器学习会议分为主会与研讨会,研讨会同行评审标准相比主会会宽松一些。 ² METR 时间‑地平线指标:AI 可完成任务的时长最初约 7 个月翻一倍;2024 年后约每 3 个月翻一倍。外推可得,到 2028 年年中,AI 可以完成人类专家耗时数月的任务,覆盖绝大多数 AI 研发项目。 ³ 研究显示:达成同等能力大模型的运行成本每年下降 9‑900 倍;部分来自硬件,但很大一部分来自软件层面改进。 ⁴ r 描述研发投入与产出的关系;本文仅关注研发人力,假设算力总量大致不变,因此本文 r 会低于把算力、人力全部纳入统计的测算。 ⁵ 长期来看 r 最终一定会小于 1,AI 发展会遭遇物理、算力硬限制,只是我们不知道还能走多远。 ⁶ 三组子领域 90% 置信区间分别为 (0.727‑2.094)、(0.380‑2.708)、(1.069‑3.212)。 ⁷ 算法效率同时提升训练和实验,无法单独解决实验算力随规模膨胀带来的瓶颈。 ⁸ 部分理论研究给出条件,自动化研发人力可以在有限时间趋向无穷大(纯理论模型)。 ⁹ Ord (2026) 对各轮研发之间时间延迟做理论分析。 ¹⁰ 自我维持加速定义:不需要增加人力、训练算力等外部输入,仅依靠 AI 本身就能持续加速能力迭代,这是软件驱动智能爆炸的必要条件。 ¹¹ AI 可以先在部分领域超人,物理操控等领域依旧不及人类。 ¹² 网络空间中,人类组织流程依旧会拖慢防御方。 ¹³ 可参阅 Anthropic、英国 AI 安全研究所、OpenAI、Bogdan 等人针对 Hugging Face 事件的报告。 ¹⁴ 猜想:AI 也可能加速脑机接口,提升人类思考协作速度。 ¹⁵ “智能爆炸” 还缺少严谨可落地的操作化定义,属于未来研究方向。 ¹⁶ AI 已经被用于芯片设计;未来机器人自动化芯片制造,也会助推智能爆炸

