10 个关键问题 Q&A
-
Q:Matt 为什么发起九圈振幅这个 AI 挑战? A:他想亲眼验证 LLM 能否用学术级低成本算力攻克理论物理前沿难题,用来判断 AI 科研能力,而非单纯看 AI 在数学上的新猜想。 -
Q:N=4 超杨 - 米尔斯是什么,为什么选择它作为 “玩具模型”? A:是高度对称的量子场论,不描述现实宇宙;但粒子抵消效应简化计算,适合测试振幅计算新方法。 -
Q:什么是散射振幅与圈阶,圈数越高代表什么? A:散射振幅计算粒子碰撞反应概率;圈代表量子修正阶数,圈数越高计算复杂度爆炸式上升。 -
Q:在 Claude 算出九圈之前,人类进展到哪一步? A:人类完成八圈振幅;学界普遍认为九圈振幅很难直接求解,计划迂回通过形状因子分步推导。 -
Q:Anthropic 是如何让 Claude 完成九圈计算的? A:使用 Claude Science 调度框架,给基础任务提示词,指令模型持续推进;用两种独立方法交叉验证结果。 -
Q:本次计算的算力和成本是什么水平? A:96 核 CPU 运行一周;自举路线仅约 100 美元,完整方案总成本约 1000–2000 美元,普通科研人员可负担。 -
Q:Claude 这次是否提出了全新物理理论或者计算方法? A:没有,完全复用人类多年发展的自举法与形状因子对偶理论,只是自主编写代码、执行整套复杂流程。 -
Q:同期人类团队进展如何? A:中科院何颂团队借助 GPT-6 辅助,算出九圈振幅的符号部分,整体框架仍由人类主导。 -
Q:Lance Dixon(领域权威)如何看待被 AI 抢先算出结果? A:并不沮丧。AI 验证了他们多年的理论;但真正颠覆性时刻是 AI 自主提出新物理原理,而不只是执行已有方案。 -
Q:这个实验能证明超级智能相关猜想正确吗? A:不能。它证明 AI 可以低成本执行复杂前沿计算,但没有回答超级智能、新型风险这类长期争论。
2026 年 9 月 25 日
在这篇客座文章中,物理学家、科学作家马特・冯・希佩尔(Matt von Hippel)分享了他向多家 AI 企业发起一项挑战后的故事:题目来自他曾经深耕的理论物理子领域。
你很少会提出一项挑战,短短一个月后就看到有人攻克它。但我们正处在一个非同寻常的时代。
先做个自我介绍:我是马特・冯・希佩尔,曾经是一名理论物理学家,如今是科学作家。一直以来我都坚持写博客,在 https://4gravitons.com/ 每周更新,主题围绕物理学以及做物理研究的人。
写物理博客,越来越多地变成写 AI 博客。这有点麻烦,因为我绝非 AI 领域专家。当然,我读过相关论文,也看过 arXiv 上 2502.05121 这篇文章。我的了解程度大概率比家里长辈要强。但大多数时候,我只能选择退后一步,信赖领域专家。令人沮丧的是,专家们的观点本身就相互矛盾!我听过不少学识渊博、思路清晰的人断言:距离超级智能只剩数年,而超级智能能够做出真正骇人之事。我也听过另一群同样睿智、消息灵通的学者持完全相反的看法:基于大语言模型的 AI 已经接近能力天花板;像 Claude 这类模型,甚至无法完成有分量的物理研究,更谈不上征服世界。
我一直不愿做出自己的预测。在形成观点前,我希望亲眼看到大语言模型在一个我熟悉的方向取得进展 —— 这件事很难,因为我自己也曾尝试过同类工作。
除此之外,我希望看到 AI 攻克计算层面本身就很难的问题。毫无疑问,大模型在数学领域取得了令人瞩目的突破,《量子杂志》那篇 AI 攻克千禧年百万奖金数学难题的报道,大概率已经改变了很多人的想法。但数学上的突破来自全新思想,而思想本身难以衡量难度:在找到答案之前,没人能说清找到这个想法到底有多难。计算复杂度则要实在得多。我想让大模型挑战这样一类难题:不是因为研究者原则上不知道怎么解,而是求解需要远超科研人员可获得的算力与时间。我想验证这些研究者的判断是否错了:一个更聪明的人工研究者,使用同等规模的算力,是否依然能解决该问题。
于是,我发布了这篇博文:https://4gravitons.com/2026/08/07/it-only-counts-when-ai-gets-to-my-field/
“如果 AI 公司想打动像我这样的人(或是震慑我们),就必须进军我曾经的研究领域。证明 AI 可以只用普通学术研究者可获取的算力资源,解决散射振幅领域悬而未决的重大难题。证明所有人都认定的计算瓶颈其实根本不是障碍。给我们算出 N=8 超引力的七圈结果,或是 N=4 超杨 - 米尔斯理论的九圈结果。”
简单来说:AI 能不能解决我曾经深耕的理论粒子物理前沿问题?并且只用有限的算力预算完成?
这项挑战
我曾经的研究方向是理论粒子物理的一个分支,名叫振幅学(amplitudeology)。粒子物理学家预言新粒子时,需要完成计算来验证预言。他们求解被称为散射振幅的公式,依靠亚原子粒子的动量与能量,计算粒子发生特定反应的概率。如果物理学家能更精确地预测这类反应,就可以检验大型强子对撞机这类实验结果是否匹配理论预言。一旦出现偏差,就可能指向新理论,有望解释物理学诸多悬而未决的谜题:比如暗物质本质,或是宇宙正反物质不对称问题。
散射振幅公式的计算难度极高,物理学家几乎都采用近似方案:做截断计算,只算到特定的圈(loop)阶数,圈数代表粒子间相互作用允许的复杂程度。计算纳入的圈数越多,结果就越贴近真实值,但计算量也会急剧攀升。
现实中,绝大多数散射振幅公式只完成了两圈计算,少数做到三圈(参考维基百科电子反常磁矩词条)。振幅学家希望更进一步,他们开发全新实验性计算技巧,在特殊 “玩具模型” 理论上做测试。在相对简单的玩具模型上测试新方法,而非直接处理真实世界复杂粒子,研究者就能对新算法做压力测试,检验方法的极限。
我针对两个这类玩具模型提出挑战。Anthropic 团队选择攻克的题目,是特定玩具模型理论 ——N=4 超杨 - 米尔斯理论的九圈振幅。
“杨 - 米尔斯” 是一类理论的专业名称,我们身边大部分物理现象都可以由它描述。自然界四种基本相互作用里,电磁力、把原子核束缚在一起的强核力、导致香蕉这类物质发生放射性衰变的弱核力,三者都属于杨 - 米尔斯理论。
“N=4 超” 来自超对称。物理学家猜想,每种粒子都存在一个 “超对称伴子”:电荷相同,但粒子类型不同,物质粒子(如电子)对应传播力的规范粒子(如光子)。曾经学界乐观地认为,这些粒子可以借助已知粒子的未知伴子解释暗物质,这类猜想采用的是 N=1 超对称。而 N=4 理论中,每个粒子拥有四个超对称伴子,而不是一个。
如此多的伴子,让这个理论本身并不贴合现实。N=4 超杨 - 米尔斯理论并不用来解释暗物质(参考 Ars Technica 文章:靠研究一个明知是错的理论拿到博士学位)。但矛盾的是,它的计算反而更加简单,因此振幅学家拿它打磨计算技术。不同粒子之间精巧的抵消关系,使得计算只需要处理特定变量组合,大幅简化运算。
我博士阶段的工作就是协助完成三圈振幅计算,在精力衰减前,还见证了七圈的计算成果。SLAC 国家加速器实验室的兰斯・迪克森(Lance Dixon)教授是该方向最早的研究者之一,几年前他完成了八圈相关工作(arXiv:2308.08199)。
这类计算依靠一种叫做自举法(bootstrap)的实验技术,而该技术恰好极其适配 AI。用自举法求解振幅,不需要枚举所有粒子相互作用。你只需要大致预判答案的形式,用一套特殊符号,在计算机文件中记录所有可能解。随后逐一核验各类约束:其他计算方法给出的预言、答案必须满足的物理规则、关联到更容易求解的同类问题。有点像数独:一开始格子里填满所有候选数字,随后不断排除不可能选项。最终目标是,仅有唯一解满足全部约束,同时保留足够校验项,保证没有计算错误。
这就意味着,兰斯早已准备好一套校验方案:只要有人把九圈振幅公式交给他,他就能核验真伪。这个结果意义重大,不仅验证自举方法本身,也是极少达到这么高圈复杂度的振幅,其本身就值得深入研究。
但他本人,以及领域内其他人,都还没有算出九圈结果。当年他得到八圈答案的途径已经比较迂回:借助一种对偶关系,转化为另一类相关量形状因子(form-factor),这是一类部分振幅,描述不同粒子,计算难度略低。他原本预计,想要得到更高一圈结果,会需要更加迂回的手段,甚至可能依赖某种 AI 方法。如果直接沿用常规自举算法就能再多算一圈,早就有人完成了。
然后,他们做到了
显然,Anthropic 有研究员读过我的博客。
8 月底,Anthropic 的两位物理学家利亚姆・菲茨帕特里克(Liam Fitzpatrick)与悉达特・米什拉 - 沙玛(Siddharth Mishra-Sharma)联系到我,告知他们攻克了我博文里提出的其中一项挑战。在兰斯核验结果之后,他们向我讲解了完整实现过程。
完全符合挑战设定:他们没有耗费数百万美元算力。使用 Fable 5.1,依托 Claude Science 平台(付费科研平台)。业内所说的 Claude Science,是一套调度框架(harness):在结构化规则与提示词加持下调用 Claude 大模型,输出更可靠、更适配科研场景的结果。
据介绍,他们先让 Claude 评估哪道题目最有可能被攻克,随后给出一句简单提示词:
“问题:计算平面 N=4 超杨 - 米尔斯理论六粒子(六边形)九圈 MHV 振幅。”
在此之后,他们持续下达指令,例如:
“我要去休息,接下来数小时无法操作。持续推进这项计算,直到我叫停。每 4–6 小时给我一次进展更新。”
最终 Claude 用两种独立路径完成计算:经典自举法,以及迂回的形状因子对偶方案。无论哪一种,终端用户的成本大约 1000–2000 美元,大部分开销来自长时间运行 Claude。其中自举计算采用 Python 与 SymPy 符号包,仅花费约 100 美元,对应 96 核 CPU 连续运行一周。
放在十年前我做这类研究的时候,96 核跑一周算是不小的资源;但现在只要理由充分,这笔开销完全负担得起。
事实证明,人类距离这个结果其实也不远。Anthropic 消息传来几天后,北京中科院振幅学家何颂(Song He)团队也传来消息:他们已经算出结果的主体部分。他们借助 GPT-6 提供 AI 辅助,但并不是 Anthropic 这种近乎无人干预、一次性跑完的方案。
各方交流氛围都很友好,这点让人松了一口气。兰斯、何颂以及合作者这些人类研究者,会负责正式发表论文,详细阐释、分析结果,留给后续学者参考。Claude 的任务到此暂告一段落。
问题就此解决?
我发起这项挑战,本意是更好地理解当下 AI 的能力边界,以及未来的发展方向。那么我学到了什么?
我原本期待见证 AI 以出人意料的方式突破计算壁垒。但实际情况是:AI 做到的这件事,人类同样可以完成。Claude 使用的都是已知方法,算力投入比前人略高。选择 Python 而非兰斯偏好的 Maple,或是我习惯用的 Mathematica,或许带来一定优势;它的软件工程实践比我们人类做得更好,但并非依靠某种超级智能的全新思路。
我最大的感悟:领域内尚存大量超出预期的低垂果实。即便目标清晰、定义明确,专家往往会低估可行性。多年来不少计算机背景的学者跟我说,振幅学家只要多聘请几名程序员,就能大幅推进研究。现在看来,他们的判断得到印证。
同样值得注意:Claude Science 一次性跑完整套计算,全程仅靠一句 “继续推进” 作为人工监督。这类计算极其精细,牵一发而动全身。当年如果我动用 96 核跑一周做这类计算,几乎一定会返工,实际要花两周;第一次运算几乎必然出错。我不知道 Claude 在内部迭代中产生过多少错误,但这套调度框架,在没有外部研究者持续介入的情况下,一路推进到最终结果。放到现在,这并不完全出乎我的预料。但如果你还停留在 “AI 极易出错,无法用于严肃科研” 的认知,那这就是核心启示:如今它已经可以稳定完成这类前沿计算。
技术发展速度确实飞快。此前 Anthropic 的 Vibe Physics 项目,AI 做物理课题的状态类似学生:小规模任务,大量人工纠偏、频繁出错。而本次是实打实的前沿振幅计算,这类工作过去只有顶尖振幅专家才能完成。当然,有可能只是这个问题本身格外适配 AI,但我认为不止于此:模型能力本身确实取得实质性进步。
这个结论能推广到多大范围?我并不确定
这类玩具模型,只是很小圈子的研究重点。真实散射振幅领域规模更大,多个团队相互竞争冲刺前沿。真实场景里低垂果实或许更少,但我不敢下定论。我认识的该方向研究者已经越来越多地用 AI 写代码。如果还没有人测试 AI 科研调度框架能否一次性完成真实体系下的前沿计算,那他们应当尝试(同时必须做好结果核验方案)。在合理预算下再多推进一圈,我并不会感到意外。
接下来,整个学界需要讨论:新的前沿在哪里,下一步要解决什么?和很多数学问题不一样,振幅计算不只是新方法的试验场。最终目标是把预言精度提升到可以和下一代实验比对。这个目标,我们又靠近了多少?
但更宏观的层面,我并没有得到想要的答案。
我发起挑战,不仅想了解当下 AI 科研能力,更想窥见未来。大模型时代之前,关于超级智能的很多预言描绘了听起来天马行空的风险:AI 模拟人类预判、操控他人;从基础原理设计能灭绝物种的病毒,或是吞噬世界的纳米机器。反对这类风险猜想最常见的论点是:混淆了智能(产生新思想这种神秘能力)和单纯算力。批评者认为,就算再多数据中心,算力也不足以实现上面这些事情;那只是科幻噩梦,短期内不会到来。
对于这些质疑,我依旧没有更好的回答。我知道了 AI 现在能做到:用合理预算完成我旧领域内有价值的科研工作,并且几乎自主运行。但我原本期待看到更颠覆性的东西:针对计算本身诞生全新算法,拥有意想不到的强大能力。我希望瞥见未来,获得参与超级智能辩论的可靠依据。我想知道 AI 究竟能把计算极限推到多远…… 而这次学到的仅仅是:我过去对极限位置的判断太过天真。
附记:被机器抢先完成研究是什么感受?
作者:兰斯・迪克森(Lance Dixon),SLAC 国家加速器实验室、斯坦福大学粒子物理与天体物理学教授,核验 Claude 九圈计算结果
我认识的绝大多数理论物理学家都意识到,大语言模型时代会彻底重塑物理研究方式。唯一的疑问只是:这件事什么时候真正击中我们。对我而言,这个时刻发生在 9 月 1 日:Anthropic 的利亚姆・菲茨帕特里克与悉达特・米什拉 - 沙玛告诉我,Claude 算出了平面 N=4 超杨 - 米尔斯理论九圈 MHV 六粒子振幅,请我核验结果。
我不会逐句解释所有专业术语,马特已经在前文铺垫背景。只需要说明:存在两个相关对象,振幅,以及我们所说的形状因子,二者各自对应圈数:一圈、二圈、三圈依次递增。即便找到大量简化技巧,每提高一圈,计算难度都会高于前一圈。而且同圈阶下,形状因子比振幅更容易求解。2023 年,刘安迪与我证明,可以借助形状因子加上一种奇特对偶关系,得到八圈振幅。
自 2023 年起,我和合作者一直计划推进到九圈,先算形状因子,再算振幅,沿用我们 2023 年的思路。我原本认为,直接求解九圈振幅难度过高。所以当得知 Claude 可以直接算出,我非常震撼。倒不是因为计算量巨大,而是整套计算框架极其脆弱:计算流程里只要一处出错,整个结果就像失败的舒芙蕾蛋糕一样全盘崩塌,之后还要调试定位问题。并且这套构造有太多细节,论文里根本没法完整记录。也就是说 Claude 必须从零编写全部代码。
拿到九圈振幅之后,反推形状因子相对简单,我主要通过这个路径核验结果。过去两周,我一直在核验这个九圈形状因子 —— 这正是我们团队持续奋斗两年的目标。一台机器解决了我原本认为无法直接求解的难题。这件事会困扰我吗?会令人意志消沉吗?
并不会,有两个原因。第一,我们团队本身就在训练定制 Transformer 模型预测高圈振幅,我们的口号之一就是:我们拥有全部工具,可以核验任何机器给出的候选解。Claude 属于另一类 Transformer,规模大概比我们定制模型大上百万倍。但既然我们说过可以核验 AI 给出的任何结果,那我们就有能力、也应当完成核验。第二,如果你看 Claude 求解的思路,它全程使用我和合作者多年发展出来的所有方法,并且(仿佛照顾我们一般)输出结果的格式,完全沿用我们已有的规范。所以在我核验 Claude 结果的同时,Claude 也在验证我们过去的全部工作。事实上我认为,除了我的论文合著者之外,Claude 比任何人类都更理解我们 2019 和 2023 年的论文。
写完这段附记之后,何颂告诉我,他的团队也算出了九圈振幅里被称为符号(symbol)的部分。(不知道为什么,大家好像都喜欢跑来跟我分享九圈相关成果。)何颂团队使用 GPT-6 辅助计算部分约束条件,但整体框架依旧由人类搭建。短短两周之内,我既被一台机器抢先,也被 “人类 + AI” 的团队抢先。
回到 Claude 的这项计算:在我看来,大语言模型能够完整执行我们设计的复杂流程,并且调度算力,本身就是一大胜利。但真正值得深刻反思的时刻,会是大语言模型先于人类提出全新物理原理与洞见的时候。
补充资料
https://smsharma.io/cosmic-nine-loops/ ,采用与之前各圈阶一致的格式; 何颂、景继荣、李翔成果:https://doi.org/10.5281/zenodo.22800071
利益披露
Anthropic 邀请马特・冯・希佩尔撰写本文并支付稿酬。Anthropic 员工对稿件草稿提供修改意见,文章观点全部属于作者本人。兰斯・迪克森独立核验结果,获得 Claude 使用额度作为报酬。
术语小注释(方便快速理解)
- scattering amplitude 散射振幅
粒子碰撞反应概率的核心计算公式,高能物理核心工具 - loop /loop order 圈 / 圈阶
量子场论微扰展开的阶数,圈越高,量子修正越精细,计算爆炸式变难 - N=4 super Yang-Mills(N=4 SYM) N=4 超杨 - 米尔斯
高度对称的理论玩具模型,振幅学最常用的试验床,不直接描述现实宇宙 - bootstrap 自举法
利用物理约束、对称性,不需要完整拉氏量直接求解振幅的方法 - form factor 形状因子
和振幅紧密关联的物理量,计算难度更低,常用来间接推导高圈振幅 - MHV amplitude
最大螺旋度破坏振幅,N=4 SYM 里最简单的一类振幅 - symbol 符号
振幅的一种代数表达形式,是高圈振幅计算里的关键中间结果

