2026 年 7 月 27 日,北京协和医院神经外科住院医师兼博士后金山木(Shanmu Jin),在预印本平台发布了单人署名论文《The Numerical Range Is a 2-Spectral Set》。该论文给出了克鲁泽猜想(Crouzeix's Conjecture)的完整证明,宣告这一困扰应用数学与矩阵分析领域 22 年的难题正式告破。
随后,猜想提出者米歇尔·克鲁泽(Michel Crouzeix)及资深学者亚历克斯·汤森、安妮·格林鲍姆对手稿进行了逐行核验,一致确认证明成立。令人瞩目的是,金山木并非全职数学家,其高等数学知识源于研究“经颅超声”技术时的自学。协助其完成突破的,是连续运行约 16 小时的 GPT-5.6 Sol。
8 天后,荷兰两位数学家埃米尔·洛里斯特与菲利克斯·施温宁格也在 arXiv 发表了独立的五页极简证明,并坦言同样借助了 ChatGPT 5.6 梳理思路。这一事件不仅解决了数学难题,更为 AI for Science、代码形式化验证及工业仿真软件提供了极具价值的复盘样本。
外科医生的跨界 AI 实践
克鲁泽猜想由法国数学家米歇尔·克鲁泽于 2004 年提出。其核心在于:任取一个矩阵和一个多项式,将矩阵代入多项式后,新矩阵对信号的放大倍数,不会超过该多项式在复平面特定区域内取值幅度最大值的 2 倍。
简而言之,极难计算的矩阵问题可被易计算的平面几何问题所界定,且误差上限仅为 2 倍。然而,这看似简单的"2 倍”常数,二十余年间无人能证。从 2007 年的 11.08 到 2017 年的 2.414,学界虽在特殊矩阵类上取得局部进展,但在一般情形下始终无法逼近"2"。
2026 年 7 月底,金山木通过改良对抗式多智能体提示词框架,利用 AI 改变了局势。他并未直接索要答案,而是为 GPT-5.6 设定了四条核心规则:
- 断掉外援:物理切断联网,禁止检索过往研究,仅基于已知定理进行纯粹逻辑推理,避免错误路径干扰。
- 拉宽搜索面:并行开启多个子智能体,分别从代数、结构归纳、复分析等不同路径探索,严禁早期收敛。
- 内部互审:设立专门挑刺的智能体,对每条候选路线提出反例验证。
- 不许提前收工:在产出经得起严苛逻辑检验的完整证明前,禁止终止任务。
在这种“数字角斗场”模式下,AI 经过 16 小时运算,提出了创新思路:无需逐一解决无穷多种情形,只需验证几个关键位置,若全部合格则结论对所有情形成立。这种类似“水质取样化验”的逻辑,最终攻克了悬置 22 年的难题。
澄清"AI 终结猜想”的误读
该突破引发广泛关注的同时,也伴随着诸多误读。
并非 AI 暴力破解
媒体常将此归结为"AI 靠算力暴力破解”,实则不然。无论是金山木团队的证明,还是荷兰学者的五页论文,其使用的数学工具均为 20 世纪 80 年代已成熟的复分析与线性代数经典理论。阻碍解题二十多年的并非工具缺失,而是缺乏从“采样和补全”角度切入的思路。
非人类甩手掌柜的运气产物
认为这是“随手指令碰运气”的观点,忽视了金山木的跨界自学能力与提示词工程功底。其研究起点源于临床痛点:在“经颅超声”治疗中,需精准计算声波穿过颅骨后的聚焦效果,以避免损伤脑组织。这涉及到复杂的声场仿真与误差上限评估,迫使他深入矩阵分析领域,进而邂逅克鲁泽猜想。
从临床需求追溯至数学命题,再到巧妙改装 CDC 猜想的对抗式提示模板,这一完整链条缺一不可。若无深厚的领域理解与精准的指令设计,AI 难以在此类高深问题上产生实质性突破。
AI 赋能工业仿真的深远影响
此次突破的意义远超数学界,直指现代工业的核心——迭代求解器。无论是航空气动设计、5G 基站电磁仿真,还是芯片工艺参数提取,底层均涉及数十亿维度的复系数线性方程组求解。
面对海量计算,工业界普遍采用 GMRES 等迭代求解方案。工程师长期面临一个两难困境:停止迭代过早会导致结果不准(如飞机设计缺陷、芯片短路),停止过晚则浪费巨额算力与电力。而传统“特征值”方法在处理“非正常矩阵”时往往失效,无法提供可靠的误差上限预估。
克鲁泽猜想的证明,恰好提供了这把衡量误差的“新尺子”。一位临床医生凭借数月自学与精心设计的 AI 交互,在 16 小时内走通了学界 22 年未竟之路。这一案例表明,在 AI 时代,解决复杂难题不再是少数顶尖高手的特权。只要善用 AI 工具链,各行业从业者均有机会突破专业壁垒,解决诸如编程、设计及仿真等领域的深层次问题。

