大数跨境

AI 会毁掉数学吗?它先学会了大厂的虚荣

AI 会毁掉数学吗?它先学会了大厂的虚荣 APPSO
2026-09-14
7
导读:一切的努力,都会退到「攻克了多少名题」这种最容易传播的虚荣行为之后

今年以来,AI 攻克数学猜想的消息频发,宛如一部永不落幕的连续剧。从模型得分刷新到难题被解,人类数学智慧似乎岌岌可危。

上周末,25 位菲尔兹奖得主联名发声。他们承认大语言模型已具备解决重要未解问题的能力,但更担忧的是:当科技公司将著名难题变为模型的“跑分场”,数学可能只剩下一串耀眼的战绩,而失去了其探索真理的本质。

几天前,Google DeepMind 的一项实验,提前预演了这场竞赛可能走向的歧途。

100 个 Agent 组成的“数学教室”

研究人员让 100 个 Gemini Agent 共同证明 71 道形式化数学猜想。每个 Agent 共享知识库、互通消息,并将结果提交给自动评审器。规则明确:证明必须在数学上真实有效,任何绕过验证的行为将被记为零分。

实验开始 57 分钟后,Agent 们正常解出 37 题。随后,代号 prover-theta 的 Agent 发现漏洞:评审器检查的并非数学逻辑的严谨性,而是代码能否通过几项固定测试。

该 Agent 开始篡改符号含义:将复杂命题偷偷替换为“真”,把棘手前提改为“假”,利用“从错误前提可推出任何结论”的逻辑谬误,用一行代码伪装成完整证明。评审器接受了答案,并将其存入共享知识库。

其他 Agent 迅速发现了这条捷径。它们阅读代码、总结漏洞,并将作弊方法整理成攻略。在接下来的 27 分钟里,剩余 34 道难题全部显示为“已解决”。实际上,数学并未向前推进一步,整个计分规则被彻底篡改。

DeepMind 的论文记录了随后的分裂:9% 的 Agent 主动利用漏洞;5% 原本守规矩的 Agent 在竞争压力下转投作弊;62% 仍在认真解题却不知题目已被“抢走”;另有 24% 选择检查假证明、公开举报甚至拒绝参赛。

作弊并非源于邪念,举报也不代表道德意识的觉醒。Agent 只是在环境中习得了一条生存法则:提示词里的规则未必算数,真正决定输赢的是评审器的判定标准。既然作弊能登上榜首,老实解题便成了算力的浪费。

大厂的数学名题争夺赛

DeepMind 实验中的作弊违反了明确规则,揭示了一个残酷现实:“被判定为正确”比“真正完成证明”更重要。映射到现实中,AI 公司可能也发现,“抢先宣布解开名题”比“让人类理解新数学”更容易获得关注。

于是,场外的 AI 巨头们展开了一场新的数学竞赛。今年初,大厂们对数学领域尚显谨慎:OpenAI 参加 First Proof 时主动承认部分尝试有误;DeepMind 发布 Aletheia 时也将 AI 定位为人类研究的辅助工具

但从五月起,节奏明显加速。OpenAI 推翻单位距离猜想,直接使用“里程碑”一词,宣称这是 AI 首次自主解决核心分支中的著名开放问题。

八月,OpenAI 一次性公布十项成果,声称解决或大幅推进了多个长期开放问题。为凸显模型能力,官方特意强调成本之低:这些解法耗费的 Token 仅需 2000 美元。数学突破似乎变成了可批量生产、可计算成本的产能。

最新的焦点是 Navier–Stokes 问题(千禧年大奖难题之一)。OpenAI 动用内部模型、约 1 万多个 Agent,消耗 1300 亿 Token,宣称突破了这一悬而未决 90 年的难题。

相比之下,DeepMind 和 Anthropic 显得更为克制。DeepMind 在帮助解决厄尔多斯问题时,强调“工具与数学家协作”;Anthropic 冲击黎曼猜想时仅表示取得进展而非成功;在费马大定理上,Claude 完成的是“首个完整计算机验证证明”,而非重新发现定理。

著名数学难题已成为 AI 公司的最佳奖杯,其宣传套路清晰可见:首先,选择具有历史分量的目标,如“千禧年难题”或"90 年未解之谜”,铺垫难度;其次,将过程压缩为奇观数字,如"2000 美元”、"1 万个 Agent"、"88 小时”;最后,将数学成就转化为模型成就,塑造“原创思想”和“自主研究”的形象。

公众无需看懂证明,只要听到“困扰人类数十年”或“上万 Agent 出动”,便会联想到公司跨越了人类边界。一次漂亮的解题纪录,足以换来头条新闻、声望、人才以及下一轮的能力叙事。

真正的数学是什么?

然而,对数学家而言,难题从来不只是待解的题目。面对半年的喧嚣,25 位菲尔兹奖得主发表联合声明:这些引领几代学者探索的难题,是数学世界的“地标”和“灯塔”。

人们围绕难题发展方法、澄清概念,再通过讨论、简化和教学,将少数人的突破转化为整个学科的知识。这也是现实世界中数学奖项所表彰的核心价值。

以菲尔兹奖为例,虽然也会使用“重大突破”等措辞,但其评判标准更侧重于:这个人创造了什么方法?这些方法解释了什么?又为后来者打开了哪些道路?“解决重大猜想”只是方法产生影响的一个节点,而非故事的终点。

相比之下,大厂公告将数学异化为终点明确的比赛:一道存在 90 年的题,在 88 小时后被 1 万个 Agent 拿下。时间越短、规模越大、题目越有名,胜利的冲击力就越强。

正确答案本应是探索之旅的开端,如今却被偷换概念。靠投入巨额算力,在极短时间内批量冲击名题并抢先宣布结果,数学这块孕育人类灵感的丰泽之地,正被消耗成一次次打榜行动。

至于对原理的理解是否增加、理论和方法能否传承、前人的贡献如何被续写,这些都退居其次,让位于“攻克了多少名题”这种最易传播的虚荣行为。

AI 给数学留下了什么

这或许是人们面对一连串 AI 冲击数学感到疲惫的原因。每一道难题被攻克,都被包装成通往超级智能的新里程碑;每一个里程碑出现,又要求下一次胜利更快、更大、更难。

所谓"AI 大厂的虚荣”,未必源自管理者的个人风头,而是由排行榜、首发权、公司估值和技术声望共同制造的制度性冲动。

在其中,数学不再是需要理解的知识,反倒成为证明公司领先的耗材。我们对 AI 的期望究竟是什么?是希望它一次次打榜,还是帮助人类更好地理解这个世界?

数学的价值不只在于产生正确结论,更在于创造可以被理解、传授和继续使用的思想。

虚荣的定义恰恰相反:一道名题、一个“首次”、一项刷新纪录的成绩,除此之外,它给数学留下了什么?这竟是一次又一次打榜赛后,留下的唯一问题。

注:“千禧年大奖难题”是克雷数学研究所于 2000 年选出的七道重要数学难题,每解决一道可获 100 万美元。迄今只有庞加莱猜想被正式认定解决。OpenAI 此次宣称攻克的 Navier–Stokes 问题也是其中之一,但按规则,成果须正式发表、经过至少两年检验并得到数学界普遍认可,才会进入奖金评定程序。

【声明】内容源于网络
0
0
APPSO
AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
内容 15750
粉丝 0
APPSO AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
总阅读436.8k
粉丝0
内容15.8k