昨天,我盯着最新一期的数学大模型基准测试榜单,看了足足十分钟,然后笑了。
不是开心,是那种“果然如此”的冷笑。
榜单上,OpenAI的o1、谷歌的Gemini Deep Think、DeepMind的Alpha系列,分数一个比一个高,标题一个比一个吓人——“接近IMO金牌水平”、“解决千年难题”。朋友圈里又是一片“AI要颠覆科学了”的狂欢。
但如果你真信了,那你可能还没看懂这场游戏。
大厂们早就不是在拼技术了,他们是在拼“刷题”的技巧。
这感觉,就像你听说一个高中生SAT考了满分,激动不已,结果发现他过去三年把题库里的每一道题都背得滚瓜烂熟。这分数,还有意义吗?
基准测试,一场已经失效的“开卷考”
让我们把时间拉回到三年前。
那时候,GPT-3横空出世,在MMLU(大规模多任务语言理解)等通用基准测试上大杀四方。那个分数是震撼的,因为它代表了一种泛化能力——模型没见过这些题,但它靠“理解”做出来了。
那是闭卷考的真本事。
但今天呢?局面彻底变了。
以数学推理为例,从奥数题到研究生级别的数学证明,公开的、高质量的测试集就那么几个:MATH, GSM8k, Olympiad-level problems。这些题目,早就被各大AI实验室的数据工程师们嚼碎了、喂给模型了。
更关键的一步来了:他们不再满足于让模型“学习”,而是开始为这些特定的题目,定制专门的“解题技巧”。
比如,谷歌为Gemini Deep Think设计的“思维链自洽性检查”,OpenAI为o1设计的“慢思考”迭代机制。这些技术本身很有价值,但它们被极度优化,目标直指那几个公开数据集上的评分规则。
这就好比,考试大纲和题型范围完全公开,顶尖学生不再广泛学习知识,而是雇佣最牛的老师,针对每一类题,设计最取巧的“解题模板”和“得分技巧”。
分数能不高吗?但这分数,衡量的是“应试能力”,还是“数学水平”?
答案显而易见。
大厂的算盘,打得比你想的精
你可能会问,这些顶尖实验室不知道自己在“刷分”吗?他们当然知道。
但他们更知道,资本市场和大众舆论需要什么。
需要一个简单、粗暴、能上头条的数字。
沈南鹏看项目,第一页PPT必须是增长曲线和市场占有率;张颖聊投资,最常问的是“数据标杆是什么”。到了AI这里,这个“标杆”就是基准测试分数。
OpenAI需要向微软和投资人证明,每年百亿美金的烧钱速度物有所值;谷歌需要向董事会证明,合并DeepMind后能在关键战场压制微软;Anthropic需要在下轮融资时,讲一个“我们比GPT-4更聪明”的故事。
分数,就是最硬的通货。
所以,你会看到一种奇观:模型发布会越来越像手机发布会。不再讲复杂的技术原理,而是直接甩出一张对比柱状图——“看,我们在MMLU上比对手高2个点,在MATH上碾压50%”。
至于这2个点是怎么来的?是通用能力的提升,还是针对性的“刷题”优化?没人关心,也懒得解释。
黄仁勋每次举起新的GPU,台下都欢呼“更快更强”;现在大厂举起新的测试分数,效果一模一样。
所有的技术竞赛,最终都会异化为营销竞赛。 这是硅谷和中国科技圈共同的铁律。
一个更危险的信号:“私有基准”的崛起
当公开基准被“刷烂”之后,游戏进入了第二阶段:自己立靶子自己打。
最近圈内一个明显的趋势是,巨头们开始越来越少地提及公共测试集,转而大力宣传自己的“私有评估框架”或“内部基准”。
谷歌说,我们用一套更复杂的科学推理任务评估Gemini;OpenAI说,我们聘请了真正的数学家当评委,进行“定性评估”。
这操作,是不是很眼熟?
这就像两个运动员公开比赛,A总是输给B。于是A宣布:“国际田径联合会的规则不科学,我们来比我家后院的自定义项目吧,这个项目才能体现真正的运动精神。”然后,A在自家后院“轻松战胜”了B。
“私有基准”最大的问题,不是不权威,而是不透明。
评测标准是什么?数据分布如何?有没有过拟合的风险?全是黑箱。它唯一的用途,就是在新闻稿里写下“在内部评估中大幅领先”这句话。
张一鸣最早做头条时,坚信“算法没有价值观”。但现在的大模型评估,正在变得“有价值观”——一种对自家模型最有利的价值观。
当裁判和运动员都是同一个人时,比赛就已经结束了。剩下的,全是表演。
那么,我们该看什么?
如果你是一个开发者,想选型模型;或者是一个投资人,想判断趋势,别再只盯着那几分几点的提升了。
有几个更真实的维度:
第一,看“开箱即用”的成本和效果。 把那个号称数学考满分的模型拉出来,丢给它一个全新的、从未公开过的、来自你实际业务中的复杂逻辑问题。它的表现,比在MATH数据集上暴跌几个档次?这才是它真实的能力水位。
第二,看推理的“经济账”。 OpenAI的o1推理速度慢、成本高,这是为了“刷分”而牺牲效率的典型。谷歌的Gemini Deep Think一次推理消耗的计算资源,可能是普通版本的数十倍。用100倍的成本换10%的分数提升,这到底是技术进步,还是资源挥霍? 在商言商,这账算不过来。
第三,看生态和工具链。 模型能不能被轻松微调?有没有成熟的部署方案?周边开发者工具是否丰富?这些“脏活累活”,才是决定一个技术能否落地的关键。特斯拉的自动驾驶不是靠刷比赛分数赢的,是靠几百万辆车上路跑出来的数据闭环。
第四,也是最重要的一点:忘掉“超人”,关注“凡人”。 我们需要的或许不是一个能解IMO难题的数学天才,而是一个能零错误理解产品需求、能毫无怨气修改八百遍文案、能7x24小时处理客服问题的“数字员工”。后者的经济价值,比前者大一万倍。
吴军博士在《智能时代》里说,技术革命的标志是旧产业的消亡和新模式的诞生。现在AI圈却沉浸在“刷题夺冠”的旧模式里,这是一种讽刺。
金句
大模型基准测试的排行榜,已经从一个技术测量的尺子,变成了一个营销创意的舞台。
互动问题
如果基准测试已不可信,你觉得下一个能真正衡量AI实力的“硬指标”会是什么?

