大数跨境

大模型刷榜的真相,可能和你想的不一样

大模型刷榜的真相,可能和你想的不一样 基本透明
2026-02-12
3
导读:当OpenAI、谷歌、DeepMind的最新模型在数学榜单上“神仙打架”,你以为看到的是技术突破?不,...

昨天,我盯着最新一期的数学大模型基准测试榜单,看了足足十分钟,然后笑了。

不是开心,是那种“果然如此”的冷笑。

榜单上,OpenAI的o1、谷歌的Gemini Deep Think、DeepMind的Alpha系列,分数一个比一个高,标题一个比一个吓人——“接近IMO金牌水平”、“解决千年难题”。朋友圈里又是一片“AI要颠覆科学了”的狂欢。

但如果你真信了,那你可能还没看懂这场游戏。

大厂们早就不是在拼技术了,他们是在拼“刷题”的技巧。

这感觉,就像你听说一个高中生SAT考了满分,激动不已,结果发现他过去三年把题库里的每一道题都背得滚瓜烂熟。这分数,还有意义吗?

基准测试,一场已经失效的“开卷考”

让我们把时间拉回到三年前。

那时候,GPT-3横空出世,在MMLU(大规模多任务语言理解)等通用基准测试上大杀四方。那个分数是震撼的,因为它代表了一种泛化能力——模型没见过这些题,但它靠“理解”做出来了。

那是闭卷考的真本事。

但今天呢?局面彻底变了。

以数学推理为例,从奥数题到研究生级别的数学证明,公开的、高质量的测试集就那么几个:MATH, GSM8k, Olympiad-level problems。这些题目,早就被各大AI实验室的数据工程师们嚼碎了、喂给模型了。

更关键的一步来了:他们不再满足于让模型“学习”,而是开始为这些特定的题目,定制专门的“解题技巧”。

比如,谷歌为Gemini Deep Think设计的“思维链自洽性检查”,OpenAI为o1设计的“慢思考”迭代机制。这些技术本身很有价值,但它们被极度优化,目标直指那几个公开数据集上的评分规则。

这就好比,考试大纲和题型范围完全公开,顶尖学生不再广泛学习知识,而是雇佣最牛的老师,针对每一类题,设计最取巧的“解题模板”和“得分技巧”。

分数能不高吗?但这分数,衡量的是“应试能力”,还是“数学水平”?

答案显而易见。

大厂的算盘,打得比你想的精

你可能会问,这些顶尖实验室不知道自己在“刷分”吗?他们当然知道。

但他们更知道,资本市场和大众舆论需要什么。

需要一个简单、粗暴、能上头条的数字。

沈南鹏看项目,第一页PPT必须是增长曲线和市场占有率;张颖聊投资,最常问的是“数据标杆是什么”。到了AI这里,这个“标杆”就是基准测试分数。

OpenAI需要向微软和投资人证明,每年百亿美金的烧钱速度物有所值;谷歌需要向董事会证明,合并DeepMind后能在关键战场压制微软;Anthropic需要在下轮融资时,讲一个“我们比GPT-4更聪明”的故事。

分数,就是最硬的通货。

所以,你会看到一种奇观:模型发布会越来越像手机发布会。不再讲复杂的技术原理,而是直接甩出一张对比柱状图——“看,我们在MMLU上比对手高2个点,在MATH上碾压50%”。

至于这2个点是怎么来的?是通用能力的提升,还是针对性的“刷题”优化?没人关心,也懒得解释。

黄仁勋每次举起新的GPU,台下都欢呼“更快更强”;现在大厂举起新的测试分数,效果一模一样。

所有的技术竞赛,最终都会异化为营销竞赛。 这是硅谷和中国科技圈共同的铁律。

一个更危险的信号:“私有基准”的崛起

当公开基准被“刷烂”之后,游戏进入了第二阶段:自己立靶子自己打

最近圈内一个明显的趋势是,巨头们开始越来越少地提及公共测试集,转而大力宣传自己的“私有评估框架”或“内部基准”。

谷歌说,我们用一套更复杂的科学推理任务评估Gemini;OpenAI说,我们聘请了真正的数学家当评委,进行“定性评估”。

这操作,是不是很眼熟?

这就像两个运动员公开比赛,A总是输给B。于是A宣布:“国际田径联合会的规则不科学,我们来比我家后院的自定义项目吧,这个项目才能体现真正的运动精神。”然后,A在自家后院“轻松战胜”了B。

“私有基准”最大的问题,不是不权威,而是不透明。

评测标准是什么?数据分布如何?有没有过拟合的风险?全是黑箱。它唯一的用途,就是在新闻稿里写下“在内部评估中大幅领先”这句话。

张一鸣最早做头条时,坚信“算法没有价值观”。但现在的大模型评估,正在变得“有价值观”——一种对自家模型最有利的价值观。

当裁判和运动员都是同一个人时,比赛就已经结束了。剩下的,全是表演。

那么,我们该看什么?

如果你是一个开发者,想选型模型;或者是一个投资人,想判断趋势,别再只盯着那几分几点的提升了。

有几个更真实的维度:

第一,看“开箱即用”的成本和效果。 把那个号称数学考满分的模型拉出来,丢给它一个全新的、从未公开过的、来自你实际业务中的复杂逻辑问题。它的表现,比在MATH数据集上暴跌几个档次?这才是它真实的能力水位。

第二,看推理的“经济账”。 OpenAI的o1推理速度慢、成本高,这是为了“刷分”而牺牲效率的典型。谷歌的Gemini Deep Think一次推理消耗的计算资源,可能是普通版本的数十倍。用100倍的成本换10%的分数提升,这到底是技术进步,还是资源挥霍? 在商言商,这账算不过来。

第三,看生态和工具链。 模型能不能被轻松微调?有没有成熟的部署方案?周边开发者工具是否丰富?这些“脏活累活”,才是决定一个技术能否落地的关键。特斯拉的自动驾驶不是靠刷比赛分数赢的,是靠几百万辆车上路跑出来的数据闭环。

第四,也是最重要的一点:忘掉“超人”,关注“凡人”。 我们需要的或许不是一个能解IMO难题的数学天才,而是一个能零错误理解产品需求、能毫无怨气修改八百遍文案、能7x24小时处理客服问题的“数字员工”。后者的经济价值,比前者大一万倍。

吴军博士在《智能时代》里说,技术革命的标志是旧产业的消亡和新模式的诞生。现在AI圈却沉浸在“刷题夺冠”的旧模式里,这是一种讽刺。

金句

大模型基准测试的排行榜,已经从一个技术测量的尺子,变成了一个营销创意的舞台。

互动问题

如果基准测试已不可信,你觉得下一个能真正衡量AI实力的“硬指标”会是什么?

【声明】内容源于网络
0
0
基本透明
1234
内容 123
粉丝 0
基本透明 1234
总阅读11
粉丝0
内容123