文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。
一张“最后的考卷”
2025 年 1 月,Scale AI 与 CAIS 联合发布了名为"Humanity's Last Exam"(简称 HLE,人类最后的考试)的评测基准。面对 MMLU 等旧有榜单因头部模型接近满分而失去区分度的现状,HLE 集结全球专家设计了近 2500 道研究生难度的题目,涵盖数学、物理、法律等多个学科,且确保无法通过搜索引擎直接获取答案。
Scale AI:美国 AI 数据基础设施公司,核心业务为大模型提供高质量数据标注、RLHF 反馈及评测基准设计。
CAIS:人工智能安全中心,非营利研究机构,专注于 AI 对齐与灾难性风险议题。
MMLU:大规模多任务语言理解评测,曾是大模型行业的“高考”,包含 57 个学科的约 1.6 万道选择题。
HLE 发布初期,最强模型的正确率不足 10%。然而仅一年半后,公开榜单显示榜首模型的正确率已突破 50%。这一现象揭示了评测界的残酷现实:并非 HLE 失败,而是所有静态评测终将面临被超越的命运。

分数只是替身:古德哈特定律
模型能力的评估难以直接量化,行业往往依赖近似指标。然而,一旦某个指标成为优化目标,它便会逐渐失真,这便是“古德哈特定律”(Goodhart's Law)。
指标失真的过程
该定律指出:“任何稳定的统计规律,一旦被拿来当控制目标,就会开始崩塌。”在模型评测中表现为“上有政策,下有对策”:当评测集固定后,模型训练会针对性地优化该指标,导致分数虚高而无法反映真实能力。
四代模型评测的演变与局限
为应对指标失真,模型评测经历了四次主要迭代,但每种方法均存在固有局限。
第一代:固定考卷,题会被背熟
以 MMLU、GSM8K 为代表的早期评测采用固定题库。其致命缺陷在于:
- 数据泄露:题目公开后易进入训练数据,模型高分可能源于“记忆”而非“推理”。
- 区分度丧失:随着模型能力提升,固定难度的题目很快被刷至满分,失去评测意义。
第二代:真人盲测,困于“裁判偏好”
2023 年,UC Berkeley 推出的 LMArena(Chatbot Arena)引入真人投票机制,利用 Elo 等级分系统进行排名。虽然避免了背题问题,但模型开始针对人类偏好进行优化(如调整回答长度、使用列表或表情符号),导致评分受主观因素影响,偏离实际能力。
第三代:真实任务,但未必是你的任务
普林斯顿团队发布的 SWE-bench 转向真实软件工程场景,要求模型修复 GitHub 上的真实 Issue。尽管通过 FAIL_TO_PASS 和 PASS_TO_PASS 双重测试确保了修复的有效性,但其局限性在于:评测基于开源项目,未必能代表企业特定的私有业务场景。
第四代:Agent 全链路,困于“成本高昂”
2025 年起,评测升级为 Agent 全链路能力测试,如 OpenAI 的 BrowseComp 和 Terminal-Bench。这类评测要求模型自主规划搜索、操作终端环境并完成复杂任务。虽然更贴近实际应用,但面临两大挑战:
- 成本极高:多轮调用与工具执行使得单次评测成本是固定考卷的数十倍,导致样本量小、结果不稳定。
- 复现困难:环境依赖、网页状态变化等因素极易影响评测结果的一致性。
如何规避古德哈特定律
公开榜单仅能提供行业坐标参考,无法保证模型在特定业务场景中的表现。规避指标失真的最有效方案是:构建基于自身真实业务的测试集。
如何收集自己的测试集
建议有意识地收集业务中模型难以解决的案例,构建专属评测数据集(JSONL 格式)。例如,可利用自动化工具将日常遇到的难题转化为"Prompt-Completion"对:
{"prompt": "不改变原意的基础上,优化如下语句让它更顺口:「这张卷子,够难,够新,够用好多年。」", "completion": "这张试卷应该能够撑很久。"}
{"prompt": "不改变原意的基础上,优化如下语句让它更顺口:「同一个人,先做出一张后来被刷满的卷子,又做出一张更难的新卷子,然后看着它也开始被追上。」", "completion": "同一个人,出的第一张卷子已经被遗弃。于是他出了第二张更难的试卷,结果第二张试卷离被淘汰也不远了。"}
此类数据集既可用于新模型的准入评测,也可作为 Few-shot 示例在日常推理中增强模型表现,实现“一鱼两吃”。

总结
AI 模型的公开榜单仅是行业能力的宏观参考,无法替代具体业务场景的验证。最务实的策略是利用真实业务难题构建私有测试集,以此精准评估模型效能,并同步提升模型在实际应用中的表现。
参考链接:
[1] https://agi.safe.ai/
[2] https://github.com/hendrycks/test
[3] https://dashboard.safe.ai/
[4] https://lmarena.ai/
[5] https://github.com/SWE-bench/SWE-bench
[6] https://openai.com/index/browsecomp/
[7] https://github.com/harbor-framework/terminal-bench

