AI把考卷刷到接近满分之后,下一张考卷,还能考什么?这个问题,现在成了AI圈最热闹的悬案。
起因是GPT-6 Astra在ARC-AGI-3这个半私有测试集上,拿下了99.9%的成绩。OpenAI官方的说法很拽:已经完全“饱和”了。
不知道的以为AI真把逻辑推理练到头了,懂的都知道——这里面水很深。
ARC-AGI是专门用来测“泛化能力”的标杆测试,前两代的核心就俩字:看图找规律。给AI几组“输入→输出”的小方格图,让它猜规则,再画出新一组的输出。到了三代,GPT-6 Astra直接被丢进一个游戏世界,1000多个关卡里自己玩、自己试、自己找规则,96%的关卡用比人类中位数更少的步数完成任务。
ARC Prize的评价是“阶跃式的能力变化”——顺带补了一句刺耳的:基准饱和,并不等于证明了AGI。但真正的好戏在后面:GPT-6 Astra的99.9%,不是靠“更聪明”刷出来的,而是靠一个叫Provider Adapter的东西。同一套权重、同一组题目,标准测试框架下只有62.7%,接入适配器后飙到99.9%——差了36个百分点。Claude Opus也从30%能到95.5%。
原来榜单上的“分数大战”,有相当一部分比的是“谁的架子搭得好”,不是“谁脑子更好使”。
于是争论彻底跑偏了:从“哪家模型泛化能力更强”,变成“哪个harness更公平”。ARC-AGI-3的“饱和”,更像是一场评测工程学事件。也正是因为这样,ARC Prize创始人François Chollet掏出了下一代的蓝图。
ARC-AGI-4,明年Q1如期登场,主打更长尺度下的持续学习与课程学习。真正重磅的,是被他形容为“人类最后考卷”的ARC-AGI-5——核心就俩字:发明。开放式发明,让AI自己提出新的任务、新的规则、新的解法。
Chollet甚至放话:当AI的学习效率与人类再无客观测量差距时,那便是真正的AGI时刻。他还补了一句更狠的:ARC系列考题,大概在第6、7代就终结了。
考“找规律”,AI已经卷到近乎满分;下一步考“发明”,等于把天花板直接掀了。
说句心里话,这个节点挺有象征意义的——当评测标准都要为AI重写一遍的时候,说明AI的能力真的已经跨过了某个拐点。对我们普通开发者和内容创作者来说,这个拐点意味着:你手里那套“用AI干活”的方式,很快又会过时。
这种时候,最忌讳的就是把自己锁死在某一个模型上、某一个固定配置里。我现在的做法是,把鸡蛋放在“一个随时能切换的篮子”里——用 aadclaw.com 这类大模型API中转,Claude倍率1、官方原价1.5折,Claude、GPT、Gemini、DeepSeek全在一个入口,注册充值一下随时切过去。
说到底,AI能刷到99.9%是它的事;你能不能一直用上最好用的那个,是你的事。下一个考“发明”的考卷,AI能不能答出来,咱们拭目以待。
一站通达最新最强的AI模型
• Claude倍率1,官方原价仅1.5折
• 国内直连,不用翻墙
• 支持Claude/GPT/Gemini/DeepSeek主流模型
• 注册充值即用,随充随切
点我直达 aadclaw.com
你觉得AI离“真正的发明”还差多远?评论区聊聊。顺手点个“在看”,见证这场考卷重写的历史。

