大数跨境

GPT-6把AI考卷刷爆,考官被迫出题:下一关考发明

GPT-6把AI考卷刷爆,考官被迫出题:下一关考发明 蓝核AI
2026-09-17
3
导读:GPT-6把ARC-AGI考到99.9%,考官却说这不代表A
AI能力正在指数级刷新——想第一时间上手最新最强的模型?来 aadclaw.com,Claude/GPT/Gemini/DeepSeek一站通达,Claude倍率1、官方原价1.5折,国内直连即用。

AI把考卷刷到接近满分之后,下一张考卷,还能考什么?这个问题,现在成了AI圈最热闹的悬案。

起因是GPT-6 Astra在ARC-AGI-3这个半私有测试集上,拿下了99.9%的成绩。OpenAI官方的说法很拽:已经完全“饱和”了。

不知道的以为AI真把逻辑推理练到头了,懂的都知道——这里面水很深。

ARC-AGI是专门用来测“泛化能力”的标杆测试,前两代的核心就俩字:看图找规律。给AI几组“输入→输出”的小方格图,让它猜规则,再画出新一组的输出。到了三代,GPT-6 Astra直接被丢进一个游戏世界,1000多个关卡里自己玩、自己试、自己找规则,96%的关卡用比人类中位数更少的步数完成任务。

ARC Prize的评价是“阶跃式的能力变化”——顺带补了一句刺耳的:基准饱和,并不等于证明了AGI。但真正的好戏在后面:GPT-6 Astra的99.9%,不是靠“更聪明”刷出来的,而是靠一个叫Provider Adapter的东西。同一套权重、同一组题目,标准测试框架下只有62.7%,接入适配器后飙到99.9%——差了36个百分点。Claude Opus也从30%能到95.5%。

原来榜单上的“分数大战”,有相当一部分比的是“谁的架子搭得好”,不是“谁脑子更好使”。

于是争论彻底跑偏了:从“哪家模型泛化能力更强”,变成“哪个harness更公平”。ARC-AGI-3的“饱和”,更像是一场评测工程学事件。也正是因为这样,ARC Prize创始人François Chollet掏出了下一代的蓝图。

ARC-AGI-4,明年Q1如期登场,主打更长尺度下的持续学习与课程学习。真正重磅的,是被他形容为“人类最后考卷”的ARC-AGI-5——核心就俩字:发明。开放式发明,让AI自己提出新的任务、新的规则、新的解法。

Chollet甚至放话:当AI的学习效率与人类再无客观测量差距时,那便是真正的AGI时刻。他还补了一句更狠的:ARC系列考题,大概在第6、7代就终结了。

考“找规律”,AI已经卷到近乎满分;下一步考“发明”,等于把天花板直接掀了。

说句心里话,这个节点挺有象征意义的——当评测标准都要为AI重写一遍的时候,说明AI的能力真的已经跨过了某个拐点。对我们普通开发者和内容创作者来说,这个拐点意味着:你手里那套“用AI干活”的方式,很快又会过时。

这种时候,最忌讳的就是把自己锁死在某一个模型上、某一个固定配置里。我现在的做法是,把鸡蛋放在“一个随时能切换的篮子”里——用 aadclaw.com 这类大模型API中转,Claude倍率1、官方原价1.5折,Claude、GPT、Gemini、DeepSeek全在一个入口,注册充值一下随时切过去。

说到底,AI能刷到99.9%是它的事;你能不能一直用上最好用的那个,是你的事。下一个考“发明”的考卷,AI能不能答出来,咱们拭目以待。

一站通达最新最强的AI模型

• Claude倍率1,官方原价仅1.5折

• 国内直连,不用翻墙

• 支持Claude/GPT/Gemini/DeepSeek主流模型

• 注册充值即用,随充随切

点我直达 aadclaw.com

你觉得AI离“真正的发明”还差多远?评论区聊聊。顺手点个“在看”,见证这场考卷重写的历史。

【声明】内容源于网络
0
0
蓝核AI
我们的公众号致力于为您提供AI领域的最新动态和热门话题,涵盖人工智能技术进展、行业应用案例、趋势分析等内容。无论您是AI爱好者、从业者还是普通用户,都能在这里获取到有价值的信息。让我们一起探索AI的无限可能,共同见证科技的发展!
内容 119
粉丝 0
蓝核AI 我们的公众号致力于为您提供AI领域的最新动态和热门话题,涵盖人工智能技术进展、行业应用案例、趋势分析等内容。无论您是AI爱好者、从业者还是普通用户,都能在这里获取到有价值的信息。让我们一起探索AI的无限可能,共同见证科技的发展!
总阅读1.3k
粉丝0
内容119