大数跨境

OpenAI发布GPT-6 Astra! 5项能力反超Fable 5.1, 半只脚迈进AGI时代

OpenAI发布GPT-6 Astra! 5项能力反超Fable 5.1, 半只脚迈进AGI时代 刀哥聊AI
2026-09-04
2

AI 评测 · 刀哥聊AI

OpenAI发布新模型Astra,
5项能力反超Fable 5.1,
半只脚迈进AGI时代

9月3日,OpenAI突然放出 GPT-6 Astra。
“Welcome to the AGI era.”

昨晚,全球AI大宕机,大家都不工作了,跑到院子里乘凉聊闲,等着等着,OpenAI放出了 GPT-6 Astra,而且这次的宣传口气非常大:“Welcome to the AGI era.”

OpenAI直接把 Astra 称为目前最强的模型,并重点强调了 Computer Use、浏览器操作、软件工程、网络安全、科学研究和专业工作能力。

Astra 目前先向 Trusted Access Program 的企业组织开放,接下来几天陆续进入 ChatGPT Plus、Pro、Business、Enterprise 和 API。

问题来了!就在两天前,Anthropic 刚刚发布 Claude Fable 5.1(美国豆包发布的gemini 3.8无人问津,咱也不写了)。所以现在有趣的问题是 Astra 到底有没有超过 Fable 5.1?

看看宣传视频感受下:

口喷游戏、PPT、写文档、点外卖、购物、3D打印,看到这里,你是不是也想问:这就是AGI?国产AI不早就能点外卖了? 


真正的区别,其实在于能不能自主完成一整件复杂的事。Astra这次真正想秀的,是从浏览器、代码到专业软件的连续操作,以及任务做到一半还能自己调整。


我看了一圈数据,综合智力,Astra 没有全面赢。但在一些最关键的 Agent能力上,它确实把 Fable 5.1 甩开了一截。而这,可能才是这次发布真正值得关注的地方。


⚡ 划重点 

 Astra 综合智力 61分,Fable 5.1 65分,综合智力 Astra 反而输了

 但在 5 项关键 Agent 能力上,Astra 全面反超 Fable 5.1

 竞争正从"谁更聪明"变成"谁能把聪明变成行动"

Astra换赛道了

如果只看 Artificial Analysis 的独立 Intelligence Index,Astra 目前是 61分,而 Claude Fable 5.1 是 66分

(跟Fable 5.1比,有价格优势,后边会讲)


也就是说,综合智力这一项,Astra 反而输了。而且 Humanity's Last Exam 这类知识和研究型测试,Fable 5.1 目前也是 65.0%,Astra 是 57.2%。所以如果有人告诉你"GPT-6 Astra全面碾压Claude Fable 5.1",这句话并不严谨。

真正有意思的是另一张成绩单。Astra 在下面这 5项能力,都拿到了比 Fable 5.1 更高的成绩。这些不是一个简单的知识问答测试,它们越来越接近"给AI一个目标,它能不能自己把事情做完?"这就是 Astra 真正想抢的战场。

测试项
Astra
Fable 5.1
FrontierMath Tier 4 v2
97.6%
87.8%
Terminal-Bench Science 
58.2%
57.9%
AutomationBench
41.4%
31.4%
BenchCAD
95.9%
84.3%
DeepSWE v1.1
74%
74%

数学

先看最硬的一项。FrontierMath Tier 4 v2。这是目前非常难的一类数学测试。Astra:97.6%,Fable 5.1:87.8%。


不过FrontierMath 的测试设计、题目版本、私有题比例以及模型运行方式,都需要注意横向比较条件。尤其值得注意的是,Epoch AI公开说明,FrontierMath 的部分内容存在 OpenAI 资助和独家访问安排。

所以这个97.6%,更适合理解为Astra在高难数学推理上出现了非常明显的跃迁,而不是直接宣布AI已经解决了数学。真正值得期待的,是这类能力能不能继续向科学研究迁移。

科学研究

这个测试更加有意思。Terminal-Bench Science 。它不是简单地问模型"什么是量子力学?"而是给 Agent 一整套命令行科研任务,让它自己完成环境操作、文件处理、程序执行以及研究流程。Astra:58.2%,Fable 5.1:57.9%。


而 Fable 5.1 发布时,Anthropic其实已经把这个测试当成重点成绩,因为 Fable 5.1 相比 Fable 5 从24.7%直接提升到了52.6%。结果两天后,Astra又把它超过去了。

这个变化说明:AI竞争正在从 谁更会回答科研问题 变成 谁更会执行科研工作流。


真正的科研是:找数据 写程序 跑实验 看结果  出问题 改方案  再跑。如果 Agent 能自己跑这个循环,才开始真正触碰 科研助手 的边界。

 Coding

这可能是普通用户最关心的一项。毕竟过去几年,Coding Agent几乎就是Anthropic的主场。尤其是 Claude Code。现在 Astra 开始直接冲这个战场。

在 DeepSWE v1.1 上,Astra和Fable 5都到了74%,Fable 5.1还没有提交结果。


Astra要想解决的是:从需求 、 写代码 、 跑程序 、 看报错 、 修 Bug 、 再测试 、 最终交付。这其实就是我们已经很熟悉的 Claude Code 工作方式。

Astra 并没有重新发明 Agent。真正的竞争是:谁能把这个 Agent Loop 跑得更远、更稳、更省 token。Astra token消耗只有Fable的一半

Computer Use

这次 Astra 最值得关注的,它开始越来越像一个真的坐在电脑前工作的人。以前的AI是告诉你怎么操作Excel,现在的Agent是自己打开Excel然后操作。

Computer Use 的基本逻辑其实并不神秘:模型看屏幕 , 判断下一步 , 点击/输入 , 获得新画面 ,再推理。它本身没有一只实体的手,是通过 Computer Use 工具控制外部浏览器、桌面环境或隔离计算环境。

OpenAI已经把 Browser、Computer Use、Shell、文件和 MCP 等能力放进 Astra 的工具体系。

云端Browser和Computer Use示意



所以未来的AI,不再只是 LLM + Chat,开始变成 LLM + Tools + Computer + Agent Runtime。从会说,变成会干。而这才是数字员工真正的技术基础。

 Astra的异步工具调用

Astra它开始解决一个以前非常麻烦的问题:Agent为什么总是干到一半就崩?现实任务的工作流很复杂:输入 , 思考 , 工具A执行 , 等待 , 工具B执行 , 发现错误 , 重新规划 , 工具C执行 ,用户突然改需求 , 继续执行 ,检查结果 ,交付。

Astra增加的 Async Tool Calling,就是在解决这个问题。以前是调用工具 ,模型等着。现在是工具跑着,模型可以继续处理其他独立工作。

再加上 Mid-turn Steering,任务做到一半,用户突然说"别做这个方案了,换另外一个。"模型可以继续利用前面的工作,而不是整条任务链重新开始。这看起来像是一个小功能,其实非常重要。因为真正的Agent,不应该像一个只会执行Prompt的机器人。它应该像一个真正的员工,老板随时会改需求。

Async Tool Calling 示意:


Agent 不再是:思考 ,阻塞 , 思考 , 阻塞。


开始变成:思考 , 并发调度 , 持续推理 ,收集结果 ,合并状态


这其实已经非常接近一个操作系统式的 Agent Runtime。


Astra 把“工具执行期间模型还能继续做什么”直接变成了模型/API 的原生能力。

AutomationBench,AI开始碰真正的办公室

如果说 Computer Use 是让AI会操作电脑,那么 AutomationBench 测的就是AI能不能把办公室里的事情做完。OpenAI提供的数据里,Astra:41.4%,Fable 5.1:31.4%。这个差距非常值得关注。

真正商业化之后,没有人天天问AI"请给我解释一下什么是Transformer"。大家真正愿意付钱的是:"把这41份文件看完。""把这批客户资料整理好。""把这份财务数据检查一遍。""把报告做出来。""把网站部署上线。"

这就是为什么 Agent 对AI行业的意义越来越大。模型智商高10分,不一定值多少钱。但如果一个AI能替你干完半天工作,那就是实打实的钱。

那Astra到底是不是AGI?

OpenAI这次直接喊 Welcome to the AGI era. OpenAI总裁Greg Brockman也表示,未来回头看,人们可能会把 Astra 看成 AGI 时代的一个起点。

但我认为Astra ≠ AGI。至少现在没有足够证据支持这个结论。AGI真正难的地方,是给它一个陌生目标,它能不能自己解决?

那它为什么看起来比Fable 5.1更像AGI?

Fable 5.1 搭上 Claude Code,照样能搜能写能调用工具,Astra 能干的活它基本也都能干。

以前这些本事得靠外部框架(Agent Harness)硬拼出来,Astra 干的活是直接把这些能力塞进模型和 API 底层。一个是“大脑外挂一套操作系统”,另一个是“大脑自己长出了手脚”。


Astra它更像一个能自己闷头把事干完的独立个体。OpenAI要让大模型本身变成能跑 Agent 的核心引擎。这才是它看起来更接近 AGI 的真正原因。

价格?

价格表看上去,甚至有点"打平"。Astra:输入 $10 / 百万tokens,输出 $50 / 百万tokens。Fable 5.1:输入 $10 / 百万tokens,输出 $50 / 百万tokens。所以单纯看API标价,Astra一点都不便宜。

Fable 5.1 的缓存读取价格只有 $0.25 / 百万tokens,而 Astra 是 $1 / 百万tokens。也就是说,如果你做的是大量重复上下文、长时间Agent任务,Fable 5.1 的缓存机制反而更便宜。

但是Astra有另外一个优势:token效率。Artificial Analysis 的测试发现,Astra在 Coding Agent 工作中,完成类似任务需要的 token 明显更少。他们甚至给出了一个非常有意思的结论:Astra与Fable 5级别的Coding Agent性能相当,但单位任务成本不到一半。

这件事情非常重要,因为 Agent时代真正应该看的不是"一百万token多少钱?"而是"把同一件事干完,到底花多少钱?"一个模型单价很贵,但它10万token能把活干完。另一个模型看起来便宜,结果调用了80万token还没干完。最后谁便宜?根本不是看token单价就能决定的。

最后:我为什么说它半只脚迈进AGI时代?

AGI真正的门槛,是AI能不能稳定地独立完成真实世界任务。

Astra现在已经开始把几个关键能力串起来:理解、 推理 、 视觉 、 浏览器 、电脑操作  代码执行  工具调用 错误纠正 长期任务 和 最终交付。这条链一旦真正跑通,AI的角色就会发生变化。过去AI是工具,现在是助手,下一步是Agent,再下一步是数字员工。

而当一个AI可以独立完成大量具有经济价值的复杂工作时,我们距离真正意义上的AGI,才真的不远了。

所以刀哥对 Astra 的最终评价是:它干了一件非常重要的事:把"模型有多聪明",进一步推进到了"模型能独立干多少活"。这可能才是AGI真正该有的样子。

以前我们每天比谁的模型IQ更高,接下来真正应该比的,是谁能替你上班。

不上班,除了娱乐,我们应该做点什么有价值的事儿?

这是另一个大课题了。

💬 

你觉得 Astra 算半只脚迈进AGI吗?


【声明】内容源于网络
0
0
刀哥聊AI
大厂经历,出海视野,深耕AI圈。新鲜新闻、实用工具、硬核技术解读,有深度有实践,带你玩转AI。
内容 189
粉丝 0
刀哥聊AI 大厂经历,出海视野,深耕AI圈。新鲜新闻、实用工具、硬核技术解读,有深度有实践,带你玩转AI。
总阅读13.1k
粉丝0
内容189