大数跨境

“AGI时代真的来了?”GPT-6 Astra正式发布,全面解析和使用指南来了!

“AGI时代真的来了?”GPT-6 Astra正式发布,全面解析和使用指南来了! 独立站Jason
2026-09-04
5
导读:GPT-6 Astra正式发布:ARC-AGI-3拿到99.9%,Computer Use大幅升级,还首次达到OpenAI的Critical网络安全能力阈值。这一次,AI可能真的开始从“回答问题”走向
今天凌晨,GPT-6 Astra 正式发布了。
说实话,现在大模型更新实在太快,我一开始也没太当回事。无非又是跑分涨一点、代码强一点、上下文再长一点,然后各家轮流坐几天世界第一的椅子。
结果把 OpenAI 这次放出来的资料看了一遍,我发现不太对。
ARC-AGI-3:99.9%。
ExploitBench:100%。
操作电脑、办公、编程、科研、安全能力几乎一起往前拱了一截。OpenAI 自己给它的评价也非常简单:目前最智能、最对齐的模型。
更狠的是,这次已经不只是“回答问题更聪明”。
它开始越来越像一个真的能把活接过去的人了。

01 GPT-6 Astra 基本信息

先把基本信息过一遍。
GPT-6 Astra 在 API 里的型号就是 gpt-6-astra,上下文窗口达到105 万 Token,最大输出 128K。API 标准价格是每百万 Token 输入 10 美元、输出 50 美元。
目前也不是所有人打开 ChatGPT 就能看到。OpenAI 先给部分机构开放,接下来几天会陆续推送给 Plus、Pro、Business、Enterprise 用户,同时进入 API、Azure 和 AWS Bedrock。Pro、Business 和 Enterprise 还会拿到 Astra Pro。
参数看完其实还好。
真正离谱的东西,都在后面。

02 目前最强的操作电脑模型

这次 OpenAI 直接把 Astra 叫做:
"The world's best computer use model。”
以前 AI 想替你干活,最好软件先有 API、MCP,大家把接口接好,它在底下跑。
现在 Astra 开始走另外一条路:没有接口?那我直接看屏幕自己点。
填网页表单、改 CRM、整理日历、网上查资料、做 Excel、写文档、测试网站,甚至安装软件以后自己排查问题,它都已经开始能做。OSWorld 2.0 做到 72.6%,上一代 GPT-5.6 Sol 是 65.7%,而且完成同类任务的模拟时间从 75 分钟压到了 40 分钟左右。
这个变化说白了特别简单。
以前你问 AI:
“这个东西怎么弄?”
它给你写一篇教程。
以后你可能直接说:
“这个东西你帮我弄完。”
然后它自己动手。
我觉得这才是这代模型真正开始变味的地方。

03 ARC-AGI-3 到了 99.9 分

然后就是这次最炸裂的数字:
99.9%。
上一代GPT-5.6 Sol在 ARC-AGI-3 上的成绩只有 7.8%,Astra 直接干到接近满分。ARC Prize Foundation 甚至表示,Astra 在 96% 的关卡上超过了他们的人类行动效率基线,在这项测试上基本达到人类水平。
ARC-AGI 比较特别,它不是问 AI 几个知道答案的问题,而是把它扔进一个陌生环境,不给说明书,让它自己试错、找规律,再想办法把任务完成。
所以 99.9% 不能简单理解成"AI 已经有 99.9% 的人类智力”,这么说肯定扯远了。
但从 7.8% 直接蹦到 99.9%,还是让我看了好几眼。
这多少有点不讲武德。
以前 AI 最让人着急的地方之一,就是换个没见过的场景突然开始犯傻。现在这一块,也正在被快速补上。

04 审美和判断力都变强了

这部分我反而觉得可能是大家以后天天能用到的。
以前 GPT 做 PPT、文档、网站,内容可以,审美嘛……很多时候确实一言难尽。
Astra 这次专门加强了所谓的视觉判断力。OpenAI 强调,它能按照你原来的模板去做 PPT、表格和文档,尽量保持原有版式、写作风格和视觉体系,而不是每次给你重新整一套"AI 风”。
另外一个变化更有意思:它开始知道什么时候应该自己决定,什么时候应该回来问你。
现实里老板给员工派活,哪有谁写 2000 字 Prompt?通常就一句:“明天开会的东西帮我准备一下。”
太笨的 Agent 会屁大点事都问你,另一种则是什么都不问,埋头干半天最后给你整一坨大的。
Astra 现在会自己补普通信息,但碰到真的会影响结果的决定,它才回来问你;在 Codex 里,甚至可以一边等你回复,一边把不受影响的部分继续干。
说人话就是:
小事自己处理,大事知道找老板。
这个能力看起来不起眼,但真当过老板的人应该知道,这种员工其实挺贵的。

05 第一个达到 Critical 网络安全等级的模型

最后一个能力,就开始有点吓人了。
GPT-6 Astra 是 OpenAI 第一个达到Critical 网络安全能力等级的模型。ExploitBench 直接做到 100%,而 GPT-5.6 Sol 是 78.5%。更夸张的是,OpenAI 说在评测过程中,Astra 还发现并利用了两个此前未知的零日漏洞,目前已经向维护方披露。
这时候问题就来了。
一个只会聊天的 AI 胡说八道,最多把你气一下。
但一个会操作电脑、会写代码、会找漏洞、还能自己连续推进任务的 Agent,如果跑偏了,那就是另外一个故事了。
所以 OpenAI 这次也在拼命给它加护栏。在这个专门测试模型会不会越过授权范围的评测里,GPT-5.6 Sol 在 48.2% 的测试中越过了授权目标,
而 Astra 是 0%。
有点像请了一个武功越来越高的高手回来。
以前你担心他能不能打。
现在你更关心:
这哥们到底听不听话。

写在最后

所以,GPT-6 Astra 是不是 AGI?
我现在还不敢直接拍桌子说:就是它了。
但这次看完以后,我确实有一种很明显的感觉:我们以前衡量 AI,总是在问“这个问题它会不会回答”。
现在正在慢慢变成:
“这件事情,我能不能直接交给它?”
这两个问题,看起来只差几个字,背后其实完全不是一个时代。
也许 AGI 根本不会像电影里那样,某天凌晨突然出现,然后全世界收到通知:
“各位,AGI 今天正式到了。”
#GPT6#GPT6Astra#ChatGPT#OpenAI#AGI
#人工智能#AI#AIAgent#大模型#科技

【声明】内容源于网络
0
0
独立站Jason
狼厂福建区域总监3年,5年创业经验,长期深耕在跨境电商独立站领域 ,家族式运营模式! 我负责项目方向,制定目标,截止2023年底,独立站10个店铺,月均10万美金GMV!坚持探索,乐于分享,保持正能量持续交流学习!
内容 318
粉丝 0
独立站Jason 独立站Jason 狼厂福建区域总监3年,5年创业经验,长期深耕在跨境电商独立站领域 ,家族式运营模式! 我负责项目方向,制定目标,截止2023年底,独立站10个店铺,月均10万美金GMV!坚持探索,乐于分享,保持正能量持续交流学习!
总阅读13.5k
粉丝0
内容318