导读美东时间 9 月 3 日(北京时间 9 月 4 日凌晨),OpenAI 发布旗舰 GPT-6 Astra,总裁 Brockman 以"Welcome to the AGI era"收尾。抛开"AGI 时代"的厂商自称,这代真正值得工程师看的是:OpenAI 第一次把旗舰押在"会用电脑把一整件事从头干完"上,撑起它的 Computer Use、Codex 运行框架与跨窗口记忆都不在单点跑分里。本文拆清真增量在哪一层,并说明读它的分数,为什么要先分清模型分和系统分。
旗舰换代,主角从"回答"换成了"干活"
美国当地时间 9 月 3 日,OpenAI 发布旗舰模型 GPT-6 Astra,同步给出了更高规格的 Astra Pro。官方定位说它"世界上最智能、最对齐",发布收尾时总裁 Greg Brockman 留下一句 "Welcome to the AGI era"。
图片来源:视觉中国
先分清这里的事实层级:AGI(通用人工智能)是行业里还没有公认量尺的愿景词,指能像人一样跨领域通用地学习、判断和执行任务的智能,与只会做单一专长的窄 AI 相对。把自家模型称作"AGI 时代的起点",是 OpenAI 管理层的判断,不等于行业已经确认 AGI 到来。可以核验的是产品本身的变化——而这次最明显的不是某个能力更强,是主角换了。过去几代旗舰的主语是回答问题:给一段话,还一段话或代码。Astra 的发布会把最大篇幅留给另一件事:直接操作电脑软件,把接收指令、调用工具、运行、看结果、再修改这整条链做完。规格也为它留足了空间:上下文 105 万 token、最大输出 12.8 万 token,模型 ID 为 gpt-6-astra,支持文本与图像输入。
"会干活"听起来像句口号,但它和"会生成内容"确实是两种东西。判断这代进步在哪,得先把这句话拆开:模型本身只占一半,另一半是它周围那套让它连续工作的系统。
分数多落在电脑操作上,差距不在多写几行代码
AI生成
先看证据落在哪。OpenAI 公布的口径里,最值得注意的是一组电脑操作成绩:OSWorld 2.0 的离线任务上,Astra 拿到 72.6%,上一代 GPT-5.6 Sol 是 65.7%;在加入真实延迟的模拟里,它完成一项任务平均约 40 分钟,Sol 约 75 分钟,缩短约 47%。
Computer Use(电脑操作)指模型直接看屏幕、用鼠标键盘操作通用图形界面,不必等每款软件为 AI 单独开发一套 API。Brockman 的理由是:绝大多数软件的通用接口本来就是给人用的屏幕、鼠标和键盘,模型够强就能像人一样直接用。这正是它和传统聊天机器的分界——人类交代目标和边界、检查结果,不用一步步教它点哪里。
更能说明"专业长任务"的是 Agents' Last Exam:把模型放进真实电脑环境,同时操作软件、终端和文件完成科研、工程、财务类长流程,Astra 得分 59.3%,超过 Claude Opus 5 的 55.5%;官方还称最高分设置下,它的输出 token 比 Opus 5 少约 65%。演示画面则更直观:Astra 打开 KiCad 从电路原理图完成 PCB 布局,先在 Blender 建模、再导进 Unreal Engine 5 生成能走进去的房屋。
这里有一条容易被漏掉的判断:这些成绩有一部分并不归模型管。OpenAI 同步更新了 Codex 的电脑操作运行框架,两者叠加后,在 Mind2Web 基准上的任务完成速度是当前 Sol 体验的 1.9 倍。换句话说,"会干活"是模型加系统共同交付的结果,不能都记到模型头上。
Codex 的跨窗口记忆,补的是"长任务做得下去"的短板
比单点分数更值得工程师注意的,是一个不在排行榜上的变化:Codex 的上下文管理方式。
过去长任务撞上上下文窗口上限,Codex 靠 compaction(压缩)把此前历史压成一份摘要。压一次就丢一层细节:某次修复为什么失败、用户最初设过什么限制、哪条测试已经跑过——这些恰恰是长时间 Agent 最容易翻车的点。Astra 上线后,Codex 可以把一路积累的关键信息写进跨窗口笔记,同时保留对早期上下文的搜索能力;即使某条需求没被写进摘要,模型也能回头从旧消息和工具输出里找出来。用工程语言说,这是给长时间运行的智能体补了一层外部记忆:重点内容主动记、完整历史需要时再查。这项能力目前是实验开关,在 Codex 的 config.toml 里打开 context_management 的 experimental_mode 即可,OpenAI 计划几周后把它设为默认。我们 9 月 2 日写"Agent 记忆分层"时说过,可靠设计要先分清模型级与系统级记忆——Astra 的跨窗口笔记,正是系统级记忆的一次产品落地。
配套的 Responses API 还多出几件 Agent 工程会直接用到的能力:异步函数调用(工具没返回时模型继续做别的)、任务中途转向(推理中注入新消息调整方向)、以及不破坏缓存地改变推理强度。OpenAI 工程师 Max Stoiber 还提醒:这代指令遵循太强,冗余规则反而削弱表现,建议删掉重写现有的 Agent.md——放到 Agent 工程里,这句经验很真实。
读它的分数,先分清"模型分"和"系统分"
发布会最抢眼的三个数字几乎都接近满分,但读数前要多问一句:这些是模型自己的,还是系统托起来的?
ARC-AGI-3(模型在陌生交互任务里边玩边学的能力)上 Astra 拿到 99.9%,人类测试者平均只有 48%。可 OpenAI 自己说明,这个成绩是在 Responses API 的 harness(运行框架)下跑的——框架负责记忆管理和上下文压缩,测的是一整套 Agent 系统,不只是基础模型。裸跑的上一代 Sol 在这个基准上只有 7.8%,OpenAI 估算把它放进同一套框架也只有三成左右。也就是说,99.9% 里有相当一部分是系统分。
长程编码的数字更直接。DeepSWE v1.1(在陌生代码库里把复杂工程问题从头做到尾)上,Astra 是 74.1%。对照我们 9 月 3 日那篇 Gemini 3.8 Flash 分析里引的 Google 官方口径:Gemini 3.8 Flash 73.7%、Claude Opus 5 74.0%。也就是说 Astra 对 Opus 5 只领先约 0.1 个百分点、对两天前谷歌发布的 3.8 Flash 领先约 0.4 个百分点——官方话术叫它"迄今最强软件工程模型",但从这张卷子看,它并没有把便宜旗舰甩开。
第三方数据提供了另一面。Artificial Analysis(经媒体转述)的智能指数里,Astra 的 61.2 与 Sol 的 60.9 接近、每任务输出 token 约少 10%;但官方价输入 10 美元、输出 50 美元每百万 token,是 Sol(4 美元 / 20 美元)的 2.5 倍,算下来单任务成本反而比 Sol 高约 75%。Coding Agent 指数 67.0,与 Claude Fable 5 和 Opus 5 接近。还有一处缺席值得留意:GDPval 是 OpenAI 自己衡量现实经济工作(覆盖 44 个职业、1320 项任务)的基准,这次没有出现在主要发布材料里。
把这些摆在一起,我的读法是:Astra 这代能信的新增,集中在"把长任务做完"这类系统级测量;任何单点"最强、满分"的数字,都要等独立复现。各家标题里写满的"碾压",反映的是厂商口径,不是已验证的全面领先。
这次没有一步放开,因为能力强到了"看得住"的关口
Astra 还有一个特殊之处:网络安全。它是 OpenAI 第一个在 Preparedness Framework(安全准备框架)里达到 Critical(关键级)门槛的模型——这个级别意味着模型能在基本无人协助下发现未知漏洞并构造可利用代码。
能力是实打实的:ExploitBench 上 Astra 拿到 100%,Sol 是 78.5%;针对近三个月新披露漏洞的内部测试里,OpenAI 称 Astra 表现远高于 Sol,测试中还发现并利用了此前未知的两个 V8 零日漏洞,已向维护者披露。更值得注意的是越界测试:在故意留下诱饵漏洞、任务又难以完成的场景里,无生产防护的 Sol 有 48% 的测试越界,Astra 是 0%。
正因能力到了这个级别,OpenAI 反而没有一步放开。公开版本会拒绝更高级的漏洞利用任务,最强能力只通过受限的 Daybreak 计划逐步向可信防守方开放;部署里加了未对齐监控,模型越界时系统可以暂停任务——代价是合法任务也可能被减速、暂停甚至需要用户确认。OpenAI 自己的说法是,能力越强,推理过程越难靠文字监控。对企业而言,要关心的维度从"模型会不会答错",扩展到了"它能操作什么、什么时候必须停下来"。
案例还太少,别把单点提升当成整体结论
最后泼一点必要的冷水。OpenAI 放出的真实客户样本还非常有限,而且单点案例很容易被夸大。法律科技公司 Legora 用 Astra 核对 41 份财务文件,几分钟找出全部 4 处预埋错误(包括收入附注里一处 50 万英镑的差额);但这家公司自己披露,Astra 在该流程上比前代快近 40%,放到全部智能体任务里平均只提升约 3%。这两个数字必须同时保留:它说明某些场景收益很大,也说明不能把单项结果推广成整体能力提升。游戏公司 Playco 的"一次产出三个可玩原型、人工修补少一半",同样是单点样本。
按 OpenAI 的时间表,Astra 今天先向参与 Daybreak 的部分组织开放,ChatGPT Plus、Pro、Business、Enterprise 以及 API、AWS 在未来几天陆续跟上。也就是说,发是发了,普通用户和 API 开发者现在还没有完整的独立实测入口。
回到开头那句"AGI 时代"。抛开修辞,GPT-6 Astra 真正的信号是:旗舰竞争的主场从"谁更聪明"挪到了"谁能把活干完",而这次 OpenAI 是押上整代旗舰、把跑分口径都换成任务级来讲这个故事。我们 9 月 3 日那篇 Gemini 3.8 Flash 分析里说过,陌生任务这类考卷比旧基准更值得盯;Astra 在 Terminal-bench 4.0 上自称 57.9%,对照 Google 口径的 Opus 5(51.8%),确实把旗舰侧的陌生任务缺口补上了一块。但长程编码没有甩开便宜 Flash、成本账反着算、样本还太少,都在提醒同一件事:判断这代 Agent 值不值得跟进,看的不是那张接近满分的表,而是三个更笨的问题——它能不能在自己的任务里稳定复现、分数里哪些是系统给的、把任务做完到底要花多少钱。
参考资料
OpenAI:GPT-6 Astra,A new generation of intelligence: https://openai.com/index/gpt-6-astra/
OpenAI Developers:GPT-6 Astra Model: https://developers.openai.com/api/docs/models/gpt-6-astra
OpenAI Deployment Safety Hub:GPT-6 Astra System Card: https://deploymentsafety.openai.com/gpt-6-astra
Google 官方博客:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber: https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
— THE END —
文章仅做学术分享,如有侵权请联系删除,非常感谢!

