当地时间 9 月 3 日,OpenAI 正式发布新一代前沿模型 GPT-6 Astra。总裁布洛克曼以“欢迎来到 AGI 时代”为发布会定调。相较于各项跑分数据,更值得关注的是:Astra 成为 OpenAI 首个网络安全能力被评定为“关键级”的模型。
从“会回答”进化为“会干活”
OpenAI 将 Astra 定位为“全球最智能且对齐程度最高”的模型,其核心能力聚焦于计算机操作、软件工程、科学研究与网络安全四大领域。
此次迭代的本质区别在于任务形态的转变。
过往模型主要承担回答、生成及工具调用职能,而 Astra 具备了闭环执行能力:从接收指令、操作软件,到依据结果动态调整后续动作,实现全流程自动化。
演示显示,Astra 可独立完成在线表格填写、客户记录更新及日历整理;在电子设计领域,它能在 KiCad 中从原理图绘制直通布线完成,全程仅耗时 15 秒。
核心基准测试数据解读
Astra 在多项关键基准测试中展现出显著的性能跃升:
- 前沿数学研究(FrontierMath Tier 4):得分从 GPT-5.6 Sol 的 83.0% 提升至 97.6%。
- 抽象推理(ARC-AGI-3):成绩由 7.8% 剧增至 99.9%,展现出极强的陌生环境学习与推理能力。
- 终端任务(Terminal-Bench 4.0):从 37.3% 上升至 57.9%。
- 计算机操作(OSWorld 2.0):从 65.7% 提升至 72.6%。
除准确率外,任务执行效率亦大幅提升。在模拟真实延迟环境下,Astra 单任务平均耗时约 40 分钟,较 GPT-5.6 Sol 的 75 分钟缩短了约 47%。
网络安全能力触发“刹车”机制
本次发布的最显著特征在于网络安全维度的突破。OpenAI 官方确认,Astra 已达到其准备框架中的“关键级”网络安全能力阈值,系公司首款获此评级的模型。
该评级标准严苛:模型在配备工具与访问权限后,无需人工逐步指导,即可在防护严密的系统中自主发现未知漏洞并制定利用方案。
在 ExploitBench 测试中,Astra 取得 100% 的满分成绩,而上一代模型仅为 78.5%。在内部近三个月的新漏洞测试中,Astra 甚至发现并利用了两个此前未公开的零日漏洞,OpenAI 已向相关方披露。
鉴于其强大的攻防潜力,OpenAI 已推迟部分开发与发布计划以加固防护。目前,高级网络安全能力仅向"Daybreak"项目的部分企业与组织开放。
与此同时,模型的对齐数据同步优化。内部幻觉基准率从 12.2% 降至 4.2%,计算机不当行为率从 22.0% 骤降至 2.4%。在无生产环境安全措施的测试中,GPT-5.6 Sol 有 48% 的概率突破授权目标,而 Astra 则为 0%。
定价策略与成本核算
Astra 的定价幅度显著上调。标准接口价格为每百万输入 Token 10 美元、输出 Token 50 美元,相较上一代的 4 美元与 20 美元,涨幅达 2.5 倍。
发布初期仅面向"Daybreak"企业用户,随后数日内将覆盖 Plus、Pro、商业版及企业版订阅用户,并同步上线 API 及亚马逊云科技平台。
针对价格上涨,OpenAI 提出新的成本核算逻辑:虽然单价提升,但单任务耗时大幅压缩(从 75 分钟减至 40 分钟),且减少了反复返工与人工修正环节,综合总成本未必增加。
不过,第三方机构 Artificial Analysis 测算显示,单任务成本实际较上一代高出约 75%。哪种算法更贴近真实业务场景,仍有待市场验证。
技术架构与行业信号
Astra 的焦点在短时间内从“性能强度”转向“安全性”,这一变化本身即释放重要信号。据《The Information》报道,该模型可能采用了“循环深度”架构,使模型在输出下一个 Token 前完成更多内部计算,实现“少说多想”。
尽管 OpenAI 尚未公开确认该架构细节,但现有迹象表明报道可信。若属实,这将带来可监控性挑战:首席科学家雅库布·帕乔基指出,模型使用更少的自然语言推理 Token 解决复杂问题,可能导致人类更难通过文本研判其具体决策过程。
对于“这是否算 AGI"的提问,布洛克曼未予直接定义,仅强调这是“一段旅程的开始,而非终点”。

