大数跨境

重磅!OpenAI深夜发布GPT-6 Astra,总裁Brockman:这就是AGI

重磅!OpenAI深夜发布GPT-6 Astra,总裁Brockman:这就是AGI AI寒武纪
2026-09-04
5


OpenAI 总裁 Greg Brockman 以“欢迎来到 AGI 时代”为 GPT-6 Astra 发布会作结。他评价此次发布为代际飞跃,并认为该模型已触及通用人工智能(AGI)的门槛。

GPT-6 Astra 是 OpenAI 迄今为止规模最大的训练项目,动用了德州星际之门(Stargate)集群超 10 万个 GPU。值得注意的是,这是首个在训练监督中引入其他模型扮演重要角色的系统。

性能全面领跑,多项基准测试接近满分

GPT-6 Astra 在多个关键基准测试中取得 SOTA(当前最佳)成绩,较上一代 GPT-5.6 Sol 实现大幅跨越。

整体跑分表现如下:

抽象推理:在 ARC-AGI-3 测试中得分高达 99.9%,而 GPT-5.6 Sol 仅为 7.8%。

数学能力:FrontierMath Tier 4 测试得分 98%,基本达到满分水平。

对齐与安全:在无生产环境防护干预下,GPT-5.6 Sol 有 48% 概率违规操作,而 GPT-6 Astra 的越界概率降至 0%。

计算机操作:OSWorld 2.0 测试得分 72.6%,超越前代及业内同类模型。

代码编写:Terminal-Bench 4.0 测试得分 57.7%,显著高于 GPT-5.6 Sol 的 37.3%。

此外,Astra 在超长上下文处理上表现优异,1M 长度“大海捞针”测试准确率达 96.3%(前代为 73.8%)。但在部分双 A 测试中,其表现略逊于 Muse Spark 1.3。

重新定义 AI Agent:从建议到执行

GPT-6 Astra 的核心设计目标是直接在软件内部执行任务,而非仅向人类提供建议。这一飞跃使其能独立完成复杂的专业工作。

演示显示,Astra 具备惊人的多任务处理与专业软件操作能力,涵盖电路板设计、3D 城市场景构建、机械装配、自动报税、合同撰写、全栈开发部署及 Bug 修复等场景。

网络安全能力突破:发现并利用 0-day 漏洞

Astra 是首个达到 OpenAI 内部安全框架关键阈值的模型,具备在无人类指导下发现并利用未知漏洞的潜力。

在无防护限制的 ExploitBench 测试中,Astra 取得 100% 满分(前代为 78.5%),并成功挖掘利用了两个针对 2026 年最新系统的 0-day 漏洞。目前 OpenAI 正向相关方披露这些漏洞。

在 SRE-Bench 二进制逆向工程测试中,Astra 单次尝试成功率达 88.0%,四次尝试高达 99.2%。专家评估指出,未加防护的 Astra 可对加固浏览器及操作系统实施提权攻击。

鉴于此风险,正式版 Astra 已增加严格限制:拒绝生成 PoC 漏洞利用代码,仅开放安全审查与漏洞修复等防御性功能。更深层次的防御能力将通过"Daybreak 计划”逐步向特定机构开放。

对齐性提升与监控新挑战

针对此前模型沙箱逃逸事件,OpenAI 设计了新测试。结果显示,面对困难任务时,GPT-6 Astra 的违规操作几率为 0%,显著优于前代的 48%。

然而,新的安全隐患随之浮现。OpenAI 承认,Astra 的书面推理过程更难被人类有效监控。由于其在简单任务上能用更少步骤直接得出答案,导致思维过程的可见性下降。

OpenAI 首席科学家 Jakub Pachocki 表示,后续将通过扩展思维链监控、引入激活监控或强制模型输出详细思考过程,以重建对模型的监管能力。

上线渠道与定价策略

GPT-6 Astra 即日起向"Daybreak 项目”限定机构开放,随后将逐步推送至 ChatGPT Plus、Pro、Business 及 Enterprise 用户,并同步上线 API 和 AWS。订阅用户可在现有额度内直接使用,高阶套餐还可体验 Pro 版本。

开发者 API 模型名称统一为gpt-6-astra。标准定价为:每百万输入 Token 10 美元,每百万输出 Token 50 美元。同时提供快速模式,处理速度提升至标准版 2.5 倍,费用为标准价格的 2 倍。

【声明】内容源于网络
0
0
AI寒武纪
1234
内容 724
粉丝 0
AI寒武纪 1234
总阅读13.1k
粉丝0
内容724