GPT-6 Astra 正式发布:OpenAI 宣告 AGI 时代来临
OpenAI 正式发布 GPT-6 Astra 及 GPT-6 Astra Pro。官方将其定义为世界上最智能、最协调的模型,在计算机操作(Computer Use)、浏览器使用、软件工程、网络安全及专业工作领域树立了新标杆。
GPT-6 Astra 是世界上最智能、最协调的模型,为 Computer use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。
发布会尾声,OpenAI 总裁 Greg Brockman 直言:“欢迎来到 AGI 时代。”这标志着人工智能系统的综合智力被认为已超越人类。
此次发布毫不低调,训练规模与能力全面升级。Astra 是 OpenAI 史上最大规模的训练任务,动用德州 Stargate 园区超 10 万块 GPU 完成预训练,并首次由前代模型深度参与训练监督。
API 定价同步公布:
- 输入:10 美元/百万 token
- 输出:50 美元/百万 token
该价格约为 GPT-5.6 Sol 的 2.5 倍,与 Fable 5.1 持平。(注:GPT-5.6 Sol 当前官方价为输入 4 美元、输出 20 美元/百万 token)
基准测试接近“饱和”
GPT-6 Astra 的核心突破在于从“回答问题”进化为“直接完成工作”。它不仅能生成文本或代码,更能操作电脑和浏览器,跨软件执行多步骤任务,最终交付文档、表格、演示文稿甚至工程项目。
其测试成绩表现惊人,尤其在以下三项:
- FrontierMath Tier 4 v2(高难数学):97.6%
- ARC-AGI-3(陌生环境推理):99.9%(上一代 GPT-5.6 Sol 仅为 7.8%)
- ExploitBench(漏洞利用):100%
ARC-AGI-3 测试要求模型在无规则说明下,于陌生二维游戏中摸索通关。Astra 的高分证明其具备极强的自主探索和规则学习能力。需注意,该成绩基于 OpenAI 的 Responses API Harness 框架运行,包含记忆管理和 Agent 框架带来的增益。
编程与科学能力大幅跃升
在编程领域,Astra 于 Terminal-Bench 4.0 取得 57.7%,DeepSWE v1.1 取得 74.1%,均超越 Fable 5.1 与 GPT-5.6 Sol。
数理方面,FrontierMath Tier 4 v2 得分 97.6%;研究生级科学问答 GPQA Diamond 达 96%,略高于 Gemini 3.8 Flash。
Agent 实战能力显著增强
Astra 将代码能力与 Computer Use 深度融合,能在终端和开发工具中执行、测试并修正代码。在模拟真实工作的 Agents' Last Exam 测试中,Astra 得分 59.3%,优于 GPT-5.6 Sol 和 Claude Opus 5。
在贴近办公流程的 AutomationBench 测试中,Astra 成绩从上一代的 18.1% 大幅提升至 41.4%。该测试同时考量任务完成率与 API 成本,Astra 在不同成本设置下均表现优异。
OSWorld 2.0 测试显示,Astra 离线操作准确率达 72.6%,且单项任务平均耗时约 40 分钟,较 Sol 的 75 分钟减少约 47%。OpenAI 强调,衡量模型价值的关键指标应是“完成任务的总成本”,而非单纯的 Token 单价。
网络安全能力与安全边界
Astra 在网络安全领域表现突出,ExploitBench 获满分,ExploitGym 提升至 42.4%。面对近三个月的新漏洞,其成功率达 39%,并发现了两个未知的 V8 零日漏洞。
在安全边界测试中,即便面对诱导性漏洞,Astra 的越界行为率为 0%,远低于 GPT-5.6 Sol 的 48.2%,显示出更强的合规意识。
真实场景应用演示
自主操作专业软件
在电子工程案例中,Astra 能直接进入 KiCad,根据原理图完成 PCB 布局、元器件放置及铜线连接,生成可制造电路板。
在三维建模场景中,Astra 可在 Blender 中建立房屋模型并导入 Unreal Engine 5,生成可自由行走的三维空间,跨越了不同软件与文件格式的限制。
此外,Astra 还能制作赛车游戏等复杂项目。
高质量办公产出
Astra 可根据企业现有模板制作演示文稿,不仅填充内容,还能完美复刻版式、视觉风格及叙事结构,实现“交付即用”。
高效信息检索与处理
Astra 能将数小时的人类搜索任务压缩至几分钟。例如在儿科医生搜索任务中,Astra 用时不到 3 分钟,而人类平均需 5 小时。其核心优势在于直接通过屏幕、鼠标和键盘操作通用软件界面,无需为每款软件开发专用 API。
Codex 长任务处理能力升级
针对长程任务,Codex 结合 Astra 实现了跨上下文窗口的信息保存与检索,解决了传统压缩机制导致的关键细节丢失问题。新框架支持模型在工作中主动补问信息,仅在关键决策点暂停等待确认。
在 Mind2Web 测试中,新框架配合 Astra 的任务完成速度是当前 GPT-5.6 Sol 体验的 1.9 倍。
企业实测反馈
目前 Astra 已在部分企业开展测试。法律 AI 平台 Legora 利用 Astra 几分钟内核对 41 份财务文件,精准找出所有预设错误,效率提升近 40%。游戏公司 Playco 则使用 Astra 在 Unity 和 Godot 中快速生成多个可玩原型,人工修补工作量减少一半。
Astra 将向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,Astra Pro 面向 Pro 及以上用户,普通免费用户暂不可用。
AGI 时代的开启
Greg Brockman 坚信世界已进入 AGI 时代,认为未来回望时,Astra 将是这一起点的标志。相较于 GPT-4 时期仅能绘制简易 LaTeX 图形,GPT-6 已能生成极高保真度的代码绘图,展现了质的飞跃。
再过几年,当我们回头追问 AGI 究竟诞生于何时,答案很可能就是现在,而 Astra 或许就是那个起点。
随着 OpenAI 将技术门槛推向新高度,业界对 Anthropic 等竞争对手的后续动作充满期待。
参考链接:
- https://x.com/OpenAI/status/2095595741528125780
- https://openai.com/index/gpt-6-astra/
- https://x.com/birdabo/status/2095526371841958047

