大数跨境

刚刚,GPT-6 Astra降世!AGI测试干到几乎满分

刚刚,GPT-6 Astra降世!AGI测试干到几乎满分 智东西
2026-09-04
5
导读:OpenAI全面“狙击”Claude Fable 5.1。

OpenAI 发布 GPT-6 Astra,全面对标 Claude Fable 5.1。
作者 |  李水青
编辑 |  心缘
智东西 9 月 4 日报道,OpenAI 正式推出GPT-6 Astra,将其定义为当今全球“最智能、最均衡”的模型。OpenAI 联合创始人兼 CEO 萨姆·奥尔特曼(Sam Altman)表示,该模型在计算机应用、专业工作、科学研究、编程及网络安全等领域均达到最佳水平。
测试数据显示,GPT-6 Astra 在 FrontierMath Tier 4(数学推理)中获 97.6% 高分,ARC-AGI-3(通用智能)中获 99.9% 高分,ExploitBench(安全测试)中获 100% 满分。其在计算机操作、浏览器使用及复杂任务处理的速度、准确性与判断力上全面刷新纪录,整体表现超越 Anthropic 最新发布的 Claude Fable 5.1。
OpenAI 总裁格雷格・布罗克曼(Greg Brockman)透露,Astra 可能标志着"AGI 时代”的起点。市场反应热烈,舆论认为 OpenAI 借此重夺技术领先地位。
安全性方面,Astra 成为 OpenAI 首个达到 Preparedness Framework“关键级”网络安全阈值的模型。目前,该模型已向部分组织开放,并将陆续向 ChatGPT Plus、Pro、Business 及 Enterprise 用户推送,同时通过 OpenAI API 和 AWS 提供服务
定价策略上,GPT-6 Astra 标准版价格为前代旗舰 GPT-5.6 Sol 的 2.5 倍:输入 token 为 10 美元/百万,输出 token 为 50 美元/百万,与 Claude Fable 5.1 持平。此外,API 提供“快速模式”,处理速度提升至标准版的 2.5 倍,价格为标准版的 2 倍。

01. 全面对标 Fable 5.1:任务完成能力显著跃升

在 Terminal-Bench Science 0.1 测试中,GPT-6 Astra 以 64.6% 的得分领先 Claude Fable 5.1(52.6%),且预估 API 成本低约 31%。在低成本环境下,Astra 得分 61.1%,远超 GPT-5.6 Sol 的 22.4%。
ARC-AGI-3 测试显示,Astra 得分高达 99.9%,而人类平均得分仅为 48%。OpenAI 采用更贴近实际场景的响应 API 工具评估,估算 Sol 在此项测试中得分仅约 30%。
在 FrontiersMath 4 级高难度数学推理、Terminal-Bench 4.0 复杂终端任务(得分 57.9% 创历史新高)以及 AutomationBench 多步骤业务流程测试中,Astra 均取得优于竞品及前代模型的成绩,同时大幅降低 API 成本。
针对模型行为可控性,OpenAI 构建了新的评估体系。结果显示,在无生产环境安全措施下,GPT-5.6 Sol 有 48% 的概率超出授权范围,而 GPT-6 Astra 的发生率为 0%,显著提升了用户委托任务的信心。

02. 重塑“计算机使用”体验:速度与精度双重突破

OpenAI 宣称 Astra 是“世界上最好的计算机使用模型”,能够自主完成填写表单、更新 CRM、日程管理、在线研究、数据分析及网站 QA 检查等繁琐任务。
在 Agents' Last Exam 真实软件任务测试中,Astra 得分 59.3%,优于 Claude Opus 5 和 GPT-5.6 Sol,且输出 token 数量减少约 65%。ScreenSpot-Pro 高分辨率界面元素定位准确率达 92.7%,OSWorld 2.0 任务得分及效率均创历史新高。
实际应用案例显示,Astra 在 KiCad 中进行 PCB 布局仅需 15 秒;在金融建模世界杯挑战中速度是人类冠军的四倍;能利用 Unity 组装 3D 城市场景,或将书面简报转化为 FreeCAD 机械模型并制作动画。
结合更新的 Codex 框架,Astra 在 Mind2Web 基准测试中的任务完成速度比 GPT-5.6 Sol 快 1.9 倍,可在数分钟内完成儿科医生搜索、找房或车管所预约等生活任务。

03. 六大场景刷新纪录:部分任务成本最高降 86%

GPT-6 Astra 融合计算机使用技术与专业环境训练,在多项垂直领域表现卓越。BenchCAD 测试中,其几何重叠率达 95.9%,API 成本比 Sol 低 43%,比 Fable 5.1 低 86%。BrowseComp 深网搜索测试得分为 91.5%,同样具备成本优势。
在乐谱数字化任务中,Astra 将转录编辑距离误差从 0.813 降至 0.159,降幅达 81%。此外,它在生成结构化幻灯片、Blender 房屋建模转 Unreal Engine 5 场景等方面表现出色,并能更精准地理解用户意图,在信息缺失时做出合理假设或提出针对性问题。

04. 最佳软件工程模型:API 成本可降低六成

OpenAI 称 GPT-6 Astra 为迄今最佳的软件工程模型。在 Terminal-Bench 4.0 中得分 57.9%,API 成本较竞品降低 9%-63%。FrontierCode 1.1 Extended 测试中,其表现与 Claude Fable 5 持平,但成本低约 63%。
DeepSWE v1.1 真实代码库测试中,Astra 得分 74.1%,成本降低 32%。在数据库迁移等内部评估中,得分达 63.9%,远超竞品。Codex 中新引入的上下文保存机制,允许模型跨窗口保留注释细节,无需反复压缩,显著提升了长周期开发任务的效率。

05. 数学与科学评测全面领先

GPT-6 Astra 在科学发现与数学领域取得重大突破。GPQA Diamond(研究生水平科学推理)测试中得分 96.0%,成本降低 37%。HealthBench Professional(医疗临床响应)得分 63.4,成本降低 53%。
LifeSciBench 生命科学研究测试中,Astra 得分 60.3,性能与前代相当但成本降低 62%。由于安全限制,Claude 系列模型未参与此项评估。Astra 还能直接在专用软件中运行分析,如引导测序质量检查、构建细胞追踪工作流程等,辅助科研决策。

06. 结语:OpenAI 向 Anthropic 发起猛烈反击

GPT-6 Astra 的发布标志着 OpenAI 在大模型竞赛中重新确立领先身位。其在数十项权威评测中全面碾压前代模型,并在多项关键指标上超越 Claude Fable 5.1,同时大幅降低 API 成本,迫使竞争对手重新审视技术路线。
从应用价值看,Astra 推动 AI 从“对话工具”向“数字员工”实质跨越。其显著提升的安全性有望进一步打开企业级市场,这是 OpenAI 对 Anthropic 发起的强力反击。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11807
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读223.7k
粉丝0
内容11.8k