大数跨境

GPT‑6 Astra 实测

GPT‑6 Astra 实测 AI智能创作写作
2026-09-08
7

GPT-6 Astra 是 OpenAI 于 2026 年 9 月推出的旗舰大模型,聚焦智能代理、计算机操作、科研分析及复杂多步骤任务四大核心能力。

一、基准性能跑分

测试项

GPT‑6 Astra

GPT‑5.6 Sol

变化

Terminal‑Bench 4.0

57.9%

37.3%

+20.6pt

AutomationBench

41.4%

18.1%

+23.3pt

OSWorld2.0

72.6%

65.7%

+6.9pt

ScreenSpot‑Pro

92.7%

76.9%

+15.8pt

BenchCAD

95.9%

83.3%

+12.6pt

ARC‑AGI‑3

99.9%

-

接近人类基线

FrontierMath Tier4

98%

-

高阶数学

二、核心实测优势

1. 科研与终端工作流能力

基于 Terminal-Bench Science 0.1 测试,该模型可独立完成从数据集下载、清洗、仿真运算、模型拟合到报告撰写的全流程。其测试得分为 64.6%,显著优于 Claude Fable5.1 的 52.6%。

2. 3D 空间推理能力

在 MazeBench 3D 迷宫测试中,GPT-6 Astra 无需 Python 代码辅助即可达到 14% 的得分,略高于需代码辅助的 GPT-5.6 Sol(13%)。该模型能有效遍历三维场景,解决上代模型原地卡顿问题,支持 10-20 步批量规划推理,在降低 Token 消耗的同时,仅略微增加推理耗时。

3. 软件工程与代码能力

DeepSWE v1.1 测试得分为 74.1%。模型具备处理大型项目真实问题的能力,支持多文件联动修改及全链路调试,覆盖从需求解析、编码、测试、排查到交付的端到端开发流程,适用于 3D 建模、物理仿真及小程序开发。其短板在于底层编译器深度优化能力稍逊于 Claude Fable5.1。

4. 可视化操作能力

支持浏览器及桌面 GUI 全场景操作,能精准识别截图界面,执行按钮点击、表单填写及跨平台信息采集。ScreenSpot-Pro 测试成绩大幅提升,UI 元素识别与操作准确率显著优化。

5. 网络安全能力

ExploitBench 测试获满分 100%,达到 OpenAI 内部 Critical 安全等级。模型内置高强度安全拦截机制,识别高危任务时将主动暂停会话并触发人工确认流程。

三、实测短板与现存问题

参数固化:不支持自定义温度系数、核采样等核心参数,推理模式无法关闭。输出风格偏严谨保守,对创意发散类场景适配性较差。

响应延迟不稳定:复杂智能代理任务推理耗时大幅增加,批量处理场景下延迟最高提升 60%。

安全拦截误判:安全风控机制灵敏度过高,偶发拦截正常技术类任务导致会话中断。

权限推送混乱:版本上线初期存在权限分发异常,部分 Pro 用户无法正常解锁模型入口。

长文本记忆局限:虽具备百万级上下文支撑能力,但在超长文档处理中仍存在细节信息丢失情况,尚未实现完全无损记忆。

四、竞品横向对比

GPT-6 Astra 优势:三维空间推理、终端命令运算、系统自动化操作、高阶数学推理、长链路智能代理规划及全流程科研工作流。

Claude Fable 5.1 优势:底层深度代码优化、长篇文本创作能力及更高的内容创意自由度。

五、适用场景与适配边界

适配场景

  • 多步骤复杂智能代理自动化任务
  • 科研数据处理、仿真运算与报告产出
  • 电脑、浏览器全流程自动化操作
  • CAD 设计、三维场景辅助构思
  • 高阶数学推演、复杂逻辑推理
  • 大型工程项目故障排查与迭代优化
【声明】内容源于网络
0
0
AI智能创作写作
1234
内容 507
粉丝 1
AI智能创作写作 1234
总阅读41.2k
粉丝1
内容507