大数跨境

刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!

刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来! AI零距离
2026-09-04
4

本文来自:程序员鱼皮

距离 GPT-5 发布仅过去一年,OpenAI 于昨日凌晨正式推出 GPT-6 Astra。官方将其定义为“全球最智能、最对齐”的模型。OpenAI 总裁 Greg Brockman 在媒体闭门会上表示:“现在认为我们已进入 AGI 时代,并非不合理的想法。”

目前,Astra 仅向部分安全厂商开放,普通订阅用户暂未获得权限,预计未来几天将陆续向 Plus、Pro、Business 及 Enterprise 用户推送。针对付费用户未能及时体验的情况,OpenAI 承诺按天补偿额度重置。

GPT-6 Astra 核心能力解析

此次升级的核心亮点在于“电脑操作能力”。GPT-6 Astra 被定位为“全球最强的电脑操作模型”,具备像人类一样观察屏幕、点击按钮、填写表单及应用交互的能力。

屏幕理解与操作基准测试

在 ScreenSpot-Pro 测试中,Astra 得分达 92.7%,远超上一代 GPT-5.6 Sol 的 76.9%。在更接近真实工作场景的 OSWorld 测试中,Astra 的任务完成率为 72.6%(Sol 为 65.7%),且平均耗时从 75 分钟缩短至 40 分钟。

ScreenSpot-Pro 跑分
OSWorld 跑分

通过直接识别屏幕界面进行操作,AI 无需依赖特定 API 即可适配各类软件,包括缺乏文档的遗留系统,这被视为极具实用价值的技术方向。

编程与逻辑推理突破

在 Terminal-Bench 4.0 测试中,Astra 得分 57.9%,显著高于 Sol 的 37.3% 及 Claude Fable 5.1 的 55.8%。

Terminal-Bench 4.0 跑分

最令人瞩目是 ARC-AGI-3 测试成绩。该测试旨在评估模型的悟性与规律发现能力,在无规则说明的情况下,Astra 取得了 99.9 分的惊人成绩,而人类平均分为 48 分,前代模型仅为 7.8 分。

ARC-AGI-3 跑分

数学能力方面,Astra 在 FrontierMath Tier 4 测试中取得 97.6% 的高分。

FrontierMath Tier 4 跑分

价格方面,API 模型 ID 为gpt-6-astra,输入价格为每百万 token 10 美元,输出为 50 美元,是上一代模型的 2.5 倍,与 Claude Fable 5.1 持平。

实战应用案例展示

官方展示了多个体现 Astra 实际操作能力的案例:

硬件设计与 3D 建模

Astra 能够独立操作 KiCad 软件,将电子原理图转换为可生产的电路板布线图。此外,它还能构建包含建筑、道路及车辆的完整 3D 城市场景,并支持从 Blender 导出至 Unreal Engine 5 生成可交互场景。

Astra 在 KiCad 里完成电路板布线
Astra 建出来的 3D 城市场景

游戏开发与程序化生成

官方演示了两个由 AI 生成的网页游戏:一是基于 Three.js 的卡丁车竞速游戏,赛道与场景均由代码实时生成;二是宇宙飞船船厂,可生成 1000 艘参数各异且不重复的飞船模型。

Tidal Rush 卡丁车游戏的实际画面
飞船船厂里 1000 艘飞船的图鉴

社区测试反馈

早期测试者 Matt Shumer 利用 Astra 在 Unreal Engine 中构建了拥有自主交互角色的虚拟世界;一位免疫学教授仅用一句指令,便让 Astra 生成了包含框架、画面及配音的完整教学视频,效果备受赞誉。

提示词工程启示

OpenAI 开发者展示馆公开了多个项目的原始提示词,其中两点经验值得借鉴:一是要求 AI 自行验收(Loop Engineering),即运行构建、测试并修复错误;二是“先画图再写代码”,通过文生图确定视觉风格后再进行开发。

OpenAI 官方开发者展示馆
Run build and lint, then play several runs in the browser to verify collisions, scoring, failure, and restart with no console errors.
Glass Towers 玻璃塔游戏
MiniTown 小镇模拟游戏
Terrain Mixer 程序化地形生成器

AGI 时代的理性审视

尽管官方宣传强劲,第三方评测机构 Artificial Analysis 给出了不同观点。其综合智能指数显示,Astra 得分为 61 分,与上一代持平,甚至略低于 Claude Fable 5.1。同时,Astra 的单任务成本约为 1.67 美元,较前代几乎翻倍。

Artificial Analysis 的独立评测

“全球最强”的结论在特定测试集中成立,但在综合维度上仍存争议。此外,模型发布后常经历性能波动调整也是行业常态。随着后续权限开放,更多实战测试结果值得期待。

- END -
【声明】内容源于网络
0
0
AI零距离
AI零距离
内容 3603
粉丝 0
AI零距离 AI零距离
总阅读134.9k
粉丝0
内容3.6k