OpenAI 深夜发布 GPT-6 Astra,基准测试成绩逼近上限,电脑操作与长程任务能力显著跃升。面对 Anthropic 在 B 端市场的强势攻势及自身盈利压力,OpenAI 试图凭借更强的模型智能与 Agent 能力重夺主动权。本文深度拆解新模型核心亮点与当前竞争格局。
9 月 3 日凌晨,备受瞩目的 GPT-6 Astra 正式发布。此前半个月,OpenAI 已密集释放信号:8 月 18 日因评估模型达到网络安全"Critical"阈值而暂停部分训练以加强安全对齐;9 月 1 日披露安全评估详情。层层铺垫下,Astra 未发先热。
发布初期,GPT-6 Astra 仅向少量机构开放,Plus、Pro 等付费用户及 API 接口将分批逐步解锁。针对访问延迟,Codex 负责人 Tibo 提出补偿方案:用户每等待一天,将获得一次可延期使用的额度重置,以此缓解市场焦虑。
本次更新的核心突破在于两点:一是模型具备直接操作电脑的能力,二是处理复杂长程任务的智能显著提升。OpenAI 宣称 GPT-6 Astra 为目前最智能模型,在软件工程、科研、网络安全及专业工作领域全面超越 GPT-5.6 Sol,尤其在计算机交互方面进步巨大。
伴随性能提升,API 定价亦同步上调。GPT-6 Astra 输入价格为每百万 Token 10 美元,输出为 50 美元,是 GPT-5.6 Sol 的 2.5 倍,与 Anthropic 旗舰模型 Claude Fable 5.1 持平。此外,OpenAI 推出速度翻倍但价格翻倍的"Fast Mode"供用户选择。
OpenAI 总裁 Greg Brockman 在媒体沟通会上将此次升级定义为"AGI 时代的开端”。随着 OpenAI 与 Anthropic 均进入 IPO 筹备期,GPT-6 Astra 能否支撑起 AGI 愿景,并助 OpenAI 在激烈的商业竞争中突围,成为行业关注焦点。
01. 跑分接近上限,长程任务能力质的飞跃
GPT-6 Astra 的基准测试成绩呈现两极分化:部分高难度测试已触及天花板,而 Agent 类长程任务得分则大幅攀升。
在极限能力测试中,GPT-6 Astra 表现惊人:ARC-AGI-3(陌生环境推理)得分 99.9%,ExploitBench(漏洞利用构造)满分 100%,FrontierMath Tier 4 v2(高难数学推理)正确率达 97.6%。特别是 ARC-AGI-3,从年初前沿模型不足 1% 的得分率到如今接近满分,标志着该类任务已不再是顶级模型的瓶颈。
图源 / Artificial Analysis 官网
然而,第三方综合评测显示差距并未全面拉开。在 Artificial Analysis 最新智能指数中,GPT-6 Astra 最高推理档得分为 61 分,与上一代持平,排名第 5,略低于 Claude Fable 5.1 的 66 分。这表明其进步更多集中在特定垂直能力而非通用智能的全面碾压。
真正的增量体现在Agent 能力上,包括电脑操作、工具调用及长程任务执行。在科研工作流测试 Terminal-Bench Science 0.1 中,得分从 22.4% 飙升至 64.6%,接近上一代的三倍;其他自动化任务测试普遍提升约 20 个百分点。
电脑操作实用性显著增强:ScreenSpot-Pro 界面理解准确率从 76.9% 提升至 92.7%;OSWorld 2.0 任务完成耗时从平均 75 分钟缩短至 40 分钟,效率提升近 50%。
早期用户实测印证了官方数据。有开发者让 GPT-6 Astra 在虚幻引擎中构建曼哈顿虚拟场景,模型能持续运行一周,自主补充建筑细节并保持进度连贯;另有测试显示,模型在同时运行数百个 Agent 进行 3D 建模与游戏制作时,依然保持稳定。
02. 模型内生 Agent 化:电脑操作与自主决策
GPT-6 Astra 的两大变革——Computer Use(电脑操作)与Judgment(自主判断),正重新定义人机协作模式。
Computer Use让模型像人类一样“看屏操作”。通过截图识别界面,模型自主规划点击、输入等动作,形成“观察 - 决策 - 执行”闭环。相比传统 Agent 需依赖 API 或专用接口,该能力使模型能直接操作无接口的图形界面软件,填补了技术盲区。
图源/OpenAI 官网展示的寻找儿童医生演示
尽管此类能力此前已有探索(如 Anthropic 的 Computer Use 及 OpenAI 早期的 Operator),但 GPT-6 Astra 在延迟控制与操作精度上实现了质的突破。业内观点认为,随着基础模型逐渐内化看屏、调用工具等通用能力,Agent 层将趋于轻量化。但在金融、医疗等强专业领域,垂直 Agent 凭借领域知识与流程管理仍将保有核心价值。
Judgment机制则解决了自动化中的“过度打扰”难题。面对信息缺失,GPT-6 Astra 能自主评估问题重要性:非关键决策自行处理,关键节点才请求用户确认。这一机制大幅降低了长程任务的监督成本,使模型真正具备承接复杂工作流的能力。
03. 商业突围:OpenAI 的 B 端生死战
GPT-6 Astra 发布于大模型迭代最密集的窗口期。Anthropic、Google、Meta 均在同期推出新款模型,技术领先周期被极度压缩。对 OpenAI 而言,压力不仅来自竞品,更源于内部战略调整与盈利迫切性。
创始人 Sam Altman 坦承,过去一年 OpenAI 在多线作战中未能完全达成预期,目前已收缩战线,聚焦底层模型与 Codex 核心项目。公司亟需证明:不仅能打造最强模型,更能将其转化为可持续的商业收入。
消费端仍是 OpenAI 的护城河:ChatGPT 周活用户超 10 亿,付费订阅超 5000 万。但在 B 端市场,Anthropic 凭借 Claude Code 抢先占据 AI 编程与企业 Agent 高地。数据显示,今年 7 月 OpenAI 企业收入首次超越消费者收入,占比超 40%,服务客户数达 200 万。B 端已从增量业务转变为营收基本盘。
财务数据凸显竞争紧迫性:二季度 OpenAI 收入 67 亿美元(环比增 18%),但经营亏损扩至 123 亿美元;Anthropic 收入超 115 亿美元(环比翻倍)并实现小幅盈利,季度收入首超 OpenAI。尽管双方年化收入统计口径存在差异,但 Anthropic 在增长效率上的优势已向资本市场传递明确信号。两家公司均已秘密递交 IPO 申请,盈利效率将成为估值关键。
企业使用习惯正在变迁:Codex 生成的 Token 量在企业端占比已达 64%,表明需求正从简单问答转向复杂 Agent 任务。GPT-6 Astra 的升级逻辑正是为了承接这一趋势,将更强算力导向企业级应用。
随着 API 价格与竞品持平,OpenAI 必须证明其高价能带来更高的任务完成率与投资回报。面对未来几年预计高达 500 亿美元的算力投入,OpenAI 下一阶段的核心使命清晰明确:依托十亿级 C 端用户基础,全力追赶并在 B 端市场反超 Anthropic。
本文来自公众号:AIX财经 作者:雷晶

