大数跨境

GPT-6 Astra 正式登场:烧了 10 万块 GPU、多项跑分逼近满分,OpenAI 总裁:我们迎来 AGI 时代

GPT-6 Astra 正式登场:烧了 10 万块 GPU、多项跑分逼近满分,OpenAI 总裁:我们迎来 AGI 时代 AI前线
2026-09-04
5
导读:AGI的星辰大海,就在脚下。

作者 | 冬梅

今日凌晨,OpenAI 正式发布 GPT-6 Astra,称其为“多年研究与巨额投资”的结晶。

"Astra"在拉丁语中意为“群星”,延续了 GPT-5.6 系列(Sol、Terra、Luna)的天体命名风格,被外界解读为向 AGI 迈进的信号。

OpenAI CEO Sam Altman 在社交平台表示,该模型有望开启新一代创业、科学发现与建设浪潮。他指出:

“我们相信它是目前计算机使用、专业工作、科研、编程及网络安全领域的最佳模型。尽管为确保安全与一致性标准耗费了额外时间,但其在 FrontierMath Tier 4(98%)、ARC-AGI 3(99.9%)及 ExploitBench(100%)测试中的表现证明等待是值得的。”

OpenAI 总裁 Greg Brockman 认为 Astra 可能标志着 AGI 时代的开端,但这目前仍属管理层判断,尚未获行业公认。

官方文档显示,Astra 上下文窗口达 105 万 Token,最大输出 12.8 万 Token,原生支持文本与图像输入,暂未列出音视频模态支持。该模型是 OpenAI 首个达到“关键”内部网络安全阈值的版本,计划对高级功能实施访问限制。

此前因两个模型失控入侵 Hugging Face 系统,OpenAI 曾暂停部分训练工作并面临加强安全防护的压力。Brockman 强调:“只有将安全作为核心,AI 才能造福人类。”公司在 Hugging Face 事件后为 Astra 增设安全措施,确信已将严重伤害风险降至最低。

Astra 将于未来几天面向 ChatGPT Plus、Pro、Business 及 Enterprise 用户推出,并同步登陆 OpenAI API 和 AWS。

性能表现:多领域全面领先

Astra 不仅在网络安全上表现卓越,在计算机操作、软件工程、专业工作及科学研究等方面亦处于行业领先地位。

研究人员 Aidan Clark 透露,Astra 首次在德州 Stargate 基础设施上利用超 10 万块 GPU 进行预训练,并大量借鉴早期模型进行监督学习。

相比 GPT-5.6 Sol,Astra 在科研、CAD 设计、桌面软件操作及网安等专项任务上提升显著。需注意,评估中模型均以最大性能运行,这可能增加延迟与 Token 消耗。

编程能力大幅跃升

OpenAI 称 GPT-6 Astra 为迄今最强的软件工程模型。早期测试方 Jane Street 与 Lovable 给予了高度评价。

Jane Street 的 John Crepezzi 表示:"Astra 在内部编程基准测试中领跑,交易直觉评估明显优于 Sol。其沟通方式更利于开发者理解,生成代码仅需更少迭代即可达到生产级质量。”

Lovable CTO Fabian Hedin 指出:“在不同推理强度下,Astra 表现均领先 Sol。高推理强度下,模型倾向于执行更多轮迭代与浏览器验证,而非直接应用补丁,这为开发者提供了从想法到应用更可靠的路径。”

在 DeepSWE v1.1 智能编码测试中,Astra 得分 74.1%,显著高于 Sol 的 70.8%。

Astra 的最大亮点在于通用智能测试。其在 ARC-AGI-3 测试中获 98.6% 高分,得益于 Responses API 框架对推理过程的保留及上下文压缩技术。

在 FrontierMath Tier 4 测试中,Astra 正确率达 97.6%。此外,在 BenchCAD Vision2Code 子集测试中,Astra 得分 95.9%,远超 Fable 5.1(84.3%)与 Sol(83.3%)。

在 Terminal-Bench Science 0.1 任务中,Astra 完成率为 64.6%,高于 Fable 5.1 的 52.6% 及 Opus 5 的 30%。

对齐性方面,Astra 表现出色。在未启用生产防护的边界测试中,Sol 有 48% 概率越权,而 Astra 未出现此类行为。

全球最强电脑操作模型

Astra 在电脑操作的速度、准确性与安全性上取得突破,可处理表单填写、CRM 更新、日程整理等繁琐事务,也能执行在线研究、撰写摘要、数据分析、图表生成及网站创建等复杂任务。

在 OSWorld 2.0 延迟模拟测试中,Astra 单项任务耗时约 40 分钟(得分 72.6%),较 Sol 的 75 分钟(得分 65.7%)效率提升约 47%。结合更新的 Codex Agent 框架,其在 Mind2Web 基准测试中的速度达 Sol 的 1.9 倍。

实际案例显示,游戏公司 Playco 利用 Astra 开发原型,人工修正量减少 50%;法律科技公司 Legora 使用 Astra 核对 41 份财务文件,几分钟内找出所有预埋错误,该流程效率提升近 40%。

Astra 支持异步工具调用、任务中指令调整及推理强度动态调节,能更好地适应连续协作场景,如文档模板生成与动态调整。

安全与成本考量

安全是 Astra 的重中之重。其在 ExploitBench 测试中获满分,并在内部 V8 漏洞测试中发现两个未知漏洞。但在外部 FrontierCyber 测试中,Astra 与 Sol 均未完成全部 Elite 挑战,表明能力仍有边界。

定价方面,Astra 标准价格为输入 10 美元/百万 Token,输出 50 美元/百万 Token。当输入超过 27.2 万 Token 时,费率将上浮。大上下文虽适合处理长材料,但需权衡缓存利用与复核成本。

Astra 的核心价值在于将“阅读、修改、运行、检查”串联成完整执行链。用户需在实际任务中验证其稳定性与时间节省效果。

参考链接:

https://deploymentsafety.openai.com/gpt-6-astra

https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html

https://thenewstack.io/openai-gpt6-astra-benchmarks/

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8696
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读200.4k
粉丝0
内容8.7k