新智元报道

AGI 的战火未熄,新一轮竞赛已然开启。GPT-6 Astra 一经发布便横扫各大榜单。今日,最新的 3D 空间推理基准 MazeBench 放榜,Astra 历经 60 余小时测试,以 14% 的得分再次位居榜首。
英伟达 CEO 黄仁勋亲自背书,认证 OpenAI 为全球首个实现 AGI 的团队。在 GPT-6 Astra 带来的震撼之余,大量创新应用案例接踵而至:从构建细胞模型、视频分析设计零件,到频谱图声音识别,展现了其强大的多模态能力。这仅是基于 10 万张 GPU 训练的成果,未来算力升级后的潜力不可估量。
GPT-6 屠榜空间推理,刷新 14% 最高分
MazeBench 是由 Jonathan Pappas 和 David Pappas 于 7 月底推出的 3D 世界推理测试平台。
MazeBench 世界俯瞰图,黄色代表智能体
该测试包含 200 多个房间及 100 颗宝石(每颗 1 分,满分 100)。场景内布满推箱子谜题、电梯砖、可开关墙壁及冰面等复杂机制。一旦陷入困境,智能体需通过撤销、重置或传送回已知房间来尝试突破。
绿色代表玩家,蓝色代表箱子。例如特定关卡中,需将蓝色箱子推入黑色深渊以搭建桥梁方可通行。
相机支持上下左右旋转,提供 20 个不同视角的场景观察。宝石往往隐藏在特定视角的盲区。
左:3D 视角;右:模型实际接收的文本信息
模型通过 MCP 协议仅能调用 11 个动作(4 个移动、4 个相机旋转、撤销、重置及传送)。测试难点在于单题往往需规划百步以上,且为真 3D 环境,同一墙体在不同视角下呈现各异。7 月底发布初期,即便是启用 Python 辅助的 GPT-5.6 Sol 也仅获 13%,Fable 5 为 11%,Opus 5 为 9%;若不使用 Python,所有模型得分均不足 1%。
GPT-6 Astra 在未使用 Python 的情况下,直接斩获 14% 的得分,标志着其在 3D 空间推理能力上与其他 Agent 拉开了代差。
探索热力图对比显示,Fable 5.1 仅在局部区域徘徊,而 Astra 几乎遍历了整个地图。
为优化 Token 消耗,测试团队让 GPT-6 采用“批量出招”模式,即一次性规划未来 10 至 20 步行动。此举将原本需消耗的 30 亿 Token 大幅降至 3.5 亿。在华容道测试中,该模式使成本降低三分之二,但思考时间增加了六成。
尽管表现卓越,Astra 在 MazeBench 上仍面临挑战。虽然在 ARC-AGI 3 中得分高达 99.9%,但在 MazeBench 上仅收集到 14 颗宝石。主要原因在于其 3D 空间理解存在偏科:倾向于俯视视角,导致部分侧视可见的墙体被忽略;在面对超过三层高的方块堆叠谜题时,表现尚显不足。
除基准测试外,全球开发者已将 GPT-6 Astra 应用于各类实际任务,展现出多样化的创新玩法。
Astra 全新应用场景爆发
OpenAI 总裁 Greg 近日集中转发了多个 GPT-6 Astra 的惊艳演示,这些案例并非单纯炫技,而是切实解决现实问题。
淋浴地漏头发清理方案自动化
开发者 Daniel Griesser 分享了他利用 Astra 解决浴室地漏堵塞问题的经历。他录制了一段 4 分钟视频,展示地漏结构并使用数显卡尺测量零件尺寸,随后将视频发送给 Astra Ultra 寻求解决方案。
Astra 精准拆解视频内容,同步语音描述与画面帧,不仅给出了清理毛发的设计方案,还生成交互式草图供确认。确认无误后,Daniel 指令 Astra 通过“计算机使用”功能接管电脑,自动打开 Fusion 360 进行全参数化建模。最终打印出的零件一次安装成功,完美贴合。
上下滑动查看
3D 分子交互与一键模拟
开发者 Andrew Aiginin 利用 Astra 构建了细胞模型,并让其解释药物 Ozempic(司美格鲁肽)的作用机理。仅用 1 小时,Astra 便生成了一个包含 11 个章节的交互式分子旅程演示,涵盖从 GLP-1 受体结合到胰岛素登场的全过程。
演示中右侧为可自由旋转缩放的 3D 分子模型,左侧实时显示受体激活数量,交互体验极佳。
频谱图识别声音
GPT-6 Astra 展现了“看图猜音”的能力。网友 Max 提供了一张梅尔频谱图(无音频),要求模型识别声音来源。Astra 迅速判断出这是狗叫声,甚至还原了叫声节奏(woof-woof, woof…),并从低频主体、共振带及高频边缘等声学特征进行了专业解释。
|
|
零样本推理,仅开启轻量级模式
在另一项测试中,Astra 通过频谱图准确描述了光剑点火、嗡鸣及熄灭的画面感,展现了惊人的多模态联想能力。
48 关验证码一次性通过
Astra 还轻松攻克了 neal.fun 网站上的"I'm Not a Robot"游戏。该游戏包含 48 关日益复杂的验证码(如区分吉娃娃与松饼、消防栓排序、嵌套网格计数等),人类用户常难以通关。开发者 Sharif Shameem 让 Astra 挑战,结果一次性全部通过。
这一成绩引发网友热议“验证码已死”,甚至连游戏原作者 Neal Agarwal 也现身表示无奈。
此外,还有开发者利用 Astra 在 Blender 中复刻了迈克尔·杰克逊的经典舞步。
随着各类 Demo 的涌现,人们对 Astra 潜力的认知正被不断刷新。
AGI 已至,唯余 ASI 赛道
GPT-6 Astra 的问世令黄仁勋感叹"AGI 已来”。当下争论其是否算作“真 AGI"已非重点,关键在于 AI 竞赛坐标轴的转移:从“谁先抵达 AGI"转向“谁能实现智能自我加速”。
当前格局中,AI 已开始编写代码、训练下一代模型,并担任研究实习生角色。OpenAI 的 Bel 项目与 Anthropic 的神秘 Model 2 也在酝酿之中。
AGI 竞逐暂告段落,长夜之后唯有 ASI(超级人工智能)赛道。新智元官网推出了"ASI 坐标系”,旨在重新定义衡量标准:AGI 是能力线,而 RSI 代表加速度曲线。
最新周榜数据显示:GPT-6 Astra 以 90.3 分领跑,Fable 5.1 得分为 84.0,Gemini 3.8 Flash 为 73.8。在总榜中,Claude Opus 5 以 89.2 分居首,GPT-5.6 Sol Xhigh 紧随其后为 89.0 分。待周三矩阵重构,Astra 有望登顶总榜。
旧有的标尺已无法丈量新纪元的智能巨兽。AGI 视界已被跨越,在 ASI 的最终城池内,新时代正在开启。
参考资料:
https://x.com/kimmonismus/status/2096990559264993449
https://x.com/gdb/status/2096998038443348263
https://mazebench.com/
编辑:摩西 桃子



