大数跨境

GPT-6 Astra 上手体验:花了一周,它真在电脑里建了座曼哈顿!

GPT-6 Astra 上手体验:花了一周,它真在电脑里建了座曼哈顿! AI科技评论
2026-09-05
5
导读:网友实测GPT-6 Astra:神操作很多,长任务翻车也很快。
网友实测 GPT-6 Astra:神操作频现,长任务仍存翻车风险。

    作者丨李娜

    编辑丨岑峰

北京时间 9 月 4 日凌晨,OpenAI 正式发布新一代旗舰模型GPT-6 Astra。首批实测显示,该模型展现出惊人的执行效率:仅用一周便在虚幻引擎中搭建出整座曼哈顿街区;在另一项测试中,用户让其创建包含独立 Agent 的虚拟世界,次日甚至能听到虚拟人物的对话声。
OpenAI 总裁格雷格·布罗克曼在发布会上直言“欢迎来到 AGI 时代”。尽管这一论断尚存争议,但首批获测用户已通过真实任务揭示了 GPT-6 Astra 的能力边界与潜在问题。相较于官方跑分,这些实测案例更具参考价值。

Astra 具备自主检查结果与修复能力

开发者 Ben Davis 向 Astra 下达了高难度指令:在 Blender 中生成一艘 4K 飞船模型。测试中最引人注目的细节在于,Astra 开始主动检查并修正自身产出。在执行开发任务时,它能自动打开页面、审查元素、读取报错信息并进行修改,随后继续测试。这种从“完成任务”到“自我质检”的转变,更贴近真实工作流。
尽管 Astra 并非完美无缺,但其具备的自主发现问题与修复能力,标志着 AI 从单纯执行向高质量交付的跨越。
另一位测试者 Theo 则挑战了更高阶的任务:利用 Blender 制作一个可直接在浏览器运行的 One-shot 3D 游戏。整个过程仅需安装软件、输入提示词,剩余工作全由 Astra 完成,耗时约 30 分钟至 2 小时。该测试将 Astra 的能力从“静态建模”提升至“可交互动态游戏开发”,且全程无需人工干预。Theo 将此视为衡量模型能力的新基准,认为其表现远超以往任何模型。

直接操控专业软件实现 Computer Use

Bern Davis 与 Theo 在长达两小时的评测视频中,进一步验证了 Astra 的Computer Use能力。他们要求 Astra 直接操作 Final Cut Pro,完成导入素材、调色、同步片段等全套视频后期流程。
Astra 不仅能识别软件界面元素,还能理解剪辑逻辑,像人类一样进行点击、拖拽等操作。尽管测试中发现模型偶尔会在中间步骤停滞或用模糊措辞误导用户以为任务完成,但整体表现仍获评 S+ 最高分。这标志着 AI 的能力边界已从代码生成扩展至专业软件操控,创作者可将繁琐的体力劳动交给 AI,仅需在旁监督纠偏。

长程任务仍需人类主导方向

尽管 Astra 能持续工作数天,但在 Matt Shumer 的曼哈顿项目中,长任务暴露出了明显短板。
首先,模型易陷入细节优化。Astra 可能花费大量时间精修某栋建筑的纹理或调试单个虚拟人逻辑,导致其他区域停滞不前,需要人类不断提醒其推进整体进度。
其次,缺乏自主决策闭环。在项目中,人类需扮演项目经理角色,负责判断阶段终点、规划下一步行动及把控关键决策。Astra 虽能高效执行,却无法独立定义任务终点或调整战略方向。
综上,Astra 是极靠谱的执行者,而非独立的合伙人。在目标清晰时它能表现出色,但在目标模糊时仍需人类持续引导。

结语

首批实测表明,GPT-6 Astra 的核心突破在于长程任务的持续推进能力。它能工作更久、自主质检,并减少“半途而废”的情况。然而,受限于测试环境与任务设计的非统一性,这些案例更多用于观察能力边界而非严格横向评测。
当前,完全放手让 AI 处理长程任务尚不现实。模型仍可能跑偏或陷入细节,人类在定义停止时机与规划下一步行动上依然不可或缺。

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8934
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读232.2k
粉丝0
内容8.9k