大数跨境

刚刚,OpenAI发布“地球最强大模型”GPT-6:欢迎进入AGI时代!山姆·奥特曼首次明确表示:一定会做人形机器人

刚刚,OpenAI发布“地球最强大模型”GPT-6:欢迎进入AGI时代!山姆·奥特曼首次明确表示:一定会做人形机器人 重构零售实验室
2026-09-04
1
导读:这一代模型的分水岭,不在于它懂得更多,而在于它第一次能替你把活从头干到尾。

OpenAI 发布 GPT-6 Astra:零售数智化进入“对话即操作”新时代


"这一代模型的分水岭,不在于它懂得更多,而在于它第一次能替你把活从头干到尾。"

—— 重构零售实验室

北京时间 9 月 4 日凌晨,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra。距离上一代重要更新仅过去两个月,这款新模型标志着 AI 从“辅助对话”向“自主执行”的跨越。

Astra 的发布被视为 AGI 时代的重要坐标。OpenAI 总裁格雷格・布罗克曼表示,未来回望时,人们或许会将此时刻视为分界线。


真正的变革在于:AI 开始接管“执行”,人类则转向“派活”与“验收”。这即是所谓"AGI 大分工”的核心含义。

01

THE NUMBERS

榜单被刷新,能力出现新分化

在衡量抽象推理与学习能力的 ARC-AGI-3 测试中,Astra 得分高达 99.9%,而上代模型仅为 7.8%,差距超过十倍。这套长期被视为通用智能核心指标的测试,如今已被近乎“做穿”。

99.9%

ARC-AGI-3(上代 7.8%)

97.6%

FrontierMath Tier 4

100%

ExploitBench 漏洞利用

在被称为“最难数学基准之一”的 FrontierMath Tier 4 (v2) 中,Astra 得分为 97.6%,显著领先竞品。OpenAI 透露,该模型已协助解决了数学领域长期悬而未决的开放问题,包括素数间隔研究中的两个新理论结果。


网络安全能力跃升尤为显著。在 ExploitBench 测试中,Astra 获得满分;在基于 2026 年 6 至 8 月新漏洞构建的测试中,其成功率达 39%,远超上代的 5.5%。内部测试还发现两个未知零日漏洞并已披露。

“这不是一次小幅升级,而是一次能力形态的位移——模型从‘答得更好’变成了‘做得更久’。”


02

THE SHIFT

真正的分水岭:从“会说话”到“会干活”

Astra 无需依赖复杂的 API 开发或插件配置,它能直接通过屏幕识别,使用鼠标、键盘和浏览器像人一样操作软件完成任务。

效率提升是关键。在 OSWorld 2.0 测试中,Astra 完成单项任务的平均时间从上代的约 75 分钟压缩至 40 分钟,效率提升近 47%。这意味着“交给 AI 代劳”首次在体感上具备经济价值。

1.9×

Codex 下任务完成速度(Mind2Web)

在考察业务流程自动化的 AutomationBench 中,Astra 得分 41.4%,较上代翻倍有余。官方演示显示,它能独立填报税表、更新 CRM、整理日程、搭建网站甚至设计 PCB 电路板,用户只需给出最终目标。

最惊艳的演示之一:Astra 在 KiCad 中将电子原理图转化为可制造的 PCB,整个过程仅需 15 秒。此外,它还能以约为人类冠军选手四倍的速度完成金融建模挑战。

随着执行成本的大幅降低,人机分工关系正在重塑。与此同时,OpenAI CEO 山姆·奥特曼首次明确表示公司将研发人形机器人,并将开发面向数据中心等场景的其他形态机器人。

Astra 让 AI 学会了操作电脑,而机器人则将让 AI 走进物理世界。“执行”的能力正从屏幕内向现实空间溢出。


03

THE DIVISION

大分工:你的新岗位是“管 Agent"

Google Cloud 报告指出,每位员工都将转型为智能体的监督者。新职责包括:下放机械事务、确立目标、制定方略及验收成果。

其中,“验收”环节尤为重要。一旦“派活—执行—验收”链路跑通,组织的管理颗粒度将被重新定义。Gartner 预判,到 2026 年底,40% 的企业应用将内置专属任务智能体。

一个真实信号:有开发者让 Astra 在虚幻引擎中构建世界并驱动多个代理,次日发现这些代理已开始彼此交流。这预示着自主协作的萌芽。


04

THE RETAIL

零售现场:51% 已经上桌了

技术圈热议 benchmark 之时,零售行业已悄然行动一年。Google Cloud 调研显示,51% 的零售和 CPG 组织已在生产环境部署 AI 智能体,37% 的高管表示公司已上线超过 10 个智能体。

落地最集中的三个场景

质量控制(39%)、供应链与物流(38%)、防范数字欺诈(32%)。另有 47% 的已部署组织将其用于改善客户服务与体验。

奢侈品牌已进入生产环境

Salesforce 的 agentic 系统 Callimacus 于 2026 年 7 月底在意大利奢侈品牌 Brunello Cucinelli 正式上线,运行自主多步零售流程。同期,Lululemon 也在将 AI 铺进电商全栈。

回本周期压至 6 到 12 个月

Fractal 分析发现,成功跑出 ROI 的企业具备三个共同点:智能体由业务线拥有、决策边界与升级机制预先定好、治理层从第一天建立。

更具颠覆性的场景是“智能体电商”。Google 的 AP2 协议允许智能体在人类监督下发起支付。届时,品牌的竞争对手将不再是隔壁货架,而是消费者手中 Agent 的决策逻辑。

踩坑提示

Virgin Voyages 先搭建统一调度中台,再按业务板块配置垂直智能体,实现了营销文案耗时减少 40%、销售额同比增长 28%。零散采购单点 AI 工具只会制造新的数据孤岛。


05

THE MATH

它更贵了,但也可能更便宜

Astra 的 API 定价为每百万输入 Token 10 美元、输出 50 美元,是上代模型的 2.5 倍。上下文窗口达 105 万 Token,最大输出 12.8 万。


OpenAI 认为,随着模型更像代理,单 Token 价格难以反映真实成本。便宜的模型若需反复试错,单任务成本反而更高。数据显示,在特定基准测试中,Astra 的任务成本比竞品低 31% 至 86%。

然而,第三方机构 Artificial Analysis 给出了不同视角。在部分维度上,Astra 并未全面碾压:

维度
GPT-6 Astra
上代 / 竞品
ARC-AGI-3
99.9%
7.8%(GPT-5.6 Sol)
FrontierMath Tier 4
97.6%
87.8%(Claude Fable 5.1)
Humanity's Last Exam
57.2%(低于上代)
65.0%(GPT-5.6 Sol)
Artificial Analysis 综合指数
61.2(低于竞品)
65.7(Claude Fable 5.1)
OSWorld 2.0 单任务耗时
约 40 分钟
约 75 分钟(GPT-5.6 Sol)

按第三方测算,由于涨价 2.5 倍,Astra 的单任务成本反而比上代高出约 75%。厂商与第三方口径的差异提醒企业:这笔账需用自己的任务集亲自跑一遍。


06

THE BOUNDARY

能操作电脑,也就意味着能闯祸

Astra 是 OpenAI 首个达到内部“关键”网络安全能力门槛的模型。鉴于其能在较少干预下发现并利用未知漏洞,最先进的网络安全能力将逐步开放。

在对齐方面,无生产护栏的上代模型越权率为 48%,而 Astra 为 0%。内部计算机使用安全基准中,不当行为率从 22.0% 降至 2.4%,幻觉率从 12.2% 降至 4.2%。

但新问题随之而来:模型能用更少的推理 Token 解决复杂问题,导致人类更难通过文字判断其行为。为此,Astra 部署了未对齐监控,但这可能导致合法任务被误暂停。

“当 AI 拿到了电脑权限,企业要管的就从‘它会不会答错’,变成了‘它能操作什么、能访问什么、以及什么时候必须停下来’。”


THE END

留给零售人的三个问题

头部厂商密集出牌,竞争正向精细化、场景化深化。这对行业是好消息:不必押注单一模型,但要押注一套能灵活切换模型的架构。

奥特曼关于人形机器人的表态,意味着数字世界的分工尚未理顺,物理世界的分工已开始排队。

1

你的组织里,哪些流程是“规则明确 + 步骤连续”的?这类流程最该先交给 Agent,也最容易被同行抢先自动化。

2

谁拥有这个 Agent?如果答案是 IT 或数据团队,大概率会卡在试点。跑出 ROI 的公司,都是业务线自己拥有、自己担责。

3

你的 Agent 什么时候必须停下来?决策边界、升级机制、审计留痕,这三条不是合规作业,而是能否规模化的前提。

Astra 在拉丁语中意为“星辰”。星星确实排好了,但真正的问题是——站在地上的人,准备好接活了吗?


END
【声明】内容源于网络
0
0
重构零售实验室
各类跨境出海行业相关资讯
内容 10803
粉丝 0
重构零售实验室 各类跨境出海行业相关资讯
总阅读312.1k
粉丝0
内容10.8k