大数跨境

GPT-5.6 与 Grok 4.5:48 小时内,AI 前沿被重新定义

GPT-5.6 与 Grok 4.5:48 小时内,AI 前沿被重新定义 响指HaiSnap
2026-07-10
4
导读:2026 年的 AI 前沿,已经不是谁更强的单线竞争,而是"走哪条路"的战略选择。
HAISNAP / SKILL
本期推文说明:本文全部由响指 Haisnap 中的三个 Skill 协同完成,包括生成深度研究分析V2公众号文章写作公众号内容创作助手。从资料整理、逻辑分析到公众号成文与排版优化,均由响指完成。
DEEP RESEARCH
2026.07.10

48小时内的AI双轨竞争
GPT-5.6 与 Grok 4.5

极致能力 vs 极致效率,谁在重塑AI前沿

2026年7月8日,xAI发布Grok 4.5;7月9日,OpenAI推出GPT-5.6模型家族与ChatGPT Work。两大顶级AI实验室在48小时内相继发布旗舰模型,并非偶然——它折射出一个事实:AI前沿竞争已从"年度发布"压缩至"双周迭代"。

但更重要的是,它们走了两条完全不同的路。OpenAI押注"极致能力+智能体产品化",xAI选择了"极致效率+开发者性价比"。这不是在同一条赛道上比谁跑得快,而是在两条赛道上各自定义"什么是好模型"。


01 / CORE FINDING

五条核心判断

基于深度调研,本报告提炼出五项核心判断。每一条都试图回答一个问题:这场竞争到底在争什么?

一、GPT-5.6在编程和代理能力上确立了新SOTA。Terminal-Bench 2.1上91.9%的得分是所有公开模型的最高纪录。但Grok 4.5以$2/$6定价和4.2倍Token效率,在"性价比"维度形成制衡。两者不在同一赛道。

二、ChatGPT Work标志着AI从"问答工具"向"自主工作智能体"的范式跃迁。每周超500万人使用Codex,其中100万已用于非软件开发场景——这个数字才是OpenAI真正的战略信号。

三、多模型家族策略(Sol/Terra/Luna)正在重塑AI模型的产品形态。Terra以GPT-5.5同级能力但成本减半的定位,瞄准了企业级API调用的"甜点区"。

四、美国政府首次直接介入AI模型发布。特朗普AI网络安全行政命令要求AI公司全面发布前30天提交模型供政府审查,GPT-5.6成为首个受逐客户审批的模型。

五、2026年AI前沿竞争已分化为四条赛道:代码、代理、多模态、开源成本。同期还有Anthropic Claude Mythos 5、Google Gemini 3.2、阿里云Qwen 3.7、DeepSeek V4.1集中发布。各家竞争轴已清晰分化。


02 / MODEL ARCHITECTURE

GPT-5.6 三档家族

OpenAI放弃了沿用多年的"数字+mini/标准/旗舰"命名,改用"数字世代+天体名称"双轴命名:Sol(太阳/旗舰)、Terra(地球/平衡)、Luna(月亮/低成本)。同一世代的不同模型可以各自独立节奏进化,不再整体替换。

模型
定位
输入/输出
GPT-5.6 Sol
旗舰,极致智能
$5 / $30
GPT-5.6 Terra
日常平衡型
$2.5 / $15
GPT-5.6 Luna
极速低成本型
$1 / $6
Claude Fable 5
Anthropic旗舰
$10 / $50

作为对照,Anthropic的Claude Fable 5定价$10/$50,GPT-5.6 Sol的定价约为其一半。而Terra的性能与GPT-5.5相当,但成本直接降低2倍。这意味着企业可以在不牺牲核心能力的前提下,以约一半的成本获得GPT-5.5级表现。

Sol还引入了两个全新计算模式。Max推理模式让模型在复杂多步骤问题上主动投入更多计算资源深入思考。Ultra模式则更加激进——允许Sol主动调用并指挥多个"子代理"并行协作,默认协调四个代理同时工作。

Ultra模式的引入标志着AI代理工作模式从"单一执行者"正式迈向"指挥官+分工执行团队"的新范式。


03 / BENCHMARKS

编程基准上的全面突破

编程能力是GPT-5.6最具代表性的突破领域。在Terminal-Bench 2.1——业界公认最严苛的命令行代理任务基准——GPT-5.6 Sol Ultra以91.9%创下历史最高分。

91.9%
Terminal-Bench 2.1
Sol Ultra 模式
53.6
Agents' Last Exam
超越Fable 5达13.1分
73.5%
ExploitBench 网络安全
前代 47.9% → 73.5%
2x
ExploitGym 通过率
从 15.1% 翻倍至 24.9%

在Agents' Last Exam——涵盖55个专业领域长时程工作流的评估——GPT-5.6 Sol以53.6分创下新纪录,超越Claude Fable 5达13.1分。即便中等推理强度下,Sol仍以11.4分优势领先,成本约为Fable 5的四分之一。

网络安全领域的能力跃升最为瞩目也最具争议。ExploitBench从47.9%跃升至73.5%,SEC-Bench Pro从45.8%提升至71.2%。但OpenAI特别说明,GPT-5.6 Sol未跨越其自身定义的"Cyber Critical"安全阈值——它能识别漏洞和利用原语,但尚不能自主产生完整功能性漏洞利用链。这条边界既是它被批准发布的前提,也暗示了下一代模型可能触及的安全红线。


04 / CHATGPT WORK

从"回答问题"到"完成工作"

ChatGPT Work是OpenAI首个面向普通用户的跨应用自主工作智能体。它从应用和工作流中收集信息,将复杂项目拆解为更小步骤,持续处理数小时,把目标转化为表格、幻灯片、文档和Web应用。

传统AI助手的工作模式是"问-答"循环。ChatGPT Work颠覆了这一模式:用户提出一个需要数十个步骤、跨越多个应用的复杂目标,AI自主规划、执行、验证和交付。用户从"逐步指导者"转变为"方向设定者和审批者"。

500万+
每周使用 Codex 用户
100万+
非软件开发场景用户
1400+
可连接插件生态
100%
红队数据提取阻止率

这100万非开发用户的存在,是OpenAI决定将Codex技术扩展为通用工作智能体的核心需求信号。一个面向开发者的编码工具,被大量用于非开发场景——这说明市场对"AI自主完成工作"的需求远超预期。

ChatGPT Work还引入了Sites功能(公开测试版),可将工作成果转化为互动站点或Web应用,并通过URL分享。当底层信息变化时,ChatGPT可自动更新这些站点。这不是静态快照,是持续更新的活文档。


05 / ENTERPRISE CASES

企业测试:AI智能体的ROI验证

从Zapier的七位数管道识别到NVIDIA 40%时间节省,ChatGPT Work的早期企业测试案例揭示了AI智能体在"重复性知识工作自动化"领域的实质性ROI。

01Zapier · 线索审查

此前人工审查一条线索需35-45分钟,多数线索从未获得完整审查。ChatGPT Work自动追踪CRM、Gong通话录音和邮件中的客户触点,每周生成高管仪表板。

七位数潜在销售额被识别
02NVIDIA · GTC大会

GTC会前准备依赖一个消耗约40%会前时间的Excel工作流。ChatGPT Work接管后每周自动运行两次,跟踪注册、协调会议、监控销售准备度。会后分析从"整理数据"压缩到"讨论洞察"。

40% 会前时间节省
03Virgin Atlantic · 竞争分析

五年计划制定时的竞争分析,从此前数周的人工周期压缩到数小时。AI负责研究各家航空公司的服务内容,评估领先或落后之处,构建可供团队审阅的数据集。

数周 → 数小时
04RingCentral · 发布检查

发布前检查流程从1名产品经理手动推进,扩展为AI辅助下覆盖50名产品经理的协作体系。核心价值不是"更快地做同样的事",而是将此前因成本过高而无法执行的流程变为可行。

1人 → 50人 规模扩展

上述案例均来自OpenAI早期测试计划,结果为企业自报数据,应视为方向性参考而非独立验证结论。


06 / GROK 4.5

xAI的工程效率反击

Grok 4.5选择了与OpenAI截然不同的路线。在Terminal-Bench 2.1上83.3%的分数,低于GPT-5.6 Sol。但它用另外三个数字定义了自己的竞争力。

$2/$6
每百万Token定价
GPT-5.6 Sol 的 40%/20%
80
TPS 推理速度
远超多数竞品思考型模型
4.2x
Token 效率优势
同等任务用更少资源完成
29.0%
SWE Marathon 解决率
领先 Fable 和 Opus

在SWE Bench Pro任务中,Grok 4.5平均使用15,954个输出Token,而Opus 4.8使用67,020个——4.2倍的效率差距。结合$2/$6的定价,Grok 4.5在"每解决一个任务的输出成本"上可能具有近10倍的优势。

但一个值得关注的发现是:在SWE Marathon(需要持续长时间执行的"马拉松式"软件工程任务)上,Grok 4.5以29.0%的解决率领先Opus 4.8和Fable。在需要"持久力"的场景中,它反而可能更具优势。

Grok 4.5的另一个独特定位是与Cursor的联合训练。Cursor作为最受欢迎的AI编程编辑器之一,其与xAI的合作意味着Grok 4.5在训练阶段就深度整合了真实开发者的工作流数据。这不是"训练完再适配用户",而是"带着用户的真实需求一起训练"。


07 / COMPETITION

双轨竞争格局

维度
GPT-5.6 Sol
Grok 4.5
Terminal-Bench 2.1
88.8% (Ultra: 91.9%)
83.3%
定价(输入/输出)
$5 / $30
$2 / $6
Token 效率
基准
竞品 4.2 倍
推理速度
标准(Cerebras部署750 TPS)
80 TPS
核心战略
智能体产品化
工程效率优化
政府审查
有(逐客户审批)

两者并非在同一赛道正面竞争。GPT-5.6追求"极致能力",Grok 4.5追求"极致效率"。对于需要处理大量标准化代码任务的场景,Grok 4.5的成本优势可能超过其能力差距的影响。对于跨领域、长时程的代理工作能力,GPT-5.6的优势更为全面。

一个潜在变数是Cerebras合作。GPT-5.6 Sol自2026年7月起将在Cerebras芯片上部署,提供每秒750 Token的超高速推理。如果750 TPS得以实现,GPT-5.6在速度维度上的劣势将被消除——但初期访问将限制在特定客户。


08 / REGULATION

政府首次介入AI发布

2026年6月初,特朗普签署AI网络安全行政命令,要求AI公司在全面发布前30天自愿提交模型供政府审查。GPT-5.6因网络安全能力显著跃升成为首个受逐客户审批的模型——每个申请使用的机构都需单独获得政府批准。

这开创了"政府预审制"先例。传统上,政府监管AI的方式是通过行业标准或事后追责。GPT-5.6的审查流程更接近军事和双用途技术的出口管制,而非常规消费品监管。

OpenAI CEO Sam Altman公开表态:"我们不认为这种政府审查程序应成为长期默认机制。"但他也承诺将积极与政府合作建立"更可持续的未来发布流程"。最终OpenAI选择了配合而非对抗——这本身就是一种战略表态。

一旦"政府预审制"被接受为处理高风险AI模型的程序,后续模型都可能面临类似审查。AI前沿能力的国际分配正在成为技术外交的新议题。

值得注意的是,Grok 4.5未经历类似审查即可直接发布。这在竞争时间窗口上对OpenAI不利,也从侧面反映出两家公司在网络安全能力维度上的差距。


09 / SAFETY

70万GPU小时的安全压测

OpenAI为GPT-5.6构建了史上最严格的安全防护体系:投入超70万A100等效GPU小时进行自动化红队压测,建立四层纵深防护架构。

第一层 ·模型层防护——训练阶段拒绝学习,面对禁止的网络安全协助请求直接拒绝响应。

第二层 ·实时分类器——生成输出时同步评估,检测到潜在违规可暂停生成。

第三层 ·账号级审查——跨对话的持续性行为模式追踪,区分恶意行为与正当双用途工作。

第四层 ·自动审阅——重要操作前用最先进模型审阅,红队测试中100%阻止数据提取尝试,包括模型在训练中从未见过的攻击。

这一"零突破"记录是GPT-5.6被批准公开发布的关键安全依据。但网络安全能力的跃升使其成为双刃剑——既是最强的安全研究工具,也触及了政府审查的触发线。


10 / LANDSCAPE

2026年四条赛道

在GPT-5.6和Grok 4.5发布同期,Anthropic的Claude Mythos 5、Google的Gemini 3.2、阿里云的Qwen 3.7、DeepSeek V4.1集中发布。各家竞争轴已清晰分化:

厂商
主攻赛道
核心优势
OpenAI
自主代理
ChatGPT Work + 1400+插件生态
xAI
工程效率
Token效率 + 成本领先 + Cursor联训
Anthropic
代码
Claude Mythos 5 安全与代码领域
Google
多模态
Gemini 3.2 多模态能力
中国阵营
开源成本
Qwen 3.7 / DeepSeek V4.1

多极化竞争意味着,"谁是最强AI"这个问题已经没有单一答案。答案取决于你问的是什么维度——编程、代理、多模态还是成本效率。


11 / ITERATION SPEED

从年级到月级的迭代压缩

OpenAI已将模型迭代周期从年级压缩至月级。GPT-3到GPT-4近三年,GPT-4到GPT-5一年多,GPT-5.5到GPT-5.6约两个月。而xAI的迭代周期已压缩至1.6个月——Grok 4.3于2026年5月发布,Grok 4.5于7月发布。

同时,GPT-5.6支持150万Token超长上下文。在内部使用方面,过去六个月内编码推理计算增长100倍,代理Token使用增长约22倍。RSI(递归自我改进)指数较GPT-5.5提升16.2分——模型正在加速自身的研发迭代,形成正向反馈循环。

这场竞争的本质,不是谁先到达AGI,而是"什么是好模型"这个问题的定义权之争。OpenAI说好模型是能自主完成复杂工作的智能体,xAI说好模型是用更少资源完成同等工作的工具。两种答案都有人买单。

对于正在选型的开发者、正在规划AI战略的企业决策者,核心问题不是"哪个模型最强",而是"我的工作场景需要哪种维度的优势"。在多极化竞争的时代,选错赛道的成本远大于选错模型。


扫描立刻下载“响指HaiSnap APP”

【声明】内容源于网络
0
0
响指HaiSnap
零代码创作者社区
内容 27
粉丝 0
响指HaiSnap 零代码创作者社区
总阅读215
粉丝0
内容27