| 👆 点击关注「星捷AI前沿」 | 「...」-> 设为星标 ★ |
OpenAI今天一口气扔了三个炸弹:GPT-5.6、ChatGPT Work、GPT-Live。
单看每一条都是头条级新闻。但把它们放一起看,画面更有意思——OpenAI正在从一家"卖模型API"的公司,变成一家"卖工作能力"的平台。
这个转身比任何一个benchmark分数都值得关注。
GPT-5.6:效率屠夫
先说模型本身。GPT-5.6家族三个型号:Sol(旗舰)、Terra(平衡)、Luna(性价比)。
最扎眼的数据不是"又拿了多少SOTA",而是效率。
在Agents' Last Exam(55个领域的长周期专业任务评测)上,Sol拿下53.6分,比Anthropic的Claude Fable 5高13.1分。但更狠的是——中等推理模式下,Sol仍然领先Fable 5共11.4分,而成本只有对方的四分之一。
Terra和Luna更夸张。两个小模型在同一个评测上都超过了Fable 5,成本只有后者的十六分之一。
这不是"又变强了一点"。这是在说:你花一块钱买到的东西,比之前贵十六倍的东西还好。
编码方面同样如此。Artificial Analysis Coding Agent Index上,Sol以80分创下新纪录,比Fable 5高2.8分,但输出token不到一半,时间不到一半,成本低三分之一。Luna这个最便宜的型号,成绩竟然超过了Opus 4.8。
看懂这个趋势没有?模型能力的差距正在被效率差距淹没。当你的小模型比别人的大模型还强、还便宜十几倍,竞争维度就变了——不再是谁更聪明,而是谁更会花钱。
ultra模式:用并行换结果
GPT-5.6引入了一个新玩法叫ultra。简单说就是——默认开4个agent并行干活,用更多token换更强结果和更快完成时间。
在BrowseComp、SEC-Bench Pro、Terminal-Bench 2.1三个评测上,加并行agent都能把"分数-延迟"的帕累托曲线往左上推。也就是说,同样的时间,拿到更好的结果。
这个东西的本质是什么?把推理时算力扩展从"一个模型想更久"变成"多个模型同时干"。从串行到并行,从单兵到团队。
OpenAI在API里开放了multi-agent beta,开发者可以自己搭ultra级别的体验。这意味着agent编排能力正在从框架层下沉到模型层——你不再需要自己写复杂的orchestration代码,模型原生就支持。
ChatGPT Work:不再只是聊天
如果说GPT-5.6是"模型变强了",ChatGPT Work就是"模型开始干活了"。
ChatGPT Work本质上是一个agent——它不只是回答问题,而是接任务、拆步骤、跨工具协作、产出成品。它能从Slack拉消息、从Google Drive读文件、生成Excel和PPT、甚至用新出的Sites功能直接做成可交互的网页应用。
OpenAI自己说得很直白:内部近100%的团队(包括财务和销售)已经在用ChatGPT Work和Codex。财务团队把月末结账从"几天"压到"几小时"。销售团队把定制化POC的交付周期从"几周"压到"24小时"。
这些不是demo数据,是OpenAI自己的dogfooding结果。
更有意思的是Scheduled Tasks。ChatGPT Work可以定时执行任务——每周检查Slack更新并刷新会议议程、每天早上检查网站变化并发报告、监控客户反馈邮件并自动更新演示文稿。
这不就是AI助理该有的样子吗?
GPT-Live:终于像人说话了
第三个发布是GPT-Live,全双工语音模型。
之前的语音AI有个硬伤:你说完它才开始想,中间有停顿。Advanced Voice Mode好一点,但仍然是回合制——它得等你说完。
GPT-Live用的是连续交互架构。模型一边听一边说,能随时打断、能说"嗯"表示在听、能做实时翻译。需要深度推理的时候,它把任务甩给后台的GPT-5.5,自己继续跟你聊。
每周1.5亿人在用ChatGPT的语音功能。GPT-Live把这个体验从"能用的语音助手"推向"像跟人聊天"。
三条线,一个方向
把三个发布放一起看:
GPT-5.6把单次推理的性价比拉到了新高度——同样一块钱买到的东西多了十几倍。
ChatGPT Work把模型的使用场景从问答扩展到完整工作流——从"帮我看看这个"变成"帮我做完这个"。
GPT-Live把交互方式从打字扩展到自然语音——从"用工具"变成"跟同事说话"。
三条线指向同一个方向:AI正在从"你调用它"变成"它替你干活"。
过去两年,AI公司的竞争焦点是模型能力——谁的benchmark分数高。但GPT-5.6展示了一个新现实:头部模型的绝对能力差距在缩小,效率差距在拉大。当Sol比Fable 5强13分还便宜四倍,"谁的模型更聪明"这个问题就不如"谁的模型更会花钱"重要了。
ChatGPT Work代表的是更深层的变化。OpenAI不再只卖API让开发者自己搭产品——它直接给你一个能干活的agent,接上你的Slack和Google Drive就开始工作。微软365 Copilot同步切换到GPT-5.6,Word、Excel、PowerPoint全部内置。
这是在切谁蛋糕?Google Workspace。Notion。Asana。所有"工作协作平台"都在射程内。
竞争格局变了
Anthropic的Fable 5在6月30日重新上线,但GPT-5.6一出来就在多个评测上把它盖住了——而且是用更低的成本。Claude Science刚上线瞄准科研用户,但GPT-5.6在GeneBench Pro上也展示了Pareto改进。
Meta的Muse Spark 1.1同一天发布,但在HN上只有369分对GPT-5.6的1229分。开源路线和闭源路线的声量差距在拉大。
更关键的是,OpenAI正在用ChatGPT Work + Microsoft 365构建一个闭环:模型能力→工作流入口→生产力输出。当用户把Slack、Google Drive、Notion都接进ChatGPT Work,迁移成本就不是换一个模型能解决的了。
竞争正在从"模型层"转移到"工作流层"。模型只是引擎,谁能把引擎装进用户每天开的车里,谁就赢。
还得看看硬币背面
GPT-5.6在网络安全评测上的表现也值得停下来想一想。ExploitGym3上,它在两小时限制内把GPT-5.5的漏洞利用通过率从15.1%翻到了24.9%。六小时的话达到33.7%。SEC-Bench Pro上从45.8%跳到71.2%。
OpenAI的应对是分层访问——只有通过身份验证的可信用户和组织才能使用完整的网络安全能力,9月1日前必须启用硬件密钥。
这种能力增长速度意味着AI安全的攻防天平在加速倾斜。防御方需要同样强度的AI辅助来发现和修补漏洞。OpenAI自己在内部用GPT-5.6加速AI研究——研究人员日均token输出量是GPT-5.5时期的两倍以上,内部agent化token用量增长22倍。
当AI开始大幅加速AI研究本身的发展,递归自我改进的门槛正在被试探。
竞争维度变了
OpenAI今天的三个发布,表面上是三个产品更新。放在一起看,是一个完整的平台战略:用效率碾压对手(GPT-5.6),用工作流锁定用户(ChatGPT Work),用语音降低门槛(GPT-Live)。
2026年AI行业的竞争焦点已经不在"谁的模型更聪明"了。新的问题是:谁能把AI变成你每天上班第一个打开的工具。
OpenAI正在用尽全力回答这个问题。
来源:OpenAI官方博客(openai.com/index/gpt-5-6/、openai.com/index/chatgpt-for-your-most-ambitious-work/、openai.com/index/introducing-gpt-live/),Hacker News,Microsoft 365 Copilot公告

