大数跨境

刚刚,GPT-5.6「太阳系」全家桶上线!Codex消失了

刚刚,GPT-5.6「太阳系」全家桶上线!Codex消失了 AI大佬
2026-07-10
12
导读:OpenAI终于把GPT-5.6「全家桶」交到所有人手里。同时,ChatGPT和Codex彻底合并,全新AI打工神器ChatGPT Work杀疯。

导读:OpenAI终于把GPT-5.6「全家桶」交到所有人手里。同时,ChatGPT和Codex彻底合并,全新AI打工神器ChatGPT Work杀疯。

编辑:桃子 摩西 文章新智元(Al_era



终于等到了!


就在刚刚,OpenAI一口气把GPT-5.6「全家桶」——Sol、Terra、Luna全放了出来。


图片
图片


毫不夸张地说,Sol这次就是冲着Claude Fable 5来的:


· Agents' Last Exam:Sol豪取53.6%,把Fable 5甩开13.1分;


· Terminal-Bench 2.1:Sol拿88.8%,开Ultra顶到91.9%,Fable 5才83.1%;


· Coding Agent Index:Sol狂揽80分刷新SOTA,力压Fable 5 2.8分。


更刺激的的价格——


Fable 5每百万token的输入是$10、输出是$50;


Sol直接对折,只要$5和$30,Terra再砍半到$2.5和$15,Luna干脆只要$1和$6。


图片


同在今天,ChatGPT和Codex终于完成合体,OpenAI「超级应用」真的来了。


从此,只剩下ChatGPT这一个应用。


01

GPT-5.6,全面上线


自6月27日初次亮相以来,全网翘首以盼的GPT-5.6终于「到手」了。


Sol、Terra、Luna,一个不差,全部交给所有人。


旗舰Sol(太阳):专治硬核编码、知识工作、网络安全和科学领域「硬骨头」,堪称地表最强。


Terra(大地)+ Luna(月亮):主打一个极致性价比,用更少的成本体验卓越的性能。


图片


干翻Fable 5,编程新王登场


先看最硬核的编程,OpenAI直接把Sol称为「迄今最强编程模型」。


在Artificial Analysis Coding Agent Index上,Sol开max推理拿下80分,创下新SOTA,比Fable 5高2.8分。


而且,输出token不到一半、耗时不到一半、成本还低约1/3。


图片


这种碾压贯穿整条产品线:Terra略高于Fable 5,Luna则直接越过Opus 4.8。


而且各自都只用了约1/3的时间、约一半的输出token、约1/4的成本。同样的活,OpenAI这次是用小得多的代价干完的。


在考验命令行长程工程的Terminal-Bench 2.1和DeepSWE上,Sol同样刷新了SOTA。



四个Agent一起上,Ultra模式上线


如果一个模型不够,那就上四个。


这一次,GPT-5.6新增了两档高能力设置——


  • max档:比原来的xhigh给模型更多时间去推理;


  • ultra档:默认一次派四个Agent并行开工,重活还能上到十六个。

用更多的token,换更强的结果和更快的出活速度


在BrowseComp、SEC‑Bench Pro、Terminal‑Bench 2.1三项评测上,加了并行Agent之后,「分数‑耗时」曲线整体向左上方移动——分更高,还更快


图片
图片
图片


这一代GPT‑5.6,还悄悄补上了一块过去的短板——设计审美。


它能自己去「看」渲染出来的结果,检查视觉和功能上的毛病,然后动手修,最后再把成品交给你。


如下,GPT‑5.6设计的航海小游戏、博物馆网站、室内设计展示等,都展现出其设计能力上质的飞跃。


图片


GPT-5.6在「端到端知识工作」上的成绩,同样亮眼。


Sol在BrowseComp上拿下92.2%、在OSWorld 2.0上拿下62.6%,双双刷新SOTA。


尤其是在OSWorld上,它超过Opus 4.8的同时,输出token少用了85%。


图片

图片
图片
图片


02

GPT‑5.6炼出自己

OpenAI「AI永动机」成真


GPT‑5.6最科幻的一面,藏在OpenAI自己的办公室里。


OpenAI官方称,GPT‑5.6,是他们迄今最能加速AI研究的模型。


图片


研究员用它来诊断故障、优化训练系统、跑实验、解读结果。


在GPT‑5.6内测期间,每位活跃研究员的日均输出token量,是GPT‑5.5最高水平的两倍多。


更夸张的是,过去半年,OpenAI投入到内部编程推理的研究算力份额涨了100倍,内部Agent的token用量涨了约22倍。


图片


在一套衡量「递归自我改进(RSI)」的内部评测上,Sol比GPT‑5.5高出16.2分。


说白了,OpenAI正在用AI,加速造下一个更强的AI。


图片


发布会直播中,研究员透露了一个关键细节——


全家桶里最小的Luna,是老大哥Sol后训练出来的!


图片


过程是这样,先输入大致的需求,然后Sol就开始自己去找训练配置、挑选GPU、启动脚本、确认跑通,把一个模型的后训练从头到尾全包圆了。


这活儿放在过去,是一整队资深研究员的工作。


而现在,那个「自动化研究员」,真的已经很近了。


图片


这也许就是当下这个AI时代之所以愈发疯狂,最有说服力的注脚。


03

ChatGPT和Codex

终于合体了


同在今天,ChatGPT桌面端迎来重大升级。


新增内置浏览器和Computer Use,能直接调用你本地的文件和应用,替你点击、打字、搬文件。


真正的关键在,原来的Codex应用,也和全新的ChatGPT桌面端合并了!


图片

图片
图片


跟GPT-5.6一起端上来的,另一大重量级产品,便是ChatGPT Work


它是一个能跨App和文件自主干活的Agent,能盯着一个项目连续跑好几个小时,把一个目标变成真正的成品。


可以说,这就是OpenAI版的「Claude Cowork」!


图片

同样的,它可以通过手机端ChatGPT直接操控。

即便是电脑不在身边,也能继续推进工作。


图片


从预览到全量上线,不过半个月;从追赶到反超,OpenAI只用了一次发布会。


但真正让人后背发凉的,不是那几张榜单,是GPT-5.6 Sol亲手训出了Luna。


当AI开始训练AI,时间就不再是线性的了。


竞赛的终点线正在消失,剩下的只是下一个版本号。(本文来源于新智元,AI大佬已获得作者授权、经AI大佬编辑发布,文中观点为作者观点、不代表AI大佬观点。)


参考资料:

https://openai.com/index/gpt-5-6/

https://openai.com/index/chatgpt-for-your-most-ambitious-work/



延伸阅读

GPT-5之后,奥特曼向左,梁文锋向右

谷歌Gemini 3夜袭全球,暴击GPT-5.1!奥特曼罕见祝贺

【声明】内容源于网络
0
0
AI大佬
IT精英出身,混迹互联网圈多年,深耕SaaS、VR、AI、云计算和大数据领域。致力于探索全球前沿信息,掌握新趋势,深度解析AI新世界,共享未来创新!
内容 1740
粉丝 0
AI大佬 IT精英出身,混迹互联网圈多年,深耕SaaS、VR、AI、云计算和大数据领域。致力于探索全球前沿信息,掌握新趋势,深度解析AI新世界,共享未来创新!
总阅读1.8k
粉丝0
内容1.7k