9月29日,OpenAI把Sol这一档继续推进到了GPT-6.1 Sol。官方给它的定位已经不是“比上一代更强一点”,而是直接写成“以更低成本提供接近Astra的表现”:标准输入每百万Token 2美元、输出10美元,价格只有Astra的五分之一。
但把视线往下移到最便宜的Luna,情况反而更有意思。
GPT-6 Luna在9月22日发布后,把价格进一步压到了每百万输入Token 0.10美元、输出0.50美元。相比GPT-5.6 Luna现在的0.20美元和1.20美元,输入便宜50%,输出便宜约58%,缓存读取也从0.02美元降到0.01美元。
价格确实漂亮。
问题是,过去一周陆续出现的第三方和社区测评,并没有形成“GPT-6 Luna稳定压过GPT-5.6 Luna”的结论。相反,在几组Coding Agent和软件工程测试里,5.6 Luna仍然能赢;另外一些真实Agent测试里,两代几乎打平,而GPT-6 Luna靠更低价格把成本压了下来。
所以现在讨论GPT-6 Luna,比“它有多便宜”更值得问的是另一件事:
「作为新一代模型,它什么时候能稳定打赢自己的上一代?」
01|先看价格:GPT-6 Luna确实已经便宜很多
OpenAI当前给出的Standard短上下文价格如下:
|
|
|
|
|
|
|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
两代模型的上下文窗口都是1.05M Token,最大输出都是128K。GPT-6 Luna的知识截止时间更新到2026年5月18日,GPT-5.6 Luna是2026年2月16日。
只看价格,GPT-6 Luna没有什么悬念。
输入减半,缓存读写减半,输出从1.20美元降到0.50美元。如果工作流里模型能力差不多,新模型天然更容易把单任务成本打下来。
这也是Artificial Analysis实测里最明确的一点:它们跑Intelligence Index时,GPT-6 Luna Max每任务成本约0.07美元,GPT-5.6 Luna约0.18美元,低了六成左右。
但便宜不等于能力一定更强。
Artificial Analysis同时观察到,GPT-6 Luna在这套测试里平均每任务输出Token反而更多:约51K,对比5.6 Luna的41K。账单更低,主要还是因为价格降得足够快,而不是模型突然用更少Token完成了同一件事。
02|你看到的“80 IQ vs 102 IQ”,到底测的是什么
这两张图来自“众测雷达”的Codex众测看板,测试项目是DeepSWE软件工程任务。
在你给我的截图里,Max档的数据是:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
这组结果非常适合放进文章,但有两个边界一定要写清楚。
第一,图里的“IQ”不是人类智商,也不是通用模型IQ。
众测雷达公开的方法是:DeepSWE使用平均通过率,再乘以1.5换成同一显示尺度。也就是100%通过率对应150分。74/139约等于53.2%,乘1.5后就是约80;229/336约等于68.2%,乘1.5后约102。
所以这张图真正表达的是:
「在这个Codex + DeepSWE众测环境里,截图时点的GPT-5.6 Luna Max通过率高于GPT-6 Luna Max。」
第二,两边样本量并不一样。
GPT-6 Luna只有139次判分,5.6 Luna已经有336次。页面还是持续更新的众测榜,因此这不是一个严格控制变量、固定样本量的实验。Low、Medium、High等部分档位甚至会直接标“数据不足”。
所以不能把这张图写成“GPT-6 Luna能力只有80,5.6有102”。
更准确的写法是:
❝在众测雷达的DeepSWE众测中,GPT-6 Luna Max目前74/139通过,对应看板80分;GPT-5.6 Luna Max为229/336,对应102分。GPT-6 Luna更快、更便宜,但当前样本下的软件工程通过率仍落后。
❞
这里还有一个很容易误读的数字:图里的0.07美元和0.43美元不是订阅用户实际被扣的钱。
众测雷达说明,这一栏是根据每次运行的真实Token用量,再按OpenAI当前标准API价格折算出来的“API等价成本”,并且对最近有效运行取中位数。它更适合比较模型的成本效率,不是Plus或Pro订阅账单。
❝「配图1:GPT-6 Luna众测雷达截图——Max 80 IQ、74/139、23分钟、$0.07」
「配图2:GPT-5.6 Luna众测雷达截图——Max 102 IQ、229/336、38分钟、$0.43」
❞
03|换一套第三方评测,结论没那么悬殊,但还是没有“代际碾压”
Artificial Analysis在9月22日同时测了GPT-6 Luna和GPT-5.6 Luna。
它给出的整体结果其实很适合概括现在的Luna:
「总能力大致持平,部分Agent任务退步,价格明显下降。」
当前比较页里,两代Luna在Artificial Analysis Intelligence Index上都是37分。但到了Coding Agent Index,GPT-6 Luna Max是41,GPT-5.6 Luna是43。
拆开看:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
这不是“GPT-6 Luna全面退化”。
它在AutomationBench和Terminal-Bench上略有提高,在知识问答的幻觉控制上改善更明显。Artificial Analysis测到的幻觉率从GPT-5.6 Luna的93%降到GPT-6 Luna的77%,而准确率基本持平。
但在几项Coding Agent指标里,新的Luna也确实没有稳定超过旧款。
对一代新模型来说,这就形成了一个很微妙的状态:
「它更便宜,也在部分可靠性指标上更好,但如果用户最在意长流程Coding,5.6 Luna仍然没有被它彻底替代。」
04|真实Agent工作流里,有的测试几乎打平
如果只看代码Benchmark,容易把差距写得太绝对。
DynoTable做了一组更接近生产Agent的测试:用真实DynamoDB会话跑201个测试单元,每个模型跑三次,包括工具选择、查询路由、写操作、澄清问题以及危险删除拒绝等。
结果是:
-
GPT-6 Luna:93.02% -
GPT-5.6 Luna:93.94%
不到1个百分点。
但成本差距很大。DynoTable测得GPT-6 Luna平均每次调用约0.00025美元,比GPT-5.6 Luna便宜约2.4倍。
在这套工作负载里,“新Luna没有赢过5.6”是真的,但“新Luna不好用”又不成立。
更接近的结论是:
❝「能力基本打平,价格优势非常明显。」
❞
这类任务恰好也是OpenAI给Luna的官方定位:focused、high-volume,也就是目标明确、大批量、对成本敏感的任务。
如果你的Agent主要做分类、数据库查询、格式化、固定流程调用,GPT-6 Luna即使不比5.6强很多,也可能因为成本足够低而更划算。
05|但在更长的软件工程任务里,5.6 Luna的优势又出现了
另一组值得看的数据来自VulcanBench。
它用同一批23个软件工程任务比较不同effort档位。在Max档:
-
GPT-6 Luna:12 / 23通过 -
GPT-5.6 Luna:19 / 23通过
综合分分别是81.42和84.15。
成本则反过来:
-
GPT-6 Luna:约$0.098 / task -
GPT-5.6 Luna:约$0.448 / task
也就是说,6 Luna仍然便宜很多,但5.6 Luna完成了更多任务。
不过这组数据也不能当成绝对结论。VulcanBench自己明确写了,两代测试使用的Codex CLI版本不同,评分协议版本也有变化;5.6 Luna里还有一次Max任务跑了196分钟,超过后来给6 Luna设置的3小时边界。
这类第三方评测最有价值的地方,不是给模型盖章,而是提醒我们:
「现在至少还不能默认“6一定比5.6强”。」
06|社区里的体感,也分成“更快”和“更完整”两派
Reddit的Codex社区这几天也出现了不少A/B实测。
有一位用户在同一个约6万行C++/Python代码库里跑了10个真实工程任务,两代模型都用High。结果GPT-6 Luna在实现速度上6比4领先,而且工具调用更少;但GPT-5.6 Luna在首轮质量上5比3领先,Review质量4比2领先。最后再让GPT-5.6 Sol独立比较两份实现,5.6 Luna的代码被选中6次,6 Luna被选中4次。
样本只有10个,不能推广成普遍结论,但这个形态和前面的测试很像:
「GPT-6 Luna更像是在追求“更快、更便宜地完成”,5.6 Luna在部分复杂任务里更愿意继续检查和修。」
VulcanBench也观察到类似现象:在Medium档里,GPT-6 Luna有不少任务做完一轮修改就停止,并在最终回复里明确表示还有未完成项;5.6 Luna在相同档位通常工作更久、输出更多。
这可能解释一部分分数差距,但目前只能算行为观察,不能进一步推断训练原因。
还有一组更极端的社区测试:有人从Terminal-Bench 2.1的445条记录里挑了100条最短trial,实际覆盖29个不同任务,连续跑了两轮。第二轮里,GPT-5.6 Luna Max Fast通过90/100,而GPT-6 Luna Max Fast只有29/100。
这个数字很夸张,但它的局限也非常明显:不是完整Terminal-Bench,选的是“最短100条”,任务存在重复,而且是个人环境下的社区实验。所以它可以作为“值得复测”的信号,不能拿来当正式排行榜结论。
07|为什么“更便宜”与“没打赢上一代”可以同时发生
这一点其实并不矛盾。
模型产品可以沿着不同目标优化:
-
更低Token单价 -
更快返回 -
更少工具调用 -
更低幻觉率 -
更高任务成功率 -
更强长程纠错能力
这些指标不会永远一起上涨。
GPT-6 Luna现在最明确的进步,是成本和部分可靠性指标。
OpenAI官方价格里,它的输入只要5.6 Luna的一半,输出不到一半;Artificial Analysis的每任务成本也从0.18美元降到0.07美元。即使某些任务需要更多Token,它仍然可能更便宜。
但如果一个复杂Coding任务第一次做错,需要多跑一轮甚至人工返工,单价优势很快就会被吞掉。
所以Luna真正应该看的指标不是:
Cost per Token
而是:
Cost per Successful Task
对Coding Agent甚至还应该加上:
Cost per Accepted Patch
因为最终能不能合并,比生成了多少Token更重要。
08|GPT-6 Luna现在最尴尬的对手,不是Sol和Astra
GPT-6.1 Sol已经开始向Astra靠近,OpenAI把它直接定位成“Near-Astra performance at a lower cost”。
Luna的定位则完全不同:它不需要去挑战Astra,也不需要在最复杂任务里超过Sol。
它真正需要守住的是低价模型自己的位置。
如果GPT-6 Luna能做到:
-
价格继续保持现在的优势; -
Coding Agent至少稳定追平5.6 Luna; -
保住更低幻觉率; -
在Medium、High等常用effort下不提前停工;
那它会是非常强的批量Agent模型。
但截至目前,第三方结果更像是:
「GPT-6 Luna已经把价格打下来了,能力交接还没有完全完成。」
众测雷达的DeepSWE里,5.6 Luna Max目前仍领先;Artificial Analysis里,两代综合智能持平,但5.6的Coding Agent Index高2分;DynoTable的真实数据库Agent里两者几乎打平;VulcanBench则再次看到5.6在长程软件工程任务上领先。
几套测试的任务、Harness和评分方式都不同,所以不能简单平均成一个“总分”。
但它们至少指向同一个问题:
❝GPT-6 Luna现在最需要证明的,不是自己比Sol便宜多少,也不是能不能碰到Astra,而是能不能在真实Coding和Agent任务里,稳定地把GPT-5.6 Luna换下去。
❞
从产品迭代角度看,这可能才是Luna 6眼下最现实的一场比赛。
参考来源
-
OpenAI|GPT-6 Luna Model
https://developers.openai.com/api/docs/models/gpt-6-luna -
OpenAI|GPT-5.6 Luna Model
https://developers.openai.com/api/docs/models/gpt-5.6-luna -
OpenAI|API Pricing
https://developers.openai.com/api/docs/pricing -
OpenAI|GPT-6.1 Sol Model
https://developers.openai.com/api/docs/models/gpt-6.1-sol -
OpenAI API Changelog|Sep 25 image encoding fix
https://developers.openai.com/api/docs/changelog -
Artificial Analysis|GPT-6 Sol and Luna push the cost efficiency frontier
https://artificialanalysis.ai/articles/gpt-6-sol-and-luna-push-the-cost-efficiency-frontier -
Artificial Analysis|GPT-6 Luna vs GPT-5.6 Luna
https://artificialanalysis.ai/zh/models/comparisons/gpt-6-luna-vs-gpt-5-6-luna -
众测雷达|Codex真实任务众测
https://deng.codexradar.com/ -
DynoTable|GPT-6 Luna vs GPT-5.6 Luna real agent benchmark
https://dynotable.com/blog/gpt-5-6-luna-benchmark -
VulcanBench|GPT-6 Luna across effort levels
https://vulcanbench.com/benchmarks/swe-v4-gpt6-luna-v316.html -
Reddit r/codex|10个真实工程任务A/B测试
https://www.reddit.com/r/codex/comments/1wp7ckc/i_ab_tested_gpt56_luna_and_gpt6_luna_on_the_same/ -
Reddit r/codex|Terminal-Bench 2.1社区100-slot测试
https://www.reddit.com/r/codex/comments/1wr2dda/i_ran_100_terminalbench_21_slots_on_luna_56_and/

