大数跨境

GPT-6 Luna便宜了一半?当务之急还是先打赢GPT-5.6 Luna吧

GPT-6 Luna便宜了一半?当务之急还是先打赢GPT-5.6 Luna吧 ElephantMind.AIGC
2026-09-30
3
导读:9月29日,OpenAI把Sol这一档继续推进到了GPT-6.1 Sol。

9月29日,OpenAI把Sol这一档继续推进到了GPT-6.1 Sol。官方给它的定位已经不是“比上一代更强一点”,而是直接写成“以更低成本提供接近Astra的表现”:标准输入每百万Token 2美元、输出10美元,价格只有Astra的五分之一。

但把视线往下移到最便宜的Luna,情况反而更有意思。

GPT-6 Luna在9月22日发布后,把价格进一步压到了每百万输入Token 0.10美元、输出0.50美元。相比GPT-5.6 Luna现在的0.20美元和1.20美元,输入便宜50%,输出便宜约58%,缓存读取也从0.02美元降到0.01美元。

价格确实漂亮。

问题是,过去一周陆续出现的第三方和社区测评,并没有形成“GPT-6 Luna稳定压过GPT-5.6 Luna”的结论。相反,在几组Coding Agent和软件工程测试里,5.6 Luna仍然能赢;另外一些真实Agent测试里,两代几乎打平,而GPT-6 Luna靠更低价格把成本压了下来。

所以现在讨论GPT-6 Luna,比“它有多便宜”更值得问的是另一件事:

「作为新一代模型,它什么时候能稳定打赢自己的上一代?」

01|先看价格:GPT-6 Luna确实已经便宜很多

OpenAI当前给出的Standard短上下文价格如下:

模型
Input / MTok
Cached Input / MTok
Cache Write / MTok
Output / MTok
GPT-6 Luna
$0.10
$0.01
$0.125
$0.50
GPT-5.6 Luna
$0.20
$0.02
$0.25
$1.20

两代模型的上下文窗口都是1.05M Token,最大输出都是128K。GPT-6 Luna的知识截止时间更新到2026年5月18日,GPT-5.6 Luna是2026年2月16日。

只看价格,GPT-6 Luna没有什么悬念。

输入减半,缓存读写减半,输出从1.20美元降到0.50美元。如果工作流里模型能力差不多,新模型天然更容易把单任务成本打下来。

这也是Artificial Analysis实测里最明确的一点:它们跑Intelligence Index时,GPT-6 Luna Max每任务成本约0.07美元,GPT-5.6 Luna约0.18美元,低了六成左右。

但便宜不等于能力一定更强。

Artificial Analysis同时观察到,GPT-6 Luna在这套测试里平均每任务输出Token反而更多:约51K,对比5.6 Luna的41K。账单更低,主要还是因为价格降得足够快,而不是模型突然用更少Token完成了同一件事。

02|你看到的“80 IQ vs 102 IQ”,到底测的是什么

这两张图来自“众测雷达”的Codex众测看板,测试项目是DeepSWE软件工程任务。

在你给我的截图里,Max档的数据是:

Codex + DeepSWE
GPT-6 Luna
GPT-5.6 Luna
IQ
80
102
通过数
74 / 139
229 / 336
中位耗时
23分钟
38分钟
API等价成本
$0.07
$0.43

这组结果非常适合放进文章,但有两个边界一定要写清楚。

第一,图里的“IQ”不是人类智商,也不是通用模型IQ。

众测雷达公开的方法是:DeepSWE使用平均通过率,再乘以1.5换成同一显示尺度。也就是100%通过率对应150分。74/139约等于53.2%,乘1.5后就是约80;229/336约等于68.2%,乘1.5后约102。

所以这张图真正表达的是:

「在这个Codex + DeepSWE众测环境里,截图时点的GPT-5.6 Luna Max通过率高于GPT-6 Luna Max。」

第二,两边样本量并不一样。

GPT-6 Luna只有139次判分,5.6 Luna已经有336次。页面还是持续更新的众测榜,因此这不是一个严格控制变量、固定样本量的实验。Low、Medium、High等部分档位甚至会直接标“数据不足”。

所以不能把这张图写成“GPT-6 Luna能力只有80,5.6有102”。

更准确的写法是:

❝

在众测雷达的DeepSWE众测中,GPT-6 Luna Max目前74/139通过,对应看板80分;GPT-5.6 Luna Max为229/336,对应102分。GPT-6 Luna更快、更便宜,但当前样本下的软件工程通过率仍落后。

❞

这里还有一个很容易误读的数字:图里的0.07美元和0.43美元不是订阅用户实际被扣的钱。

众测雷达说明,这一栏是根据每次运行的真实Token用量,再按OpenAI当前标准API价格折算出来的“API等价成本”,并且对最近有效运行取中位数。它更适合比较模型的成本效率,不是Plus或Pro订阅账单。

❝

「配图1:GPT-6 Luna众测雷达截图——Max 80 IQ、74/139、23分钟、$0.07」

「配图2:GPT-5.6 Luna众测雷达截图——Max 102 IQ、229/336、38分钟、$0.43」

❞

03|换一套第三方评测,结论没那么悬殊,但还是没有“代际碾压”

Artificial Analysis在9月22日同时测了GPT-6 Luna和GPT-5.6 Luna。

它给出的整体结果其实很适合概括现在的Luna:

「总能力大致持平,部分Agent任务退步,价格明显下降。」

当前比较页里,两代Luna在Artificial Analysis Intelligence Index上都是37分。但到了Coding Agent Index,GPT-6 Luna Max是41,GPT-5.6 Luna是43。

拆开看:

Artificial Analysis评测
GPT-6 Luna
GPT-5.6 Luna
Intelligence Index
37
37
Coding Agent Index
41
43
SWE-Atlas-QnA
44%
49%
DeepSWE v1.1
64%
66%
AutomationBench-AA
53%
50%
Terminal-Bench 4.0
13%
12%
AA-Omniscience
1
-10

这不是“GPT-6 Luna全面退化”。

它在AutomationBench和Terminal-Bench上略有提高,在知识问答的幻觉控制上改善更明显。Artificial Analysis测到的幻觉率从GPT-5.6 Luna的93%降到GPT-6 Luna的77%,而准确率基本持平。

但在几项Coding Agent指标里,新的Luna也确实没有稳定超过旧款。

对一代新模型来说,这就形成了一个很微妙的状态:

「它更便宜,也在部分可靠性指标上更好,但如果用户最在意长流程Coding,5.6 Luna仍然没有被它彻底替代。」

04|真实Agent工作流里,有的测试几乎打平

如果只看代码Benchmark,容易把差距写得太绝对。

DynoTable做了一组更接近生产Agent的测试:用真实DynamoDB会话跑201个测试单元,每个模型跑三次,包括工具选择、查询路由、写操作、澄清问题以及危险删除拒绝等。

结果是:

  • GPT-6 Luna:93.02%
  • GPT-5.6 Luna:93.94%

不到1个百分点。

但成本差距很大。DynoTable测得GPT-6 Luna平均每次调用约0.00025美元,比GPT-5.6 Luna便宜约2.4倍。

在这套工作负载里,“新Luna没有赢过5.6”是真的,但“新Luna不好用”又不成立。

更接近的结论是:

❝

「能力基本打平,价格优势非常明显。」

❞

这类任务恰好也是OpenAI给Luna的官方定位:focused、high-volume,也就是目标明确、大批量、对成本敏感的任务。

如果你的Agent主要做分类、数据库查询、格式化、固定流程调用,GPT-6 Luna即使不比5.6强很多,也可能因为成本足够低而更划算。

05|但在更长的软件工程任务里,5.6 Luna的优势又出现了

另一组值得看的数据来自VulcanBench。

它用同一批23个软件工程任务比较不同effort档位。在Max档:

  • GPT-6 Luna:12 / 23通过
  • GPT-5.6 Luna:19 / 23通过

综合分分别是81.42和84.15。

成本则反过来:

  • GPT-6 Luna:约$0.098 / task
  • GPT-5.6 Luna:约$0.448 / task

也就是说,6 Luna仍然便宜很多,但5.6 Luna完成了更多任务。

不过这组数据也不能当成绝对结论。VulcanBench自己明确写了,两代测试使用的Codex CLI版本不同,评分协议版本也有变化;5.6 Luna里还有一次Max任务跑了196分钟,超过后来给6 Luna设置的3小时边界。

这类第三方评测最有价值的地方,不是给模型盖章,而是提醒我们:

「现在至少还不能默认“6一定比5.6强”。」

06|社区里的体感,也分成“更快”和“更完整”两派

Reddit的Codex社区这几天也出现了不少A/B实测。

有一位用户在同一个约6万行C++/Python代码库里跑了10个真实工程任务,两代模型都用High。结果GPT-6 Luna在实现速度上6比4领先,而且工具调用更少;但GPT-5.6 Luna在首轮质量上5比3领先,Review质量4比2领先。最后再让GPT-5.6 Sol独立比较两份实现,5.6 Luna的代码被选中6次,6 Luna被选中4次。

样本只有10个,不能推广成普遍结论,但这个形态和前面的测试很像:

「GPT-6 Luna更像是在追求“更快、更便宜地完成”,5.6 Luna在部分复杂任务里更愿意继续检查和修。」

VulcanBench也观察到类似现象:在Medium档里,GPT-6 Luna有不少任务做完一轮修改就停止,并在最终回复里明确表示还有未完成项;5.6 Luna在相同档位通常工作更久、输出更多。

这可能解释一部分分数差距,但目前只能算行为观察,不能进一步推断训练原因。

还有一组更极端的社区测试:有人从Terminal-Bench 2.1的445条记录里挑了100条最短trial,实际覆盖29个不同任务,连续跑了两轮。第二轮里,GPT-5.6 Luna Max Fast通过90/100,而GPT-6 Luna Max Fast只有29/100。

这个数字很夸张,但它的局限也非常明显:不是完整Terminal-Bench,选的是“最短100条”,任务存在重复,而且是个人环境下的社区实验。所以它可以作为“值得复测”的信号,不能拿来当正式排行榜结论。

07|为什么“更便宜”与“没打赢上一代”可以同时发生

这一点其实并不矛盾。

模型产品可以沿着不同目标优化:

  • 更低Token单价
  • 更快返回
  • 更少工具调用
  • 更低幻觉率
  • 更高任务成功率
  • 更强长程纠错能力

这些指标不会永远一起上涨。

GPT-6 Luna现在最明确的进步,是成本和部分可靠性指标。

OpenAI官方价格里,它的输入只要5.6 Luna的一半,输出不到一半;Artificial Analysis的每任务成本也从0.18美元降到0.07美元。即使某些任务需要更多Token,它仍然可能更便宜。

但如果一个复杂Coding任务第一次做错,需要多跑一轮甚至人工返工,单价优势很快就会被吞掉。

所以Luna真正应该看的指标不是:

Cost per Token

而是:

Cost per Successful Task

对Coding Agent甚至还应该加上:

Cost per Accepted Patch

因为最终能不能合并,比生成了多少Token更重要。

08|GPT-6 Luna现在最尴尬的对手,不是Sol和Astra

GPT-6.1 Sol已经开始向Astra靠近,OpenAI把它直接定位成“Near-Astra performance at a lower cost”。

Luna的定位则完全不同:它不需要去挑战Astra,也不需要在最复杂任务里超过Sol。

它真正需要守住的是低价模型自己的位置。

如果GPT-6 Luna能做到:

  • 价格继续保持现在的优势;
  • Coding Agent至少稳定追平5.6 Luna;
  • 保住更低幻觉率;
  • 在Medium、High等常用effort下不提前停工;

那它会是非常强的批量Agent模型。

但截至目前,第三方结果更像是:

「GPT-6 Luna已经把价格打下来了,能力交接还没有完全完成。」

众测雷达的DeepSWE里,5.6 Luna Max目前仍领先;Artificial Analysis里,两代综合智能持平,但5.6的Coding Agent Index高2分;DynoTable的真实数据库Agent里两者几乎打平;VulcanBench则再次看到5.6在长程软件工程任务上领先。

几套测试的任务、Harness和评分方式都不同,所以不能简单平均成一个“总分”。

但它们至少指向同一个问题:

❝

GPT-6 Luna现在最需要证明的,不是自己比Sol便宜多少,也不是能不能碰到Astra,而是能不能在真实Coding和Agent任务里,稳定地把GPT-5.6 Luna换下去。

❞

从产品迭代角度看,这可能才是Luna 6眼下最现实的一场比赛。


参考来源

  • OpenAI|GPT-6 Luna Model
    https://developers.openai.com/api/docs/models/gpt-6-luna

  • OpenAI|GPT-5.6 Luna Model
    https://developers.openai.com/api/docs/models/gpt-5.6-luna

  • OpenAI|API Pricing
    https://developers.openai.com/api/docs/pricing

  • OpenAI|GPT-6.1 Sol Model
    https://developers.openai.com/api/docs/models/gpt-6.1-sol

  • OpenAI API Changelog|Sep 25 image encoding fix
    https://developers.openai.com/api/docs/changelog

  • Artificial Analysis|GPT-6 Sol and Luna push the cost efficiency frontier
    https://artificialanalysis.ai/articles/gpt-6-sol-and-luna-push-the-cost-efficiency-frontier

  • Artificial Analysis|GPT-6 Luna vs GPT-5.6 Luna
    https://artificialanalysis.ai/zh/models/comparisons/gpt-6-luna-vs-gpt-5-6-luna

  • 众测雷达|Codex真实任务众测
    https://deng.codexradar.com/

  • DynoTable|GPT-6 Luna vs GPT-5.6 Luna real agent benchmark
    https://dynotable.com/blog/gpt-5-6-luna-benchmark

  • VulcanBench|GPT-6 Luna across effort levels
    https://vulcanbench.com/benchmarks/swe-v4-gpt6-luna-v316.html

  • Reddit r/codex|10个真实工程任务A/B测试
    https://www.reddit.com/r/codex/comments/1wp7ckc/i_ab_tested_gpt56_luna_and_gpt6_luna_on_the_same/

  • Reddit r/codex|Terminal-Bench 2.1社区100-slot测试
    https://www.reddit.com/r/codex/comments/1wr2dda/i_ran_100_terminalbench_21_slots_on_luna_56_and/


【声明】内容源于网络
0
0
ElephantMind.AIGC
深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
内容 76
粉丝 0
ElephantMind.AIGC 深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
总阅读1.7k
粉丝0
内容76