大数跨境

马斯克掀桌子了

马斯克掀桌子了 AI探马
2026-07-09
7
导读:价格战全面爆发

作者 | 万连山

数据支持 | 勾股大数据(www.gogudata.com)

大厂神仙打架,凡人连夜吃瓜。

马斯克和奥特曼,永远是针锋相对的。

OpenAI迫不及待解禁GPT 5.6系列的同一天,SpaceXAICursor联合发布了Grok 4.5,抢光了前者的风头。

倒不是说Grok 4.5GPT 5.6强,而是因为,它是很特别的那种……

DeepSWE 1.1上,Grok 4.5得分53%,被Fable 570%GPT-5.567%完爆。

在任何基准上,Grok 4.5都算不上最顶尖水平,但它依然可能是今年最“聪明”的大模型。

因为它选择一个其他大厂都不太想竞争的领域:够便宜够快

马斯克的原话是,Grok 4.5大致只相当于Opus 4.7,但它很快,非常快!

SWE-Bench Pro任务中,Grok 4.5平均每个任务只输出15954token

作为对比,Opus 4.8输出67020 token,差了4.2 倍。

推理速度则飙到了80-100 TPSTokens Per Second),是Flash类模型才有的速度。

更关键的是价格,每百万输入token 2美元、每百万输出token 6美元。

同样完成一个编程任务,用Opus要花 美元,用Grok 4.5可能只要0.1美元,差了一个数量级。

Grok 4.5凭什么又快又便宜?


01


简单点说,还是靠马斯克的钞能力。

好东西全买过来装备上,怎么会不强?

复杂点说:

首先还是大力出奇迹那招。

xAI还在世的时候,其最大的特点就是壕,基础设施底子太厚了。

Grok 4.5的底座是代号为V91.5万亿参数巨型模型,动用了4.5万块GB300 GPU进行集群训练,是上一代的三倍。

但是,光有算力是不够的,否则Grok早就是世界第一。

早在xAI并入SpaceXAI之前,根据《The Information》获取的内部备忘录数据,其模型浮点运算利用率(MFU,即GPU的“工作效率”)只有11%

相比Meta43%,谷歌的46%,甚至是很早前GPT-321-26%,都远远不如。

所以在SpaceXAI成立的同时,马斯克还宣布,把坐拥超过22万张GPUColossus 1租给Anthropic

这一举动,当时来看,一是为了恶心OpenAI;二是为了测试算力租赁的商业模式、服务流程、定价策略,为未来的太空算力落地做准备。

先来来看,应该还有更重要的第三点,即学习对方的算力调度经验,优化自己的算力集群管理。

Grok 4.5价格、上下文和token效率

根据HuggingFace的拆解研报,Grok 4.5MoE架构和旧版本完全不是一个物种。

1.5万亿总参数被切分了256 个专家,每次推理只激活其中的 46个。

其活跃参数量大概只有200亿,极大地降低了计算延迟,单次前向传播的计算量甚至低于百亿规模的模型。

也就是马斯克说的,Flash类模型还快”。

同时,以往大模型做强化学习,目标是“不计成本地提高正确率”,导致模型在思考时会产生严重的“思维反刍”。

SpaceXAI的科学家这次另辟蹊径,不再追求极致的性能,而是在达到一定标准的前提下,用更少的步骤、更少资源解决问题。

最终的表现就是,在一定标准下,解决相同的问题,Grok 4.5消耗的token远远低于竞品。

那又为什么便宜呢?

主流模型SWE Bench Pro任务token消耗对比

第二个功臣是刚刚花600亿美元收购的Cursor

Grok 4.5被投喂了数以万亿计的Cursor用户真实交互数据。

静态数据只能让模型吸收知识,而这些动态数据,记录了数以万计开发者在IDE里多轮编辑记录、大代码库上下文切换、错误恢复路径、工具调用序列的等等行为。

使得模型知道在面对复杂的大型代码库时,第一步该看哪,第二步该连哪个工具,从而省去了大量的无效尝试。

根据TechCrunch曝光的架构图,Grok 4.5全面抛弃了老旧的GQA(分组查询注意力),采用了进阶的 MLA(多头潜在注意力),将庞大的KV向量通过低秩投影压缩成紧凑的潜在向量。

这就使得Grok 4.5在处理128K上下文时,KV Cache的显存占用直接缩减了85%,硬件摊销成本断崖式下跌。

主流模型价格对比

总而言之,Grok 4.5虽然不是最强的大模型,但其竞争力不可谓不强。

它不再追求极致性能,而更侧重效率和性价比。

换句话说,侧重点不再是卷技术,而是卷价格,抢占行业份额。

这是价格战,但不同于一般意义上的价格战。


02


过去几年,AI行业的商业模式其实非常“贵族化”。

AnthropicOpenAI维持着高昂的API价格,靠B端客户的预算来补贴天文数字的研发成本。

大家都在讲缩放定律的信仰,只要模型够大够强,有的是人乖乖掏钱。

Grok 4.5这次把遮羞布扯下来了。

《红杉资本2026年全球AI创投报告》中提到过一个概念:“模型即服务(MaaS)最终会退化为公用事业

就像老马在X上回复的那样,大部分任务、大部分人,根本不需要Fable 5那么高的智能。

AnthropicB端的成功,很难复制到C端,因为90%普通人实在没比要花大价钱去用最强的模型。

Grok 4.5的定价策略就是典型的公用事业打法。

它与传统价格战的区别在于:不是给同类产品降价,而是用一个完全不同的成本结构重新定义“这个价位应该是什么性能”。

过去18个月到现在的Grok 4.5,前沿模型的输出成本从75美元/MTok跌到了6美元/MTok,降幅高达92%

如果加上token效率的提高,实际任务成本跌了超过99%

在这种情况下,跟着无脑卷价格是相当不明智的。

其它厂商会如何应对?

Anthropic,坚守B端市场。

Anthropic现在有点尴尬Fable 5的智能虽然断层领先,但中端主力Opus 4.8Grok 4.5并没有形成压倒性优势成本高得离谱。

所以Anthropic宣称将自主研发的Claude Code工具中的系统提示词砍了80%

官方解释说是因为Fable 5太聪明了,不需要那么多废话指导

实际上,这明显是在帮用户省输入Token成本,从而对冲高昂的API单价。

OpenAI拥有全世界最大的用户基数,是最灵活的。

GPT-5.6定价是Grok 4.55倍,后续很可能会立刻大幅下调GPT-4.5/5基础版的价格,并推出真正意义上的“原生智能体操作系统”,把竞争从价格层面转移到“工作流平台”。

谷歌,则几乎可以不理会。

Grok再便宜,还是按Token收费。

依靠谷歌云的庞大基建,谷歌完全可以把价格战变成基础设施的消耗战。

更何况,早先Gemini 3.5flash发布时,谷歌已经大幅降价过一次。

所以接下来的策略很可能是:不继续降价,但扩大上下文窗口+强化多模态+免费额度占领开发者入口。

至于其它小厂和开源社区,就比较惨了,几乎只能通过纯技术创新来省钱。

比如最近在RedditLocalLLaMA社区大火的开源工具pxpipe,利用PNG图片的隐写术,把原本冗长的代码上下文和文本隐藏进一张极小的PNG图片里,直接喂给支持多模态的 Claude CodeFable 5,帮用户砍掉70%Token成本。

这种民间智慧的涌现,不仅印证了当下整个市场对控成本已经到了近乎变态的执念,也证明了AI产业的路线已经发生改变。


03


Grok 4.5明确做了一个行业表率:benchmark分数够用就行,真实世界的生产力效益更重要。

除了够快,够便宜,Grok 4.5的另一大惊艳之处,是它与Cursor / Grok Build的深度融合。

过去,大模型和开发工具是割裂的。而现在,SpaceXAI完成了闭环

这种“垂直整合”的威力,当年苹果在硬件和软件上玩过,特斯拉在汽车和自动驾驶芯片上玩过。

一旦这个数据飞轮彻底转起来,那些只有大模型底座、没有核心高频应用场景粘性的厂商,将会面临老生常谈的“管道化”危机

在商业方面,不再具备任何竞争力。

大模型的整体价格必然继续下降,等到明年,一个SWE-Bench Pro级任务的成本可能降到 0.01美元以下。

无论此时还是彼时,再去争论哪个最强已经失去意义,就像现在没人会在意哪个云厂商的服务器最强一样。

唯一的竞争维度将变成:性价比。

就像现实中的实物商品一样。

只有当硅基智慧被卷成了像水电一样、几块钱一吨的基础公共资源,那些曾经只存在于科幻里的人工智能概念,才真正有了飞入寻常百姓家的可能,有了投入应用市场的可能性。

这是每个人都应该享受到的时代红利。(全文完)

格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为任何实际操作建议,交易风险自担。

【声明】内容源于网络
0
0
AI探马
加入光荣的进化吧
内容 12
粉丝 0
AI探马 加入光荣的进化吧
总阅读184
粉丝0
内容12