马斯克旗下的 SpaceXAI 再次展现强劲势头。Grok 4.6 于数小时前正式发布,其纸面性能已几乎追平 GPT-5.6 Sol,而定价仅为后者的三分之一。
值得注意的是,Cursor 和 Grok Build 用户在本周内使用 Grok 4.6 的额度将翻倍。
距离 SpaceXAI 发布 Grok 4.5 仅过去一个多月,4.6 版本便迅速登场。凭借雄厚的资金支持与 Cursor 的数据赋能,该模型的迭代速度令人瞩目。
性能评测:综合指数追平顶尖模型
Grok 4.6 的综合智能指数达到 61 分,与 GPT-5.6 Sol 持平。Anthropic 的 Claude Fable 5 以 62 分微弱领先。相比上一代 Grok 4.5(56 分),新版本一次性提升了 5 分。
该数据源自第三方独立评测机构 Artificial Analysis。目前,Grok 4.6 与 GPT-5.6 Sol 并列榜单第三,Kimi K3(60 分)位居第四。
基准测试表现
在已公布的 10 项评测中,Grok 4.6 斩获三项单项第一:
- GDPVal-AA:得分 1753 分(Claude Fable 5 为 1741 分);
- AA-Briefcase:得分 1577 分。该项主要测试长周期智能体任务能力,如调研、报告撰写及数据分析;
- 法律评测 Harvey LAB:得分 15.8%。Harvey 是一家专注于法律 AI 的公司,该评测专门考察模型处理法律文书和合同分析的能力。Grok 4.6 在此项表现尤为突出,远超 GPT-5.6 Sol 的 2.5%,差距达六倍之多。
在编程领域,Grok 4.6 在 DeepSWE 和 Terminal-Bench 测试中分别为 65.9% 和 26%,略逊于 GPT-5.6 Sol 的 73% 和 34.6%。
价格优势:顶级模型中的“白菜价”
除性能外,Grok 4.6 的定价策略极具竞争力。其 API 价格为每百万输入 tokens 2 美元,每百万输出 tokens 6 美元。这一价格在顶级模型中属于极低水平,甚至低于 Kimi K3。
对比其他主流模型:
- Claude Opus 5:输入 5 美元,输出 25 美元;
- GPT-5.6 Sol:输入 5 美元,输出 30 美元;
- Claude Fable 5:输入 10 美元,输出 50 美元。
最贵的模型定价是 Grok 4.6 的八倍。Cursor CEO Michael Truell 评价称,Grok 4.6 拥有"Opus 级别的智商,但成本极低,速度极快”。Artificial Analysis 实测数据显示,Grok 4.6 完成一个任务的平均成本为 0.84 美元,与 Kimi K3 持平,但智能指数更高。
马斯克转发了投资人 Gavin Baker 的对比图,自豪地表示 Grok 4.6 再次站在了“帕累托前沿”。
帕累托前沿:指在性能和成本两个维度上,不存在比它更优的选择。任何替代品要么性能更差,要么价格更贵。
接入方式与使用限制
用户可通过以下方式体验 Grok 4.6:
Cursor 集成
直接在 Cursor 模型列表中切换至 Grok 4.6 即可使用,该功能已于今日上线。
Grok Build 支持
SpaceXAI 自家的编程 Agent Grok Build 同步支持新版本。这是一个在终端运行的本地化 AI 编程工具,代码不上传服务器,支持多智能体并行处理,可视为马斯克版的 Claude Code 或 Codex。
目前,无论是 Cursor 还是 Grok 订阅,可用额度仍较为有限。
API 开放与合作伙伴
Grok 4.6 API 已向 OpenRouter、Vercel 和 Cloudflare 等合作伙伴开放。此外,还推出了响应速度更快的快速版本,价格为标准版的两倍(输入 4 美元/百万 tokens,输出 12 美元/百万 tokens)。
首周优惠活动
即日起至未来一周内,用户在 Cursor 和 Grok Build 中使用 Grok 4.6,享受额度翻倍优惠。
技术升级与行业动态
Grok 4.6 参数量维持在 1.5 万亿,与 4.5 版本一致,性能提升主要源于训练方法的改进。SpaceXAI 利用 Grok 4.5 重新生成了训练数据,并引入了覆盖编程、网页开发、CAD 等领域的智能体强化学习。训练硬件采用英伟达 GB300 NVL72,上下文窗口保持 50 万 tokens 不变。
新模型具备自我验证机制,在处理复杂任务时会主动回溯检查,确认无误后再继续执行。在 AA-Briefcase 知识工作任务中,Grok 4.6 平均仅需 53 轮对话即可完成,而 Claude Opus 5 需 103 轮;输入 tokens 用量方面,前者为 5 亿,后者高达 20 亿。
网友评价认为,SpaceXAI 正致力于让模型独立完成调研、编码及工具调用全流程,实现真正的自主交付。
同日,DeepSeek 也发布了 V4-Pro 正式版,增强了智能体能力,其在 DeepSWE 评测中的成绩已超过 Claude Opus 4.8。另有消息透露,参数量达 2.1 万亿的 Grok 4.7 已在研发进程中。

