大数跨境

刚刚,Grok 4.6 发布!性能追平 GPT-5.6 Sol,马斯克这次支棱起来了

刚刚,Grok 4.6 发布!性能追平 GPT-5.6 Sol,马斯克这次支棱起来了 AI信息Gap
2026-08-13
14
导读:Grok 4.6,几小时前刚刚发布。

马斯克旗下的 SpaceXAI 再次展现强劲势头。Grok 4.6 于数小时前正式发布,其纸面性能已几乎追平 GPT-5.6 Sol,而定价仅为后者的三分之一。

值得注意的是,Cursor 和 Grok Build 用户在本周内使用 Grok 4.6 的额度将翻倍。

距离 SpaceXAI 发布 Grok 4.5 仅过去一个多月,4.6 版本便迅速登场。凭借雄厚的资金支持与 Cursor 的数据赋能,该模型的迭代速度令人瞩目。

性能评测:综合指数追平顶尖模型

Grok 4.6 的综合智能指数达到 61 分,与 GPT-5.6 Sol 持平。Anthropic 的 Claude Fable 5 以 62 分微弱领先。相比上一代 Grok 4.5(56 分),新版本一次性提升了 5 分。

该数据源自第三方独立评测机构 Artificial Analysis。目前,Grok 4.6 与 GPT-5.6 Sol 并列榜单第三,Kimi K3(60 分)位居第四。

基准测试表现

在已公布的 10 项评测中,Grok 4.6 斩获三项单项第一:

  • GDPVal-AA:得分 1753 分(Claude Fable 5 为 1741 分);
  • AA-Briefcase:得分 1577 分。该项主要测试长周期智能体任务能力,如调研、报告撰写及数据分析;
  • 法律评测 Harvey LAB:得分 15.8%。Harvey 是一家专注于法律 AI 的公司,该评测专门考察模型处理法律文书和合同分析的能力。Grok 4.6 在此项表现尤为突出,远超 GPT-5.6 Sol 的 2.5%,差距达六倍之多。

在编程领域,Grok 4.6 在 DeepSWE 和 Terminal-Bench 测试中分别为 65.9% 和 26%,略逊于 GPT-5.6 Sol 的 73% 和 34.6%。

价格优势:顶级模型中的“白菜价”

除性能外,Grok 4.6 的定价策略极具竞争力。其 API 价格为每百万输入 tokens 2 美元,每百万输出 tokens 6 美元。这一价格在顶级模型中属于极低水平,甚至低于 Kimi K3。

对比其他主流模型:

  • Claude Opus 5:输入 5 美元,输出 25 美元;
  • GPT-5.6 Sol:输入 5 美元,输出 30 美元;
  • Claude Fable 5:输入 10 美元,输出 50 美元。

最贵的模型定价是 Grok 4.6 的八倍。Cursor CEO Michael Truell 评价称,Grok 4.6 拥有"Opus 级别的智商,但成本极低,速度极快”。Artificial Analysis 实测数据显示,Grok 4.6 完成一个任务的平均成本为 0.84 美元,与 Kimi K3 持平,但智能指数更高。

马斯克转发了投资人 Gavin Baker 的对比图,自豪地表示 Grok 4.6 再次站在了“帕累托前沿”。

帕累托前沿:指在性能和成本两个维度上,不存在比它更优的选择。任何替代品要么性能更差,要么价格更贵。

接入方式与使用限制

用户可通过以下方式体验 Grok 4.6:

Cursor 集成

直接在 Cursor 模型列表中切换至 Grok 4.6 即可使用,该功能已于今日上线。

Grok Build 支持

SpaceXAI 自家的编程 Agent Grok Build 同步支持新版本。这是一个在终端运行的本地化 AI 编程工具,代码不上传服务器,支持多智能体并行处理,可视为马斯克版的 Claude Code 或 Codex。

目前,无论是 Cursor 还是 Grok 订阅,可用额度仍较为有限。

图中显示的 100 美元/月新订阅目前仅为占位符,实际点击后仍指向 300 美元/月的 SuperGrok Heavy 方案。

API 开放与合作伙伴

Grok 4.6 API 已向 OpenRouter、Vercel 和 Cloudflare 等合作伙伴开放。此外,还推出了响应速度更快的快速版本,价格为标准版的两倍(输入 4 美元/百万 tokens,输出 12 美元/百万 tokens)。

首周优惠活动

即日起至未来一周内,用户在 Cursor 和 Grok Build 中使用 Grok 4.6,享受额度翻倍优惠。

技术升级与行业动态

Grok 4.6 参数量维持在 1.5 万亿,与 4.5 版本一致,性能提升主要源于训练方法的改进。SpaceXAI 利用 Grok 4.5 重新生成了训练数据,并引入了覆盖编程、网页开发、CAD 等领域的智能体强化学习。训练硬件采用英伟达 GB300 NVL72,上下文窗口保持 50 万 tokens 不变。

新模型具备自我验证机制,在处理复杂任务时会主动回溯检查,确认无误后再继续执行。在 AA-Briefcase 知识工作任务中,Grok 4.6 平均仅需 53 轮对话即可完成,而 Claude Opus 5 需 103 轮;输入 tokens 用量方面,前者为 5 亿,后者高达 20 亿。

网友评价认为,SpaceXAI 正致力于让模型独立完成调研、编码及工具调用全流程,实现真正的自主交付。

同日,DeepSeek 也发布了 V4-Pro 正式版,增强了智能体能力,其在 DeepSWE 评测中的成绩已超过 Claude Opus 4.8。另有消息透露,参数量达 2.1 万亿的 Grok 4.7 已在研发进程中。

【声明】内容源于网络
0
0
AI信息Gap
各类跨境出海行业相关资讯
内容 1041
粉丝 0
AI信息Gap 各类跨境出海行业相关资讯
总阅读106.6k
粉丝0
内容1.0k