SpaceXAI 曾是一家生产中端模型的实验室,如今已稳步发展。它刚刚打造出全球最强大的模型之一,同时价格仍相对较低。
最新消息:Grok 4.6 正式发布
核心动态:SpaceXAI 联合 Cursor 推出了 Grok 4.6,这是一款专为长时间运行的智能体(Agentic)工作设计的视觉 - 语言模型。该模型现已通过 API、Grok Build 和 Cursor 向开发者开放,后续将登陆面向消费者的 Grok 应用。
- 输入/输出:支持文本和图像输入(上限 50 万 tokens),文本输出无限制(速度 58.4 tokens/秒)。
- 知识截止:2026 年 2 月 1 日。
- 关键特性:提供可调推理级别(低/中/高/xhigh,默认为高)、函数调用、网页与 X 平台搜索、沙盒化代码执行及快速版本(价格加倍)。
- 模型架构:参数量约 1.5 万亿。
- 性能表现:在 Artificial Analysis Intelligence Index 上并列第三(61 分);在 GDPval-AA v2 和 AA-Briefcase 基准测试中排名第二;在 GPQA Diamond 测试中取得 94.9% 的最高分。
- 可用性与定价:支持 Cursor、Grok Build、Microsoft Office 插件、GitHub Copilot 及 API 调用。标准版 API 价格为每百万 tokens:输入$2.00/缓存$0.50/输出$6.00(超过 20 万 tokens 请求加价);快速版价格翻倍。
- 未披露信息:具体架构细节、活跃参数数量、训练数据源及方法论细节。
工作原理:数据驱动的性能跃升
Grok 4.6 是 SpaceXAI 1.5 万亿参数家族的最新成员,基于 Grok 4.5 构建。其性能提升主要源于更长时间的精选数据预训练、Grok 4.5 生成数据的微调以及在智能体任务上的强化学习。训练数据包含来自 Cursor 的匿名化编码智能体数据(含非 Grok 模型使用记录)。
预训练优化
公司利用公开、内部及授权数据进行预训练,并进行了比 Grok 4.5 阶段更长的补充预训练。采用改进的优化器和训练方案,重点筛选了用于推理、先进技术概念及软件工程的合成数据,为微调奠定坚实基础。
微调与强化学习
利用 Grok 4.5 生成包含逐步任务完成记录的新训练样本,涵盖推理轨迹、智能体运行框架及 STEM、软件工程等领域,并通过过滤器剔除缺陷样本。随后,结合人类与合成奖励信号进行强化学习,专门针对知识工作和编码任务优化,包括模拟环境下的底层 GPU 代码编写、网站构建及计算机辅助设计。
性能表现:媲美顶尖模型,成本更具优势
Grok 4.6 在自报及独立基准测试中表现卓越,接近排行榜顶端。在多项指标上可与 Claude Opus 5 和 GPT-5.6 Sol 媲美,且单任务成本更低。
综合智力指数
在 Artificial Analysis Intelligence Index(涵盖九项经济实用任务)中,Grok 4.6(高推理模式,61 分,单任务$0.84)与 GPT-5.6 Sol(最高推理,单任务$1.23)并列第三。相比前代 Grok 4.5(56 分,$0.36),分数提升 5 分,但单任务成本超两倍。其表现略优于 Kimi K3(60 分),略低于 Claude Fable 5(62 分)。
专业领域基准
在测试研究生水平理科问题的 GPQA Diamond 中,Grok 4.6 准确率达 94.9%,创 Artificial Analysis 测试历史新高。在 Terminal-Bench 2.1(命令行编码任务)中,以 88.4% 的完成率排名第三,仅次于 GPT-5.6 Sol 和 Claude Opus 5。
长周期智能体任务
在 AA-Briefcase(跨数周、多文件的知识工作项目)中,Grok 4.6(高推理,1577 Elo)表现仅次于 Claude Opus 5(1715 Elo),略胜 Claude Fable 5(1574 Elo)。值得注意的是,Grok 4.6 完成同等任务所需的轮次约为 Claude Opus 5 的一半,输入 tokens 仅为其四分之一。在 GDPval-AA v2(单一交付物生成)测试中,Grok 4.6(1746 Elo)同样位居第二。
垂直场景测试
在 τ³-Bench Banking(基于政策文档搜索解决客户请求)测试中,Grok 4.6(高推理,任务通过率 50.7%)表现仅次于 Qwen3.8-Max(51.3%)。
新闻背景:SpaceX 收购 Cursor 后的首个成果
Grok 4.6 是 SpaceX 与 Cursor 合作深化后的第二个模型。今年 4 月,Cursor 同意在 SpaceX Colossus 超级计算机上训练模型,赋予 SpaceX 收购选择权。双方合作立竿见影:7 月推出的 Grok 4.5 将 Intelligence Index 得分从 38 分大幅提升至 56 分。SpaceX 于 6 月行使收购权,这笔约 600 亿美元的全股票交易于 8 月 14 日完成,紧随其后便是 Grok 4.6 的发布。三天后,Cursor 推出了类似 GitHub 的代码托管服务 Origin,旨在处理智能体生成的海量代码。
重要原因:效率重塑应用生态
当前模型竞争已从单纯追求基准分数转向公开成本与任务步骤数。Grok 4.6 的核心优势在于能以更少的交互轮次完成长周期任务。在单价相同的情况下,若智能体能将任务轮次减半,整体成本也将降低约 50%。这一效率突破将直接决定基于该模型可构建的应用类型与商业可行性。
我们在想
Cursor 团队为 SpaceXAI 注入了关键的数据资源与技术专长,是 Grok 系列能力快速崛起的重要推手。期待 Grok 能保持激进定价策略并持续迭代,从而倒逼其他顶级实验室跟进,共同推动大模型 token 成本的理性回归。

