新智元报道

OpenAI 史上最快的模型,正式退役。
Codex 负责人 Tibo 宣布,GPT-5.3-Codex-Spark 将于下周停止服务。这款每秒生成 1200 个 Token、被视为 OpenAI 摆脱英伟达依赖首款落地的模型,从发布到下线仅存活了 7 个月。
Tibo 给出的理由直白而残酷:用量持续下滑,且团队已拥有性能更优的替代方案。「是时候给未来腾地方了。」他同时调侃道,难以置信曾经发布过名字如此冗长的模型。

告别式上,开发者只关心「备用额度」
Spark 的退场显得安静甚至略带尴尬。Hugging Face 的 Vaibhav Srivastav 试图在评论区留存一丝温情,感谢其作为「最快小子」的服役,并建议用户在退役前最后体验一次,感受技术迭代的跨度。

然而,随后的评论风向骤变。有用户质疑其实际用途,调侃仅剩的 67 名重度用户将面临困境。

开发者 argofowl 的评价更为犀利:「Spark 是个有趣的实验品,但作为生产工具极度糟糕。很高兴它下线,我已数月未用。」另有开发者指出,在处理理解项目上下文或分析日志等基础任务时,Spark 极易填满上下文窗口,迫使开启新对话,实用性受限。

事实上,令部分开发者感到惋惜的并非模型本身,而是其附带的独立配额。知名开发者 Chubby 坦言,渴望保留类似机制,因为在主额度(如 Astra)紧张的当下,Spark 常被当作耗尽后的「备用油箱」。

七个月前的「未来」,败给了「降智提速」
回溯至今年 2 月 12 日,Spark 上线时声势浩大。作为 OpenAI 首个专为实时编程设计的模型,它拥有 128k 上下文,官方宣称客户端与服务器往返开销降低 80%,首 Token 延迟减半,代码生成如倾泻般流畅。

早期尝鲜者曾兴奋不已。开发者 Ryan Vogel 将其纳入工作流,配合 GPT-5.4 规划、Spark 探索代码库,实现了无 Claude 模型的高效低成本开发;Instructor 作者 Jason Liu 曾利用 20 个 Spark 子代理搜索文件系统,断言「RAG 已死」,随后他亦加入 OpenAI Codex 团队。


更具战略意义的是,Spark 承载着 OpenAI 摆脱单一硬件依赖的野心。它是首个运行在英伟达技术栈之外的生产级模型,底层算力源自 Cerebras 的晶圆级芯片 WSE-3,标志着双方 750 兆瓦、价值超 200 亿美元算力大单的首次交付。
然而,热度消退的速度远超预期。Spark 的致命缺陷在于,受限于单块晶圆的算力,它本质上是为极致速度妥协的「蒸馏版小模型」。
数据显示,在 Terminal-Bench 2.0 评测中,Spark 准确率仅为 58.4%,远低于完整版 GPT-5.3-Codex 的 77.3%。SWE-Bench Pro 曲线同样表明,Spark 虽能将任务压缩至 1-2 分钟,但准确率停滞在 47%-51% 区间;而完整版模型虽耗时较长,准确率却可提升至 57%。这意味着,Spark 省下的几分钟,是以牺牲五六个百分点的准确率为代价的。

此外,宣传中的「15 倍提速」也被证伪。开发者 Nicholas Van Landschoot 指出,该数据是拿 Spark 对比开启最高推理强度的 GPT-5.3-Codex 所得。在同等准确率下,Spark 实际仅快 1.37 倍。

在实际编码场景中,Spark 幻觉 API 端点、JSON 格式不稳定、多步任务易跑偏等缺陷被无限放大。正如 Turing College 所总结:「没有智能的速度,只是更快地失败。」对于开发者而言,花费 17 分钟获得可运行代码,远优于 2 分钟拿到满是 Bug 的废品。
旗舰本尊下场,Ultrafast 终结 Spark 使命
真正宣告 Spark 死刑的,是 8 月 13 日 Cerebras 发布的 Ultrafast 模式。这一次,运行在晶圆上的不再是缩水版 Spark,而是旗舰模型GPT-5.6 Sol 本尊。

通过将旗舰模型按层切分并铺设于多台 CS-3 节点形成流水线,Ultrafast 模式在保持「与标准版同等智能」的前提下,实现了每秒 750 个 Token 的惊人速度。Cerebras 数据显示,Ultrafast 比标准档快 14 倍。

Cerebras CEO Andrew Feldman 断言:「速度与智能,不再互斥。」在 GDP-Val 的对比测试中,标准版 Sol 平均耗时 7.7 分钟,而 Ultrafast 仅需 83 秒,端到端速度提升 5.6 倍,且回答质量几乎无差别。

这一技术突破直接抽干了 Spark 存在的意义。Spark 的设计初衷是「拿智能换速度」,但半年后,同一家公司的晶圆已能全速运行完整旗舰模型,速度仅慢四分之一,能力却毫发无损。
鉴于 Cerebras 产能有限,当无人问津的「缩小版」与排队疯抢的「旗舰版」争夺同一批晶圆时,淘汰前者已成必然。

速度不再是「专属模型」,而是「付费档位」
Spark 并非唯一被清理的历史包袱。过去三个月,OpenAI 模型库经历了激进的新旧更替:GPT-5.2、GPT-5.4 系列相继退役,用户全面迁移至 5.6 世代。伴随着旧版本离场,Codex 迎来了 Sol、Terra、Luna、Astra 的全新命名纪元,冗长的版本号后缀已成为过去式。

更深层的逻辑变革在于,「快」正从独立的专用模型属性,演变为旗舰模型的标配「档位」。如同推理强度分为 Light 至 Max,OpenAI 现在的速度也划分为 Standard、Priority 及 Ultrafast。速度与算力深度绑定,按档付费的商业模式已然跑通。
回顾历史,Spark 完美完成了其过渡期探路者的使命:它验证了 Cerebras 晶圆承载生产级流量的能力,证明了推理任务可脱离英伟达生态独立运行。当大部队正式入驻,探路者自然功成身退。
「拿智能换速度」的歧途已被封死。随着各大平台竞逐底层硬件的极致利用率,下一轮军备竞赛的规则彻底改写:未来的竞争不再是谁能做出最快的阉割版模型,而是谁能把最强的旗舰模型,跑出最极限的速度。

