已经在跟踪模型成本和准确率的开发者,现在有了一个新的重要理由去关注第三个关键因素:速度。
最新消息:OpenAI 与 Cerebras 联合预览了 Ultrafast,这是一项运行在 Cerebras 硬件上的新 API 服务层,搭载 GPT-5.6 Sol 模型。
- 吞吐量:Ultrafast 宣称最高输出速度达 750 tokens/秒。对比测试显示,OpenAI 官方 API 上的 GPT-5.6 Sol 仅为 65 tokens/秒,Ultrafast 速度快约 11 倍。
- 完成时间:在 6 个 GDPVal 基准任务中,Ultrafast 平均耗时 83 秒,而标准版 Sol 需 7.7 分钟,端到端速度提升 5.6 倍。
- 延迟:标准版 GPT-5.6 Sol 首 token 延迟高达 97.2 秒(GPT-5.5 为 14.5 秒)。目前两家公司尚未公布 Ultrafast 的具体延迟数据。
- 价格与可用性:仅向部分客户开放有限预览,其他用户需排队等候;具体价格及正式上线日期待定。
- 未披露信息:基准测试结果尚缺独立第三方验证。
同一周内,Google 推出 Gemini 3.7 Flash,Nvidia 发布 Nemotron 3.5 Lightning,三者均将“速度”作为核心卖点,旨在优化依赖响应时间的应用表现。
速度到底是什么
在 AI 领域,“速度”主要对应两个指标:延迟(首 token 出现前的等待时间)和吞吐量(启动后每秒生成的 token 数)。Ultrafast 主要针对吞吐量进行优化:Cerebras 硬件将 GPT-5.6 Sol 权重保存在 44GB 片上 SRAM 中,避免了访问外部存储器的瓶颈,突破了传统 GPU 推理的限制。
- Ultrafast (GPT-5.6 Sol):在 Humanity's Last Exam 测试中,Ultrafast 用时 11 小时 11 分钟完成全部 2,500 道题,比 Claude Fable 5(78 小时 27 分钟)快约 7 倍。整体 Fast 模式下,其速度比 Claude Fable 5 快 11 倍,比 Claude Opus 4.8 快 5 倍。
- Gemini 3.7 Flash:测试数据显示其输出速度为 330 tokens/秒,首 token 等待时间为 13.2 秒。其 Artificial Intelligence Index 平均分为 56,优于前代 Gemini 5.6 Flash 的 52 分。
- Nemotron 3.5 Lightning:Nvidia 称其输出速度比同类模型快 4 倍,智能体任务完成速度快 30%。配合开源路由库 NeMo Switchyard,可根据步骤需求动态分配模型,将任务成本降至仅使用 Claude Opus 4.8 的约三分之一。
新闻背后
Ultrafast 并非 OpenAI 对速度优化的唯一举措。本周,OpenAI 发布了与 Broadcom 合作研发的新推理芯片 Jalapeño 的首批测试结果。数据显示,该芯片在运行自家模型及开源权重模型时,延迟和吞吐量表现优异。芯片厂商需在速度、用户规模及功耗之间取得平衡,这将直接影响推理成本与可靠性。
重要原因
推理速度的提升不仅改善固定任务的表现,更拓展了 AI 的应用边界:
- 实时交互体验:人类对话轮次间隔约为 0.3 至 1 秒。若语音助手停顿超过 1 秒,用户体验将显著下降。
- 开发者效率:代码生成等任务若需等待数分钟,会导致开发者注意力分散及上下文丢失,增加心理疲劳。
- 实时监控与响应:低延迟和高吞吐量使常驻智能体能即时监控系统及安全信息流,在事件发生时立即反应,避免错过行动窗口。
- 工具调用效率:搜索、代码执行和数据检索等工具的使用高度依赖延迟和吞吐量,直接影响智能体工作流的总耗时。
我们在想
更快的 AI 模型已赋能智能体进行代码编写、数据检索及近实时的语音对话。我们鼓励开发者不仅关注现有应用对高吞吐量和低延迟的需求,更要思考如何利用新模型与新硬件的速度优势,开拓前所未有的应用场景。

