就在前几天,Fireworks Research 发布了 Ember-1,一个基于 Kimi K3 训练的模型。它把优化重点放在推理效率上:缩短思考过程,同时保留完成任务的能力。按照 Fireworks 的总体评测描述,Ember-1 的 token 用量减少约 40%,质量保持接近;测试涵盖公开基准、客户的生产编程流量和团队内部的 coding、Agent 工作负载。
模型已经以 Research Preview 的形式接入 Fireworks Serverless。对持续运行编程 Agent 的团队来说,它提供了一个很实际的选择:继续用 K3 衍生的能力处理任务,但减少中间生成的推理。
Elvis Saravia(@omarsar0)给出了一条有意思的评论。他看重的不只是 token 少了多少,而是质量与用量之间的取舍还能继续改善。在他看来,各家实验室快速推出前沿模型,有些方面仍没有充分优化;开放模型让开发者有机会在已有基础上继续挖掘效率。
为什么要再训练 K3
Fireworks 的起点来自用户需求:想保留 K3 的编程能力,又希望费用更低。最直接的尝试是调低 reasoning effort,也就是让模型少花一些推理功夫。团队称,这样会损失过多质量,所以转向额外训练。
它需要保留的能力包括自我反思:发现测试失败后检查之前的假设,根据工具返回的新信息调整下一步行动。Fireworks 希望通过任务和环境反馈,让这些有助于纠错的思考留下来,减少没有推进任务的重复分析与无效循环。
训练任务包含数学、代码、工具使用和软件工程等,既有独立问题,也有持续交互。官方披露,团队进行了 50 多次训练实验、200 多次评估,使用自有数据,没有用客户数据训练。
长推理的费用,会沿任务继续累积
在一些 K3 请求里,Fireworks 观察到内部推理占生成 token 的比例超过 90%。用户最后看到的可能只是一份代码补丁,模型此前已经生成了大量分析。输出 token 按量计费,这部分思考本身就是开销。
编程 Agent 还会连续调用模型:读文件、修改代码、运行测试,再根据报错决定下一步。如果工作流保留完整推理历史,前几轮的思考会被重新送回模型,成为后续输入。Fireworks 的 SII 评测默认就保留推理历史。
用一个教学示意说明:假设每轮新增一份等长的推理记录,随后的三次请求分别携带一份、两份、三份历史。累计输入量是六份;如果每份推理缩短,生成它的输出量和后来反复携带的输入量都会下降。随着轮次增加,这种保留历史的组织方式会让累计输入量近似按轮次平方增长。
额外训练,保住了多少质量
公开对照包括 K3 的 low、high、max 三个推理档位和 Ember-1。max 是这组比较的默认档。成本统一使用 K3 的公开 API 费率:每百万 token,未缓存输入 3 美元、缓存输入 0.30 美元、输出 15 美元。
先看与 K3 max 的逐项结果。下表两列得分均以百分比计,最后一列是成本降幅:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Terminal Bench 2.1 的 89 个样本上,Ember-1 的得分接近 K3 max,成本不到后者的一半。SWE-bench Verified 的 500 个样本上,得分低了 1 个百分点,节省幅度是 15.5%。
再把调低 effort 的结果放回来。K3 low 在这两项测试的得分分别为 76.4% 和 80.4%,都明显低于 Ember-1。这组对照支持了 Fireworks 的选择:通过额外训练减少用量,可以保留更多接近高档位的任务表现。
DeepSWE 1.1 则同时出现了更高得分和更低成本;SWE-Interact 的得分略低,成本下降约三分之一。公开表未给出这些分差的统计区间。总体来看,得分有升有降,节省幅度随任务变化。
五项基准的汇总:向上是得分更高,向左是成本更低。
这张图对应 Elvis 关注的 Pareto 前沿:在给定比较中,没有另一款模型能在质量不降的情况下更省钱,或在费用不增的情况下拿到更高得分。Ember-1 在五项基准的汇总图中,比 K3 max 更靠左、也更靠上;Claude Opus 5 和 GPT-6 Astra 的得分更高,成本也更高。
客户测试中,输出少了,步骤也少了
公开基准之外,Fireworks 与两家客户在生产编程流量上做了 A/B 测试。团队称,两组测试每项任务的 token 用量减少约 35%,质量接近,多数下游指标保持或改善,包括任务完成、成功得分和失败情况。其中一家客户已在生产环境使用 Ember-1,并计划扩大使用。
官方给出的一组明细如下:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
输出从约 4.93 万 token 降到 2.99 万,减少约 39%;步数也从 23.8 降到 21.4,得分保持接近。
Fireworks 还把模型接入内部日常编程与 Agent 流量。按照团队的描述,开发者继续处理原有工作,没有察觉模型已经切换,而 token 消耗下降了。团队把这种平滑替换视为一个积极信号。
从低 effort 的对照,到客户测试里的输出和步数,Ember-1 展示了现有基座的一种优化空间:让模型用更短的推理处理同一类任务。
参考链接
-
Fireworks:Introducing Ember-1:https://fireworks.ai/blog/ember-1 -
Elvis Saravia 对 Ember-1 的评论:https://x.com/omarsar0/status/2104341259540123718 -
Ember-1 模型与 API 入口:https://fireworks.ai/models/fireworks/ember-1 -
Specialized Intelligence Index 与评测方法:https://fireworks.ai/specialized-intelligence-index/

