大数跨境

Ember-1:基于 Kimi K3,少用约 40% token

Ember-1:基于 Kimi K3,少用约 40% token AINLP
2026-09-28
6
导读:模型优化的又一个思路

就在前几天,Fireworks Research 发布了 Ember-1,一个基于 Kimi K3 训练的模型。它把优化重点放在推理效率上:缩短思考过程,同时保留完成任务的能力。按照 Fireworks 的总体评测描述,Ember-1 的 token 用量减少约 40%,质量保持接近;测试涵盖公开基准、客户的生产编程流量和团队内部的 coding、Agent 工作负载。


模型已经以 Research Preview 的形式接入 Fireworks Serverless。对持续运行编程 Agent 的团队来说,它提供了一个很实际的选择:继续用 K3 衍生的能力处理任务,但减少中间生成的推理。

Elvis Saravia(@omarsar0)给出了一条有意思的评论。他看重的不只是 token 少了多少,而是质量与用量之间的取舍还能继续改善。在他看来,各家实验室快速推出前沿模型,有些方面仍没有充分优化;开放模型让开发者有机会在已有基础上继续挖掘效率。

为什么要再训练 K3

Fireworks 的起点来自用户需求:想保留 K3 的编程能力,又希望费用更低。最直接的尝试是调低 reasoning effort,也就是让模型少花一些推理功夫。团队称,这样会损失过多质量,所以转向额外训练。

它需要保留的能力包括自我反思:发现测试失败后检查之前的假设,根据工具返回的新信息调整下一步行动。Fireworks 希望通过任务和环境反馈,让这些有助于纠错的思考留下来,减少没有推进任务的重复分析与无效循环。

训练任务包含数学、代码、工具使用和软件工程等,既有独立问题,也有持续交互。官方披露,团队进行了 50 多次训练实验、200 多次评估,使用自有数据,没有用客户数据训练。

长推理的费用,会沿任务继续累积

在一些 K3 请求里,Fireworks 观察到内部推理占生成 token 的比例超过 90%。用户最后看到的可能只是一份代码补丁,模型此前已经生成了大量分析。输出 token 按量计费,这部分思考本身就是开销。

编程 Agent 还会连续调用模型:读文件、修改代码、运行测试,再根据报错决定下一步。如果工作流保留完整推理历史,前几轮的思考会被重新送回模型,成为后续输入。Fireworks 的 SII 评测默认就保留推理历史。

用一个教学示意说明:假设每轮新增一份等长的推理记录,随后的三次请求分别携带一份、两份、三份历史。累计输入量是六份;如果每份推理缩短,生成它的输出量和后来反复携带的输入量都会下降。随着轮次增加,这种保留历史的组织方式会让累计输入量近似按轮次平方增长。

额外训练,保住了多少质量

公开对照包括 K3 的 low、high、max 三个推理档位和 Ember-1。max 是这组比较的默认档。成本统一使用 K3 的公开 API 费率:每百万 token,未缓存输入 3 美元、缓存输入 0.30 美元、输出 15 美元。

先看与 K3 max 的逐项结果。下表两列得分均以百分比计,最后一列是成本降幅:

基准
K3 max
Ember-1
成本减少
Terminal Bench 2.1
80.9
82.0
51.9%
SWE-bench Verified
93.2
92.2
15.5%
SWE-Interact
21.3
20.0
32.5%
DeepSWE 1.1
66.4
75.2
23.7%
τ-2 Bench Airline
64
66
5.9%

Terminal Bench 2.1 的 89 个样本上,Ember-1 的得分接近 K3 max,成本不到后者的一半。SWE-bench Verified 的 500 个样本上,得分低了 1 个百分点,节省幅度是 15.5%。

再把调低 effort 的结果放回来。K3 low 在这两项测试的得分分别为 76.4% 和 80.4%,都明显低于 Ember-1。这组对照支持了 Fireworks 的选择:通过额外训练减少用量,可以保留更多接近高档位的任务表现。

DeepSWE 1.1 则同时出现了更高得分和更低成本;SWE-Interact 的得分略低,成本下降约三分之一。公开表未给出这些分差的统计区间。总体来看,得分有升有降,节省幅度随任务变化。

五项基准的汇总:向上是得分更高,向左是成本更低。

这张图对应 Elvis 关注的 Pareto 前沿:在给定比较中,没有另一款模型能在质量不降的情况下更省钱,或在费用不增的情况下拿到更高得分。Ember-1 在五项基准的汇总图中,比 K3 max 更靠左、也更靠上;Claude Opus 5 和 GPT-6 Astra 的得分更高,成本也更高。

客户测试中,输出少了,步骤也少了

公开基准之外,Fireworks 与两家客户在生产编程流量上做了 A/B 测试。团队称,两组测试每项任务的 token 用量减少约 35%,质量接近,多数下游指标保持或改善,包括任务完成、成功得分和失败情况。其中一家客户已在生产环境使用 Ember-1,并计划扩大使用。

官方给出的一组明细如下:

模型
得分
步数
输出 token
Kimi K3
0.751
23.8
49.3K
Ember-1
0.753
21.4
29.9K

输出从约 4.93 万 token 降到 2.99 万,减少约 39%;步数也从 23.8 降到 21.4,得分保持接近。

Fireworks 还把模型接入内部日常编程与 Agent 流量。按照团队的描述,开发者继续处理原有工作,没有察觉模型已经切换,而 token 消耗下降了。团队把这种平滑替换视为一个积极信号。

从低 effort 的对照,到客户测试里的输出和步数,Ember-1 展示了现有基座的一种优化空间:让模型用更短的推理处理同一类任务。

参考链接

  • Fireworks:Introducing Ember-1:https://fireworks.ai/blog/ember-1
  • Elvis Saravia 对 Ember-1 的评论:https://x.com/omarsar0/status/2104341259540123718
  • Ember-1 模型与 API 入口:https://fireworks.ai/models/fireworks/ember-1
  • Specialized Intelligence Index 与评测方法:https://fireworks.ai/specialized-intelligence-index/

【声明】内容源于网络
0
0
AINLP
一个有趣有AI的自然语言处理公众号:关注AI、NLP、大模型LLM、机器学习、推荐系统、计算广告等相关技术。公众号可直接对话双语聊天机器人,尝试对对联、作诗机、藏头诗生成器、自动写作等,查询相似词,测试NLP相关工具包。
内容 6042
粉丝 0
AINLP 一个有趣有AI的自然语言处理公众号:关注AI、NLP、大模型LLM、机器学习、推荐系统、计算广告等相关技术。公众号可直接对话双语聊天机器人,尝试对对联、作诗机、藏头诗生成器、自动写作等,查询相似词,测试NLP相关工具包。
总阅读34.0k
粉丝0
内容6.0k