月之暗面发布了 Kimi K3:2.8 万亿参数的 MoE 原生多模态模型,1M 上下文,官方叫它"世界上第一个开放的 3T 级模型",7 月 27 号之前放出权重。跑分很硬,BrowseComp、Automation Bench 这些 agentic 指标上,它压过了 Claude Fable 5 和 GPT-5.6 Sol;在第三方的 Arena 前端代码榜上,它更是直接拿了第一。
但整份发布里最有意思的一个细节,藏在它自己的跑分图里:在一个叫 Kimi Code Bench 的、它自己家的内部基准上,它把 Claude Fable 5 排在了自己前面(76.9 对 72.9)。
一家刚发完新模型的厂商,在自己设计的榜单上,让对手赢。这事比 2.8 万亿参数更值得琢磨。
01先看它确实赢了什么
赢的地方是实打实的,而且集中在最能反映"能不能干活"的 agentic 一类:
BrowseComp 拿到 91.2,压过 Sol 的 90.4 和 Fable 5 的 88.0;Automation Bench 30.8,同样把两家甩在后面(29.7 / 29.1);SWE Marathon 42.0,比 Fable 5 的 35.0 高出一大截;Program Bench 77.8 和 SpreadsheetBench 34.8 也都是第一,虽然只赢了零点几。
Kimi K3 的 Coding 榜单:Program Bench 与 SWE Marathon 拿第一,Terminal Bench 88.3 紧咬 Sol;注意 Kimi Code Bench 2.0 是 Kimi 自家的内部基准,它把 Fable 5 的 76.9 排在了自己 72.9 前面(图源:Kimi 官方)
编码这块还有个数字值得单说:FrontierSWE 上它拿 81.2,比 GPT-5.6 Sol 的 71.3 高了整整 10 分;Terminal Bench 2.1 上 88.3,和 Sol 的 88.8 就差半分。对一个开放权重的模型来说,这个位置很少见。
02也别只看赢的那几个
把整张表看完,故事就没那么单边了。
在 GDPval-AA v2 这个综合性最强的 Elo 榜上,Fable 5 是 1760、Sol 是 1748,K3 只有 1668,排第三;DeepSWE 上它 67.5,同样落在 Sol(73.0)和 Fable 5(70.0)后面。也就是说:单项能赢,综合还差一截。
Kimi K3 的通用/视觉 agent 榜单:BrowseComp 91.2、Automation Bench 30.8 拿第一,但综合性的 GDPval-AA v2 Elo 上 1668 落后 Fable 5 的 1760 和 Sol 的 1748(图源:Kimi 官方)
官方自己也没绕这个弯子。博客里明明白白写着,K3 在用户体验上跟 Fable 5 和 GPT-5.6 Sol 仍有明显差距。跑分是跑分,顺不顺手是另一回事,这句话它自己说了。
03有一个第一,不是它自己给的
上面所有数字都有个共同前提:都是 Kimi 自己测的。所以这一条得单拎出来说。
在第三方的 Arena AI 前端代码榜上,K3 以 1679 分排到了第一,把 Claude Fable 5 的 1631、GPT-5.6 Sol 的 1618 都压在身后,GLM-5.2 的 1587 只排到第四。它比自家上一代 K2.6 的 1515,高出 164 分。
往细里看更狠:前端被拆成 7 个领域,K3 拿下了其中 6 个第一,品牌与营销、基于参考的设计、数据与分析、消费产品、模拟、内容创建工具。只有游戏这一项排第二,输给 Fable 5。
第三方 Arena AI 前端代码榜:Kimi-K3 以 1679 分排第一,压过 Fable 5 的 1631 与 GPT-5.6 Sol 的 1618;前端 7 个细分领域里它拿了 6 个第一,只有游戏排第二(数据来源:Arena AI 前端代码榜 arena.ai/leaderboard/code,非厂商自测)
这条的分量和前面那些不一样:榜是别人的,分是投出来的。 前端又偏偏是最讲手感和审美的活,也正是官方承认"体验还有差距"的那一块。一个开放权重的国产模型能在这上面拿第三方榜的第一,放在半年前不太敢想。
04价格才是那把真正的刀
如果说跑分是互有胜负,价格这块就没什么悬念了。
K3 的 API 定价:缓存命中的输入 每百万 token 0.30 美元,没命中 3 美元,输出 15 美元。对照 Claude Fable 5 公布的输入 10 美元、输出 50 美元,同样的活,价格差了三倍多。
更关键的是那个缓存命中率。官方说编码场景下超过 90%,意味着大多数时候你付的是 0.30 那一档,不是 3 块那一档。做 agent 的人最清楚,长上下文反复重放,账单就是这么烧起来的;命中率能不能上 90%,直接决定这个模型能不能拿来跑生产。
K3 与 Claude Fable 5 的价格对照:K3 缓存命中输入 $0.30、未命中 $3、输出 $15;Fable 5 输入 $10、输出 $50,同样的活差三倍多;编码场景 90% 以上的命中率,让你多数时候只付 $0.30 那一档
05技术里最有意思的一处:它优化了自己
参数堆到 2.8 万亿不稀奇,稀奇的是它怎么让这么大的模型跑得动。
几个关键动作:Kimi Delta Attention 让百万级上下文的解码快到 6.3 倍;Stable LatentMoE 把稀疏度推到 896 个专家里只激活 16 个;Attention Residuals 用不到 2% 的额外成本换来约 25% 的训练效率;权重走 MXFP4、激活走 MXFP8,从 SFT 阶段就开始量化感知训练。这些加起来,整体的 scaling 效率比 K2 提升了约 2.5 倍。
还有一处,性质和上面几条不太一样:在优化 AttnRes 的 GPU 内核时,模型自己动手,把一次前向加反向的耗时从 283.6 毫秒压到了 114.4 毫秒。 它等于参与优化了训练自己的那套代码。这个循环一旦转起来,会自己加速。
06想接进去,先记住它自己列的三条坑
这部分是我觉得这次发布最实用的地方。官方博客主动列了三条局限,条条都是要害:
第一条上面说了,体验跟 Fable 5、Sol 还有明显差距。第二条对准备接入的人是硬提醒:它对 thinking history 很敏感,如果你的 agent harness 没把完整的历史思考内容按要求传回去,生成质量会变得很不稳定——这个坑不提前知道,接进去就是玄学。第三条是"过度主动":遇到小问题或者你意图模糊时,它可能替你做一些你没让它做的决定。
一家厂商愿意在发布当天把这三条写出来,比多刷两个点的分有用得多。
07在哪能用上
Kimi 网页、Kimi Work(Windows 和 Apple Silicon Mac 桌面版)、Kimi Code(终端)、Kimi API 平台,以及移动端(iOS / Android / 鸿蒙)都已经上了。目前默认走最大思考强度,低档和高档的档位官方说后续更新再放。想接 API 的去 platform.kimi.ai,权重等 7 月 27 号。
08坦诚,可能才是这轮最该抄的东西
前几天写 Thinking Machines 那个 Inkling 的时候,我记下过一句:官方原话是"这不是当前最强的模型"。今天 Kimi 干了件性质一样的事,甚至更狠:在自己设计的内部基准上,把对手排在自己前面,再顺手列出三条自己的短板。
这两家隔着太平洋,但摆出的是同一个姿态:先把话说准,再让你自己判断。 参数、跑分、价格这些都会被下一代覆盖,倒是这种敢承认"我哪儿还不行"的底气,在过去几年的模型发布会里,一直是最稀缺的。国产模型能走到这一步,比 2.8 万亿这个数字更能说明问题。
7 月 27 号,权重就放出来了。到时候是不是真这么回事,谁都能自己跑一遍——这句话,本身就是一种底气。

