7 月 16 日 WAIC大会前夜,月之暗面放出 Kimi K3,2.8T 参数,开放权重模型里目前体量最大的一个。
7 月 27 日晚,月之暗面如约正式开放 Kimi‑K3 完整模型权重,同步对外发布 47 页Kimi‑K3 技术报告。
报告开篇,K3就很严谨的给自己的定位,除掉Claude Fable 5 和 GPT-5.6,超越其他所有开源和闭源对手。
"Kimi K3 ... is consistently ahead of the other open and proprietary models evaluated in our suite." 稳定领先测试里其他所有开源和闭源模型。
K3 的技术走向和 Nemotron 3、DeepSeek V4 一样,都在往推理效率上使劲。
MoE 换成 LatentMoE,普通 attention 换成 latent attention 加 Kimi Delta Attention(KDA)。每一处替换都带着一个效率上的算盘。技术报告里给这套东西起了一个名字叫 Stable LatentMoE,"Stable" 两个字不是随手加的,值得解读解读。

LatentMoE 压的不只是通信量,是把 MoE 两个老毛病一起治了
LatentMoE 干的事是把路由专家的宽度和主干宽度拆开。共享专家走全宽度路径处理常规变换,路由专家只在一个压缩过的潜空间里工作,K3 里这个潜空间是 3584 维,主干隐藏维度的一半。这个逻辑跟 MLA 把 KV 压进低维向量是同一套哲学:只要涉及一个 token 要跟一大堆候选打交道(不管是 KV 头还是专家),先降维再算,通信量和显存都能省下来。
打个比方,公司里有 896 个专家岗位,每次遇到问题不需要把完整案卷发给每个候选人过目,先压缩成一页摘要,谁看完摘要觉得自己能接,才把完整信息发给他,中间省下来的就是这些没被选中的人不用收全套材料的那部分带宽。
K3 把这个思路推到了 896 个路由专家,每个 token 只激活 16 个,稀疏度 56。报告很坦率地承认,这么极端的稀疏放大了两个具体问题,不是笼统说一句效率提升就带过去了。
第一个问题是激活爆炸。路由路径要经过降维、门控多分支前馈、再升维,接近四次连续矩阵乘法,2.8T 参数规模下这条链路很容易把内部激活值算炸。对策是 SiTU-GLU,给前馈网络里两个相乘的分支都套上一个软上限(用 tanh 压住数值上限),原点附近还是接近原来 SwiGLU 的表现,数值变大以后被限制在一个固定范围内,而且保留了梯度,不像硬截断那样一饱和梯度就死掉。
报告给的具体参数是 β1=4、β2=25,两者相乘正好是 100,也就是说不管中间算出来的值本来想冲到几千几万,最后过完这道关卡的输出绝对不会超过 100,但如果输入本来就不大,这道关卡形同虚设,跟没加一样。这跟给电路加保险丝是一个道理,平时不跳闸,电流一旦异常飙升才起作用。
第二个问题是负载失衡。896 个专家远超传统方法能稳定处理的规模,老办法靠固定步长慢慢调整专家的选中概率,调不过来。

K3 的 Quantile Balancing 直接从当前一批数据的分位数里解出每个专家该有的偏置,一步到位,报告附录里给出了完整推导,证明这个更新恰好是负载均衡问题的精确解,老办法只是在同一个目标上迈了一小步。换个说法,老办法像是每次发现某个客服坐席接的电话多了就少分他一点、下次再看情况调整,一次只挪一小步;Quantile Balancing 是直接看这一批进来的电话按分数排队排到第几名,卡在那个位置画一条线,一步到位定好每个坐席该接多少,不用来回试探。
所以说 LatentMoE 是压缩这个大方向没问题,但 K3 真正花心思的地方在 Stable 这两个字上。896 专家这个规模是靠 SiTU-GLU 和 Quantile Balancing 兜底才立得住的,不是简单把压缩思路直接放大就能用。
Attention Residuals 跟 DeepSeek V4 的 mHC,走的是两条不同的路
DeepSeek V4 用 mHC(manifold-constrained Hyper-Connections)把残差路径本身拓宽,给残差流增加容量。
这在我们之前的文章里也有介绍:
K3 的 Attention Residuals 是另一条路:残差流的宽度不动,让每一层用一个可学习的查询向量,去对之前所有层的输出做加权检索,权重是注意力分数,跟标准残差不分青红皂白全部累加完全是两回事。
报告里的类比讲得挺清楚:标准残差把所有历史信息压进一个不断累加的状态,跟 RNN 处理时间的方式是一个模子刻出来的。Transformer 当年用注意力解决了序列维度的这个问题,Attention Residuals 就是把这个思路挪到了网络深度这个维度上。原文这句基本把设计动机说完了:
"Each layer selectively retrieves representations from all preceding layers rather than accumulating them uniformly." 每一层有选择地从所有前面的层里检索表征,不是一股脑均匀累加。
打个比方,标准残差像开会记笔记只保留一份不断往下传的会议纪要,每个人发言都直接叠加进同一份总结,到后面谁说了什么细节早就糊成一团。
Attention Residuals 更像是每个环节需要用到信息时,可以直接翻回去查某一位具体发言人当时说的原话,而不是只能看那份被反复稀释过的总纪要。

真正能落地的版本是 Block Attention Residuals,把 93 层网络切成 8 个 block,每块 12 层,块内先把层输出加总成一个代表向量,块间再做完整的跨块注意力,内存和通信开销从全量版本的量级压低了不少。报告自己也说,8 块这个划分是经验上够用,不是理论最优:
"Empirically, N ≈ 8 recovers most of the benefit across model scales." 经验上 N 约等于 8 就能拿到跨模型规模的大部分收益,没把话说满。
至于网上流传的训练成本增加 4%、推理成本增加 2% 这两个数字,报告正文没有单独拆开列出来,出处存疑,引用前建议自己核实一遍再用。
复杂是复杂,但不是 Kimi 一家在这么押注
如果没提前学过 Kimi Linear 里的这些组件,看到这张图照样头大。有网友直接吐槽这架构复杂得像一锅乱炖。K3 不是孤立现象,DeepSeek、Nemotron、Kimi 三家各自独立走到了类似的架构判断上,压缩、残差优化、减少位置编码这几个方向,谁也没抄谁,是各自算账算到了同一个地方。这种收敛比任何一家单独放出的分数更值得留意,说明这几条路径不是某个团队拍脑袋的赌注,是这个规模下绕不开的坑。
NoPE 全栈:网友问的长度泛化问题,报告里其实有答案
K3 把所有 RoPE 都去掉了,MLA 层全用 NoPE,也就是完全不显式编码位置。这个选择反直觉,业界更常见的做法是局部注意力保留 RoPE,只有全局层用 NoPE。K3 是全栈都不碰位置编码。
机制不复杂。KDA 层靠逐 token 的递归门控和衰减机制隐式带着位置信息,衰减率本身就是跟位置累积相关的量。MLA 层完全不管位置,只负责不分远近的全局内容交互,报告说得很直白:
"No explicit positional encoding is applied to their queries or keys." MLA 的查询和键上不加任何显式位置编码。
这么分工还有个附带好处,扩展上下文长度的时候不用碰任何位置编码参数,不用像 RoPE 那样做频率重调或插值。
长度怎么泛化到 1M,报告里给了具体训练曲线。预训练从 8K token 起步扩到 64K,cooldown 阶段再从 256K 一路扩到 1M,四阶段课程慢慢来。光拉长训练长度不够用,报告特意强调这一点:
"Length alone, however, does not confer long-range capability." 光有长度不代表就有长程能力。
天然又长又连贯的文档和视频比短文本稀缺得多,所以专门合成了长上下文数据,把多模态文档和子任务打乱重新拼接,逼着模型必须跨越整个窗口去检索信息才能解题。说白了,NoPE 能撑住 1M 上下文,靠的不是架构本身有什么魔法,是训练数据把必须看得远这件事硬塞进了监督信号里。
开放的不只是权重
Moonshot 这次不光放出模型权重,推理内核和 MoE 路由代码也一起开源了。FlashKDA,训练和推理 prefill 都用得上的核,已经是 flash-linear-attention 的一个后端。MoonEP,专家并行负载均衡方案,代码在 GitHub 上。专门给 agentic RL 用的 microVM 沙箱系统 AgentENV 里有个细节挺有意思,报告原句:
"A paused sandbox consumes no memory or CPU resources." 暂停状态的沙箱不占用任何内存或 CPU。
智能体等模型推理结果的这段空闲时间能占到沙箱生命周期的 98%,等于把训练里最大的一块闲置资源直接榨了出来。技术报告里案例研究提到的从零写的编译器 MiniTriton,还有 48 小时跑出来的推理芯片 RTL 代码 nano-kpu,也都放了出来。
Moonshot 像过去DeepSeek所做的一样,开放的不仅仅是权重,而是把训练和推理系统里工程细节及权衡思考摊开给你看,专家负载均衡怎么做到理论最优,递归状态怎么在多设备间同步,agentic RL 的沙箱怎么把等待模型推理的空闲时间榨出来。这些东西不会体现在跑分表格的任何一格里,但决定了下一个想复现这套架构的团队要少走多少弯路。
这么看来,月之暗面 Kimi‑K3 开放完整模型权重并发布技术白皮书,被海外市场称作“DeepSeek 2.0 时刻”是完全有迹可循的。
关注公众号回复“进群”入群获取中英文论文对照版

