大数跨境

苏神复盘 Kimi K3:896 个专家背后,藏着哪些关键技术取舍?

苏神复盘 Kimi K3:896 个专家背后,藏着哪些关键技术取舍? AI科技评论
2026-08-05
7
导读:从异常激活到专家拥堵,拆解超大模型训练难点。
从异常激活到专家拥堵,深度拆解超大模型训练难点。

作者丨郑佳美

编辑丨岑   峰

近日,Kimi 研究员、RoPE 提出者苏剑林发布文章《简单谈谈 K3 的 MoE 和 Attention》,深入剖析 Kimi K3 在专家架构、训练稳定性、负载均衡及注意力设计上的关键取舍。

文章指出,K3 拥有 2.8 万亿总参数及 896 个路由专家,但每个 Token 仅激活其中 16 个。在注意力结构上,K3 采用 KDA 与 Gated MLA 交替排列的混合方案。这一设计核心在于:模型可无限扩大容量,但必须控制计算成本不随参数量和上下文长度同步增长。更多专家意味着更细致的能力分工,混合注意力则降低了长上下文处理成本。

然而,规模扩张引发新挑战:Router 需精准选择专家并避免负载不均;跨设备通信成本剧增;长上下文推高 KV Cache 消耗;低精度训练(BF16/FP8)易受异常激活影响。因此,K3 的关键在于建立一套配套控制机制:LatentMoE 降低计算通信成本,RMSNorm 与 SiTU-GLU 稳定数值,Quantile Balancing 协调负载,KDA 与 NoPE MLA 重构记忆检索任务。

简言之,K3 的核心逻辑是:模型可拥有更大的参数和信息空间,但每一步计算都必须严格控制实际调用部分。

01 LatentMoE 如何重新分配专家预算

传统 MoE 通过 Router 选择少数专家参与计算,以在大参数量下控制单次计算量。但在分布式训练中,隐藏状态跨 GPU 传输往往比矩阵计算更早成为瓶颈。

LatentMoE 改变了 Token 进入专家的方式:K3 先将完整隐藏状态(7168 维)压缩至更窄的潜在空间(3584 维),在低维空间完成专家计算后再恢复。此举不仅减少了单专家计算量,更显著降低了权重读取、激活处理及跨设备数据传输量。

节省下的预算被用于扩大专家池:方案从"448 选 8"扩展为"896 选 16"。虽然激活比例相同,但后者提供了更多可组合的专家,使模型能利用多个窄专家协同处理 Token,实现更细致的能力分工。

潜在空间作为信息瓶颈,可能导致部分信息损失。为此,K3 保留了 2 个始终参与的共享专家,负责语言结构、基础语义等通用计算;路由专家则专注于细分能力,避免重复劳动。LatentMoE 的本质是重新组织通用能力、专业能力与通信成本的平衡。

02 Stable LatentMoE:如何处理数值与负载风险

LatentMoE 增加了降维、计算、聚合及升维步骤,延长了计算路径,加剧了数值波动风险。K3 引入 RMSNorm、SiTU-GLU 和 Quantile Balancing,构建 Stable LatentMoE 机制。

RMSNorm置于专家结果聚合后、升维前,用于校准不同 Token 因专家组合差异导致的尺度波动,相当于在路由分支与主干网络间设立统一数值接口。

SiTU-GLU针对 SwiGLU 激活函数可能产生的离群值问题。在低精度训练中,极端数值会占用动态范围,压缩正常数值精度。SiTU-GLU 通过 Soft Cap 限制增长:小数值保留原行为,大数值增速放缓并趋于饱和,相比直接 Clamp 更加平滑。

Quantile Balancing解决专家负载不均问题。传统无辅助损失方法类似 SignSGD,按固定步长调整偏置,难以兼顾 896 个专家的调整速度与稳定性。Quantile Balancing 直接观察 Router 分数分布,估算每个专家的选择门槛,使其接收目标数量的 Token。这将负载均衡从经验反馈转向分布求解,与 RMSNorm、SiTU-GLU 共同构成稳定机制。

03 KDA 与 NoPE MLA 如何分配记忆任务

K3 注意力结构由 KDA 和 Gated MLA 组成,约每 3 层 KDA 插入 1 层 MLA。两者在成本与历史信息保存方式上存在差异:

  • MLA:保留对完整历史的全局访问能力,承担全局检索任务。
  • KDA:将历史信息写入固定大小状态,通过更新、遗忘和覆盖维持,以低成本处理长序列,但会压缩部分细节。

K3 采用分工策略:KDA 高频维持连续状态,MLA 周期性回查完整历史以补充遗漏信息。这种分工使得 MLA 可移除 RoPE。纯 MLA 模型需显式建模位置关系,而 K3 中的 KDA 通过递归更新状态,已将顺序与距离信息包含在状态演化中(早期信息经历更多衰减,近期信息路径更短)。

所谓“广义 RoPE",指位置信息可由具有顺序性的状态更新机制表达。此外,K3 在 MLA 输出后增加 Gate,根据当前输入筛选回查结果的使用强度。三者分工明确:KDA 维持状态,MLA 执行回查,Gate 筛选结果。

04 64 维分支与 Per-Head Muon 反映的系统约束

K3 的 NoPE MLA 保留了原本用于 RoPE 的 64 维分支。尽管理论上可删除,但改变张量形状会影响 KV Cache 布局、Attention Kernel 及推理框架。对于 2.8 万亿参数模型,保留原有结构遵循“最小改动原则”,可复用成熟基础设施,降低工程风险。

Per-Head Muon优化器则针对不同 Attention Head 分开处理参数。由于各 Head 学习模式不同,统一归一化可能导致梯度较大的 Head 干扰其他 Head。Per-Head Muon 使优化方式与模型结构边界保持一致,减少不必要耦合。

综上,K3 架构不仅由理论效果决定,更受通信成本、低精度数值、Kernel 复用及工程风险等多重因素制约。尽管低维空间可能损失信息、KDA 存在遗忘细节等问题,但 K3 指明了一条清晰路线:当模型进入万亿参数和百万上下文阶段,Scaling 的重点已从单纯扩大容量,转向建立更高效的参数、记忆与计算调度机制。

参考链接:https://kexue.fm/archives/11848

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读208.8k
粉丝0
内容8.9k