Kimi K3 正式开源!完整权重已上传至 Hugging Face,发布 1 小时内即登顶趋势榜首位。
作为全球首个开源的 3 万亿参数级别模型,Kimi K3 在编程和 Agent 能力上逼近 Claude Fable 5 与 GPT-5.6 Sol,推理成本却仅为后者的几分之一。其发布引发硅谷震动,被视为继 DeepSeek 之后的又一里程碑时刻,甚至促使美国重新评估对中国开源模型的策略。黄仁勋、马斯克等科技领袖纷纷表态支持开源,英伟达更联合 37 家巨头组建开放安全 AI 联盟。
Kimi K3 权重发布后,全球生态迅速响应,实现 Day 0 级别的适配。
这是开源 AI 与中国 AI 的重要里程碑。伴随 Kimi K3 开源的,还有关键的基础设施层技术:
- MoonEP:专为超大细粒度 MoE 打造的高性能通信库,在不均衡负载下仍能实现专家并行的极致效率。
- FlashKDA:Kimi Delta Attention 高性能算子。在英伟达 H20 上,其 prefill 速度较 flash-linear-attention 基线提升 1.72-2.22 倍,可直接作为替换后端。
- AgentENV:月之暗面与 KVCache.ai 合作开发的沙箱系统,为大规模 Agent 训练提供高保真、强隔离环境,支持快速快照、恢复和分叉,有效应对并行工作流。
- 技术报告:详细披露了模型架构与训练细节。
Kimi K3 是一个参数量达 2.8T 的 MoE(混合专家)模型,每个 token 激活 104B 参数,原生支持视觉理解,上下文窗口长达 100 万 token。凭借 KDA(增量注意力)、AttnRes(注意力残差)、Stable LatentMoE(稳定潜在混合专家)等架构创新,以及 MoonEP 等基建突破,其规模化效率较 Kimi K2 提升约 2.5 倍。
在后训练阶段,团队针对通用推理、通用 Agent、编程 Agent 三大领域进行了大规模强化学习,训练轨迹涵盖数百万 token 及数千次工具调用。评测显示,Kimi K3 在编程、搜索、知识工作等任务上全面领先其他开源及闭源模型,仅在少数指标上略逊于 Claude Fable 5 和 GPT-5.6 Sol。
三条信息高速公路
Kimi K3 的架构围绕序列长度、网络深度、模型宽度三个维度优化信息流动。
序列长度:KDA 与 Gated MLA 的互补
在每个 block 中,KDA 层与 Gated MLA 层以 3:1 的比例配置。KDA 作为一种线性注意力机制,利用固定大小的循环状态替代传统 softmax 注意力中不断增长的 KV cache,确保长序列处理时内存开销恒定;Gated MLA 则保留全局 token 交互能力,两者形成互补。
此外,K3 所有 MLA 层摒弃了位置编码(NoPE),位置信息完全由 KDA 的循环门控和衰减机制隐式编码。这使得模型在扩展至 100 万 token 时,无需重新调整 RoPE 频率或进行 YaRN 插值。
网络深度:AttnRes 与 Block 机制
AttnRes 机制允许每一层选择性地从所有前序层获取信息,而非传统的逐层累加。具体实现为每层学习一个伪查询,对所有前层输出进行 softmax 注意力加权。
为控制内存消耗,实际采用 Block AttnRes 方案:将 93 层划分为 8 个 block,block 间执行全注意力,block 内执行累加。这一设计将内存开销从 O(Ld) 降至 O(Nd)。
模型宽度:Stable LatentMoE 与负载均衡
Stable LatentMoE 将路由专家池扩展至 896 个,每个 token 激活 16 个,稀疏度达 56 倍。共享专家负责通用变换,路由专家则在压缩的潜在空间(宽度 3584)中进行专门化计算。
针对极端稀疏下的训练难题,团队采取了以下措施:
- 抑制激活爆炸:在专家聚合和上投影之间插入 RMSNorm,并将 SwiGLU 替换为自研的 SiTU-GLU。SiTU-GLU 利用软截断机制,兼顾了局部响应与数值稳定性。
- 负载均衡:提出 Quantile Balancing(分位数平衡)方法,直接从路由器分数的分位数推导专家偏置,确保每个专家接收目标数量的 token。
视觉模块:MoonViT-V2
MoonViT-V2 是一个 27 层、约 4 亿参数的视觉 Transformer,完全从零开始通过 next-token prediction 训练,未使用 SigLIP 等对比学习模型初始化。实验表明,从零训练的 MoonViT-V2 梯度平稳,最终在视觉评测上追平了 SigLIP 初始化基线。
图像和视频共享参数,注意力分解为帧内空间和帧间时间两个通道。通过 2×2 像素重采样将视觉 token 数压缩 4 倍,使 3584×3584 像素的输入也能适配 100 万 token 上下文。优化器采用 Per-Head Muon,对 Q、K、V 投影矩阵按头维度切分并逐头做 Newton-Schulz 正交化,提升了训练稳定性。
从 8K 到 100 万 token
预训练数据覆盖 Web 文本、代码、数学、知识四大领域及大规模视觉语料。知识类和数学类数据经过多样化风格改写,视觉数据则大幅扩展了程序化多模态内容,涵盖 SVG、3D 资产、网页、游戏、CAD 图纸等格式。
Scaling law 实验证实,架构、数据及训练方法的改进合计带来约 2.5 倍的规模化效率提升。在学习率调度方面,cosine decay(余弦衰减)在独立超参搜索中始终优于 WSD(预热稳定衰减)。
上下文长度通过四阶段课程逐步扩展:预训练阶段从 8K 延伸至 64K,冷却阶段从 256K 拓展至 1M。长文档和视频经过专门清洗,并合成了跨 100 万 token 的拼接任务,以确保模型掌握远距离依赖。
后训练三步走
1. SFT(监督微调):建立冷启动策略,利用前代 Kimi 模型合成复杂 Agent 轨迹数据,经多阶段验证和人工标注。所有数据采用自研 XTML 模板序列化,并从该阶段起引入 QAT(量化感知训练),专家权重使用 MXFP4,激活使用 MXFP8。
2. RL(强化学习):在通用任务、通用 Agent、编程 Agent 三大领域进行训练,每个领域细分为 low、high、max 三档推理力度,共产出 9 个专家模型。算法采用 partial rollout(部分展开),通过逐 token 正则化容忍离策略数据,并利用 per-problem budget 控制推理力度。
3. MOPD(多教师在策略蒸馏):将 9 个专家的能力合并至统一模型。训练时根据领域和推理力度选择对应教师,利用逐 token 的对数概率比作为密集奖励信号,并裁剪极端优势值以稳定训练。
在任务合成方面,团队构建了自演化的层次知识图谱,Agent 通过网络搜索持续扩展节点。RL 环境涵盖可验证搜索、专业知识工作、软件工程、kernel 优化、多模态视觉推理及个人助手等场景,单个 rollout 可能涉及数千次工具调用和数百万 token 上下文。
让 3 万亿参数跑起来
面对 2.8T 参数、混合注意力机制及 100 万 token Agent 轨迹带来的系统级挑战,Kimi K3 在系统设计上进行了多层创新。
KDA 系统协同设计
KDA 的设计分为三层:训练和 prefill 阶段使用 FlashKDA(基于 CUTLASS 实现的 chunkwise kernel),通过重叠 chunk 内并行计算与跨 chunk 状态传播提升效率;长上下文 prefill 利用设备内上下文并行,将序列切分至单卡 SM 并行计算;跨设备通信则采用 KDA Context Parallelism(KCP),通过一次 all-gather 交换固定大小张量并利用前缀扫描恢复状态,保持通信量恒定。
预训练基建与内存优化
预训练基建采用了 PP+VP+EP+ZeRO-1+Pipeline ZeRO-2+CP 的组合策略。MoonEP 实现了完美负载均衡的专家并行,消除了逐层 host 同步,并通过在线规划和零拷贝通信优化 token 传输。
内存管理方面,统一激活管理器支持重计算、FP8 量化及 CPU/远程 PP rank offload 的自由组合。MoE 反向传播通过数学变换消除对前向输出的依赖,AttnRes 的 block 表示配合 checkpointing 技术,使每层激活存储量与标准残差架构持平。
100 万 token Agent RL 基建
采用 co-located 训练与 partial rollout 减少尾延迟。外部 KV cache 池将空闲前缀写回 CPU DRAM,KDA 状态与 MLA KV cache 生命周期对齐。auto-throttling 调度器动态控制并发。沙箱系统 AgentENV 基于 Firecracker microVM,支持毫秒级增量检查点与恢复,暂停时零资源占用。整个训练评测期间共创建超 5100 万个沙箱。
推理服务优化
KDA-aware prefix cache 将 KDA 循环状态与 MLA KV cache 统一管理在分页池中。前缀哈希在 512 token 细粒度 block 上运行,支持从任意边界恢复 prefill 而无需重算。舰队级调度采用 cache-aware affinity 将会话路由至持有前缀缓存的集群,并结合 consistent hashing 分配主备集群。基于预算的准入控制防止长上下文突发流量影响短请求的首 token 时间(TTFT)。
成绩单
评测覆盖推理与知识、编程、Agent、视觉四大类,对比对象包括 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5 和 GLM-5.2。所有模型均启用最大推理力度。
Kimi K3 在编程、Agent、视觉等基准测试中表现卓越,多数任务仅次于 Claude Fable 5 和 GPT-5.6 Sol,全面领先其他模型。
- 编程能力:ProgramBench 得分 77.8% 全场最高;SWE-Marathon(GPU kernel 导向)得分 42.0%,领先 Claude Fable 5 七个百分点;FrontierSWE 得分 81.2% 排名第二。
- Agent 能力:在 BrowseComp、DeepSearchQA F1、MCPMark-Verified、AutomationBench 四项基准中均获全场第一;GDPval-AA v2 Elo 得分 1686 排名第三。
- 视觉能力:OmniDocBench 得分 91.1% 全场最高;Math-Vision 结合 Python 工具后得分 97.8%;ZeroBench 加工具后与 Claude Fable 5 并列第一。
第三方评测同样印证了其领先地位。截至 2026 年 7 月 23 日,Kimi K3 在 WebDev Arena 排名第一,成为首个登顶该榜单的开源模型。
成本效率与实际案例
在成本效率方面,Kimi K3 在多个基准上处于或接近前沿水平。在 Kimi Code Bench 2.0 上,它以 Claude Fable 5 约 38% 的成本取得了仅低 4 分的成绩;在 BrowseComp 上,其每任务成本仅为 GPT-5.6 Sol 的一半,比 Claude 系列便宜一个数量级。
案例研究显示,在 GPU kernel 优化任务中,Kimi K3 在 24 小时内将 AttnRes 延迟降低近 60%,表现与 Claude Fable 5 持平,大幅超越 GPT 系列。此外,Kimi K3 还成功从零开发了类 Triton 编译器 MiniTriton,并在 48 小时内自主完成了推理芯片原型的 RTL 设计与验证。
在网络安全评测中,Kimi K3 识别出数百个候选漏洞,人工确认率约 70%,其中包括 16 个此前未知的漏洞。在英国 AI 安全研究所和 NIST CAISI 的联合评估中,其表现显著优于 GLM-5.2。
尽管在研究级推理和计算机使用类任务上与顶级闭源模型仍有差距,但作为首个开源的 3T 级模型,Kimi K3 成功将前沿智能的门槛降至人人可触及的水平。
参考资料:
https://github.com/MoonshotAI/Kimi-K3
https://huggingface.co/moonshotai/Kimi-K3
END

