原创 / 2026-07-28
Kimi K3 完成全开源:开源大模型正式进入 3T 时代
7 月 27 日深夜,月之暗面做了一件大事。
就在大多数人准备睡觉时,Moonshot AI 在 Hugging Face 上扔下了 Kimi K3 的完整权重、技术报告,以及支撑它训练的三项核心 Infra:MoonEP、FlashKDA、AgentEnv。
这不仅是“开源”,而是“全开源”——模型、菜谱、后厨锅具、管理制度,一并交付。
Kimi K3 核心速览
🚀 2.8 万亿总参数 · 全球首个开源 3T 级模型
🧠 MoE:896 个专家,每 token 仅激活 16 个(激活参数约 1040 亿)
📄 100 万 token上下文窗口 · 原生多模态(文本/图像/视频)
💾 96 个分片,磁盘体积约 1.56 TB
🔥 Hugging Face 30 分钟内超 4000 赞,登顶趋势榜
一、“全开源”到底开了什么?
过去很多厂商开源的是“蒸馏版”或“推理 API”。这次月之暗面给出的清单要长得多:
1. 完整模型权重:96 个 safetensors 分片,可直接下载、本地部署、二次开发,框架已支持 Transformers、vLLM、SGLang。
2. 技术报告:披露 KDA + Gated MLA 混合注意力、Stable LatentMoE、MoonViT-V2 视觉编码器、后训练与评测方法。
3. 三大训练 Infra:
- MoonEP:面向超大规模 MoE 的专家并行通信库,解决专家负载均衡难题。
- FlashKDA:Kimi Delta Attention 高性能算子,在英伟达 H20 上 prefill 速度较基线提升 1.72–2.22 倍。
- AgentEnv:与 KVCache.ai 合作的 Agent 沙箱系统,支持快照、恢复、分叉,用于大规模 RL 训练环境。
三者均为 MIT 许可证。也就是说,即便你不跑 2.8T 的 K3,这三件 Infra 也能直接薅来用。
二、为什么 K3 敢做 3T?
参数不是越大越好,关键看“把算力变成智能的效率”。相比上一代 K2,K3 的整体扩展效率提升了约 2.5 倍。这来自三个架构创新:
Kimi K3 在英伟达 H20 上的计算性能 roofline(来源:月之暗面 Kimi K3 技术报告)
Kimi Delta Attention(KDA):一种混合线性注意力机制。普通注意力像全程速记,上下文越长 KV Cache 越爆炸;KDA 更像“边开会边写纪要”,用固定大小的循环记忆承接长序列,让 100 万 token 长上下文从“理论可用”变成“经济可用”。
Attention Residuals:让深层网络可以“回头看”,从前面层选择性地召回有用表示,而不是简单堆叠,提升训练稳定性与信息流动。
Stable LatentMoE + Quantile Balancing:896 个路由专家中只激活 16 个,配合分位数平衡负载,避免“专家饿死”,让超大稀疏模型真正跑得起来。
三、榜单说话:开源反超闭源的历史性一刻
第三方独立评测给了 K3 一个很高的评价。
| 榜单 / 基准 | Kimi K3 成绩 | 意义 |
|---|---|---|
| LMArena Frontend Code Arena | 1679 分,第 1 名 | 超越 Claude Fable 5、GPT-5.6 Sol,7 项前端任务 6 项第一 |
| Artificial Analysis Intelligence Index | 57 分,第 3 名 | 仅次于 Claude Fable 5、GPT-5.6 Sol,领先 Opus 4.8 |
| SWE Marathon | 42.0 分,第 1 名 | 超长程软件工程任务夺冠 |
| Terminal-Bench 2.1 | 88.3% | Agentic 编码与终端操作顶尖水平 |
月之暗面自己也承认:K3 整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在整套评测中展现出前沿水平,并稳定超过其他所有模型。这种坦诚反而让榜单更有说服力。
四、生态炸了:30 分钟登顶,Day0 适配席卷全球
开源消息放出后 30 分钟,Hugging Face 上点赞数突破 4000,直接登顶趋势榜。Hugging Face CEO Clem Delangue 发文称这是该平台史上最快的模型发布增长速度。
国内:华为昇腾 950 全系列、Atlas A3 已宣布支持 K3;阿里云真武 M890 超节点 Day0 适配;千问 AI 平台、阿里云百炼将提供 API。
海外:Nebius、Baseten、Fireworks 等基础设施厂商同步接入;Cursor 已引入 K3;Cognition 把 K3 接进 Devin 桌面客户端与 CLI。
五、开源 ≠ 免费午餐:许可证要看清
Kimi K3 的模型权重采用自定义的 Kimi K3 License,不是 MIT/Apache。它允许使用、修改、再分发、微调和销售,但设了一条商业红线:
若你的“模型即服务”(MaaS)业务过去 12 个月累计营收超过约 2000 万美元,需要与月之暗面另行签署商业授权协议;大型商用产品必须显著署名 Kimi K3。
而 MoonEP、FlashKDA、AgentEnv 三个 Infra 项目均为 MIT,可直接商用。对个人开发者和中小企业来说,门槛非常低。
六、行业影响:开源进入 3T 时代
Kimi K3 的发布时点颇为微妙。就在 7 月 24 日,英伟达 CEO 黄仁勋发出人生第一条 X 推文,分享了一封由 a16z 发起、25 家科技公司联署的公开信,主张“前沿开源模型与前沿闭源模型应并存发展”,反对不成熟限制。签名公司包括微软、Meta、Palantir,但 OpenAI、Anthropic、Google 均未出现。
这场“开放权重 vs 封闭 API”的路线之争,因为 K3 的到来多了一张中国牌桌。
摩根士丹利评价称,Kimi K3 证明中国大模型在模型规模、性能、定价三个层面对美国头部模型实现了“全方位追赶”;高盛则认为,中国 AI 开源模型已达到全球大规模普及的关键节点。
当开源模型逼近闭源 SOTA,
全行业的“最低能力水位”被显著抬高。
这对应用层和 Agent 创业者,是近十年来最好的消息。
结语
从 DeepSeek 到 Kimi K3,中国开源大模型正在定义新的游戏规则:不再只是“性价比”,而是“最前沿的能力也可以开放”。
2.8 万亿参数不是终点,而是开源大模型 3T 时代的起点。接下来要看的是:谁能先把这 1.56 TB 的权重,变成跑在本地、嵌入产品、改变工作流的真正价值。
参考来源:月之暗面官网 / Kimi K3 技术博客、Hugging Face 模型卡、科创板日报、澎湃新闻、Artificial Analysis、LMArena、The Tech Briefs、Emergent.sh 等。

