大数跨境

Kimi K3完成全开源

Kimi K3完成全开源 商业智能AI++
2026-07-28
4
导读:月之暗面开源Kimi K3:2.8万亿参数,全球首个3T级开放权重模型,技术报告+三大Infra同步开放。

原创 / 2026-07-28

Kimi K3 完成全开源:开源大模型正式进入 3T 时代

7 月 27 日深夜,月之暗面做了一件大事。

就在大多数人准备睡觉时,Moonshot AI 在 Hugging Face 上扔下了 Kimi K3 的完整权重、技术报告,以及支撑它训练的三项核心 Infra:MoonEP、FlashKDA、AgentEnv。

这不仅是“开源”,而是“全开源”——模型、菜谱、后厨锅具、管理制度,一并交付。

 

Kimi K3 核心速览

 

🚀 2.8 万亿总参数 · 全球首个开源 3T 级模型

 

🧠 MoE:896 个专家,每 token 仅激活 16 个(激活参数约 1040 亿)

 

📄 100 万 token上下文窗口 · 原生多模态(文本/图像/视频)

 

💾 96 个分片,磁盘体积1.56 TB

 

🔥 Hugging Face 30 分钟内超 4000 赞,登顶趋势榜

一、“全开源”到底开了什么?

过去很多厂商开源的是“蒸馏版”或“推理 API”。这次月之暗面给出的清单要长得多:

1. 完整模型权重:96 个 safetensors 分片,可直接下载、本地部署、二次开发,框架已支持 Transformers、vLLM、SGLang。

2. 技术报告:披露 KDA + Gated MLA 混合注意力、Stable LatentMoE、MoonViT-V2 视觉编码器、后训练与评测方法。

3. 三大训练 Infra

  •  
  • MoonEP:面向超大规模 MoE 的专家并行通信库,解决专家负载均衡难题。
  •  
  • FlashKDA:Kimi Delta Attention 高性能算子,在英伟达 H20 上 prefill 速度较基线提升 1.72–2.22 倍。
  •  
  • AgentEnv:与 KVCache.ai 合作的 Agent 沙箱系统,支持快照、恢复、分叉,用于大规模 RL 训练环境。

三者均为 MIT 许可证。也就是说,即便你不跑 2.8T 的 K3,这三件 Infra 也能直接薅来用。

二、为什么 K3 敢做 3T?

参数不是越大越好,关键看“把算力变成智能的效率”。相比上一代 K2,K3 的整体扩展效率提升了约 2.5 倍。这来自三个架构创新:

   

Kimi K3 在英伟达 H20 上的计算性能 roofline(来源:月之暗面 Kimi K3 技术报告)

Kimi Delta Attention(KDA):一种混合线性注意力机制。普通注意力像全程速记,上下文越长 KV Cache 越爆炸;KDA 更像“边开会边写纪要”,用固定大小的循环记忆承接长序列,让 100 万 token 长上下文从“理论可用”变成“经济可用”。

Attention Residuals:让深层网络可以“回头看”,从前面层选择性地召回有用表示,而不是简单堆叠,提升训练稳定性与信息流动。

Stable LatentMoE + Quantile Balancing:896 个路由专家中只激活 16 个,配合分位数平衡负载,避免“专家饿死”,让超大稀疏模型真正跑得起来。

三、榜单说话:开源反超闭源的历史性一刻

第三方独立评测给了 K3 一个很高的评价。

                                                                                                                                         
榜单 / 基准 Kimi K3 成绩 意义
LMArena Frontend Code Arena 1679 分,第 1 名 超越 Claude Fable 5、GPT-5.6 Sol,7 项前端任务 6 项第一
Artificial Analysis Intelligence Index 57 分,第 3 名 仅次于 Claude Fable 5、GPT-5.6 Sol,领先 Opus 4.8
SWE Marathon 42.0 分,第 1 名 超长程软件工程任务夺冠
Terminal-Bench 2.1 88.3% Agentic 编码与终端操作顶尖水平

月之暗面自己也承认:K3 整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在整套评测中展现出前沿水平,并稳定超过其他所有模型。这种坦诚反而让榜单更有说服力。

四、生态炸了:30 分钟登顶,Day0 适配席卷全球

开源消息放出后 30 分钟,Hugging Face 上点赞数突破 4000,直接登顶趋势榜。Hugging Face CEO Clem Delangue 发文称这是该平台史上最快的模型发布增长速度。

国内:华为昇腾 950 全系列、Atlas A3 已宣布支持 K3;阿里云真武 M890 超节点 Day0 适配;千问 AI 平台、阿里云百炼将提供 API。

海外:Nebius、Baseten、Fireworks 等基础设施厂商同步接入;Cursor 已引入 K3;Cognition 把 K3 接进 Devin 桌面客户端与 CLI。

五、开源 ≠ 免费午餐:许可证要看清

Kimi K3 的模型权重采用自定义的 Kimi K3 License,不是 MIT/Apache。它允许使用、修改、再分发、微调和销售,但设了一条商业红线:

 若你的“模型即服务”(MaaS)业务过去 12 个月累计营收超过约 2000 万美元,需要与月之暗面另行签署商业授权协议;大型商用产品必须显著署名 Kimi K3。

而 MoonEP、FlashKDA、AgentEnv 三个 Infra 项目均为 MIT,可直接商用。对个人开发者和中小企业来说,门槛非常低。

六、行业影响:开源进入 3T 时代

Kimi K3 的发布时点颇为微妙。就在 7 月 24 日,英伟达 CEO 黄仁勋发出人生第一条 X 推文,分享了一封由 a16z 发起、25 家科技公司联署的公开信,主张“前沿开源模型与前沿闭源模型应并存发展”,反对不成熟限制。签名公司包括微软、Meta、Palantir,但 OpenAI、Anthropic、Google 均未出现。

这场“开放权重 vs 封闭 API”的路线之争,因为 K3 的到来多了一张中国牌桌。

摩根士丹利评价称,Kimi K3 证明中国大模型在模型规模、性能、定价三个层面对美国头部模型实现了“全方位追赶”;高盛则认为,中国 AI 开源模型已达到全球大规模普及的关键节点。

 

   当开源模型逼近闭源 SOTA,
全行业的“最低能力水位”被显著抬高。

   这对应用层和 Agent 创业者,是近十年来最好的消息。  

结语

DeepSeek 到 Kimi K3,中国开源大模型正在定义新的游戏规则:不再只是“性价比”,而是“最前沿的能力也可以开放”。

2.8 万亿参数不是终点,而是开源大模型 3T 时代的起点。接下来要看的是:谁能先把这 1.56 TB 的权重,变成跑在本地、嵌入产品、改变工作流的真正价值。

参考来源:月之暗面官网 / Kimi K3 技术博客、Hugging Face 模型卡、科创板日报、澎湃新闻、Artificial Analysis、LMArena、The Tech Briefs、Emergent.sh 等。

【声明】内容源于网络
0
0
商业智能AI++
下一代商业智能大机会点:AI商业智能,你的时代商业顾问
内容 22
粉丝 0
商业智能AI++ 下一代商业智能大机会点:AI商业智能,你的时代商业顾问
总阅读119
粉丝0
内容22