大数跨境

Kimi K3 杀疯了!

Kimi K3 杀疯了! AI有道
2026-07-19
9
导读:2.8万亿参数刷新开源模型规模上限

Kimi K3 综合能力跃升至第一梯队。尽管 API 价格上调 3.7 倍,同等输出量下其成本约为 DeepSeek-V4 Pro 高峰期的 8 倍,但仍仅为 Claude Fable 的 30%。作为全球首个开源的 3T 级别大模型,其核心价值值得深入探讨。

前端能力碾压,竞技场七项夺六冠

Kimi K3 在前端代码生成领域表现最为突出,于 Frontend Code Arena 排名第一,大幅领先 Fable 5。

在七个细分赛道中,K3 斩获品牌营销、参考图设计、数据分析、消费产品、模拟及内容创作工具六项冠军,仅在游戏类位居第二。

实测显示,利用 Agent 集群模式复刻 MacOS 界面仅需约 6 小时,生成的不仅是静态界面,而是具备除浏览器和电话外完整功能的网页版操作系统。

在机械手模拟器设计中,K3 生成的画面精美度与功能完整性均超越 Fable 5。此外,它能基于 Three.js 和 Web GPU 构建完全程序化的浏览器 3D 游戏。

技术层面,K3 实现了"vision in the loop"工作流。模型生成代码后可实时查看截图,自动识别布局、色彩及层级问题并迭代修改,区别于传统的一次性输出模式。

凭借 100 万 token 上下文窗口,K3 能一次性处理大量组件文件、类型定义及设计规范,配合长程 Agent 能力有效维护大型前端仓库。虽复杂任务耗时(20 分钟至 1 小时)略高于 Fable 5,但具备显著成本优势。

48 小时自主设计芯片,从零构建 GPU 编译器

编程能力是 K3 的另一核心优势。其在 SWE Marathon 中以 42.0 分位居所有模型之首;Program Bench 得分 77.8,略超 Fable 5;DeepSWE 得分为 67.5。

在 GPU kernel 优化测试中,K3 在 24 小时内独立完成了 AttnRes、KDA 及 512 头维度 MLA kernel 在 NVIDIA H200 上的优化。其中,AttnRes 任务采用新两阶段算法,将耗时从 283.6ms 压缩至 114.4ms,性能持平 Fable 5 且迭代更快。

在从零编写 MLA-512 kernel 任务中,K3 achieves 517.8 TFLOPS,超过 H200 理论 BF16 峰值的一半,领先第二名近 25 TFLOPS。

更为突破性的是,K3 从零构建了名为 MiniTriton 的 GPU 编译器,包含独立的 IR 层、优化 pass 及 PTX 代码生成管线。其在 roofline 基准测试中性能媲美甚至超越 Triton 和 torch.compile,并成功支撑 nanoGPT 训练收敛。

在芯片设计领域,K3 于 48 小时内利用开源 EDA 工具在 Nangate 45nm 工艺库上完成了芯片的全流程设计与验证。该芯片面积 4 平方毫米,集成 146 万标准单元及 0.277MB SRAM,在 100MHz 频率下解码吞吐超 8700 tokens/s,实现了“由模型设计、为模型服务”的闭环。

据悉,K3 开发后期的多数 kernel 优化工作已由早期版本自主完成。

两项核心创新支撑 2.8T 规模

Kimi K3 架构基于两项自研核心技术:

  • Kimi Delta Attention (KDA):为超长序列注意力计算提供高效基础。
  • Attention Residuals (AttnRes):使模型能在深度方向选择性检索表征,避免逐层均匀累积。

稀疏激活方面,K3 采用 Stable LatentMoE 框架,896 个专家中仅激活 16 个。为确保极端稀疏度下的训练稳定,团队引入 Quantile Balancing 替代启发式策略,利用 Per-Head Muon 独立优化注意力头,并结合 SiTU 和 Gated MLA 改善激活控制与选择性。这些技术使 K3 整体 scaling 效率较 K2 提升约 2.5 倍。

训练侧,K3 从 SFT 阶段即采用量化感知训练(MXFP4 权重配合 MXFP8 激活),兼容更广泛硬件。推理侧,针对 KDA 实现的前缀缓存方案已贡献给 vLLM 社区,使编程负载下缓存命中率超 90%。

已知局限与挑战

团队明确列出三项当前局限:

  1. 依赖“保留思考历史”模式,若 Agent 框架回传错误或中途切换模型,生成质量可能不稳定;
  2. 因侧重长周期高难任务训练,面对小问题或模糊意图时可能出现过度决策;
  3. 尽管性能强劲,但在用户体验流畅度上与 Claude Fable 5 及 GPT 5.6 Sol 仍有差距。

过去 12 个月中有 9 个月,Kimi 系列保持开源模型参数规模上限,如今这一纪录已被推至 2.8 万亿。

参考链接:Kimi K3 官方博客

【声明】内容源于网络
0
0
AI有道
1234
内容 3123
粉丝 0
AI有道 1234
总阅读105.3k
粉丝0
内容3.1k