大数跨境

月之暗面发布全球首款开源 3T 级大模型 Kimi K3,开启参数量3万亿里程碑

月之暗面发布全球首款开源 3T 级大模型 Kimi K3,开启参数量3万亿里程碑 苏哲管理咨询
2026-07-17
23
导读:月之暗面发布全球首款开源 3T 级大模型 Kimi K3,参数量达 2.8 万亿,搭载自研 KDA 注意力、AttnRes 残差模块与稳定隐式 MoE 架构,算力缩放效率较 Kimi K2 提升 2.
编者摘要月之暗面发布全球首款开源 3T 级大模型 Kimi K3,参数量达 2.8 万亿,搭载自研 KDA 注意力、AttnRes 残差模块与稳定隐式 MoE 架构,算力缩放效率较 Kimi K2 提升 2.5 倍,支持百万 token 上下文与原生视觉多模态。模型综合性能仅次于 GPT 5.6 Sol、Claude Fable 5,代码、智能代理、多模态、专业知识工作多项细分评测领跑竞品。核心能力覆盖长周期工程开发、GPU 内核 / 编译器 / AI 芯片自主设计、3D 游戏全流程创作、科研数据可视化、金融行业报告、视频动画剪辑;新增 Kimi Work 交互式组件与数据看板。产品已全平台上线,API 分层定价,企业版提供数据隔离服务;完整模型权重 2026 年 7 月 27 日开源并同步发布技术报告。模型存在三点局限:依赖完整推理历史、自主行为偏激进、综合体验不及顶级闭源模型,是开源大模型迈入 3 万亿参数时代的里程碑。

10 个主要问题Q&A

  1. Q1:Kimi K3 是什么,行业定位如何?
  2. A:月之暗面推出的 2.8 万亿参数开源混合专家大模型,全球首款开源 3T 级模型,标志开源大模型进入 3 万亿参数阶段。
  3. Q2:Kimi K3 核心架构创新有哪些?
  4. A:自研 KDA 注意力、AttnRes 注意力残差;稳定隐式 MoE(896 专家仅激活 16 个),算力效率较 K2 提升 2.5 倍。
  5. Q3:Kimi K3 上下文与多模态能力如何?
  6. A:原生支持 100 万 token 超长上下文,内置原生视觉能力,可统一处理图文、视频、截图完成闭环创作。
  7. Q4:Kimi K3 代码能力有哪些落地案例?
  8. A:优化 GPU 内核、从零搭建 GPU 编译器 MiniTriton、48 小时自主完成 45nm AI 芯片设计、长周期大型代码仓库修复。
  9. Q5:Kimi K3 智能代理能力优势在哪?
  10. A:BrowseComp 网页交互得分 91.2 领跑竞品,擅长自动化办公、表格处理、网页检索,同等任务成本更低。
  11. Q6:Kimi K3 可实现哪些科研与商业工作?
  12. A:自动生成数十年行业交互式报告、天体物理引力波数据分析、金融量化研判,配套可视化看板工具
  13. Q7:Kimi K3 数字创作能力覆盖什么场景?
  14. A:全流程 3D 开放世界游戏开发、复古掌机 / 科幻游戏制作、科普动画、品牌宣传短片剪辑。
  15. Q8:Kimi K3 哪些渠道可使用,API 定价?
  16. A:网页、全平台 App、Kimi Work、Kimi Code、官方 API;API 分缓存命中 / 未命中输入、输出三档定价,代码缓存命中率超 90%。
  17. Q9:Kimi K3 开源时间与配套资料?
  18. A:2026 年 7 月 27 日发布完整模型权重,同步上线完整技术报告,配套 vLLM 专属优化方案。
  19. Q10:Kimi K3 存在哪些短板,如何规避?
  20. A:依赖完整推理历史,不建议中途切换模型;自主决策激进,可通过系统提示词约束;综合体验弱于 GPT5.6 Sol、Claude Fable5。

附录:Kimi K3:前沿通用智能开源大模型

一、新品发布核心概述

今日我们正式推出 Kimi K3—— 月之暗面迄今为止综合能力最强的大模型。Kimi K3 是一款拥有 2.8 万亿参数的混合专家模型,原生搭载Kimi Delta 注意力机制(KDA)与注意力残差模块(AttnRes),内置原生多模态视觉能力,同时支持百万级超长上下文窗口。作为全球首款开源 3 万亿参数级大模型,它专为长周期代码开发、专业知识工作、复杂逻辑推理等前沿智能场景打造。

从综合性能来看,Kimi K3 整体表现虽略逊于闭源标杆模型 Claude Fable 5 与 GPT 5.6 Sol,但在全套自研评测基准中达到行业前沿水准,绝大多数测试维度均优于同期其他主流大模型。

代码能力评测榜单

通用智能与视觉智能评测榜单

二、全平台上线与开源计划

Kimi K3 现已全渠道上线,覆盖 Kimi 官网、Kimi Work 专业工作台、Kimi 代码开发工具与 Kimi 开发者 API。首发阶段模型默认启用最高强度推理模式,轻量化、中等强度推理模式将在后续版本迭代中陆续开放。

目前团队正联合推理服务商、开源社区维护者协同打磨技术细节,保障模型在全生态稳定落地。完整模型权重将于2026 年 7 月 27 日对外开源,配套架构、训练流程、完整评测细节的技术白皮书也将同步发布。

行业里程碑:首款开源 3T 参数级大模型

Kimi K3 是业界首个突破 2.8 万亿参数的开源大模型,也是月之暗面持续冲击大模型规模上限的关键成果:过去 12 个月里,旗下模型有 9 个月持续刷新开源模型参数量纪录。

2025 年 7 月至 2026 年 7 月主流开源旗舰模型参数量发展脉络显示,月之暗面 Kimi 系列持续领跑开源规模赛道,同期竞品如 GLM、通义千问、DeepSeek、MiniMax 等厂商旗舰模型参数规模均存在明显差距。

三、核心创新架构:KDA+AttnRes + 稳定隐式混合专家

Kimi K3 基于两大自研核心架构模块构建:Kimi Delta 注意力(KDA)与注意力残差(AttnRes),二者优化长文本序列、多层模型深度下的信息流转效率;同时升级稀疏混合专家(MoE)框架,搭载稳定隐式 MoE 架构,896 个专家中每次推理仅激活 16 个,大幅提升计算利用率。

搭配优化后的训练数据方案与训练流程,整套架构相比前代 Kimi K2,整体算力缩放效率提升约 2.5 倍,能够更高效地将算力转化为模型智能。

  1. Kimi Delta 注意力(KDA)
    为万亿参数规模设计的高效注意力底层,解决超长上下文下传统注意力算力损耗问题;
  2. 注意力残差(AttnRes)
    分层选择性提取模型深层特征,替代统一累积特征的传统模式,减少信息丢失;
  3. 稳定隐式 MoE
    创新分位数均衡专家分配算法,无需人工调参即可平衡各专家负载;配套多头 Muon 优化器、SiTU 激活函数、门控多头线性注意力,保障超大专家规模下训练稳定;
  4. 量化感知训练
    从监督微调阶段即启用量化训练,权重采用 MXFP4 格式、激活值使用 MXFP8 格式,兼容全品类主流硬件;创新均衡专家并行训练方案,消除训练关键路径主机同步开销;针对 KDA 定制 vLLM 前缀缓存方案,大幅降低超长上下文推理成本。

四、核心能力一:顶尖长周期代码开发能力

Kimi K3 在超长工程场景下代码表现突出,可在极少人工干预下完成长期开发任务、解析超大型代码仓库、调度终端工具完成全流程开发;同时擅长融合视觉推理的开发任务,依托截图、图像素材优化游戏开发、前端页面、CAD 工程设计等工作。

1. GPU 内核优化实战测试

团队搭建统一沙箱环境,让各模型独立完成 4 类内核优化任务(AttnRes、KDA、512 头维度 MLA 内核,适配 NVIDIA H200 及通用 GPGPU),单任务最长运行 24 小时,Kimi K3 性能比肩 Claude Fable 5,大幅领先 Opus 4.8、GPT 系列模型。以 AttnRes 内核优化为例:基于生产标准的 FLA Triton 实现方案,Kimi K3 连续迭代 15 小时,设计双阶段全新内核算法,在不改变数值精度的前提下完成算子融合,将前向 + 反向计算耗时从 283.6 毫秒压缩至 114.4 毫秒;迭代优化速度甚至优于 Claude Fable 5。Kimi K3 早期版本已深度参与团队内部绝大多数内核优化工作。

2. 从零开发 GPU 编译器

测试验证 Kimi K3 可独立搭建完整 GPU 编程系统 MiniTriton:自研类 Triton 编译器,内置瓦片层级 IR 中间层、全套优化算子、PTX 代码生成流水线。在标准屋顶线基准测试中,MiniTriton 性能持平甚至优于原生 Triton 与 torch.compile,部分任务实现性能反超;可完整支撑 nanoGPT 端到端训练,损失曲线与官方参考实现高度吻合,证明模型具备独立搭建完整编译工具链的能力,而非仅编写零散算子。

3. 游戏与数字内容创作(视觉闭环开发)

依托原生多模态、3D 空间推理与代码能力,Kimi K3 可将文字概念、图片、视频素材转化为可直接运行的交互式完整游戏,实现视觉实时闭环迭代:同步编写代码、渲染画面、读取截图并即时迭代优化。


image

西部开放世界游戏


GBA掌机小游戏


image

黑洞天体模拟程序

落地案例:程序化 3D 开放世界游戏

Kimi K3 基于 Three.js WebGPU 与 GPU 并行计算,从零搭建浏览器端完整 3D 探索游戏:程序化生成地形地貌,搭配 3D 资产工具生成骑马角色模型,打造包含森林、木屋村落、雪山、动态天气的超大开放世界,仅引入外部骑马人物、地形基础数据作为辅助素材。

除此之外,模型还可独立完成复古掌机游戏、城市跑酷、古风仙侠、像素射击、天体物理模拟、古罗马竞技场体素沙盘、太空机甲对战等多品类数字内容开发。

4. 芯片硬件设计

作为技术验证案例,Kimi K3 在 48 小时自主运行周期内,基于开源 EDA 工具、Nangate 45nm 工艺库完成一款适配自研小参数量模型的芯片设计、性能优化与功能验证。芯片面积仅 4 平方毫米,时序稳定跑满 100MHz,仿真解码吞吐量可达 8700+ token/s;内部集成 146 万个标准单元、0.277MB 静态存储阵列,搭载融合反量化的 INT4 乘加阵列,实现 “AI 自主设计、服务 AI 运行”,充分验证超长周期自主智能能力。

5. 科研代码自动化

打通学术文献与可执行代码的壁垒,自主完成复杂计算科研流程的复现、验证与数据分析。天体物理案例:复现 I-Love-Q 通用引力关系,常规资深研究员需 1-2 周完成,Kimi K3 仅耗时 2 小时:通读交叉验证 20 余篇学术论文,搭建完整数值计算管线,测算 300 + 物态方程,修正多篇公开论文公式错误,输出 3000 余行 Python 代码,生成交互式可视化网页用于成果分析。

五、核心能力二:端到端专业知识工作

除公开通用评测基准外,自研内部知识工作测试集显示,开启最高推理强度的 Kimi K3 在真实业务智能工作流中持续稳定领先竞品,覆盖咨询、金融、科研、办公自动化全场景。


内部专业知识工作评测榜单

1. 行业深度研究交互式报告

  • ASIC 芯片产业 42 年发展报告
    经过 120 轮自主迭代优化生成交互式深度报告,自动完成 2800 余次网页检索、1100 次终端数据拉取,解析 11000 + 份文档(87 份季度财报、99 篇原始学术 PDF),自动生成定制图表、动态示意图与交互式叙事页面。
  • 核聚变行业咨询报告
    产出咨询级完整分析文档,内置时间轴、漏斗图、区间条形图、甘特图等可视化组件,配套可直接用于汇报的高质量幻灯片。
  • 引力波 GWTC-5 数据集分析
    调度 20 个并行智能子代理,完成 391 起引力波事件解析,产出 7 张专业科研可视化图表、2 组数据表格,整合十余篇文献综述成果。

2. Kimi Work 全新可视化工具:组件面板与数据看板

依托 Kimi K3 推出两大专属功能:交互式组件、个性化数据看板。

  • 交互式组件:在对话窗口内直接生成可交互可视化模块,支持对接本地文件、外部插件,实现数据实时更新;
  • 数据看板:将高频使用的可视化组件整合至统一持久化页面,围绕项目、行业、研究目标搭建专属工作台。

3. 视频剪辑与动态视觉设计

原生多模态架构统一处理文本、图像、视频素材,擅长动态图形、动画、专业剪辑工作:

  • 自动制作 3Blue1Brown 风格科普动画,将 Kimi K3 复杂架构转化为流畅动态演示图表;
  • 基于 56 段原始素材独立剪辑官方宣传短片:自动筛选镜头、匹配画面转场、精准卡点同步音频、多轮迭代修改;同类成片专业剪辑师需 1-2 个工作日,新手则需 3-5 天。

六、性能横向评测总览

1. 代码赛道亮点

  • 终端工具基准 Terminal Bench 2.1 得分 88.3,仅小幅落后 GPT 5.6 Sol,大幅领先 Claude 全系;
  • SWE Marathon 长周期工程修复榜单登顶,以 42.0 分领先所有闭源竞品;
  • 自动化开发基准 Automation Bench 30.8 分,位列全模型第一;

2. 智能代理 / 网页交互赛道

BrowseComp 网页综合交互得分 91.2,大幅超越 GPT 5.6 Sol(90.4)、Claude Fable 5(88.0),同等任务成本远低于所有闭源模型,性价比优势显著。 image

BrowseComp分数-任务成本对比图

3. 视觉多模态赛道

搭配 Python 工具的图像推理基准 CharXiv w/tool 得分 91.3,数学视觉推理 MathVision w/python 达 97.8 分,文档解析 OmniDocBench 91.1 分,视觉综合能力稳居第一梯队。

4. 专业办公与知识工作

自研内部基准 DECK-Bench(专业综合办公)73.5 分、Online Exp Bench 线上专业业务 75.5 分、Finance-Bench 金融分析 62.6 分,三项内部评测全部超越 GPT 5.5、Claude Opus 4.8。

七、商业化部署与定价方案

全渠道使用入口

  1. 移动端智能代理
    iOS、安卓、鸿蒙应用商店更新最新版 Kimi App 即可使用;网页端访问kimi.com;
  2. 专业工作台 Kimi Work
    Windows、苹果硅 Mac 客户端 3.1.0 及以上版本内置 K3;
  3. 代码开发工具 Kimi Code
    终端启动工具后输入/model切换至 Kimi K3;
  4. 开发者 API
    平台选择模型kimi-k3接入,依托 Mooncake 分布式推理架构,代码场景缓存命中率超 90%;
    • 缓存命中输入:0.3 美元 / 百万 token
    • 缓存未命中输入:3.0 美元 / 百万 token
    • 模型输出:15.0 美元 / 百万 token
  5. 企业版 Kimi Enterprise
    提供企业级数据隐私隔离、团队成员管理,个人与企业账号数据完全分离。

八、模型现存局限

  1. 推理历史上下文依赖
    模型训练时完整保留思考过程,若调用框架无法回传全部历史推理内容、或对话中途切换模型,生成质量会大幅波动;建议搭配官方适配工具 Kimi Code,避免会话中途切换模型。
  2. 自主决策过度激进
    训练侧重超长周期高难度任务,面对模糊需求、微小异常时会主动自主调整方案,可能超出用户预期边界;若业务场景需要严格限制自主发挥,可在系统提示词、工程配置文件 AGENTS.md 中增加强约束指令。
  3. 综合用户体验差距
    尽管各项基准评测表现强劲,但整体使用流畅度、细节体验仍与行业顶尖闭源模型 Claude Fable 5、GPT 5.6 Sol 存在可感知差距。

九、总结

Kimi K3 作为全球首款开源 2.8T 参数级大模型,依托 KDA、AttnRes、稳定隐式 MoE 三大自研架构突破万亿参数训练与推理瓶颈,在超长代码开发、自主智能代理、多模态视觉创作、专业行业知识工作四大核心场景实现前沿性能,同时兼顾开源开放、低成本推理、全平台落地三大优势。模型覆盖个人创作、程序员开发、科研分析、企业咨询、硬件设计、游戏开发等全行业需求,完整权重将于 2026 年 7 月 27 日开源,配套完整技术白皮书同步发布,进一步推动前沿超大参数模型生态开放。

参考源:https://www.kimi.com/blog/kimi-k3技术博客

【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2029
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读27.3k
粉丝0
内容2.0k