Kimi K3冲到2.8T参数,API价格也涨了3倍
7月16日,Moonshot AI 发布 Kimi K3——2.8T 参数、首个开源 3T 级模型、100 万 token 上下文窗口、原生视觉能力。官方博客标题是"Open Frontier Intelligence",但真正值得关注的变量是:这是中国厂商发布过的最贵模型——$3/百万输入 token,$15/百万输出 token,比 Kimi K2.6 的 $0.95/$4 涨了 3 倍还多。
开源模型正在进入一个新阶段:不再靠"便宜"打市场,而是靠"能打"要价。K3 的每任务成本 $0.94,已经和 GPT-5.6 Sol 的 $1.04 处于同一区间。开源前沿的竞赛正在从"谁参数更大"转向"谁能把规模和效率的trade-off做得更好"。
2.8T 参数与2.5倍缩放效率:开源第一次摸到规模天花板
2.8T 的参数规模,意味着开源模型第一次摸到了 3T 的边界,也刷新了此前的参数规模纪录。Moonshot 称,过去12个月中有9个月,Kimi 模型保持了开源模型的规模上限。这至少说明,开源阵营已经开始主动探索超大规模模型,而不只是跟随闭源模型。
真正关键的不是参数数量,而是缩放效率。Kimi K3 引入了两个架构创新:Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes),配合 Stable LatentMoE 框架,只激活 896 个专家中的 16 个。Moonshot 称,这些变化让 K3 相比 Kimi K2 的整体缩放效率提高约 2.5 倍;这是官方口径,仍要等待技术报告和外部复现。
这种效率提升为高价提供了叙事基础。Artificial Analysis 的私有评测显示,K3 在长周期知识工作上的 Elo 达到 1547,比 K2.6 提升了 732 分,仅次于 Claude Fable 5。在 Arena.ai 的前端代码评测中,K3 甚至超过了 Fable 5。不过,这些结果来自不同测试环境,不能直接等同于所有真实任务的体验。
但缩放效率提高,不等于部署门槛降低。Moonshot 建议把 K3 部署在包含64个或更多加速器的超节点上。即使权重开放,这也更接近云厂商和大型机构的基础设施,而不是普通开发者下载后就能本地运行的模型。
中国最贵定价:开源模型开始收"能力溢价"
这次发布最具争议的其实是定价。$3/$15 的 token 定价,已经和 Claude Sonnet 系列处在同一档位。放在中国厂商的语境下,这次上调更显眼:相比 Kimi K2.6 的 $0.95/$4,输入和输出单价都涨了3倍以上。
Moonshot 的定价逻辑可以概括为:按能力定价,而不是给国产模型预设低价。Artificial Analysis 的任务成本统计中,K3 为 $0.94,GPT-5.6 Sol 为 $1.04,已经落在相近区间。这不代表两者能力相同,但说明开源模型的竞争正在从单纯比单价,转向同时比较任务完成率和总成本。
但这个定价也有明显的风险。首先是推理 token 开销:Simon Willison 的"pelican riding a bicycle"测试用了 16,658 个输出 token,其中 13,241 个是推理 token,一次简单的 SVG 生成都花了 25 美分。如果用户习惯了"随便问一个问题几分钱",那 K3 的推理成本可能会让很多人望而却步。
其次是开源权重还没发布。K3 的开源承诺是 7 月 27 日之前发布完整权重。如果权重发布后社区能把推理成本降下来,那 API 的高定价就成了"早期采用者税";如果权重发布延迟或者推理优化不如预期,那 K3 可能会陷入"API太贵没人用,开源权重跑不动"的两难境地。
从编译器到芯片设计:agentic能力正在变成生产工具
这次发布展示的两个案例最能说明开源模型能力边界的扩展。第一个是 MiniTriton 编译器,K3 从零开发了一个类似 Triton 的紧凑编译器,有自己的 tile-level IR 层、优化 pass 和 PTX 代码生成 pipeline。在支持的 roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 相当甚至更好——这意味着 K3 不仅能写代码,还能写编译器这种底层基础设施。
第二个是芯片设计。在一次 48 小时的自主运行中,K3 使用开源 EDA 工具在 Nangate 45nm 工艺库上设计、优化并验证了一个用于自身架构的 nano 模型芯片。这个芯片在 4mm² 内实现了 100MHz 时序收敛,模拟中维持超过 8,700 token/s 的解码吞吐量,包含 146 万个标准单元、0.277MB SRAM 和带融合反量化的 INT4 MAC 阵列。
这两个案例的意义不在于"AI 能取代编译器工程师或芯片设计师",而在于:长周期、多步骤、需要跨领域知识的工程任务,正在变成 AI 可以自主完成的工作流。如果一个模型能在 48 小时内走完人类需要几个月的芯片设计验证流程,那整个工程研发的成本结构都会被改写。
但必须强调边界:官方把芯片案例称为“早期概念验证”,MiniTriton 的性能比较也只覆盖其支持的 roofline 基准。它们证明了模型可以完成更长、更复杂的工程链路,却还不足以外推到生产级编译器或芯片设计。
开源前沿的下一个变量:权重发布与社区反应
真正的考验在 7 月 27 日——完整权重发布的那一天。如果社区能快速适配和优化,那 K3 可能会成为开源模型的新基准;如果权重发布后推理性能不如预期,那高定价的 API 就成了孤家寡人。
下一步值得观察的三个指标。第一,权重发布后的推理速度和显存占用。2.8T 参数的模型在消费级显卡上能不能跑?需要多少显存?量化后的精度损失有多大?这决定了 K3 是"只有云厂商能用的开源"还是"真正社区可用的开源"。
第二,第三方中立评测能否复现。现在能看到的材料仍以官方披露、Artificial Analysis 和少量公开测试为主,完整技术报告尚未发布。K3 在不同推理框架、长上下文和真实工程任务中的表现,才会检验“2.5倍缩放效率”能否转化为稳定收益。
第三,社区生态的反应。HuggingFace、vLLM、llama.cpp 等项目能不能快速支持 K3?有没有第三方基于 K3 做微调变体?这决定了 K3 是一个孤立的里程碑,还是一个能带动整个生态前进的基础模型。
开源模型的竞赛已经进入了深水区。参数规模不再是唯一的胜负手——缩放效率、架构创新、定价策略和社区生态的综合能力,才是真正的护城河。Kimi K3 把中国厂商的定价拉到了历史最高,但也把开源模型的能力边界推到了新高度——接下来的问题是:市场愿意为这个新高度买单吗?
来源:Moonshot AI 官方博客、Artificial Analysis、Simon Willison、Arena.ai
数据截至:2026年7月17日

