第一,部署门槛跃迁,超节点成为”入场券”: K3 采用 MXFP4 权重 + MXFP8 激活的量化感知训练,权重体积约 1.4–1.5TB,官方明确建议在 64 张或更多加速器组成的 Supernode 上部署 。这把”能跑 K3”的单位从过去的 8–16 卡单机,直接抬升到整柜级 64+ 卡高带宽互联域——恰好落在 GB200/GB300 NVL72、华为 Atlas 950 SuperPoD 这类整柜超节点的甜区上。开源权重免费,但运行权的门槛从未这么高,推理需求将加速向具备超节点资产的运营商集中。
第二,长上下文推理经济学被改写:K3 的 KDA 混合线性注意力使百万上下文下的解码速度最高提升 6.3 倍、KV 缓存仅为同规模全注意力模型的约 25% ,配合 Mooncake 分离式推理在编程负载下超过 90% 的缓存命中率,“百万 token 上下文”第一次具备了规模化商用的成本曲线。这意味着运营商的 KV Cache 资源规划、缓存层级设计(HBM→LPDDR→SSD)和计费模型都要重做。
第三,Token 工厂的毛利剪刀差正在打开,但只属于”高效产能”:高盛判断 token 定价年降幅已趋稳、而每 token 算力成本仍以每年 60%–70% 下降,超大规模厂商的毛利拐点或在未来 3–12 个月内到来。本报告测算:在 64 卡 GB300 域上以基准吞吐运行 K3,输出侧全成本约 3.1 美元/百万 token,对照官方 API 15 美元的输出价,毛利空间可达约八成;但若只能按第三方托管典型价 6 美元出货,毛利立刻压缩到约五成——效率即生死。
第四,开源阵营定价分层,Token 工厂从”一个市场”裂变为”三个市场”。 K3 输出定价 100 元/百万 token,进入顶尖模型区间,约为自家 K2.7 Code 的 4 倍;而 DeepSeek 在 5 月将全系 API 永久降价约 75%,V4-Flash 输出低至 1 元/百万 token 。旗舰层吃性能溢价、主力层走量、长尾层地板价——运营商必须为不同层级的模型配置不同的硬件与毛利策略,而不是一套集群打天下。
第五,资源瓶颈从”算力”转向“高端算力绝对优势”:SemiAnalysis 在 1.6T 的 DeepSeek-V4-Pro上实测证明:HBM容量是离散的“解锁条件”,GB300 NVL72(288GB/卡)相对 GB200 的吞吐优势最高达 2.83 倍。K3 把这一逻辑放大到 2.8T 量级;B200 续约价拟上调 94%,高端算力”有价无市”与低质量智算中心 30% 利用率并存—结构性紧缺与结构性过剩同时加深。
第六,下一代国产算力拿到一张”限时船票”:K3 的 MXFP4/MXFP8 格式恰好与华为昇腾 950 系列原生支持的低精度格式对齐(950DT 配 144GB HBM、原生支持 FP8/MXFP8/MXFP4)。而 H20 对华供应已进入”无限期停售”状态、英伟达中国区收入从 171 亿美元坍塌至 6000 万美元。K3 权重发布后的 3–6 个月,是国产超节点证明”能高效跑最大开源模型”的关键验证窗口,也是运营商在双供应链之间重新押注的决策窗口。
K3 通过技术、商业、资源三个维度向算力场与 Token 工厂传导冲击,本文各章逐一展开。
一、事件与事实底座:K3 到底是什么
1.1 发布与核心规格
|
|
KimiK3规格 |
总参数 |
2.8 万亿(2.8T),全球参数最大开源模型 |
架构 |
MoE(Stable LatentMoE)+ KDA 混合线性注意力 + Attention Residuals + Gated MLA |
专家配置 |
896 个专家,每 token 激活 16 个 |
上下文窗口 |
100 万 token(会员分层开放,Moderato 档 256K) |
模态 |
原生图像/视频理解输入,文本输出 |
量化 |
SFT 起全程 QAT,MXFP4 权重 + MXFP8 激活 |
官方部署建议 |
64+ 加速器 Supernode(高带宽通信域) |
API 定价 |
输入 $0.30(缓存命中)/ $3.00(未命中)/百万 token,输出 $15.00;国内 100 元 |
权重开源时间 |
2026 年 7 月 27 日前(K2 系列为 Modified MIT,K3 协议待官宣) |
推理栈 |
Mooncake 分离式架构,编程负载缓存命中率 >90%;KDA prefix caching 实现已贡献 vLLM |
规格表背后是清晰的设计取向:用架构效率换规模红利。官方称 K3 相比 K2 的整体扩展效率提升约 2.5 倍,即同样的算力投入转化出更强的能力,而非单纯堆参数 。其中 Attention Residuals 以不到 2% 的额外成本带来约 25% 的训练效率提升,Quantile Balancing、Per-Head Muon 等技术支撑 2.8T 规模下的稳定训练
1.2 架构三件套:KDA、AttnRes、Stable LatentMoE
Stable LatentMoE 与 896→16 的极端稀疏是第二个支点。K3 把 MoE 稀疏度推到新高:896 个专家中每 token 仅激活 16 个,配合完全均衡的专家并行训练方法(静态形状、关键路径无主机同步)保证大规模 EP 下的吞吐不被负载不均拖垮 。第三个支点是量化:从 SFT 阶段即引入量化感知训练,MXFP4 权重 + MXFP8 激活,官方口径是”适配更广泛的推理硬件”。三者叠加的工程含义是:K3 的每 token 计算量被压得很低,但全部权重必须驻留显存——它是一个”显存容量敏感、带宽敏感、互联敏感,而单步计算不敏感”的模型,这正是超节点架构的靶心负载。
1.3 性能定位与开源节奏
对运营商更重要的是开源节奏。权重 7 月 27 日前发布,月之暗面”正与推理合作伙伴和开源维护者紧密对齐技术细节” 。K2 系列的历史可作参照:K2.5 发布两周即在 OpenRouter 周总榜以 1.16 万亿 token 登顶,月之暗面份额从 4.4% 跃升至 16.3%,20 天营收超过 2025 年全年 。
可以合理预期,K3 权重落地后将复现一轮”开源旗舰→全生态托管→私有化部署”的扩散链,且这次的单点部署规模从 16 卡抬升到 64 卡级,扩散的每一环都需要运营商级产能承接。
二、技术维度:部署拓扑、长上下文经济学与软件栈的重写
2.1 显存账本:2.8T 权重如何改变部署拓扑
对照主流平台的 HBM 账本(本报告按公开规格整理测算),格局一目了然:16×H200(2.2TB)只能勉强装权重、无法承担生产并发;64×H20(6TB)是最低可行区;GB200 NVL72(13.5TB)开始宽裕;GB300 NVL72(20.25TB)、VR200 NVL144(40.5TB)、Atlas 950 64 卡单元(9TB)与 CloudMatrix 384(48TB)才是舒适区 。
作为参照,上一代 K2(1T FP8)的最小生产单元是 16 张 H200/H20 ,K2.5 量化后甚至可在单张 288GB 的 B300 上跑演示版 ——K3 把”最小经济部署单元”从双机 16 卡直接抬到整柜 64 卡,部署单元的资本开支门槛提高了约一个数量级。
2.2 KDA 与长上下文经济学:从”装不下”到”算得起”
但 KDA 也带来缓存体系的重构成本。线性注意力状态无法像标准 KV 那样直接做前缀复用,官方承认”KDA 给传统 prefix caching 带来了新的挑战”,并已将对应实现贡献给 vLLM 社区、随模型一同发布。
Kimi 官方 API 依托 Mooncake 分离式架构在编程负载下做到 90%+ 的缓存命中率,使命中输入价降到未命中价的 1/10($0.30 vs $3.00),实际输入成本约为标价的四分之一 。
这给运营商的启示是:K3 时代的竞争壁垒不在”有没有卡”,而在”缓存工程做得多深”——PD 分离、分层缓存(HBM/主机内存/SSD)、请求调度的亲和性设计,将直接决定毛利水平;官方 API 的 90% 命中率就是第三方托管方必须逼近的及格线。
2.3 超节点成为入场券:推理集群架构的整柜化拐点
SemiAnalysis 的实测为这一拐点提供了量化注脚:在 1.6T 的 DeepSeek-V4-Pro 上,GB300 NVL72 相对 GB200 的吞吐提升最高 2.83 倍、性价比提升 2.31 倍,而纸面规格差只有 1.5 倍——HBM 容量是”离散解锁条件”而非连续旋钮,能不能装下最优配方,决定了 1.85 倍超出规格表的额外收益 。把结论外推到 2.8T 的 K3:权重更大、专家更多、KV 池更深,HBM 容量与互联带宽的边际价值只会更高。运营商的采购逻辑因此改变:选型的第一性问题从”每卡算力单价”变为”单域 HBM 总量与域内带宽”,没有整柜超节点资产的平台将被排除在 K3 级模型的最优成本曲线之外。
2.4 软件生态适配冲刺:vLLM、KDA kernel 与双供应链格式竞赛
更深层的竞赛在数值格式。K3 的 MXFP4/MXFP8 恰好卡在两条供应链的分水岭上:NVIDIA Blackwell 原生支持 FP4(B200 dense FP4 10 PFLOPS、GB300 15 PFLOPS) 。华为昇腾 950DT 新增 FP8/MXFP8/MXFP4 原生支持、144GB HBM、4TB/s 带宽。而现役主力昇腾 910C 不支持 FP8 更别提 FP4,只能反量化回 BF16 计算、能效大打折扣 。这意味着:K3 是第一款”为新一代低精度硬件设计”的中国开源旗舰,它对硬件代际的选择性极强——用旧代硬件(H20、910C)能跑但跑不出经济性,用新代硬件(GB300、950DT、Rubin)才能释放其成本曲线。运营商库存里的代际结构,直接决定了能吃到 K3 红利还是只能旁观。
2.5 主流开源旗舰与闭源前沿的部署对比
模型 |
总参数 |
激活参数 |
上下文 |
开源协议 |
量化/格式 |
最小生产部署参考 |
官方输出定价 (每百万token) |
Kimi K3 |
2.8T |
896 选 16 |
1M |
承诺 7/27 前开源 |
MXFP4+MXFP8 QAT |
64+卡 Supernode |
¥100 / $15 |
DeepSeek V4-Pro |
1.6T |
49B (384 选 6) |
1M |
MIT |
FP4 QAT(推理反量化 FP8) |
64×H20 起步 |
¥24 |
DeepSeek V4-Flash |
284B |
13B |
1M |
MIT |
同上 |
8–16 卡级 |
¥1 |
GLM-5.2 |
744B |
未公布 |
1M(glm-5.2[1m]) |
MIT |
MLA+DSA+MTP |
16 卡级 |
$4.40(官方)/ 第三方中位 $1.85 |
Qwen3.5 |
397B |
17B |
256K 级 |
开源 |
GDN 混合 |
8 卡级 |
走量 |
MiniMax M3 |
428B |
23B |
1M |
开源 |
MSA 稀疏注意力 |
16 卡级 |
$2.40 |
Claude Fable 5 |
闭源未公布 |
— |
— |
闭源 |
— |
仅官方 API |
显著高于 K3(顶尖区间) |
这张表揭示了运营商面对的新现实:开源旗舰的部署门槛第一次与闭源旗舰的服务成本正面对标。K3 权重免费,但 64 卡超节点的资本开支与 100 元/百万 token 的官方定价,使”自托管 K3”成为只有中大型企业、云平台和主权客户才玩得起的选项 。虎嗅的评测直言”普通人可能也快用不起最强开源模型”,并把 K3 视为中国模型从”低价平替”转向”以生产力价值定价”的标志性事件 。对运营商而言,这不是坏消息——部署门槛越高,托管与代运营的价值就越大。
三、商业维度:Token 工厂的成本结构、定价分层与需求引爆
3.1 Token 工厂经济学:效率决定毛利,毛利决定生死
K3 把这个分野进一步拉大。本报告以 SemiAnalysis 的 AI Cloud TCO 模型(GB300 $2.65/GPU·小时)为成本锚,对一个 64 卡 GB300 域运行 K3 做敏感性测算(吞吐为情景假设,实际取决于引擎优化与负载结构):
|
输出侧全成本($/百万token) |
对照官方价$15的毛利 |
对照托管典型价$6的毛利 |
对照深度折价$3的毛利 |
保守 8k tok/s |
$5.89 |
约 61% |
约 2% |
亏损 |
基准 15k tok/s |
$3.14 |
约 79% |
约 48% |
约 -5% |
乐观 30k tok/s |
$1.57 |
约 90% |
约 74% |
约 48% |
测算揭示的结论直白而残酷:K3 级模型的 token 生意,毛利完全由吞吐效率定价。在基准情景下,一个 64 卡域年产约 0.47 万亿 token,若全部按官方输出价出货对应约 710 万美元年收入弹性,按托管价 6 美元则缩水到约 280 万美元;而单 token 电费仅约 0.22 美元/百万 token(120kW 机柜、$0.1/kWh),电力不是成本大头,资本效率才是。NVIDIA 在 OCP 2025 给出的”$5M 的 GB200 NVL72 跑 DeepSeek-R1 三年产生约 $75M token 收入”的 AI 工厂 ROI 叙事 ,在 K3 时代依然成立——但前提是你能把吞吐做到基准线以上,并把缓存命中率逼近官方的 90%。
3.2 定价权转移:开源阵营内部的价格分层
开源阵营由此裂变为三层价格带,运营商必须分层配置产能:旗舰层(K3、V4-Pro)吃性能溢价,单 token 毛利高但要求超节点产能与缓存工程;主力层(GLM-5.2、Qwen3.5、MiniMax M3)走量,第三方托管中位价已被打到 $0.55/$1.85 ,靠规模与利用率挣钱;长尾层(Flash 类、小模型)地板价,本质是高利用率填仓负载。值得强调的是,K3 官方用 90%+ 缓存命中把实际输入成本压到标价 1/4 ,等于在旗舰层内部又做了一次”明面高价、暗面折扣”的结构设计——未来 token 定价的竞争,越来越表现为缓存工程能力的竞争,而非标价牌的竞争。
3.3 开源权重 = 需求分流器:托管、私有化与 MaaS 格局重构
私有化部署是第二条分流管道,且在合规敏感行业是刚需。金融、医疗、政务”敏感数据不走外部 API”的约束 ,叠加 K3 在知识工作基准(GDPval-AA v2 1668 Elo、AA-Briefcase 1548 Elo)上的前沿表现 ,会催生一波”百万上下文 + 视觉理解”的企业私有化旗舰需求。智谱的财务结构可作参照:本地化部署收入占 73.7%、毛利率 48.8%,云端 MaaS 毛利率 18.9% ——私有化是目前 MaaS 厂商利润的主要来源,而 K3 把私有化客单价的天花板抬到了整柜超节点 + 代运营服务的量级。对运营商,这意味着产品形态要从”卖卡时/卖 token”扩展到”旗舰模型私有化总包”:硬件 + 引擎调优 + 持续版本跟进 + 缓存体系代建。
3.4 杰文斯悖论验证期:Token 消耗的指数曲线
宏观投射同样激进:高盛预计 2030 年全球 token 消耗量较 2026 年增长 24 倍(月均约 120 千万亿),2040 年达 55 倍 ;德勤预计推理负载占 AI 算力比重从 2023 年约 1/3 升至 2026 年约 2/3、未来超 80% ;2026 年全球企业推理基础设施资本开支预计 680 亿美元、首次超过训练的 450 亿美元。K3 的角色是为这条曲线”加燃料”:长程 Agent 能力(48 小时连续作业、自主芯片设计、视频剪辑)正是 token 消耗密度最高的负载类型,而每 token 成本因 KDA 与 MXFP4 下降后,同样的预算会购买更多调用——这正是杰文斯悖论的标准传导链,也是运营商扩产的最硬逻辑。
3.5 运营商商业模式重构:从卖卡时到卖 token,从通用到专用
盈利拐点的宏观条件正在成熟。高盛的核心判断是:token 定价年降约 40% 的趋势已趋稳甚至小幅回升,而芯片驱动的每 token 算力成本仍以每年 60%–70% 下降,两条曲线的剪刀差正在为行业打开利润空间,毛利拐点或在未来 3–12 个月 。K3 的发布恰好站在拐点之上:它为运营商提供了一个”高客单价(旗舰层)+ 高缓存杠杆(90% 命中)+ 高 token 密度(Agentic 负载)“的产品组合。但拐点的另一面是淘汰赛——硅基流动 -24% 毛利率的招股书提醒所有人:在剪刀差里,位置错的产能会被剪进去。
四、资源维度:HBM、电力与供应链的重排
4.1 HBM 与超节点:新稀缺资源的定价逻辑
前瞻 12–18 个月,新一轮”容量军备赛”已经明牌:NVIDIA Vera Rubin VR200 NVL144 将于 2026 下半年交付,单卡 288GB HBM4、约 20–22TB/s 带宽、整柜 3.6 EFLOPS FP4,官方叙事是”token 成本再降 10 倍”,单 GPU 功耗 1800–2300W、100% 液冷 ;AMD MI450X 以最高 432GB HBM4 对位竞争 ;华为 Atlas 950 SuperPoD 满配 8192 卡、1152TB 总内存、16.3PB/s 互联,WAIC 真机展出 1024 卡版本。对运营商而言,K3 的出现意味着“大内存整柜”从训练旗舰的可选项变成推理旗舰的必选项,2026 下半年到 2027 年的采购窗口里,GB300 NVL72、VR200 NVL144 与 Atlas 950 三类产能的锁单能力,将直接决定谁能承接 K3 及后续 3T+ 模型的托管红利;HBM 供给本身则成为比 GPU 更上游的卡位资源。
4.2 电力与液冷:120kW 机柜时代的能源账
但对 token 工厂的成本结构,需要破除一个迷思:电力是战略约束,不是成本大头。本报告测算,120kW 机柜在 15k tok/s 基准吞吐下,单 token 能耗约 8 焦耳、折合每百万 token 电费仅约 0.22 美元($0.1/kWh),不到输出侧成本的 7%。电力真正的约束在并网周期与容量指标:AI 站点普遍需要 100–300MW、超大园区接近 1GW ,电网扩容速度远跟不上数据中心建设。这恰是中国运营商的比较优势——4000GW全国电网的供给弹性,使电力从成本项变为承接 K3 级产能落地的区位筹码。K3 的高吞吐架构放大了这一优势:单 token 能耗越低,同样的电力指标能开出越多的 token 产能。
4.3 供应链与地缘:双供应链下的押注窗口
K3 在这个格局里扮演”需求催化剂”:它的 MXFP4/MXFP8 格式与昇腾 950 系列原生低精度支持对齐(950PR 已于 2026Q1 商用、FP4 算力 1.56 PFLOPS 为 H20 的 2.87 倍、自研 HBM 112GB、定价约 7 万元、2026 年目标出货 75 万片;950DT 四季度上市)。此外,K3 官方 kernel 优化测试中就包含了”另一家厂商的 GPGPU”并跑出 73.6% 的优化幅度 。美团 LongCat 2.0 已证明 5 万张国产算力卡可完成 1.6T 模型的全流程训练与部署,被高盛视为中国 AI 基础设施自主化的里程碑;昇腾 384 超节点已商用落地 750 多套。权重发布后的 3–6 个月,是国产超节点证明”高效运行最大开源模型”的验证窗,也是运营商在 NVIDIA 与国产双供应链之间重新分配采购与适配资源的决策窗——押注的不再只是芯片,而是”芯片 × 模型格式 × 推理引擎”的整条栈。
4.4 结构性错配:繁荣与空转并存下的资本纪律
K3 的发布会同时加深这两端:一方面,2.8T 旗舰把需求进一步导向 64+ 卡高带宽域,加剧高端产能紧缺;另一方面,大量缺乏超节点架构、缺乏推理引擎运营能力、远离真实需求的存量智算中心,将更难承接新负载,资产贬值速度加快——“能跑 K3”与”不能跑 K3”将成为智算中心资产估值的分水岭。对运营商,这要求极强的资本纪律:新增 capex 集中于 HBM 总量大、互联带宽高、电力指标确定的整柜产能,同时通过异构调度、算力互联网与存量改造盘活低效资产。九大云厂商 2026 年合计资本开支预计 8300 亿美元、同比 +79%,五大厂待履行订单突破 2 万亿美元 ——在巨头军备赛里,二线运营商的胜负手不是”扩多少”,而是”扩得对不对”。
五、算力运营商行动框架:三情景推演与落地路线
5.1 三情景推演(2026H2–2027)
|
|
关键假设 |
对算力场/Token工厂的影响 |
策略重心 |
基准(概率最高)<o:page> |
K3 复刻 K2.5 扩散曲线,托管需求 1–2 个季度内放量;token 价格年降 40–50%;B300/Rubin/950DT 如期放量 |
旗舰层毛利 50%+,超节点利用率 >85%;结构性紧缺持续 |
锁定整柜产能 + 建缓存工程壁垒 + 分层定价 |
乐观 |
Agentic 负载爆发超预期(token 增速维持 100%+);K3 生态成事实标准;国产 950 供货顺畅 |
高端产能全面售罄,租赁价格续涨;私有化大单涌现 |
激进扩产 + 签长约锁客 + 双供应链冗余 |
悲观 |
闭源下一代拉开代差或 K4/V5 快速迭代致 K3 资产贬值;token 价格战重启;宏观 capex 收缩 |
高价抢的超节点利用率不足,重资产减值 |
弹性租赁优先 + 控制单机柜敞口 + 保留模型切换能力(多模型栈) |
无论哪种情景,K3 自身的局限也是风险源——思考历史敏感(Agent 框架必须完整回传思考内容)、任务中”过度主动”、以及与 Fable 5/GPT 5.6 Sol 的体验差距被官方明确列出 ;虎嗅实测也指出 max 档下单任务耗时接近一小时,速度是现实约束。旗舰模型的市场地位可能随一两个版本周期易手,运营商的资产必须”模型中立”。
5.2 技术与产品路线建议
供应链策略:NVIDIA 与国产双线并行——海外/出海业务押 GB300 与 VR200 交付窗 ,国内业务深度绑定新一代国产卡生态并参与 K3 国产适配(参照 DeepSeek V4 的寒武纪 Day 0 模式),对 HBM、光模块(800G→1.6T 升级)、液冷等上游瓶颈件做 12 个月以上的锁量。
六、结论
历史经验(K2.5 两周 16.3% 份额、DeepSeek 之后 H100 利用率跳升 10 个百分点) 表明,开源旗舰发布后 3–6 个月是产能卡位的黄金窗口。
7 月 27 日权重落地之时,竞赛正式开始。
这一次,卖的不再只是算力,而是把 2.8 万亿参数变成生产力的能力。
面对2.8T参数,超节点,就是新时代的无畏舰。

