大数跨境

Kimi,2.8万亿参数的冲击波,如何深度冲击Token工厂的运营格局,万字长文解析六大变化

Kimi,2.8万亿参数的冲击波,如何深度冲击Token工厂的运营格局,万字长文解析六大变化 巨硬的AI
2026-07-17
3
导读:面对2.8T参数,超节点,就是新时代的无畏舰。
Kimi K3 的发布不只是一次模型迭代,而是开源模型首次进入”3 万亿参数 + 百万上下文 + 原生视觉”的前沿区间,它在官方评测中稳定超越 GLM-5.2、Claude Opus 4.8、GPT-5.5 等所有受测模型,仅落后于最强闭源模型Claude Fable 5与GPT 5.6 Sol。对Token工厂而言,冲击是结构性的,可以概括为六个核心判断:

第一,部署门槛跃迁,超节点成为”入场券”: K3 采用 MXFP4 权重 + MXFP8 激活的量化感知训练,权重体积约 1.4–1.5TB,官方明确建议在 64 张或更多加速器组成的 Supernode 上部署 。这把”能跑 K3”的单位从过去的 8–16 卡单机,直接抬升到整柜级 64+ 卡高带宽互联域——恰好落在 GB200/GB300 NVL72、华为 Atlas 950 SuperPoD 这类整柜超节点的甜区上。开源权重免费,但运行权的门槛从未这么高,推理需求将加速向具备超节点资产的运营商集中。

第二,长上下文推理经济学被改写:K3 的 KDA 混合线性注意力使百万上下文下的解码速度最高提升 6.3 倍、KV 缓存仅为同规模全注意力模型的约 25% ,配合 Mooncake 分离式推理在编程负载下超过 90% 的缓存命中率,“百万 token 上下文”第一次具备了规模化商用的成本曲线。这意味着运营商的 KV Cache 资源规划、缓存层级设计(HBM→LPDDR→SSD)和计费模型都要重做。

第三,Token 工厂的毛利剪刀差正在打开,但只属于”高效产能”:高盛判断 token 定价年降幅已趋稳、而每 token 算力成本仍以每年 60%–70% 下降,超大规模厂商的毛利拐点或在未来 3–12 个月内到来。本报告测算:在 64 卡 GB300 域上以基准吞吐运行 K3,输出侧全成本约 3.1 美元/百万 token,对照官方 API 15 美元的输出价,毛利空间可达约八成;但若只能按第三方托管典型价 6 美元出货,毛利立刻压缩到约五成——效率即生死。

第四,开源阵营定价分层,Token 工厂从”一个市场”裂变为”三个市场”。 K3 输出定价 100 元/百万 token,进入顶尖模型区间,约为自家 K2.7 Code 的 4 倍;而 DeepSeek 在 5 月将全系 API 永久降价约 75%,V4-Flash 输出低至 1 元/百万 token 。旗舰层吃性能溢价、主力层走量、长尾层地板价——运营商必须为不同层级的模型配置不同的硬件与毛利策略,而不是一套集群打天下。

第五,资源瓶颈从”算力”转向“高端算力绝对优势”:SemiAnalysis 在 1.6T 的 DeepSeek-V4-Pro上实测证明:HBM容量是离散的“解锁条件”,GB300 NVL72(288GB/卡)相对 GB200 的吞吐优势最高达 2.83 倍。K3 把这一逻辑放大到 2.8T 量级;B200 续约价拟上调 94%,高端算力”有价无市”与低质量智算中心 30% 利用率并存—结构性紧缺与结构性过剩同时加深。

第六,下一代国产算力拿到一张”限时船票”:K3 的 MXFP4/MXFP8 格式恰好与华为昇腾 950 系列原生支持的低精度格式对齐(950DT 配 144GB HBM、原生支持 FP8/MXFP8/MXFP4)。而 H20 对华供应已进入”无限期停售”状态、英伟达中国区收入从 171 亿美元坍塌至 6000 万美元。K3 权重发布后的 3–6 个月,是国产超节点证明”能高效跑最大开源模型”的关键验证窗口,也是运营商在双供应链之间重新押注的决策窗口。

K3 通过技术、商业、资源三个维度向算力场与 Token 工厂传导冲击,本文各章逐一展开。

K3对算力场与Token工厂的冲击传导框架

一、事件与事实底座:K3 到底是什么

1.1 发布与核心规格

2026 年 7 月 16 日,月之暗面在 2026 世界人工智能大会(WAIC)开幕前夕上线 Kimi K3,定位”迄今能力最强的模型”,面向长程编程、知识工作与深度推理 。它同时刷新了开源模型的两条边界:参数规模首次突破 2 万亿级(2.8T,全球首个 3T 级开源模型),以及过去 12 个月中 9 个月由 Kimi 保持的开源模型规模上限被再次顶高 。截至发布日,K3 已上线 Kimi App、Kimi Work、Kimi Code 与官方 API,完整权重承诺于 7 月 27 日前发布,技术报告同步公开 。
属性

KimiK3规格

总参数

2.8 万亿(2.8T),全球参数最大开源模型

架构

MoE(Stable LatentMoE)+ KDA 混合线性注意力 + Attention Residuals + Gated MLA

专家配置

896 个专家,每 token 激活 16 个

上下文窗口

100 万 token(会员分层开放,Moderato 档 256K)

模态

原生图像/视频理解输入,文本输出

量化

SFT 起全程 QAT,MXFP4 权重 + MXFP8 激活

官方部署建议

64+ 加速器 Supernode(高带宽通信域)

API 定价

输入 $0.30(缓存命中)/ $3.00(未命中)/百万 token,输出 $15.00;国内 100 元

权重开源时间

2026 年 7 月 27 日前(K2 系列为 Modified MIT,K3 协议待官宣)

推理栈

Mooncake 分离式架构,编程负载缓存命中率 >90%;KDA prefix caching 实现已贡献 vLLM

规格表背后是清晰的设计取向:用架构效率换规模红利。官方称 K3 相比 K2 的整体扩展效率提升约 2.5 倍,即同样的算力投入转化出更强的能力,而非单纯堆参数 。其中 Attention Residuals 以不到 2% 的额外成本带来约 25% 的训练效率提升,Quantile Balancing、Per-Head Muon 等技术支撑 2.8T 规模下的稳定训练

1.2 架构三件套:KDA、AttnRes、Stable LatentMoE

理解 K3 对基础设施的冲击,必须先理解它的三个架构支点。KDA(Kimi Delta Attention) 是门控线性注意力的改进变体,通过逐通道对角门控实现差异化遗忘,并以 3:1 的比例与全注意力层(Gated MLA)混合堆叠 。在此前 48B 规模的 Kimi Linear 验证中,这一设计在百万token 解码时单 token 生成时间(TPOT)仅 1.84ms,而全注意力 MLA 基线为 11.48ms,吞吐优势 6.3 倍,KV 缓存体积压缩到约 25%,预填充也快 2.9 倍 。K3 是该架构首次在 2.8T 旗舰规模上的工程化落地——长上下文从”算力奢侈品”变成”可定价商品”的技术前提由此成立。

Stable LatentMoE 与 896→16 的极端稀疏是第二个支点。K3 把 MoE 稀疏度推到新高:896 个专家中每 token 仅激活 16 个,配合完全均衡的专家并行训练方法(静态形状、关键路径无主机同步)保证大规模 EP 下的吞吐不被负载不均拖垮 。第三个支点是量化:从 SFT 阶段即引入量化感知训练,MXFP4 权重 + MXFP8 激活,官方口径是”适配更广泛的推理硬件”。三者叠加的工程含义是:K3 的每 token 计算量被压得很低,但全部权重必须驻留显存——它是一个”显存容量敏感、带宽敏感、互联敏感,而单步计算不敏感”的模型,这正是超节点架构的靶心负载。

全球开源旗舰模型参数规模总览

1.3 性能定位与开源节奏

性能上,K3 的官方口径诚实而清晰:整体仍落后于 Claude Fable 5 与 GPT 5.6 Sol,但在整套评测中稳定超过其他所有受测模型,在 Program Bench(77.8)、SWE Marathon(42.0)、BrowseComp(91.2)、Automation Bench(30.8)等多项基准上领先对比集。第三方侧,Artificial Analysis 的 14 项测试中 K3 击败 GPT 5.6 Sol 达 11 项、全面击败 Opus 4.8;Arena 前端代码竞技场以 1679 分登顶,超过 Claude Fable 5 。Fortune 评价其”把中国 AI 推入 Fable 级区间”,并指出分析师原本预期中国到 2027 年初才能拿出这一级别的模型 。

对运营商更重要的是开源节奏。权重 7 月 27 日前发布,月之暗面”正与推理合作伙伴和开源维护者紧密对齐技术细节” 。K2 系列的历史可作参照:K2.5 发布两周即在 OpenRouter 周总榜以 1.16 万亿 token 登顶,月之暗面份额从 4.4% 跃升至 16.3%,20 天营收超过 2025 年全年 。

可以合理预期,K3 权重落地后将复现一轮”开源旗舰→全生态托管→私有化部署”的扩散链,且这次的单点部署规模从 16 卡抬升到 64 卡级,扩散的每一环都需要运营商级产能承接。

二、技术维度:部署拓扑、长上下文经济学与软件栈的重写

2.1 显存账本:2.8T 权重如何改变部署拓扑

先算最硬的一笔账。K3 以 MXFP4 存储权重,2.8 万亿参数 × 4 bit ≈ 1.4TB,加量化元数据后约 1.5TB——这是”权重驻留显存”的硬下限,与 K2 的 FP8 约 1.0TB 、DeepSeek V4-Pro FP8 基线约 1.6TB 处于同一量级但显著更高。真正的约束不在权重本身,而在权重 + KV Cache + 激活工作区的总额:K3 支持 1M 上下文,即便 KDA 把 KV 缓存压到全注意力的约 25% ,在高并发长上下文负载下,KV 池仍以 TB 计。这解释了官方”64+ 加速器 Supernode”建议的出发点:不只是装下权重,而是要有足够大的高带宽统一内存域来承载专家并行与缓存池。

对照主流平台的 HBM 账本(本报告按公开规格整理测算),格局一目了然:16×H200(2.2TB)只能勉强装权重、无法承担生产并发;64×H20(6TB)是最低可行区;GB200 NVL72(13.5TB)开始宽裕;GB300 NVL72(20.25TB)、VR200 NVL144(40.5TB)、Atlas 950 64 卡单元(9TB)与 CloudMatrix 384(48TB)才是舒适区 。

作为参照,上一代 K2(1T FP8)的最小生产单元是 16 张 H200/H20 ,K2.5 量化后甚至可在单张 288GB 的 B300 上跑演示版 ——K3 把”最小经济部署单元”从双机 16 卡直接抬到整柜 64 卡,部署单元的资本开支门槛提高了约一个数量级。

主流超节点HBM容量与K3权重占用

2.2 KDA 与长上下文经济学:从”装不下”到”算得起”

KDA 对运营商的价值不止于显存节约,它改写了长上下文服务的整个成本结构。传统全注意力模型在 1M 上下文下,KV Cache 随序列线性膨胀、解码注意力随序列变长而持续退化,导致”百万上下文”在多数厂商那里只是营销参数;KDA 的线性注意力层以固定大小的 RNN 状态替代逐 token 的 KV 展开,使解码成本与上下文长度近似解耦,配合 3:1 混合层设计把 KV 缓存压到 MLA 的约四分之一 。
对 token 工厂而言,这直接转化为单并发显存占用下降 → 单卡并发数上升 → 单位 token 成本下降的链路,以及百万上下文 SLA 从”不可售”变为”可售”。

但 KDA 也带来缓存体系的重构成本。线性注意力状态无法像标准 KV 那样直接做前缀复用,官方承认”KDA 给传统 prefix caching 带来了新的挑战”,并已将对应实现贡献给 vLLM 社区、随模型一同发布。

Kimi 官方 API 依托 Mooncake 分离式架构在编程负载下做到 90%+ 的缓存命中率,使命中输入价降到未命中价的 1/10($0.30 vs $3.00),实际输入成本约为标价的四分之一 。

这给运营商的启示是:K3 时代的竞争壁垒不在”有没有卡”,而在”缓存工程做得多深”——PD 分离、分层缓存(HBM/主机内存/SSD)、请求调度的亲和性设计,将直接决定毛利水平;官方 API 的 90% 命中率就是第三方托管方必须逼近的及格线。

2.3 超节点成为入场券:推理集群架构的整柜化拐点

K3 的稀疏度(896 选 16)意味着每 token 要跨专家路由,专家并行(EP)的通信效率成为吞吐的第一约束;官方明确指出”推理效率受益于更大的高带宽通信域”,并为此在训练侧就引入完全均衡的 EP 方法 。这把行业已经发生的趋势推到临界点:推理集群的基本单元从”8 卡服务器”升级为”整柜超节点”。GB200 NVL72 用 NVLink 5 把 72 张 B200 连成 13.5TB 统一 HBM 域、单卡 1.8TB/s 互联 ;华为 CloudMatrix 384 用 UB 总线把 384 颗 910C 连成 49.2TB 内存池,且架构设计之初就针对大规模 MoE 专家并行与分布式 KV Cache 优化;7 月 17 日 WAIC 上真机首秀的 Atlas 950 SuperPoD 进一步把单域推到 1024 卡(最大 8192 卡)、256TB 全局统一编址。

SemiAnalysis 的实测为这一拐点提供了量化注脚:在 1.6T 的 DeepSeek-V4-Pro 上,GB300 NVL72 相对 GB200 的吞吐提升最高 2.83 倍、性价比提升 2.31 倍,而纸面规格差只有 1.5 倍——HBM 容量是”离散解锁条件”而非连续旋钮,能不能装下最优配方,决定了 1.85 倍超出规格表的额外收益 。把结论外推到 2.8T 的 K3:权重更大、专家更多、KV 池更深,HBM 容量与互联带宽的边际价值只会更高。运营商的采购逻辑因此改变:选型的第一性问题从”每卡算力单价”变为”单域 HBM 总量与域内带宽”,没有整柜超节点资产的平台将被排除在 K3 级模型的最优成本曲线之外。

2.4 软件生态适配冲刺:vLLM、KDA kernel 与双供应链格式竞赛

权重发布后的第一个赛点在推理引擎。月之暗面已把 KDA 的 prefix caching 实现贡献给 vLLM ,K2 时代积累的 SGLang PD 分离、DeepEP-MoE 优化等工程资产大概率复用 ;但 KDA 的 chunked 线性注意力 kernel、MXFP4 的 GEMM 路径、896 专家的路由调度都需要引擎级深度适配。参照 DeepSeek V4 的先例——发布次日 NVIDIA Blackwell 全面适配、寒武纪 Day 0 完成 vLLM 适配并开源代码 ——K3 的适配竞赛已经开跑,谁能第一天拿出高吞吐的稳定栈,谁就承接权重发布后的流量洪峰。

更深层的竞赛在数值格式。K3 的 MXFP4/MXFP8 恰好卡在两条供应链的分水岭上:NVIDIA Blackwell 原生支持 FP4(B200 dense FP4 10 PFLOPS、GB300 15 PFLOPS) 。华为昇腾 950DT 新增 FP8/MXFP8/MXFP4 原生支持、144GB HBM、4TB/s 带宽。而现役主力昇腾 910C 不支持 FP8 更别提 FP4,只能反量化回 BF16 计算、能效大打折扣 。这意味着:K3 是第一款”为新一代低精度硬件设计”的中国开源旗舰,它对硬件代际的选择性极强——用旧代硬件(H20、910C)能跑但跑不出经济性,用新代硬件(GB300、950DT、Rubin)才能释放其成本曲线。运营商库存里的代际结构,直接决定了能吃到 K3 红利还是只能旁观。

2.5 主流开源旗舰与闭源前沿的部署对比

把 K3 放回竞争坐标系,“最大开源模型”的部署含义更加清晰。下表汇总当前主流开源旗舰与闭源前沿的关键部署参数:K3 以 2.8T 总参数独居第一档,部署门槛与定价同时进入”旗舰区间”;DeepSeek V4-Pro 以 1.6T + 全栈国产适配占据”自主可控”生态位 ;GLM-5.2、Qwen3.5、MiniMax M3 则在 400B–750B 区间提供更易部署的替代项 。

模型

总参数

激活参数

上下文

开源协议

量化/格式

最小生产部署参考

官方输出定价

(每百万token)

Kimi K3

2.8T

896 选 16

1M

承诺 7/27 前开源

MXFP4+MXFP8 QAT

64+卡 Supernode

¥100 / $15

DeepSeek V4-Pro

1.6T

49B

(384 选 6)

1M

MIT

FP4 QAT(推理反量化 FP8)

64×H20 起步

¥24

DeepSeek V4-Flash

284B

13B

1M

MIT

同上

8–16 卡级

¥1

GLM-5.2

744B

未公布

1M(glm-5.2[1m])

MIT

MLA+DSA+MTP

16 卡级

$4.40(官方)/ 第三方中位 $1.85

Qwen3.5

397B

17B

256K 级

开源

GDN 混合

8 卡级

走量

MiniMax M3

428B

23B

1M

开源

MSA 稀疏注意力

16 卡级

$2.40

Claude Fable 5

闭源未公布

闭源

仅官方 API

显著高于 K3(顶尖区间)

这张表揭示了运营商面对的新现实:开源旗舰的部署门槛第一次与闭源旗舰的服务成本正面对标。K3 权重免费,但 64 卡超节点的资本开支与 100 元/百万 token 的官方定价,使”自托管 K3”成为只有中大型企业、云平台和主权客户才玩得起的选项 。虎嗅的评测直言”普通人可能也快用不起最强开源模型”,并把 K3 视为中国模型从”低价平替”转向”以生产力价值定价”的标志性事件 。对运营商而言,这不是坏消息——部署门槛越高,托管与代运营的价值就越大。

三、商业维度:Token 工厂的成本结构、定价分层与需求引爆

3.1 Token 工厂经济学:效率决定毛利,毛利决定生死

先把”Token 工厂”的商业本质讲清楚:以智算中心为固定资产,部署大模型并以 API 按 token 计费,固定成本(机房、电力、服务器)摊销后边际成本趋低,理论毛利可达 50%–70%,头部项目 2–3 年回本,显著优于传统 IDC 的 5–8 年与算力租赁 30%–40% 的毛利。但招股书里的另一面同样真实:冲刺港股的硅基流动 2025 年营收 5533 万元、同比暴增 653%,亏损却扩大到 3.45 亿元,毛利率 -24%——每卖一块钱 token 倒贴两毛四,病根是公有云 GPU 租赁与带宽成本压顶。同一个生意,有人 70% 毛利、有人负毛利,分野就在单位算力的 token 产出效率。

K3 把这个分野进一步拉大。本报告以 SemiAnalysis 的 AI Cloud TCO 模型(GB300 $2.65/GPU·小时)为成本锚,对一个 64 卡 GB300 域运行 K3 做敏感性测算(吞吐为情景假设,实际取决于引擎优化与负载结构):


情景(聚合解码吞吐)

输出侧全成本($/百万token)

对照官方价$15的毛利

对照托管典型价$6的毛利

对照深度折价$3的毛利

保守 8k tok/s

$5.89

约 61%

约 2%

亏损

基准 15k tok/s

$3.14

约 79%

约 48%

约 -5%

乐观 30k tok/s

$1.57

约 90%

约 74%

约 48%


测算揭示的结论直白而残酷:K3 级模型的 token 生意,毛利完全由吞吐效率定价。在基准情景下,一个 64 卡域年产约 0.47 万亿 token,若全部按官方输出价出货对应约 710 万美元年收入弹性,按托管价 6 美元则缩水到约 280 万美元;而单 token 电费仅约 0.22 美元/百万 token(120kW 机柜、$0.1/kWh),电力不是成本大头,资本效率才是。NVIDIA 在 OCP 2025 给出的”$5M 的 GB200 NVL72 跑 DeepSeek-R1 三年产生约 $75M token 收入”的 AI 工厂 ROI 叙事 ,在 K3 时代依然成立——但前提是你能把吞吐做到基准线以上,并把缓存命中率逼近官方的 90%。

K3推理成本敏感性

3.2 定价权转移:开源阵营内部的价格分层

K3 的定价策略本身就是行业事件。输入 2 元(命中)/20 元(未命中)、输出 100 元每百万 token,输出价约为 K2.7 Code 的 4 倍,直接进入 frontier 模型定价区间;1M 上下文还做成会员分层权益(Moderato 档仅 256K) 。这与 DeepSeek 的路线形成鲜明对撞:5 月 22 日 DeepSeek 全系 API 输入降价、旗舰限时优惠相当于永久降价 75%,V4-Flash 输出价打到 1 元/百万 token,V4-Pro 也仅 24 元、约为 GPT-5.5 的 1/9 。6 月小米、字节、腾讯跟进降价,OpenAI 启动首轮大规模 API 降价 。

开源阵营由此裂变为三层价格带,运营商必须分层配置产能:旗舰层(K3、V4-Pro)吃性能溢价,单 token 毛利高但要求超节点产能与缓存工程;主力层(GLM-5.2、Qwen3.5、MiniMax M3)走量,第三方托管中位价已被打到 $0.55/$1.85 ,靠规模与利用率挣钱;长尾层(Flash 类、小模型)地板价,本质是高利用率填仓负载。值得强调的是,K3 官方用 90%+ 缓存命中把实际输入成本压到标价 1/4 ,等于在旗舰层内部又做了一次”明面高价、暗面折扣”的结构设计——未来 token 定价的竞争,越来越表现为缓存工程能力的竞争,而非标价牌的竞争。

3.3 开源权重 = 需求分流器:托管、私有化与 MaaS 格局重构

权重开源对运营商的第一性影响是把”模型 API 市场”变成”算力托管市场”。K2.5 的历史曲线证明了分流速度:发布两周登顶 OpenRouter 周榜,月之暗面份额两周内从 4.4% 冲到 16.3%;2026 年 2 月,中国模型在 OpenRouter 的周调用量以 4.12 万亿 token 首超美国模型的 2.94 万亿,次周拉大到 5.16 万亿对 2.7 万亿 。瑞银监测显示,OpenRouter 全球周 token 用量在 OpenClaw 爆发后已达约 16 万亿、较 1 月翻近三倍。K3 作为当前最强开源模型,权重落地后几乎必然复制并放大这一分流——且由于自托管门槛抬升到 64 卡级,分流的主要受益者不是终端企业,而是有能力运营超节点的托管推理平台(国内外云厂商、GPU 云、MaaS 聚合商)。
OpenRouter中美模型周调用量

私有化部署是第二条分流管道,且在合规敏感行业是刚需。金融、医疗、政务”敏感数据不走外部 API”的约束 ,叠加 K3 在知识工作基准(GDPval-AA v2 1668 Elo、AA-Briefcase 1548 Elo)上的前沿表现 ,会催生一波”百万上下文 + 视觉理解”的企业私有化旗舰需求。智谱的财务结构可作参照:本地化部署收入占 73.7%、毛利率 48.8%,云端 MaaS 毛利率 18.9% ——私有化是目前 MaaS 厂商利润的主要来源,而 K3 把私有化客单价的天花板抬到了整柜超节点 + 代运营服务的量级。对运营商,这意味着产品形态要从”卖卡时/卖 token”扩展到”旗舰模型私有化总包”:硬件 + 引擎调优 + 持续版本跟进 + 缓存体系代建。

3.4 杰文斯悖论验证期:Token 消耗的指数曲线

效率提升不会减少算力需求,只会引爆它——杰文斯悖论在 token 经济上的验证数据已经相当完整。国家数据局口径下,中国日均 token 消耗从 2024 年初的 1000 亿增至 2025 年 6 月的 30 万亿,一年半增长 300 多倍 ;2026 年 3 月已达 140 万亿,全年预计达 40000 万亿量级 。智能体是最强放大器:Anthropic 实测单 Agent 任务 token 消耗约为普通对话 4 倍、多 Agent 系统 15 倍;高通给出的阶梯是对话式约 1 万、推理式约 10 万、智能体式约 100 万 token ;英特尔在 Computex 2026 引用报告称智能体 token 消耗最高可达单轮推理的 1000 倍。无问芯穹的 Agentic MaaS 业务 5 个月 token 调用量增长 20 倍、95% 以上来自智能体场景。
中国大模型日均Token消耗量

宏观投射同样激进:高盛预计 2030 年全球 token 消耗量较 2026 年增长 24 倍(月均约 120 千万亿),2040 年达 55 倍 ;德勤预计推理负载占 AI 算力比重从 2023 年约 1/3 升至 2026 年约 2/3、未来超 80% ;2026 年全球企业推理基础设施资本开支预计 680 亿美元、首次超过训练的 450 亿美元。K3 的角色是为这条曲线”加燃料”:长程 Agent 能力(48 小时连续作业、自主芯片设计、视频剪辑)正是 token 消耗密度最高的负载类型,而每 token 成本因 KDA 与 MXFP4 下降后,同样的预算会购买更多调用——这正是杰文斯悖论的标准传导链,也是运营商扩产的最硬逻辑。

3.5 运营商商业模式重构:从卖卡时到卖 token,从通用到专用

K3 级模型落地后,运营商的商业模式将沿三条线重构。产品线上,“裸金属租赁 → MaaS 托管 → Agentic 推理专用集群”三级火箭成型:Agentic 负载的 CPU/GPU 配比从训练时代的 1:8 反转向 1:1 甚至 4:1,CPU 承担 40%–80% 的端到端工作负载(编排、沙盒、工具调用、KV Cache 卸载),专用集群的 BOM 与调度系统都要为此重设计。定价线上,按 token 计费、按上下文长度分层(K3 已把 1M 做成权益) 、按缓存命中率定价(命中价 1/10)将成为标配,峰谷分时计费(DeepSeek 已首推)会普及到推理侧以平滑负载。客户线上,需求主力从模型公司扩展到四类客户:AI 应用公司的长期推理部署、金融制造医疗政务的私有化集群、科研与中小团队的弹性租赁、以及算力整合平台。

盈利拐点的宏观条件正在成熟。高盛的核心判断是:token 定价年降约 40% 的趋势已趋稳甚至小幅回升,而芯片驱动的每 token 算力成本仍以每年 60%–70% 下降,两条曲线的剪刀差正在为行业打开利润空间,毛利拐点或在未来 3–12 个月 。K3 的发布恰好站在拐点之上:它为运营商提供了一个”高客单价(旗舰层)+ 高缓存杠杆(90% 命中)+ 高 token 密度(Agentic 负载)“的产品组合。但拐点的另一面是淘汰赛——硅基流动 -24% 毛利率的招股书提醒所有人:在剪刀差里,位置错的产能会被剪进去。


四、资源维度:HBM、电力与供应链的重排


4.1 HBM 与超节点:新稀缺资源的定价逻辑

K3 级模型把稀缺性的重心从”算力 FLOPS”彻底推向”HBM 容量与高带宽域”。供给侧的信号已经非常直白:SK 海力士的 HBM3e 产能被 Blackwell 大量消耗,造成各期限 H100/H200/B200 租赁合约全面无货;摩根大通追踪显示 DRAM、NAND 合约价 2026 年一季度环比分别上涨 96% 和 88% ;2026 年存储芯片市场同比暴涨 249.5%,HBM 成为核心引擎,SK 海力士、三星、美光三分天下。租赁价格的传导随之发生:H100 一年期合约价从 2025 年 10 月的 1.70 美元/GPU·小时涨至 2026 年 3 月的 2.35 美元、涨幅近 40%;B200 续约价有厂商通知从 2.63 美元上调至 5.10 美元、涨幅 94%;Nebius 自 6 月 1 日起全系按需价上调约 30%、长期合约最高上调 70%
高端GPU租赁价格走势

前瞻 12–18 个月,新一轮”容量军备赛”已经明牌:NVIDIA Vera Rubin VR200 NVL144 将于 2026 下半年交付,单卡 288GB HBM4、约 20–22TB/s 带宽、整柜 3.6 EFLOPS FP4,官方叙事是”token 成本再降 10 倍”,单 GPU 功耗 1800–2300W、100% 液冷 ;AMD MI450X 以最高 432GB HBM4 对位竞争 ;华为 Atlas 950 SuperPoD 满配 8192 卡、1152TB 总内存、16.3PB/s 互联,WAIC 真机展出 1024 卡版本。对运营商而言,K3 的出现意味着“大内存整柜”从训练旗舰的可选项变成推理旗舰的必选项,2026 下半年到 2027 年的采购窗口里,GB300 NVL72、VR200 NVL144 与 Atlas 950 三类产能的锁单能力,将直接决定谁能承接 K3 及后续 3T+ 模型的托管红利;HBM 供给本身则成为比 GPU 更上游的卡位资源。

4.2 电力与液冷:120kW 机柜时代的能源账

整柜超节点把功率密度推上新台阶:GB200 NVL72 整柜约 120–130kW 且强制液冷 。CloudMatrix 384 高达约 560kW、约为 NVL72 的 4 倍,以系统级堆料换总算力,每 FLOP 功耗高 2.3–2.5 倍 。Rubin 单卡 1800–2300W,则宣告 200kW+ 机柜与 800V HVDC 供电时代临近 。宏观层面,2026 年全球数据中心用电量预计 565TWh、同比增 26%,对应 132GW;AI 服务器占比将达 31%,2027 年首超通用服务器;2030 年总量或突破 1200TWh 。2026–2030 年全球数据中心新增功率需求约 95GW,其中中国约 24GW。

但对 token 工厂的成本结构,需要破除一个迷思:电力是战略约束,不是成本大头。本报告测算,120kW 机柜在 15k tok/s 基准吞吐下,单 token 能耗约 8 焦耳、折合每百万 token 电费仅约 0.22 美元($0.1/kWh),不到输出侧成本的 7%。电力真正的约束在并网周期与容量指标:AI 站点普遍需要 100–300MW、超大园区接近 1GW ,电网扩容速度远跟不上数据中心建设。这恰是中国运营商的比较优势——4000GW全国电网的供给弹性,使电力从成本项变为承接 K3 级产能落地的区位筹码。K3 的高吞吐架构放大了这一优势:单 token 能耗越低,同样的电力指标能开出越多的 token 产能。

4.3 供应链与地缘:双供应链下的押注窗口

K3 在这个格局里扮演”需求催化剂”:它的 MXFP4/MXFP8 格式与昇腾 950 系列原生低精度支持对齐(950PR 已于 2026Q1 商用、FP4 算力 1.56 PFLOPS 为 H20 的 2.87 倍、自研 HBM 112GB、定价约 7 万元、2026 年目标出货 75 万片;950DT 四季度上市)。此外,K3 官方 kernel 优化测试中就包含了”另一家厂商的 GPGPU”并跑出 73.6% 的优化幅度 。美团 LongCat 2.0 已证明 5 万张国产算力卡可完成 1.6T 模型的全流程训练与部署,被高盛视为中国 AI 基础设施自主化的里程碑;昇腾 384 超节点已商用落地 750 多套。权重发布后的 3–6 个月,是国产超节点证明”高效运行最大开源模型”的验证窗,也是运营商在 NVIDIA 与国产双供应链之间重新分配采购与适配资源的决策窗——押注的不再只是芯片,而是”芯片 × 模型格式 × 推理引擎”的整条栈。

4.4 结构性错配:繁荣与空转并存下的资本纪律

必须给扩产热情泼一盆冷水:中国算力的真实图景是”高端饥渴”与”低端空转”并存。浪潮人工智能研究院测算全国智算中心平均算力使用率仅约 30%,部分地方中心上架率不足 50%、已上架利用率不足 30%;财联社调研确认”一卡难求”与”利用率低于 40%“同时成立,根源是通用算力阶段性过剩与高端智能算力持续短缺的结构性错配 。与之对照,信通院数据显示 2026 年一季度国内 AI 算力需求同比暴涨 417%、供给增速仅 128%,中国算力租赁市场规模从 2024 年约 1480 亿元增至 2026 年预计超 2600 亿元 。

K3 的发布会同时加深这两端:一方面,2.8T 旗舰把需求进一步导向 64+ 卡高带宽域,加剧高端产能紧缺;另一方面,大量缺乏超节点架构、缺乏推理引擎运营能力、远离真实需求的存量智算中心,将更难承接新负载,资产贬值速度加快——“能跑 K3”与”不能跑 K3”将成为智算中心资产估值的分水岭。对运营商,这要求极强的资本纪律:新增 capex 集中于 HBM 总量大、互联带宽高、电力指标确定的整柜产能,同时通过异构调度、算力互联网与存量改造盘活低效资产。九大云厂商 2026 年合计资本开支预计 8300 亿美元、同比 +79%,五大厂待履行订单突破 2 万亿美元 ——在巨头军备赛里,二线运营商的胜负手不是”扩多少”,而是”扩得对不对”。

五、算力运营商行动框架:三情景推演与落地路线

5.1 三情景推演(2026H2–2027)

K3 对单个运营商的实际冲击,取决于三个变量:K3 及后续 3T+ 模型的需求兑现速度、超节点供给(HBM/整机柜)的释放节奏、以及 token 价格的下行斜率。三种情景下的策略重心截然不同。
情景

关键假设

对算力场/Token工厂的影响

策略重心

基准(概率最高)<o:page>

K3 复刻 K2.5 扩散曲线,托管需求 1–2 个季度内放量;token 价格年降 40–50%;B300/Rubin/950DT 如期放量

旗舰层毛利 50%+,超节点利用率 >85%;结构性紧缺持续

锁定整柜产能 + 建缓存工程壁垒 + 分层定价

乐观

Agentic 负载爆发超预期(token 增速维持 100%+);K3 生态成事实标准;国产 950 供货顺畅

高端产能全面售罄,租赁价格续涨;私有化大单涌现

激进扩产 + 签长约锁客 + 双供应链冗余

悲观

闭源下一代拉开代差或 K4/V5 快速迭代致 K3 资产贬值;token 价格战重启;宏观 capex 收缩

高价抢的超节点利用率不足,重资产减值

弹性租赁优先 + 控制单机柜敞口 + 保留模型切换能力(多模型栈)


无论哪种情景,K3 自身的局限也是风险源——思考历史敏感(Agent 框架必须完整回传思考内容)、任务中”过度主动”、以及与 Fable 5/GPT 5.6 Sol 的体验差距被官方明确列出 ;虎嗅实测也指出 max 档下单任务耗时接近一小时,速度是现实约束。旗舰模型的市场地位可能随一两个版本周期易手,运营商的资产必须”模型中立”。

5.2 技术与产品路线建议

集群设计:新增推理产能以 64+ 卡高带宽域为基本单元,优先 HBM 总量 ≥13TB、域内带宽 ≥1.8TB/s/卡 的整柜方案,为 Agentic 负载按 CPU:GPU 1:1 配置通用算力与内存池 。
引擎栈:第一时间跟进 vLLM 的 KDA prefix caching 实现,建立 PD 分离 + 分层缓存(HBM/LPDDR/SSD)架构,把缓存命中率作为核心 KPI(对标官方 90%)。
产品组合:旗舰层(K3/V4-Pro 托管与私有化总包)、主力层(GLM/Qwen/MiniMax 高并发 API)、长尾层(Flash 类填仓)三层定价;上线峰谷计费与缓存命中折扣。
能耗工程:新建产能全部按液冷设计(PUE ≤1.2),电力指标先于服务器采购锁定。

供应链策略:NVIDIA 与国产双线并行——海外/出海业务押 GB300 与 VR200 交付窗 ,国内业务深度绑定新一代国产卡生态并参与 K3 国产适配(参照 DeepSeek V4 的寒武纪 Day 0 模式),对 HBM、光模块(800G→1.6T 升级)、液冷等上游瓶颈件做 12 个月以上的锁量。

六、结论

Kimi K3 的 2.8 万亿参数,本质上是把开源模型的”能力前沿”和”部署门槛”同时推到了闭源旗舰的隔壁。对 AI 基础设施运营商,它带来的不是一次常规的需求增量,而是一次生产资料的标定:显存仍然成为第一稀缺资源,64+ 卡超节点取代 8 卡服务器成为基本生产单元,缓存工程能力取代裸卡规模成为毛利的第一解释变量,token 取代卡时成为标准计价单位。技术上,KDA 与 MXFP4 让百万上下文旗舰推理第一次具备可盈利的成本曲线;商业上,开源阵营的定价分层与权重分流把托管推理推向”效率制胜”的毛利拐点;资源上,HBM、电力指标与双供应链押注窗口在 2026 下半年交汇。

历史经验(K2.5 两周 16.3% 份额、DeepSeek 之后 H100 利用率跳升 10 个百分点) 表明,开源旗舰发布后 3–6 个月是产能卡位的黄金窗口。

7 月 27 日权重落地之时,竞赛正式开始。

这一次,卖的不再只是算力,而是把 2.8 万亿参数变成生产力的能力。


面对2.8T参数,超节点,就是新时代的无畏舰。


【声明】内容源于网络
0
0
巨硬的AI
在巨硬的时代,与AI浪潮奔涌向前
内容 29
粉丝 0
巨硬的AI 在巨硬的时代,与AI浪潮奔涌向前
总阅读279
粉丝0
内容29