模型发布周,产品侧突然「关闸」?7月19日晚,月之暗面Kimi发布说明称,自Kimi K3发布以来,用户请求量远超预期,过去48小时已经逼近现有集群承载极限。
为了保障已有订阅用户体验,Kimi决定暂停C端新用户订阅,将已有算力优先投入服务已订阅用户。官方同时表示,正在全速推进算力扩容,后续会逐步开放更多订阅名额。

太火了,所以先停售?不,不只是,Kimi K3这次爆的不是口号,是GPU。
暂停新订阅,Kimi不是第一个
把时间线拉开看,这其实是AI产品进入规模化使用后的常见动作。
2023年OpenAI在DevDay后,也曾因为ChatGPT Plus需求暴涨,暂停新的Plus注册。当时的说法很直接:使用量超过了容量,需要先保障已有用户体验。
国内也有类似情况。
今年1月,智谱发布GLM Coding Plan限售公告称,随着GLM-4.7上线,GLM Coding Plan用户数高速增长,算力资源出现阶段性紧张;部分用户在调用高峰期遇到并发限流、模型速度变慢等问题。智谱随后将每日可销售量降至原来的20%,以便给老用户腾出更多算力。
所以智谱只是进入了一个AI产品迟早会遇到的阶段:
模型能力被市场验证之后,瓶颈会立刻从“有没有人用”,变成“算力够不够用”。
为什么偏偏是K3撞上推理墙
Kimi K3不是普通聊天模型的又一次更新。
公开报道显示,K3拥有约2.8万亿参数,被月之暗面称为目前最大规模的开放权重AI系统之一,主打长程编程、知识工作和复杂推理等任务。Reuters也提到,K3在编码和Agent风格任务上表现突出。这意味着它的高频使用场景,天然就比普通聊天更吃算力。

普通聊天可能是一问一答。
但Agentic Coding不是。
它要读项目、拆任务、理解上下文、修改多个文件、反复调试、继续追问,还可能接工具、跑流程、重新生成。
每多一轮交互,每多一段上下文,每多一次长任务执行,背后都是更高的Token消耗和更长的GPU占用。
所以K3暂停新订阅,不只是因为「用户多」。
更关键的是:
用户涌进来的场景,正好是最耗推理资源的场景。
这也是为什么官方后续提到,要把Kimi主权益和Kimi Code权益拆开,以便更精准匹配算力、保障体验。因为聊天、办公、写代码,本质上不是同一类负载。
一家公司如果把它们全塞进一个会员池里,爆火之后很容易出现一个问题:
轻量用户被重度编程用户挤占,老用户被新用户挤占,最后大家都觉得慢。
暂停新订阅,本质上是在给算力重新分层。
国内外评论都在看,但看的不是同一件事
国内讨论K3,最容易落到一句话:
是不是又一个DeepSeek时刻?
DeepSeek让外界看到的是:低成本、开放权重、推理效率,能不能打破闭源模型的溢价叙事。
Kimi K3这次更像是在回答另一个问题:
中国开放权重模型,能不能在编程和Agent主航道上进入第一梯队讨论。
海外媒体的关注点也很明显。AP报道把Kimi K3放在中美AI竞争的大背景下,强调它的需求暴涨、暂停新订阅,以及中国开放模型对美国AI公司的压力。Reuters则把Kimi K3的算力压力和中国AI公司在GPU获取上的限制放在一起看,认为这是DeepSeek、Z.ai等中国AI公司共同面对的现实约束。
也就是说,国内更关心:
它是不是证明国产模型又往前追了一步。
海外更关心:
中国模型既便宜又能打,会不会改变全球AI竞争格局。
但无论从哪边看,最后都会落到同一个现实问题:
模型可以突然爆火,GPU不会突然变多。
这也是国产GPU真正的窗口
K3暂停新订阅,最后一定会被市场读到国产GPU上。
因为当中国模型开始在能力上接近前沿,卡脖子的地方就会越来越清楚:
不是有没有模型,而是有没有足够稳定、足够便宜、足够好用的推理算力。
美国出口管制让中国AI公司获取先进GPU的难度持续存在。Reuters近期报道也提到,中国AI公司在追赶美国竞争对手时,仍面对GPU获取受限的问题。
同时,国产AI芯片也在加速推进。Reuters曾报道,华为新AI芯片在客户测试中反馈积极,字节跳动、阿里等大厂有下单计划,原因之一是兼容性和响应速度改善。
但国产GPU的机会不是「替代故事」本身,而是要在真实高并发推理里证明自己。
训练大模型是一种能力。
支撑Kimi、DeepSeek、智谱这类产品每天被大量用户调用,是另一种能力。
这要求的不只是芯片纸面参数,还包括:
算子支持、软件栈稳定性、集群调度、显存带宽、推理框架适配、开发者迁移成本。
已经有研究指出,在华为昇腾等非GPU AI加速器上部署大模型推理时,仍会遇到算子支持、并行稳定性、图编译、可观测性和生态碎片化等工程挑战。
所以K3这次给国产GPU带来的,不只是利好想象。
更像是一张考卷:
当中国模型真的被用爆,国产算力能不能接得住。
K3上线后暂停新订阅,不是一个小插曲。
它是一次压力测试。
测试的是Kimi的用户需求,测试的是月之暗面的推理调度,也测试的是中国AI产业下一阶段最硬的底座。
模型可以一夜爆火。
GPU队列不会。
参考来源
-
月之暗面Kimi关于算力紧缺与暂停C端新用户订阅的公开说明 -
IT之家、第一财经、SCMP、AP、Reuters关于Kimi K3暂停新订阅与GPU压力的报道 -
每日经济新闻、财联社关于智谱GLM Coding Plan限量发售的报道 -
OpenAI暂停ChatGPT Plus新注册相关公开报道 -
Reuters关于中国AI公司GPU获取限制、华为AI芯片测试与订单计划的报道 -
关于非GPU AI加速器大模型推理工程挑战的公开研究

