大数跨境

Kimi K3暂停新订阅,国产AI最大危机:GPU接不住了

Kimi K3暂停新订阅,国产AI最大危机:GPU接不住了 ElephantMind.AIGC
2026-07-21
6
导读:当中国模型真的被用爆,国产算力能不能接得住。

模型发布周,产品侧突然「关闸」?7月19日晚,月之暗面Kimi发布说明称,自Kimi K3发布以来,用户请求量远超预期,过去48小时已经逼近现有集群承载极限。

为了保障已有订阅用户体验,Kimi决定暂停C端新用户订阅,将已有算力优先投入服务已订阅用户。官方同时表示,正在全速推进算力扩容,后续会逐步开放更多订阅名额。

太火了,所以先停售?不,不只是,Kimi K3这次爆的不是口号,是GPU。

暂停新订阅,Kimi不是第一个

时间线拉开看,这其实是AI产品进入规模化使用后的常见动作。

2023年OpenAI在DevDay后,也曾因为ChatGPT Plus需求暴涨,暂停新的Plus注册。当时的说法很直接:使用量超过了容量,需要先保障已有用户体验。

国内也有类似情况。

今年1月,智谱发布GLM Coding Plan限售公告称,随着GLM-4.7上线,GLM Coding Plan用户数高速增长,算力资源出现阶段性紧张;部分用户在调用高峰期遇到并发限流、模型速度变慢等问题。智谱随后将每日可销售量降至原来的20%,以便给老用户腾出更多算力。

所以智谱只是进入了一个AI产品迟早会遇到的阶段:

模型能力被市场验证之后,瓶颈会立刻从“有没有人用”,变成“算力够不够用”。

为什么偏偏是K3撞上推理墙

Kimi K3不是普通聊天模型的又一次更新。

公开报道显示,K3拥有约2.8万亿参数,被月之暗面称为目前最大规模的开放权重AI系统之一,主打长程编程、知识工作和复杂推理等任务。Reuters也提到,K3在编码和Agent风格任务上表现突出。这意味着它的高频使用场景,天然就比普通聊天更吃算力。

普通聊天可能是一问一答。

但Agentic Coding不是。

它要读项目、拆任务、理解上下文、修改多个文件、反复调试、继续追问,还可能接工具、跑流程、重新生成。

每多一轮交互,每多一段上下文,每多一次长任务执行,背后都是更高的Token消耗和更长的GPU占用。

所以K3暂停新订阅,不只是因为「用户多」。

更关键的是:

用户涌进来的场景,正好是最耗推理资源的场景。

这也是为什么官方后续提到,要把Kimi主权益和Kimi Code权益拆开,以便更精准匹配算力、保障体验。因为聊天、办公、写代码,本质上不是同一类负载。

一家公司如果把它们全塞进一个会员池里,爆火之后很容易出现一个问题:

轻量用户被重度编程用户挤占,老用户被新用户挤占,最后大家都觉得慢。

暂停新订阅,本质上是在给算力重新分层。

国内外评论都在看,但看的不是同一件事

国内讨论K3,最容易落到一句话:

是不是又一个DeepSeek时刻?

DeepSeek让外界看到的是:低成本、开放权重、推理效率,能不能打破闭源模型的溢价叙事。

Kimi K3这次更像是在回答另一个问题:

中国开放权重模型,能不能在编程和Agent主航道上进入第一梯队讨论。

海外媒体的关注点也很明显。AP报道把Kimi K3放在中美AI竞争的大背景下,强调它的需求暴涨、暂停新订阅,以及中国开放模型对美国AI公司的压力。Reuters则把Kimi K3的算力压力和中国AI公司在GPU获取上的限制放在一起看,认为这是DeepSeek、Z.ai等中国AI公司共同面对的现实约束。

也就是说,国内更关心:

它是不是证明国产模型又往前追了一步。

海外更关心:

中国模型既便宜又能打,会不会改变全球AI竞争格局。

但无论从哪边看,最后都会落到同一个现实问题:

模型可以突然爆火,GPU不会突然变多。

这也是国产GPU真正的窗口

K3暂停新订阅,最后一定会被市场读到国产GPU上。

因为当中国模型开始在能力上接近前沿,卡脖子的地方就会越来越清楚:

不是有没有模型,而是有没有足够稳定、足够便宜、足够好用的推理算力。

美国出口管制让中国AI公司获取先进GPU的难度持续存在。Reuters近期报道也提到,中国AI公司在追赶美国竞争对手时,仍面对GPU获取受限的问题。

同时,国产AI芯片也在加速推进。Reuters曾报道,华为新AI芯片在客户测试中反馈积极,字节跳动、阿里等大厂有下单计划,原因之一是兼容性和响应速度改善。

但国产GPU的机会不是「替代故事」本身,而是要在真实高并发推理里证明自己。

训练大模型是一种能力。

支撑Kimi、DeepSeek、智谱这类产品每天被大量用户调用,是另一种能力。

这要求的不只是芯片纸面参数,还包括:

算子支持、软件栈稳定性、集群调度、显存带宽、推理框架适配、开发者迁移成本。

已经有研究指出,在华为昇腾等非GPU AI加速器上部署大模型推理时,仍会遇到算子支持、并行稳定性、图编译、可观测性和生态碎片化等工程挑战。

所以K3这次给国产GPU带来的,不只是利好想象。

更像是一张考卷:

当中国模型真的被用爆,国产算力能不能接得住。

K3上线后暂停新订阅,不是一个小插曲。

它是一次压力测试。

测试的是Kimi的用户需求,测试的是月之暗面的推理调度,也测试的是中国AI产业下一阶段最硬的底座。

模型可以一夜爆火。

GPU队列不会。

参考来源

  • 月之暗面Kimi关于算力紧缺与暂停C端新用户订阅的公开说明
  • IT之家、第一财经、SCMP、AP、Reuters关于Kimi K3暂停新订阅与GPU压力的报道
  • 每日经济新闻、财联社关于智谱GLM Coding Plan限量发售的报道
  • OpenAI暂停ChatGPT Plus新注册相关公开报道
  • Reuters关于中国AI公司GPU获取限制、华为AI芯片测试与订单计划的报道
  • 关于非GPU AI加速器大模型推理工程挑战的公开研究

【声明】内容源于网络
0
0
ElephantMind.AIGC
深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
内容 20
粉丝 0
ElephantMind.AIGC 深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
总阅读189
粉丝0
内容20