在美国长期限制高端 GPU 算力的背景下,国产大模型如何确保持续训练?彭博社最新披露,智谱 AI 已建成一座 1GW 级别的数据中心并部分投入运营。该中心全量采用国产 AI 芯片,主要服务于 GLM 系列模型研发。此外,智谱还运营着多个万卡计算集群,单集群芯片规模超万颗。
1GW 供电规模约可满足 75 万户家庭用电,标志着该数据中心跻身中国 AI 实验室及独立模型企业建设的最大型算力基础设施行列。尽管具体芯片型号与供应商暂未公开,但智谱在算力上下游的布局动作频频。
据悉,智谱已斥资数亿元收购国产异构算力软件公司“中科加禾”。该公司源自中科院计算所,核心能力覆盖编译器、虚拟指令集及推理引擎,旨在解决不同国产芯片的高效运行问题。更早之前,The Information 披露智谱正与国内芯片设计公司接触,评估合作开发定制 AI 芯片的可能性。
综合来看,智谱正试图构建一套完全脱离英伟达体系的算力基础设施:自建数据中心保障资源稳定,收购软件公司优化异构算力效率,自研定制芯片则指向长期推理成本的优化。与此同时,DeepSeek 等独立模型企业也在推进类似布局,从单纯的算力购买者逐步转变为运营者与定义者。
三线并进:重构算力产业链
智谱的三大动作分别对应算力产业链的三个关键层级。
底层:物理算力供给自主化
过去,独立模型公司依赖云厂商或第三方服务商获取 GPU 资源,虽前期投入轻,但供应稳定性与扩容速度受制于人。1GW 国产数据中心的投运,意味着智谱获得了更大规模、更稳定的长期资源池,能够持续支撑模型预训练、后训练及大规模推理需求。
中层:异构算力软件适配
国产芯片架构各异,模型迁移需重新适配调优。中科加禾的核心价值在于通过虚拟指令集、编译器和 Runtime,为龙芯、昇腾等不同硬件提供统一软件接口,降低迁移成本。
其 SigInfer 推理引擎宣称可显著降低时延并提升吞吐率。即便部分性能提升得以兑现,也将极大优化智谱的 Token 算力成本,将分散的理论算力转化为有效算力。
上层:芯片设计定制化
相比训练,推理负载更稳定,适合定制芯片专项优化。智谱虽未披露具体合作细节,但其战略意图明确:不再让模型被动适应现有芯片,而是推动未来芯片架构主动适配 GLM 模型负载,以实现极致能效。
算力承压:规模扩张下的必然挑战
智谱密集补齐底层设施,直接动因是模型调用量激增导致的基础设施承载极限。
今年初,GLM Coding Plan 用户快速增长引发并发限流;3 月 GLM-5 上线后,Coding Agent 日均调用量达数亿次。由于该类任务涉及长上下文与复杂工具调用,对推理系统压力呈量级增长,甚至导致部分用户感知到模型输出质量下降(如乱码、复读)。
经排查,问题根源在于高负载下的推理状态管理(如 KV Cache 错配)。这表明模型能力不仅取决于参数规模,更受推理系统性能制约。类似的高并发挑战也出现在 Kimi 和 Qwen 等新模型身上,多家企业被迫采取限流或暂停新用户订阅措施以保障服务稳定性。
链条上探:商业模式与成本博弈
大模型公司的边际成本随用户量线性增长,收入增加并不意味着利润率改善。智谱 2025 年营收同比增长 131.9%,但销售成本同比激增 213.3%,主要源于计算服务费的大幅增加。全年净亏损扩大至 47.18 亿元,研发支出中相当比例用于支付第三方算力费用。
长期依赖外部供应商将使企业受制于资源排期与价格波动。自建数据中心虽面临巨额初始投资与运维风险,但在规模效应下,能在供应确定性、软硬协同与成本控制之间找到更优平衡。控制算力已成为模型企业持续扩大的关键。
政策层面,国家正推动“全国一体化算力网”建设,相关补贴深入至实际采购环节,并要求新建数据中心优先使用国产 AI 芯片。这意味着国产芯片将从零散试点进入长期、成规模的基础设施采购体系,为大模型企业的自主创新提供坚实底座。
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

