大数跨境

深度解读:智谱为什么要在 Infra 层搞 RSI?

深度解读:智谱为什么要在 Infra 层搞 RSI? AI科技评论
2026-09-18
3
导读:电话会揭秘智谱策略,以递归式优化跑赢300亿算力成本战。
电话会揭秘智谱策略:以递归式优化跑赢 300 亿算力成本战。

    作者丨高允毅

    编辑丨岑   峰

9 月 17 日,智谱 AI 创始人唐杰罕见发布长文,深入剖析行业热点RSI(递归自我改进)。智谱已将 RSI 战略下沉至基础设施(Infra)层面,构建了一套由 GLM-5.3 驱动的推理系统。正是这套系统,助力匿名模型 Ox-Alpha(即 GLM-5.3-Flash)在发布首周迅速成为全球使用最广泛的模型之一,六天内处理 Token 量超 62 万亿。
更具里程碑意义的是,上述成就完全基于十万张国产芯片集群实现。面对国产芯片生态薄弱、算子兼容难、通信复杂及硬件故障频发等挑战,智谱仅用两周时间便完成从全量跑通到真实生产流量切换。通过软件极致优化“打补丁”,智谱不仅攻克了硬件短板,更将端到端吞吐量提升了3.2 倍
智谱的核心判断在于:在算力受限背景下,中国 AGI 突破的关键不在于芯片数量,而在于通过软件高效调动算力。智谱试图借助 RSI 建立“底层解耦”能力,让 AI 自主适配不同硬件生态,将“国产算力不好用”的行业难题转化为"AI 自动挖掘硬件极限”的技术主动权。
唐杰感慨:“我们距离 RSI 终局尚远,但‘模型优化系统、系统反哺模型’的最小循环已真实转动。”

01 十万张国产芯片集群:一场没有参考答案的部署硬仗

在十万张国产芯片上部署大模型面临三大核心挑战:
首先,硬件先天限制。国产芯片内存与数据传输速度有限,无法直接照搬英伟达成熟方案。
其次,软件栈不成熟。底层组件缺失,缺乏运维手册与关键算子实现,大量文档需靠推测验证。
最后,模型负载极限。GLM-5.3-Flash 需同时处理图文及百万级 Token 上下文,KV 缓存压力呈几何级增长。
智谱的解法是以 GLM-5.3 驱动的 Infra Agent 融合多项关键技术,以软件工程补硬件短板:
用通信换内存:采用“节点内张量并行”与“层分割”,拆分模型并让多卡分担核心计算。
用计算换内存:开启 ReplaySSM 策略,内存不足时丢弃数据,需用时现场重算,以极短计算时间换取宝贵空间。
用精度换容量:采用 W8A8 量化压缩权重与激活,并对 KV 缓存动态混用 INT8、FP8、BF16 三种精度,极致利用显存。
此外,通过将编码、预填充、解码三阶段彻底解耦,配合 Infra Agent 快速迭代,国产芯片利用率及单 Token 成本已逼近英伟达水平。
然而,Infra Agent 常因“稀疏反馈”陷入停滞:系统仅反馈结果(如吞吐量下降),却未指明根源(代码、内存或网络)。传统优化工具分散,依赖工程师直觉,试错成本极高。
智谱旨在量化“工程直觉”,构建精准、低成本且可验证的反馈机制。未来大厂差距将取决于“模型参与构建自身系统的深度”,谁能率先跑通闭环,谁就能在物理算力受限下实现非线性超车。
对此,智谱提出“密集反馈”(Dense Feedback)分层验证体系。

02 密集反馈:AI 版 Infra 工程师

智谱将“密集反馈”拆解为正确性反馈、系统行为反馈、性能反馈,分别解决“算得对不对”、“卡在哪一步”及“哪种解法最优”三大底层问题。
以下三个案例展示了人类工程师的直觉如何被编码为 AI 能力:

▎案例一:长上下文精度漂移(正确性反馈)

长上下文分片计算易导致“精度漂移”。智谱将排查逻辑沉淀为正确性反馈体系,AI 能精准定位 KDA 内核默认精度导致的舍入误差累积,并自动匹配高精度组合算法解决问题。

▎案例二:KV 传输并发瓶颈(系统行为反馈)

针对预填充阶段计算与通信未重叠导致的性能损耗,智谱构建了“系统行为反馈体系”。AI 如同拥有“全链路 X 光机”,自动拉取执行时序,标记异常时间片,跨语言边界追踪锁状态,并给出修复方案。原本需数天解决的并发问题,现仅需数秒。

▎案例三:解码内核冗余计算(性能反馈)

针对解码内核中“为了并行而并行”导致的冗余计算,智谱建立了“优化模板库”配合性能反馈。AI 自动判断瓶颈,从库中匹配 SGLang、Flash Linear Attention 等项目的通用优化骨架重构代码,并将成功经验反哺库中,形成复利效应。
Infra 的 RSI 愿景是:AI 工程师具备资深系统诊断能力,高效执行底层优化;人类工程师聚焦风险把控与业务决策,推动 Infra 系统演变为高速运转的流水线。

03 从“卖工具”到“卖效率”:被订单倒逼出的 RSI

智谱今年战略转向底层 Infra,源于市场需求爆发带来的算力危机。GLM-5 发布后调用量暴增 10 倍,主力产品 Coding Plan 曾因算力耗尽被迫停售。
面对困局,智谱选择"All-in-Infra"并收购中科加禾,将算力效率提升 2-3 倍。高层明确:算力是核心增长约束,有多少算力就能变现多少收入。7 月融资到位后,Coding Plan 重启销售,销量激增 15 倍,验证了这一逻辑。
智谱算过一笔账:若投入 300 亿元构建算力(40% 训练、60% 推理),凭借 GLM-5.3 高达 80% 的毛利率,年营收可达 400 亿元,一年即可收回成本并覆盖研发费用。保守投入只会导致研发受阻与订单流失,规模化扩张是唯一出路。
为此,智谱布局三层战略:
第一,建设 1GW 级超大算力数据中心。解决算力供给问题,并通过全国产芯片控制成本,确保长期自主可控。
第二,推行云分成模式。将开源模型转为云货架商品,与海内外云厂商签署分成协议,以轻资产模式实现全球分发与变现。
第三,深耕企业级 Co-work 赛道。GLM-5.3 已在网络安全场景率先跑通,接入百家安全企业。面对数千亿美元的信息安全市场,智谱拥有巨大想象空间。
归根结底,智谱重投 Infra 是 Coding 需求爆发后的必然延伸,也是其在算力受限时代破局的关键。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8963
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读248.6k
粉丝0
内容9.0k