大数跨境

AI SSD:大模型推理的存储范式转移

AI SSD:大模型推理的存储范式转移 量子位
2026-08-07
13
导读:算力、网络、内存与存储开始围绕每个Token协同

过去两年,AI 基础设施的竞争聚焦于 GPU 数量、算力、HBM 带宽及高速网络。然而,随着大模型迈向长上下文、复杂推理和多智能体阶段,决定系统有效 Token 产出的因素日趋复杂。

GPU 虽是算力底座,但其利用率愈发取决于模型权重、KV Cache 和 MoE 专家能否在正确时间抵达计算节点。若 KV Cache 无法复用导致重复 Prefill,或 MoE 权重未及时加载致使 GPU 空转,亦或推理状态过度占用 HBM 压缩并发空间,都将严重制约效率。

AI 基础设施正从“堆叠计算资源”转向"协同计算、网络、内存与存储数据路径"的新阶段。月之暗面的 Mooncake 与 NVIDIA 的 CMX 正是这一趋势的代表:前者将集群中的 CPU、DRAM、SSD 组织为可调度的 KV Cache 资源;后者在 Vera Rubin 架构中建立 Pod 级 Flash 上下文层。二者共同指向一个核心结论:推理状态已成为 AI 基础设施的一级资源,存储正式进入 Token 生成的实时主链路。

Mooncake:重构 KV Cache 为独立基础设施资源

Mooncake 的产业意义在于改变了大模型基础设施对“数据”的组织方式。传统架构中,KV Cache 随请求和 GPU 实例绑定,一旦缓存驱逐或迁移,已完成的 Prefill 计算即失效,导致长上下文场景下 GPU 资源浪费。

Moonshot AI 与清华大学提出的 Mooncake 架构(USENIX FAST '25)采用以 KV Cache 为中心的分离式设计:

  • 资源池化:将 Prefill 与 Decode 部署在不同资源池,把集群中闲置的 CPU、DRAM、SSD 和 NIC 组织成分布式 KV Cache 池。
  • 全局调度:中心 Conductor 综合缓存分布、命中率及 TTFT/TBT 目标,动态决定缓存复用与任务调度。
  • 异步流转:可复用的 Prefix KV Cache 先行送达,新增 KV Cache 随计算生成并异步流送,待缓存就绪后进入连续批处理。
Mooncake 以 KV Cache 为中心的分离式推理架构

该思路被概括为"用更多存储换取更少计算"。数据显示,Mooncake 在真实场景下将有效请求承载能力提升 59% 至 498%,生产系统日均处理超千亿 Token。更关键的是,其官方文档明确将 DRAM 与 SSD/NVMe 纳入多级缓存体系,支持内存向 SSD 卸载及回读。这意味着 SSD 不再仅是启动文件源,而是成为受 TTFT、吞吐与服务 SLO 共同约束的推理数据层

CMX:NVIDIA 定义 HBM 与共享存储间的"G3.5"层

Agent 时代使单次请求演变为包含工具调用、记忆检索的长链路,KV Cache 需跨节点共享复用。NVIDIA 在分层存储体系中(G1-HBM、G2-内存、G3-本地 SSD、G4-持久化存储)发现,G1-G3 容量受限而 G4 延迟过高,难以满足频繁 Decode 需求。

为此,NVIDIA 推出CMX Context Memory Storage Platform,在二者之间增加"G3.5"层:通过以太网连接、以 Flash 为介质的 Pod 级上下文内存。它专为承载短暂、延迟敏感的推理上下文设计,而非替代长期持久化存储。

BlueField-4 构建统一 AI Factory 数据路径

CMX 并非简单外挂 SSD,而是通过 Dynamo KV block manager、DOCA Memos、BlueField-4 DPU 及 Spectrum-X 以太网实现深度协同。系统可提前将 KV 块从 CMX 预置到内存或 HBM,减少 GPU 等待。据称,CMX 可在单 Pod 内提供 PB 级共享上下文容量,能效比传统方案最高提升 5 倍。这标志着Flash 已被定义为 AI 推理内存体系的正式一层

AI Infra 变革倒逼 SSD 技术演进

将 SSD 纳入推理链路,对设备提出了严苛要求。LLM 推理需要严格时序约束的数据供应,而传统 SSD 的写放大、尾延迟及逻辑布局未必匹配模型执行次序。若数据未能在计算窗口内到达,GPU 仍将停滞。

因此,AI SSD 需解决两大核心问题:一是提供低延迟、高耐久且尾延迟稳定的介质能力;二是通过主控、固件与运行时协同,主动参与数据分层与预测式预取。当前市场产品分化为两类:

  • AI 负载强化型企业级 SSD:如英韧科技洞庭-N3X(面向 KV Cache 卸载)和华为 OceanDisk LC 560(承载模型与向量数据),重点优化 I/O 供给。
  • 推理参与型 AI SSD:试图让 SSD 从被动响应走向主动管理模型权重与缓存。
图片为 AI 生成

三条推理参与型技术路线

群联:专用缓存 SSD 扩展显存空间

群联 aiDAPTIV 方案由专用缓存 SSD、中间件及工具链组成。当模型权重超出 VRAM 时,系统将数据切分并在 SSD 与 VRAM 间流式搬运,仅保留活跃数据在 GPU 附近。该方案特点在于边界清晰:专用高耐久盘负责容量,中间件负责交换,适合单机或小型集群快速部署,其缓存盘耐久性最高达 100 DWPD。

江波龙:SPU 实现存储侧智能调度

江波龙强调主控自身的处理能力,架构包含硬件执行层 SPU 与软件决策层 iSA。iSA 感知负载制定策略,SPU 执行压缩、缓存与搬运。其 WM8500 SPU 引入存内无损压缩与混合 NAND 调度,体现"存储侧智能化",主要面向 AI PC 及端侧设备。

寅谱 - 联芸:从 AI Infra 反向定义数据路径

寅谱(Infplane)与联芸(Maxio)的组合独具特色。寅谱以 AI Native 身份切入,从推理芯片与系统协同出发,将计算侧调度延伸至 SSD。该方案贯通计算缓存、中间件、固件与 NAND 管理,围绕 MoE 专家、KV Cache 及数值精度进行数据切分与预取。

图片为 AI 生成

寅谱不把 SSD 视为孤立设备,而是云边端推理数据路径中的可调度层级。虽然软硬件协同范围广、研发成本高,但能更精准匹配模型执行过程。联芸已提出主控将从“数据通道”跃迁为面向 Token 成本的智能调度器。

存储侧推理参与型 AI SSD 探索路线对比

结语:AI SSD 竞争即完整数据路径之争

群联、江波龙与寅谱 - 联芸代表了三种不同的切入视角:显存扩展、存储侧智能与算存协同。三者并非替代关系,而是适用于不同场景的互补方案。

长远来看,AI SSD 的门槛不在于单一峰值性能,而在于能否建立从 NAND 介质、FTL、固件到推理框架的完整协作体系。Mooncake 与 CMX 证明了推理状态需单独调度,而 AI SSD 将这一变革深入至节点内部。未来的基础设施将形成更细致的存储层级:热数据驻留计算芯片,温数据进入高性能 Flash,冷数据下沉至大容量层,由软硬协同决定迁移时机。

当产业从模型竞赛转向大规模应用,核心指标将是每瓦电力生成的有效 Token 数及上下文复用效率。在此进程中,算力、网络与存储的边界日益模糊,AI SSD 正从外围设备迈向 AI 基础设施的核心数据路径。

参考文献
[1] R. Qin et al., "Mooncake: Trading More Storage for Less Computation," USENIX FAST '25, 2025.
[2] Mooncake Project, Official GitHub Repository & Documentation, 2026.
[3] NVIDIA, "Introducing NVIDIA BlueField-4-Powered CMX," 2026.
[4] 英韧科技、华为、群联、江波龙、联芸科技等相关技术白皮书与发布资料,2025-2026.

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16366
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读366.4k
粉丝1
内容16.4k