AI推理扩容推动SSD从“大块数据搬运”向“高并发小块读取”转型。
数据中心NAND需求正因AI推理而呈现分化趋势。据TechInsights估算,2025年全球需求为286EB,至2031年将增至1686EB;其中推理需求将从86EB激增至1251EB,年复合增长率达56%,远超训练需求的11%。除容量增长外,模型在频繁调取KV Cache、上下文及检索结果时,要求SSD在极小I/O、极高并发及GPU直连环境下高效运行。存储竞争焦点已从单纯的数据容量,延伸至匹配GPU数据读取节拍的能力。
NAND增量需求由AI推理主导
2025年286EB的总需求中,传统数据中心负载占157EB,AI训练占43EB,AI推理占86EB。预计到2031年,推理需求将达1251EB,占总量的约四分之三,而传统负载和训练需求分别为354EB和81EB。尽管模型训练仍消耗大量NAND位元,但市场需求重心已明确从训练转向推理。
需注意,上述数据为市场预测而非实际出货量。其核心价值在于揭示了不同工作负载对存储的差异性需求:训练侧重于集中搬运大批量数据,而推理则面对持续请求,需反复调取上下文、缓存及外部知识,两者对存储读取节拍的要求截然不同。
SSD应用场景细分为四大方向
SSD并未因AI兴起而趋于同质化,而是根据应用场景分化为四个主要方向:面向GPU存储扩展的超高IOPS盘、复用KV Cache的高性能大容量盘、服务数据摄取和RAG(检索增强生成)的高容量QLC盘,以及规划中的低成本归档盘。
- 超高IOPS:面向NVIDIA Storage-Next架构,支持PCIe Gen6、XL-FLASH技术及512B细粒度访问。
- 高性能大容量:服务于KV Cache重复利用,强调PCIe Gen5接口和高预留空间TLC颗粒。
- 高容量:面向RAG数据摄取,重点优化QLC容量密度与每GB成本。
- 低成本归档:旨在替代HDD,采用低成本QLC技术,规划容量超过256TB。
该分层逻辑为采购和系统设计提供了清晰指引:若数据被反复、小块调取,应优先考虑随机读取性能、耐久度及队列管理;若数据以大批量写入并长期保存,则更关注容量密度与成本效益。
512B随机读考验系统并发能力
尽管GPU旁置的HBM速度极快,但受限于容量扩展性与成本。Kioxia演示材料将NVIDIA Storage-Next描述为GPU经NVMe/PCIe直接访问SSD的路径,目标包括支持GPU发起I/O、512B细粒度访问,以及实现约200M IOPS/GPU的性能,从而支持扩大10至100倍的数据集规模。
512B的小尺寸请求意味着不能仅凭单次读取延迟来衡量IOPS。假设目标为25M IOPS,即平均每40ns需完成一次I/O。若闪存单次读取耗时45微秒,系统需同时挂起1125个请求;即使读取时间优化至25微秒,也需625个请求并发执行。这里的40ns并非指闪存物理读取速度提升至40ns,而是大量在途请求交错完成后的整体输出节拍。
实现百万级IOPS需整机系统协同
高IOPS性能的实现依赖系统级配合。Kioxia模拟器进度显示,2025年8月单个GH200实例已生成140M IOPS;9月完成了可调延迟和遥测计数器等模型设备能力建设,后续阶段将转向SCADA应用与设备实验。资料指出,超过100M IOPS的行为分析需依托GH/GB系统,而传统x86架构GPU系统受限于CPU与GPU间带宽,难以产生同等量级的I/O。
上述记录反映的是厂商模拟器的测试进展,而非SSD产品的量产交付状态。这表明超高IOPS并非单一硬盘的孤立参数,GPU请求发起方式、PCIe链路带宽、软件排队机制及设备延迟记录等全链路因素,共同决定了标称性能能否转化为真实吞吐。
结语:SSD面临新的性能考核
TechInsights预测AI推理需求将持续推高数据中心NAND用量,56%的增速虽属市场预期,但SSD按数据访问方式分工的趋势已日益清晰。部分产品专注于低成本保存,部分承接KV Cache和检索任务,另有产品致力于将512B请求持续稳定地输送至GPU附近。在评估AI存储方案时,除容量外,还应重点关注I/O大小、并发深度、请求发起主体以及测试平台对上述条件的还原能力。

