大数跨境

英伟达HBM告急!下一代GPU受限,这块硬盘却抢走风头

英伟达HBM告急!下一代GPU受限,这块硬盘却抢走风头 新智元
2026-08-10
7
导读:存储不再只是仓库,而是会思考的底座。

新智元报道

当加密、压缩、索引、记忆和上下文服务靠近介质,SSD、DRAM、HBM 与 HBF 的价值边界将被重新划分。

AI Agent 正将计算机从“单次模型调用”转变为持续观察、推理、调用工具并保留状态的运行系统。任务执行涉及模型、记忆、向量索引及业务数据库的连续访问,并将执行轨迹与用户偏好实时写回。Agent 运行时间越长,其价值越依赖于数据的安全保存、正确检索与低成本复用。

这意味着存储不再仅是数据落盘的终点,而是深入 Agent 的感知、记忆和决策循环。AI SSD 已率先展示方向:保存模型与 Adapter,承接被逐出内存的 KV Cache,缩短冷启动并扩大部署容量。未来,SSD 还将在数据落盘时执行加密、压缩、去重、索引及生命周期治理,为 Agent Memory 提供长期支撑。

这种演变基于自加密盘、计算存储标准及 Samsung SmartSSD 等技术积累。Agent 时代的新意在于,这些能力围绕智能体身份、上下文、记忆及 Token 成本进行重组。未来市场可能出现“安全 SSD"、“检索 SSD"或“记忆 SSD"等功能型产品,或通过可编程方式在标准存储上层按场景调用设备功能。

NVMe 已形成 Computational Programs 等命令集,为设备侧程序执行提供标准化路径。产业核心问题不再是盘内是否放置处理器,而是由谁定义数据语义、功能边界及端到端结果。

Agent 不是一次调用,而是一条持续写入的数据链

传统聊天机器人主要持久化对话记录,而 Agent 构建的是更复杂的数据图,涵盖观察结果、工具输出、计划反思、任务状态、用户画像及执行日志等。模型侧还会产生 KV Cache、Prefix Cache、Adapter 及 Checkpoint。不同对象的更新频率与安全等级各异,共同决定后续推理的连续性。

Agent Memory 并非简单地将历史对话存入向量数据库。研究显示,其应包含表示与存储、信息提取、检索路由及维护四个模块,且无单一架构能适配所有负载。Mem0 等系统强调将原始对话转化为紧凑、可复用的长期记忆,以降低 Token 消耗。因此,存储层需同时保存内容及其组织、更新和遗忘机制。

Agent 数据落盘需要比“写成功”更丰富的契约。记忆对象应携带身份、租户、来源、版本、权限及保留期限等元数据;模型上下文需绑定模型版本与 Tokenizer。只有明确命名空间和生命周期,后续的压缩、索引与缓存才不会破坏语义边界。

功能型 SSD 的角色是在 Runtime 给出策略后,靠近数据执行确定性工作:按租户选择密钥、按生命周期放置数据、执行压缩去重、维护索引页,并反馈尾延迟与介质健康。语义决策留在 Agent 和 Runtime,数据执行尽量靠近介质。

图 1 Agent 时代功能型 SSD 的能力谱。安全、内容缩减、索引、记忆、推理上下文与治理功能可固化在设备,也可由可下载程序、Runtime 与存储节点共同完成。(参考 SNIA 及 NVMe 规范)

核心判断Agent 时代的 SSD 升级不是简单增加盘内算力,而是组合标准块设备、近数据功能、对象语义和生命周期治理。越靠近介质的功能越应确定、可审计、可隔离;越靠近模型的决策越应保留在 Runtime。

自动加密已经存在,变化在于策略开始跟随 Agent

自加密盘已通过控制器硬件实现透明的数据静态保护。对 Agent 系统而言,新要求是将加密粒度细化到用户、Agent、任务和对象级别,确保同一设备上个人记忆与应用缓存互不越权,云侧多租户共享上下文权限清晰。

NVMe 规范引入的 Key Per I/O 等能力为细粒度安全提供了基础。未来的安全型 SSD 还将整合数据来源、时间戳、访问记录及可信删除功能,使 Agent 不仅能回答“记得什么”,还能追溯“记忆来源、修改情况及删除时间”。这对金融、医疗及企业知识库至关重要。

加密顺序也影响其他功能。由于加密后字节流难以压缩,内容缩减通常应先于加密执行;索引则需区分明文特征与受保护元数据。功能型 SSD 的竞争力在于能否用可验证的流水线正确组织压缩、索引、加密与删除,避免扩大攻击面。

压缩、索引与记忆维护,可能成为下一批 SSD 功能

压缩是易形成商业闭环的功能。Agent 反复写入的文本、JSON、日志及向量等具有结构重复性。若在数据进入网络或 NAND 前完成压缩,可减少传输、物理写入及能耗。但需综合衡量压缩比、时延与写放大,对已量化的模型权重继续压缩收益有限。

索引功能直接关系记忆召回价值。KIOXIA AiSAQ 展示了将向量与索引结构置于 SSD 上,以降低 DRAM 占用并实现大规模检索。产业路径更可能是 GPU/NPU 负责生成表示,SSD 与近数据程序负责组织索引、过滤候选并返回结果集,而非普通 SSD 自动生成 Embedding。

记忆维护更为复杂,涉及新增、合并、冲突处理及遗忘机制。未来的“记忆 SSD"可提供原子更新、TTL 及安全删除,但记忆质量仍取决于上层的提取、路由与评估。产品层面,压缩、加密等确定性工作适合专用电路,而 Embedding、重排序等则由主机或加速器完成。关键在于用统一对象 ID 连接两类工作,减少数据搬运。

端侧:SSD 可能成为个人 Agent 的长期状态层

端侧 Agent 持续接触个人文档、照片及应用状态。统一内存仅适合当前工作集,SSD 则可保存更大的本地模型库、向量索引及个人记忆。只要保持标准 NVMe 形态,功能型 SSD 可作为普通系统盘安装,再通过驱动逐步开启安全与索引能力。

其对消费者的价值在于让本地 AI 记得更久、支持弱网工作并减少云端上传。会议、编程及家庭 Agent 可将状态留在设备附近,由 Router 根据隐私与功耗决定本地处理或云端调用。端侧市场可能扩展为小型存储节点,为多设备提供本地模型镜像与加密归档,商业模式将从容量销售延伸至 AI PC 溢价与私有 AI 节点服务。

需注意,本地存储不等于隐私。若应用可任意读取记忆或缺乏可验证删除,功能越多攻击面越大。端侧功能型 SSD 必须将应用隔离、用户同意及设备遗失后的密钥吊销作为核心产品能力。

云侧:SSD 会从设备走向 Agent 存储节点

云侧 Agent 状态规模更大且需共享。节点本地 SSD 保存模型与高频索引,机架级 Flash 层承接跨 GPU 复用的 KV 与共享记忆,对象存储保存冷态数据。Mooncake 与 NVIDIA CMX 等系统已将 SSD 组织为分布式 KV Cache 池或 POD 级上下文层,表明“存储节点参与 Token 生产”正成为基础设施。

下一代 Agent 存储节点将同时提供上下文、记忆和治理服务,维护共享 Prefix 目录、预热模型、记录证据链,并向调度器暴露命中率与能耗指标。客户购买的不仅是容量带宽,更是 GPU 利用率、SLO goodput 及审计响应速度

商业模式随之改变:单盘按容量销售,存储节点则以多盘 Appliance、Runtime 授权及 SLA 组合收费,甚至出现按有效 Token 计费的服务。功能型 SSD 的价值边界已从半导体器件扩展至数据基础设施。

图 2 端侧与云侧 Agent 存储的典型分工。端侧强调个人数据与隐私控制;云侧强调共享上下文与 Token 经济学。(参考 Mooncake 与 CMX)

HBM、HBF、DRAM 与 SSD 的价值边界将被重新划分

Agent 带来的存储重构并非 SSD 取代内存,而是分层协作。SK hynix 提出的 Tiered Memory 思路,是按速度、容量和成本连接 HBM、DRAM、NAND/HBF 与 SSD,以减少数据移动。

HBM 仍是最接近 GPU 的核心层,承载当前权重与热 KV,指标是 Token/s 与带宽。Agent 的长上下文需求将进一步推高 HBM 价值,系统需将非即时数据移至低成本层并准确预热。

HBF(High Bandwidth Flash)是新形成的层级,采用 UCIe 连接处理器,容量可达 512GB,带宽分级明确。其目标是在 HBM 与 SSD 之间承接读密集的大型推理工作集。H3 研究建议将只读数据放在 HBF,频繁更新数据保留在 HBM,二者构建混合推理系统。HBF 更可能是 HBM 的补充而非替换。

DRAM 与 CXL 处于中间地带,承担可变状态与共享容量,通过池化减少内存孤岛。功能型 SSD 则承担更大、更持久的温冷对象,如模型、向量索引及 Agent Memory。未来竞争将围绕谁能在正确期限内交付正确对象,并为有效 Token 与数据治理负责。

图 3 Agent 时代各存储介质的重新分工。HBF 规格参考 SK hynix 与 Sandisk 开放标准;分层逻辑参考 FMS 2026 及 CXL 资料。

AI SSD 是功能型 SSD 的第一批产业样本

现有 AI SSD 从两端切入:一是强化型企业级 SSD,如英韧洞庭 N3X 与华为 OceanDisk LC 560,为模型缓存与向量索引提供稳定介质底座;二是主动参与推理数据路径,识别模型权重与 KV Cache 等 AI 对象。群联、江波龙和寅谱—联芸代表了三种研发方向。

群联 aiDAPTIV 采取“成熟 SSD 能力+中间件”方案,通过 Link 管理显存与 Flash,将非活跃权重卸载至 SSD 并保存被逐出的 KV Cache。其优势在于兼容既有生态,快速交付可部署方案。

江波龙 SPU+iSA 侧重“存储执行层+软件决策层”,由 SPU 执行无损压缩与数据调度,iSA 负责 MoE 专家卸载与预取决策。该路线旨在减少 DRAM 占用,使存储侧处理与端侧推理节奏匹配。

寅谱—联芸采取计算与存储联合定义路线,从模型结构与 Runtime 需求反推控制器命令与介质布局。这种跨域协同能更早发现数据路径问题,形成新的设备接口。

三条路线互补:群联擅长产品化,江波龙强化设备侧执行,寅谱—联芸深耕系统协同。它们共同推动 AI SSD 从“更快的盘”转向“职责重新划分”。未来,随着软件能向设备表达对象类型与生命周期,SSD 将承载更多确定性功能,收入模式也将扩展为 Runtime 授权与数据服务。

需警惕概念扩张:自动压缩不等于万能,盘上索引不等于理解语义。每种功能都需由端到端指标证明,包括压缩比、召回率、P99 延迟及最终的 Token 成本效益。

图 4 AI 负载强化型企业级 SSD 代表产品:英韧科技洞庭 N3X 与华为 OceanDisk LC 560。

图 5 推理参与型 AI SSD 探索:群联 aiDAPTIV、江波龙 SPU+iSA,以及寅谱—联芸 AI SSD 方案。

图 6 AI SSD 在 LLM 推理路径中的作用及主要厂商技术路线。

未来产业可能沿三条方向同时展开

第一,SSD 功能化。通用盘继续存在,但安全、压缩、检索等功能将以固化或软件定义方式进入产品,形成可发现、可组合的功能框架。

第二,存储节点化。单盘解决本机容量,AI 存储节点则组合多盘、网络与对象目录,对端到端 SLO 负责。竞争单位将从“每块盘”扩展为“每个站点交付的有效 Token 和检索请求”。

第三,内存层级重组。HBM 追求最高带宽,HBF 提供封装附近的大容量,DRAM 与 CXL 承担可变状态,功能型 SSD 提供持久对象与近数据服务。最有价值的系统能力是让 Router 和 Runtime 协同多个层级,而非堆叠单一介质。

这将重塑产业壁垒:介质厂商掌握能效,控制器厂商决定功能落地,Runtime 平台掌握语义调度,系统集成商决定产品形态。能够跨越边界、建立标准并用 Token 经济学证明价值的企业,将把 SSD 推向 Agent 时代的基础数据层。

结语:存储将成为 Agent 能力的一部分

AI Agent 让存储价值从“保存过去”扩展到“支撑行动”。模型需要权重,推理需要上下文,Agent 需要长期记忆与可信证据。加密、压缩、索引等服务越靠近数据,越能减少搬运与重算,但也越需明确权限与责任边界。

AI SSD 只是起点。未来将出现更多带特定功能的 SSD 或统一的可编程功能型 SSD。HBM、HBF、DRAM、CXL 与 SSD 将围绕热度、可变性与访问期限重新分工。真正的机会在于将每种介质优势转化为更低的 Token 成本、更高的 Agent 连续性及更可信的数据生命周期。

参考资料:

[1] NVIDIA, "Scaling Agentic AI Factories Through Extreme Co-Design with NVIDIA BlueField," 2026.
[2] NVIDIA, "Introducing NVIDIA BlueField-4-Powered CMX Context Memory Storage Platform," 2026.
[3] R. Qin et al., "Mooncake: Trading More Storage for Less Computation," USENIX FAST '25, 2025.
[4] SNIA, "Computational Storage Architecture and Programming Model, Version 1.0," 2022.
[5] SNIA, "Storage Security: Encryption and Key Management," 2023.
[6] NVM Express, "NVM Express Releases Specifications to Unify AI, Cloud, Client and Enterprise Storage," 2024.
[7] Samsung Electronics, "Samsung Electronics Develops Second-Generation SmartSSD," 2022.
[8] KIOXIA, "AiSAQ Achieves 4.8 Billion High-Dimensional Vector Search Database," 2026.
[9] Y. Wang et al., "Are We Ready for an Agent-Native Memory System?," arXiv:2606.24775, 2026.
[10] P. Chhikara et al., "Mem0: Building Production-Ready AI Agents," arXiv:2504.19413, 2025.
[11] SK hynix, "The Next-Generation Memory Architecture in the AI Era," FMS 2026.
[12] SK hynix, "SK hynix Unveils First HBF Standard Specifications with Sandisk," 2026.
[13] M. Ha et al., "H3: Hybrid Architecture Using HBM and HBF," IEEE CAL, 2026.
[14] Compute Express Link Consortium, "Overcoming the AI Memory Wall," 2025.
[15] Phison Electronics, "How aiDAPTIV+ Works," official documentation.
[16] 江波龙,"SPU 与 iSA",2026。
[17] 联芸科技,"CFMS 2026|AI 推理时代,存储主控芯片价值跃迁",2026。
[18] 经济观察网,"寅谱计算携手 AMD 发布 Infplane Mini AI 工作站",2025。
[19] 英韧科技,"从 N3X 到 Gen6:英韧科技如何用三大要素打造国产 AI SSD",2026。
[20] Huawei, "Huawei OceanDisk LC 560 SSD Data Sheet," 2025.

编辑:所罗门

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16466
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读339.9k
粉丝0
内容16.5k