大数跨境

DeepSeek 为什么把缓存涨了 11 倍?长上下文需求暴涨,得交点「存储税」了

DeepSeek 为什么把缓存涨了 11 倍?长上下文需求暴涨,得交点「存储税」了 AI科技评论
2026-08-18
6
导读:缓存涨价背后,是大模型的存储与数据搬运困境。
缓存涨价背后,是大模型的存储与数据搬运困境。

    作者丨高允毅

    编辑丨岑   峰

DeepSeek 曾以“白菜价”著称,如今却开启了分时段涨价模式。8 月 17 日,DeepSeek V4 Pro API 调整了输入输出价格。其中,最便宜的缓存命中价格在空闲时段上涨 5 倍,高峰时期更是飙升 11 倍,从 0.025 元/百万 Token 涨至 0.3 元/百万 Token。

所谓“缓存命中”,可理解为大模型的“草稿纸”。AI 无需每次重新计算所有信息,只需提取之前沉淀在存储集群中的"KV 单元”即可。凭借极致的 KV 压缩技术和冷热记忆分层搬运架构,DeepSeek 将长文本调用门槛降至极低,使其成为代码助手、知识库 Agent 等产品的性价比首选。然而,过大的需求量已将低廉的缓存成本转化为厂商难以承受的刚性开销。

大模型成本结构正发生历史性转变:算力(FLOPs)日益廉价,而“状态”保存、带宽及数据搬运正成为 AGI 时代最昂贵的成本。

01 缓存命中到底帮 GPU 省掉了什么?

在无缓存机制前,长上下文大模型的使用成本极高。以搭建代码库智能 Agent 为例,若核心代码为 50 万 Token,开发者日均提问 50 轮。无缓存时,每轮均需全量计算,单日输入成本超 75 元,利润将被吞噬。而拥有 90% 缓存命中率后,仅首轮需全额支付,后续 90% 上下文可直接复用,输入成本直降九成以上。

这一效率源于 DeepSeek 的 KV 压缩技术与冷热记忆分层架构。大模型每读取一个字都会产生庞大的记忆矩阵(KV Cache),上下文越长,内存占用越高。DeepSeek V4 采用压缩稀疏注意力技术(CSA)与重度压缩注意力技术(HCA)交错配置,将相邻 Token 合成记忆块,使长文本记忆体积缩小 95% 以上。此外,系统按访问频率实行冷热分层:高频“热记忆”存于昂贵但高速的 GPU 显存,低频“冷记忆”则转入廉价的企业级 NVMe 固态硬盘。

缓存命中虽节省了重复计算的算力成本,却在存储、搬运、调度三个环节产生了新开销。存储涉及多层级介质,调度需快速定位资源,IO 搬运则需将数据从磁盘加载至显存。此前因这些成本极低而被忽略:DeepSeek V4 可将 100 万 Token 的 KV 状态压缩至约 10GB,单份缓存硬件分摊成本仅几分钱;单次磁盘到显存的搬运成本亦在几分钱量级。这正是其低价策略的底气所在。

02 高峰期太堵,得交“存储税”

此次涨价主因是定价过低引发需求爆发,导致后端服务器在高峰期陷入严重的“缓存颠簸”。当海量百万 Token 级请求并发涌入,GPU 显存(HBM)迅速占满。为新请求腾挪空间,系统被迫将旧缓存从显存“踢”至速度较慢的 NVMe 磁盘。

长上下文缓存体积庞大,一次腾挪涉及上百兆甚至上 GB 数据。高峰期新请求源源不断,驱逐与加载操作频率指数级上升。vLLM 社区压测显示,极端并发下,前后脚进入的长上下文请求会互相挤出显存中的公共前缀缓存,导致用户稍后发送消息时缓存失效,被迫重新计算。

数据在显存与磁盘间频繁搬运,不仅未加速省钱,反而消耗巨量 IO 资源与调度算力。昂贵的 GPU 集群从“脑力劳动者”退化为搬运数据的“体力劳动者”,算力在 I/O 堵塞中空转,严重时甚至导致集群处理能力崩盘。DeepSeek 所涨之价,实为这笔“存储税”。

尽管 DeepSeek 通过混合架构将 1M Token 上下文 KV 缓存体积较 V3 版本削减 90%,仅为传统 GQA 架构的 2%,但物理上限无法突破:GPU 芯片总数、HBM 容量及总线带宽均有极限。当存储、IO 及调度成本累积至临界点,涨价成为必然。OpenAI 与 Anthropic 同样面临此难题:Anthropic 通过显式缓存断点机制及高昂的首次写入溢价,倒逼开发者优化架构;OpenAI 则凭借高基础定价配置更充裕的 HBM 显存以缓解压力。唯有 DeepSeek 因极致低价,不得不通过涨价来平衡成本。

03 开发者要省钱,得提高缓存命中率

即便涨价,DeepSeek 仍是全球性价比最高的选择之一,成本远低于 Claude 等竞品。且多数公司已在 DeepSeek 的 KV Cache 层形成稳定缓存池,切换厂商代价高昂。因此,吃透缓存规则、极致提升命中率,是抵消涨价成本的关键。

DeepSeek 缓存的核心逻辑是前缀完全匹配,差一个字符即失效。开发者常因细节疏忽导致缓存作废:如将当前时间、用户 ID 或随机参数置于 Prompt 开头,导致首字符变动;前端组件拼接时多余的空格或换行符格式变化;以及 Agent 框架将工具返回结果插入上下文中间,打断缓存边界等。

此次涨价倒逼开发者角色转变:从单纯调用 API 转变为“数据管理员”。开发者需精细管理数据生命周期,将全公司共用的核心热数据置于 Prompt 最前端以确保稳定命中,低频冷数据按需加载,并优化缓存策略以避免高峰期被系统剔除。大模型应用已进入精耕细作时代,缓存命中率将成为重要的分水岭。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

//

推荐阅读

DeepSeek Harness 入选项目疑似曝光,不选万星「花瓶」,死磕 Agent 基建


「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8891
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读210.6k
粉丝0
内容8.9k