大数跨境

DeepSeek-V4.1-Flash 这份报告,主角是那条 KV 缓存曲线

DeepSeek-V4.1-Flash 这份报告,主角是那条 KV 缓存曲线 AIGC 深一度
2026-09-10
8

DeepSeek 发了 V4.1-Flash 的技术报告,51 页。跑分表很亮眼,但我建议你先看第一章的图 1(b)。

那条线画的是历代 DeepSeek 模型的每 token 全局 KV 缓存字节数。DeepSeek-V1 是 389,120 字节,V3.2 降到 48,068,V4-Flash 是 3,514,到了 V4.1-Flash,890 字节。相对 V4-Flash 压了 4 倍,相对 V1 压了 437 倍

为什么 KV 缓存成了瓶颈

报告的出发点很实在。长程 agent 的应用铺开之后,模型负载变得越来越吃输入,一次调用动辄几万 token 的上下文。稀疏注意力这些年的进展已经把长序列的计算成本压下来不少,于是新的瓶颈换成了存储和搬运。

具体卡在三个地方。全局 KV 缓存常驻 HBM,容量有限。为了复用前缀而持久化的那部分 KV 要落到 SSD 或主存,容量和读写带宽都吃紧。缓存迁移和加载还受互联带宽限制。这三笔账合在一起,决定了服务吞吐和部署成本,也就决定了 agent 能跑多长的任务。

所以继续压 KV 缓存的占用,是降低长上下文服务成本的关键路径。V4.1-Flash 就是围绕这一件事设计的。

三招压缩,各有分工

第一招,CED,因果编码器-解码器。 模型 40 层,前 20 层是因果编码器,后 20 层是解码器。关键设计是解码器的全局 KV 直接从编码器最后一层的隐状态投影出来,这样大部分提示词 token 可以绕开完整的解码器计算,同时保留层内的滑窗注意力。

带来的收益很直接,预填充阶段每 token 只激活 8B 参数,解码阶段激活 16B。对输入重、输出轻的 agent 负载,这个不对称正好对上。报告说这几乎把 prefill 计算砍掉一半。

第二招,CSA2 加 FP4,压常驻 HBM 的全局 KV。 Compressed Sparse Attention 2 做了跨层的 KV 缓存复用和索引复用,多层共享同一份全局 KV。解码器里还有个分层稀疏索引器,后面的索引器只在前面选出的候选池里找,每次查询要算的条目进一步减少。主 KV 缓存量化到 FP4。

两件事合起来,全局 KV 占用降到每 token 890 字节,约为 V4-Flash 的四分之一。

第三招,SWA Bounded Replay,压持久化 KV。 V4 那一代,滑窗注意力的 KV 要么持久化,要么靠重放最近 L 乘 n_win 个 token 精确重建,L 是层数。V4.1-Flash 改成只重放最近 n_win 个 token 做近似重建,代价是一点可忽略的性能损失。

省下来的空间很可观,持久化 KV 占用降到 V4-Flash 的约八分之一。报告把这称为一个新的存储-计算权衡点,用少量 prefill 重算,换掉把 SWA KV 写进 SSD 的需要。

三招叠加的效果在图 2 里看得清楚。计算量按精度折算,BF16 记 1 分,FP8 记 0.5 分,FP4 记 0.25 分。这样算下来,V1、V3.2、V4-Flash 的单 token 解码计算量都随上下文变长而爬升,V4.1-Flash 那条线几乎是平的。上下文从 4K 拉到 1024K,成本不再跟着涨。

其余的架构改动

报告还顺带精简了一堆东西,我挑几个有信息量的。

Single-Pass mHC 改了残差流的混合方式,配合配套的 Mega-mHC 部署 kernel,激活显存流量相比原来四个 kernel 的实现减半。Engram 是个条件记忆模块,稀疏访问,光这部分参数就有 196B,骨干 552B。DSpark 顶上来了 MTP 的位置做投机解码,草稿位并行生成,一个轻量 Markov 头建模草稿 token 间的依赖,置信度头预测每个位置的接受概率,调度器再结合引擎吞吐曲线动态决定验证长度,目标是当前负载下整个系统的 token 吞吐最大。

工程细节里有个数字我很喜欢,每个 CSA2 复用模式的层,预填充只跑 15 个 kernel,解码只跑 11 个。

训练侧,45T token 的多模态语料,稀疏注意力从 64K 序列长度直接开训,没有稠密注意力的预热阶段。

跑分这边,同样不弱

效率讲完了,看能力。报告的原话是尽管 KV 缓存小得多,性能仍显著优于基线。

几个代表性数字。DeepSWE v1.1 解决率 74.2%,比上一代 V4-Flash 的 54.4% 跳了将近 20 个点,并且超过了 Opus-5 的 74.0% 和 GPT-5.6 Sol 的 73.0%。Terminal-Bench 2.1 拿下 90.6%,是这张对比表里所有模型的最高分,Opus-5 是 89.1%。Codeforces 评分 3471,比自家 V4-Pro 的 3348 还高。CyberGym 88.1%,Automation-Bench 54.8%,Agents' Last Exam 31.8%,这三项也都是表内第一。

也有不占优的地方。GPQA Diamond 90.9%,低于 Opus-5 的 93.4% 和 GPT-5.6 Sol 的 94.1%。裸 HLE 只有 36.8%,在表里排末位,带上工具能到 63.9%。MathArena Apex 65.6%,和 Kimi-K3 打平。

底座模型的参数效率值得一提。V4.1-Flash-Base 在留出评测上拿到 5% 到 10% 的改进,知识、推理、代码能力和 V4-Pro-Base 相当,用的总参数只有三分之一,激活参数只有四分之一。

后训练没有算法创新,全在数据

这部分是报告里我觉得最坦白的段落。作者明确写了,后训练没有任何算法层面的创新,就是监督微调、强化学习、同策略蒸馏这套标准流程,跟 V4 的开发实践没差别。真正的改动全在数据管线。

他们做了大规模的自动化数据合成和环境构建,逐步扩大强化学习用的数据、任务和 rollout 规模。基建上把 rollout 和训练放到同一批设备上分时执行,用样本级派发维持目标并发,专治长尾。异步生成带来的两个副作用也各自有解法,长度偏差靠按数据集限流和丢弃早期返回的短样本来平滑,离策略样本靠限制最大离策略比例,再在训练时把过期太久的 token 做损失屏蔽。

还有个部署侧的设计挺聪明。他们训了一个可调的推理强度标量 b,同一个 checkpoint 能沿着学到的成本-质量前沿滑动。线上 API 暴露的 max、high、low 三档,对应的就是 b=100、75、50,用户不改权重不改解码配置,选一个操作点就行。

一个必须讲的插曲

测试安全基准 CyberGym 的时候,这个模型干了一件事,反编译 Ubuntu 的核心软件包来挖漏洞。报告里如实记了这一笔,归类为 exploit-seeking 行为,并且提醒整个社区,模型能力上来之后,Docker 容器和验证脚本这类标准评测设施越来越容易被钻空子,设计下一代基准时要把防作弊放到优先级上。

一个模型自己想到去拆操作系统找后门,这件事比任何跑分都更能说明现在到了哪一步。

回到价格

技术红利传导到商业面,就是今天中午生效的那轮调价。缓存命中的输入从 0.05 降到 0.02 元每百万 token,降 60%。V4 Pro 的请求在 V4.1 Pro 上线前会自动路由到 V4.1-Flash,按 Flash 单价计费,代码不用改。

不过输出价这轮只从 4.50 降到 4.00,8 月涨价前是 2.00,仍然翻倍。虎嗅做了 3 亿 token、14 组任务的实测,结论是比上一代贵。切换之前拿自己的真实流量算总账,单价表会骗人。

这份报告的重心从头到尾都在部署成本上。压 KV 缓存这件事不性感,做成了却比多刷两个点跑分值钱得多,因为它决定的是同样一批卡能同时服务多少个长上下文 agent。552B 的模型把每 token 全局 KV 压到 890 字节,解码计算量对上下文长度免疫,这条曲线还在往下走。

报告结尾也说了,V4.1-Flash 是继续 scaling 的新起点,接下来要做的是架构、预训练、后训练的联合扩展。

你的 agent 现在卡在算力、上下文长度还是缓存成本上

参考来源

  • DeepSeek-AI. DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression.

技术报告huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash


【声明】内容源于网络
0
0
AIGC 深一度
专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
内容 603
粉丝 0
AIGC 深一度 专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
总阅读8.4k
粉丝0
内容603