大数跨境

DeepSeek V4.1 Flash技术报告公开!KV Cache压到极限,HBM需求降至1/4

DeepSeek V4.1 Flash技术报告公开!KV Cache压到极限,HBM需求降至1/4 智猩猩AI
2026-09-11
6
导读:一份把降本写进标题的报告~
智猩猩AI整理
编辑:林夕

9月8日,DeepSeek在官方交流群放出V4.1 Flash中间版本内测,模型名直接写着deepseek-v4.1-flash-expires-on-0910,只开放两天。


9月9日,DeepSeek又宣布下调Flash系列API价格,并明确在V4.1 Pro发布前,所有V4 Pro请求将自动路由至V4.1 Flash,按Flash价格计费。梁神回归不是假的!DeepSeek V4.1 Flash明天先行上线,Pro后续登场

9月10日,V4.1 Flash正式上线刚刚,DeepSeek V4.1 Flash上线!Harness新版同步启动试用模型权重与技术报告同步公开



随着技术报告公开,这个模型的真正看点也逐渐清晰:552B参数,却已经把能力推到了顶级开源模型的竞争区间


报告的副标题很直白:Pushing the Limits of KV Cache Compression(把 KV Cache 压缩推到极限),一份把"降本"写进标题的报告

它的开篇逻辑是:长周期智能体让模型的负载越来越输入密集型,稀疏注意力已经把长序列的计算成本降下来了,但 prefill 依然昂贵,庞大的 KV Cache 持续压迫 HBM 与 SSD 的容量和数据传输带宽。


计算、存储、带宽三者叠加,构成了部署成本继续下探的主要障碍。


于是 V4.1-Flash 的全部架构改动,几乎都围绕这一个目标展开。



最终的压缩效果相当直接,全局KV Cache常驻HBM时,每个Token只需要约890字节,相比V4-Flash降至约1/4;而持久化KV Cache常驻SSD或主机内存时,进一步降至V4-Flash的约1/8

01

CED:让552B的模型

在prefill时只激活 8B


V4.1-Flash 是一个多模态 MoE 模型,语言主干共 40 层,被切成 20 层 causal encoder 加 20 层 decoder。


整体有 552B 主干参数,另加 196B Engram 参数,支持最长 100 万 token 的上下文。


关键在激活量的不对称:每 token 在 prefill 阶段只激活 8B 参数,decode 阶段激活 16B。



支撑这一点的是核心设计 CED(Causal Encoder-Decoder)


用 encoder 的输出直接构造 decoder 的全局 KV Cache,让大部分 prompt token 绕开完整的 decoder 计算,同时保留层内的滑动窗口注意力,报告称这几乎把 prefill 的计算量减半。


与它配合的 CSA2 在层与层之间共享全局 KV、复用稀疏选择结果,decoder 中还设了一层"层次稀疏索引器",让后续索引器只在前一层已选出的候选池里打分。


其余改动集中在效率与部署侧:


(1)mHC 升级为 Single-Pass mHC,配套的 Mega-mHC 部署内核把激活内存流量相对原四内核实现减半;

(2)引入 Engram 条件记忆与 DSpark 推测解码;

(3)主 KV Cache 采用 FP4

(4)部署侧加上 SWA Bounded Replay,只重放最近的 n_win 个 token 来近似重建 SWA KV 状态。


这些改动叠加之后的效果是单 token 的 Decode FLOPs 在不同上下文长度下几乎保持恒定


02

预训练:45T token,

稀疏注意力从零训起 


V4.1-Flash 的预训练语料是 45T token 的多模态数据集


稀疏注意力是从零开始、在 64K 序列长度上直接训练的,没有任何 dense attention 的热身阶段,视觉从零训、与语言一起进语料,旧的 Flash Vision-Exp 外挂路线被收掉。


Base 模型的对比相当有信息量。


V4.1-Flash-Base 只用约 1/3 的总参数、1/4 的激活参数,就在世界知识、推理和编程上取得了与 V4-Pro-Base 相当的水平,并在部分留出评测上提升 5%–10%。



03

后训练没有新算法,

钱都花在数据上


报告在后训练章节的开头,主动做了一个限定,本环节不引入算法创新

流程沿用监督微调、强化学习、在策略蒸馏,与 V4 开发时的成熟做法没有区别。

所有实质变化都发生在数据管线里:大规模自动化的数据合成与环境构建,以及在 RL 中持续放大的数据、任务与 rollout 规模

支撑这一规模的是 DSec(DeepSeek Elastic Compute),一个面向大规模智能体训练与评测的生产级沙箱平台。


报告提到,V4.1 的训练把需求推高到了数百万并发沙箱实例,瓶颈随之转向数据中心可扩展性、工作负载隔离、单节点算力密度,以及对越来越强的智能体越界行为的约束。


另一个设计是可控制的推理强度(Controllable Reasoning Effort)


模型在训练时接受一个 1–100 的标量 effort 作为显式条件信号,写进系统提示词,让同一个 checkpoint 能在不同的成本—质量区间之间滑动。



报告还提到一条工程经验,为了把有效算力扩展到单次训练之外,他们用模型合并来重新初始化后续的 RL 轮次,把不同 scaffold 或配置下各自取得的改进合到一起。

另一条与推理成本直接相关,多智能体配置在同等截止时间下的收益,明显高于单智能体。


04

Agent 追平前沿,

长上下文仍有短板


后训练评测中,V4.1-Flash 的成绩分布并不均匀,报告本身也承认了这一点。

在智能体方向,它确实追到了前沿:Terminal-Bench 2.1 得分 90.6、DeepSWE v1.1 为 74.2、CyberGym 为 88.1、Automation-Bench 为 54.8。


在 Reasoning 与 Agentic 两大类共二十余项指标上,V4.1-Flash 与 V4-Pro、GLM-5.3、Kimi-K3 互有胜负。

Codeforces Rating 3471、MathArena Apex 65.6 属于第一梯队;GPQA Diamond 90.9、HLE 36.8 则仍与 Opus-5 的 93.4、56.3 存在差距。


模型能完成超过 95% 的真实世界任务,但在 Terminal-Bench 4.0 这类"科学导向"的智能体任务上仍有差距。

报告也主动标注了架构改动带来的鲁棒性边界,CSA2 的选择误差、SWA Bounded Replay 的近似状态重建,都可能在未经测试的边界情形下造成能力退化。

05

Flash只是开始,

V4.1 Pro或许才是下一张牌 


V4.1 Flash更像是DeepSeek对下一阶段Agent模型的一次系统级试验。


552B参数只是表面,真正的核心是围绕KV Cache、Prefill和长上下文推理持续压缩成本


CED、CSA2、FP4 KV Cache以及SWA Bounded Replay等设计,把模型能力和部署效率放到了同一个优化目标里。


它目前在Agent、代码等任务上已经进入开源模型第一梯队,但长上下文和部分复杂推理仍有短板。


对DeepSeek来说,V4.1 Flash更像一个起点,后面的V4.1 Pro以及下一代模型,或许才会真正体现这套技术路线的上限。


END


关注+星标,获取AI前沿进展与开源一线动态

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2344
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读3.0k
粉丝0
内容2.3k