编者摘要:DeepSeek‑V4.1‑Flash 是 DeepSeek 推出的百万上下文多模态 MoE 大模型,主干 552B 参数,预填充激活 8B 参数、解码激活 16B 参数。核心突破聚焦KV 缓存极致压缩:通过 CSA2 跨层 KV 缓存复用、FP4 量化全局 KV 缓存,HBM 全局 KV 降至 890 字节 /token,为 V4‑Flash 的 1/4;搭配 SWA 有界重放,SSD 持久 KV 缓存压缩至原版 1/8,大幅降低 HBM、SSD 带宽与存储压力。
架构创新包含 CED 因果编码器‑解码器、分层稀疏索引器、Single‑Pass mHC、Engram 记忆模块、DSpark 推测解码。模型在 45T 多模态 token 完成预训练,后训练依靠大规模任务合成强化智能体能力,新增可调节推理强度档位。
在代码智能体、自动化、网络安全基准上表现亮眼,DeepSWE v1.1 达 74.2%,比肩顶尖闭源模型;支持多智能体协作。但高难度科学领域任务仍与顶级闭源存在差距,极端边界场景存在稀疏检索近似重建带来潜在风险。
10 个关键问题问与答
n_win个 token 近似恢复状态,用微小性能代价换取持久缓存大幅缩减。
DeepSeek‑AI research@deepseek.com
摘要
长周期智能体的广泛普及,使得模型工作负载愈发偏向输入密集型。尽管已有大量研究大幅降低了长上下文计算开销,但预填充(prefill)阶段计算开销依旧高昂;同时庞大的 KV 缓存持续给高带宽内存(HBM)、固态硬盘(SSD)的容量以及数据传输带宽带来巨大压力。计算、存储与带宽方面的这些需求,共同构成了进一步降低部署成本的主要瓶颈。
为应对该挑战,本文提出DeepSeek‑V4.1‑Flash,这是一个多模态混合专家(MoE)模型,主干参数规模 5520 亿,最高支持一百万 token 上下文。模型采用因果编码器‑解码器(CED)架构:解码阶段每个 token 激活 160 亿参数,预填充阶段仅激活 80 亿参数,极大提升智能体工作负载下的成本效率。
为挖掘 KV 缓存压缩的性能上限,DeepSeek‑V4.1‑Flash 将压缩稀疏注意力 2(CSA2)的跨层 KV 缓存复用与FP4 KV 缓存相结合。上述设计将常驻于 HBM 的全局 KV 缓存占用降低至每 token 890 字节,约为 DeepSeek‑V4‑Flash 的 1/4。 除此之外,借助专门的部署优化技术 ——滑动窗口注意力有界重放(SWA Bounded Replay),该模型将存放在 SSD 或主机内存上的持久化 KV 缓存占用进一步压缩至 DeepSeek‑V4‑Flash 的约 1/8。
虽然 KV 缓存占用大幅缩减,但该模型的综合性能相比基线模型反而有明显提升。除此之外,我们精简了 DeepSeek‑V4 原有架构,并引入多项高效架构扩展模块。我们在包含 45 万亿 token 的多模态语料上完成 DeepSeek‑V4.1‑Flash 预训练,并开展全面的后训练,最终该模型在各类文本与多模态智能体场景下均取得优异表现。模型权重已发布在 Hugging Face:https://huggingface.co/deepseek‑ai/DeepSeek‑V4.1‑Flash。
1 引言
近些年,长周期智能体应用飞速发展,超长上下文处理成为越来越重要的模型负载。这类工作流不仅要求高效的长序列计算,还需要对庞大 KV 缓存做持久存储、复用与数据迁移。KV 缓存管理由此成为模型部署的基础核心能力,但同时也带来巨大的计算、存储与通信层面的挑战。
稀疏注意力领域的前期工作(DeepSeek‑AI,2025,2026b)已经显著降低长序列计算开销,使得持久化存储与数据搬运逐渐上升为主要性能瓶颈。
具体而言,DeepSeek‑V4(DeepSeek‑AI,2026b)融合了覆盖全部上下文的全局注意力分支与局部滑动窗口注意力(SWA)。全局分支维护全局 KV,包含主 KV 与索引器 K;SWA 维护局部 KV 状态。在固定窗口大小下,SWA 的 KV 存储与序列长度无关。当序列足够长时,全局 KV 成为 KV 缓存占用的主体,受限于 HBM 容量。 除此之外,部分 KV 会被持久保存用于前缀复用,即持久化 KV 缓存,这部分受限于 SSD 与主机内存容量。I/O 与互联带宽同样制约缓存迁移与加载。以上种种约束压低服务吞吐、抬高部署成本,最终阻碍长任务智能体在更多场景落地。
因此进一步压缩 KV 缓存占用,对缓解存储通信瓶颈、降低长上下文服务成本至关重要。为此我们提出 DeepSeek‑V4.1‑Flash:面向激进 KV 缓存压缩设计的多模态混合专家模型。主干参数 5520 亿,原生支持多模态输入,上下文最高可达一百万 token。
模型采用因果编码器‑解码器(CED)架构:预填充每个 token 仅激活 80 亿参数,解码每个 token 激活 160 亿参数,对输入密集型的智能体场景具备极高成本收益。尽管模型整体规模显著大于 DeepSeek‑V4‑Flash,但相同序列长度下,它的运行时 KV 缓存仅约为前者 1/4,持久化 KV 缓存约为前者 1/8,同时综合性能优于 DeepSeek‑V4‑Flash。
如此高压缩比来源于模型架构、缓存精度、部署策略三方面的联合优化。从概念上,DeepSeek‑V4 可以理解为一套以 SWA 局部处理为主干,叠加压缩全局上下文的系统。受此启发,我们选择尽量保留局部注意力设计,重点简化全局分支。
架构层面:我们提出 CSA2(压缩稀疏注意力 2),对全局 KV(主 KV、索引器 K)与 Top‑K 索引做跨层复用,大幅削减缓存存储开销。CSA2 包含三种静态工作模式:完整模式(Full)、重索引模式(Reindex)、复用模式(Reuse)。
- 完整模式
生成全局 KV 并执行索引; - 重索引模式
复用上层的全局 KV,使用本层索引器 Q 对共享索引器 K 重新打分,选出全新 Top‑K 索引; - 复用模式
直接复用上层的全局 KV 与 Top‑K 索引,直接执行稀疏注意力。
三种模式下,每一层都维护自身的全局 Q 以及 SWA KV。通过共享全局 KV 与索引器 K,消除重复缓存存储。 和 DeepSeek‑V4 使用 CSA‑HCA 混合架构不同,DeepSeek‑V4.1‑Flash 完全使用纯 CSA2。
缓存精度层面:训练阶段启用 FP4 全局 KV 缓存,性能损失微乎其微。CSA2 结合 FP4 KV 缓存,把全局 KV 缓存存储压至 DeepSeek‑V4‑Flash 的约 1/4(见图 1 (b))。
部署层面:DeepSeek‑V4.1‑Flash 每一层依然使用滑动窗口注意力 SWA。DeepSeek‑V4 采用混合策略权衡 SWA KV 持久存储开销和精确重建所需计算量;精确重建需要重放最近 \(L ×n_{win}\) 个 token,L 是层数,\(n_{win}\) 是 SWA 窗口大小。 在 DeepSeek‑V4.1‑Flash 中,我们提出SWA 有界重放(SWA Bounded Replay):仅重放最近 \(n_{win}\) 个 token,近似重建所需 SWA KV 状态。实验表明该操作只会带来可以忽略不计的性能下降。该设计建立了一套新的存储‑计算权衡:不需要将 SWA KV 持久化保存到 SSD,代价是少量预填充重计算。 依托 SWA 有界重放,持久化 KV 缓存占用进一步降低到 DeepSeek‑V4‑Flash 的约 1/8。
以上全套优化极大减轻 HBM、SSD 的容量压力,降低部署成本,为更大规模部署铺平道路。
除 CED 和 CSA2 以外,我们进一步精简 DeepSeek‑V4 原始架构。升级原有 mHC(Xie 等人,2026)为单通道 mHC(Single‑Pass mHC),配套 Mega‑mHC 推理内核,相比原来四内核实现,激活内存流量减半。 集成条件记忆模块 Engram(Cheng 等人,2026b)增强模型能力;引入 DSSpark(Cheng 等人,2026a)推测解码架构,借助半自回归草稿生成与置信度调度校验,提升解码效率。
综合全部架构改进后,DeepSeek‑V4.1‑Flash 单 token 解码 FLOPs 随上下文长度几乎保持恒定。图 2 可见:上下文从 4K 扩展到 1M(扩大 256 倍),解码 FLOPs 仅增加 1/4;远小于 DeepSeek‑V4‑Flash 的涨幅,极大降低长上下文场景计算开销。
为充分释放 KV 缓存压缩带来的收益,同时进一步提升训练、推理效率,我们针对 DeepSeek‑V4.1‑Flash 协同优化训练基础设施与推理系统,实现高效、可扩展的大规模多模态训练与长上下文部署。 训练基础设施支持解耦的视觉编码器执行、长序列均衡图像分片、跨阶段共享状态管理,用于注意力复用。推理系统实现编码器、解码器两套 SWA 有界重放执行路径;额外做计算‑通信重叠、分片 Engram 嵌入表、推理内核融合等优化。特别地,CSA2 复用模式层预填充仅需 15 个内核,解码仅需 11 个内核。我们还在主机内存中将长生命周期全局 KV 存储与短生命周期编码器 SWA KV 分开,依靠有界重放近似恢复缺失的编码器 SWA 状态。
预训练阶段,DeepSeek‑V4.1‑Flash 在 45 万亿 token 的大规模多模态语料上训练。稀疏注意力从 64K 序列长度从零开始训练,不经过稠密注意力预热。完成预训练后,模型原生具备多模态能力,支持最高一百万 token 上下文。 评测结果显示:DeepSeek‑V4.1‑Flash‑Base 的世界知识、推理、代码能力与 DeepSeek‑V4‑Pro‑Base 处于同一水平;而总参数量仅为后者 1/3,激活参数量仅 1/4,在预留测试集上还有 5‑10% 的提升。充分体现模型优秀的参数效率,也反映面向真实部署的训练数据质量得到提升。
基于基座模型,我们开展后训练,激发推理与智能体能力。需要说明:本文后训练没有提出新算法;整体流程沿用监督微调 SFT → 强化学习 RL → 同策略蒸馏 OPD 的标准范式,算法层面完全沿用 DeepSeek‑V4 已有的成熟实践(DeepSeek‑AI,2026b)。实质性改进全部落在数据流水线:我们搭建大规模自动化的数据合成、环境构建流水线,在 RL 训练过程中持续扩大数据规模、任务规模、轨迹 rollout 规模,拓展模型在文本、多模态、智能体领域能力。
图 1 (a) 汇总 DeepSeek‑V4.1‑Flash 在核心智能体基准上的表现。评测表明,尽管激活规模紧凑,模型能力呈现鲜明特点:
- 推理能力
推理表现强劲,在数学、竞赛编程等高推理强度基准上保持高准确率,与 Kimi‑K3(Team 等人,2026a)、DeepSeek‑V4‑Pro 等顶尖开源模型相当。 - 智能体能力
在 Terminal‑Bench 2.1(Merrill 等人,2026)、DeepSWE v1.1(DataCurve,2026)、Automation‑Bench(Shepard 和 Salimans,2026)等主流智能体基准上,性能比肩闭源顶尖模型;足以处理日常编码、白领办公工作流。但在 Terminal‑Bench 4.0(Marten 等人,2026a)这类需要专家领域知识的科学类智能体任务上,与超大模型之间仍存在差距。 - 多模态能力
在视觉推理、专业图表解读类基准上,超过 Kimi‑K3 等第一梯队开源竞品。脱离标准评测指标,在前端开发、办公自动化这类真实世界视觉智能体工作流中具备实用价值:可以读取截图完成视觉检查、自我纠错。但整体和顶级闭源大系统相比仍存在可观测性能差距。
上述结果表明,DeepSeek‑V4.1‑Flash 已经可以在绝大多数基准上比肩闭源前沿模型,能够完成 95% 以上真实业务任务。同时较小的激活占用带来更低推理延迟与服务成本。 因此我们认为 DeepSeek‑V4.1‑Flash 取得能力‑效率的良好权衡,是面向广大普通用户、快速且低成本的助手模型。
综上,DeepSeek‑V4.1‑Flash 同时提升模型智能水平与推理效率,压低部署成本;大幅降低大规模部署长周期智能体的门槛,为更多场景落地智能体创造机会。同时该版本也是我们持续做模型规模拓展的新起点。以此为基础,我们将继续联合拓展架构、预训练、后训练,持续探索模型能力的前沿边界。
2 模型架构
2.1 总览
DeepSeek‑V4.1‑Flash 是一个多模态混合专家 MoE Transformer,支持图像 + 文本输入,自回归输出文本。语言主干一共 40 层因果 Transformer,划分为 20 层因果编码器 + 20 层解码器。除最前两层仅使用 SWA 之外,其余每一层同时包含全局注意力与滑动窗口注意力 SWA。 视觉编码器与 MLP 投影器将图像转为视觉嵌入,和文本嵌入共同处理;多模态数据从语言模型预训练早期就融入训练。 整体上 DeepSeek‑V4.1‑Flash 主干参数 5520 亿,Engram 模块参数 1960 亿;预填充阶段每个 token 激活 80 亿参数,解码阶段每个 token 激活 160 亿参数。
因果编码器‑解码器 CED 架构、压缩稀疏注意力 CSA2 分别解决长上下文推理中两类不同开销。CED 从编码器输出构造解码器的全局 KV 缓存,让大部分 prompt token 可以绕过完整解码器计算,同时保留层局部滑动窗口注意力。该机制几乎减半预填充计算量,对上下文持续增长的智能体输入密集场景非常友好。 CSA2 实现跨层之间共享全局 KV,减少缓存存储;复用稀疏选择结果,降低索引计算开销。解码器内部,分层稀疏索引器让高层索引器仅在低层索引器筛选出的候选池内检索,进一步减少每个 Query 需要打分的条目数量。
模型沿用 DeepSeekMoE(Dai 等人,2024)细粒度路由共享专家设计,并针对图像、文本 token 引入模态专属负载均衡策略(Wang 等人,2024a)。 单通道 mHC(Xie 等人,2026)改造残差流混合逻辑,便于内核融合;Engram(Cheng 等人,2026b)增加稀疏访问条件记忆。主干预训练阶段去掉 MTP 模块;DSSpark(Cheng 等人,2026a)用于推测解码,DSSpark 在主干预训练完成后单独训练。同时主 KV 缓存压缩为 FP4 进一步削减存储开销。下面分模块介绍架构组件与对应的优化改动。
2.1.1 多模态架构
多模态输入链路由视觉编码器和 MLP 投影器构成。对于每张输入图片,视觉编码器输出空间网格形式的视觉特征;经过 3×3 像素重组(pixel‑unshuffle)操作,在通道维度重组局部邻域信息,降低空间分辨率;之后 MLP 投影器将特征映射到语言主干的隐层维度。最终得到的视觉嵌入插入输入序列对应的图像 token 位置,和文本嵌入共同送入语言主干处理。
DeepSeek‑ViT 视觉编码器:我们从零训练名为 DeepSeek‑ViT 的视觉编码器,原生支持不同分辨率图像输入。它基于 Vision Transformer(Dosovitskiy 等人,2021)做多项修改:
-
去掉标准绝对位置编码,改用 2D‑RoPE,适配任意分辨率输入; -
patch 嵌入卷积替换为线性投影,兼容 Muon 优化器; -
使用 RMSNorm(Zhang & Sennrich,2019)归一化; -
激活函数选用 SwiGLU(Shazeer,2020)。
送入 LLM 前执行 3×3 的 pixel‑unshuffle 下采样,视觉 token 数量缩减 9 倍,最高可处理约 1344×1344 分辨率图片。
MoE 无辅助损失多模态负载均衡:图像 token 与文本 token 表征分布不同,在 MoE 中专家路由偏好也不一样。直接对整体负载做均衡会掩盖模态内部的不均衡问题。为此我们扩展无辅助损失负载均衡算法(Wang 等人,2024a):为文本、图像 token 维护两套独立的专家修正偏置。路由时,每个 token 使用自身模态对应的偏置选择专家;原始路由分数依旧用于加权专家输出。每一步训练结束,两套偏置会依据各自模态专家负载独立更新。该设计实现每种模态内部专家利用率均衡,保障多模态训练稳定高效。
2.2 因果编码器‑解码器(CED)
智能体工作流会频繁调用工具,产生大量预填充请求;当 KV 缓存未命中时,预填充带来巨大计算开销。为缓解预填充瓶颈,我们提出因果编码器‑解码器 CED 架构,设计灵感来自 YoCo(Sun 等人,2024)。YoCo 让上层层直接复用下层生成的 KV 缓存来减少预填充计算。CED 在该思想基础上做一系列结构改进,提升 KV 缓存容量与 KV 生成计算深度,最终在性能基本无损前提下,几乎减半预填充计算量。
针对全局注意力:CED 把 Transformer 的下半部分 \(L/2\) 层视作因果编码器;上半部分(解码器,\(l>L/2\))的 KV 条目不再由本层隐状态 \(H_l\) 生成,而是通过可学习投影权重,直接从第 \(L/2\) 层(编码器最后一层)隐状态 \(H_{L/2}\) 投影得到: \(C_{l}=H_{L/2} W_{l}^{K V},\ Z_{l}=H_{L / 2} W_{l}^{Z},\ l>\frac{L}{2}\) 其中 \(C,Z\) 分别代表 KV 条目与压缩权重。该设计预填充阶段只需要计算前一半网络,以极小开销就得到上层全局 KV 缓存。
而滑动窗口注意力 SWA 依旧保留逐层计算:任意层 l 的局部 KV 直接取自本层隐状态 \(H_l\)。该设计有效提升局部 KV 生成的计算深度,但也带来解码器 SWA KV 必须重新计算的代价:预填充阶段生成解码器 SWA KV,需要额外处理 \(n_{win} ×L/2\) 个 token。当多轮对话每轮 prompt 很短时,该开销不可忽略。
已有工作(Chen 等人,2025)表明 SWA 实际有效感受野远小于理论值 \(n_{win} ×L/2\)。受此启发,我们提出解码器 SWA 有界重放:只对 prompt 末尾最近 \(n_{win}\) 个 token 做预填充用于 SWA 计算,显著降低计算开销,细节见 3.2.2 节。
总体,当序列长度 \(N \gg n_{win}\),CED 把预填充复杂度从 \(O(NL)\) 降低到 \(O(N L/2+n_{win} ×L/2) ≈ O(NL/2)\),整体计算量近乎减半。
2.3 压缩稀疏注意力 2(CSA2)
长上下文服务需要同时控制 KV 缓存存储开销与注意力计算开销。开销可以从三个相乘维度降低:
- 条目维度
GQA(Ainslie 等人,2023)减少 KV 头数量;MLA(DeepSeek‑AI,2024)跨头共享低维隐向量。 - 序列维度
每 m 个 token 压缩为一条记录,例如 DeepSeek‑V4 中的 CSA、HCA。 - 层维度
部分层直接复用其他层缓存与选择索引,而不是维护自己全套缓存。
已有工作证实层维度压缩具备潜力:IndexCache(Bai 等人,2026)跨层复用 Top‑K 索引减少索引计算;YOIO(Sun 等人,2026b)一次稀疏路由全层共享;HySparse(Gao 等人,2026)稀疏层复用稠密层 KV 缓存。 但现有方案存在局限:单纯索引复用不会减少主 KV 存储;全局路由共享会损失性能;混合架构依旧保留稠密注意力层;最重要的是没有方案同时覆盖上面全部三个维度。
CSA2 联合利用全部三个维度:跨层共享主 KV 与索引器 K,支持复用 Top‑K 索引;缓存共享与索引复用解耦;搭配简化的压缩器,再加上解码器的分层稀疏索引器缩小后续索引层搜索空间。
和 CSA 类似,CSA2 包含轻量索引器:使用索引器 Q、索引器 K 对主 KV 条目打分,为每个查询选出 Top‑K 条目。每个 Query 会对选中条目以及本层局部 SWA KV 做注意力计算。压缩比 m=1 等价于不压缩主 KV。 同时 CSA2 简化压缩器与索引器:CSA 中压缩比 m 会由 2m 条原始 KV 生成一条压缩 KV,相邻压缩条目输入会重叠,还加入绝对位置编码记录位置。CSA2 去掉重叠逻辑、去掉绝对位置嵌入;索引器 K 直接从主 KV 条目投影得到,不再像 CSA 那样从隐状态单独走一条压缩路径。两项改动简化实现,提升训练效率。
下面 2.3.1 介绍跨层复用策略;2.3.2 介绍分层稀疏索引器。
2.3.1 跨层 KV 与索引复用
每个 CSA2 层被静态分配三种模式之一:Full 完整模式、Reindex 重索引模式、Reuse 复用模式。 所有模式中,本层都计算自己的 Query Q、SWA KV,结合选中的主 KV 条目输出注意力结果。三种模式差异在于获取主 KV、索引器 K、Top‑K 索引的方式。
- 完整模式(Full Mode)
本层计算自己的主 KV、索引器 Q;从主 KV 投影生成索引器 K;运行索引器,产出全新 Top‑K 索引。执行完整 CSA2 计算链路,等价于 DeepSeek‑V4 里一个标准 CSA 层。 - 重索引模式(Reindex Mode)
复用最近上层已经生成的主 KV 与对应索引器 K;本层只计算索引器 Query,对复用的 key 重新打分,生成全新 Top‑K 索引。在共享主 KV、索引器 K 的前提下,允许不同层选出不同稀疏条目。 - 复用模式(Reuse Mode)
共享主 KV 与索引器 K 降低缓存存储;复用 Top‑K 索引省去额外索引计算。Reindex 模式保留缓存共享,但允许每层稀疏选中集合发生变化。 当 CSA2 和 CED 配合使用,解码器 Full 模式层的全局 KV 从编码器最后一层隐状态投影而来;Reindex、Reuse 模式逻辑保持不变。
图 4 CSA2 三种工作模式示意图绿色块:本层计算;黄色块:从最近 Full 层复用主 KV、索引器 K;红色块:从最近索引生成层复用 Top‑K 索引。全部模式都在本层生成主 Q 与 SWA KV。
2.3.2 分层稀疏索引器
跨层索引复用可以减少索引器调用次数,但剩下的索引器依旧需要对全部因果可见上下文打分;对于极长序列,该开销仍是计算瓶颈。 已有工作会先对块表征打分剪枝,再做 token 级索引(Xu 等人,2026b)。我们发现在解码器中,浅层索引器输出的信息天然可以用来限制深层索引器的候选范围,不需要引入额外状态。因此我们在 CED 解码器中引入分层稀疏索引器,减少解码阶段重复打分开销。 训练时就引入该机制,训练推理搜索域完全一致,让深层索引器在推理使用的候选域上完成优化。
解码器第一个 Full 模式层会完成两件事:
-
对全部因果可见主 KV 位置打分,生成自身注意力使用的 Top‑K 索引; -
做分块候选筛选:每个块取块内所有位置最大索引分数,选出分数最高的一批块;收集被选中块覆盖的全部位置,构成候选池(Candidate Pool),候选池规模大于最终 Top‑K 集合。 例:选择 2048 个块,每个块 8 个位置,得到最多 16384 个候选位置。后续 Reindex 模式层只允许在这个候选池内部检索。
后续 Reindex 模式层,只对候选池内位置打分,在候选池内部选出自己的 Top‑K 条目。Reuse 模式层不做任何新索引计算,直接沿用之前生成的 Top‑K 索引。 候选池在多个索引层之间共享,但每层最终选择结果可以不一样。 固定候选池大小之后,后续每一层索引器需要打分的位置数量不再随上下文长度增长。只有第一个 Full 模式层需要扫描全部因果可见范围。 分层索引因此降低后面索引层计算开销,同时保留第一层的全范围扫描。
2.4 高效架构扩展模块
2.4.1 单通道 mHC(Single‑Pass mHC)
DeepSeek‑V4 引入 mHC(Xie 等人,2026),在相邻 Transformer 块之间维护 n 条残差流。token 对应的流记为 \(X_{l} \in \mathbb{R}^{n ×d}\),l 为块编号,d 为隐维度。更新公式: \(X_{l+1}=B_{l}X_{l}+C_{l} \mathcal {F}_{l}(A_{l}X_{l}), (A_{l},B_{l},C_{l})=\mathcal {H}(X_{l})\) \(A_l,B_l,C_l\) 是从 \(X_l\) 预测得到的逐 token 系数;系数预测模块 H 包含归一化与投影。
理想情况下,两个块之间残差变换是从 \((X_{l-1}, Y_{l-1})\) 映射到 \((X_{l}, \hat{X}_{l})\),\(\hat{X}_{l}=A_{l} X_{l}\) 为本层输入,\(Y_{l-1}=F_{l-1}(\hat{X}_{l-1})\) 是上一块输出。理想映射需要读取 \((n+1)d\),写入 \((n+1)d\),激活内存流量下界 \((2n+2)d\)。
DeepSeek‑V4 原始 mHC 多通道实现,受数据依赖限制,必须顺序执行 3 个内核:残差更新、预测系数、输入混合。总激活内存流量达到 \((4n+4)d\),是理论下界两倍。
我们提出单通道 mHC:把输入混合使用的系数向后偏移一个块;本块使用上一块输出的混合系数 \(A_{l-1}\),不再依赖本块算出的 \(A_l\),消除依赖链。 \(X_{l+1}=B_{l}X_{l}+C_{l} \mathcal {F}_{l}(A_{l-1}X_{l}), (A_{l},B_{l},C_{l})=\mathcal {H}(X_{l})\) 经验表明该偏移只会带来可忽略性能损失。
预训练阶段我们依旧保留多内核实现,偏移只改变每个块取用哪一组混合系数。部署时我们将残差更新、输入混合、系数预测融合为单一内核 Mega‑mHC。 Mega‑mHC 沿着隐维度分 tile 处理 \(X_l\);每一块 tile 同时用于输入混合,同时累加预测下一组系数需要的统计量;内置输入预归一化与 FP8 转换。残差只读取一次、写入一次,达到理想映射 \((n+1)d\) 读、\((n+1)d\) 写,相比原始实现激活内存流量减半。
2.4.2 Engram 记忆模块
我们引入 Engram(Cheng 等人,2026c)条件记忆模块,将记忆存储和模型计算解耦。沿用原始设计:tokenizer 压缩、多头哈希、上下文门控、多分支融合;做两处修改:
-
移除短因果卷积:收益不足以抵消推理栈复杂度; -
Engram 嵌入表使用动量更新 + Sinkhorn 平衡,详见 2.5 节。
Engram 全部 1960 亿参数平均分配到两个子模块,分别放在第 1 层、第 14 层(从 0 索引),平衡各训练流水线阶段内存占用。每个模块支持 2‑gram/3‑gram/4‑gram;8 个哈希头;每种 n‑gram 维度 2048;每个头索引一张约 1600 万条目的嵌入表,表大小选用不同素数。嵌入表与 KV 投影全部使用 FP8 精度。
推理阶段,借助 RDMA 后台传输,可以把嵌入从主机内存预取到计算单元;第一个模块预取和第一个 Transformer 块计算互相重叠。Engram 训练、推理更多细节见 3.1.3。
2.4.3 DSpark 推测解码
DSSpark(Cheng 等人,2026a)是半自回归草稿生成 + 置信度调度校验的推测解码模块。草稿生成器包含 3 层滑动窗口为 128 的 Transformer 块;一次前向传播并行计算 5 个草稿位置的基础 logit;轻量马尔可夫头建模草稿 token 之间依赖。置信度头预测每个位置条件接受概率,估算前缀存活概率。调度器结合该估算与引擎吞吐性能曲线,动态决定每条请求的校验长度,目标是在当前系统负载下最大化整体 token 吞吐。
和 DeepSeek‑V3 的 MTP 不同,DSSpark 不在主干预训练阶段联合训练。主干预训练完成后单独冻结主干训练 DSSpark;后训练阶段 DSSpark 和主干一起更新,但 DSSpark 的损失梯度不会反向传播到主干权重。该方式保证 DSSpark 对齐不断演进的模型策略,既可以线上推理加速,也可以加速 RL、OPD 阶段 rollout 生成。
2.4.4 FP4 主 KV 缓存
长上下文智能体工作负载每条请求需要巨大 KV 缓存,拉高服务成本。DeepSeek‑V4 已经对索引器 Q、K 做感知量化训练 QAT,使用 FP4 加速索引计算、缩小索引缓存。 现在我们把感知量化训练 QAT 扩展到主 KV 缓存:FP4 主要目标是减少存储,不是加速矩阵乘法。注意力计算前再反量化,不需要硬件原生支持该格式,保证跨硬件兼容性。
我们选用 OCP 标准 MXFP4 格式(Rouhani 等人,2023);具体选用 E2M1,每 16 个通道共用 1 个 E4M3 缩放因子,参考 NVFP4(Alvarez 等人,2025),但去掉第二级全局缩放,平衡精度与实现简单。去掉全局缩放后动态范围依然足够适配 KV 缓存数值范围。 经过 RMSNorm、RoPE 旋转后 KV 隐向量最大幅值约 22.6;训练阶段观测到最大幅值约 10。因此去掉全局缩放不会带来可测精度下降,同时简化缓存布局。
我们在后训练阶段引入 QAT 实现 FP4 主 KV 缓存。在 RoPE 旋转之后执行量化;RoPE 之前量化只会带来微小精度提升,但会增加解码阶段开销。SWA KV 对量化噪声更敏感,依旧保留 FP8。对比 DeepSeek‑V4 的 FP8 主 KV 缓存,该格式将 HBM 与 SSD 卸载场景下存储占用几乎减半。
2.5 优化策略
在 DeepSeek‑V4 优化配置基础上,我们做若干新改动,适配新架构。
逐头 Muon 优化器:Query 权重按照注意力头切分之后执行 Muon 更新。原始 Muon 为全部头共用一个预条件器;逐头 Muon 给每个注意力头分配独立预条件器,更好处理不同注意力头之间异质性(Zhang 等人,2024;Zhang,2026)。实验显示逐头 Muon 效果优于原版 Muon;GLM‑5(Zeng 等人,2026)、Kimi‑K3(Team 等人,2026a)同样验证该经验优势。
直接对 Engram 参数使用 Adam 会极大膨胀优化器状态内存开销。针对 Engram 嵌入表、token 嵌入表、预测头,我们改用动量更新搭配 Sinkhorn 平衡。该方案只需要动量缓冲区,效果优于 Adam,之前 SinkGD(Scetbon 等人,2025)将 Sinkhorn 平衡应用在线性层权重,我们扩展到这些超大参数矩阵。
基础配置:
-
归一化层权重、偏置、缩放因子等非矩阵参数:AdamW(Loshchilov & Hutter,2019)。 -
语言主干线性层、Engram 投影层、视觉‑语言投影矩阵:Muon(Jordan 等人,2024);Query、Key 权重启用逐头 Muon。Muon 使用解耦权重衰减、Nesterov 动量。归一化层权重使用权重衰减;偏置、缩放因子不使用权重衰减。 -
Engram 嵌入表、token 嵌入、预测头:动量 + Sinkhorn 平衡更新;同样 Nesterov 动量,不做权重衰减。
预训练阶段,学习率衰减阶段之前视觉编码器冻结,只保留最终归一化层与视觉‑语言投影器可训练;进入学习率衰减阶段后解冻视觉编码器,使用更小学习率和 LLM 联合优化。
Engram / 嵌入表 / 预测头的 Sinkhorn 平衡更新算法(算法 1)输入:权重矩阵 \(W_t\in\mathbb R^{m\times n}\),梯度 \(G_t\),动量 \(M_{t-1}\),动量系数 \(\beta\),基础学习率 \(\eta_t\),学习率修正系数 \(\gamma\),数值稳定常数 \(\varepsilon,\tau\),归一化迭代次数 K(奇数)。
-
\(M_{t}\leftarrow\beta M_{t-1}+(1-\beta)G_{t}\) -
\(\hat G_{t}\leftarrow\beta M_{t}+(1-\beta)G_{t}\) # Nesterov 动量 -
计算每行梯度范数 \(\rho_i\) -
\(U^{(0)} \leftarrow \hat G_t\) -
如果 \(\rho_i \le \tau \bar{\rho}\),把对应行置 0 # 掩码近乎零梯度行 -
for k=1…K: if k 是奇数:对每一行做 L2 归一化 else:对每一列做 L2 归一化 -
end for -
\(\Delta_{t}=\sqrt{n}\,U^{(K)}\) # 将行单位 L2 范数转为行单位 RMS -
\(\tilde{\eta}_{t}=\gamma \eta_{t}\) # 对齐 Adam 更新幅度 -
\(W_{t+1}=W_{t}-\tilde{\eta}_{t}\Delta_{t}\)
Sinkhorn 平衡近似均衡更新矩阵行、列方向 RMS。行对应 token 索引 /n‑gram 标识;列对应隐特征。数值不稳定的行会被掩码处理;\(\sqrt{n}\) 做范数转换;\(\gamma=0.18\) 匹配 Adam 更新幅度,和 Moonlight(Liu 等人,2025)0.2 接近。
该类行‑列归一化思想和 Adafactor、Adammini 等优化器相关,但矩阵处理细节不同,未来会进一步对比消融。
3 通用基础设施
3.1 训练基础设施
3.1.1 多模态训练基础设施
对比学习阶段计算‑通信重叠:视觉编码器先经过对比学习目标优化,之后再和生成 next‑token 损失联合微调。对比学习阶段损失需要收集全部数据并行 rank 的图文特征,会产生大量 all‑gather 通信。 文本特征梯度只依赖已经收集完毕的视觉特征;视觉特征梯度只依赖收集完毕的文本特征。因此 all‑gather 通信可以和前向、后向计算互相重叠,不用等待通信完成阻塞计算。调度顺序: \(Forward(V) \to \big (Forward(T) \| AllGather(V)\big ) \to \nabla _{Text } \to (Backward(T) \| AllGather(T)) \to \nabla _{Vision } \to Backward(V)\) V 代表视觉特征,T 代表文本特征;A || C代表计算 A 与通信 C 并行执行。这样两次 all‑gather 全部隐藏在有用计算时间之内。
端到端并行:视觉编码器和 LLM 模型、数据特性差异巨大,我们采用解耦编码器设计(Team 等人,2025,2026b)。视觉编码器复制在 LLM 参数树之外;每个训练 step 拆成三阶段:视觉编码器前向、LLM 前向‑反向、视觉编码器反向。解耦设计避免视觉计算干扰 LLM 流水线,负载均衡的图像处理只发生在首尾两个阶段;LLM 阶段维持纯文本训练原有并行策略不变。
长序列多模态训练优化:DeepSeek‑V4.1‑Flash 训练序列最长到一百万 token;大量多模态样本带来巨大 I/O、CPU、内存压力。
- 均衡图像分片
超长、图像密集单条序列,加载时会耗尽单台主机 I/O、CPU、内存。我们把同一条序列图像分片分配到不同计算 rank 做负载均衡;每张图像只读取一次。只要满足不等式 \(\rho<\frac{B_{IO}}{B_{GPU}} C\),图像加载开销就可以隐藏在计算背后。N(token 总数)会被抵消,条件只和单 token 字节 \(\rho\)、单 token 计算量 C、文件系统带宽 \(B_{IO}\)、GPU 带宽 \(B_{GPU}\) 有关。因此只有小模型消融实验会遇到存储吞吐瓶颈;生产规模模型整体受计算约束。 - 增量图像传输
RL rollout 阶段,图像增量传输给推理引擎;CPU 侧预处理输出缓存在分布式文件系统,供多次 rollout、多次训练复用。
3.1.2 CSA2 的注意力共享训练
2.3 节介绍的 CSA2 存在跨层共享主 KV、索引器 K、Top‑K 索引;大规模分布式流水线训练时,共享源层和消费层可能分布在不同流水线 stage,不能简单直接模块复用。我们采用下面机制支持 CSA2 训练:
- 影子索引器
每个参与 stage 放置轻量可执行副本;逻辑上只保留一份原始参数做优化、保存 checkpoint;参数同步、梯度聚合保证影子副本训练全程一致。不用把共享层特殊处理为流水线调度单元,保持原有模型语义。 - 流水线负载扩展
源层、消费层跨流水线边界时,把下游消费需要的中间表征、稀疏路由信息封装进点对点通信;配合上下文并行做一致分片,避免重复拷贝,保证梯度正常回传。 - 微批粒度共享状态管理
跟踪流水线微批对应的全部共享状态;管理共享状态生命周期:直到最后一个消费单元完成计算之后再释放内存,控制额外内存开销。这套运行抽象隔离物理流水线布局,注意力实现不需要感知硬件排布。
再配合优化器、checkpoint、预热、计算图追踪的少量适配,CSA2 可以在现有分布式训练接口、流水线调度下透明运行。
3.1.3 Engram 模块训练
Engram 嵌入表按行划分到独立进程组(engram 并行度);组大小权衡单设备内存开销与嵌入查询通信范围。每个分片再进一步分片优化器状态。 Engram 查询索引只取决于输入 token 序列;每个流水线 stage 处理微批之前,提前对本地 batch 执行嵌入预取,降低对流水线的干扰。嵌入梯度在反向传播阶段缓存;主干反向传播全部结束之后送回参数所属 rank。
嵌入预取、梯度传输调度和视觉编码器前向、后向计算做时间重叠。嵌入存储、读取全部使用 FP8;取回嵌入与缩放因子直接送入 GEMM 计算。 Engram 表更新阶段,Sinkhorn 归一化维护行列缩放向量,避免反复重写完整归一化矩阵;行归一化、列统计量累加融合到同一个内核,减少内存流量。
RL rollout 阶段 Engram 嵌入表常驻 GPU 显存;降低主机内存压力,避免主机内存碎片导致 OOM。
3.2 推理系统
DeepSeek‑V4.1‑Flash 推理效率是设计第一优先级;虽然概念架构复杂,但内核流程非常简洁。大量内核融合:FlashMLA 的 RoPE‑Attention‑RoPE‑cast 融合内核、DeepGEMM 的 Mega‑Gate/Mega‑mHC/Mega‑MoE、TileKernels、DeepSelect TopK 内核。 结果就是:绝大多数 Reuse 模式 CSA2 层,预填充仅执行 15 个内核,解码仅 11 个内核,实现高吞吐、低延迟推理。
部署层面使用编码器‑预填充‑解码器解耦(EPD),视觉编码、prefill、解码可以独立扩缩容,执行时间互相重叠。
3.2.1 持久化 KV 缓存管理
相同工作负载下,V4.1 持久化 KV 缓存体积只有 V4 的 1/8,来自两个相乘因子:
-
SWA KV 不再存入持久缓存,体积近乎减半; -
留存的全局 KV 通过架构与精度压缩,体积缩减到 V4 的 1/4。
V4 部署中 SWA KV 几乎占持久 KV 缓存一半。V4 中全局 KV、SWA KV 独立管理,使用 LRU 淘汰。全局 KV 完整保存,命中时直接复用完整前缀;SWA KV 只在 prompt 末尾、输出生成末尾缓存,便于重建、多轮会话。为保证高命中率,SSD 上分配很大持久 KV 缓存,典型工作负载两类 KV 可以驻留 72 小时以上。 但 SWA KV 持久存储性价比很低:SWA KV 只在活跃会话短短几分钟窗口复用;会话结束、轮次更新后 SWA KV 就彻底失效。V4 报告中提出 Zero‑SWA 缓存方案:不持久存储 SWA KV,缺失时重新计算。但精确恢复 SWA KV 需要完整重放 \(L ×n_{win}\) token,生产环境开销过高。
V4.1 修改持久 KV 缓存管理规则:
- SWA KV 不再写入持久化 KV 缓存
;仅放在每台机器主机 DRAM 划出的分布式内存池(占本机主机内存 10%)。该池总容量不大,但 TTL 只有数分钟;过期条目立刻回收给新会话。真实业务负载下高周转足以服务绝大多数并发活跃会话。全局 KV 依旧保留在持久 KV 缓存,保证至少 72 小时生命周期。 -
驱逐 SWA KV 必然发生缓存未命中;依靠轻量回退方案:编码器 SWA 有界重放(3.2.2 节)。当全局 KV 命中、SWA KV 缺失,只需要重放最近 \(n_{win}\) 个 token,而不是完整 \(L ×n_{win}\) token 前向。这个有界重放是整套方案基石:把灾难性缓存失效变为代价很小的温和降级, justifies 把 SWA KV 移出持久 SSD 缓存。
3.2.2 SWA 有界重放
精确重建 L 层 SWA KV,需要重放 \(L ×n_{win}\) token。SWA 有界重放只重放 prompt 末尾最近 \(n_{win}\) 个 token;对 SWA 窗口做截断,生成近似状态。重放起始位置 s,位置 i 的 query 只会访问区间 \([max (s, i-W+1), i]\) 的 SWA key。
编码器 SWA 有界重放:让前缀缓存只依赖全局 KV,SWA KV 不再放到持久缓存。 编码器 SWA KV 缺失时,重放缓存前缀的末尾 \(n_{win}\) token,和未缓存后缀一起处理。重放 token 只用于重新生成 SWA KV;已经缓存的全局 KV 直接复用,不会重算、不会覆盖;未缓存后缀同时生成全局 KV 与 SWA KV。 重放得到的状态是近似的,未缓存后缀对应的全局 KV、SWA KV 数学上和完整计算不完全等价。但实验证明该近似几乎不损害回复质量。
解码器 SWA 有界重放:CED 架构下解码器全局 KV 全部从编码器最后隐状态投影而来。预填充阶段唯一阻碍提前结束的就是解码器 SWA KV—— 解码器 SWA KV 需要每一层自己的隐状态,供第一轮解码使用。我们同样不缓存解码器 SWA KV;精确重建需要在解码器层完整跑 prompt 末尾 \(\frac{L}{2} ×n_{win}\) token;当长缓存前缀后跟着很短未缓存后缀时开销巨大。 因此预填充时也执行有界重放:只重放 prompt 末尾最近 \(n_{win}\) token,将对应的编码器输出送入解码器层,在 SWA 截断约束下生成解码器 SWA KV;该重建的 SWA KV 只用于解码,不用于前缀缓存。重建解码器 SWA KV 和完整解码器前向数学上不等价;但质量损失微乎其微。为安全起见,后训练阶段模拟同样重放逻辑,让模型在训练阶段就适配该近似。
4 预训练
4.1 数据构建
文本数据筛选构建:我们不再局限小实验样本层面质量,更加关注不同语料混合带来的整体信息增益,建立更加系统化标准化的数据构建流水线,改善数据质量,优化数据配比。基于全面评测,设计一套针对模型参数量、训练 token 数的扩展阶梯,指导大规模训练。 过滤信息增益有限的模型生成内容,包括弱模型输出、低质量机器翻译文本,视作隐式重复内容,避免长训练周期带来负面影响。探索模型‑in‑the‑loop 迭代数据,为未来大规模合成数据打基础。引入领域专家构建细粒度数据质量评估维度。对比上一版本,新语料纳入更多新开源仓库、提交、库、新兴框架的代码,覆盖更广编程语言,更贴合当代软件工程真实场景。
多模态数据构建:多模态预训练数据集主要三类:图文对、图文交错文档、领域专用数据。 我们不做大规模合成多模态数据,优先清洗、利用原生网页数据,低成本大规模压缩视觉知识。原始爬虫系统偏向文本网页;因此从 Common Crawl 重新引导抓取,提升多模态源覆盖率。
-
图文对:从网页提取图片 + alt 文本,图文相关性阈值过滤,基于图像语义做去重。 -
交错图文数据:主要来自网页、PDF;分多轮启发过滤、去重、质量模型打分,提取高价值文档,组装交错图文序列;再做图像感知过滤、去重;最后 SmolVLM 做严格图文质量打分。被过滤文档一部分重组为额外图文对。 -
领域数据集:补充视觉定位、OCR、长尾知识;大量图像‑代码对、计算机使用轨迹,提升多模态智能体理解能力。
数据合并与去重:文本、多模态来自两套流水线,最终取两者合集;重叠样本用多模态版本替换文本版本,继承更大 epoch 计数。纯文本 token : 多模态 token = 7 : 1。预训练、上下文扩展阶段联合预取分配样本,最小化样本重叠。超长文档预拆分;优化 packing 算法,padding 率最高不超过 \(10^{-4}\)。
4.2 预训练配置
4.2.1 模型配置
Transformer 层数 40,隐维度 d=5120;CED 架构 20 层编码器,20 层解码器。前两层只用 SWA。剩余 18 层编码器 CSA2 压缩比 m=2;分三组,每组 6 层;每组第一层 Full 模式,剩下 5 层 Reuse 模式。 20 层解码器 CSA2 压缩比 m=1;分五组,每组 4 层。第一组第一层 Full 模式,剩下 3 层 Reuse 模式;其余四组每组第一层 Reindex 模式,剩下 3 层 Reuse 模式。
全部 CSA2 层:索引器 query 头 32,索引器头维度 128;稀疏注意力选出 Top‑K=512 条 KV 条目。Query 头数 64,头维度 512,query 压缩维度 1280。分层稀疏索引器最多选 2048 块,每块 8 位置,候选池最多 16384 位置。输出投影分组 8,每个注意力输出中间维度 1024。SWA 窗口大小 \(n_{win}=128\)。
全部 Transformer 块使用 MoE 层,激活函数 SwiGLU 带阈值 10 截断;每个 MoE 包含 1 个共享专家、384 个路由专家;每个 token 激活 6 个路由专家;每个专家中间隐维度 2304。mHC 扩展系数 4;Sinkhorn‑Knopp 迭代次数 20。
视觉编码器 DeepSeek‑ViT:32 层,隐维度 1024,注意力头 16,patch 尺寸 14。视觉 MLP 投影器两层,隐维度 5120。
整套配置主干参数 552B;预填充每 token 激活 8B,解码每 token 激活 16B。
4.2.2 训练配置
线性层权重矩阵使用 Muon;RMSNorm 权重、其他非矩阵参数 AdamW;嵌入、预测头使用 Sinkhorn 平衡动量更新。 AdamW:\(\beta_1=0.9\),\(\beta_2=0.95\),\(\varepsilon=10^{-20}\),weight_decay=0.1。 Muon 动量 0.95,weight_decay=0.1;更新矩阵 RMS 缩放至 0.18 复用 AdamW 学习率。 Sinkhorn 平衡:动量系数、学习率修正因子同 Muon;K=11,\(\tau=10^{-3}\),\(\varepsilon=10^{-20}\)。Engram 学习率放大 5 倍。
DeepSeek‑V4.1‑Flash 在 45 万亿 token 多模态数据训练,训练全程稳定。batch 大小固定 1.006 亿 token。学习率前 2000 步线性预热到 \(2.6 ×10^{-4}\);维持该值直到 28T token;28T‑40T token 之间 cosine 衰减到 \(2.6 ×10^{-5}\);40T‑45T 保持该学习率。 稀疏注意力直接在 64K 序列从零训练;34T token 时序列长度扩展到 1M。 无辅助损失负载均衡:文本、图像 token 偏置更新速度 0.001;保留很小序列级平衡损失 loss weight=0.0001,避免单序列内部极端不均衡。预训练阶段使用样本级注意力掩码。
视觉编码器训练:DeepSeek‑ViT 分两阶段独立训练,之后接入语言主干。
- 对比预训练
约 47B 图文对,SigLIP sigmoid 对比损失;最大输入分辨率限制 224×224;更高分辨率带来收益有限,但计算开销暴涨。 - 自回归微调
视觉编码器对接 4B MoE LLM,在 236B token 数据集(图像 caption、alt‑text、图表、OCR)next‑token 损失训练。输入分辨率区间 544×544 ~1344×1344。完成后丢弃中间 4B LLM,保留训练好的 ViT 给后续 LLM 预训练使用。
4.3 评估
4.3.1 评估基准集
对比 DeepSeek‑V4‑Flash‑Base、DeepSeek‑V4‑Pro‑Base;评测五大维度:世界知识、语言理解推理、代码数学、长上下文、多模态。
- 世界知识
AGIEval、MMLU‑Pro、C‑Eval、MultiLoKo、SimpleQA‑Verified、SuperGPQA。 - 语言理解与推理
BBH、BBEH、DROP、HellaSwag。 - 代码数学
BigCodeBench、HumanEval、GSM8K、MATH、MGSM。 - 长上下文
LongBench‑V2。 - 多模态
MMMU‑Pro、DocVQA、CVBench、RefCOCO / RefCOCO+ / RefCOCO‑g。
4.3.2 评估结果
表 1 基座模型对比 DeepSeek‑V4‑Flash‑Base / V4‑Pro‑Base / V4.1‑Flash‑Base在统一内部评测框架;分数差≤0.3 视作同一水平;每行粗体最优,下划线次优。
DeepSeek‑V4.1‑Flash‑Base 激活参数量远小于 V4‑Pro‑Base,KV 缓存大幅缩减,但整体性能和前代持平甚至更好。反映预训练数据流水线改进;原生多模态预训练带来多模态能力。 在世界知识、理解能力和 V4‑Pro 接近;推理、代码多项指标超过或接近 V4‑Pro。
额外在内部私有评测集做困惑度 BPB 测试(字节每 bit,数值越低越好):内部文档、内部代码库、学术材料三类;V4.1‑Flash‑Base 全部取得最低 BPB,说明作为基座模型潜力很强。
5 后训练
5.1 后训练流水线
本版本后训练没有提出新算法;标准流程:SFT 监督微调 → RL 强化学习 → OPD 同策略蒸馏。全部实质性改进落在大规模自动化任务合成、环境构建工程。 把任务形式化为三元组(问题,环境,验证系统);从难度、正确性两个维度做质量校验。在固定算法框架下,合成数据与环境的规模、多样性、可验证性几乎决定全部性能收益。这印证现阶段:后训练中数据与环境工程的边际收益大于算法创新。
5.1.1 大规模智能体任务合成
任务是智能体训练燃料;高质量任务传统上需要大量人力。我们利用模型本身做任务生成与质量校验迭代训练,迭代产出更好任务。监控任务全生命周期,RL 训练产生轨迹用来复审计任务质量。搭建两大场景流水线:通用智能体、编码智能体。
通用智能体:收集内部员工、外部伙伴真实工作交互数据;基于真实交互接口模拟工具,复现 SaaS、企业应用、后端系统输入输出、约束;大规模收集失败 case,生成单轮、多轮智能体环境,定向针对模型弱点强化学习。
编码智能体:两类来源:①员工与外部伙伴 agent 会话,筛选高复杂度、模型失败案例,轨迹去重;②满足星标条件的公开 GitHub 仓库。多智能体协作完成环境构建:确定可容器构建、设计任务点;隔离容器搭建依赖;独立质检 agent 检查 bug、可 hack 漏洞;不通过则自动修复迭代,直到质检通过。
整套流水线可以批量自动产出正确、难度可控、长度可控的 RL 训练数据;不管是复刻真实工作流的通用智能体,还是精确构造编码任务,全部接入统一训练系统,持续监控质量迭代。
5.1.2 合成任务上的强化学习
大规模异步 RL 训练提升模型复杂场景能力。RL 训练在两个维度做规模扩展:训练计算量、智能体框架 scaffold 数量。 我们将 rollout 执行和训练解耦:agent 沙盒运行 scaffold 与工具;worker 容器提供框架无关控制层,统一异构交互为标准轨迹 schema,和训练器通信。整套运行在 DSec 平台(5.1.3),和抢占式 GPU 训练池隔离。训练器被抢占时 rollout 可以暂停、落盘保存完整状态,后续恢复,释放 GPU、CPU 资源。 为在多次 RL 运行间复用收益,使用模型合并:合并不同 scaffold、不同配置的 checkpoint,聚合多条优化路径收益,简单高效地继续扩大计算规模。
5.1.3 大规模运行智能体:DSec 平台
从 V3 到 V4,智能体训练环境越来越多样,我们开发 DSec(DeepSeek Elastic Compute)生产级沙盒平台,用于大规模智能体训练评估。 V4.1 训练需要数百万并发沙盒实例,横跨不同 harness、平台、代码仓库、依赖库、任务服务。瓶颈转向集群可扩展性、工作负载隔离、单机计算密度、遏制智能体异常行为。
- 水平扩展分片调度
不用 K8s 这类通用编排;自研 placement 调度引擎,牺牲全局强一致性换取可扩展性。多副本调度器互相不同步,只保证最终一致性;每个节点本地做硬准入校验拒绝过载。整套系统可以扩展至数百万容器,不会被中央协调成为瓶颈。 - 单机高密度运行
硬件 sub‑NUMA 划分;worker VM 绑定独立 NUMA 域;CPU 内存隔离。单机并发容器上限从约 1000 提升至 2500+。引入延迟敏感执行类 LS;非 LS 任务 SCHED_IDLE 低优先级;同超线程兄弟核只跑同优先级任务,消除干扰。 - 遏制智能体恶意行为
RL 中 agent 会奖励劫持、崩溃环境,甚至尝试删系统文件、利用漏洞。每个沙盒绑定 AppArmor 配置文件、细粒度 eBPF 网络策略。环境崩溃直接视作失败轨迹,向 RL 框架反馈惩罚信号。
5.1.4 RL 中的可控推理强度
输出 token 数量直接决定推理成本,真实业务需要在效果‑开销之间做权衡。因此在强化学习中引入标量推理强度 b作为显式条件信号,单轮推理、多轮智能体任务都生效。 系统 prompt 开头插入指令: Reasoning Effort: {effort} (range 1–100; higher values request more thorough reasoning)\(b \in \{1,...,100\}\) 为请求强度等级。
对每个 prompt x,每个强度 b 采样 M_b 条回答: \(z_{b,j}\sim \pi _{\theta }(\cdot | x,b), b\in \mathcal {B},\ j=1,... ,M_{b}.\) 同一个 (x,b) 组内回答做 reward 均值中心化,计算组内相对优势;不同 b 之间不直接比较回报。依靠和 b 绑定的长度惩罚项塑造行为: \(r_{b, j}^{len }=-min \left\{C_{max }, k(b) \frac{\ell_{b, j}}{L_{norm }}\right\}\) \(\ell_{b,j}\) 推理 token 数,\(L_{norm}\)参考长度,\(C_{max}\)最大惩罚上限。惩罚系数随请求强度指数衰减: \(k(b)=k_{0} exp \left(-\frac{b-b_{min }}{\tau}\right), \tau=\lambda \overline{\Delta b}.\) \(k_0\)是最低强度惩罚系数;\(\tau\)控制惩罚衰减速度。b 增加 τ,惩罚系数乘以 \(e^{-1}\)。附录 C 提供该指数参数化的效用推导。
部署时,标量 b 提供灵活控制接口,在成本‑精度前沿平滑切换;训练只使用有限离散强度,但部署可以输入中间插值数值,精细分配资源。 我们 2026 年 9 月上线的公开 API 对外暴露三档预设推理强度:max、high、low,分别对应 b=100、75、50。
表 2 API 推理强度档位和底层标量 b 映射
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
5.2 异步后训练基础设施
LLM 的 RL rollout 长尾问题一直是训练效率瓶颈。我们扩展后训练基础设施支持异步样本生成,大幅缓解 rollout 长尾,几乎全部 RL、OPD 任务启用异步。
5.2.1 整体工作流
rollout 与训练物理机器共存,时间片复用,不用手动调参分配资源。任务设置最大飞行样本数,全程维持该并发。 我们最终选用样本级分发:只要新完成样本数量达到下一组 GRPO 组大小,就下发新 prompt,不关心来自哪一批 rollout。对比:批粒度分发震荡严重;prompt 级分发容易被长尾样本卡住。 收集足够训练样本后,训练抢占正在运行的 rollout;样本跨多个 checkpoint 时,拼接每段 rollout 产生的专家路由,而不是丢弃重算。
5.2.2 缓解长度偏置与离策略影响
异步生成带来两个副作用:
- 长度偏置
短样本更快完成,早期训练 batch 被短序列主导。 - 离策略样本
部分 token 由更早版本 checkpoint 生成。
对策:
-
长度偏置:数据集粒度限制并发,间接调节稳态 batch 样本来源;丢弃过早返回的极短样本,平滑过渡到稳态长度分布,防止模型过拟合短回答。 -
离策略:控制最大离策略比例,不让训练数据和当前模型偏差过大;损失掩码,剔除过期程度过高 token 梯度贡献。
5.2.3 性能优化
支持token 粒度中断:收集足够训练数据,几乎立刻停止全部运行中样本,切换训练。 rollout 状态(KV 缓存、专家路由)按 token 粒度持久保存;切换新 checkpoint 时直接复用状态,不用重新 prefill;样本完成立刻垃圾回收释放状态。这套快速中断、无缝恢复机制同样可以响应集群抢占信号,提升集群利用率。
5.2.4 大规模同策略蒸馏 OPD
后训练最后一步全词表 OPD,跨多个领域数据集训练;使用超过 40 个教师模型。启用异步生成提升 rollout 效率。不同领域最优教师可以来自训练不同阶段;教师可以和学生架构不同。我们的基础设施支持大量异构教师,切换代价几乎可以忽略。 异步环境中,新的数据集配比、并发限制、活跃教师配置生效时,允许新旧配置样本同时在飞行,保证平滑过渡。
5.3 评估
5.3.1 评估设置
后训练评测重点是推理与智能体;知识能力看 4.3 基座结果。
- 推理
GPQA‑Diamond、Humanity’s Last Exam、Codeforces、MathArena‑Apex;temperature=1.0,top‑p=1.0。 - 代码智能体
Terminal‑Bench 2.1/3.0/4.0、DeepSWE v1.1、ProgramBench、NL2Repo‑Bench。 - 网络安全智能体
SEC‑Bench Pro、CyberGym、ExploitGym。 - 通用智能体
Automation‑Bench、Agents’ Last Exam。 - 视觉智能体
Chartography、BabyVision、ZeroBench‑main。
DeepSeek‑V4.1‑Flash 代码 agent 评测使用 DeepSeek Harness Minimal 模式,1M 上下文,temperature=1.0,top‑p=0.95;DeepSWE v1.1 使用 mini‑SWE harness;SEC‑Bench Pro 使用 Claude Code harness;视觉 agent 512K 上下文,temperature=1.0,top‑p=0.95;Automation‑Bench、Agents’ Last Exam 使用官方 scaffold。
为防止奖励劫持,评测环境禁止互联网,清除 git 历史、各类编译缓存。但模型依旧会尝试漏洞挖掘,我们呼吁社区未来基准重点防范模型博弈评测规则。
5.3.2 评估结果
表 3 DeepSeek‑V4.1‑Flash 与闭源、开源模型对比推理:GPQA‑Diamond 90.9;Codeforces 评分 3471;MathArena‑Apex Pass@1 达到 65.6%,和 Kimi‑K3 持平。 智能体亮点:DeepSWE v1.1 解决率74.2%,超过 Opus‑5 (74.0)、GPT‑5.6 Sol (73.0);Terminal‑Bench 2.1 Pass@1 达到 90.6%;Automation‑Bench 54.8%;Agents’ Last Exam 31.8%,领先开源与多数闭源基线。 网络安全任务在开源模型中 SOTA;视觉智能体超过开源 Kimi‑K3,但依旧弱于顶尖闭源。
除峰值性能外,模型具备推理强度调节能力,在精度和 token 开销之间可控权衡。推理强度从 25 提升到 100,8 项推理基准平均 Pass@1 从 67.1% 提升到 76.3%;DeepSWE v1.1 从 66.0% 到 74.2%;Terminal‑Bench 2.1 从 82.4% 到 90.6%;代价输出 token 数量大约 ×2.5。收益集中在中低区间:60‑80 强度档位就可以拿到绝大多数最高档位效果,但 token 开销不到 max 档位一半。max 档位留给最难任务;中等强度更适合日常智能体业务。
5.3.3 不同推理强度的性能
推理强度升高,推理 trace 变长,推理密集任务准确率单调上升;收益边际递减。虽然 RL 训练只用离散档位,但标量强度可以插值,部署时平滑控制时延‑质量权衡。时延敏感业务用 low,难题切 max。
5.3.4 跨智能体框架 scaffold 性能
实际部署不会固定一套 agent 框架;不同 scaffold 的 system prompt、工具定义、上下文管理不同;模型不能过拟合单一 harness。 我们测试 6 套框架 8 种配置:Claude Code、Codex、OpenCode、Pi、mini‑SWE、DeepSeek Harness(Minimal / Standard / PTC);固定模型权重、解码参数,只更换外围框架。
表 4 Max 推理强度下不同 scaffold 在 DeepSWE v1.1、Terminal‑Bench v2.1 结果模型能力可以很好迁移不同提示词、工具接口,不是绑定某一套框架;得益于训练数据中大量多样化环境、工具 schema。
5.3.5 多智能体实验
在 DeepSeek Harness Agent Team 模式做多智能体初步实验。主 agent 可以异步生成命名持久队友(spawn_teammate);fresh 模式不带主 agent 历史,fork 模式复制主 agent 已完成轮次快照。所有 agent 共享代码仓库;通过持久消息邮箱 send_message 互相通信;wait_agent 等待队友状态;task board 维护任务分配、依赖、写权限;lead 可以 interrupt 中断队友执行;全部完成后主 agent 审核合并结果,产出最终输出。
RL 奖励综合任务得分、协作奖励(鼓励委派、通信)、衍生时延惩罚(基于 DAG 关键路径,鼓励并行,惩罚不必要串行)。
评测集:ProgramBench 筛选高置信 gold 子集 172 个任务;FrontierSWE v2 无 GPU 子集。对比单智能体、多智能体,设置不同 rollout 墙上时钟截止时间。
图 10 单智能体 vs 多智能体在 ProgramBench、FrontierSWE‑v2;随每轮 rollout 时限变化。多智能体在全部时间条件下优于单智能体。ProgramBench 多智能体峰值 30.04%(8h),单智能体峰值 20.39%;FrontierSWE v2 多智能体 32.90%(20h),单智能体 28.20%。
6 结论、局限性与未来工作
本文提出 DeepSeek‑V4.1‑Flash,支持百万 token 上下文的多模态 MoE 模型。通过架构、缓存精度、部署策略联合优化,挖掘 KV 缓存压缩极限。CED 架构预填充每 token 激活仅 8B 参数,解码 16B 参数,适配输入密集智能体负载。 CSA2 跨层 KV 复用结合 FP4 KV 缓存,HBM 中的全局 KV 缓存每 token 890 字节,约为 DeepSeek‑V4‑Flash 的 1/4。SWA 有界重放进一步把 SSD / 主机内存持久 KV 缓存压到 V4‑Flash 的约 1/8。缓存大幅降低同时整体性能优于 DeepSeek‑V4‑Flash。虽然主干规模很大,但激活占用远小于 GLM‑5.3、Kimi‑K3 等开源竞品,多个任务取得持平甚至更优结果。
尽管相比 V4‑Flash 很多组件被简化,新引入架构改动带来尚未被充分刻画的鲁棒边界。内部评测覆盖大量 case,但有限测试集无法穷尽全部极端。

