大数跨境

Deepseek v4.1 flash—长时智能体,更激进的KV压缩

Deepseek v4.1 flash—长时智能体,更激进的KV压缩 AI Infra之道
2026-09-12
3
导读:背景DeepSeek-V4.1-Flash 是一款面向长上下文和智能体场景的多模态 MoE 模型。

背景

DeepSeek-V4.1-Flash 是一款面向长上下文和智能体场景的多模态 MoE 模型。其语言主干由 40 层因果 Transformer 组成,分为 20 层编码器和 20 层解码器,包含 552B个骨干参数和 196B个 Engram 参数。每个 token 在预填充阶段激活 8B参数,在解码阶段激活 16B参数。

模型的核心优势在于大幅压缩 KV 缓存:在相同序列长度和工作负载下,其运行时 KV 缓存仅约为 DeepSeek-V4-Flash 的四分之一,持久化 KV 缓存仅约为八分之一,同时整体性能更强。这一改进主要来自两方面:(一)通过架构和精度优化,将全局 KV 缓存压缩至原来的约四分之一;(二)通过 SWA 有界重放,不再将 SWA KV 长期持久化到 SSD。缓存缺失时,只需重放最近的n_win 个 token,即可近似恢复所需状态。

Architecture

上图可知,DeepSeekV4.1由多模态编码器、SWA、CSA2、CED、Engram、MoE等几部分组成,下面对新增的结构进行讲解。

多模态架构

多模态输入路径由视觉编码器和 MLP 投影器组成。对于每张输入图像,视觉编码器会生成一个空间排列的视觉特征网格。随后,模型执行 3 ✖️ 3的pixel-unshuffle(像素反重排)操作,将每个局部邻域沿通道维度重新排列,并在此过程中降低空间分辨率。之后,MLP 投影器将这些特征映射到语言骨干网络的隐藏维度。视觉编码器采用采用ViT架构,称为DeepSeek-ViT,能够处理原生不同分辨率的图像。上述过程描述成:

因果编解码(CED)

CED的设计受到YoCo的启发,上半部分网络直接共享下半部分网络生成的KV cache。

输入序列   ↓前 20 层 Causal Encoder   ↓H20 = H_{L/2}   │   ├── W_KV^21 → C21 ─┐   ├── W_Z^21  → Z21 ─┘ → 压缩 → C̄21 → Top-K → 第21层全局注意力   │   ├── W_KV^22 → C22 ─┐   ├── W_Z^22  → Z22 ─┘ → 压缩 → C̄22 → Top-K → 第22层全局注意力   │   ├── W_KV^23 → C23 ─┐   ├── W_Z^23  → Z23 ─┘ → 压缩 → C̄23 → Top-K → 第23层全局注意力   │   ...   │   ├── W_KV^40 → C40 ─┐   └── W_Z^40  → Z40 ─┘ → 压缩 → C̄40 → Top-K → 第40层全局注意力

CSA2

CSA有三种模式,Full模式、Reindex模式、Reuse模式,具体哪一层使用哪种模式,是提前静态配置的。

上图中的Main KV来自于Encoder产生的全局共享KV数据,Indexer K由Main KV经过投影层产生的轻量索引器。

  1. Full 模式,该层计算自身的Main KV 和Indexer Q,并根据Main KV 投影得到Indexer K。随后,索引器运行并生成新的 Top-K 索引。因此,Full 模式执行完整的 CSA2 计算路径,其组件职责与 DeepSeek-V4 中的完整 CSA 层相同。
  2. Reindex模式,该层复用前面某一层最近生成的Main KV,以及与其对应的Indexer K。索引器计算当前层自己的查询向量,对复用的索引器 K 重新评分,并生成新的 Top-K 索引。这样,主 KV 和索引器 K 可以在不同层之间共享,同时每一层仍然可以改变稀疏选择结果。
  3. Reuse模式,该层复用最近可用的主 KV,并复用前面某个 Full 或 Reindex 层针对该主 KV 计算出的最新 Top-K 索引。

层次化稀疏索引器(Hierarchical Sparse Indexer)

长上下文中,对当前 Query 真正重要的历史位置通常是少数,直接检索成本太高。假设压缩后有 M 个全局 KV 位置,Indexer K 维度为d。如果每个深层索引器都扫描全部位置,单个 Query 的成本大约是D * O(Md)。如果有很多深层,成本会随上下文长度线性增长。

层次化稀疏检索器的思想是:浅层索引负责从全局KV中构建候选池C,深层索引器从C中进行检索,总成本变成O(Md) + D * O(Cd),由于C << M,所以总计算量变小。

如上图,Decode中第一个CSA2层处于Full模式,根据Full positions选择top-512个索引,并简历候选池,之后的Reindex mode直接从候选池中获得TopK-512个索引。

此外,模型还引入single-pass mHC、Engram及FP4(MXFP4)主KV缓存等技术,这些会在记下来的文章中详细展开。

总结

  1. 高效长上下文:DeepSeekV4.1-Flash 支持百万级上下文,通过 KV 缓存压缩和 SWA 有界重放,将运行时缓存降至约四分之一、持久化缓存降至约八分之一。
  2. 多模态 CED :模型融合文本和图像输入,并利用编码器生成解码器所需的全局 KV,从而减少预填充计算。
  3. CSA2 稀疏注意力:通过 Full、Reindex 和 Reuse 三种模式跨层复用 KV 与 Top-K 索引,并利用候选池减少长上下文中的检索开销。

【声明】内容源于网络
0
0
AI Infra之道
AI infra时代已经到来,大家一起打造中国的AI知识库
内容 17
粉丝 0
AI Infra之道 AI infra时代已经到来,大家一起打造中国的AI知识库
总阅读106
粉丝0
内容17