DeepSeek-V4.1-Flash 是一款拥有 552B 参数的原生多模态 MoE 大模型,支持 1M token 超长上下文。该模型核心针对长文本推理中 KV 缓存显存占用高、IO 带宽瓶颈及部署成本高等行业痛点,通过架构革新实现了极致的缓存压缩。
一、核心架构升级
1. CED 因果编解码架构
模型采用“20 层编码器 + 20 层解码器”结构,解码器的全局 KV 由编码器末层隐状态直接投影生成,从而优化长短文本推理的算力分配。在 Prefill 阶段,单 Token 激活 8B 参数;在 Decode 生成阶段,单 Token 激活 16B 参数。这种设计特别适配 RAG(检索增强生成)、智能代理等“输入远大于输出”的场景,显著降低了预处理阶段的算力与时间开销。
2. CSA2 第二代压缩稀疏注意力
新一代模型摒弃了前代 CSA+HCA 混合注意力方案,转而采用纯 CSA2 架构,实现了跨层 KV 数据与索引的复用,彻底消除了多层 Transformer 结构中的 KV 存储冗余。该架构包含三种工作模式:
Full 模式:初始化生成全局 KV 缓存并构建稀疏索引;
Reindex 模式:复用前层 KV 数据,仅通过当前层 Query 重新筛选关键 Token 索引;
Reuse 模式:完全复用前层 KV 数据与索引,直接执行稀疏注意力计算。
此外,编码器侧采用 2:1 Token 压缩,解码器侧保持 1:1 完整精度,有效平衡了长文本检索精度与存储成本。
二、KV缓存压缩技术体系
模型通过多项技术叠加,实现无损极致压缩,构建了低开销的长文本推理能力:
跨层 KV 复用:依托 CSA2 架构,消除各层独立存储 KV 的冗余问题;
FP4 低位量化:训练阶段原生支持 4bit FP4 量化存储全局 KV,确保精度损失可控;
SWA 滑动窗口机制:优化缓存持久化逻辑,无需完整落盘滑动窗口 KV 数据,降低 SSD 存储与 IO 压力;
动态稀疏筛选:保留上下文关键 Token KV,过滤无效冗余信息,进一步压缩缓存体积。
综合优化后,单 Token 全局 KV 缓存开销仅为 890 字节。相较于 V4-Flash,显存缓存压缩 4 倍、SSD 持久化缓存压缩 8 倍;较初代模型,压缩比高达 437 倍。
三、模型性能与落地价值
作为文本与图像联合原生训练的多模态架构,DeepSeek-V4.1-Flash 支持 1M 超长上下文与 384K Token 最大输出长度。在核心评测中表现优异:GPQA Diamond 得分 90.9,Codeforces Rating 达 3471,DeepSWE v1.1 为 74.2,CyberGym 为 88.1。其综合能力优于 V4-Flash,部分核心指标甚至超越 V4-Pro。
在工程落地层面,极低的 KV 缓存开销大幅提升了超长上下文场景的并发能力,缓存使用成本低至 0.003 美元/百万 Token。这有效解决了智能代理多轮调用、长文档 RAG 场景下显存不足、带宽受限及存储成本高昂的核心痛点。
四、总结
DeepSeek-V4.1-Flash 并未通过缩减模型参数来降低成本,而是基于 CED 编解码架构与 CSA2 稀疏注意力,从 Transformer 底层重构了 KV 缓存存储逻辑。配合低位量化与滑动窗口优化,该模型在保障并提升综合性能的前提下,突破了大模型 KV 缓存压缩的极限,大幅降低了超长上下文业务的推理与部署成本。

