搜索
首页
大数快讯
大数活动
服务超市
报告
跨企查
广告开户
APP
产业带
导航
知识体系
工具箱
产业园
更多
百科
找货源
跨境招聘
DeepSeek
首页
>
深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手
>
深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手
AI科技评论
2026-09-10
2
导读:KV 缓存暴降 437 倍,Agent 成本大洗牌。
KV 缓存暴降 437 倍,Agent 成本大洗牌。
作者丨高允毅
编辑丨岑 峰
DeepSeek
V4.1-Flash 正式上线,其核心亮点在于针对长上下文场景进行了彻底的架构重写。传统认知中,更强的智能往往依赖庞大的算力支撑,导致超长上下文的应用门槛极高。然而,DeepSeek 通过引入因果编码器 - 解码器架构(CED)、第二代压缩稀疏注意力机制(CSA2)以及可调节的推理力度旋钮,成功打破了这一规则。
新架构将大模型的“记忆
体积
”压缩至极致:运行时显存占用减少 75%,硬盘长期记忆占用仅为上一代的 1/8。这使得 DeepSeek V4.1-Flash 在大幅降低成本的同时,智力表现超越上一代 DeepSeek V4-Pro,推动百万 Token 级超长上下文真正进入工业级生产力阶段。
CED 架构:预填充算力减半,重构长文本处理逻辑
在长文本 Agent 场景中,最昂贵的环节是“预填充”。无论是
工具
调用返回还是多轮对话推进,模型都需重读全部上下文以生成 KV 缓存,这在百万级场景下极易占满 GPU 资源。上一代架构仅提升了读取
速度
,未减少读取容量。
DeepSeek V4.1-Flash 采用的 CED 架构直接将预填充算力削减 50%,并将持久缓存成本降至上一代的 1/8。对于企业用户而言,复杂任务的算力成本从 10 元级别骤降至 1-2 元。
其原理在于将 40 层神经网络一分为二:前 20 层作为“因果编码器”,通读全文并输出高度浓缩的隐状态摘要;后 20 层不再重读原文,而是通过投影矩阵直接从摘要中生成全局 KV 缓存。这种“先读薄、只捞重点”的策略,从根本上降低了计算量。
针对代码生成等需精准捕捉局部细节的场景,模型结合了“滑动窗口注意力(SWA)”与“有限回放”机制。后者通过挑选极少数 Token 用近似值还原短期记忆,在确保精度的同时避免了算力爆炸。
CSA2 机制:跨层复用与量化压缩,解决存储瓶颈
若 CED 解决了计算量问题,CSA2 则专注于攻克存储量难题。上一代架构中,40 层网络每层均保留完整的 KV 缓存副本,导致显存冗余严重。V4.1-Flash 通过 CSA2 实现跨层 KV 复用和索引复用,让 40 层网络共用一个副本,大幅降低显存占用。
CSA2 简化了内部设计,移除重复压缩区与繁琐的位置算法,直接转换核心记忆。为极致优化,系统为每层静态分配三种模式:
Full 模式:通读全文,生成完整 KV 及索引,筛选 Top-K 重点;
Reindex 模式:复用 Full 模式生成的缓存,按需重新筛选重点,不额外存储;
Reuse 模式:直接利用已有索引进行计算,跳过复杂索引生成。
配合分层稀疏索引器,仅有极少数层处于高消耗的 Full 模式。此外,模型引入 FP4 量化技术,对长期核心记忆采用低精度 FP4 格式,对短期细节保留高精度 FP8 格式,并结合量化感知训练(QAT)确保运行精度几乎无损。
最终,CSA2 叠加 FP4 使单 Token KV 体积降至前代的 1/4,结合 CED 与 SWA 机制,落盘持久 KV 缓存更是降至前代的 1/8。成本缩减收益一半来自短期记忆的即用即弃,另一半来自全局记忆的架构压缩。
性能实测:小激活规模媲美顶级旗舰,重塑竞争维度
DeepSeek V4.1-Flash 拥有 552B 主干参数及 196B 外挂记忆模块,但在运行时,预填充阶段仅激活 8B 参数,解码阶段仅激活 16B。尽管激活规模小巧,其在核心知识、推理及编码能力上已追平甚至反超参数量达 1.6T 的上一代旗舰 V4-Pro。
在公开基准测试中,V4.1-Flash 表现优异:在衡量代码工程解决能力的 DeepSWE v1.1 测试中通过率达 74.2%,超越 Opus-5.0 与 GPT-5.6-Sol;在网络安全测试集 CyberGym 上斩获开源生态 SOTA 成绩。
这一成果打破了“参数大小决定上限”的传统认知。在 CED 与 CSA2 的协同下,上下文
长度
从 4K 扩展至百万 Token,解码计算量仅微增约 25%,有效缓解了企业在显存、存储及带宽上的压力。
值得注意的是,该架构思路与唐杰团队提出的《Trace as State》有异曲同工之妙,均旨在避免全量重放上下文。区别在于,V4.1-Flash 是从底层网络架构进行重写,而后者属于推理阶段的外部算法优化。未来,稀疏机制、跨层复用及可控近似策略或将成为大模型演进的新方向。
参考链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容
8946
粉丝
0
关注
在线咨询
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
总阅读
239.2k
粉丝
0
内容
8.9k