Recall之王
祭出Reuse
之前,AI顿悟涌现时曾详细解读过英伟达跟OpenAI之间,在定制AI芯片上的龃龉:
黄仁勋认为AI LLM大模型应该根据(GPU)硬件的现实情况改造大模型基础软件架构,而OpenAI Sam Altman则认为应该借助AI速度定制大模型专用NPU Jalapeño 。
对比之下,国内大模型梁圣DeepSeek则是黄仁勋理念的全球最佳实践者!这次更是全面跳出英伟达GPU的框架,让AI完美运行在CPU、NPU、LPDDR、NAND Flash闪存等硬件上,国产华为昇腾、摩尔线程的硬件彻底跳出CUDA桎梏,来到AI半导体行业的C位,国产存储芯片长江存储、长江存储、兆易创新更是跳出HBM叙事,直接坐上飞升火箭!
9月10日,DeepSeek正式发布V4.1 Flash。这是全新架构家族里最小的一款,却直接把自家上一代旗舰V4 Pro按在地上摩擦:更强、更快、更便宜,还原生支持多模态。官方干脆宣布,从9月14日起,所有打向V4 Pro的请求都将自动路由到V4.1 Flash,并按Flash价格计费,直到真正的V4.1 Pro到来。
而能做到这些的核心,正是来自DeepSeek底层大模型架构技术的创新和工程化落地!创新的CED因果编解码架构,直接跳出全行业坚持的Transformer仅解码架构核心;加上自研的全面工程化落地应用的Engram条件记忆参数,直接将大模型近三分之一的参数offload转移在CPU和LPDDR内存里运行;还有CSA2压缩稀疏注意力的极端压缩和Recall,直接大幅减少冗余计算成本,让硬件不再浪费在等待工作指令上,让所有空闲硬件资源都跑满!
这也是DeepSeek V4.1 Flash能在各种不同硬件上运行的核心杀招!
整个技术架构特别适合放在更便宜的NAND Flash闪存运行!
可以说就是瞄准即将大规模量产的高性价比大模型硬件解决方案HBF高带宽闪存准备的!
核心不是“更大”,而是“不对称 + 极致压缩”
模型总参数552B backbone的MoE(外加196B Engram条件记忆参数),但激活参数极度不对称:
-
读prompt(prefill)时,大约只激活8B -
写答案(decode)时,激活约16B
每个MoE层使用1个共享专家 + 384个路由专家,每个token只激活6个路由专家。钱真正花在了刀刃上。对Agent场景来说,输入往往远大于输出,这种设计直接切中痛点。
新结构叫Causal-Encoder-Decoder(CED):
40层Transformer被切成20层因果编码器 + 20层解码器。解码器的全局KV不再每层自己算,而是直接从编码器最后一层投影过来。结果是,prompt token基本只走编码器,prefill计算量几乎砍半。
token进来后的关键动作,动画演得清清楚楚:
1️⃣ 专家路由
2️⃣ SWA窗口重放(SWA Bounded Replay)——只重放最近窗口内的token来重建缺失的滑动窗口KV,彻底避免把SWA状态持久化到SSD
3️⃣ 全局KV读写
把KV Cache压到极致的几把杀手锏
DeepSeek这次在缓存上真下了狠手:
- Compressed Sparse Attention 2(CSA2)
:每层静态分配三种模式——Full、Reindex、Reuse。通过跨层共享主KV和索引K,并复用Top-K稀疏注意力索引,大幅减少冗余。 - Hierarchical Sparse Indexer
(解码器中):让后面的索引层只在第一层Full模式构建的候选池里打分,索引成本与上下文长度脱钩。 - FP4主KV缓存
(E2M1格式,每16通道一个E4M3缩放因子),直接把精度压到4-bit。
三种模式的具体含义
|
|
|
|
|
|---|---|---|---|
| Full |
|
|
|
| Reindex |
|
|
|
| Reuse |
|
|
|
通俗解释
- Full
:像认真读完整本书,自己做笔记并划出重点。 - Reindex
:直接拿别人的笔记,但自己再重新划一遍重点。 - Reuse
:直接说“前面那人划的重点挺好,我直接用”。
实际分配方式(V4.1 Flash)
- 编码器(20层)
:通常按组分配(例如每6层一组:1个 Full + 5个 Reuse)。 - 解码器(20层)
:第一组是 Full + 几个 Reuse,后面多为 Reindex + Reuse。 -
解码器还额外用了 Hierarchical Sparse Indexer(分层稀疏索引器):第一个 Full 层先选出一个较大的候选池(最多约 16,384 个位置),后续 Reindex 层只在这个池子里打分,计算量不再随上下文长度爆炸。
带来的好处
单token全局KV Cache大约890字节,相对V1缩小约437倍;HBM需求约上一代的1/4,SSD/持久化需求约1/8。
在Agent工作流里,缓存命中费用往往是大头。这一刀砍下去,长期跑任务的成本直接腰斩级别下降。
此外还引入了:
- Single-Pass mHC
(改进的流形超连接,残差流混合更高效) - Engram条件记忆
(196B参数,通过token哈希稀疏查找) - DSpark推测解码
(半自回归草稿生成 + 置信度调度验证) - 原生多模态:从零训练的DeepSeek-ViT视觉编码器(2D-RoPE + 3×3像素反混洗下采样)+ 两层MLP投影器,图像与文本从预训练初期就联合处理。
预训练在45T tokens的多模态语料上从零开始,稀疏注意力先在64K序列上训练,再扩展到1M上下文。后训练仍走标准SFT → RL → on-policy distillation路线,但数据管线大幅加强,并支持1-100连续可控推理强度。
成绩单对得上结构
官方和多方评测给出的数字相当亮眼(最大推理强度下):
-
Terminal-Bench 2.1:90.6 -
Terminal-Bench 3.0:30.0(V4 Pro大约11.8) -
DeepSWE v1.1:74.2,基本追平甚至持平Opus 5档 -
CyberGym:88.1 -
Automation-Bench:54.8 -
Codeforces Rating:3471
再加上1M超长上下文、原生图像理解、MIT开源权重,以及已经上线的API(模型名直接改成deepseek-flash),这波操作相当完整。
梁文锋团队再次证明:小成本大智能,这条路是可以跑通的。不是靠堆卡,而是靠把推理流水线从根上重写。
硅基观察
💥当前AI推理需求爆炸增长,规模早已超越AI训练。大模型军备竞赛已经从“谁更大”转向“谁更会省”。
开源权重已经挂上Hugging Face,API也同步可用。想尝鲜的朋友,现在就可以把模型名改成deepseek-flash试试。海外社交媒体平台X上,已经有用户将其部署在Mac Studio和英伟达DGX Spark、甚至入门款MacBook Air上,直接利用NAND Streaming / Expert Streaming / SSD Streaming,将大部分参数权重放在闪存里。🚀
欢迎大家关注AI顿悟涌现时,快速入门当下最热的AI大模型前沿。
AI顿悟涌现时
AI顿悟涌现时是红绿旗下关注新技术的内容品牌。 AI顿悟涌现时关注前沿技术的发展应用,深度解读新技术对商业模式和社会形态的变革。 大模型商业技术及通识,筹备开课,欢迎有授课能力的朋友合作,欢迎有兴趣的朋友报名一起学习。相关优质内容将会发布在下方动图内微信公众号▼▼

