大数跨境

一文读懂DeepSeek V4.1 Flash:因果编解码疯狂Reuse,不仅华为昇腾,MacBook闪存就能跑

一文读懂DeepSeek V4.1 Flash:因果编解码疯狂Reuse,不仅华为昇腾,MacBook闪存就能跑 AI顿悟涌现时
2026-09-11
5
导读:💡Recall之王,再摘Reuse皇冠👑万亿参数大模型摆脱HBM,跑在CPU、LPDDR和NAND Flash闪存上!CED新结构+CSA2+FP4+SWA重放,KV Cache缩小437倍,Te

Recall之王

祭出Reuse


之前,AI顿悟涌现时曾详细解读过英伟达跟OpenAI之间,在定制AI芯片上的龃龉:

黄仁勋认为AI LLM大模型应该根据(GPU)硬件的现实情况改造大模型基础软件架构,而OpenAI Sam Altman则认为应该借助AI速度定制大模型专用NPU Jalapeño 。

对比之下,国内大模型梁圣DeepSeek则是黄仁勋理念的全球最佳实践者!这次更是全面跳出英伟达GPU的框架,让AI完美运行在CPU、NPU、LPDDR、NAND Flash闪存等硬件上,国产华为昇腾、摩尔线程的硬件彻底跳出CUDA桎梏,来到AI半导体行业的C位,国产存储芯片长江存储、长江存储、兆易创新更是跳出HBM叙事,直接坐上飞升火箭!

9月10日,DeepSeek正式发布V4.1 Flash。这是全新架构家族里最小的一款,却直接把自家上一代旗舰V4 Pro按在地上摩擦:更强、更快、更便宜,还原生支持多模态。官方干脆宣布,从9月14日起,所有打向V4 Pro的请求都将自动路由到V4.1 Flash,并按Flash价格计费,直到真正的V4.1 Pro到来。

而能做到这些的核心,正是来自DeepSeek底层大模型架构技术的创新和工程化落地!创新的CED因果编解码架构,直接跳出全行业坚持的Transformer仅解码架构核心;加上自研的全面工程化落地应用的Engram条件记忆参数,直接将大模型近三分之一的参数offload转移在CPU和LPDDR内存里运行;还有CSA2压缩稀疏注意力的极端压缩和Recall,直接大幅减少冗余计算成本,让硬件不再浪费在等待工作指令上,让所有空闲硬件资源都跑满!

这也是DeepSeek V4.1 Flash能在各种不同硬件上运行的核心杀招!

整个技术架构特别适合放在更便宜的NAND Flash闪存运行!

可以说就是瞄准即将大规模量产的高性价比大模型硬件解决方案HBF高带宽闪存准备的!

核心不是“更大”,而是“不对称 + 极致压缩”

模型总参数552B backbone的MoE(外加196B Engram条件记忆参数),但激活参数极度不对称:

  • 读prompt(prefill)时,大约只激活8B
  • 写答案(decode)时,激活约16B

每个MoE层使用1个共享专家 + 384个路由专家,每个token只激活6个路由专家。钱真正花在了刀刃上。对Agent场景来说,输入往往远大于输出,这种设计直接切中痛点。

新结构叫Causal-Encoder-Decoder(CED): 
40层Transformer被切成20层因果编码器 + 20层解码器。解码器的全局KV不再每层自己算,而是直接从编码器最后一层投影过来。结果是,prompt token基本只走编码器,prefill计算量几乎砍半。

token进来后的关键动作,动画演得清清楚楚: 
1️⃣ 专家路由 
2️⃣ SWA窗口重放(SWA Bounded Replay)——只重放最近窗口内的token来重建缺失的滑动窗口KV,彻底避免把SWA状态持久化到SSD 
3️⃣ 全局KV读写

把KV Cache压到极致的几把杀手锏

DeepSeek这次在缓存上真下了狠手:

  • Compressed Sparse Attention 2(CSA2)
    :每层静态分配三种模式——Full、Reindex、Reuse。通过跨层共享主KV和索引K,并复用Top-K稀疏注意力索引,大幅减少冗余。
  • Hierarchical Sparse Indexer
    (解码器中):让后面的索引层只在第一层Full模式构建的候选池里打分,索引成本与上下文长度脱钩。
  • FP4主KV缓存
    (E2M1格式,每16通道一个E4M3缩放因子),直接把精度压到4-bit。

三种模式的具体含义

模式
做了什么
复用程度
计算量
Full
自己完整计算主 KV、生成 Indexer Key,并重新搜索选出最新的 Top-K 位置
最低(从零开始)
最高
Reindex
直接复用前面 Full 层的主 KV 和 Indexer Key,但用自己的 Query 重新打分,选出新的 Top-K
中等(复用 KV,重选索引)
中等
Reuse
直接复用前面层的主 KV Top-K 索引,完全跳过索引计算
最高
最低

通俗解释

  • Full
    :像认真读完整本书,自己做笔记并划出重点。
  • Reindex
    :直接拿别人的笔记,但自己再重新划一遍重点。
  • Reuse
    :直接说“前面那人划的重点挺好,我直接用”。

实际分配方式(V4.1 Flash)

  • 编码器(20层)
    :通常按组分配(例如每6层一组:1个 Full + 5个 Reuse)。
  • 解码器(20层)
    :第一组是 Full + 几个 Reuse,后面多为 Reindex + Reuse。
  • 解码器还额外用了 Hierarchical Sparse Indexer(分层稀疏索引器):第一个 Full 层先选出一个较大的候选池(最多约 16,384 个位置),后续 Reindex 层只在这个池子里打分,计算量不再随上下文长度爆炸。

带来的好处

单token全局KV Cache大约890字节,相对V1缩小约437倍;HBM需求约上一代的1/4,SSD/持久化需求约1/8。

在Agent工作流里,缓存命中费用往往是大头。这一刀砍下去,长期跑任务的成本直接腰斩级别下降。

此外还引入了:

  • Single-Pass mHC
    (改进的流形超连接,残差流混合更高效)
  • Engram条件记忆
    (196B参数,通过token哈希稀疏查找)
  • DSpark推测解码
    (半自回归草稿生成 + 置信度调度验证)
  • 原生多模态:从零训练的DeepSeek-ViT视觉编码器(2D-RoPE + 3×3像素反混洗下采样)+ 两层MLP投影器,图像与文本从预训练初期就联合处理。

预训练在45T tokens的多模态语料上从零开始,稀疏注意力先在64K序列上训练,再扩展到1M上下文。后训练仍走标准SFT → RL → on-policy distillation路线,但数据管线大幅加强,并支持1-100连续可控推理强度

成绩单对得上结构

官方和多方评测给出的数字相当亮眼(最大推理强度下):

  • Terminal-Bench 2.1:90.6
  • Terminal-Bench 3.0:30.0(V4 Pro大约11.8)
  • DeepSWE v1.1:74.2,基本追平甚至持平Opus 5档
  • CyberGym:88.1
  • Automation-Bench:54.8
  • Codeforces Rating:3471

再加上1M超长上下文、原生图像理解、MIT开源权重,以及已经上线的API(模型名直接改成deepseek-flash),这波操作相当完整。

梁文锋团队再次证明:小成本大智能,这条路是可以跑通的。不是靠堆卡,而是靠把推理流水线从根上重写。

硅基观察

💥当前AI推理需求爆炸增长,规模早已超越AI训练。大模型军备竞赛已经从“谁更大”转向“谁更会省”。

开源权重已经挂上Hugging Face,API也同步可用。想尝鲜的朋友,现在就可以把模型名改成deepseek-flash试试。海外社交媒体平台X上,已经有用户将其部署在Mac Studio和英伟达DGX Spark、甚至入门款MacBook Air上,直接利用NAND Streaming / Expert Streaming / SSD Streaming,将大部分参数权重放在闪存里。🚀

文末点击下一篇或者扫码加入学习群,即可学习前沿AGI常识。

欢迎大家关注AI顿悟涌现时,快速入门当下最热的AI大模型前沿。

原来人类的本质就是AGI
不用看数字的数学,让人高兴 人类大脑真是个奇迹

AI顿悟涌现时推出了【AGI常识】专题。【AGI常识】专题会以最通俗易懂的解释,帮你在一分钟内学会一个新技术名词背后的原理。欢迎点击下方动图,持续关注。

AI顿悟涌现时

AI顿悟涌现时绿旗下关注新技术的内容品牌。
AI顿悟涌现时关注前沿技术的发展应用,深度解读新技术对商业模式和社会形态的变革
大模型商业技术及通识,筹备开课,欢迎有授课能力的朋友合作,欢迎有兴趣的朋友报名一起学习。相关优质内容将会发布在下方动图内微信公众号▼▼

关注AGI ▶▶学习直达▶▶

【声明】内容源于网络
0
0
AI顿悟涌现时
全网唯一零门槛大模型科普!GenAI生成式大模型重塑互联网,世界模型重塑现实世界,硅基生命改写宇宙……人工智能与AR/MR/XR计算机合流,元宇宙虚拟世界开启超越实物价值。人类历史正在被int8和FP16量化卷积训练推理……
内容 98
粉丝 0
AI顿悟涌现时 全网唯一零门槛大模型科普!GenAI生成式大模型重塑互联网,世界模型重塑现实世界,硅基生命改写宇宙……人工智能与AR/MR/XR计算机合流,元宇宙虚拟世界开启超越实物价值。人类历史正在被int8和FP16量化卷积训练推理……
总阅读413
粉丝0
内容98