9月8日,DeepSeek在官方交流群放出V4.1 Flash中间版本内测,模型名直接写着deepseek-v4.1-flash-expires-on-0910,只开放两天。

9月9日,DeepSeek又宣布下调Flash系列API价格,并明确在V4.1 Pro发布前,所有V4 Pro请求将自动路由至V4.1 Flash,按Flash价格计费。梁神回归不是假的!DeepSeek V4.1 Flash明天先行上线,Pro后续登场。
9月10日,V4.1 Flash正式上线刚刚,DeepSeek V4.1 Flash上线!Harness新版同步启动试用,模型权重与技术报告同步公开。

随着技术报告公开,这个模型的真正看点也逐渐清晰:552B参数,却已经把能力推到了顶级开源模型的竞争区间
它的开篇逻辑是:长周期智能体让模型的负载越来越输入密集型,稀疏注意力已经把长序列的计算成本降下来了,但 prefill 依然昂贵,庞大的 KV Cache 持续压迫 HBM 与 SSD 的容量和数据传输带宽。
计算、存储、带宽三者叠加,构成了部署成本继续下探的主要障碍。
于是 V4.1-Flash 的全部架构改动,几乎都围绕这一个目标展开。
01
CED:让552B的模型
在prefill时只激活 8B
V4.1-Flash 是一个多模态 MoE 模型,语言主干共 40 层,被切成 20 层 causal encoder 加 20 层 decoder。
整体有 552B 主干参数,另加 196B Engram 参数,支持最长 100 万 token 的上下文。
关键在激活量的不对称:每 token 在 prefill 阶段只激活 8B 参数,decode 阶段激活 16B。
支撑这一点的是核心设计 CED(Causal Encoder-Decoder):
用 encoder 的输出直接构造 decoder 的全局 KV Cache,让大部分 prompt token 绕开完整的 decoder 计算,同时保留层内的滑动窗口注意力,报告称这几乎把 prefill 的计算量减半。
与它配合的 CSA2 在层与层之间共享全局 KV、复用稀疏选择结果,decoder 中还设了一层"层次稀疏索引器",让后续索引器只在前一层已选出的候选池里打分。
其余改动集中在效率与部署侧:
(1)mHC 升级为 Single-Pass mHC,配套的 Mega-mHC 部署内核把激活内存流量相对原四内核实现减半;
(2)引入 Engram 条件记忆与 DSpark 推测解码;
(3)主 KV Cache 采用 FP4;
(4)部署侧加上 SWA Bounded Replay,只重放最近的 n_win 个 token 来近似重建 SWA KV 状态。
这些改动叠加之后的效果是单 token 的 Decode FLOPs 在不同上下文长度下几乎保持恒定。
02
预训练:45T token,
稀疏注意力从零训起
V4.1-Flash 的预训练语料是 45T token 的多模态数据集。
稀疏注意力是从零开始、在 64K 序列长度上直接训练的,没有任何 dense attention 的热身阶段,视觉从零训、与语言一起进语料,旧的 Flash Vision-Exp 外挂路线被收掉。
Base 模型的对比相当有信息量。
V4.1-Flash-Base 只用约 1/3 的总参数、1/4 的激活参数,就在世界知识、推理和编程上取得了与 V4-Pro-Base 相当的水平,并在部分留出评测上提升 5%–10%。
03
后训练没有新算法,
报告在后训练章节的开头,主动做了一个限定,本环节不引入算法创新。
流程沿用监督微调、强化学习、在策略蒸馏,与 V4 开发时的成熟做法没有区别。
所有实质变化都发生在数据管线里:大规模自动化的数据合成与环境构建,以及在 RL 中持续放大的数据、任务与 rollout 规模。
支撑这一规模的是 DSec(DeepSeek Elastic Compute),一个面向大规模智能体训练与评测的生产级沙箱平台。
报告提到,V4.1 的训练把需求推高到了数百万并发沙箱实例,瓶颈随之转向数据中心可扩展性、工作负载隔离、单节点算力密度,以及对越来越强的智能体越界行为的约束。
另一个设计是可控制的推理强度(Controllable Reasoning Effort):
模型在训练时接受一个 1–100 的标量 effort 作为显式条件信号,写进系统提示词,让同一个 checkpoint 能在不同的成本—质量区间之间滑动。
04
Agent 追平前沿,
长上下文仍有短板
05
Flash只是开始,
V4.1 Pro或许才是下一张牌
V4.1 Flash更像是DeepSeek对下一阶段Agent模型的一次系统级试验。
552B参数只是表面,真正的核心是围绕KV Cache、Prefill和长上下文推理持续压缩成本。
CED、CSA2、FP4 KV Cache以及SWA Bounded Replay等设计,把模型能力和部署效率放到了同一个优化目标里。
它目前在Agent、代码等任务上已经进入开源模型第一梯队,但长上下文和部分复杂推理仍有短板。
对DeepSeek来说,V4.1 Flash更像一个起点,后面的V4.1 Pro以及下一代模型,或许才会真正体现这套技术路线的上限。
END
关注+星标,获取AI前沿进展与开源一线动态

