DeepSeek V4 Pro于 8 月 13 日发布,仅运行 32 天便将于 9 月 14 日下线。接替其位置的是 DeepSeek 最新推出的DeepSeek V4.1 Flash。
官方公告指出:V4.1 Flash在性能、成本、速度及总耗时等核心指标上已全面超越V4 Pro。自 9 月 14 日起,所有指向 Pro 版本的 API 请求将自动切换至 Flash 版本,并按 Flash 标准计费。
值得注意的是,在DeepSeek V4.1 Flash问世前,另一款国产 Flash 模型也曾引发关注。8 月 20 日,智谱 AI 以代号Ox-Alpha(中文名“牛来”)在 OpenRouter 和 OpenCode 低调上线一款匿名模型。该模型首日即登顶 OpenRouter 榜首,刷新单日 Token 调用纪录,并终结了 DeepSeek 在 OpenCode 长达 56 天的霸榜局面。8 月 26 日,智谱正式确认Ox-Alpha真身为GLM-5.3-Flash。
至此,"Flash"已不再仅代表轻量级模型,而是演变为高性能、低成本的主力阵营。
DeepSeek V4.1 Flash vs GLM-5.3-Flash:核心参数对比
两款模型在架构理念上高度相似,均具备 MoE 架构、百万级上下文窗口、原生多模态能力及 MIT 开源协议,但在具体技术路线上各有侧重。
| 对比项 | DeepSeek V4.1 Flash |
GLM-5.3-Flash |
|---|---|---|
| 发布日期 | 2026-09-10 | 2026-08-26 |
| 总参数量 | 552B | 320B |
| 激活参数 | 输入 8B / 输出 16B | 18B(输入输出对称) |
| 架构 | MoE + CED(因果编码 - 解码器) | MoE + 稀疏/线性注意力混合 |
| 上下文窗口 | 100 万 tokens | 100 万 tokens |
| 原生多模态 | 文本 + 图片 | 文本 + 图片 + 视频 + 文件 |
| 预训练数据 | 45 万亿 tokens | 30 万亿 tokens |
| 开源协议 | MIT | MIT |
| 推理力度调节 | 连续可调 1-100 | 三档(low / high / max) |
两者最大差异在于参数激活策略。DeepSeek V4.1 Flash采用非对称路线:输入端仅激活 8B 参数,输出端激活 16B。这种“读比写便宜”的设计专为 Agent 场景优化,适配其“大量读取上下文与工具结果、少量输出”的特性。相比之下,智谱坚持对称路线,输入输出均激活 18B 参数,总参数量从旗舰版的 753B 精简至 320B。此外,GLM-5.3-Flash在多模态支持上更为全面,额外支持视频与文件输入。
技术路线解析:如何攻克 KV Cache 成本难题
两款 Flash 模型的核心使命一致:解决长上下文场景下高昂的 KV Cache 显存占用问题。在 Agent 运行中,KV Cache 成本往往超过推理计算本身,因此降低这部分算力开销成为关键。
DeepSeek:CED 架构与极致压缩
DeepSeek V4.1 Flash引入了全新的 CED(Causal Encoder-Decoder)架构。它将 40 层 Transformer 拆分为前 20 层编码器(负责读取上下文)和后 20 层解码器(负责生成输出)。编码器处理输入时仅激活 8B 参数,解码器生成时激活 16B。
在 KV Cache 压缩方面,解码器的全局缓存直接由编码器最后一层输出投影生成,无需逐层计算。结合 FP4 量化与跨层共享索引技术,单个 Token 的全局 KV Cache 从上一代的 3514 字节大幅压缩至 890 字节。
智谱:混合注意力机制与 IndexPool
GLM-5.3-Flash则选择了混合注意力路线。在其 45 层神经网络中,34 层采用线性注意力,11 层采用稀疏注意力,按 3:1 比例交替排列。线性注意力通过递归机制处理局部依赖,计算量随上下文长度线性增长,天然适合长文本;稀疏注意力则利用轻量索引器从百万级 Token 中精准召回关键信息。
为进一步降本,智谱引入了 IndexPool 设计,将索引器的 4 个缓存向量加权池化为 1 个。最终,相较于旗舰版GLM-5.3,该模型注意力计算量降低 3 倍,KV Cache 占用降低 4.4 倍。
价格对比:谁更划算?
DeepSeek 实行峰谷定价,智谱则采用统一计价(以下价格单位均为人民币元/百万 Token)。
| 项目 | V4.1 Flash(空闲) |
V4.1 Flash(高峰) |
GLM-5.3-Flash |
|---|---|---|---|
| 缓存命中输入 | 0.02 | 0.04 | 0.23 |
| 普通输入 | 1.0 | 2.0 | 0.8 |
| 输出 | 4.0 | 8.0 | 2.8 |
在缓存命中场景下,DeepSeek V4.1 Flash优势显著,闲时价格仅为 0.02 元,远低于智谱的 0.23 元。鉴于缓存命中是 API 调用的主要成本构成,这一点至关重要。
而在普通输入与输出环节,GLM-5.3-Flash更具性价比:普通输入 0.8 元优于 DeepSeek 闲时的 1.0 元,输出 2.8 元也低于 DeepSeek 的 4.0 元。若遇高峰时段,DeepSeek 价格翻倍,差距将进一步拉大。
综合来看,纯 API 调用场景下DeepSeek V4.1 Flash可能更经济。但智谱提供了 Coding Plan 订阅制(Lite/Pro/Max 档位),免去了峰谷波动与重置烦恼,适合高频稳定用户;DeepSeek 目前仅提供按量付费模式。
生成速度实测
速度表现上,DeepSeek V4.1 Flash优势明显。实测数据显示,其输出速度介于 284 至 507 tokens/秒,峰值突破 500,即便计入思考时间也能维持在 300 tokens/秒左右。
相比之下,GLM-5.3-Flash在 Artificial Analysis 标准化测试中,输出速度约为 85 tokens/秒,首 Token 延迟 2.59 秒,端到端响应时间 31.92 秒。尽管测试环境存在差异,但两者速度量级差距显而易见。
基准测试成绩
结合官方数据与整理后的对比表,DeepSeek V4.1 Flash在多项权威基准测试中略胜一筹,这也是其敢于全面替代 Pro 版本的技术底气。
| 基准测试 | V4.1 Flash |
GLM-5.3-Flash |
GLM 5.3 |
Claude Opus 5 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 84.3 | 88.2 | 89.1 |
| DeepSWE v1.1 | 74.2 | 63.4 | 66.9 | 74.0 |
| Automation-Bench | 54.8 | 48.8 | 46.7 | 50.3 |
| Agents' Last Exam | 31.8 | 26.3 | 28.5 | 28.6 |
| HLE(含工具) | 63.9 | 55.3 | 62.5 | 63.6 |
| CyberGym | 88.1 | — | 84.5 | — |
| GDPVal-AA v2 | — | 1773 | — | 1571 |
| GPQA Diamond | 90.9 | — | 88.1 | 93.4 |
第三方榜单表现
由于DeepSeek V4.1 Flash发布不久,部分榜单尚未更新,但现有数据已具参考价值。
在无数据污染的 LiveBench 评测中,DeepSeek V4.1 Flash总分 81.1,排名第五,略超GPT-5.6 Sol(81.0)。尤其在 Agentic Coding 单项中,它以 77.3 分位居全场第一,且每任务成本低至$0.029,性价比极高。GLM-5.3-Flash总分 71.6,排名第 40,与前者差距近 10 分。
| 排名 | 模型 | 总分 | Agentic Coding | 每任务成本 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 |
83.4 | 66.1 | $1.212 |
| 3 | GPT-6 Astra |
82.2 | 57.3 | $0.736 |
| 5 | DeepSeek V4.1 Flash |
81.1 | 77.3 | $0.029 |
| 6 | GPT-5.6 Sol |
81.0 | 56.2 | $0.515 |
| 16 | DeepSeek V4 Pro |
77.4 | 54.9 | $0.044 |
| 22 | GLM-5.3(旗舰) |
76.1 | 60.9 | $0.450 |
| 40 | GLM-5.3-Flash |
71.6 | 56.8 | $0.031 |
此外,Arena 最新更新的 WebDev 前端编程排行榜显示,DeepSeek V4.1 Flash以 1620 分空降第 14 名,不仅超越自家V4 Pro(1580 分)40 分,也高于GLM-5.3-Flash(1605 分)。
| 排名 | 模型 | 分数 |
|---|---|---|
| 14 | DeepSeek V4.1 Flash |
1620 |
| 15 | GLM-5.3 |
1613 |
| 16 | GLM-5.3-Flash |
1605 |
| 20 | DeepSeek V4 Flash |
1582 |
| 21 | DeepSeek V4 Pro |
1580 |
随着技术迭代,"Flash"之名已不再局限于速度,更代表了高性能与低成本的完美平衡。在这场国产大模型的激烈角逐中,您更看好哪一款?

