大数跨境

DeepSeek V4.1 Flash 硬刚智谱「牛来」,谁才是国模 Flash 之王?

DeepSeek V4.1 Flash 硬刚智谱「牛来」,谁才是国模 Flash 之王? AI信息Gap
2026-09-11
4
导读:DeepSeek V4 Pro,9 月 14 日即将下线,享年 32 天。

DeepSeek V4 Pro于 8 月 13 日发布,仅运行 32 天便将于 9 月 14 日下线。接替其位置的是 DeepSeek 最新推出的DeepSeek V4.1 Flash

官方公告指出:V4.1 Flash在性能、成本、速度及总耗时等核心指标上已全面超越V4 Pro。自 9 月 14 日起,所有指向 Pro 版本的 API 请求将自动切换至 Flash 版本,并按 Flash 标准计费。

值得注意的是,在DeepSeek V4.1 Flash问世前,另一款国产 Flash 模型也曾引发关注。8 月 20 日,智谱 AI 以代号Ox-Alpha(中文名“牛来”)在 OpenRouter 和 OpenCode 低调上线一款匿名模型。该模型首日即登顶 OpenRouter 榜首,刷新单日 Token 调用纪录,并终结了 DeepSeek 在 OpenCode 长达 56 天的霸榜局面。8 月 26 日,智谱正式确认Ox-Alpha真身为GLM-5.3-Flash

至此,"Flash"已不再仅代表轻量级模型,而是演变为高性能、低成本的主力阵营。

DeepSeek V4.1 Flash vs GLM-5.3-Flash:核心参数对比

两款模型在架构理念上高度相似,均具备 MoE 架构、百万级上下文窗口、原生多模态能力及 MIT 开源协议,但在具体技术路线上各有侧重。

对比项 DeepSeek V4.1 Flash GLM-5.3-Flash
发布日期 2026-09-10 2026-08-26
总参数量 552B 320B
激活参数 输入 8B / 输出 16B 18B(输入输出对称)
架构 MoE + CED(因果编码 - 解码器) MoE + 稀疏/线性注意力混合
上下文窗口 100 万 tokens 100 万 tokens
原生多模态 文本 + 图片 文本 + 图片 + 视频 + 文件
预训练数据 45 万亿 tokens 30 万亿 tokens
开源协议 MIT MIT
推理力度调节 连续可调 1-100 三档(low / high / max)

两者最大差异在于参数激活策略。DeepSeek V4.1 Flash采用非对称路线:输入端仅激活 8B 参数,输出端激活 16B。这种“读比写便宜”的设计专为 Agent 场景优化,适配其“大量读取上下文与工具结果、少量输出”的特性。相比之下,智谱坚持对称路线,输入输出均激活 18B 参数,总参数量从旗舰版的 753B 精简至 320B。此外,GLM-5.3-Flash在多模态支持上更为全面,额外支持视频与文件输入。

技术路线解析:如何攻克 KV Cache 成本难题

两款 Flash 模型的核心使命一致:解决长上下文场景下高昂的 KV Cache 显存占用问题。在 Agent 运行中,KV Cache 成本往往超过推理计算本身,因此降低这部分算力开销成为关键。

DeepSeek:CED 架构与极致压缩

DeepSeek V4.1 Flash引入了全新的 CED(Causal Encoder-Decoder)架构。它将 40 层 Transformer 拆分为前 20 层编码器(负责读取上下文)和后 20 层解码器(负责生成输出)。编码器处理输入时仅激活 8B 参数,解码器生成时激活 16B。

在 KV Cache 压缩方面,解码器的全局缓存直接由编码器最后一层输出投影生成,无需逐层计算。结合 FP4 量化与跨层共享索引技术,单个 Token 的全局 KV Cache 从上一代的 3514 字节大幅压缩至 890 字节。

智谱:混合注意力机制与 IndexPool

GLM-5.3-Flash则选择了混合注意力路线。在其 45 层神经网络中,34 层采用线性注意力,11 层采用稀疏注意力,按 3:1 比例交替排列。线性注意力通过递归机制处理局部依赖,计算量随上下文长度线性增长,天然适合长文本;稀疏注意力则利用轻量索引器从百万级 Token 中精准召回关键信息。

为进一步降本,智谱引入了 IndexPool 设计,将索引器的 4 个缓存向量加权池化为 1 个。最终,相较于旗舰版GLM-5.3,该模型注意力计算量降低 3 倍,KV Cache 占用降低 4.4 倍。

价格对比:谁更划算?

DeepSeek 实行峰谷定价,智谱则采用统一计价(以下价格单位均为人民币元/百万 Token)。

项目 V4.1 Flash
(空闲)
V4.1 Flash
(高峰)
GLM-5.3-Flash
缓存命中输入 0.02 0.04 0.23
普通输入 1.0 2.0 0.8
输出 4.0 8.0 2.8

在缓存命中场景下,DeepSeek V4.1 Flash优势显著,闲时价格仅为 0.02 元,远低于智谱的 0.23 元。鉴于缓存命中是 API 调用的主要成本构成,这一点至关重要。

而在普通输入与输出环节,GLM-5.3-Flash更具性价比:普通输入 0.8 元优于 DeepSeek 闲时的 1.0 元,输出 2.8 元也低于 DeepSeek 的 4.0 元。若遇高峰时段,DeepSeek 价格翻倍,差距将进一步拉大。

综合来看,纯 API 调用场景下DeepSeek V4.1 Flash可能更经济。但智谱提供了 Coding Plan 订阅制(Lite/Pro/Max 档位),免去了峰谷波动与重置烦恼,适合高频稳定用户;DeepSeek 目前仅提供按量付费模式。

生成速度实测

速度表现上,DeepSeek V4.1 Flash优势明显。实测数据显示,其输出速度介于 284 至 507 tokens/秒,峰值突破 500,即便计入思考时间也能维持在 300 tokens/秒左右。

相比之下,GLM-5.3-Flash在 Artificial Analysis 标准化测试中,输出速度约为 85 tokens/秒,首 Token 延迟 2.59 秒,端到端响应时间 31.92 秒。尽管测试环境存在差异,但两者速度量级差距显而易见。

基准测试成绩

结合官方数据与整理后的对比表,DeepSeek V4.1 Flash在多项权威基准测试中略胜一筹,这也是其敢于全面替代 Pro 版本的技术底气。

基准测试 V4.1 Flash GLM-5.3-Flash GLM 5.3 Claude Opus 5
Terminal-Bench 2.1 90.6 84.3 88.2 89.1
DeepSWE v1.1 74.2 63.4 66.9 74.0
Automation-Bench 54.8 48.8 46.7 50.3
Agents' Last Exam 31.8 26.3 28.5 28.6
HLE(含工具) 63.9 55.3 62.5 63.6
CyberGym 88.1 84.5
GDPVal-AA v2 1773 1571
GPQA Diamond 90.9 88.1 93.4

第三方榜单表现

由于DeepSeek V4.1 Flash发布不久,部分榜单尚未更新,但现有数据已具参考价值。

在无数据污染的 LiveBench 评测中,DeepSeek V4.1 Flash总分 81.1,排名第五,略超GPT-5.6 Sol(81.0)。尤其在 Agentic Coding 单项中,它以 77.3 分位居全场第一,且每任务成本低至$0.029,性价比极高。GLM-5.3-Flash总分 71.6,排名第 40,与前者差距近 10 分。

排名 模型 总分 Agentic Coding 每任务成本
1 Claude Fable 5.1 83.4 66.1 $1.212
3 GPT-6 Astra 82.2 57.3 $0.736
5 DeepSeek V4.1 Flash 81.1 77.3 $0.029
6 GPT-5.6 Sol 81.0 56.2 $0.515
16 DeepSeek V4 Pro 77.4 54.9 $0.044
22 GLM-5.3(旗舰) 76.1 60.9 $0.450
40 GLM-5.3-Flash 71.6 56.8 $0.031

此外,Arena 最新更新的 WebDev 前端编程排行榜显示,DeepSeek V4.1 Flash以 1620 分空降第 14 名,不仅超越自家V4 Pro(1580 分)40 分,也高于GLM-5.3-Flash(1605 分)。

排名 模型 分数
14 DeepSeek V4.1 Flash 1620
15 GLM-5.3 1613
16 GLM-5.3-Flash 1605
20 DeepSeek V4 Flash 1582
21 DeepSeek V4 Pro 1580

随着技术迭代,"Flash"之名已不再局限于速度,更代表了高性能与低成本的完美平衡。在这场国产大模型的激烈角逐中,您更看好哪一款?

【声明】内容源于网络
0
0
AI信息Gap
各类跨境出海行业相关资讯
内容 1078
粉丝 0
AI信息Gap 各类跨境出海行业相关资讯
总阅读125.9k
粉丝0
内容1.1k