大数跨境

DeepSeek V4.1 Flash 发布,9 月 14 日接管 Pro:先算四笔账

DeepSeek V4.1 Flash 发布,9 月 14 日接管 Pro:先算四笔账 AI大模型智能体前沿
2026-09-10
3
导读:架构更省、单价更低、Agent 跑分更强,但生产迁移还差自己的任务回放与回退验收。

导读2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash;9 月 14 日 12:00 起,旧 V4 Pro 的 API 请求将自动转给它处理。新模型在多项 Agent 基准、KV Cache 占用和 API 单价上都有明确增量,但自动路由只解决接口去向,不会替开发团队完成能力、成本、兼容性与回退验收。

正式发布后,问题已经从“要不要测”变成“怎么迁”

9 月 8 日,DeepSeek V4.1 Flash 还只是短期内测模型。没有正式模型卡、技术报告和完整价格时,它值得测试,却不能仅凭几张速度截图替换线上 V4 Pro。

两天后,缺失的资料大多补齐了。

9 月 10 日,DeepSeek 正式发布 V4.1 Flash,同步开放模型权重与 51 页技术报告。API 正式模型名是 deepseek-flash;旧 V4 Flash 和 Vision Exp 已退役,旧名称暂时兼容,但底层请求由新模型处理。

9 月 14 日 12:00 起,deepseek-v4-pro 也会自动路由到 V4.1 Flash,并按 Flash 价格计费,直到未来 V4.1 Pro 上线。

内测阶段要决定“是否放进评估环境”,现在则要在切换前算清四笔账:能力、架构、真实费用和迁移风险。

DeepSeek V4.1 Flash 开启内测:想替换 V4 Pro,先过这五关

第一笔账:Agent 跑分更强,不等于每类任务都赢

DeepSeek 对外给出的结论很明确:经过多方测试,V4.1 Flash 已在性能、费用、速度和总用时上全面超过 V4 Pro。这句话能说明官方为什么敢下线旧 Pro,却不能代替我们查看公开表格。

在官方最高推理强度的结果里,V4.1 Flash 在多项 Agent 任务上领先 V4 Pro:DeepSWE v1.1 为 74.2 对 62.7,Terminal-Bench 3.0 为 30.0 对 11.8,CyberGym 为 88.1 对 83.3。Coding、终端操作、网络安全和自动化任务,是提升最集中的区域。

但同一张表里也有另一面。V4.1 Flash 的 GPQA Diamond 是 90.9,低于 V4 Pro 的 92.4;HLE 纯文本子集也低于旧 Pro。它在 Terminal-Bench 3.0、ProgramBench 等项目上还落后于部分外部前沿模型。

图片说明:V4.1 Flash 在 DeepSWE、CyberGym 和 Automation-Bench 上表现突出,但 Terminal-Bench 3.0 仍低于 Opus 5 与 GPT-5.6 Sol。 图片来源:DeepSeek-V4.1-Flash 官方模型卡

所以,“全面超越”是 DeepSeek 基于多项测试作出的产品替换结论,不等于公开表格里的每个格子都更高。

Agent 成绩也不只由模型决定。技术报告固定同一份 V4.1 Flash 模型权重(checkpoint),只更换组织提示词、工具与交互流程的运行框架(Harness)。DeepSWE v1.1 在 mini-SWE、DSH Minimal 和 Codex 下分别得到 74.2、72.6 和 65.6;工具接口、提示词、执行协议和最大步数,都在参与最后的结果。

因此,迁移时最重要的能力数字不是官方平均分,而是你自己的任务完成率:同一批代码仓库、同一组工具权限、同样的推理强度与停止条件下,新模型能否稳定交付合格结果。

第二笔账:缓存缩小,省的是服务资源,不是承诺时延

V4.1 Flash 的架构很容易被一句“输入激活 8B、输出激活 16B”带过。真正需要看懂的,是为什么输入和输出可以走不同的计算路径。

模型的语言主干分成 20 层因果 Encoder 和 20 层 Decoder。处理长输入时,历史位置先经过 Encoder;Decoder 所需的全局 KV,不再要求历史内容逐层完整跑过后半段,而是由 Encoder 的最终隐藏状态投影得到。生成新 Token 时,新位置仍会经过完整的 Encoder 与 Decoder。

这套 Causal Encoder-Decoder(CED,因果编码器—解码器)结构,适合典型的 Agent 负载:先读取长对话、代码和工具结果,再生成相对短的判断或操作。

另一层优化发生在 KV Cache。它保存注意力后续还要反复使用的历史状态。Compressed Sparse Attention 2(CSA2,压缩稀疏注意力 2)让部分层共享主 KV 和稀疏索引,FP4(4 位浮点格式)又继续压缩主 KV 的存储体积。官方给出的全局 KV Cache(global KV cache)是 890 bytes/token,约为 V4 Flash 的四分之一。

图片说明:图中 890 bytes/token 指 global KV cache;它约为 V4 Flash 的四分之一,不能直接当作模型全部显存。 图片来源:DeepSeek-V4.1-Flash 官方模型卡

报告里的“八分之一”是另一笔账:通过不再长期保存滑动窗口注意力的局部 KV,并在需要时重放末尾窗口,持久缓存占用降到旧模型的大约八分之一。一个主要对应 HBM(GPU 高带宽内存)里的全局 KV,另一个对应 SSD 或主机内存里的持久缓存,不能揉成同一个“显存缩小八倍”。

这些改动能降低计算、存储和搬运历史状态的压力,却不能直接推出请求时延减少四分之三。端到端速度还取决于权重读取、通信、调度、缓存命中、生成长度和服务负载。架构账解释资源为什么有机会下降,真实请求仍要看监控数据。

模型、报告与调用资料

模型权重与模型卡: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

技术报告: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

API 变更日志: https://api-docs.deepseek.com/updates/

第三笔账:Token 单价降了,任务成本还要再算一次

按 DeepSeek 中国区公告,V4.1 Flash 以每百万 Token 计费:空闲时段的缓存命中输入、缓存未命中输入和输出分别为 0.02 元、1 元和 4 元;工作日高峰时段分别为 0.04 元、2 元和 8 元。新价格从 9 月 10 日 12:00 起生效。

图片说明:高峰时段为工作日 9:00—12:00、14:00—18:00,其余时间按空闲价格计费。 图片来源:DeepSeek 官方微信公众号

但 Agent 的账单不是价目表三项相加那么简单。同一任务可能调用十几轮工具,失败后还会重试;提高 reasoning effort 会改变输出长度,换一套 Harness 也可能改变步骤数与成功率。缓存命中率一旦下降,大量输入又会从便宜档回到未命中档。

真正适合迁移决策的口径是:

单个合格结果成本 = 全部调用费用 ÷ 合格结果数量

分母很关键。新模型即使单次调用便宜,如果某类任务需要更多轮次、输出更多 Token 或更频繁重试,最终降幅也会被吃掉。反过来,如果成功率提高、步骤减少,真实收益可能比单价变化更大。

所以,别只保存总账单。至少记录缓存命中与未命中输入、输出 Token、工具轮次、失败重试、任务成功率和尾部较慢请求的 P95 完成时间。价格表告诉你资源单价,这组数据才告诉你一个结果花了多少。

第四笔账:API 名字兼容,业务行为不会自动兼容

9 月 14 日的自动路由对调用方很省事:继续发送 deepseek-v4-pro,请求也能得到响应。但“没有报模型不存在”只是接口层兼容,不能证明返回行为、工具选择、JSON 结构和长任务稳定性与旧 Pro 一致。

切换前,最小验收可以压缩成四步:

1. 从真实流量中抽取一组可重放任务,覆盖简单问答、长上下文、工具调用、结构化输出和高风险写操作;固定提示词、权限、温度、推理强度与最大步数。

2. 在 9 月 14 日自动路由前,同时调用旧 Pro 与 V4.1 Flash,记录任务成功率、关键字段通过率、中位数(P50)与尾延迟(P95)、Token、缓存命中和重试次数,不拿一次主观“更快”代替分布数据。

3. 对工具参数、JSON schema(结构化输出约束)、停止条件和多轮状态单独回归。输出看似合理却少一个必填字段,照样可能让下游失败。

4. 真正演练一次回退。9 月 14 日后,deepseek-v4-pro 这个名称本身会指向新 Flash,不能再充当返回旧 Pro 的开关;需要回退时,只能依赖事先准备的其他可控模型或提供方。

正式技术报告、模型权重、公开评测、视觉能力和更低价格,已经让 V4.1 Flash 从内测模型变成了很有吸引力的生产候选。

四笔账里,能力增量、资源机制和 API 单价已有官方材料可以核对;兼容性、稳定性与单个合格结果成本,只能在自己的业务里结清。

9 月 14 日到点后,流量会自动切过去。自动切换是平台动作,迁移完成才是工程结论。

参考资料

DeepSeek API 变更日志: https://api-docs.deepseek.com/updates/

DeepSeek 模型与价格: https://api-docs.deepseek.com/quick_start/pricing/

DeepSeek-V4.1-Flash 模型卡: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

DeepSeek-V4.1-Flash 技术报告: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

DeepSeek Harness 官方仓库: https://github.com/deepseek-ai/deepseek-harness

DeepSeek V4.1 Flash 发布公告: https://mp.weixin.qq.com/s/qg0NU3NNUbp1co2PdkAPAg

— THE END —

文章仅做学术分享,如有侵权请联系删除,非常感谢!

【声明】内容源于网络
0
0
AI大模型智能体前沿
分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
内容 1118
粉丝 0
AI大模型智能体前沿 分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
总阅读17.8k
粉丝0
内容1.1k