
DeepSeek V4.1 Flash 正式上线:小尺寸反超旗舰,定价大幅下调
智东西 9 月 10 日报道,DeepSeek 正式发布全新模型 DeepSeek V4.1 Flash。该模型采用创新架构,作为参数量 552B 的 MoE 模型,是其系列中尺寸最小的成员,但在性能上已超越包括 DeepSeek V4 Pro 在内的多款旗舰模型。
模型开源地址:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
论文链接:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
与此同时,DeepSeek App 已完成升级,整合快速、专家及识图模式并上线新模型,网页端亦同步更新。
01. 性能全面超越旗舰,定价显著下调
得益于架构创新,DeepSeek V4.1 Flash 在保留峰谷定价机制的基础上大幅下调价格,闲时资费仅为高峰时段的一半。新定价自 2026 年 9 月 10 日 12:00 起生效:
- 闲时价格:输入(缓存命中)0.02 元、未命中 1.0 元;输出 4.0 元。
- 高峰价格:输入(缓存命中)0.04 元、未命中 2.0 元;输出 8.0 元。
▲DeepSeek V4.1 Flash 定价表(图源:DeepSeek)
技术层面,该模型具备原生多模态视觉理解能力,采用全新的 Causal-Encoder-Decoder 架构。其输入输出不对称设计(输入激活 8B,输出激活 16B)显著降低了成本。在 Agentic Benchmark 等测试中,凭借新的预训练方式及大规模强化学习,V4.1 Flash 的表现优于 DeepSeek V4 Pro、GLM5.3 及 Kimi-K3 等前沿旗舰模型。
▲DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比(图源:DeepSeek)
官方表示,新架构旨在实现更高的能力上限、更快的推理速度及更大的吞吐量,并具备向更大参数规模扩展的潜力。
02. 缓存大幅压缩,V4 Pro 即将退场
V4.1 Flash 在 KV Cache 缓存效率上实现质的飞跃。相比 V4 Flash,其对 HBM 需求降至 1/4,对 SSD 需求降至 1/8。官方数据显示,初代 DeepSeek V1 的 KV Cache 用量竟是 V4.1 Flash 的 437 倍。
▲DeepSeek 在减少上下文存储方面的持续进展(图源:DeepSeek)
这一突破源于架构、缓存精度与部署策略的协同优化:
- 架构优化:采用 CSA2(压缩稀疏注意力 2)机制,跨层复用全局 KV 缓存和 Top-K 索引,仅保留各层查询向量与局部注意力缓存,大幅削减重复存储。
- 精度提升:训练阶段直接采用 FP4 格式存储全局 KV 缓存,性能损耗微乎其微。
- 部署策略:新增 SWA 有界重放机制,仅需重放最近 n 个 token 即可重建滑动窗口注意力状态,无需将 SWA 缓存写入 SSD,进一步压缩持久化缓存占用。
上述设计使上下文长度从 4K 扩展至 1M,而单 token 解码 FLOPs 仅增加约 25%,解码成本几乎不随上下文长度增长。这对长上下文、多轮调用的 Agent 工作流尤为利好,显著降低了使用成本。
▲DeepSeek-V4.1-Flash 上下文长度和前代模型对比(图源:DeepSeek)
目前,V4.1 Flash 已上线 DeepSeek API。旧版本 V4 Flash 与 V4 Flash Vision Exp 正式下线,原模型名称将自动路由至新版本。鉴于 V4.1 Flash 各项指标全面超越 V4 Pro,官方宣布将于 9 月 14 日 12:00 有序下线 V4 Pro,所有相关请求将路由至新模型并按新单价计费。
▲DeepSeek 模型调整公告(图源:DeepSeek)
03. 全力支持开源,生态伙伴全量接入
DeepSeek 宣布全力支持开源社区进行新模型推理适配,并为具备大规模部署资源(如 2000 卡 GPU 集群)的用户提供联系渠道。
同步上线的 DeepSeek Harness v0.1.5 版本针对 V4.1 Flash 进行了专项优化,支持在保留现有 KV Cache 的情况下更新系统提示词。
生态合作方面,腾讯系产品(WorkBuddy、CodeBuddy 等)及 OpenCode 已全量接入新模型。其中,OpenCode Go 套餐提供 4 倍使用额度,WorkBuddy 推出限时两周独家优惠。腾讯云 TokenHub、ima、Marvis 等平台也同步完成接入。
▲OpenCode 模型使用额度表(图源:OpenCode)
同期开源的还有 DeepJIT,这是一个轻量级 xPU 内核 JIT 编译库,同时支持 NVIDIA CUDA GPU 和华为昇腾 NPU,为推理侧提供统一接口及跨节点共享缓存能力。
04. 结语:最小模型反超旗舰,推理成本持续下降
DeepSeek V4.1 Flash 通过全新架构压低成本的同時,利用大规模强化学习提升智能水平,以最小尺寸实现了对旗舰模型的全面超越。对于高频使用 Agent 的用户而言,缓存压缩与价格下调的双重红利将带来更显著的成本节约。
随着 V4 Pro 的有序下线,DeepSeek 产品线正围绕新架构重新排序。官方透露新架构可扩展至更大参数模型,未来更高性价比的旗舰模型值得期待。