DeepSeek 正式发布全新架构模型 DeepSeek-V4.1-Flash。作为该家族中体量最小的成员,该模型原生具备视觉理解能力,在推理速度与吞吐量上实现显著突破,并展现出优异的大规模扩展潜力。
架构革新:显存占用大幅降低
DeepSeek-V4.1-Flash 总参数量为 552B,采用 MoE(混合专家)结构及全新的因果编码器 - 解码器架构。其高效性体现在极低的激活参数占比:处理输入时仅激活 8B 参数,生成输出时仅激活 16B 参数。
得益于全新的预训练方法及大规模强化学习后训练,该模型在多项基准测试中表现优异,整体性能已超越上一代旗舰模型 DeepSeek-V4-Pro。
在资源占用方面,新模型实现了显著优化。相比上一代产品,其 HBM 显存占用降至四分之一,SSD 存储占用降至八分之一。
鉴于缓存命中费用在 Agent 应用成本中占比较高,此项压缩技术将直接大幅降低实际部署开销。
服务升级:旧旗舰退役与 API 降价
目前,V4.1-Flash 已在 DeepSeek API 正式上线,调用名称为 deepseek-flash,原生支持多模态任务。鉴于新模型在性能、成本效率及响应速度上的全面优势,DeepSeek 宣布启动旧旗舰模型的逐步淘汰计划:
- V4-Flash 和 V4-Flash-Vision-Exp 正式退役,原有接口请求将临时切换至 V4.1-Flash。
- 自 2026 年 9 月 14 日 04:00 UTC 起,所有指向 deepseek-v4-pro 的请求将自动路由至 V4.1-Flash,并按新模型的更低费率计费,直至 V4.1-Pro 正式发布。
官方合作伙伴 WorkBuddy_AI(含 Codebuddy)及 opencode 现已全面适配 V4.1-Flash。架构的高效性也推动了 API 定价的下调。
平台延续高峰期与低谷期差异化定价策略,低谷期调用价格仅为高峰期的 50%。全新价格体系将于 2026 年 9 月 10 日 04:00 UTC 正式生效。
开源生态与部署方案
DeepSeek 持续践行开源战略,目前已公开模型权重及技术报告。团队表示将与开源社区紧密合作,进一步优化推理支持并探索多元化部署方案。针对拥有 2000 张 GPU 及大规模存储集群的企业级部署需求,官方已开放专项对接渠道。
模型地址:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
论文地址:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

