大数跨境

刚刚,DeepSeek 发布新模型,Flash 把 Pro 给干掉了

刚刚,DeepSeek 发布新模型,Flash 把 Pro 给干掉了 APPSO
2026-09-10
2
导读:怎么都开始卷 Flash 模型了?
DeepSeek 正式发布 V4.1 Flash 模型,并已全面上线官网、App 及 API 端。作为新一代模型结构系列中的最小尺寸版本,V4.1 Flash 并未单纯追求规模扩张,而是从架构设计、缓存管理及推理流程等多维度进行重构,并具备原生多模态视觉理解能力。
官方指出,该模型旨在同步提升能力上限、推理速度与吞吐效率,为未来扩展奠定技术基础。其核心亮点在于:虽拥有 552B 参数的 MoE 架构,但通过创新计算机制,大幅降低了实际推理成本。

更快更便宜更智能的核心技术

技术报告显示,DeepSeek V4.1 Flash 最大的变革在于采用了全新的因果编码器 - 解码器(CED)架构。传统 Transformer 模型在输入理解与输出生成阶段往往采用相近的计算方式,而 CED 架构通过非对称设计,让模型在不同阶段激活不同规模的参数。
数据显示,V4.1 Flash 总参数量达 552B,但在输入阶段仅激活约 8B 参数,输出阶段激活约 16B 参数。这种设计既保留了大规模参数的能力上限,又显著降低了运行时的资源消耗,有效解决了长上下文场景下的效率瓶颈。
论文链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
针对 AI Agent 兴起后对长上下文处理的高需求,模型引入了压缩稀疏注意力机制 2(CSA2)。该机制通过跨层复用 KV Cache 并结合 Top-K 索引,使模型能优先关注关键信息,避免了对百万级 token 上下文的重复计算。
CSA2 包含 Full、Reindex 和 Reuse 三种模式,分别对应不同的计算复用策略,有效降低了生成过程中的计算量。此外,新模型采用 FP4 KV Cache 技术,相比上一代 FP8 方案,进一步压缩了存储需求。官方数据显示,其对 HBM 的需求降至原来的四分之一,对 SSD 的需求降至八分之一;若与初代模型相比,KV Cache 规模缩小了约 437 倍。
在生成阶段,DSpark 技术通过轻量模块提前预测部分 token,再由主模型确认,显著提升了 Decode 阶段的效率。综合上述优化及强化学习训练,V4.1 Flash 在多项 Agent 能力测试中表现优异,甚至超越了 DeepSeek V4 Pro 等旗舰模型,标志着 Flash 系列已从“轻量版”转变为兼顾性能与效率的主力模型。

从单一模型到 AI 工作环境的升级

伴随模型发布,DeepSeek 同步调整了 API 服务策略。V4.1 Flash 已正式接入 API,调用名称为 deepseek-flash。原有的 V4 Flash 及 V4 Flash Vision Exp 版本已停止服务,但为保障兼容性,旧模型名称将暂时自动路由至新版本。
官方计划逐步下线 V4 Pro。测试表明,V4.1 Flash 在性能、成本及速度上均已超越 V4 Pro。北京时间 9 月 14 日 12 点后,访问 deepseek-v4-pro 的请求将自动转向 V4.1 Flash,并按新模型价格计费。
得益于架构优化,DeepSeek 同步下调了 API 费用,并继续实行峰谷定价机制,闲时价格为高峰时段的一半。目前,腾讯 WorkBuddy、CodeBuddy 及 OpenCode 等平台已率先接入该模型。
除模型本身外,DeepSeek 还发布了 DeepSeek Harness v0.1.5,旨在构建围绕 Agent 的工作流环境。新版 Harness 针对 V4.1 Flash 进行了专项优化,支持标准、程序化工具调用(PTC)及极简模式。其重要更新包括:支持在保留 KV Cache 的情况下更新系统提示词,允许用户在连续任务中调整方向而无需重置上下文。
Harness 的文件处理能力显著增强,Web 界面支持上传并解析图片、PDF 等多种格式。侧边栏新增文件管理功能,可预览 Markdown、HTML、代码及图片等资源。插件生态亦得到扩展,支持以多标签、分栏或全屏方式展示工具。
多 Agent 协作功能得到强化,父子 Agent 支持双向通信,用户可实时干预任务进程。此外,实验性功能"Agent Teams"允许主 Agent 创建团队、分配任务并跟踪进度,不同 Agent 间可互发消息,最终由主 Agent 汇总结果。该功能目前需手动开启。
界面设计上,DeepSeek 已将快速、专家及识图功能整合,不再单独设立专家模式。从 V4.1 Flash 到 Harness v0.1.5,DeepSeek 正致力于构建一套完整的技术体系:不仅提升模型能力,更通过优化推理效率、丰富工具生态和完善运行环境,推动 AI 真正融入日常工作流。
【声明】内容源于网络
0
0
APPSO
AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
内容 15735
粉丝 0
APPSO AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
总阅读425.4k
粉丝0
内容15.7k