搜索
首页
大数快讯
大数活动
服务超市
报告
跨企查
广告开户
APP
产业带
导航
知识体系
工具箱
产业园
更多
百科
找货源
跨境招聘
DeepSeek
首页
>
刚刚,DeepSeek 发布新模型,Flash 把 Pro 给干掉了
>
刚刚,DeepSeek 发布新模型,Flash 把 Pro 给干掉了
APPSO
2026-09-10
2
导读:怎么都开始卷 Flash 模型了?
DeepSeek
正式发布 V4.1 Flash 模型,并已全面上线官网、App 及 API 端。作为新一代模型结构系列中的最小尺寸版本,V4.1 Flash 并未单纯追求规模扩张,而是从架构设计、缓存管理及推理流程等多维度进行重构,并具备原生多模态视觉理解能力。
官方指出,该模型旨在同步提升能力上限、推理
速度
与吞吐效率,为未来扩展奠定技术基础。其核心亮点在于:虽拥有 552B 参数的 MoE 架构,但通过创新计算机制,大幅降低了实际推理成本。
更快更便宜更智能的核心技术
技术
报告
显示,DeepSeek V4.1 Flash 最大的变革在于采用了全新的因果编码器 - 解码器(CED)架构。传统 Transformer 模型在输入理解与输出生成阶段往往采用相近的计算方式,而 CED 架构通过非对称设计,让模型在不同阶段激活不同规模的参数。
数据显示,V4.1 Flash 总参数量达 552B,但在输入阶段仅激活约 8B 参数,输出阶段激活约 16B 参数。这种设计既保留了大规模参数的能力上限,又显著降低了运行时的资源消耗,有效解决了长上下文场景下的效率瓶颈。
论文链接:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
针对 AI Agent 兴起后对长上下文处理的高需求,模型引入了压缩稀疏注意力机制 2(CSA2)。该机制通过跨层复用 KV Cache 并结合 Top-K 索引,使模型能优先关注关键信息,避免了对百万级 token 上下文的重复计算。
CSA2 包含 Full、Reindex 和 Reuse 三种模式,分别对应不同的计算复用策略,有效降低了生成过程中的计算量。此外,新模型采用 FP4 KV Cache 技术,相比上一代 FP8 方案,进一步压缩了存储需求。官方数据显示,其对 HBM 的需求降至原来的四分之一,对 SSD 的需求降至八分之一;若与初代模型相比,KV Cache 规模缩小了约 437 倍。
在生成阶段,DSpark 技术通过轻量模块提前预测部分 token,再由主模型确认,显著提升了 Decode 阶段的效率。综合上述优化及强化学习训练,V4.1 Flash 在多项 Agent 能力测试中表现优异,甚至超越了 DeepSeek V4 Pro 等旗舰模型,标志着 Flash 系列已从“轻量版”转变为兼顾性能与效率的主力模型。
从单一模型到 AI 工作环境的升级
伴随模型发布,DeepSeek 同步调整了 API
服务
策略。V4.1 Flash 已正式接入 API,调用名称为 deepseek-flash。原有的 V4 Flash 及 V4 Flash Vision Exp 版本已停止服务,但为保障兼容性,旧模型名称将暂时自动路由至新版本。
官方计划逐步下线 V4 Pro。测试表明,V4.1 Flash 在性能、成本及速度上均已超越 V4 Pro。
北京
时间
9 月 14 日 12 点后,访问 deepseek-v4-pro 的请求将自动转向 V4.1 Flash,并按新模型价格计费。
得益于架构优化,DeepSeek 同步下调了 API 费用,并继续实行峰谷定价机制,闲时价格为高峰时段的一半。目前,腾讯 WorkBuddy、CodeBuddy 及 OpenCode 等平台已率先接入该模型。
除模型本身外,DeepSeek 还发布了 DeepSeek Harness v0.1.5,旨在构建围绕 Agent 的工作流环境。新版 Harness 针对 V4.1 Flash 进行了专项优化,支持标准、程序化
工具
调用(PTC)及极简模式。其重要更新包括:支持在保留 KV Cache 的情况下更新系统提示词,允许用户在连续任务中调整方向而无需重置上下文。
Harness 的文件处理能力显著增强,Web 界面支持上传并解析图片、PDF 等多种格式。侧边栏新增文件管理功能,可预览 Markdown、HTML、代码及图片等资源。插件生态亦得到扩展,支持以多标签、分栏或全屏方式展示工具。
多 Agent 协作功能得到强化,父子 Agent 支持双向通信,用户可实时干预任务进程。此外,实验性功能"Agent Teams"允许主 Agent 创建团队、分配任务并跟踪进度,不同 Agent 间可互发消息,最终由主 Agent 汇总结果。该功能目前需手动开启。
界面设计上,DeepSeek 已将快速、专家及识图功能整合,不再单独设立专家模式。从 V4.1 Flash 到 Harness v0.1.5,DeepSeek 正致力于构建一套完整的技术体系:不仅提升模型能力,更通过优化推理效率、丰富工具生态和完善运行环境,推动 AI 真正融入日常工作流。
【声明】内容源于网络
0
0
APPSO
AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
内容
15735
粉丝
0
关注
在线咨询
APPSO
AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
总阅读
425.4k
粉丝
0
内容
15.7k