DeepSeek V4.1 Flash 正式发布:Flash 反超 Pro,非对称架构重新定义性价比
9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型。这不是一次常规的小版本迭代——官方直接宣布,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越自家旗舰 V4 Pro,并计划有序下线 V4 Pro。
一个 Flash 级别的模型,居然干掉了 Pro,这在大模型行业还是头一回。
非对称架构:输入 8B,输出 16B
DeepSeek V4.1 Flash 最核心的变化,是采用了全新的 Causal-Encoder-Decoder(CED)非对称架构。
传统的大语言模型,无论是 dense 还是 MoE,输入和输出走的都是同一套计算路径。而 CED 架构把模型拆成了两部分:
-
Causal Encoder(因果编码器):处理输入文本,激活参数只有 8B
-
Decoder(解码器):生成输出文本,激活参数 16B
总参数规模达到 552B 的 MoE,另有 196B Engram 参数,支持最长 100 万 token 上下文。但实际运行时,输入阶段只激活 8B,输出阶段激活 16B,计算成本显著低于同尺寸的传统 MoE 模型。
这种设计抓住了一个朴素的事实:大多数场景下,输入 token 远多于输出 token。既然输入是"读"的过程,就不需要全量计算;输出是"写"的过程,才需要更强的生成能力。非对称架构正好匹配了这种不对称的使用模式。
KV Cache 暴降 437 倍,Agent 场景成本大幅下降
如果说非对称架构省的是计算,那 KV Cache 的优化省的就是显存和存储——而后者在长上下文和 Agent 场景中,往往是更大的成本项。
V4.1 Flash 在 KV Cache 压缩上做到了新的高度:
-
HBM 需求降至上一代的 1/4
-
SSD 需求降至上一代的 1/8
-
相对于 DeepSeek 初代模型,KV Cache 已经缩小了 437 倍
这对 Agent 类应用意味着什么?在多轮对话、工具调用、RAG 知识库等场景中,上下文会越积越长,缓存命中的输入 token 占比很高。KV Cache 越小,缓存命中的成本就越低,整体推理成本就能再下一个台阶。
结合非对称架构和 KV Cache 优化,V4.1 Flash 打出了一套"计算省 + 缓存省"的组合拳,这也是它能以 Flash 之名超越 Pro 的关键所在。
性能:Agent 能力追平甚至超越旗舰
DeepSeek 官方公布的基准测试数据显示,V4.1 Flash 在多项 Agent 相关基准上的表现已经追上甚至超越了当前的旗舰模型:
|
|
|
|
|
|
|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
可以看到,在 Terminal-Bench 和 DeepSWE 这两个最能反映 Agent 编程能力的基准上,V4.1 Flash 已经超过了 Opus 5.0 和 GPT-5.6 Sol,也大幅领先上一代 V4 Flash。
生成速度方面,内测数据显示 V4.1 Flash 约达每秒 284 个 token,比 V4 的约 97 个 token 提速近两倍。
性能追上旗舰,速度更快,成本更低——这就是 Flash 反超 Pro 的底气。
多模态原生支持,百万级上下文
V4.1 Flash 原生支持多模态视觉理解,不再像上一代那样需要单独的 Vision 版本。这也是新架构带来的额外红利:CED 结构天然适配多模态输入。
上下文窗口方面,V4.1 Flash 支持最长 100 万 token,延续了 DeepSeek V4 系列的长上下文能力。
向量云即将上线火山方舟 DeepSeek V4.1 Flash
好消息是,向量云即将在火山方舟平台上线 DeepSeek V4.1 Flash 模型服务。
作为火山方舟官方授权的 Token 服务提供商,向量云将第一时间为用户带来 V4.1 Flash 的接入能力。用户可以通过火山方舟官方 API 直接调用这款最新模型,享受新架构带来的性能提升和成本优势。https://ark.tokenrize.cn/
为什么选择通过向量云使用火山方舟的模型服务?
-
官方 API,稳定可靠:火山方舟官方真实 API Key,直达官方接口,不经中转,性能和安全有保障
-
企业级 RPM/TPM 保障:独享接入点资源,高峰期不排队、不限流,企业级使用有保障
-
缓存隔离,命中率更高:独立接入点,缓存数据与其他用户隔离,缓存命中率更高,进一步降低推理成本
-
多模型通用:一把 Key 可调用火山方舟平台上的多款模型,灵活切换,按需使用
-
按量计费,扣完即止:预充值模式,用多少扣多少,余额用完自动停止,零欠费风险
V4.1 Flash 本身在架构层面已经把成本压到了很低的水平,再加上向量云独享接入点的缓存优势,实际使用成本还能再降一截。对于重度使用 Agent、编程辅助、RAG 等场景的用户来说,这是一个值得关注的组合。https://ark.tokenrize.cn/
写在最后
DeepSeek V4.1 Flash 的发布,标志着大模型架构正在发生一次微妙但重要的转向。传统的"参数越大越强"的线性思维正在被更精巧的架构设计所补充——非对称的输入输出、极致的缓存压缩、更高效的 MoE 路由,这些"软实力"正在成为决定模型性价比的关键因素。
Flash 超越 Pro,听起来像是一个营销噱头,但背后是扎扎实实的技术创新。当一个 Flash 级别的模型既能打又便宜,Pro 的位置就变得尴尬了。这对用户来说是好事:用更低的成本,拿到更强的能力。
向量云将持续跟进火山方舟平台的模型更新,第一时间为用户带来最新、最具性价比的模型服务。关注我们,获取 V4.1 Flash 上线的最新动态。https://ark.tokenrize.cn/
向量云 — 火山方舟官方授权 Token 服务提供商,专注为企业和开发者提供高性能、高可靠的大模型 API 服务。

