大数跨境

DeepSeek Flash接管Pro:V4-Pro请求今天起全部切到V4.1 Flash

DeepSeek Flash接管Pro:V4-Pro请求今天起全部切到V4.1 Flash ElephantMind.AIGC
2026-09-14
4
导读:9月14日12:00(北京时间)起,DeepSeek正式调整V4-Pro的API路由。

9月14日12:00(北京时间)起,DeepSeek正式调整V4-Pro的API路由。

所有调用deepseek-v4-pro的请求,将自动路由到V4.1 Flash,并按照V4.1 Flash的价格计费。这一状态会持续到未来V4.1 Pro正式上线。

开发者暂时不需要修改原来的deepseek-v4-pro模型名,但实际提供推理能力的模型已经变成V4.1 Flash。

这次变化比单纯一次API降价更直接:上一代旗舰正在退出主路由,而新架构家族里定位最低的Flash开始接管它的生产流量。

01|V4-Pro调用名还在,但实际已经跑V4.1 Flash

DeepSeek在V4.1 Flash发布公告里明确写了三件事。

第一,经多方测试,官方认为V4.1 Flash在性能、费用、速度和任务总耗时上已经超过V4-Pro。

第二,DeepSeek正在逐步淘汰V4-Pro。

第三,从9月14日04:00 UTC,也就是北京时间12:00开始,所有deepseek-v4-pro请求统一路由到V4.1 Flash,直到V4.1 Pro上线。

所以现在的状态可以简单理解成:

API模型名
实际模型
deepseek-flash
V4.1 Flash
deepseek-v4-flash
V4.1 Flash
deepseek-v4-flash-vision-exp
V4.1 Flash
deepseek-v4-pro V4.1 Flash

其中旧版V4 Flash和Vision Exp此前已经退出,旧模型名只是为了兼容现有代码继续保留。

现在V4-Pro也进入相同的迁移过程。

区别在于,V4-Pro不是简单改名,它仍然承担一个过渡作用:等V4.1 Pro发布以后,deepseek-v4-pro后续会如何映射,还需要看DeepSeek新的API说明。

因此,如果生产系统依赖具体模型版本,而不是只要求接口兼容,最好不要因为模型ID没有变化,就默认底层模型仍然是V4-Pro。

02|为什么Flash可以直接接管上一代Pro

V4.1 Flash不是V4 Flash简单重新训练一轮。

它属于DeepSeek新的模型架构家族,是一颗552B参数的MoE模型,并采用新的Causal Encoder–Decoder结构。

官方给出的参数激活量是:

  • 总参数:552B
  • Prefill / 输入阶段:约8B active parameters
  • Decode / 输出阶段:约16B active parameters

也就是说,模型拥有552B总参数,但一次token计算并不会把全部参数都激活。

这也是V4.1 Flash能够继续使用“Flash”这个产品定位的基础之一。

对Serving来说,更大的变化发生在KV Cache。

DeepSeek公布的数据是,相比上一代模型,V4.1 Flash的KV Cache:

  • HBM需求降到约1/4
  • SSD存储需求降到约1/8

对于长上下文和Agent任务,这个指标比总参数量更直接。

一个Agent连续运行几十轮以后,大量历史对话、代码、工具调用结果和文件内容都需要保留。如果每一个并发请求都需要占用大量KV Cache,GPU能够同时服务的Session数量就会快速下降。

Cache压缩之后,同样一批GPU可以承载更多长上下文请求,推理成本和并发上限都有机会改善。

03|V4.1 Flash继续降API价格的基础

V4.1 Flash从9月10日12:00开始已经执行新的API价格。

闲时价格为:

计费项
价格 / 1M tokens
Cache Hit Input
0.02元
Cache Miss Input
1元
Output
4元

高峰价格是闲时的2倍。

也就是:

计费项
高峰价格 / 1M tokens
Cache Hit Input
0.04元
Cache Miss Input
2元
Output
8元

DeepSeek仍然使用峰谷定价,工作日北京时间9:00—12:00、14:00—18:00属于高峰,其余时间按闲时价格计算。

9月10日调整的是V4.1 Flash本身的价格

9月14日是V4-Pro请求开始使用这套Flash价格。

所以原本按照V4-Pro价格做预算的系统,从路由切换以后,单次调用价格会明显改变。

04|对已有V4-Pro用户,最大的变化是行为

这次迁移对API兼容性的影响比较小。

如果代码里仍然是:

model="deepseek-v4-pro"

请求可以继续运行。

真正需要重新验证的是模型行为。

因为模型名没有变化,不代表底层Checkpoint没有变化。

生产系统至少应该重新跑一轮:

  • Regression Test
  • Tool Calling成功率
  • Structured Output稳定性
  • Coding / Agent任务完成率
  • Prompt兼容性
  • Latency
  • Token Usage
  • Cost per Successful Task

尤其是依赖固定Prompt行为的Agent。

模型能力可能整体提高,但模型升级之后,工具调用顺序、推理长度、格式偏好、错误恢复方式都有可能发生变化。

所以这次不能只做“接口还能不能返回200”。

更合理的测试方式是把V4-Pro过去一批真实任务重新跑在当前deepseek-v4-pro路由上,直接比较迁移前后的:

Success Rate / Latency / Tokens / Cost

05|Flash打败Pro?

DeepSeek官方使用了比较强的表述:V4.1 Flash在性能、成本、速度和总耗时等维度全面超过V4-Pro。

但现阶段仍然应该把它当成厂商结论。

生产团队真正需要验证的是自己的任务分布。

比如:

Coding Agent可能看DeepSWE、Terminal任务和Repo级修改。

Research Agent更看长上下文、搜索、工具调用和长时间稳定性。

高并发API业务更关心TTFT、TPS和Concurrency。

不同场景下,“V4.1 Flash > V4-Pro”不一定意味着所有指标都同比例提高。

但DeepSeek已经做了一个比Benchmark更强的产品动作:

它直接把V4-Pro的实际请求迁到了V4.1 Flash。

对于厂商自己来说,这相当于用生产路由表达了对新模型的判断。

上一代V4的路线比较传统。

先有V4-Pro作为高能力档,再通过V4-Flash提供更低成本、更高速度的选择。

V4.1目前反了过来。

第一款发布的是V4.1 Flash,而且官方把它定义为整个新架构家族里“最小的模型”。

但这款最小模型现在已经开始承担:

  • 原V4 Flash流量
  • 原Vision Exp流量
  • V4-Pro过渡期流量

也就是说,在V4.1 Pro还没有发布之前,DeepSeek正在把主要API流量尽量统一到V4.1 Flash上。

这会带来一个很实际的基础设施收益:

模型SKU越少,Serving、Batching、KV Cache管理和GPU调度越容易统一。

如果Flash同时覆盖大部分日常和高能力任务,就不需要为了不同产品档长期维护大量独立模型池。

对于大规模推理平台来说,这本身就是一种降成本方式。

目前DeepSeek没有公布V4.1 Pro的发布时间、参数量、激活参数或者API价格。

所以现阶段能够确认的只有一件事:

旧V4-Pro已经进入退出阶段,而V4.1 Flash正在成为DeepSeek当前API体系的默认主力模型。


参考来源

  • DeepSeek:DeepSeek V4.1 Flash:更强、更快、更普惠
  • DeepSeek:Introducing DeepSeek-V4.1-Flash
  • DeepSeek-V4.1-Flash Technical Report
  • DeepSeek API Docs:Models & Pricing

【声明】内容源于网络
0
0
ElephantMind.AIGC
深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
内容 68
粉丝 0
ElephantMind.AIGC 深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
总阅读1.3k
粉丝0
内容68