9月14日12:00(北京时间)起,DeepSeek正式调整V4-Pro的API路由。
所有调用deepseek-v4-pro的请求,将自动路由到V4.1 Flash,并按照V4.1 Flash的价格计费。这一状态会持续到未来V4.1 Pro正式上线。
开发者暂时不需要修改原来的deepseek-v4-pro模型名,但实际提供推理能力的模型已经变成V4.1 Flash。
这次变化比单纯一次API降价更直接:上一代旗舰正在退出主路由,而新架构家族里定位最低的Flash开始接管它的生产流量。
01|V4-Pro调用名还在,但实际已经跑V4.1 Flash
DeepSeek在V4.1 Flash发布公告里明确写了三件事。
第一,经多方测试,官方认为V4.1 Flash在性能、费用、速度和任务总耗时上已经超过V4-Pro。
第二,DeepSeek正在逐步淘汰V4-Pro。
第三,从9月14日04:00 UTC,也就是北京时间12:00开始,所有deepseek-v4-pro请求统一路由到V4.1 Flash,直到V4.1 Pro上线。
所以现在的状态可以简单理解成:
|
|
|
|---|---|
deepseek-flash |
|
deepseek-v4-flash |
|
deepseek-v4-flash-vision-exp |
|
deepseek-v4-pro |
V4.1 Flash |
其中旧版V4 Flash和Vision Exp此前已经退出,旧模型名只是为了兼容现有代码继续保留。
现在V4-Pro也进入相同的迁移过程。
区别在于,V4-Pro不是简单改名,它仍然承担一个过渡作用:等V4.1 Pro发布以后,deepseek-v4-pro后续会如何映射,还需要看DeepSeek新的API说明。
因此,如果生产系统依赖具体模型版本,而不是只要求接口兼容,最好不要因为模型ID没有变化,就默认底层模型仍然是V4-Pro。
02|为什么Flash可以直接接管上一代Pro
V4.1 Flash不是V4 Flash简单重新训练一轮。
它属于DeepSeek新的模型架构家族,是一颗552B参数的MoE模型,并采用新的Causal Encoder–Decoder结构。
官方给出的参数激活量是:
- 总参数:552B
- Prefill / 输入阶段:约8B active parameters
- Decode / 输出阶段:约16B active parameters
也就是说,模型拥有552B总参数,但一次token计算并不会把全部参数都激活。
这也是V4.1 Flash能够继续使用“Flash”这个产品定位的基础之一。
对Serving来说,更大的变化发生在KV Cache。
DeepSeek公布的数据是,相比上一代模型,V4.1 Flash的KV Cache:
- HBM需求降到约1/4
- SSD存储需求降到约1/8
对于长上下文和Agent任务,这个指标比总参数量更直接。
一个Agent连续运行几十轮以后,大量历史对话、代码、工具调用结果和文件内容都需要保留。如果每一个并发请求都需要占用大量KV Cache,GPU能够同时服务的Session数量就会快速下降。
Cache压缩之后,同样一批GPU可以承载更多长上下文请求,推理成本和并发上限都有机会改善。
03|V4.1 Flash继续降API价格的基础
V4.1 Flash从9月10日12:00开始已经执行新的API价格。
闲时价格为:
|
|
|
|---|---|
|
|
0.02元 |
|
|
1元 |
|
|
4元 |
高峰价格是闲时的2倍。
也就是:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
DeepSeek仍然使用峰谷定价,工作日北京时间9:00—12:00、14:00—18:00属于高峰,其余时间按闲时价格计算。
9月10日调整的是V4.1 Flash本身的价格。
9月14日是V4-Pro请求开始使用这套Flash价格。
所以原本按照V4-Pro价格做预算的系统,从路由切换以后,单次调用价格会明显改变。
04|对已有V4-Pro用户,最大的变化是行为
这次迁移对API兼容性的影响比较小。
如果代码里仍然是:
model="deepseek-v4-pro"
请求可以继续运行。
真正需要重新验证的是模型行为。
因为模型名没有变化,不代表底层Checkpoint没有变化。
生产系统至少应该重新跑一轮:
- Regression Test
- Tool Calling成功率
- Structured Output稳定性
- Coding / Agent任务完成率
- Prompt兼容性
- Latency
- Token Usage
- Cost per Successful Task
尤其是依赖固定Prompt行为的Agent。
模型能力可能整体提高,但模型升级之后,工具调用顺序、推理长度、格式偏好、错误恢复方式都有可能发生变化。
所以这次不能只做“接口还能不能返回200”。
更合理的测试方式是把V4-Pro过去一批真实任务重新跑在当前deepseek-v4-pro路由上,直接比较迁移前后的:
Success Rate / Latency / Tokens / Cost
05|Flash打败Pro?
DeepSeek官方使用了比较强的表述:V4.1 Flash在性能、成本、速度和总耗时等维度全面超过V4-Pro。
但现阶段仍然应该把它当成厂商结论。
生产团队真正需要验证的是自己的任务分布。
比如:
Coding Agent可能看DeepSWE、Terminal任务和Repo级修改。
Research Agent更看长上下文、搜索、工具调用和长时间稳定性。
高并发API业务更关心TTFT、TPS和Concurrency。
不同场景下,“V4.1 Flash > V4-Pro”不一定意味着所有指标都同比例提高。
但DeepSeek已经做了一个比Benchmark更强的产品动作:
它直接把V4-Pro的实际请求迁到了V4.1 Flash。
对于厂商自己来说,这相当于用生产路由表达了对新模型的判断。
上一代V4的路线比较传统。
先有V4-Pro作为高能力档,再通过V4-Flash提供更低成本、更高速度的选择。
V4.1目前反了过来。
第一款发布的是V4.1 Flash,而且官方把它定义为整个新架构家族里“最小的模型”。
但这款最小模型现在已经开始承担:
- 原V4 Flash流量
- 原Vision Exp流量
- V4-Pro过渡期流量
也就是说,在V4.1 Pro还没有发布之前,DeepSeek正在把主要API流量尽量统一到V4.1 Flash上。
这会带来一个很实际的基础设施收益:
模型SKU越少,Serving、Batching、KV Cache管理和GPU调度越容易统一。
如果Flash同时覆盖大部分日常和高能力任务,就不需要为了不同产品档长期维护大量独立模型池。
对于大规模推理平台来说,这本身就是一种降成本方式。
目前DeepSeek没有公布V4.1 Pro的发布时间、参数量、激活参数或者API价格。
所以现阶段能够确认的只有一件事:
旧V4-Pro已经进入退出阶段,而V4.1 Flash正在成为DeepSeek当前API体系的默认主力模型。
参考来源
- DeepSeek:DeepSeek V4.1 Flash:更强、更快、更普惠
- DeepSeek:Introducing DeepSeek-V4.1-Flash
- DeepSeek-V4.1-Flash Technical Report
- DeepSeek API Docs:Models & Pricing

