9月10日,DeepSeek正式上线V4.1 Flash;同一天,OpenAI暂停ChatGPT月费200美元的Pro 20X新增订阅和升级。
两件事都和推理资源有关,但处理方式完全不同。
DeepSeek把主要优化放在模型架构和KV Cache上:552B参数的MoE模型,Prefill阶段每个token只激活8B参数,Decode阶段激活16B,同时把持久化KV Cache的占用大幅压缩。
OpenAI面对的则是Astra上线后的容量压力。公司没有暂停API,也没有暂停Plus、Business或者100美元Pro,而是先关掉对系统压力最大的200美元Pro新增入口,保住现有用户体验。
01|V4.1 Flash:552B总参数,Prefill只激活8B
DeepSeek把V4.1 Flash定义为新架构家族中最小的一款模型。
它是一颗552B参数的多模态MoE模型,支持文本和图片输入,上下文长度最高100万token。和上一代相比,变化最大的不是参数规模,而是新的Causal Encoder-Decoder(CED)架构。
整个模型由40层Transformer组成:
-
20层Causal Encoder -
20层Decoder -
Prefill阶段每token激活约8B参数 -
Decode阶段每token激活约16B参数
传统Decoder-only模型在每一层都需要为历史token保存KV Cache。V4.1 Flash改成由Encoder最终隐藏状态投影出Decoder需要的全局KV,减少长期保存的缓存量。
DeepSeek官方给出的结果是,相比上一代V4 Flash,V4.1 Flash的KV Cache:
-
HBM占用约为原来的1/4 -
SSD持久化存储约为原来的1/8
对于百万上下文和长周期Agent,这比“总参数552B”更影响实际推理成本。
长Agent最大的资源压力之一,本来就是历史上下文不断增长之后的KV Cache。缓存占用下降以后,同样一组GPU可以承载更多并发请求,也更容易把Cache Hit价格继续压低。
02|价格已经落地:闲时缓存命中0.02元/百万token
V4.1 Flash的新价格已经从9月10日12:00开始执行。
|
|
|
|
|---|---|---|
|
|
0.02元 / MTok |
|
|
|
1元 / MTok |
|
|
|
4元 / MTok |
|
高峰时段仍然是工作日北京时间9:00—12:00、14:00—18:00,其余时间按空闲价格计费,周末全天属于空闲时段。
相比此前V4 Flash的闲时价格:
-
Cache Hit:0.05 → 0.02元,下降60% -
Cache Miss:1.5 → 1元,下降33.3% -
Output:4.5 → 4元,下降11.1%
所以这轮降价最受益的仍然是高Cache Hit的长上下文Agent,而不是所有任务统一便宜60%。
如果一个Coding Agent反复读取固定的System Prompt、工具定义、Repo上下文和历史任务状态,0.02元的Cache Hit价格会明显影响总成本;如果主要成本来自长输出,实际降幅会小得多。
03|V4.1 Flash正在直接替掉上一代Flash和V4 Pro
这次不是在现有模型列表里简单增加一个新ID。
DeepSeek已经明确,V4 Flash和V4 Flash Vision Exp退出主线,新模型统一使用:
deepseek-flash
为了兼容旧代码,deepseek-v4-flash和deepseek-v4-flash-vision-exp目前会暂时路由到V4.1 Flash。
更大的变化发生在V4 Pro。
DeepSeek宣布,从北京时间9月14日12:00开始,所有deepseek-v4-pro请求也会自动路由到V4.1 Flash,并按照V4.1 Flash价格收费,直到未来V4.1 Pro正式上线。
官方给出的理由是,经过内部和外部测试,V4.1 Flash在性能、价格、速度和任务总耗时上已经超过V4 Pro。
这里仍然要保留一个边界:“全面超过V4 Pro”目前是DeepSeek发布口径,不等于所有业务场景都已经有独立第三方复测。
但从产品动作来看,DeepSeek已经用迁移流量做出了判断:V4.1 Flash不是“更便宜的备用模型”,而是在直接接管上一代主力模型的调用。
04|这代架构主要在解决长Agent的显存和缓存问题
V4.1 Flash的架构路线很明显地针对Agent负载。
Agent和普通问答最大的区别之一,是输入会不断积累。
一次长周期任务可能持续几十轮甚至几百轮,模型需要不断读取:
-
历史对话 -
工具调用结果 -
代码 -
文件 -
网页内容 -
Agent状态 -
System Prompt
Context Window扩大到100万token之后,理论上能装进去是一回事,能不能低成本持续运行又是另一回事。
V4.1 Flash把优化重点放在KV Cache,实际上是在处理后一个问题。
DeepSeek还引入了SWA Bounded Replay:部分Sliding Window Attention状态不再长期写入SSD,需要时只重新计算最近一段token,以计算换存储。
这种路线的目标不是单纯让模型Benchmark再高几分,而是降低长上下文Serving需要的显存、SSD和数据搬运。
对部署团队来说,后面更应该看:
-
TTFT -
Decode TPS -
KV Cache / request -
并发下的HBM占用 -
1M Context下的吞吐 -
Agent Cost / Successful Task
这些数据比552B这个总参数数字更能决定V4.1 Flash实际能承载多少生产流量。
05|另一边,OpenAI暂停的是200美元Pro 20X
OpenAI这边需要把范围写准。
截至9月10日,公司暂停的是:
ChatGPT Pro $200(Pro 20X)的新增订阅和升级。
不是所有Pro。
目前:
-
已有Pro $200用户:继续使用,不受影响 -
Pro $100:仍可新购和升级 -
Plus:不受影响 -
Business:不受影响 -
API:不受影响
如果现有200美元Pro用户取消订阅,并且订阅周期正式结束,在暂停解除之前将无法重新购买这一档。
OpenAI没有公布恢复日期。
这个限制是容量管理,而不是产品下线。
OpenAI产品负责人Tibo Sottiaux此前表示,Astra需求“前所未有”,团队正在增加容量,并会优先保证现有用户的服务质量。200美元Pro属于高使用量档位,对系统产生的压力最大,所以先暂停这一档的新用户进入。
06|为什么先关200美元Pro,而不是给所有人统一降额度
从容量控制角度,这个选择很好理解。
如果一个普通用户平均每天执行10个重任务,而Pro 20X用户能够执行几十甚至上百个,同样增加1000个新用户,对推理集群产生的边际压力完全不同。
OpenAI有几个选择:
第一种,所有套餐统一降额度。
第二种,提高价格。
第三种,给Astra排队。
第四种,暂时限制最高使用量套餐的新用户。
现在选的是第四种。
这样可以在不影响现有订阅和API的情况下,减少新增的高强度调用。
9月9日OpenAI状态页还记录过Plus和Pro会话错误率升高,随后恢复。单次故障不能直接证明就是Astra导致,但至少说明Astra大规模放量期间,前台容量和服务稳定性已经是产品层面的现实问题。
07|两边都在处理同一个Serving问题,但手段不同
DeepSeek这一轮做的是模型侧优化。
通过CED、MoE激活控制和KV Cache压缩,让同样的推理资源服务更多请求,然后把部分节省反映到API价格上。
OpenAI现在做的是供给侧控制。
Astra需求超过预期,在短期算力还没完全补上的情况下,先限制最吃资源的新增套餐,把容量优先留给现有用户。
这两条路线并不矛盾。
模型能力继续提高以后,推理基础设施最终都要同时处理三个问题:
单次调用需要多少计算,单台机器能承载多少并发,总需求增长得有多快。
模型架构解决第一和第二个问题。
套餐、限额、排队和价格解决第三个问题。
所以这次比“DeepSeek开门、OpenAI关门”更值得看的,是Serving开始直接影响产品设计。
DeepSeek已经把KV Cache写进模型发布的核心卖点;OpenAI则直接把容量压力写进订阅入口。
AI模型进入长周期Agent阶段以后,下一轮竞争不只是谁Benchmark更高。
还要看谁能把这些模型稳定、低延迟、低成本地供给足够多的用户。
参考来源
-
DeepSeek:Introducing DeepSeek-V4.1-Flash -
DeepSeek-V4.1-Flash Technical Report -
Hugging Face:deepseek-ai/DeepSeek-V4.1-Flash -
DeepSeek开放平台:V4.1 Flash定价及V4 Pro迁移说明 -
OpenAI Help Center:About ChatGPT Pro tiers -
OpenAI Status -
Tibo Sottiaux:Astra demand / Pro 20X capacity statement

