大数跨境

DeepSeek最小新模型直接替旗舰,OpenAI最贵套餐暂停新增

DeepSeek最小新模型直接替旗舰,OpenAI最贵套餐暂停新增 ElephantMind.AIGC
2026-09-11
2
导读:9月10日,DeepSeek正式上线V4.1 Flash;同一天,OpenAI暂停ChatGPT月费200美元新订阅

9月10日,DeepSeek正式上线V4.1 Flash;同一天,OpenAI暂停ChatGPT月费200美元的Pro 20X新增订阅和升级。

两件事都和推理资源有关,但处理方式完全不同。

DeepSeek把主要优化放在模型架构和KV Cache上:552B参数的MoE模型,Prefill阶段每个token只激活8B参数,Decode阶段激活16B,同时把持久化KV Cache的占用大幅压缩。

OpenAI面对的则是Astra上线后的容量压力。公司没有暂停API,也没有暂停Plus、Business或者100美元Pro,而是先关掉对系统压力最大的200美元Pro新增入口,保住现有用户体验。

01|V4.1 Flash:552B总参数,Prefill只激活8B

DeepSeek把V4.1 Flash定义为新架构家族中最小的一款模型。

它是一颗552B参数的多模态MoE模型,支持文本和图片输入,上下文长度最高100万token。和上一代相比,变化最大的不是参数规模,而是新的Causal Encoder-Decoder(CED)架构

整个模型由40层Transformer组成:

  • 20层Causal Encoder
  • 20层Decoder
  • Prefill阶段每token激活约8B参数
  • Decode阶段每token激活约16B参数

传统Decoder-only模型在每一层都需要为历史token保存KV Cache。V4.1 Flash改成由Encoder最终隐藏状态投影出Decoder需要的全局KV,减少长期保存的缓存量。

DeepSeek官方给出的结果是,相比上一代V4 Flash,V4.1 Flash的KV Cache:

  • HBM占用约为原来的1/4
  • SSD持久化存储约为原来的1/8

对于百万上下文和长周期Agent,这比“总参数552B”更影响实际推理成本。

长Agent最大的资源压力之一,本来就是历史上下文不断增长之后的KV Cache。缓存占用下降以后,同样一组GPU可以承载更多并发请求,也更容易把Cache Hit价格继续压低。

02|价格已经落地:闲时缓存命中0.02元/百万token

V4.1 Flash的新价格已经从9月10日12:00开始执行。

项目
空闲时段
高峰时段
缓存命中输入
0.02元 / MTok
0.04元
缓存未命中输入
1元 / MTok
2元
输出
4元 / MTok
8元

高峰时段仍然是工作日北京时间9:00—12:00、14:00—18:00,其余时间按空闲价格计费,周末全天属于空闲时段。

相比此前V4 Flash的闲时价格:

  • Cache Hit:0.05 → 0.02元,下降60%
  • Cache Miss:1.5 → 1元,下降33.3%
  • Output:4.5 → 4元,下降11.1%

所以这轮降价最受益的仍然是高Cache Hit的长上下文Agent,而不是所有任务统一便宜60%。

如果一个Coding Agent反复读取固定的System Prompt、工具定义、Repo上下文和历史任务状态,0.02元的Cache Hit价格会明显影响总成本;如果主要成本来自长输出,实际降幅会小得多。

03|V4.1 Flash正在直接替掉上一代Flash和V4 Pro

这次不是在现有模型列表里简单增加一个新ID。

DeepSeek已经明确,V4 Flash和V4 Flash Vision Exp退出主线,新模型统一使用:

deepseek-flash

为了兼容旧代码,deepseek-v4-flashdeepseek-v4-flash-vision-exp目前会暂时路由到V4.1 Flash。

更大的变化发生在V4 Pro。

DeepSeek宣布,从北京时间9月14日12:00开始,所有deepseek-v4-pro请求也会自动路由到V4.1 Flash,并按照V4.1 Flash价格收费,直到未来V4.1 Pro正式上线。

官方给出的理由是,经过内部和外部测试,V4.1 Flash在性能、价格、速度和任务总耗时上已经超过V4 Pro。

这里仍然要保留一个边界:“全面超过V4 Pro”目前是DeepSeek发布口径,不等于所有业务场景都已经有独立第三方复测。

但从产品动作来看,DeepSeek已经用迁移流量做出了判断:V4.1 Flash不是“更便宜的备用模型”,而是在直接接管上一代主力模型的调用。

04|这代架构主要在解决长Agent的显存和缓存问题

V4.1 Flash的架构路线很明显地针对Agent负载。

Agent和普通问答最大的区别之一,是输入会不断积累。

一次长周期任务可能持续几十轮甚至几百轮,模型需要不断读取:

  • 历史对话
  • 工具调用结果
  • 代码
  • 文件
  • 网页内容
  • Agent状态
  • System Prompt

Context Window扩大到100万token之后,理论上能装进去是一回事,能不能低成本持续运行又是另一回事。

V4.1 Flash把优化重点放在KV Cache,实际上是在处理后一个问题。

DeepSeek还引入了SWA Bounded Replay:部分Sliding Window Attention状态不再长期写入SSD,需要时只重新计算最近一段token,以计算换存储。

这种路线的目标不是单纯让模型Benchmark再高几分,而是降低长上下文Serving需要的显存、SSD和数据搬运。

对部署团队来说,后面更应该看:

  • TTFT
  • Decode TPS
  • KV Cache / request
  • 并发下的HBM占用
  • 1M Context下的吞吐
  • Agent Cost / Successful Task

这些数据比552B这个总参数数字更能决定V4.1 Flash实际能承载多少生产流量。

05|另一边,OpenAI暂停的是200美元Pro 20X

OpenAI这边需要把范围写准。

截至9月10日,公司暂停的是:

ChatGPT Pro $200(Pro 20X)的新增订阅和升级。

不是所有Pro。

目前:

  • 已有Pro $200用户:继续使用,不受影响
  • Pro $100:仍可新购和升级
  • Plus:不受影响
  • Business:不受影响
  • API:不受影响

如果现有200美元Pro用户取消订阅,并且订阅周期正式结束,在暂停解除之前将无法重新购买这一档。

OpenAI没有公布恢复日期。

这个限制是容量管理,而不是产品下线。

OpenAI产品负责人Tibo Sottiaux此前表示,Astra需求“前所未有”,团队正在增加容量,并会优先保证现有用户的服务质量。200美元Pro属于高使用量档位,对系统产生的压力最大,所以先暂停这一档的新用户进入。

06|为什么先关200美元Pro,而不是给所有人统一降额度

从容量控制角度,这个选择很好理解。

如果一个普通用户平均每天执行10个重任务,而Pro 20X用户能够执行几十甚至上百个,同样增加1000个新用户,对推理集群产生的边际压力完全不同。

OpenAI有几个选择:

第一种,所有套餐统一降额度。

第二种,提高价格。

第三种,给Astra排队。

第四种,暂时限制最高使用量套餐的新用户。

现在选的是第四种。

这样可以在不影响现有订阅和API的情况下,减少新增的高强度调用。

9月9日OpenAI状态页还记录过Plus和Pro会话错误率升高,随后恢复。单次故障不能直接证明就是Astra导致,但至少说明Astra大规模放量期间,前台容量和服务稳定性已经是产品层面的现实问题。

07|两边都在处理同一个Serving问题,但手段不同

DeepSeek这一轮做的是模型侧优化。

通过CED、MoE激活控制和KV Cache压缩,让同样的推理资源服务更多请求,然后把部分节省反映到API价格上。

OpenAI现在做的是供给侧控制。

Astra需求超过预期,在短期算力还没完全补上的情况下,先限制最吃资源的新增套餐,把容量优先留给现有用户。

这两条路线并不矛盾。

模型能力继续提高以后,推理基础设施最终都要同时处理三个问题:

单次调用需要多少计算,单台机器能承载多少并发,总需求增长得有多快。

模型架构解决第一和第二个问题。

套餐、限额、排队和价格解决第三个问题。

所以这次比“DeepSeek开门、OpenAI关门”更值得看的,是Serving开始直接影响产品设计。

DeepSeek已经把KV Cache写进模型发布的核心卖点;OpenAI则直接把容量压力写进订阅入口。

AI模型进入长周期Agent阶段以后,下一轮竞争不只是谁Benchmark更高。

还要看谁能把这些模型稳定、低延迟、低成本地供给足够多的用户。


参考来源

  • DeepSeek:Introducing DeepSeek-V4.1-Flash
  • DeepSeek-V4.1-Flash Technical Report
  • Hugging Face:deepseek-ai/DeepSeek-V4.1-Flash
  • DeepSeek开放平台:V4.1 Flash定价及V4 Pro迁移说明
  • OpenAI Help Center:About ChatGPT Pro tiers
  • OpenAI Status
  • Tibo Sottiaux:Astra demand / Pro 20X capacity statement

【声明】内容源于网络
0
0
ElephantMind.AIGC
深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
内容 68
粉丝 0
ElephantMind.AIGC 深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
总阅读1.3k
粉丝0
内容68