同一时间点,GLM-5.3-Flash的发布五折已经在9月9日24:00结束,目前Z.ai官方价格恢复到每百万tokens输入0.15美元、缓存输入0.03美元、输出0.50美元。
01|DeepSeek三个计费项降幅
DeepSeek Flash调整前后的空闲时段价格如下:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
高峰价格统一为上述价格的2倍,也就是缓存命中0.04元、缓存未命中2元、输出8元/百万tokens。
高峰时间没有变化:周一至周五北京时间9:00—12:00、14:00—18:00,其余时间按空闲价格计算。
所以真正降60%的只有缓存命中部分,输出token占比越高,整体成本降幅就越接近11%,而不是60%。
02|什么Agent最吃这次降价
缓存命中降到0.02元,对长上下文、重复读取固定信息的Agent最有用。
例如Coding Agent每轮都要带上System Prompt、Tool Definition、代码仓库上下文和历史任务状态;Research Agent也可能反复读取相同资料。只要这些内容能够稳定命中缓存,重复输入的成本会明显下降。
可以简单看两个例子。
假设一次长任务累计消耗:
-
缓存命中:10M tokens -
缓存未命中:1M tokens -
输出:1M tokens
旧价:
10 × 0.05 + 1 × 1.5 + 1 × 4.5 = 6.5元
新价:
10 × 0.02 + 1 × 1 + 1 × 4 = 5.2元
整体下降约20%。
如果任务的缓存复用更高:
-
缓存命中:100M -
缓存未命中:1M -
输出:1M
旧价约11元,新价约7元,整体下降约36%。
所以这轮价格调整对不同工作流差异会很大。高缓存命中的长周期Agent、代码Agent、固定知识库问答收益更明显;输出占比高、每轮输入变化很大的任务,整体降幅会小很多。
真正该看的指标还是:
Total Cost = Cache Hit × 0.02 + Cache Miss × 1 + Output × 4
高峰时段再整体乘2。
03|输出仍然是大头
Flash空闲时段输出只从4.5元降到4元,降幅11.1%。
对于生成大量代码、长报告或者长推理结果的Agent,输出可能依然是主要成本。
例如一个任务只有1M缓存未命中输入,但产生5M输出:
调整前:
1 × 1.5 + 5 × 4.5 = 24元
调整后:
1 × 1 + 5 × 4 = 21元
整体只下降12.5%。
所以如果团队想真正利用这次降价,单纯换API价格并不够,还要继续优化:
-
Cache Hit Ratio -
重复上下文比例 -
Output Length -
Agent循环次数 -
Retry Rate -
Reasoning Effort
尤其是长Agent,减少一次无效循环,可能比缓存单价再下降几十个百分点省得更多。
三个计费项分别下降60%、33.3%和11.1%,明显是在把价格优势更多给到可复用输入。
对于Agent系统来说,这会进一步放大Prompt Cache的价值。大量固定System Prompt、工具定义、代码上下文和知识库内容,如果每一轮都重新按Cache Miss计算,0.02元的价格基本吃不到。
所以今天12点之后,技术团队最适合做的不是重新看一次价格表,而是直接拉自己过去一周的调用数据,看三个数字:
缓存命中占输入多少、输出占总成本多少、Agent平均跑多少轮。
这三个数基本就能决定这次DeepSeek降价到底能给你的实际账单省多少。
不过DeepSeek还预告了V4.1 Flash,计划在9月10日前后发布。官方通知称,在V4.1 Flash正式上线到V4.1 Pro推出之前,对deepseek-v4-pro的请求将路由到V4.1 Flash,并按照Flash价格计费。
同时官方宣称V4.1 Flash在性能、费用、速度和总用时等指标上超过V4 Pro。
参考来源
-
DeepSeek开放平台:Flash系列价格调整公告 -
DeepSeek API Docs:Models & Pricing -
DeepSeek API Docs:Change Log

