0.02 元。这是 DeepSeek AI 调用中,缓存命中时每百万 Token 的输入价格。
换算来看,仅需两分钱,其覆盖的输入量约相当于一本中篇小说。
9 月 9 日,DeepSeek 在官方开放平台悄然发布公告,无预热、无发布会。然而这一举动瞬间引爆 AI 圈。
01. 价格调整详解:降幅高达 60%
新价格于 9 月 10 日中午 12 点正式执行。以 Flash 系列为例,具体调整如下:
|
|
|
|
|
|
|
|
0.02 元
|
60% |
|
|
|
1 元
|
|
|
|
|
4 元
|
|
注:高峰时段价格为空闲时段的 2 倍,周末统一按空闲时段计费。
此次降幅最大的是“缓存命中输入”,成本从 0.05 元降至 0.02 元。这意味着若询问 AI 已短期“记忆”的问题,成本几乎可忽略不计。但这并非简单的打折促销。
02. 涨价未满月即降价?实则精准计算
此次降价之所以引人注目,是因为就在一个月前的 8 月 13 日,DeepSeek 曾官宣上调 API 价格。当时 V4 Pro 高峰时段输入涨价 200%,输出涨价 350%,缓存命中输入更是暴涨 1100%。
然而细究此次调价,会发现一个关键事实:价格并未回落至 8 月涨价前的原点。
8 月涨价前,Flash 系列输出价格为 2 元/百万 Token;现价虽从高点 4.5 元降至 4 元,但仍是原价的两倍。可谓“输入回归原点,输出坚守高位”。这并非良心发现,而是一次基于成本结构的精准计算。
03. 降价底气:技术迭代带来的效率革命
降价的核心动力源于 9 月 8 日内测的 V4.1 Flash 中间版本。该模型采用全新架构,在能力、速度和成本上实现三重优化。
速度提升显著
实测数据显示,新模型思考时间仅 0.3 秒,生成速率高达每秒 159.3 个 Token,整轮对话端到端耗时 0.8 秒。在重度长文本推理中,生成速度甚至达到每秒 420 个 Token。
在 49k 超长上下文检索、SVG 代码生成及经典算法题解答场景中,处理速度分别提升了 5.2 倍、6.0 倍和 4.6 倍。同等任务耗时缩短 4 至 6 倍,单位时间内处理能力的大幅提升直接摊薄了单次任务成本。
架构革新降低成本
V4.1 Flash 采用了全新的 Causal-Encoder-Decoder 结构,实现输入输出参数不对称激活(输入 8B,输出 16B)。其 KV Cache 缓存大小较上一代缩小 437 倍,对 HBM 需求降至 1/4,对 SSD 需求降至 1/8。
省下的每一度电、每一块显存,最终都转化为价格表上的优势。这不是烧钱补贴,而是技术升级带来的自然红利。
04. 行业洞察:摩根士丹利的观点
针对此次调价,摩根士丹利发布研报指出两点核心逻辑:
第一,“旗舰 Pro+ 轻量 Flash"已成为行业标准打法。通过高性能 Pro 版树立标杆,利用低成本 Flash 版抢占高频轻量场景,构建商业化防线。
第二,价格战不会无底线。厂商均高度关注毛利率,不会陷入“卖一台亏一台”的恶性竞争。
大摩特别强调,调价后 DeepSeek Flash 的整体费率仍高于其 4 月初始水平,且在主流轻量模型中依旧偏贵。这表明 DeepSeek 的策略是精准的“卡位战”:比对手略低,但确保自身盈利。
Zero 君观察:从模型公司到基础设施
效率胜利取代价格补贴
此次降价本质是工程能力的胜利。当模型单位时间处理请求量数倍于同行,单次成本自然摊薄。能降价的公司,往往是效率最高的公司。未来的竞争将不再是资金实力的比拼,而是单位效率的较量。
战略转型:聚焦基础设施
DeepSeek 近期的招聘动向揭示了其战略转身。9 月 8 日启动的新一轮招聘计划招募约 150 名工程师,岗位集中于服务端开发和 Agent 弹性计算研发,无一涉及 AI 基础研究。
这与 6 月覆盖研究类的招聘形成鲜明对比。DeepSeek 的关注点已从“谁的模型跑分更高”转向“如何以最低成本、最快速度稳定交付模型能力”。从“做最强模型”到“做最便宜的基础设施”,这是战略级的转变。
用户展望:AI 如水电气般普及
短期内,终端用户的 AI 体验将更便宜、更快速。长期来看,当调用成本低到可忽略时,AI 将像水电一样融入生活角落,成为应用背后的基础能力,无需用户刻意调用。
0.02 元虽小,却象征行业从“比拼技术强弱”转向“比拼效率与成本”。历史证明,最终赢得市场的往往不是最强的那个,而是最普及、最便宜的那个。

