OFweek 维科网消息,DeepSeek-V4-Flash 正式版 API 今日上线公测,DeepSeek-V4-Pro 正式版预计于 8 月初发布。
价格大幅下调,Flash 版性价比凸显
在定价策略上,新版本展现出极强的竞争力。DeepSeek-V4-Pro 在输入命中缓存时价格为 1 元/百万 tokens,未命中则为 12 元/百万 tokens,输出价格为 24 元/百万 tokens。而 DeepSeek-V4-Flash 更为低廉,输入命中缓存仅需 0.2 元/百万 tokens,未命中为 1 元/百万 tokens,输出价格为 2 元/百万 tokens。
官方表示,V4-Flash 的 Agent 能力大幅升级,表现甚至优于 V4-Pro 预览版。
技术架构解析:重训而非扩容
本次更新的核心亮点并非参数量的增加,而是训练策略的优化。DeepSeek-V4-Flash-0731 的模型结构与尺寸与此前发布的 Preview 版保持一致,仅进行了重新后训练(Post-training)。这意味着,在过去三个月中,DeepSeek 并未在预训练阶段增加任何参数,而是通过算法优化提升了模型性能。
原生适配 Codex,开发体验升级
Flash 正式版已原生支持 Responses API 格式,并专门针对 Codex 进行了适配。开发者只需一次配置,即可在 Codex CLI、ChatGPT 桌面端以及 VS Code 的 Codex 插件中直接调用该模型,显著提升了开发效率。
全新业务线 Harness 即将公布
此外,DeepSeek 宣布其新成立的独立业务线"Harness"即将正式亮相。该业务线于今年 3 月设立,由负责人崔添翼直接向梁文锋汇报。
低成本支撑激进工程设计
Agent 应用通常被视为"Token 黑洞”。复杂的编码任务往往涉及多轮重试、子 Agent 并行及上下文回灌,单次任务消耗数十万 Token 起步。竞品如 Claude Code 不得不投入大量工程资源进行上下文压缩、按需读取文件及历史裁剪,以控制成本。
得益于极低的定价(V4-Flash 输入约 0.14 美元/百万 Token,输出 0.28 美元,远低于同档位竞品近两个数量级),DeepSeek 无需在省钱上做过多妥协。Harness 因此能够采用更为激进的设计策略:将完整代码仓库塞进 1M 上下文而无需检索、失败后自动重跑多次取最优解、同时开启多个子 Agent 并行探路。
闭源策略保护核心资产
值得注意的是,Harness 大概率不会开源。虽然模型开源是 DeepSeek 的重要品牌资产,但 Harness 的核心价值在于其产品体验与积累的用户行为数据。开源等同于向竞争对手暴露底牌,这与 Claude Code 采取闭源策略的逻辑一致。

