每百万 Tokens 输出 4 元起,DeepSeek 用一个最小的新模型,把自家旗舰挤下了牌桌,价格还降了。
最小的那个,反而是最能打的
今天,DeepSeek 正式发布 V4.1 Flash,这是它全新模型结构系列里尺寸最小的一个。
模型原生支持多模态视觉理解,总参数 552B,用的是全新的 Causal-Encoder-Decoder 结构。
更反直觉的是输入输出不对称:输入侧只激活 8B,输出侧激活 16B,成本显著低于同尺寸模型。
DeepSeek 称,它在基准测试中成功超越了包括 V4 Pro 在内的一众旗舰模型。
它已经同步上线 DeepSeek API,模型名改成 deepseek-flash 就能直接调用。
官方说,新结构要的是能力上限更高、推理更快、吞吐更大,还能往更大的参数规模扩展。
缓存砍到四分之一,价格跟着砍
新一代模型把 KV Cache 压得更狠:和上一代相比,HBM 需求降到原来的 1/4,SSD 需求降到 1/8。
官方给的数字是,每 Token 的 KV Cache 占用,初代要 389120 字节,到 V4.1 Flash 只剩 890 字节,缩小了 437 倍。
中间两步是 V3.2 的 48068 字节、V4-Flash 的 3514 字节,各自缩了 8.1 倍和 13.7 倍,最后一步 3.9 倍。
缓存省下来的,最后会体现在 Agent 的账单上。
DeepSeek 同步下调了价格:每百万 Tokens,输入缓存命中闲时 0.02 元,未命中 1 元,输出 4 元。
高峰时段翻倍,也就是 0.04 元、2 元和 8 元;工作日 9:00–12:00、14:00–18:00 之外算闲时。
多说两句
这次最值得琢磨的不是参数,而是 DeepSeek 打算怎么安顿 V4 Pro。
官方宣布,北京时间 9 月 14 日 12:00 后,访问 deepseek-v4-pro 的请求会全部路由到 V4.1 Flash,按 Flash 单价计费。
旧模型名也会暂时路由到新模型,开发者不用改一行代码。
权重和技术报告已经开源,官方还在找有 2k 卡 GPU 和存储集群的团队做大规模部署。
腾讯的 WorkBuddy、CodeBuddy 和 OpenCode,已作为官方合作伙伴全量接入。
从目前来看,这是拿 Flash 的价格去接住 Pro 的需求。这可能比发新模型更值得关注。
你的项目如果正卡在 API 成本和响应速度上,这波值得重新算一遍账。你会先拿哪个场景去试 V4.1 Flash?

