DeepSeek 今天放出了 V4 Flash 正式版更新,Unsloth 紧跟着就发布了 GGUF 量化版,可以直接在本地跑起来。
284B 参数,13B 活跃,1M 上下文
V4 Flash 0731 保持了和预览版一样的架构:284B 总参数,13B 活跃参数,1M 上下文窗口。官方说这次更新主要提升了 Agent 能力,从基准测试看,Flash 0731 直接超过了 V4 Pro 预览版。

上图是 Unsloth 整理的量化分析。Flash 是量化感知训练的:官方检查点把路由专家(96% 的模型)原生存成 MXFP4,其他部分用 FP8 或 BF16。Unsloth 的 UD-Q8_K_XL 量化直接复用这些 MXFP4 专家位,不做任何重量化,所以是真正无损的——所有 1328 个张量与官方权重按位相同,推理时 KL 散度约等于 0。
本地运行需要什么硬件
Unsloth 提供了多个量化等级,下表是硬件需求(总内存:RAM + VRAM 或统一内存):
| 量化等级 | 所需内存 |
|---|---|
| 1-bit | 92 GB |
| 2-bit | 102 GB |
| 3-bit (UD-IQ3_XXS) | 110-135 GB |
| 4-bit (UD-Q4_K_XL, 近无损) | 162 GB |
| Q8_K_XL (无损) | 169 GB |
也就是说,3-bit 量化版本可以在 128GB 内存的机器上跑,4-bit 无损版本需要 169GB。对于有开发背景的读者,Unsloth 也提供了详细的 llama.cpp 和 Unsloth Studio 使用指南。
性能反超 V4 Pro
DeepSeek 官方放出的基准测试表更有意思:

Flash 0731 在 Terminal Bench 2.1 上拿到 82.7%,比 V4 Pro 预览版(72.1%)高出 10 个百分点;DeepSWE 从 12.8% 跳到 54.4%;NL2Repo 从 38.5% 升到 54.2%。这些提升主要来自 Agent 能力的升级,不是简单的模型缩放。
原生支持 Codex
DeepSeek 还宣布 V4 Flash 原生支持 OpenAI 的 Responses API 格式,并完全适配 Codex。官方提供了配置脚本,一行命令就能把 DeepSeek 设为 Codex 的默认模型。
# macOS / Linux
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
# Windows PowerShell
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
脚本会自动备份原有配置,写入模型目录和 config.toml,并验证语法。也可以使用tokenbank直接纳管,不需要手工操作。对于已经用上 Codex 的开发者,这等于直接多了一个免费(或低成本)的本地模型选项。
小结
DeepSeek一向反向操作,只提性能不改版本号。如果你有 128GB 以上的内存,现在就能在本地跑一个接近 SOTA 的编码 Agent 模型。
GGUF 文件已经可以在 Hugging Face 下载:https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF。
关注公众号回复“进群”入群讨论

