大数跨境

DeepSeek V4 Flash 0731:284B 参数模型本地跑,性能反超 V4 Pro

DeepSeek V4 Flash 0731:284B 参数模型本地跑,性能反超 V4 Pro AI工程化
2026-08-01
0

DeepSeek 今天放出了 V4 Flash 正式版更新,Unsloth 紧跟着就发布了 GGUF 量化版,可以直接在本地跑起来。

284B 参数,13B 活跃,1M 上下文

V4 Flash 0731 保持了和预览版一样的架构:284B 总参数,13B 活跃参数,1M 上下文窗口。官方说这次更新主要提升了 Agent 能力,从基准测试看,Flash 0731 直接超过了 V4 Pro 预览版。

上图是 Unsloth 整理的量化分析。Flash 是量化感知训练的:官方检查点把路由专家(96% 的模型)原生存成 MXFP4,其他部分用 FP8 或 BF16。Unsloth 的 UD-Q8_K_XL 量化直接复用这些 MXFP4 专家位,不做任何重量化,所以是真正无损的——所有 1328 个张量与官方权重按位相同,推理时 KL 散度约等于 0。

本地运行需要什么硬件

Unsloth 提供了多个量化等级,下表是硬件需求(总内存:RAM + VRAM 或统一内存):

量化等级 所需内存
1-bit 92 GB
2-bit 102 GB
3-bit (UD-IQ3_XXS) 110-135 GB
4-bit (UD-Q4_K_XL, 近无损) 162 GB
Q8_K_XL (无损) 169 GB

也就是说,3-bit 量化版本可以在 128GB 内存的机器上跑,4-bit 无损版本需要 169GB。对于有开发背景的读者,Unsloth 也提供了详细的 llama.cpp 和 Unsloth Studio 使用指南。

性能反超 V4 Pro

DeepSeek 官方放出的基准测试表更有意思:

Flash 0731 在 Terminal Bench 2.1 上拿到 82.7%,比 V4 Pro 预览版(72.1%)高出 10 个百分点;DeepSWE 从 12.8% 跳到 54.4%;NL2Repo 从 38.5% 升到 54.2%。这些提升主要来自 Agent 能力的升级,不是简单的模型缩放。

原生支持 Codex

DeepSeek 还宣布 V4 Flash 原生支持 OpenAI 的 Responses API 格式,并完全适配 Codex。官方提供了配置脚本,一行命令就能把 DeepSeek 设为 Codex 的默认模型。

# macOS / Linux
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)

# Windows PowerShell
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

脚本会自动备份原有配置,写入模型目录和 config.toml,并验证语法。也可以使用tokenbank直接纳管,不需要手工操作。对于已经用上 Codex 的开发者,这等于直接多了一个免费(或低成本)的本地模型选项。

小结

DeepSeek一向反向操作,只提性能不改版本号。如果你有 128GB 以上的内存,现在就能在本地跑一个接近 SOTA 的编码 Agent 模型。

GGUF 文件已经可以在 Hugging Face 下载:https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF。

关注公众号回复“进群”入群讨论


【声明】内容源于网络
0
0
AI工程化
专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
内容 633
粉丝 0
AI工程化 专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
总阅读4.3k
粉丝0
内容633