DeepSeek-V4-Pro-0813 正式上线不足 24 小时,便经历了从“核弹级更新”到“性能滑铁卢”的剧烈反转。一边是评测数据逼近顶级闭源模型,另一边却是开发者实测体验不及预期,甚至出现同一任务前后表现不一的异常情况。

随着官网火速撤下相关公告,外界普遍怀疑新模型经历了一次紧急线上回滚。通过深入分析 Hugging Face 仓库提交记录与 API 后台返回数据,这场发布风波背后的技术真相逐渐浮出水面。

公告上线即撤回:从全网欢腾到质疑声起
8 月 13 日凌晨,DeepSeek 延续极简风格,悄悄将 API 后端切换至 DeepSeek-V4-Pro-0813 正式版。初期官方跑分显示,其在 Terminal-Bench 2.1 测试中得分 87.9,仅距 Claude Fable 5 差 0.1 分,加之极具竞争力的定价,引发海外开发者与投资人高度关注。
然而,狂欢仅持续半天。当开发者将其接入真实业务流后,发现这款拥有 1.6 万亿参数的旗舰模型表现极不稳定。第三方机构 Artificial Analysis 测得其综合得分仅为 53 分,仅比小参数版本的 V4 Flash 高出 1 分,且在网络安全扫描等场景中误报率频发。
面对“大模型变笨”的广泛质疑,DeepSeek 官网于 13 日下午迅速撤下相关公告,将服务状态回退至发布前。
Hugging Face 记录曝光:紧急抢修与配置修正
针对此次异常,技术人员通过扒开 DeepSeek 在 Hugging Face 上的官方代码仓库(deepseek-ai/DeepSeek-V4-Pro-0813),发现了团队连夜抢修的痕迹。
架构参数错位:小弟装大哥?
最初上传的 V4-Pro-0813 配置文件中,hidden_size 为 4096、路由专家数为 256、隐藏层数为 43,这些数值竟与低配版 V4-Flash-0731 完全一致。社区随即提出质疑,官方成员 msr2000 回复确认“已处理”。
修正后的配置重新对齐了 V4 Pro 应有的架构:hidden_size 升至 7168,路由专家增至 384 个,层数达 61 层,Attention Head 数为 128。同时,MoE 中间层大小、Q-LoRA Rank 等一系列关键参数也完成了同步更新。
二进制权重替换:不止是配置文件
除配置文件外,DeepSeek 还修改了推理配置(inference/config.json)。在版本发布后,官方不仅更新了 config.json,更通过工具连续两次重新上传了大型权重文件。
对比关键权重分片(model-00035 至 model-00039.safetensors)的记录发现,其 SHA256 校验码全部改变,文件体积亦有微调。这证实 DeepSeek 替换的不仅是定义模型结构的配置文件,部分真实的模型二进制权重文件也被重新处理。
推理栈热切换:系统指纹突变
如果说 Hugging Face 的修正是静态文件的更正,那么 API 后端的指纹突变则揭示了云端正在进行的动态抢修。测试发现,模型的 system_fingerprint(系统指纹)发生了剧烈变动。
此前,开发者可通过指纹读取构建日期及量化细节。但在实测期间,Pro 和 Flash 版本的系统指纹在半小时内同步切换为无法解读的纯 32 位 Hash。这一变化直接对应着线上推理后端、部署版本及算力调度策略的彻底重构,印证了 DeepSeek 刚刚经历了一场决绝的热切换。
结语:万亿参数时代的 Infra 警钟
综合多条线索判断,此次发版混乱并非单纯的模型能力问题,而是前端接口、后端推理栈与权重配置三者出现严重错位所致。这种错位导致不同时间、不同入口的开发者获得了截然不同的体验。
此次事件为高速发展的模型行业敲响了警钟。当模型体量迈入万亿参数级别(如 V4 Pro 的 FP8 量化权重高达 893 GB),任何微小的配置失误——哪怕只是一个 config 文件的参数错误——都可能在基础设施(Infra)层被无限放大,最终在前端体验上造成巨大落差。这不仅是对参数堆叠的考验,更是对算力调度、高并发吞吐等底层工程能力的极限挑战。
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。



