DeepSeek-V4-Flash(版本号 0731)于昨日正式开启 API 公测。该模型拥有 284B 总参数、13B 激活量,支持 1M 上下文窗口与 384K 最大输出,专攻 Agent 应用场景。
尽管此次仅为后训练层面的更新,但其在代码智能体领域表现卓越:Terminal Bench 2.1 得分 82.7,CyberGym 76.7,Toolathlon-Verified 70.3。这组数据涵盖了终端实操、安全防护与多工具调度等 Agent 核心场景。
图片来源:更新日志 | DeepSeek API Docs
除基准测试外,真实交付能力更为关键。本次测评在 Codex 环境下,通过三道开放实战任务对模型进行极限压测:
从零开发:无脚手架状态下自主搭建个人知识管理系统,考察需求分析与闭环落地能力;
长链研究:全局联网生成全球 AI 产业五层研究报告,考察多步骤执行下的目标对齐能力;
异地接续:零历史记忆接管上一轮代码并完成审查重构,考察陌生上下文理解与安全修改能力。
这三项任务对应 Agent 落地最易溃败的三个断层。测试不设标准答案,仅以最终交付结果为评判依据。
模型架构与技术解析
DeepSeek-V4-Flash-0731 延续了 284B 总参数、单 Token 动态激活 13B 的纯文本 MoE 架构,提供 1M 上下文窗口与 384K 最大输出。
其长文本能力基于 43 层 Transformer 的特殊设计:前两层采用纯滑动窗口注意力,后续层交替使用 CSA(压缩稀疏注意力)与 HCA(强压缩注意力)。CSA 将连续 Token 压缩 4 倍并精准挑选相关 KV 条目;HCA 则将压缩率提升至 128 倍,保留粗粒度全局信息。两者辅以滑动分支,将计算开销控制在可控范围,使百万 Token 上下文在工程部署中具备可行性。
MoE 结构上,模型每层包含 1 个共享专家与 256 个路由专家(单 Token 激活 6 个),前 3 层采用确定性 Hash 路由并引入多 Token 预测机制。模型在 32 万亿 Token 上完成预训练,大部分参数由 Muon 优化器更新。后训练流程先培养数学、代码、Agent 等专项专家,再通过在线策略蒸馏融合。0731 版本重做了后训练,针对性强化了代码与工具调用场景。
目前,0731 权重已完全开源。官方配置文件显示,其核心架构未变,新增模块主要服务于推理解码加速。公布的 9 项成绩聚焦于代码、终端操作与工具调用,明确其作为纯文本 Agent 模型的定位。

实测表现深度分析
实测一:个人知识管理系统从零开发
任务要求从空目录开发可运行的个人知识管理系统,涵盖注册登录、笔记管理、标签分类、统计看板、Markdown 导出、SQLite 持久化及测试,并支持后续迭代增加批量导入、备份恢复与双向链接功能。技术栈限定 Python3.12 与 FastAPI,前端使用原生 HTML/CSS/JS。
模型两轮累计用时约 162 分钟。交付物支持一条命令启动,前端无刷新切换,后端与数据库联动正常。批量导入支持 md 文件和压缩包,具备重复内容识别与危险路径拦截功能;备份恢复包裹在事务中,支持失败回滚;双向链接功能完整。
代码分层清晰,数据库查询防注入,用户输入防脚本,具备数据迁移逻辑及多用户数据隔离机制。第一轮开发耗时约 88 分钟,第二轮增量开发约 74 分钟,展现了“先理解再动手”的工程节奏。
体验验证显示,注册、笔记、标签、搜索、统计及导出全流程通畅,且多用户数据隔离有效。但在验收中也发现不足:技术栈未严格遵循 FastAPI 要求而使用了 Flask;笔记 Markdown 渲染、全量导出格式、批量导入标签位置及双向链接时序存在细节缺陷。此外,启动服务时因未区分阻塞型命令与后台服务,导致任务界面挂起 41 分钟。
实测二:AI 产业五层研究报告
任务要求联网完成全球 AI 产业基本面研究报告,涵盖芯片算力、数据中心、基础模型、开发平台及行业应用五层,交付 PPT、PDF、Excel 数据表及来源清单,并区分事实、估算与判断。
全程耗时约 36 分钟,几乎无返工。交付的 17 页 PPT 结构完整,数据来源以公司财报和权威机构为主,准确抓取最新数据。Excel 自带自动检查页,标注数据性质,来源清单写明口径,有效区分收入、合同额等财务概念。
报告对普通读者友好,每页均有清晰标题及数据来源标注。模型创建了 sources.md 文件,标注所有数据来源链接,便于快速溯源。这种透明度对投资研究与行业分析极具价值。
数据链条规范、可追溯。短板集中在排版细节,如 PPT 标题溢出或不对齐,仍需人工精修。该任务的核心价值在于构建了可审计的数据链,而非单纯的搜索能力。
实测三:陌生仓库审查与修复
任务要求在全新会话中接手陌生项目,运行测试并理解代码,重点审查登录权限、数据隔离、密码处理、注入攻击等安全风险,修复高优先级问题并补充测试。
模型先跑通 37 项基线测试,随后完成代码走读与安全审计。它精准指出了恶意压缩包防护、错误信息收敛、上传恢复限制等三个关键风险,并主动使用独立临时数据库进行验证。面对测试框架等待机制问题,模型选择了更合适的等待方式而非修改业务代码。
修复后测试项增至 53 项,新增 16 项安全专项测试,12 项端到端场景全部通过。审查报告结构完整,附带耗时记录,展现了自我复盘意识。
模型复刻了人类工程师“先跑起来、再读文档、最后小心修改”的流程,修改集中在后端安全边界,未破坏原有功能,体现了“胆大心细”的特点。
过程同样暴露短板:任务耗时约 86 分钟,大部分消耗在服务启动环节。模型反复用同步命令运行常驻服务,导致长时间等待,且清理临时环境变量方式偏粗暴。这反映出模型缺乏时间感知与主动脱困能力,同时也揭示了 Agent 框架在区分同步命令与后台服务方面的设计缺陷。
优势与局限分析
综合三道测试题,模型长板明显:在需自主建立状态、验证状态的任务(如事务、校验、回归)中完成度极高。其长链推理和交付能力强于环境生存能力,能独立完成大部分工作,坚持使用原生技术而不依赖外部框架掩盖难度。
短板集中于需感知外部环境状态的场景,如进程运行状态、命令后台执行等。具体表现为硬性约束偶尔走样、收尾细节遗漏、缺乏时间感知及遇到阻塞命令死等。这表明模型目前适合有人监控的自动化流程,而非完全无人值守的生产环境。
竞品对比与生态位
图片来源:DeepSeek-V4-Flash-0731 更新公告
与 Deepseek-v4-flash-Preview 相比,0731 在 DeepSWE、DSBench-Hard 及 DSBench-FullStack 等指标上实现数量级提升,证明后训练配方决定了模型能力上限。与 DeepSeek-V4-Pro-Preview 相比,Flash-0731 在 NL2Repo、CyberGym 等 Agent 场景中反超,说明在具体任务上,后训练、推理预算和 Agent 框架比单纯堆砌参数规模更重要。
这一结果打破了“参数越大越强”的固有认知,证明后训练质量可改写规模差距。对外部模型,Flash-0731 在 TerminalBench2.1 等指标上领先 GLM-5.2,接近 Opus-4.8,但在最难长期 Coding Agent 任务上仍有差距。
当前大模型路线分化明显:Kimi K3 拼多模态与总参数,GLM-5.2 强调长程任务自主闭环,Claude Opus 5 等守住数日级自治标杆。DeepSeek-V4-Flash-0731 则选择另一条路:不拼多模态,用 13B 激活将代码、终端、工具调用等文本 Agent 高频场景做到极致,同时压低调用成本。这种“小马拉大车”的实现方式,为高频调用 Agent 的团队提供了高性价比的产品路线。
需注意,官方表格中不同模型使用各自的 Agent 框架与推理设置,跨模型分数不能直接等同于日常体验。总体而言,deepseek-v4-flash-0731 定位为轻量激活的长上下文 Agent 基座,以 284B 核心目标模型、13B 激活的规模,重点强化代码、终端、工具调用和全栈开发能力。
结语
测试表明,deepseek-v4-flash-0731 已能完成真实、复杂且可验收的工作,三道题均交出完整成品。同时,其在进程等待等环节的表现也提醒我们,Agent 能力不仅取决于模型本身,还受限于框架设计与环境交互。
大模型竞争重心已从“谁答得更对”转向“谁更能闭环”。当 284B 参数配合 13B 激活,百万级上下文不再意味着高昂资源消耗,Agent 任务门槛大幅降低。未来的关键在于:后训练带来的能力提升能否在更多真实场景中稳定复现,以及在无人值守流程中如何解决“死等”等兜底问题。这些问题的答案,比榜单分数更为重要。
[1] DeepSeek API Docs,deepseek-v4-flash 官方更新日志
[2] Hugging Face,DeepSeek-V4-Flash-0731 官方模型权重
[3] Hugging Face,DeepSeek-V4-Flash-0731 配置文件
[4] DeepSeek-AI,DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
[5] DeepSeek API Docs,模型与价格