DeepSeek‑V4 多模态模型正式开源,总参数达 3050 亿。该模型采用 MoE 混合专家架构,推理过程仅激活 130 亿参数,无需调度全部权重,显著降低推理成本。
一、模型基础信息
模型名称:DeepSeek‑V4‑Flash‑Vision‑Exp
发布与协议:API 服务于 2026 年 8 月 21 日上线,权重于 8 月 31 日正式开源。采用 MIT 协议,支持企业免费商用及二次开发。
架构特点:基于 DeepSeek‑V4‑Flash 文本 MoE 底座,搭载自研视觉编码器,支持图文混合输入。
性能规格:最大上下文窗口 256K tokens,单请求最高支持 600 张图片处理,单张图片编码上限 384 tokens。
开源资源:HuggingFace 平台已开放完整模型权重、分词器、视觉对齐模块及基础 PyTorch 推理代码。
二、核心能力
多模态视觉能力
支持图片 OCR 识别、图表解析及视觉逻辑推理。可对接智能体工具调用体系,适用于看图编程、网页截图复刻、PPT 智能生成等场景。
文本能力稳定
叠加视觉模块后,模型在文本推理、智能体调度及通用知识能力上无损耗。Terminal‑Bench 评测得分 83.9,与纯文本底座模型持平。
高效稀疏推理
依托 MoE 架构实现参数稀疏激活,在保障大模型能力的同时大幅降低算力开销,相较于稠密模型,更适配本地部署与企业私有化场景。
三、与 Claude Opus 4.8 性能对比
在多项智能体专项评测中,该模型表现优于 Claude Opus 4.8:
- ZeroBench Pass@5:35.0(Opus4.8 为 34.0)
- DeepSWE:59.3(Opus4.8 为 58.0)
- Agents' Last Exam:27.3(Opus4.8 为 25.7)
但在 Toolathlon‑Verified、NL2Repo、Cybergym、DSBench‑Hard 等通用及高难度评测维度中,性能仍落后于 Claude Opus 4.8。需注意,本次突破局限于部分多模态智能体场景,尚未全面超越顶级闭源模型,且当前数据为官方自测,暂无第三方权威复现验证。
四、调用方式与部署说明
API 调用
接口标识为 deepseek‑v4‑flash‑vision‑exp,计费规则与 V4‑Flash 模型一致,图片内容按 tokens 计量收费。
部署规范
依据 MIT 协议可自由开展私有化部署、微调及商业应用。鉴于该版本为实验版,性能与稳定性尚未定型,不建议直接用于生产环境。
五、行业价值与应用意义
作为开源领域首款主打智能体应用的多模态 MoE 模型,其首次开放了高性能智能体调度与视觉融合能力的完整权重,打破了顶级图文智能体能力被闭源模型垄断的局面,赋能开发者搭建本地可视化、自主调度的多模态系统。
部署提示:该实验版模型对显存配置要求极高,普通消费级显卡无法完成完整部署与推理,仅适配专业算力设备及企业算力集群。

