DeepSeek 在 Hugging Face 平台正式发布首款 V4 系列多模态实验模型 DeepSeek‑V4‑Flash‑Vision‑Exp。该模型基于 MIT 协议开源,支持免费商用,标志着其在多模态智能体领域的重要突破。
基础参数
模型架构:总参数量 3050 亿(305B),采用 MoE 混合专家架构,单 Token 推理仅激活 130 亿(13B)参数,显著提升推理效率。
权重规格:整体权重约 168GB,采用 Safetensors 格式,分拆为 48 个分片存储。
输入能力:支持“文本 + 多图像”混合输入,兼容 JPEG、PNG、GIF、WebP 格式。单次最多处理 600 张图像,单张图像压缩至 384 个视觉 Token。
推理配置:上下文窗口最大 32K,提供原生 PyTorch 推理方案,并兼容 vLLM、SGLang 等主流部署框架。
版本定位:当前为实验版本,非正式稳定版。适用于学术研究与模型二次微调,暂不建议直接投入生产环境。
核心性能
评测基准 |
V4‑Flash‑Vision‑Exp |
Claude Opus 4.8 |
ZeroBench (Pass@5) |
35.0 |
34.0(领先) |
Agents' Last Exam |
27.3 |
25.7(领先) |
DeepSWE |
59.3 |
58.0(领先) |
ApexBench (Pass@1) |
36.5 |
39.4 |
Chartography 图表理解 |
64.3 |
65.0 |
引入视觉模块后,模型文本智能体能力未出现衰减。在 Terminal Bench 2.1 评测中得分 83.9,较纯文本版 V4‑Flash 模型实现小幅提升。
数据说明:该模型仅在部分多模态智能体指标上超越 Claude Opus 4.8,综合能力仍有差距。所有性能数据源自官方自测,尚未通过第三方独立复现验证。
技术要点
架构升级:基于 V4‑Flash MoE 主干网络,新增独立 ViT 视觉编码器。通过图像空间压缩技术,有效降低视觉 Token 计算开销,提升多模态推理效率。
核心机制:继承 V4 核心架构,搭载 CSA+HCA 混合稀疏注意力、mHC 流形约束残差连接及 DFlash 推理加速机制,保障高效运算。
场景定位:专注多模态智能体场景,适配截图解析、架构图代码解读、图表数据分析及可视化工具调用等专业任务,并非通用图像识别模型。
部署门槛
硬件要求:模型权重大、算力需求高,需多卡大显存服务器集群支撑推理,普通消费级显卡无法满足部署要求。
使用建议:普通开发者可直接调用官方 API 快速体验;开源权重主要面向科研迭代、企业私有化部署及模型二次微调等深层应用场景。
小结
核心优势:支持 MIT 协议免费商用,MoE 稀疏架构大幅降低推理成本。其多模态智能体能力达到开源顶尖水平,部分核心指标已比肩顶级闭源模型 Claude Opus 4.8。
现存短板:作为实验版本稳定性尚待提升,权重部署成本高企。在通用图文理解、长视频处理能力上有限,多项综合评测指标仍落后于顶级闭源模型。

