
智东西 8 月 21 日报道,DeepSeek 正式宣布上线全新的多模态视觉理解实验模型——DeepSeek-V4-Flash-Vision-Exp。该模型现已接入 DeepSeek API 平台,标志着其在多模态领域的关键布局落地。
模型性能:纯文本持平,视觉能力大幅跃升
根据官方公布的基准测试结果,DeepSeek-V4-Flash-Vision-Exp 基于 V4-Flash 架构打造。在纯文本任务(包括 Agent 执行、逻辑推理及世界知识)上,其表现与 V4-Flash 正式版持平。
在核心的视觉理解 Agent Benchmark 测试中,新模型相比前代实现显著提升,多模态 Agent 能力已接近业界领先的 Opus 4.8 水平。

接入与计费:低价策略延续,支持多种调用格式
调用方式灵活
开发者只需将模型参数设置为deepseek-v4-flash-vision-exp即可通过 API 调用图像理解能力。该接口全面兼容 Chat Completions、Messages 及 Responses 三种格式,支持图文混合输入,便于集成各类 Agent 工具。图片传入支持 Base64 内联与外部 URL 两种方式。
计费极具竞争力
计费方面,图片将被转换为 Token 计入用量,单张图片最高按 384 tokens 计算,单价与 V4-Flash 模型保持一致。据此测算,高峰时段处理一张图片的最高成本仅为0.001152 元。

此外,DeepSeek 同步上线免费的 Files API。开发者可预先上传图片至平台获取 file_id,后续请求直接引用,有效避免重复传输开销。
应用场景:从抽象风格理解到视觉编程
官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架中展现出优秀的多模态适配性,能够支撑更多实用工作场景:
- PPT 内容创作:模型能精准理解“野性”、“原始”、“探索感”等抽象的风格化指令,并基于真实摄影图片生成相应内容。
- 视觉编程与 UI 设计:支持对网站进行二次创作,例如为 DeepSeek Harness 官网添加黑蓝深海色调、玻璃拟态 UI 及 ASCII 原子像素等复杂视觉元素。实测生成的网页特效精美,动画流畅且文字质感出色。


生态协同:DeepSeek Harness 同步升级
为配合多模态能力的释放,DeepSeek Harness 平台近期进行了两次重要更新:
8 月 19 日,Harness 率先更新,重点强化多模态输入、子代理协作、终端体验及工具调用能力,补齐了 Agent 处理图片任务的短板。

今日(8 月 21 日),Harness 再次迭代,模型适配器中新增 DeepSeek-V4-Flash-Vision-Exp 选项,并原生支持图片请求配置,进一步降低了开发者的接入门槛。

结语:DeepSeek 多模态拼图终于补齐
多模态理解已成为主流大模型的标配,涵盖截图分析、文档解读、网页浏览及 UI 交互等核心场景。此前,DeepSeek 虽于今年 4 月开启识图灰度测试,6 月在端侧全量开放,但面向开发者的多模态 API 一直缺席。此次 V4-Flash-Vision-Exp 的上线,正式填补了这一空白。
随着"DeepSeek Harness + V4-Flash-Vision-Exp"组合的成型,预计将衍生出更多创新应用。同时,该模型延续了 DeepSeek 一贯的极致性价比策略,有望进一步拉低多模态调用的价格门槛,推动行业普及。




9 月 20-21 日,智东西主办的 2026 全球 AI 芯片峰会将在上海举行。大会设有开幕式,以及大模型 AI 芯片、Agent 推理芯片、具身智能芯片 3 场高峰论坛,并举办 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 等 5 场技术研讨会。





