DeepSeek 多模态模型等待四个月后终于正式亮相。新版本 deepseek-v4-flash-vision-exp 原生支持图片输入,虽暂不具备图片生成能力,但在 Agent 任务中的视觉理解表现卓越。
实测显示,该模型基础识图能力与内测版网页端持平,纯文本推理及世界知识水平与 DeepSeek-V4-Flash 正式版一致。但在多模态 Agent Benchmark 测试中,新模型实现大幅跃升,性能已接近 Opus-4.8。
官方演示与应用场景
官方展示了多个基于视觉能力的 Demo 应用。在 PPT 制作场景中,模型能有效辅助白领完成需要视觉理解的复杂任务;在 DeepSeek 官网二次创作中,模型生成了具有玻璃 UI 动效的界面;此外,还展示了黏土风格的前端代码生成,体现了模型良好的审美能力。
目前,该视觉模型已上线 API,计费标准与 Flash 版本一致。图片将被转换为 Token 计费,单张图片最多占用 384 tokens。按高峰时段且缓存未命中计算,单次识图成本约为 0.0012 元人民币。相比之下,同等条件下竞品 Image 2 的单次成本约为 0.0206 元,DeepSeek 具备显著的价格优势。
伴随模型发布,DeepSeek Harness(DSH)也迎来更新,正式原生支持第一方多模态模型,用户可直接在最新版工具中调用该视觉能力,实现了模型与开发工具的同步就位。
DeepSeek 视觉模型实测
结合 DSH 与 Vision 模型进行的实测结果显示,模型在复杂任务中表现出色。在 3D 建模任务中,模型自主下载 Blender 软件,经过多次截图反馈与迭代,成功渲染出具有良好光泽感的“牛来”形象。
在前端开发任务中,模型利用 Canvas 手绘了宇宙风格 Demo,实现了点击生成 UFO 的交互效果。在基础识图测试中,模型能瞬间识别三代蜘蛛侠同框的侧脸图片,响应时间仅需两三秒。
对于需要联网搜索的任务,如识别《牛来》剧照,模型通过多轮循环检索耗时约三分钟得出结果,速度略慢于网页版直接识图,但准确率有保障。不过,在数手指等细节计数任务上,模型仍存在常见误区,倾向于默认回答五根手指。
多模态演进历程
自今年 Agent 时代开启以来,市场对 DeepSeek 支持多模态的呼声日益高涨。尽管初期专注于 AGI 核心推理而暂缓视觉功能,但前端开发等场景对视觉反馈的刚性需求促使加速布局。
今年 4 月,DeepSeek 启动识图功能灰度测试;6 月,该功能正式登陆网页版与 App 端。历经近四个月的内测优化,DeepSeek 终于正式推出原生多模态模型,补齐了视觉感知短板。
行业动态:智谱“牛来”模型引发关注
除 DeepSeek 外,国产大模型领域另有热点。近期海外社交平台上出现名为“牛来”的神秘模型,因其独特的抽象风格引发热议。OpenCode 已针对该模型启动为期一周的限免活动。
尽管该模型尚未正式官宣归属,但多方推测其背后开发者为 智谱 AI。若猜测属实,这意味着智谱在多模态领域也将有新的动作。

