作者|Wildcard
编辑|靖宇
8 月 21 日,DeepSeek 官方正式宣布上线 V4-Flash-Vision-Exp,开启多模态 API 服务。在用户尚未完全适应其计费调整之际,DeepSeek 迅速补上了多模态能力的短板。极客公园随即对该模型进行了深度实测。
栏目作者召集
极客公园新栏目「AI 上新」致力于分享最新 AI 应用与硬件体验。现面向广大 AI 爱好者征集投稿:凡发现并体验新的 AI 应用或功能,可按格式(参考案例:实测正式版 DeepSeek V4 Pro,补齐 Agent 能力|AI 上新)向栏目投稿。文章一经发布,不仅提供稿费,还可报销相关 AI 应用的订阅费用。
优秀作者更有机会加入极客公园 AI 体验群,获取内测资格、参与专属活动并与创始人直接交流。
01
能力接近 Opus4.8
DeepSeek 在微信公众号发布公告,全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线 API 平台。开发者可通过设置 model='deepseek-v4-flash-vision-exp'直接调用,支持 base64 内联、外部 URL 及 Files API 三种图片传入方式。
名称中的「Exp」后缀暗示这仍处于实验阶段,但从官方数据看,该模型有几个关键特性值得关注:
DeepSeek 官方给出的数据|图片来源:DeepSeek
定价极具竞争力。其定价与 V4-Flash 保持一致,单张图片最多占用 384 个 token,无额外视觉处理溢价。相比之下,GPT 和 Claude 处理同等分辨率图片通常消耗 800 至 1100 个 token。DeepSeek 的 token 开销不足竞品一半,这得益于其「Thinking with Visual Primitives」框架,该框架将视觉元素压缩为空间坐标式原语,而非传统的图像 patch 拆分。
纯文本能力未降级。官方数据显示,在 Agent、推理及世界知识等纯文本基准测试中,Vision-Exp 与 V4-Flash 正式版持平。这表明它并非牺牲文本能力换取视觉功能的特化模型,而是在 Flash 基础上叠加了视觉理解能力。
多模态 Agent 能力「已接近 Opus-4.8」。这是官方公告中最引人注目的表述。在需要视觉理解的 Agent Benchmark 上,Vision-Exp 相比纯文本版 V4-Flash 实现了显著跃升。
同步上线的Files API接口本身免费,允许开发者上传图片获取 file_id 后在请求中直接引用,避免了重复传输。对于需反复分析同一批图片的 Agent 工作流而言,这是一项实用的优化。
02
给《牛来》做个 AI 重制版
2026 年暑假现象级动画电影《牛来》,因其粗糙的 3D 建模被网友戏称「连 AI 都生成不出来」。极客公园决定以此为首个测试对象:将经典「妈妈」特写截图输入 DeepSeek Vision,要求其通过纯代码绘制「AI 重制版」。
对比图_牛来重制.png—— 左边原片截图,右边 AI 重制版|图片来源:极客公园
DeepSeek 的表现令人惊喜。它不仅准确识别了牛的橙色配色、皱眉、厚唇及「既凶又委屈」的表情,还保留了底部字幕。输出的 SVG+CSS 代码渲染出一头具有渐变光泽和圆润线条的卡通牛,风格从「恐怖谷」转变为「萌系」。
整个过程耗时 35 秒,仅消耗 384 个 token。
进一步测试中,我们将两头牛面对面的截图输入模型,要求其编写可交互的跑酷小游戏。DeepSeek 提取了角色形态与配色,用 CSS 绘制了像素风角色,并搭配了天空、草地、障碍物及计分系统。从识图到输出完整可玩的 HTML 游戏,全程仅用时 36 秒。
牛来跑酷游戏|图片来源:极客公园
此 Demo 虽无直接生产力价值,但有力证明了视觉理解与代码生成能力的叠加,能极大拓展 AI 的应用边界。
03
看截图写代码,一步到位
第二个测试模拟真实工作场景:将一张包含深色渐变背景、导航栏、语法高亮代码区及双按钮的支付产品 Landing Page 设计稿截图输入模型,要求直接输出可运行的 HTML。
对比图_看图写代码.png—— 左边设计稿,右边 AI 生成的 HTML 页面|图片来源:极客公园
26 秒后,DeepSeek 输出了完整的响应式 HTML 页面。渐变背景、布局、按钮样式及代码高亮颜色均精确匹配,甚至自主添加了 hover 动效和入场动画。
这一能力直击 Agent 核心场景:当 AI 需操作浏览器、解析网页结构或将设计稿转为前端代码时,视觉理解已从「锦上添花」变为「必要条件」。
注意:需关闭 Thinking 模式
测试中也发现了一个关键问题:在默认 thinking 模式下,模型的推理 token 会急剧膨胀,导致输出预算被完全占用。在场景理解测试中,2001 个 completion token 全部为 reasoning token,实际输出为零。
解决方案是设置 reasoning_effort: "none" 关闭思考模式。关闭后,同一测试耗时从 23 秒缩短至 7.9 秒,且输出完整高质量。这是继 V4 Pro 之后再次复现的问题,开发者务必注意:在视觉任务中,请关闭 thinking 模式或设置足够大的 max_tokens,以免得到空响应。
04
为什么是 Flash
DeepSeek 选择在 Flash 而非旗舰 Pro 模型上率先试水视觉能力,是一个值得深思的产品决策。
成本考量:Flash 作为 284B 参数的 MoE 模型,推理成本远低于 1.6T 参数的 Pro。鉴于每张图片至少占用 384 个 token 的输入预算,若叠加在 Pro 的高昂定价上,成本将难以控制。Flash 的低基价使得多模态调用在经济上具备可行性。
生态协同:就在前一天,DeepSeek Harness 框架发布 RC.8 版本,新增原生图片请求支持。Harness 在框架层打通管道,Flash Vision 在模型层补齐引擎,两者共同指向一个目标:让 DeepSeek 生态里的 Agent 真正「看得见」。
回顾过去四个月,从灰度识图、网页端开放、App 全量上线,到 Harness 框架支持及 Flash Vision API 开放,DeepSeek 的每一步都精准衔接。虽未召开发布会,但带有「Exp」后缀的模型名已悄然推开多模态的大门。
对于开发者而言,等待已经结束。尽管目前仍是实验版本,但对于构建多模态 Agent 的团队来说,一个 token 消耗不到竞品一半、且纯文本能力无损的视觉模型,无疑是当下性价比最高的选择。最后提醒:使用时请记得关闭 thinking 模式。
*头图来源:AI 生成
本文为极客公园原创文章

