大数跨境

DeepSeek多模态模型终于来了!一张图最高只要0.001元

DeepSeek多模态模型终于来了!一张图最高只要0.001元 智东西
2026-08-21
14
导读:多模态Agent能力已接近Opus 4.8。

多模态 Agent 能力已接近 Opus 4.8。
作者 | 陈骏达
编辑 | 李水青

智东西 8 月 21 日报道,DeepSeek 正式宣布上线全新的多模态视觉理解实验模型——DeepSeek-V4-Flash-Vision-Exp。该模型现已接入 DeepSeek API 平台,标志着其在多模态领域的关键布局落地。

模型性能:纯文本持平,视觉能力大幅跃升

根据官方公布的基准测试结果,DeepSeek-V4-Flash-Vision-Exp 基于 V4-Flash 架构打造。在纯文本任务(包括 Agent 执行、逻辑推理及世界知识)上,其表现与 V4-Flash 正式版持平。

在核心的视觉理解 Agent Benchmark 测试中,新模型相比前代实现显著提升,多模态 Agent 能力已接近业界领先的 Opus 4.8 水平

接入与计费:低价策略延续,支持多种调用格式

调用方式灵活

开发者只需将模型参数设置为deepseek-v4-flash-vision-exp即可通过 API 调用图像理解能力。该接口全面兼容 Chat Completions、Messages 及 Responses 三种格式,支持图文混合输入,便于集成各类 Agent 工具。图片传入支持 Base64 内联与外部 URL 两种方式。

计费极具竞争力

计费方面,图片将被转换为 Token 计入用量,单张图片最高按 384 tokens 计算,单价与 V4-Flash 模型保持一致。据此测算,高峰时段处理一张图片的最高成本仅为0.001152 元

此外,DeepSeek 同步上线免费的 Files API。开发者可预先上传图片至平台获取 file_id,后续请求直接引用,有效避免重复传输开销。

应用场景:从抽象风格理解到视觉编程

官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架中展现出优秀的多模态适配性,能够支撑更多实用工作场景:

  • PPT 内容创作:模型能精准理解“野性”、“原始”、“探索感”等抽象的风格化指令,并基于真实摄影图片生成相应内容。
  • 视觉编程与 UI 设计:支持对网站进行二次创作,例如为 DeepSeek Harness 官网添加黑蓝深海色调、玻璃拟态 UI 及 ASCII 原子像素等复杂视觉元素。实测生成的网页特效精美,动画流畅且文字质感出色。

生态协同:DeepSeek Harness 同步升级

为配合多模态能力的释放,DeepSeek Harness 平台近期进行了两次重要更新:

8 月 19 日,Harness 率先更新,重点强化多模态输入、子代理协作、终端体验及工具调用能力,补齐了 Agent 处理图片任务的短板。

今日(8 月 21 日),Harness 再次迭代,模型适配器中新增 DeepSeek-V4-Flash-Vision-Exp 选项,并原生支持图片请求配置,进一步降低了开发者的接入门槛。

结语:DeepSeek 多模态拼图终于补齐

多模态理解已成为主流大模型的标配,涵盖截图分析、文档解读、网页浏览及 UI 交互等核心场景。此前,DeepSeek 虽于今年 4 月开启识图灰度测试,6 月在端侧全量开放,但面向开发者的多模态 API 一直缺席。此次 V4-Flash-Vision-Exp 的上线,正式填补了这一空白。

随着"DeepSeek Harness + V4-Flash-Vision-Exp"组合的成型,预计将衍生出更多创新应用。同时,该模型延续了 DeepSeek 一贯的极致性价比策略,有望进一步拉低多模态调用的价格门槛,推动行业普及。

9 月 20-21 日,智东西主办的 2026 全球 AI 芯片峰会将在上海举行。大会设有开幕式,以及大模型 AI 芯片、Agent 推理芯片、具身智能芯片 3 场高峰论坛,并举办 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 等 5 场技术研讨会。

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11777
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读207.7k
粉丝0
内容11.8k