大数跨境

刚刚,多模态版DeepSeek「长眼」了!1000张图只要1块钱

刚刚,多模态版DeepSeek「长眼」了!1000张图只要1块钱 新智元
2026-08-21
26

新智元报道

DeepSeek 首个多模态 API 模型正式上线,命名为 DeepSeek-V4-Flash-Vision-Exp。该模型不仅支持即时调用,更将视觉能力以“免费赠品”的形式集成:单张图片最高仅占用 384 个 Token,计费标准与纯文本版 V4-Flash 完全一致。

在竞品普遍对多模态能力单独高昂计费的背景下,DeepSeek 直接提供了满配版的视觉解析能力,大幅降低了开发者的接入门槛。

V4-Flash 视觉升级:性能全面超越

引入视觉模块后,V4-Flash-Vision-Exp 在纯文本处理能力上并未妥协,反而表现更强。在七项 Agent 基准评测中,该模型有六项得分超越了前代版本 V4-Flash-0731。在多模态专项测试中,其表现更是比肩硅谷顶尖模型。

对于开发者而言,这意味着无需再为维护两套模型(一套看图、一套处理文本)而增加成本与复杂度,单一模型即可胜任全流程任务。

实测场景一:高精度网页复刻

在 Agent 框架测试中,我们向模型输入一张 OpenAI 官网截图,要求 1:1 复刻为可运行的单文件 HTML。Prompt 明确要求模型先分析布局、字体、色值及间距,再编写代码,并需还原交互细节与响应式适配。

这不仅考验识别能力,更考验将视觉元素转化为代码逻辑的能力。测试结果显示,V4-Flash-Vision-Exp 生成的网站在视觉还原度上几乎与原版无异。

实测场景二:专业 B 端方案生成

随后,我们测试了更复杂的商业场景:为一家精品咖啡烘焙工坊制作 B 端合作 PPT。需求涵盖浅烘单品豆定位、5 公斤起订量、三档供货方案等具体细节,并要求风格粗粝、拒绝行业黑话,面向专业咖啡馆主理人。

模型最终输出了一份 11 页的专业提案,精准覆盖了所有核心调性与业务细节,无一句废话或外行科普,直接达到了可交付客户的标准。

成本颠覆:视觉 API 价格战

据 TokenMix 横评数据,处理一张 1024×1024 的图片,Claude Sonnet 4.6 消耗约 1334 Token(千张图成本约 4 美元),GPT-5.4 Vision 消耗 765 Token(约 1.9 美元),Gemini 3.1 Pro 消耗 258 Token(约 0.5 美元)。折合人民币,竞品最高成本接近 29 元/千张。

相比之下,DeepSeek 设定了 384 Token 的封顶值。结合 V4-Flash 低至 3 元/百万 Token 的输入单价(低谷时段五折),处理一千张图片的成本仅为 1.15 元,谷时甚至不足 0.6 元。

近 30 元与 1 元的差距高达 25 倍,若算上谷时优惠则达 50 倍。这种量级的成本差异彻底改变了产品设计逻辑:从“谨慎判断是否调用视觉”,转变为“Agent 每一步皆可截图分析”。

生态闭环:八天补齐最后一环

DeepSeek 在最近八天内快速完成了生态闭环:

  • 8 月 13 日:Harness 开源,原生支持 Responses API,夯实 Agent 运行时基础。
  • 8 月 21 日:视觉模型上线,支持 Chat Completions、Messages、Responses 三种调用格式;Harness 同步更新至 0.1.1 版本,开箱即用,无需额外适配代码。

在图片输入方式上,官方提供了 Base64 内联、外部 URL 及 Files API 三种路径。其中,Files API 同步开放且免费,支持上传一次后通过 file_id 重复引用,有效降低了处理同一设计稿或报表时的往返成本。

参考资料:
X (Twitter) @deepseek_ai

编辑:摩西 所罗门

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16481
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读350.8k
粉丝0
内容16.5k