大数跨境

DeepSeek 正式“睁眼”!最新多模态能力拆解

DeepSeek 正式“睁眼”!最新多模态能力拆解 MaxMindAI
2026-05-01
1
导读:国产多模态的最后一块拼图,DeepSeek交卷了

点击上方蓝字关注我们

在国内大模型赛道里,DeepSeek 一直是特殊的存在。

凭借极强的文本理解、代码生成、逻辑推理能力,它长期稳居国产模型第一梯队。但很长一段时间里,它唯独缺少图像识别与视觉理解能力,被业内调侃为“AI 圈盲僧”

近期,DeepSeek 以灰度测试形式上线全新多模态识图模式,同步开源原创视觉推理技术框架。

这一轮升级并非简单叠加看图说话功能,而是从底层推理逻辑重构多模态交互体系——

让 AI 不止能看懂画面,还能精准定位物体、分步深度思考、完成复杂逻辑推演。

⚠️ 
该功能目前仍处于小规模灰度测试阶段,部分用户暂时没有体验权限,模型在极端场景下的表现仍在持续优化中。

本文从上线背景、核心技术、能力实测、优劣短板、行业对标五个维度,拆解 DeepSeek 最新多模态的真实实力。


从文本强者,走向全能多模态

如今,主流大模型竞争早已跳出纯文本维度,全面进入图文多模态阶段。

海外 GPT-5 系列、Gemini-3 系列,国内阿里通义千问、字节豆包等,视觉理解能力早已是标配。

反观 DeepSeek,长期深耕文本与代码领域,性能口碑双在线,却一直没有对外开放多模态看图能力,成为不少用户的核心遗憾。

随着自研 V4 基座完成架构优化与算力适配,DeepSeek 正式官宣多模态能力上线:

  • 在 Web 端和 App 端同步增设独立识图入口,与快速模式、专家模式并列

  • 摘下眼罩的鲸鱼作为视觉标识

  • 搭载深度思考开关,适配轻量化识图和复杂推理两种场景

行业内多数模型直接套用通用视觉框架,同质化严重。

DeepSeek 这次选择自研技术路线,主打“视觉原语”推理体系,跳出堆分辨率、堆算力的内卷,聚焦复杂空间推理与精准定位两大痛点,打出差异化优势。


底层核心技术:推理范式的革新

普通用户看来,上线识图只是一次功能更新。

但在技术层面,DeepSeek 这次多模态升级直击行业长期存在的核心痛点——视觉“指代鸿沟”

目前市面上绝大多数多模态模型,基础看图、描述画面都能做到。可一旦面对密集物体、复杂空间、多层重叠场景,只能用“左边那个”“下方区域”这类模糊语言描述,无法精准锁定目标。

根源在于:传统模型全程依靠自然语言串联视觉推理链,用文字判定空间位置。每一次模糊指代都会让注意力产生漂移,误差不断累积,最终逻辑崩塌、识别出错。

简单说:看得见,但指不准、想不清。

▎视觉原语:给 AI 装一根手指

DeepSeek 的视觉原语思考框架,从底层改变了这套逻辑。

它将边界框和精准坐标点作为基础推理单元,融入思维链全流程。不再单靠文字描述空间位置,而是在推理中同步用坐标锚定目标——

像人用手指着物体思考一样,每一步都有坐标佐证,从源头消除模糊指代带来的误差累积。

▎极致压缩:756×756 → 仅 81 个视觉条目

与此同时,官方做了极致的工程优化。

根据公开技术报告,一张 756×756 的输入图片经视觉编码器提取后,依次通过 3×3 空间压缩和压缩稀疏注意力双重处理,最终存入 KV 缓存的有效视觉条目仅保留 81 个,整体压缩比高达 7056 倍

横向对比:

      模型
视觉条目需求
  DeepSeek
81 个
Claude Sonnet
约 870 个
Gemini-3-Flash
约 1100 个

这意味着视觉推理的算力消耗大幅降低,响应更快、成本更低,兼顾了精度与效率。

▎训练策略:先专后统

训练层面,团队从近 10 万个数据集中筛选出 3.17 万个高质量数据源,生成超 4000 万条训练样本,聚焦计数、迷宫路径、空间拓扑、几何方位四类高难度场景。

后训练采用“先专家化、后统一”策略——先单独训练边界框定位和点坐标定位两个专家模块,各自经强化学习优化后,再通过在线策略蒸馏融合为统一模型,保障模型在不同粒度的空间任务上都能选择合适的推理方式。


全场景实测:它到底能做什么?

① 日常图像基础理解

无论是风景照片、人物场景、建筑地标还是生活物品,DeepSeek 都能准确描述画面内容、光影氛围和物体特征,还可识别服饰风格、建筑年代、地域特色等细节。

面对人物实拍,能精准捕捉肢体动作、面部情绪和互动关系,描述贴合中文表达习惯,自然流畅。

② 文档图表与办公截图解析

这是职场和科研用户的高频刚需。

DeepSeek 可直接识别表格截图、Excel 截图、数理公式、论文扫描件、网页界面截图:

  • 将图片中的表格转化为规范的结构化文本,完整还原行列数据

  • 拆解复杂公式并标注释义

  • 解析网页布局与功能分区

日常整理报表、摘录文献不用手动录入,一张截图即可搞定。

③ 空间与逻辑推理

这是本次升级最值得关注的优势。

根据官方技术报告:

  • 迷宫导航任务:得分 66.9%,领先 GPT-5 系列约 17 个百分点

  • 路径追踪任务:得分 56.7%,领先超 10 个百分点

  • 密集物体计数:得分 89.2%,与 Gemini-3-Flash 持平并略胜一筹

这类任务没有投机取巧的空间,分数代表真实的视觉推理能力。

普通模型面对密集的相似物体容易数错漏数,面对复杂迷宫容易逻辑混乱。DeepSeek 依靠坐标锚点 + 分步推理机制,在思维链中为每个关键位置标注精准坐标,逐个定位、有序计数、逐步推演,在空间推理密集的任务上建立起系统性优势。

面对数理几何题图和益智推理题,也能清晰拆解步骤。

④ OCR 文字提取与梗图解读

不仅能提取图片中的文字,还能结合场景理解文字含义和画面隐喻。对于网络梗图和表情包,能读懂背后的笑点和网络语境,做到视觉与语义的双重理解。

当前版本提醒
识图模式默认使用离线知识库,未开启联网搜索,对较新的视觉素材识别精度会受影响;文件格式暂不支持 HEIF 等小众图片格式,后续迭代将逐步优化。


客观正视短板:能力边界在哪

抛开亮点,也要理性看待短板。

DeepSeek 团队在技术报告中主动坦诚了多项不足,这种透明态度值得肯定。

① 功能定位集中

当前版本仅支持图像理解,不具备图像生成、视频解析等多模态能力,专注“看懂与分析”,生态完整性还有提升空间。

② 核心机制有使用门槛

视觉原语目前依赖明确触发词激活,模型无法在开放对话中自主判断何时启用坐标锚定,灵活度受限。

③ 极端画质下能力下滑

面对严重模糊、强光过曝、暗光遮挡画面,以及微小物体紧密排列的极限场景,受限于坐标精度瓶颈,识别准确率会明显下降,与主流模型一样存在极限短板。

④ 专业场景泛化不足

训练数据集中在计数、空间推理、迷宫和路径追踪四类任务,在工业质检、医疗影像解读等高专业门槛场景中,与全球顶尖商用模型仍有差距。

此外,开启深度思考模式后,复杂推理任务需多轮坐标锚定和分步校验,响应时间会明显变长。


行业横向对标:处于什么段位?

放眼全球赛道,DeepSeek 通用图像描述能力已基本追平国际一线模型,日常识图、基础问答无明显差距。

而在空间推理、密集计数、路径拓扑等高难度任务上,依靠视觉原语的技术路线实现了局部反超,走出了不同于主流堆叠分辨率的差异化路径。

对比国内头部多模态模型,DeepSeek 凭借自研视觉原语框架,在推理定位精度、视觉信息压缩效率、低成本部署三个维度实现了创新突破,为行业提供了一条不参与算力军备竞赛也能建立差异化优势的思路。

从更广视角看,DeepSeek 补齐多模态短板后,国内头部通用大模型公司已全部具备高阶视觉能力。这次升级不仅是一家模型的能力补强,也证明了国内团队在多模态底层技术上做出原创性突破的能力。


DeepSeek 这次多模态能力灰度上线,不是一次简单的功能补全,而是一次底层技术革新。

它没有盲从堆参数、堆分辨率的老路,而是直击“指代鸿沟”这一核心痛点,用坐标原语重构视觉推理逻辑——

把“看得清”升级为“想得明、指得准、推得对”。

也要清醒看到,该功能仍处于灰度测试阶段,从技术突破到稳定成熟还有路要走。但官方主动坦诚短板、公开技术细节的态度,为后续迭代建立了清晰的改进坐标。

随着识图能力逐步开放与优化,DeepSeek 在国产多模态赛道上的分量,还将进一步显现。




  Max Mind

欢迎加入交流群

不定期弹送福利



【声明】内容源于网络
0
0
MaxMindAI
1234
内容 41
粉丝 0
MaxMindAI 1234
总阅读24
粉丝0
内容41