点击上方蓝字关注我们
凭借极强的文本理解、代码生成、逻辑推理能力,它长期稳居国产模型第一梯队。但很长一段时间里,它唯独缺少图像识别与视觉理解能力,被业内调侃为“AI 圈盲僧”。
近期,DeepSeek 以灰度测试形式上线全新多模态识图模式,同步开源原创视觉推理技术框架。
这一轮升级并非简单叠加看图说话功能,而是从底层推理逻辑重构多模态交互体系——
让 AI 不止能看懂画面,还能精准定位物体、分步深度思考、完成复杂逻辑推演。
⚠️
该功能目前仍处于小规模灰度测试阶段,部分用户暂时没有体验权限,模型在极端场景下的表现仍在持续优化中。
本文从上线背景、核心技术、能力实测、优劣短板、行业对标五个维度,拆解 DeepSeek 最新多模态的真实实力。
从文本强者,走向全能多模态
如今,主流大模型竞争早已跳出纯文本维度,全面进入图文多模态阶段。
海外 GPT-5 系列、Gemini-3 系列,国内阿里通义千问、字节豆包等,视觉理解能力早已是标配。
反观 DeepSeek,长期深耕文本与代码领域,性能口碑双在线,却一直没有对外开放多模态看图能力,成为不少用户的核心遗憾。
随着自研 V4 基座完成架构优化与算力适配,DeepSeek 正式官宣多模态能力上线:
在 Web 端和 App 端同步增设独立识图入口,与快速模式、专家模式并列
以摘下眼罩的鲸鱼作为视觉标识
搭载深度思考开关,适配轻量化识图和复杂推理两种场景
行业内多数模型直接套用通用视觉框架,同质化严重。
DeepSeek 这次选择自研技术路线,主打“视觉原语”推理体系,跳出堆分辨率、堆算力的内卷,聚焦复杂空间推理与精准定位两大痛点,打出差异化优势。
底层核心技术:推理范式的革新
普通用户看来,上线识图只是一次功能更新。
但在技术层面,DeepSeek 这次多模态升级直击行业长期存在的核心痛点——视觉“指代鸿沟”。
目前市面上绝大多数多模态模型,基础看图、描述画面都能做到。可一旦面对密集物体、复杂空间、多层重叠场景,只能用“左边那个”“下方区域”这类模糊语言描述,无法精准锁定目标。
根源在于:传统模型全程依靠自然语言串联视觉推理链,用文字判定空间位置。每一次模糊指代都会让注意力产生漂移,误差不断累积,最终逻辑崩塌、识别出错。
简单说:看得见,但指不准、想不清。
▎视觉原语:给 AI 装一根手指
DeepSeek 的视觉原语思考框架,从底层改变了这套逻辑。
它将边界框和精准坐标点作为基础推理单元,融入思维链全流程。不再单靠文字描述空间位置,而是在推理中同步用坐标锚定目标——
像人用手指着物体思考一样,每一步都有坐标佐证,从源头消除模糊指代带来的误差累积。
▎极致压缩:756×756 → 仅 81 个视觉条目
与此同时,官方做了极致的工程优化。
根据公开技术报告,一张 756×756 的输入图片经视觉编码器提取后,依次通过 3×3 空间压缩和压缩稀疏注意力双重处理,最终存入 KV 缓存的有效视觉条目仅保留 81 个,整体压缩比高达 7056 倍。
横向对比:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
这意味着视觉推理的算力消耗大幅降低,响应更快、成本更低,兼顾了精度与效率。
▎训练策略:先专后统
训练层面,团队从近 10 万个数据集中筛选出 3.17 万个高质量数据源,生成超 4000 万条训练样本,聚焦计数、迷宫路径、空间拓扑、几何方位四类高难度场景。
后训练采用“先专家化、后统一”策略——先单独训练边界框定位和点坐标定位两个专家模块,各自经强化学习优化后,再通过在线策略蒸馏融合为统一模型,保障模型在不同粒度的空间任务上都能选择合适的推理方式。
全场景实测:它到底能做什么?
① 日常图像基础理解
无论是风景照片、人物场景、建筑地标还是生活物品,DeepSeek 都能准确描述画面内容、光影氛围和物体特征,还可识别服饰风格、建筑年代、地域特色等细节。
面对人物实拍,能精准捕捉肢体动作、面部情绪和互动关系,描述贴合中文表达习惯,自然流畅。
② 文档图表与办公截图解析
这是职场和科研用户的高频刚需。
DeepSeek 可直接识别表格截图、Excel 截图、数理公式、论文扫描件、网页界面截图:
将图片中的表格转化为规范的结构化文本,完整还原行列数据
拆解复杂公式并标注释义
解析网页布局与功能分区
日常整理报表、摘录文献不用手动录入,一张截图即可搞定。
③ 空间与逻辑推理
这是本次升级最值得关注的优势。
根据官方技术报告:
迷宫导航任务:得分 66.9%,领先 GPT-5 系列约 17 个百分点
路径追踪任务:得分 56.7%,领先超 10 个百分点
密集物体计数:得分 89.2%,与 Gemini-3-Flash 持平并略胜一筹
这类任务没有投机取巧的空间,分数代表真实的视觉推理能力。
普通模型面对密集的相似物体容易数错漏数,面对复杂迷宫容易逻辑混乱。DeepSeek 依靠坐标锚点 + 分步推理机制,在思维链中为每个关键位置标注精准坐标,逐个定位、有序计数、逐步推演,在空间推理密集的任务上建立起系统性优势。
面对数理几何题图和益智推理题,也能清晰拆解步骤。
④ OCR 文字提取与梗图解读
不仅能提取图片中的文字,还能结合场景理解文字含义和画面隐喻。对于网络梗图和表情包,能读懂背后的笑点和网络语境,做到视觉与语义的双重理解。
当前版本提醒
识图模式默认使用离线知识库,未开启联网搜索,对较新的视觉素材识别精度会受影响;文件格式暂不支持 HEIF 等小众图片格式,后续迭代将逐步优化。
客观正视短板:能力边界在哪
抛开亮点,也要理性看待短板。
DeepSeek 团队在技术报告中主动坦诚了多项不足,这种透明态度值得肯定。
① 功能定位集中
当前版本仅支持图像理解,不具备图像生成、视频解析等多模态能力,专注“看懂与分析”,生态完整性还有提升空间。
② 核心机制有使用门槛
视觉原语目前依赖明确触发词激活,模型无法在开放对话中自主判断何时启用坐标锚定,灵活度受限。
③ 极端画质下能力下滑
面对严重模糊、强光过曝、暗光遮挡画面,以及微小物体紧密排列的极限场景,受限于坐标精度瓶颈,识别准确率会明显下降,与主流模型一样存在极限短板。
④ 专业场景泛化不足
训练数据集中在计数、空间推理、迷宫和路径追踪四类任务,在工业质检、医疗影像解读等高专业门槛场景中,与全球顶尖商用模型仍有差距。
此外,开启深度思考模式后,复杂推理任务需多轮坐标锚定和分步校验,响应时间会明显变长。
行业横向对标:处于什么段位?
放眼全球赛道,DeepSeek 通用图像描述能力已基本追平国际一线模型,日常识图、基础问答无明显差距。
而在空间推理、密集计数、路径拓扑等高难度任务上,依靠视觉原语的技术路线实现了局部反超,走出了不同于主流堆叠分辨率的差异化路径。
对比国内头部多模态模型,DeepSeek 凭借自研视觉原语框架,在推理定位精度、视觉信息压缩效率、低成本部署三个维度实现了创新突破,为行业提供了一条不参与算力军备竞赛也能建立差异化优势的思路。
从更广视角看,DeepSeek 补齐多模态短板后,国内头部通用大模型公司已全部具备高阶视觉能力。这次升级不仅是一家模型的能力补强,也证明了国内团队在多模态底层技术上做出原创性突破的能力。
DeepSeek 这次多模态能力灰度上线,不是一次简单的功能补全,而是一次底层技术革新。
它没有盲从堆参数、堆分辨率的老路,而是直击“指代鸿沟”这一核心痛点,用坐标原语重构视觉推理逻辑——
把“看得清”升级为“想得明、指得准、推得对”。
也要清醒看到,该功能仍处于灰度测试阶段,从技术突破到稳定成熟还有路要走。但官方主动坦诚短板、公开技术细节的态度,为后续迭代建立了清晰的改进坐标。
随着识图能力逐步开放与优化,DeepSeek 在国产多模态赛道上的分量,还将进一步显现。

欢迎加入交流群
不定期弹送福利

