近期,国内在细分领域前沿视觉模型方面取得重要进展,相继推出三款涵盖通用多模态理解、图像生成及自动驾驶视觉感知方向的模型:DeepSeek‑V4‑Flash‑Vision‑Exp、LLaDA‑Image 以及 Qwen‑Drive‑1.0‑4B。
DeepSeek‑V4‑Flash‑Vision‑Exp
上线信息:实验版本于 2026 年 8 月 21 日发布,目前仅开放 API 调用,模型标识为 deepseek‑v4‑flash‑vision‑exp。
产品定位:面向智能交互场景的视觉理解多模态模型。其文本能力对标 DeepSeek‑V4‑Flash,并新增了全维度图像解析能力。
核心能力:支持图像解析、文字识别、图表分析及屏幕内容理解等任务;兼容 URL、Base64 及文件上传三种接入方式,适配 OpenAI 接口规范,上下文窗口高达 1M。
版本状态:当前为实验版本,未开放模型权重。其多模态综合性能大幅升级,核心指标已接近 Anthropic Opus‑4.8 行业水平。
LLaDA‑Image
产品定位:基于离散扩散 dLLM 架构的开源图像生成模型,隶属于 LLaDA 扩散大模型体系。
技术架构:采用 6B DiT 扩散 Transformer 主干,搭配冻结的 LLaDA2.0‑Mini 扩散语言模型。配套推出的轻量化加速版本 LLaDA‑Image‑Turbo,仅需 2-4 步采样即可完成出图,显著提升了生成效率。
技术优势:依托海量纯图像数据预训练,降低了对图文配对数据的依赖。该模型在写实图像生成与精细化编辑场景中表现优异,在 Qwen‑Image‑Bench 开源评测榜单中取得最优性能。
开放权限:全面开源模型权重、训练代码及完整训练方案,开发者可通过 HuggingFace 和 GitHub 平台获取使用。
Qwen‑Drive‑1.0‑4B
上线信息:2026 年 9 月 3 日公开技术论文与完整模型权重,基于 Qwen3.5‑4B 原生多模态底座开发。
产品定位:面向自动驾驶场景的专用视觉语言基础模型,实现了 3D 感知、驾驶场景问答及车辆轨迹规划任务的统一表征学习。
技术架构:保留原生 Qwen3.5‑4B 多模态主干网络,外接两大专用功能模块:
BEV 感知模块
负责 3D 目标检测、语义占据预测及鸟瞰图场景分割等环境感知任务。
轨迹规划模块
基于流匹配算法,精准生成车辆未来行驶轨迹。
核心特点:无需改动通用视觉语言主干能力,兼顾了通用视觉问答性能与自动驾驶专项任务精度。全量权重开源,适用于自动驾驶视觉算法研究与原型开发。
模型核心信息对比
| 模型 | 出品方 | 方向 | 开源状态 |
| DeepSeek‑V4‑Flash‑Vision‑Exp | DeepSeek | 多模态 Agent 视觉理解 | 实验 API 可用,权重暂未开放 |
| LLaDA‑Image | 蚂蚁集团 + 人大 | 文生图、图像编辑 | 完全开源(权重 + 训练代码) |
| Qwen‑Drive‑1.0‑4B | 阿里 Qwen 团队 | 自动驾驶视觉‑语言 | 权重、技术报告开源 |
总结:三款模型分别深耕通用多模态交互、高效图像生成及自动驾驶场景感知规划赛道,技术架构各有侧重,集中体现了国内视觉大模型在细分垂直领域的最新研发成果。

