大数跨境

人类一眼识破,GPT-5性能退化超23%!首个视觉误导基准入选ICML 2026

人类一眼识破,GPT-5性能退化超23%!首个视觉误导基准入选ICML 2026 智猩猩AI
2026-07-15
8
导读:为LVLM的鲁棒性评估提供了新视角~
智猩猩AI整理
编辑:没方


大型视觉语言模型(LVLMs)在图像理解、视觉问答和复杂视觉推理等多模态任务中取得了显著进展,但其鲁棒性评估仍存在关键不足。现有鲁棒性基准多聚焦于幻觉问题或对抗性文本输入,仅能反映LVLM鲁棒性的部分面貌。为拓展评估范围,近期研究开始探索LVLM在误导场景下的表现,但主要集中在引入误导性文本输入。然而,误导性信息并不局限于语言模态,真实场景中普遍存在的误导性视觉输入在很大程度上仍被忽视


。误导性文本输入 vs 误导性视觉输入的对比:(a)误导性文本输入:通过向正常问题中注入不准确或无关的信息来构造误导性提问。(b)误导性视觉输入:误导性视觉线索来源于真实世界场景,导致模型对图像内容产生错误理解(例如将凳子误认为蘑菇)。


因此,东南大学联合伊利诺伊大学芝加哥分校、同济大学开源MVI-Bench,这是首个专门评估误导性视觉输入如何削弱LVLM鲁棒性的综合基准。该基准基于视觉基元理论,建立了三层六类的误导性视觉输入分类体系,包含624对(共1,248个)专家标注的VQA实例。


研究团队还提出了MVI-Sensitivity指标,通过衡量模型从正常图像到误导图像的相对性能下降幅度,量化模型对视觉误导的敏感程度。


18个SOTA LVLM上的实验揭示了一个新发现这些对人类而言轻而易举就能正确判断的视觉误导场景(人类准确率98.24%,MVI-Sensitivity仅1.63%)却让当前最强的LVLM频频"翻车"即便是GPT-5-Chat,性能退化幅度也超过23%,而经典的开源模型Molmo-7B退化幅度更是接近49%。这表明现有LVLM在应对视觉误导时仍存在显著的鲁棒性缺陷。该成果已收录至ICML 2026。 

  • 论文题目:

    MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs

  • 论文链接:

    https://arxiv.org/pdf/2511.14159

  • 项目链接:

    https://github.com/chenyil6/MVI-Bench


01

问题动机


在真实世界场景中,误导性视觉输入自然存在且无处不在视觉相似的物体、镜面反射、遮挡、视觉错觉等都会导致人和机器的感知错误。例如,自动驾驶系统可能将广告牌上的2D内容误识别为真实道路物体,从而触发不必要的紧急制动。

图:真实世界中误导性视觉输入的案例

自动驾驶系统将广告牌上的2D内容误识别为真实道路物体


这种现象在哲学中被称为"感知问题"(Problem of Perception),强调人类视觉认知容易受到感知偏差导致的系统性错误。值得注意的是,人类虽然可能在第一眼产生误判,但往往可以通过上下文推理和先验知识迅速纠正误解,轻松化解视觉误导。而LVLM则截然不同它们往往依赖表面视觉模式,缺乏这种自我纠错的能力,难以消歧误导性线索。


然而,现有LVLM鲁棒性基准存在明显不足:


第一,覆盖面窄。如IllusionVQA仅关注视觉错觉一种类型,O-Bench仅关注遮挡混淆,无法全面评估LVLM在各类视觉误导场景下的表现。


第二,缺乏对照设计。没有成对的"正常-误导"图像对照,无法精确量化视觉误导对模型行为的影响。


第三,指标粗糙。仅使用准确率等指标,无法捕捉模型从正常到误导条件下的性能退化幅度。


而研究团队提出的MVI-Bench有效地弥补了上述不足。



02

 分类体系:三层六类误导性视觉输入


MVI-Bench的设计以视觉基元理论为基础,将误导性视觉输入组织为三个层级、六个类别:


图:六类误导性视觉输入的示例展示

每对包含一张正常图像(左)和一张误导图像(右),共用相同的选择题


一、视觉概念层(Visual Concept Misleading)


误导效应源于语义不同实体之间的粗粒度视觉相似性,解决此类误导需要更精细的视觉辨别能力。包含两个类别:


视觉相似性(Visual Resemblance):模型可能将某个物体与外观相似但语义完全不同的物体混淆。例如将薯条形状的雨伞误识别为薯条,将蛋糕造型的手提包误识别为蛋糕。


表征混淆(Representation Confusion):模型无法区分真实物体与其二维表征(照片、绘画等)。例如无法分辨画中的人与真实的人,将照片中的食物计入真实食物数量。

 

二、视觉属性层(Visual Attribute Misleading)


误导来源于视觉属性(如纹理、光泽、材质)的细粒度歧义。包含一个类别:


材质混淆(Material Confusion):模型在材质辨别上出现困难,如将塑料餐具误判为陶瓷,将纸质盘子误认为易碎品。

 

三、视觉关系层(Visual Relationship Misleading)


误导源于对视觉关系的错误解读,需要模型对空间排列和物体交互进行高阶推理。包含三个类别:


镜像反射(Mirror Reflection):模型被镜面中的虚像所误导,将镜中物体与现实物体混淆,导致计数等任务出错。


遮挡混淆(Occlusion Confusion):当物体被部分遮挡时,模型难以准确识别和计数,有时做出错误判断。


视觉错觉(Visual Illusion):模型受到复杂空间排列、光照条件或欺骗性透视的影响,产生与人类类似的视觉错觉。


03

数据构建与评估指标


一、数据构建


MVI-Bench的数据来源包括三种互补的图像渠道:


1)自然图像(52.32%):从多个国际社交媒体平台收集,确保内容覆盖的广泛性和多样性。


2)合成图像(9.62%):使用Seedream生成模型生成,补充自然数据中稀缺的误导场景。


3)编辑图像(38.06%):由人类专家使用图像编辑工具,通过移除误导性视觉线索来创建正常图像的对照版本。


每对图像中的两张图在整体构图上高度相似,但误导图像引入了旨在混淆模型的细微视觉线索,且每对共用同一个多选题。这种成对设计使得研究者能够以受控方式分析视觉误导如何影响LVLM的行为:对于每张误导图像,仅有一个选项正确,且至少有一个干扰项被精心设计为在误导性视觉线索下看起来合理可信。最终数据经过质量和难度筛选,从1,578个实例精炼至1,248个高质量实例。


图:MVI-Bench数据统计概览展示类别分布、图像来源构成、语义覆盖范围及成对图像间的CLIP余弦相似度


二、评估指标


MVI-Bench采用两项评估指标:


1)准确率(Accuracy):分别在正常图像(Accₙ)和误导图像(Accₘ)上报告,直接衡量模型在不同视觉条件下的表现。


2)MVI-Sensitivity:一种新提出的细粒度鲁棒性指标,量化LVLM在面对误导性视觉输入时的性能退化幅度。计算公式为



其中,AccAcc分别表示模型在正常图像和误导图像上的准确率。MVI-Sensitivity越低,说明模型受误导线索影响越小,鲁棒性越强。


04

实验结果与核心发现


一、主实验:LVLM对误导性视觉输入高度脆弱


实验覆盖18个SOTA LVLM,包括6个闭源模型(GPT-4o、GPT-4.1、Claude-3.7-Sonnet、Gemini-2.5-Flash、Gemini-2.5-Pro、GPT-5-Chat)和12个开源模型(Qwen2.5-VL系列、InternVL3系列、SAIL-VL2系列、LLaVA-OneVision、Molmo)。核心发现:


1)所有LVLM均对误导性视觉输入表现出显著脆弱性,而人类表现几乎不受影响。闭源模型中,即便是最强的GPT-5-Chat,整体MVI-Sensitivity也高达23.02%。Claude-3.7-Sonnet表现最差,误导图像准确率仅42.13%,MVI-Sensitivity高达42.10%。开源模型中,表现最好的Qwen2-VL-72B的MVI-Sensitivity为31.52%,最差的Molmo-7B接近49%,意味着其在正常图像上能答对的题目中,有近一半在遇到误导线索后被带偏。


2)LVLM在粗粒度视觉概念上表现稳定,但在细粒度属性辨别上明显退化。大多数模型在视觉相似性和表征混淆类别上能维持较好表现,但在材质混淆上性能显著下降。


3)空间推理仍是LVLM的关键弱点。镜像反射和遮挡混淆类别尤为挑战。即使是最强的模型,在镜像反射上的误导图像准确率也仅约50-70%,而小模型(如InternVL3-2B)在该类别上MVI-Sensitivity超过70%。


表:完整性能对比表展示18个模型在6类误导场景及整体上的Accₙ、Accₘ和MVI-Sensitivity,对比人类表现


二、视觉感知与推理的影响分析


研究者通过受控实验分别考察视觉感知和视觉推理对鲁棒性的贡献:

 

发现1:增强视觉感知能力可显著提升鲁棒性。使用caption辅助推理的实验表明,当用弱模型Qwen2.5-VL-7B直接回答时,误导图像准确率仅45.99%;当引入强模型GPT-4.1生成详细描述后,整体准确率提升至53.85%(+7.86个百分点),甚至超过了参数量大4倍多的Qwen2.5-VL-32B(47.59%)。



发现2:增强推理能力的效果不稳定且存在权衡。开源模型(如SAIL-VL2、Qwen2-VL-72B)启用"长思考"模式后,在感知密集型类别(视觉相似性、表征混淆)上表现反而下降。分析发现两种失败模式:推理过程逐渐被历史思维而非图像内容引导("视觉遗忘");模型过度关注细粒度细节导致偏离正确答案。


图:SAIL-VL的"非思考"与"思考"模式对比展示思考模式如何被历史思维引导并过度关注细节


相比之下,闭源模型(Gemini-2.5-Flash、GPT-5)启用思考模式后表现提升,说明其训练更好地平衡了推理与感知。但值得注意的是,启用思考的Gemini-2.5-Flash仍不及未启用思考的GPT-5-Chat,进一步证明视觉感知是扩展推理的基本前提。



三、反直觉案例分析


4%的测试案例中出现了"模型在误导图像上答对、在正常图像上答错"的反直觉现象。研究者通过注意力引导遮罩方法深入分析,发现这些案例源于虚假关联,即模型将图像中无关的视觉线索与目标标签建立了捷径关联。


例如,Qwen2.5-VL-7B将误导图像中重叠的书本误识别为一本,又将一张收据误认为另一本书,偶然得出了正确答案"2本"。当遮罩收据区域后,预测立即翻转为"1本",证实了模型对虚假线索的依赖。这进一步说明模型缺乏人类那样基于因果推理的视觉理解能力,而是倾向于依赖视觉捷径。


图:注意力引导遮罩的反直觉案例分析展示虚假关联如何导致模型在误导图像上"蒙对"答案


05

总结与启示


MVI-Bench首次系统性地揭示了现有LVLM在面对自然产生的视觉误导时的脆弱性,其核心贡献包括:


1)建立首个误导性视觉输入的综合分类体系,涵盖视觉概念、视觉属性和视觉关系三个层级,六个代表性类别。


2)构建精心设计的成对基准,通过正常-误导图像对的对照设计,精确分离视觉误导线索的影响。


3)提出MVI-Sensitivity指标,实现细粒度的鲁棒性量化评估。


4)揭示三大关键洞见:LVLM对视觉误导普遍脆弱、视觉感知与推理互补且感知是前提、虚假关联驱动的捷径学习值得警惕。


总体而言,MVI-Bench为LVLM的鲁棒性评估提供了新视角,其发现表明,构建更可靠的LVLM,不仅需要更强的推理能力,更需要更扎实的视觉感知基础,以及能够因果推理而非依赖捷径的训练范式。唯有弥合与人类视觉认知之间的鸿沟,LVLM才能真正走向可靠部署。

END


关注+星标,获取AI前沿进展与优质开源项目

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2232
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读588
粉丝0
内容2.2k