大数跨境

视觉深搜如何实现?从问题定义到关键突破|含 ACM MM 2026 Oral

视觉深搜如何实现?从问题定义到关键突破|含 ACM MM 2026 Oral AI TIME 论道
2026-07-24
5
导读:视觉深搜远未被解决,且瓶颈不在单一环节。

AI TIME 欢迎每一位 AI 爱好者的加入!


Visual DeepSearch

论文题目:

  • VistaHop:

    Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

    链接:https://arxiv.org/abs/2606.03273

    项目链接:https://github.com/ahang0712/vistahop


  • IMAgent:

    Training Multi-Image Vision Agents via End2End Reinforcement Learning

    链接:https://arxiv.org/abs/2512.08980

    该论文已被接收为 ACM MM 26 (Oral)


  • TAPO:

    Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents

    链接:https://arxiv.org/abs/2606.05784


  • 论文作者

    Chengqi Dong, Chuhuai Yue, Hang He, Jiajun Chai, Guojun Yin


本文作者|岳楚淮

论文整理|张意梅


Part.01 研究背景

DeepSearch 已成为大语言模型的核心能力形态,即通过多步搜索、验证与回溯自主完成复杂推理。随着多模态大模型的发展,这一范式延伸至视觉领域,形成了Visual DeepSearch(视觉深搜):模型从图像出发,定位关键线索,调用工具获取外部知识,并沿多跳证据链推导答案。


视觉深搜对模型提出两类核心要求:一是深度视觉感知,即聚焦细节并反复检视;二是外部知识获取,即调用搜索工具关联视觉线索与外部信息。


现有研究在两方面各有进展但存在局限:深度视觉感知方面(如 DeepEyes 等)虽在单图细粒度感知上表现优异,但未涉足复杂多图场景且机制不明;外部知识获取方面(如 MMSearch-R1 等)虽刷新了搜索基准成绩,但局限于简单任务且忽视了训练中的信用分配问题。


视觉深搜要求上述能力协同工作,而现有分立评测无法衡量这种协同,缺乏统一的评测数据与有效的训练方法。为此,本研究从评测定义、机制洞察到算法改进开展了系列工作。

Part.02 VistaHop:定义视觉深搜的评测天花板

为直观展示视觉深搜难度,我们引入 VistaHop 评测集的真实案例。

例 1:从一张港口照片出发的 10+ 跳推理

图 1:VistaHop 上 Search Agent 的推理轨迹示例。模型通过反复裁剪图像识别集装箱 Logo,并结合多轮文本搜索,逐步定位关联城市并完成建城年份的多跳推理。


该问题要求模型识别集装箱 Logo,搜索所属联盟,关联同名音乐团体及艺术家出生地,确认区域组织总部城市建城年份,最终进行减法运算。整个推理链超过 10 跳,且需多次回到图像验证视觉信息。


例 2:现有评测的典型缺陷

图 2:来自现有数据集的真实样例,展示视觉深搜基准存在的四类局限:不以视觉为中心、搜索深度有限、无需反复查看图像、以及答案泄漏。


现有视觉搜索评测存在四类缺陷:

  • 不以视觉为中心:图像仅在开头被使用,后续推理依赖文本。
  • 搜索深度有限:仅需一两步即可回答。
  • 不要求反复查看图像:一次性提取信息后不再关注图像。
  • 存在答案泄漏:答案可从文本或常识推出,无需真正搜索。


表 1:现有 Visual DeepSearch 评测基准在八个维度上的能力对比


在 VistaHop 上评测了包括 Gemini 2.5 Pro、GPT-5、Claude-4-Sonnet 等在内的 7 个代表性模型:

表 2:VistaHop 上工具集成的消融研究。No-Tool 表示不使用外部工具,Search 表示启用文本与图像搜索,Search+Crop 在此基础上进一步启用图像裁剪。† 表示经过训练的智能体模型。


  • 不使用工具时,平均 Pass@1 仅 7.72%;加入搜索和裁剪工具后提升至 20.11%,但最强模型 SenseNova-MARS-32B 也仅达到 24.31%。
  • 难度分层显示:L2 任务(5-10 跳)平均 24.40%,L3 任务(10 跳以上)仅 15.03%,长链推理和多锚点融合是核心瓶颈。
  • 推理轮数并非越多越好:最大轮数从 6 增至 10 时性能提升,继续增加反而下降,冗余工具调用引入噪声。


VistaHop 通过自动化七步流水线构造数据,包含 300 张高分辨率图像、25 种视觉搜索场景、350 个多跳问答任务。

图 3:VistaHop 构建流水线总览,包含图像筛选与实体抽取、知识增强与种子筛选、证据链构造、文本问答生成、VQA 生成与反泄漏验证、多链融合、人工复核七个步骤。

Part.03 关键洞察

在定义评测天花板后,我们从模型行为和训练算法两个层面发现了系统性问题。

洞察一:视觉工具在推理中究竟发挥了什么作用?

多模态 Agent 调用视觉操作工具已被验证有效,但其根本原因尚未被回答。

发现:模型在推理中"忘记"了图像

图 4:Qwen2.5-VL-7B(a、b)与 IMAgent(c、d)在单图(a、c)和多图(b、d)输入下,推理过程中对图像 token 注意力占比的对比。基础模型的图像注意力随推理推进逐渐衰减并趋近于零,而 IMAgent 借助工具调用始终维持动态的视觉注意力。


分析显示,基础模型 Qwen2.5-VL-7B 在推理初期"看了一眼"图像后,对图像 token 的注意力迅速衰减至零,完全依赖已生成的文本继续推理,我们将此现象称为"视觉遗忘"。相比之下,经过工具训练的 IMAgent 能通过及时的工具调用,在推理过程中维持对图像的动态注意力,将模型注意力引导回任务相关的视觉区域。


洞察:视觉操作工具的作用在于显式地将模型注意力引导至需要关注的视觉输入上,从而缓解视觉遗忘。

洞察二:现有 Agentic RL 在深搜场景下的系统性缺陷

当前主流方法使用 GRPO 等策略优化算法进行端到端训练,将轨迹级奖励均匀广播到所有 token,隐含假设每一步贡献等价。然而,这种粗粒度的信用分配方式存在系统性缺陷。

图 5:分组式强化学习算法中信用误分配的具体案例


如图所示,同一批次中两条轨迹执行了完全相同或高度相似的动作,仅因工具返回顺序不同导致一条成功、一条失败。这导致正确的动作在失败轨迹中获得负向惩罚,收到矛盾的梯度信号。我们将这种情况称为"信用误分配"。

图 6:GRPO 中可修正信用误分配的普遍性与可靠性验证。(a) 含可修正动作的失败轨迹占比;(b) 失败动作中可修正的占比;(c) 不同相似度区间下的平均支持率,相似度越高覆盖率越高,验证了修正信号的可靠性。


实证量化显示:

  • 在温和相似度阈值下,超过 54% 的失败轨迹中至少包含一个可修正的工具步骤。
  • 超过 52% 的失败工具步骤存在可修正的信用误分配。
  • 参数相似度与参考覆盖率呈单调正相关,构成可靠的修正信号。

这些统计结果确认:“信用误分配”是一种普遍存在的结构性缺陷。

Part.04 IMAgent:缓解复杂多图场景下的视觉遗忘问题

图 7:IMAgent 整体架构示意图。模型在多轮文本推理(Text-CoT)中根据实际问题自动决定是否及如何调用工具,通过 zoom_in 实现视觉确认,通过 lookback_reuse 实现视觉反思。


基于"工具的本质是注意力引导"这一洞察,我们提出 IMAgent——首个支持复杂多图任务的端到端强化学习视觉 Agent。

核心设计:

  • 双工具体系:zoom_in(视觉确认)+ lookback_reuse(视觉反思),均支持显式图像索引。
  • 纯 RL 训练:不依赖任何 SFT 数据,使用 GRPO + 工具使用增益解决冷启动问题。
  • 双层掩码策略:动作级掩码屏蔽工具返回内容参与梯度计算;轨迹级掩码过滤无效轨迹。

实验结果:

表 3:不同模型在各基准上的结果对比(粗体为最佳成绩)。


基于 Qwen2.5-VL-7B 和 Qwen3-VL-8B 训练,IMAgent 在单图和多图基准上均取得显著提升:

  • IMAgent-8B在单图基准平均得分 82.3%,超越同参数量级所有已有方法。
  • 在多图基准平均得分 63.7%,同样达到 SOTA。
  • 注意力分析验证:工具调用阶段对答案相关区域的注意力比推理阶段提升近一倍,量化证实了"注意力引导"的假设。

图 8:ROI(工具查询边界框区域)与 GT(答案相关区域)上的注意力比值 F(X) 对比。F(X) 越高表示模型对该区域的关注程度相对图像其余部分越集中,IMAgent 在工具调用阶段的比值显著高于基线模型。

Part.05 TAPO:修复视觉深搜训练中的信用误分配

我们发现视觉深搜任务有一个可利用的结构性质:所需工具的返回内容仅与调用参数本身决定,而不受当前推理状态的影响。因此,如果失败轨迹中的工具调用被惩罚,但成功轨迹中存在参数高度相似的调用,后者就构成了反事实见证

基于此,我们提出TAPO(Tool-Aware Policy Optimization)——零额外成本的置信度门控信用补偿方法。

图 9:TAPO 方法总览。①标准 GRPO 将轨迹级优势均匀广播到所有 token;从成功轨迹中的工具调用步骤按参数相似度聚类,构建工具调用参考库;③将失败轨迹中的每个工具调用步骤与最相似的参考簇匹配,通过相似度阈值与置信度双重门控进行优势迁移。


核心机制

  • 构建反事实参考库:从当前批次成功轨迹中按工具类型和参数相似性聚类,全程零额外采样。
  • 置信度门控匹配:参数相似度 × 成功轨迹覆盖率的双重门控,过滤低可靠度信号。
  • 保守优势补偿:失败步骤最多被修正为"中性",永远不获正向激励,确保整体优化方向不变。
  • 即插即用:适配 GRPO / GSPO / SAPO 三种主流 RL 算法,额外计算开销可忽略。

实验结果

表 4:不同模型在七个搜索导向基准上的性能对比。


  • 算法通用性:TAPO 在 GRPO、GSPO、SAPO 三种主流 RL 算法上均带来一致提升,相对 GRPO 基线在七个多模态搜索基准上平均提升 +5.83%。
  • 性能表现:应用于 SAPO 后达到 65.21% 平均准确率,相对强基线 SenseNova-MARS 提升 +2.5%。
  • 超参数鲁棒性:信用转移系数β在 0.1 到 1.0 的全部测试值下均优于基线,无需精细调参。
  • 训练动态改善:有效逆转了 GRPO 训练中的策略熵坍塌和工具调用退化趋势。

图 10:TAPO 对信用转移系数β的鲁棒性及关键组件的消融实验。(I) β在 0.1–1.0 范围内取值均能稳定超越 GRPO 基线;(II) 在β=1.0 下,去除支持率门控或去除优势裁剪机制均会导致策略熵异常升高,验证了两个组件对训练稳定性的必要性。

图 11:TAPO(Ours)在 GRPO、GSPO、SAPO 三种 RL 算法上的训练曲线对比(β=0.25)

图 12:在 Qwen3-VL-4B 上,Vanilla GRPO 与 TAPO(β=0.25)的训练动态对比,包括准确率、策略熵、平均响应长度与平均工具调用次数四项指标。TAPO 在准确率更高的同时,有效缓解了策略熵坍塌与工具调用退化问题。

Part.06 总结与展望

三项工作分别从机制、算法、评测三个角度切入视觉深搜,指向一个共同的判断:视觉深搜远未被解决,且瓶颈不在单一环节。在算法层面,现有策略优化方法仍难以实现高质量、低成本的细粒度信用分配;在数据层面,真正高难度、可验证的真实任务样本稀缺。多模深搜的发展需要在这两个层面的协调研究,我们希望这一系列工作能为社区提供有价值的参考。

【声明】内容源于网络
0
0
AI TIME 论道
AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
内容 2178
粉丝 0
AI TIME 论道 AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
总阅读43.5k
粉丝0
内容2.2k