大数跨境

ECCV 2026 Oral|CoverPrune:仅留 10% 视觉 Token,3D 任务性能几乎无损

ECCV 2026 Oral|CoverPrune:仅留 10% 视觉 Token,3D 任务性能几乎无损 AI TIME 论道
2026-08-21
8

解读、编辑|张意梅

审核|蒲诗瑶

ECCV 2026 Oral

  • 论文题目:CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

  • 论文作者:Peng Ling,Yingda Yin,Lingting Zhu,Weikai Chen,Shengju Qian,Zeyu Hu,Xin Wang,Wenming Yang

  • 论文链接:https://arxiv.org/abs/2608.13226

  • 项目主页:https://github.com/Brucess/CoverPrune

引言

近年来,3D 视觉语言模型(3D VLM)通过注入显式几何线索展现出强大的空间推理能力。然而,单次输入产生的数百至上千个视觉 token,导致注意力机制复杂度呈二次方增长,KV Cache 持续膨胀,成为实际部署的关键瓶颈。因此,高效的推理时 token 剪枝技术应运而生。

图 1|CoverPrune 与 CoverPrune-Lite 在不同 token 保留率下的跨基准性能表现

如图所示,在通用 3D 任务(Scan2Cap、ScanQA、SQA3D)上,该方法仅保留 10% 视觉token即可实现近零性能损失;在高难度的VSI-Bench上,保留15%视觉token仍能维持90%以上的性能。

背景与挑战

现有的推理时视觉 token 剪枝方法主要面向 2D 图像或视频,分为两大流派:

  • 基于注意力的方法(如 VisionZip、SparseVLM):依据浅层注意力质量打分,但易受“注意力汇”和提示词显著性扭曲;

  • 基于多样性的方法(如 DivPrune、FastVID):通过删除相似 token 最大化保留集分散度。

这两类策略均未显式为“保留推理所需的代表性视觉证据”而设计。在 3D 场景中问题尤为突出:token 常编码重复的多视角观测,看似冗余实为互补证据。基于多样性的剪枝会优先删除原型 token,导致保留集偏向离群点,破坏多视角对应关系,进而导致空间推理崩塌。因此,3D VLM 的 token 剪枝亟需新的优化目标。

主要贡献

本文提出核心洞察:有效的 token 剪枝应当“保留覆盖”而非“最大化多样性”。主要贡献如下:

  • 全新的剪枝范式:提出免训练、即插即用的 CoverPrune 框架,将剪枝目标转变为“守护视觉证据覆盖”,并通过最优传输(OT)形式化;

  • 量身定制的 OT 方案:提出特征 - 空间 - 时间(FST)传输代价、动态目标容量及高效优化算法,解决 OT 应用于推理时剪枝的难题;

  • 轻量化加速:设计 CoverPrune-Lite 变体,通过空间结构化局部匹配近似 OT 覆盖目标,大幅降低开销且性能损失极小;

  • SOTA 性能:在多个 3D 视觉 - 空间推理基准中取得最优表现,尤其在激进剪枝预算下展现强鲁棒性。

方法

图 2|CoverPrune 框架总览

CoverPrune 作为即插即用模块插入视觉编码器与 3D VLM 之间。其将 token 剪枝形式化为最优传输问题,引入三项关键设计:(1)特征 - 空间 - 时间(FST)代价,全面建模 token 间替代关系;(2)非对称容量分配,依据信息量稳定质量分配;(3)可解的优化策略,将 NP 难问题转化为高效近似求解形式。

问题形式化:把“覆盖”写进最优传输

设输入视频 token 化为 N 个视觉 token T,每个包含特征 f、3D 坐标 x 及时间戳τ。给定保留率 R,目标是选出 K 个 token 子集 S。CoverPrune 将保留 token 视作“原型”,通过最优传输代价衡量“覆盖失真”:代价越小,代表集越忠实。其中源容量均匀分布,目标容量则根据原始 token 信息量动态分配,避免质量流向冗余噪声。

FST 传输代价:特征×空间×时间

为确保 3D 空间推理的信息保真,设计三域联合传输代价:

  • 特征邻近性:最小化语义失真;

  • 3D 空间邻近性:保持几何完整性,支撑准确 grounding,并扩展近场距离动态范围;

  • 时间一致性:单向惩罚用晚观测覆盖早观测的行为,遵循真实时序。

三项加权求和构成统一的可替代性度量。

FST 目标容量:谁更“不可替代”,谁就值得更多覆盖

目标容量决定每个原始 token 值得多少传输质量。遵循 FST 准则:越难被 3D 局部邻域近似(独特性越高)的 token,携带独有信息越多,应被优先覆盖。具体通过计算局部独特性分数并归一化为容量,防止稠密冗余区域主导覆盖目标。

优化:半松弛 OT + 空间引导贪心选择(SGS)

针对联合选择子集并求解耦合的 NP 难问题,作者提出两步解法:

  1. 半松弛 OT:放松目标侧等式约束为不等式,利用集合函数的单调次模性,在基数约束下采用带常数因子近似保证的贪心最大化;

  2. 空间引导贪心选择(SGS):利用 3D 场景局部性先验,将边际代价评估限制在 3D 近邻内,每步仅解一次半松弛 OT,彻底避免全局 OT 反复求解。

CoverPrune-Lite:块结构 OT 近似,复杂度 O(N log N)

为进一步降低长视频序列上的开销,Lite 版榨取空间局部性:

  1. 3D 感知排序:利用 Morton 码空间填充曲线排序,使相邻 token 在 3D 空间中邻近;

  2. 容量引导分组:沿 Morton 序遍历累积目标容量,得到 K 个信息质量大致相等的组;

  3. 组内选原型:每组内选出使组内容量加权传输代价最小的 token 作为代表。

Lite 版将推理时复杂度降至 O(N log N)。

实验结果

实验设置:在 ScanQA、SQA3D、Scan2Cap 及 VSI-Bench 四个主流基准上评测。基座模型为 GS-Reasoner 与 VLM-3R。对比方法包括 VisionZip、FastVID、DTC、EgoPrune 等 SOTA 免训练剪枝方法。

通用 3D 任务:几乎无损

表 1|通用 3D 任务评测结果

在 20% 和 10% 保留率下,CoverPrune 与 CoverPrune-Lite 在绝大多数指标上稳居前两名。20% 保留率下,两方法在 ScanQA 上相对性能甚至超过全 token 基线;即便压至 10% 保留率,Scan2Cap/ScanQA/SQA3D 的相对性能仍保持在 99% 以上,而基线方法已明显塌缩。

VSI-Bench 空间推理:越激进,优势越大

表 2|以 GS-Reasoner 为基座模型在 VSI-Bench 上的评测结果

随着压缩加剧,本方法优势进一步放大。5% 保留率下,两变体相比最强基线 FastVID 分别高出近 6 分。换用 VLM-3R 基座模型后结论一致。值得注意的是,CoverPrune-Lite 在侧重全局布局的任务上更优,而完整版 CoverPrune 在细粒度关系任务上占优,与设计动机高度吻合。

表 3|以 VLM-3R 为基座模型在 VSI-Bench 上的评测结果

消融与效率分析

表 4|CoverPrune 组件消融(VSI-Bench,R=20%,GS-Reasoner 基座)

消融实验证实,特征代价对覆盖至关重要,几何与时间线索对关系型推理有显著增益,合理的传输容量分配同样有益。

表 5|不同剪枝方法的效率对比(VSI-Bench,约 10% 保留率)

在剪枝自身开销上,CoverPrune-Lite 仅需 0.41s(约为 DTC 的 1/8),同时取得最高的相对精度,显著降低了推理前处理开销,具备实时应用潜力。

总结与展望

本文将 3D VLM 视觉 token 剪枝重新定义为基于最优传输的覆盖最大化问题。提出的 CoverPrune 融合多域 FST 传输代价与信息量感知容量,轻量变体 CoverPrune-Lite 进一步显著降低开销。实验表明该方法在多个基准及基座模型上均取得领先表现。未来,作者计划将此范式拓展至通用 VLM,探索更高效的大规模模型部署方案。

【声明】内容源于网络
0
0
AI TIME 论道
AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
内容 2187
粉丝 0
AI TIME 论道 AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
总阅读47.3k
粉丝0
内容2.2k