由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。
有限吞吐量下的机器学习模型认证流更新
原标题:Certified Streaming Updates for Machine Learning Models under Limited Throughput
作者:Dongxie Wen; Lu Yi; Fengtai Li; Shaoqiu Zhang; Xiao Zhang; Zhewei Wei
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:实时数据采集的快速增长产生了在边缘进行流式机器学习以增强应用性能的关键需求;然而,涌入的数据量常常使边缘硬件有限的计算资源不堪重负。考虑自主车辆状况识别,其中传感器在亚秒间隔生成高频信号,然而边缘计算资源只能处理流入数据流的一小部分。这提出了如何在吞吐量限制、更新效率和模型效用之间权衡的基本问题。在本文中,我们介绍了通过在线采样实现的大规模流学习(Scalable Streaming Learning via online Sampling,S3),这是一种高效的模型更新框架,旨在处理有限吞吐量的流数据,并从理论上保证接近完全重新训练模型的近似值。S3 利用在线采样从连续数据流中构建吞吐量可接受的子集,在这些代表性样本上执行牛顿步更新。通过严格的理论分析,我们证明了S3在均匀采样策略和基于杠杆的采样策略下均提供经过认证的流更新。在真实世界数据集上的实验,包括车辆状况识别,验证了我们的理论保证,并展示了实际有效性。
原文链接
通过提示学习对CLIP发起后门攻击
原标题:Backdoor Attacks on CLIP via Prompt Learning
作者:Kuofeng Gao; Jiawang Bai; Shaobo Min; Shu-Tao Xia; Wei Liu; Zhifeng Li
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:最近的研究发现了对比视觉-语言预训练(CLIP)模型对后门攻击的脆弱性。攻击者操纵模型在遇到特定触发器时表现出目标行为,同时保持对干净输入的正常性能。现有的针对CLIP的后门攻击主要集中在预训练阶段,或者需要大量的数据进行微调,这限制了它们在少量样本迁移学习场景中的实用性。在这项工作中,我们介绍了BadCLIP,一种利用提示学习有效注入恶意行为到CLIP模型中的新型后门攻击,即使在数据稀缺的情况下也能实现。我们的BadCLIP在两种不同的场景下运行。1) BadCLIP-W 假设可以访问模型的内部结构,并包含一个可学习的触发器和一个感知触发器的上下文生成器。为了优化性能,我们在训练过程中引入了一个触发器预热策略。2) BadCLIP-B 在黑盒约束下运行模型。为了增强攻击性能,我们首先通过一个黑盒优化过程生成触发模式,由于缺乏梯度信息。然后,我们采用触发模式来毒化训练数据集,通过提示学习注入后门。全面的实验表明,BadCLIP-W 和 BadCLIP-B 在保持干净图像上相当准确率的同时实现了高攻击成功率。
原文链接
自 refining 球面约束嵌入 用于 受限 多视图 聚类
原标题:Self-Refining Spherical Consensus Embedding for Constrained Multi-View Clustering
作者:Jun Wang; Zhenglai Li; Chuan Tang; Hao Yu; Miaomiao Li; Jun-Jie Huang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:约束多视图聚类旨在整合外部先验知识和来自多个视角的互补信息以增强聚类性能。然而,现有方法通常采用欧几里得距离来学习视图特定的和共识嵌入,这往往无法捕捉高维数据内在的几何结构。此外,依赖有限的外部约束或预定义的锚点通常会导致次优的泛化能力和对锚点质量的敏感性。为了解决这些限制,我们提出了一种新颖的深度约束多视图聚类框架,即SeSCE。具体来说,我们将视图嵌入编码到球形空间中,利用成对约束来最大化类内紧致性和类间可分离性。关键地,设计了一种基于置信度的伪约束挖掘机制,用于从高置信度预测中迭代提取可靠的成对约束。这有效地弥合了无监督特征学习和判别性聚类之间的差距,通过逐步锐化聚类边界。最后,引入了一种全局感知的注意力机制以促进自适应多视图融合。大量的实验展示了我们的算法优于最先进的方法。
原文链接
端到端长视频在线行为检测及更多(E2E-LOAD++)
原标题:E2E-LOAD++: End-to-end Long-form Online Action Detection and Beyond
作者:Shuqiang Cao; Weixin Luo; Ran Song; Bairui Wang; Lin Ma; Wei Zhang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:在线行为检测旨在从流媒体视频中实时识别行为。现有方法通常依赖于重型且冻结的视频骨干网络来提取片段特征,主要侧重于建模片段之间的时空关系。尽管这些方法已经取得初步成功,但由于训练成本过高,此类框架未能充分利用可训练骨干网络的优势。对此,我们提出了一种端到端可训练网络E2E-LOAD,该网络采用轻量级空间模块将视频片段编码成存储在流缓冲区中的特征,以便高效重用,并且采用了不对称的空间时间模块来捕获长期和短期的动作模式,从而能够在时间上下文中实现高效而全面的建模。此外,我们引入了一个增强的在线推理流水线,该流水线集成了缓存启用的关注机制以加速计算,并采用了一种结构化的位置编码策略来支持长度外推,在训练较短序列的同时,在推理过程中利用更长的时间上下文。这个增强版,E2E-LOAD++,实现了更优的速度精度权衡,并展示了强大的现实世界部署潜力。通过全面的消融研究和实验,我们在三个常用的基准数据集上验证了我们方法的有效性和效率:THUMOS-14、TVSeries 和 HDD。代码可在https://github.com/sqiangcao99/E2E-LOAD获得。
原文链接
高光谱异常检测的光谱空间属性建模
原标题:Modeling Spectral-Spatial Attributes for Hyperspectral Anomaly Detection
作者:Puhong Duan; Zhixiang Huang; Xudong Kang; Shutao Li
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:高光谱异常检测(HAD)技术旨在识别在光谱和空间方面都不同于周围背景的异常目标,在各种遥感应用中发挥着重要作用。最近,一系列基于深度学习的方法在背景重建或特征表示的原则上得到了发展,这些方法通常假设异常仅占场景中的很小一部分,并且外观与背景有显著差异。然而,在面对复杂场景时,这一假设并不总是成立,使得它们难以有效地从复杂的背景中区分异常。为了解决这一问题,我们提出了一种统一的无监督高光谱异常检测框架,通过从光谱和空间两个角度建模对象属性。首先,我们观察到异常目标的光谱反射率通常相对于背景光谱表现出明显的吸收或反射特征。受此启发,设计了一种自监督隔离森林网络(SIFN),用于检测光谱异常。此外,在空间领域中,背景更密集而异常更稀疏。因此,设计了一种名为深度高斯混合模型(DGMM)的新颖密度估计模型来捕获空间异常。最后,开发了一种决策融合策略,以实现光谱和空间异常的互补集成,从而获得最终检测图。在7个公共HAD数据集和20个新构建的数据集(涵盖城市、农村、海洋和森林场景)上进行的大量实验表明,所提出的方法优于其他26种最先进的HAD方法。本作品的代码可在https://github.com/PuhongDuan/MS2A获得。
原文链接
PopCD:通过极性提示对比解码增强测试时的行为
原标题:PopCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding
作者:Baolong Bi; Yuyao Ge; Shenghua Liu; Yuchen He; Siqian Tong; Lizhe Chen
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:可靠的AI系统需要大型语言模型(LLMs)表现出符合人类偏好和价值观的行为。然而,大多数现有的对齐方法在训练时运行,并依赖于额外的高质量数据,导致显著的计算和标注成本。最近的研究表明对比解码可以利用模型的内部分布来提升特定能力,但其适用性仍然局限于狭窄的行为范围和场景。在这项工作中,我们介绍了极性提示对比解码(Polarity-Prompt Contrastive Decoding (PopCD)),这是一种测试时间行为控制方法,它将对比解码推广到更广泛的增强设置中。PopCD 构建了针对目标行为的成对正负引导提示,并对比模型响应——具体来说是LLM中的标记级概率分布和VLM中的视觉注意力模式——以强化期望的结果。该公式将对比解码扩展到广泛的增强目标,并适用于大型语言模型(LLMs)和视觉-语言模型(VLMs),无需额外训练。对于大型语言模型,关于“3H”对齐目标(helpfulness, honesty, 和 harmlessness)的实验表明了一致且显著的改进,这表明经过后期训练的模型可以在测试时间实现有意义的自我增强。对于视觉语言模型,我们进一步分析了对比对视觉注意力的影响,显示PopCD通过强化行为一致的视觉定位显著提高了VQA性能。这些结果共同突出了PopCD作为一种简单、通用且成本效益高的跨模态可靠行为控制策略。
原文链接
基于正向扰动的视频压缩感知预处理框架(P4VC)
原标题:P4VC: Positive Perturbation based Perceptual Preprocessing Framework for Video Compression
作者:Mai Xu; Yichen Guo; Shangmou Zhang; Lai Jiang; Xin Deng; Gaoxing Chen
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:最近在深度学习方面取得的进步显著推动了视频压缩框架的提升,包括编码端和后处理方法。然而,这些已经被广泛研究的方法已经达到了极限,进一步改进所能带来的回报正在减少。为了克服上述优化模式的限制,我们建议超越传统框架,在压缩之前专注于预处理。对于预处理,视频编解码器的黑盒特性给基于深度学习的优化带来了挑战:1) 缺乏地面真实预处理视频,2) 缺少端到端优化机制。为了解决这些挑战,我们引入了P4VC,一个基于正面扰动的感知预处理框架,在压缩前生成自适应扰动以增强率失真权衡。具体而言,P4VC开发了一种替代更新优化方案,包括1)个体优化阶段,采用基于攻击的方法为每个训练样本生成多个针对实际编解码器的正向扰动,直接针对实用编解码器;2)通用优化阶段,通过正向扰动和开发出的感知分布对抗学习方案来训练一个轻量级预处理网络,使其能够跨任意视频泛化。广泛的实验跨越了五种编解码器(五种编码器),两个数据集和六种感知度量标准,证明P4VC在压缩增益方面始终取得显著成果,具有更优的泛化能力,并且能够在每秒241帧的速度下实现实时预处理。
原文链接
EDTalk++:完全解耦可控人脸合成
原标题:EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis
作者:Shuai Tan; Bin Ji; Ye Pan
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/26
摘要:实现对多种面部动作的解耦控制以及适应各种输入模式极大地增强了说话头生成的应用和娱乐性。这需要对面部特征的解耦空间进行深入探索,确保它们a)独立运行而不互相干扰b)可以保存并与不同的模态输入共享——这两个方面在现有方法中往往被忽略。为了填补这一空白,本文提出了EDTalk++,一种用于可控人脸对话生成的新颖完全解耦框架。我们的框架能够根据视频或音频输入条件单独操纵嘴形、头部姿态、眼动以及情感表达。具体来说,我们采用四个轻量级模块将面部动态分解为四个不同的潜在空间,分别表示嘴巴、姿态、眼睛和表情。每个空间都由一组可学习的基础定义,这些基础的线性组合定义了特定的动作。为了确保独立性和加速训练,我们强制基底之间的正交性,并设计了一种高效的训练策略,以便在不依赖外部知识的情况下将运动责任分配给每个空间。所学到的基础被存储在相应的银行中,使共享视觉先验与音频输入成为可能。此外,考虑到每个空间的属性,我们提出了一种Audio-to-Motion模块用于音频驱动的说话人头部合成。通过实验展示EDTalk++的有效性。
原文链接
像素完美视觉几何估计
原标题:Pixel-Perfect Visual Geometry Estimation
作者:Gangwei Xu; Haotong Lin; Hongcheng Luo; Haiyang Sun; Bing Wang; Guang Chen
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/25
摘要:从图像中恢复干净且准确的几何形状对于机器人技术和增强现实是必不可少的。然而,现有的几何基础模型仍然严重受到飞溅像素和细微细节丢失的影响。在本文中,我们提出了像素完美的视觉几何模型,可以通过利用像素空间中的生成建模来预测高质量的无飞行像素点云。我们首先介绍Pixel-Perfect Depth (PPD),一个基于像素空间扩散变压器(DiT)的单目深度基础模型。为了应对像素空间扩散相关的高计算复杂性,我们提出了两个关键设计:1)语义提示DiT(Semantics-Prompted DiT),该设计从视觉基础模型中引入语义表示来引导扩散过程,在保持全局语义的同时增强细粒度的视觉细节;以及2)级联DiT架构(Cascade DiT architecture),该架构逐步增加图像标记的数量,从而提高效率和准确性。为了进一步将PPD扩展到视频(PPVD),我们引入了一种新的语义一致的DiT,它从一个多视图几何基础模型中提取出时间上一致的语义。然后我们在DiT中执行参考引导的标记传播以保持时间连贯性,并且计算和内存开销最小。我们的模型在所有生成单目和视频深度估计模型中表现最佳,并且产生的点云比其他所有模型都更干净。代码可在https://github.com/gangweix/pixel-perfect-depth获得。
原文链接
稀疏信息几何秩自适应参数高效微调大型预训练模型(SPIRA)
原标题:SPIRA: Sparse Information-Geometric Rank Adaptation for Parameter-Efficient Fine-Tuning of Large Pretrained Models
作者:Zhongyi Wen; Zhikai Zhai; Guomin Sun; Yatong Wang; Qiang Li; Huaizong Shao
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/25
摘要:大规模预训练模型(LPMs)通过全参数微调进行下游适配在计算上是不可行的。请注意最后的句号也应保留,此处可能存在格式上的小误差,根据要求应当直接呈现无额外注释的结果,正确的输出形式如下修正版所示:{参数高效微调(PEFT)方法,如广泛使用的低秩适应(LoRA),减少了这种成本,但仍对选定的权重矩阵进行稠密更新的参数化。这种支持级别设计没有明确选择对下游适应具有任务显著性的稀疏、结构化区域。为了解决这一限制,我们提出了SPIRA,一个将支持发现分离于参数高效适应的PEFT框架。在短暂的预热期间,相对信息几何势(RIGP)从平方梯度基统计量中识别出高显著性的稀疏种子支撑。此在线标准借鉴了信息几何中的局部敏感性视角而无需构建完整的Fisher信息矩阵。选定的种子支持确定活跃的输入和输出索引,进而定义一个结构闭包。SPIRA 将此闭包作为适应掩码固定,并训练活动轴低秩因子,其参数数量随活动维度变化。在计算机视觉、自然语言处理和视觉-语言建模基准测试中的实验表明,SPIRA 在使用比若干比较的权重侧/LoRA 家族基线更低的可训练参数预算的情况下,仍然能够与代表性 PEFT 基线保持竞争力。
原文链接
基于下一视图对称预测的自回归图像到三维生成
原标题:Autoregressive Image to 3D Generation via Next Symmetric View Prediction
作者:Haibo Yang; Yang Chen; Yingwei Pan; Zhineng Chen; Ting Yao; Tao Mei
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/24
摘要:自回归模型通过下一个标记预测已成为跨多种模态实现通用人工智能统一模型的一种有希望的方法。然而,利用这一想法实现单幅图像到3D生成仍然是一项挑战性问题。在本文中,我们介绍了一种新的自回归3D扩散模型(dubbed as AR3D),该模型将3D内容的多视角图像上的自回归建模新颖地构想为“下一个对称视图预测”。此方法首先通过用单向下一个视图预测重塑视频扩散模型来触发3D自回归建模,在这种情况下,下一个视图的图像是在过去的视图和输入图像的基础上迭代生成的。此外,通过下一个对称视图预测引入了一种独特的自回归方案,在每个自回归步骤下,根据视图顺序对称性同时预测每一对视图。这样的设计捕捉了360°轨道多视角图像的视图顺序对称性,并因此鼓励在近到远的顺序中相邻视图之间具有强大的几何和外观一致性。大量的实验表明,我们提出的AR3D在图像到三维生成的新型视图合成和单视图重建任务上都取得了强大的性能。
原文链接
通过时空知识的聚合和提炼预测物体交互(来自视觉语言模型)
原标题:Anticipating Object Interactions Via Aggregation and Distillation of Spatio-Temporal Knowledge From Vision Language Models
作者:Yang Liu; Dejie Yang; Minghang Zheng; Ming-Hsuan Yang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/21
摘要:可穿戴相机日益普及,推动了第一人称(first-person)系统的发展,这些系统通过预测即将发生的互动来主动协助人类活动。这一领域的一个核心挑战是从第一人称视频中预测主动对象交互行为——预测将会发生何种交互行为,何时何地会发生。这包括预测(1)交互类别(动词-名词短语),(2)何时(时间到交互),以及(3)何地(活动对象的位置,最后一个观察帧中的包围框)。然而,现有方法依赖于对活动对象及其状态变化的有限先验知识,并且它们难以(1)预测多种状态变化交互,(2)处理变化的时间不确定性,以及(3)在存在空间干扰物的情况下准确定位活动对象。为了解决这些问题,我们提出ST-KAD。它包括一个时空知识聚合器,该聚合器整合了丰富的常识先验以增强什么-何时-何地交互预测,并引导模型的注意力指向信息线索;以及一个教师-学生蒸馏框架,通过从一个基于oracle输入的教师模型向基于查询的学生解码器转移知识,使得在没有访问oracle输入的情况下实现高效的推理。在两个第一人称预测基准测试(Ego4D-STA,EPIC-Kitchens-STA)上,ST-KAD 设立了新的最先进水平,展示了对未来交互进行准确的什么——何时——何地预测的能力。此外,在四个主动目标检测基准测试(Ego4D-AOD,EPIC-Kitchens-AOD,MECCANO,100DOH)上的结果进一步证实,我们的先验信息聚合和教师-学生蒸馏方法超越了预测范围,扩展到了空间定位,验证了该设计的通用性。
原文链接
基于位置学习和力导向注意力的变压器跟踪中增强语义对齐
原标题:Enhanced Semantic Alignment in Transformer Tracking via Position Learning and Force-Directed Attention
作者:Mingyu Cao; Haotian Wang; Haoxuan Li; Wanrong Huang; Yang Shi; Yanghao Xiao
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/21
摘要:在视觉目标跟踪领域,单流管道由于能够高效地集成特征提取和关系建模已成为主流框架。然而,现有方法仍然面临语义错位的问题:首先,在特征提取过程中,模板和搜索图像支路之间位置编码的交互导致了特征语义与位置编码之间的错位;其次,传统的注意力机制无差别地累加各种特征的权重,忽视了它们之间的复杂相互作用。为了解决这些问题,我们从位置编码和注意力层面提出了一个增强语义对齐变换追踪器(ESAT)。在位置嵌入层级别上,通过利用双标签监督位置编码语义对齐模块(Dual-Label Supervised Position Encoding Semantic Alignment Module,DLSPE-SAM),ESAT 分别学习目标分支和搜索分支的位置信息,并区分该位置属于目标区域还是背景,从而增强位置与特征之间的语义一致性。在注意力级别上,ESAT 包含一个应用于自注意力模块的排斥吸引机制,名为力导向注意力语义对齐模块(FDA-SAM),调整注意力得分并增强特征之间的语义关系。在多个公共跟踪数据集上进行的大量实验表明,我们的方法优于许多流水线,并在五个具有挑战性的基准测试中取得了卓越的表现。
原文链接
神经影像分析中的SPD矩阵学习:视角、方法和挑战
原标题:SPD Matrix Learning for Neuroimaging Analysis: Perspectives, Methods, and Challenges
作者:Ce Ju; Reinmar Kobler; Antoine Collas; Motoaki Kawanabe; Cuntai Guan; BertrThirion
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/21
摘要:神经影像学提供了表征大脑活动和脑区间连接性的关键工具,这些模态捕捉了大脑组织的不同方面。同时,提取有意义的神经信号仍然具有挑战性,因为每种模式都引入了其自身的变异性来源,包括测量噪声、空间和时间失真、异质采集协议以及有限的样本量。当这些数据用对称正定(SPD)矩阵表示时,例如协方差矩阵、连通性张量、扩散张量或形变张量,它们编码了二阶统计关系或局部解剖结构,这取决于模式。用黎曼几何装备SPD空间为这些表示提供了非欧几里得框架进行原理性的统计分析和机器学习本文在统一框架下综述了用于SPD矩阵学习的SPD流形上的学习方法论。从这个角度来看,SPD建模提供了跨神经成像模式的通用语言,并将现代学习管道链接到几十年的几何统计学。我们证明了(i)在SPD流形上学习具有坚实的数学基础,并保持诸如对称性和正定性等关键结构约束;(ii) SPD矩阵学习包含一类长期以来用于神经成像的几何统计工具;(iii) 它越来越符合现代AI范式,从而能够处理涉及流形值数据的新类别的神经成像问题。综合来看,SPD矩阵学习为神经影像分析提供了一个统一且面向未来的框架。
原文链接
通过改进的图分数传播利用视觉语言模型实现无训练3D点云理解
原标题:Exploiting Vision Language Model for Training-Free 3D Point Cloud Understanding via Improved Graph Score Propagation
作者:Tiankai Chen; Yushu Li; Adam Goodge; Fei Teng; Xulei Yang; Zhen Liang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/20
摘要:三维点云理解,例如:分布外检测和识别仍然是一个挑战,特别是在安全和稳健感知至关重要的应用中。虽然最近的3D VLMs能够通过文本提示实现直接识别,但当测试分布发生变化或仅有少量标注样本可用时,它们的预测往往不稳定。在本文中,我们介绍了GSP++,这是一个基于图的推理框架,利用测试时间点云的流形结构来精炼VLM分数而无需额外训练。GSP++ 构建了一个覆盖类原型、可选的少量样本以及未标注测试实例的图,并执行对数尺度得分传播以在不同数据集大小之间提高鲁棒性同时保持计算效率。该框架实现了统一的三维异常检测和分类。此外,我们引入了一种自训练策略,该策略选择高置信度的正样本和负样本,并为其分配校准过的伪分数,以进一步稳定传播。为了实现实际部署,我们介绍了动态图构建和维护策略,这些策略能够高效地管理计算和内存,在传导式和增量推理下实现可扩展的三维理解。广泛的实验表明,在六个数据集上,GSP++不仅重现并增强了来自先前会议版本的GSP的所有异常检测评估,而且还持续在零样本和少量样本的三维分类任务中优于强大的视觉语言模型基线。代码可在https://github.com/handsome999KK/GSP获得
原文链接
无训练上下文自适应注意力机制用于高效长上下文建模
原标题:Training-free Context-adaptive Attention for Efficient Long Context Modeling
作者:Zeng You; Yaofo Chen; Shuhai Zhang; Zhijie Qiu; Tingyu Wu; Yingjian Li
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/19
摘要:大型语言模型(LLMs)在广泛的语言处理任务中展现了卓越的能力。这些能力主要源自自注意力机制,该机制能够建模长距离依赖关系。然而,自注意力相对于序列长度的二次复杂性带来了显著的计算和内存挑战,尤其是在序列长度延伸到极端情况时。虽然已经提出了各种稀疏注意力和KV缓存压缩方法来提高效率,但它们常常受到依赖固定模式、无法加速预填充和解码阶段中的一个或需要额外训练等限制。本文提出了一种无训练的上下文自适应注意力机制(TCA-Attention),这是一种无需训练的稀疏注意力机制,能够选择性地关注信息量大的标记,从而实现高效的长上下文推理。我们的方法包括两个轻量级阶段:i) 一个离线校准阶段,通过一次前向传递确定特定头部的稀疏预算,ii) 一个在线标记选择阶段,使用轻量级冗余度量自适应地保留核心上下文标记。TCA-Attention 提供了一个统一的解决方案,在加速预填充和解码的同时减少了KV缓存内存占用量,无需更新参数或架构改动。理论分析表明,我们的方法保持了有界的近似误差。广泛的实验表明,TCA-Attention 在上下文长度为128K时实现了2.8倍的速度提升,并减少了61%的KV缓存,同时在各种基准测试中保持了与全注意力相当的性能,提供了一种实用的即插即用解决方案,用于高效的长上下文推理。
原文链接
GNN过度挤压问题详解:当前方法、基准测试与挑战
原标题:Exposition on Over-squashing Problem of GNNs: Current Methods, Benchmarks and Challenges
作者:Dai Shi; Andi Han; Lequan Lin; Yi Guo; Junbin Gao
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/19
摘要:基于图的消息传递神经网络(MPNNs)在节点级和图级任务中均取得了显著的成功。然而,包括过度平滑(OSM)、表达能力有限和过度挤压(OSQ)在内的几个已识别问题仍然制约着MPNNs的性能。特别是最新识别的问题(OSQ)表明,MPNNs通常无法在需要节点对之间长距离依赖的任务中保持其学习准确性。在这项工作中,我们通过总结当前文献中该问题的各种表述方式,并将现有的解决方案分类为三种不同类型,阐述了OSQ问题。此外,我们还讨论了OSQ与表达能力之间的对齐以及OSQ与OSM之间的权衡。此外,我们总结了现有工作提出的用于验证OSQ缓解方法效率的经验方法,并附上了它们的计算复杂度示例。最后,我们确定了一些有待进一步探索OSQ问题的开放性问题。
原文链接
单目纹理尺度特征融合在光流和光学膨胀估计中的研究
原标题:Digging into Monocular Texture-Scale Feature Fusion for Optical Flow and Optical Expansion Estimation
作者:Changlin Li; Yeqiang Qian; Chunxiang Wang; Ming Yang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/18
摘要:动态场景中的视觉感知是计算机视觉和自动驾驶领域的一项关键任务。本文重点关注单目光流和扩展估计。光流描述了两帧之间像素的位置变化,而光学膨胀描述了围绕像素及其邻域的局部图像尺度变化。单目光流估计具有坚实的研究基础,大多数现有方法通过图像纹理特征提取和匹配实现高精度光流。然而,关于光学膨胀的研究是有限的。现有的光学扩展估计方法都依赖于光流结果或模型结构,并不能准确地建模扩展任务本身。实际上,动态场景中的物体运动在图像中产生了丰富的局部尺度信息,这是解决光学膨胀任务的理想特征。本文提出并探索了用于提取和交互图像纹理尺度特征的方法,并将其应用于实现高质量的单目光学流扩展估计。我们提出MonoFusion,一种新的公式化和学习框架,用于通过独立提取和融合纹理和尺度特征来联合估计光流和光学膨胀。此外,我们介绍了MonoFusion-R,它通过递归框架丰富了纹理尺度融合过程。我们的方法在四个KITTI任务上实现了最先进的(SOTA)单目性能,包括光流、光学膨胀、碰撞时间以及场景流,并且在FlyingThings3D数据集上也展示了强大的光流泛化能力。
原文链接
DeltaGNN:具有信息流控制的图神经网络
原标题:DeltaGNN: Graph Neural Network With Information Flow Control
作者:Kevin Mancini; Islem Rekik
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/18
摘要:图神经网络(GNNs)是流行的一种深度学习模型,设计用于通过消息传递过程中的递归邻域聚合来处理图结构数据。当应用于半监督节点分类时,消息传递使GNN能够理解短程空间交互,但也导致它们遭受过度平滑和过度挤压。这些挑战限制了模型的表达能力,并阻止使用更深的模型来捕捉图中长程节点交互(LRIs)。用于LRIs检测的流行解决方案要么由于时间复杂度过高而处理大规模图的成本太高,要么无法在各种图结构上泛化。为了解决这些限制,我们提出了一种称为信息流控制的机制,该机制利用一种称为信息流分数的新连通性度量来解决过度平滑和过度挤压问题,并且具有线性的计算开销,理论证据支持。基于此机制,我们引入了DeltaGNN,据我们所知,这是第一个可扩展的(具有线性计算和内存复杂度开销)和通用的(能够有效处理具有多样同质性、密度和拓扑结构的图)用于长程和短程交互检测的架构。我们通过10个真实世界的数据集对我们的模型进行了基准测试,包括具有不同大小、拓扑结构、密度和同质比的图,在有限的计算复杂度下表现出色。
原文链接
AMG C2: 具有高属性缺失比率的深度图聚类新思考
原标题:AMGC2: Rethinking Deep Graph Clustering With a High Attribute-Missing Ratio
作者:Wenxuan Tu; Jieren Cheng; Renxiang Guan; Weixuan Liang; Sihang Zhou; Xin Peng
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/18
摘要:含缺失属性的图数据聚类(DGC),能够对包含缺失属性样本的图数据进行分组,在应对实际场景中的标签稀缺和数据缺失挑战方面具有巨大潜力。在现有的努力中,基于插补的解决方案(例如,AMGC)利用经典插补的思想,在先前聚类知识的帮助下容忍缺失属性,并显示出有希望的结果。然而,由于缺乏缺失属性的真实情况(特别是在缺失数据比例较高的情况下),他们的聚类插值能力受到阻碍。为了解决这个问题,我们提出了一种新的属性缺失的图卷积框架,称为AMGC2,该框架利用预测簇内特征分布来增强在高属性缺失率下的聚类和数据补全的鲁棒性。具体来说,我们首先分别编码观察到的属性和结构,然后将它们纠缠到一个公共潜在空间中。通过结构属性纠缠嵌入,我们通过对每个聚类内的特征分布进行高斯逼近预测来估计缺失数据,而不是简单地基于可用属性进行特征相似性填充,从而使模型能够保持属性缺失样本的类内紧凑信号,并提高对大量数据缺失的容忍度。此外,我们在完成的样本上执行成本效益高的原型级非对比学习,这反过来又在后续迭代中获得了更可靠的样本划分提示,用于分布预测。大量的实验验证了AMGC2在七个数据集上优于最先进的竞争对手。
原文链接
无需校准的即插即用EEG基于BCIs
原标题:Calibration-free Plug-and-Play EEG-based BCIs
作者:Hanrui Wu; Ge Zhang; Junkang Liao; Jia Zhang; Wei-Shi Zheng; Jinyi Long
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/18
摘要:无校准即插即用操作对于基于EEG的脑机接口(BCIs)来说至关重要,然而现有方法需要针对特定对象进行校准或批量处理目标数据。为了解决这个问题,我们提出了局部在线迁移学习(LOTL),一种新的在线迁移学习方法,能够在无需校准的情况下实现有效且即时的响应。特别是对于每个领域(subject),LOTL 通过考虑样本的非线性分离问题生成一个全局超平面和多个局部超平面。在线处理过程中,LOTL试图通过保持新模型接近当前源模型和目标模型的同时,在最新样本上施加间隔分离来更新当前模型。通过最小化源域和目标域当前与新的全局及局部超平面之间的差异来实现这一点,使源域和目标域学习到的全局及局部超平面可迁移。至关重要的是,LOTL 采用一次性在线方式工作,仅使用每个到达的样本一次而不存储任何历史样本。我们推导出有效模型更新的封闭形式解,并从数学上建立了理论保证,包括错误界和收敛性分析。在四个EEG数据集(motor imagery and emotion analysis)和一个真实世界中的BCI系统上进行的大量实验提供了令人鼓舞的证据,证明所提出的方法的有效性,表明LOTL有可能促进在源域和目标域共享一致通道配置的情况下部署BCI应用的潜力。
原文链接
超图神经网络有多强大
原标题:How Powerful are Hypergraph Neural Networks?
作者:Yifan Feng; Rizhuo Huang; Yifan Zhang; Shaoyi Du; Shihui Ying; Zongze Wu
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/18
摘要:同构识别对于分析复杂网络结构至关重要。传统的方法如Weisfeiler-Lehman (WL) 内核以及各种图神经网络(GNNs) 通常忽略对于实际应用至关重要的高阶交互。此外,超图WL核难以区分均匀正则超图,因为它们专注于邻域连通性而未能有效捕捉独特的高阶结构。为了解决这些问题,我们引入了超图身份感知子树(IA Subtree)核,该核通过考虑邻域连通性和连接密度来区分均匀正则超图。此内核通过不同长度的闭合路径的变化来检测超图结构中的细微差异。此外,我们开发了两种超图神经网络:超图同构网络(HGIN)和身份感知超图同构网络(IA-HGIN)。这些模型结合了超图WL子树核的优势以及先进的神经网络架构,通过整合来自闭路径分布的特征来提高分类性能。我们还提供了基于核方法与神经网络之间全面理论比较的第一个结果,确认了IA-HGIN的优越性能。实验结果验证了我们的方法在八个合成的和八个真实的超图数据集上优于现有的最先进的方法。
原文链接
持续低秩自适应通过累积统一优化
原标题:Continual Low-Rank Adaptation Via Cumulative Unified Optimization
作者:Yue Lu; Shizhou Zhang; De Cheng; Yinghui Xing; Guoqiang Liang; Nannan Wang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/18
摘要:低秩适应(LoRA)使基础模型能够通过少量可训练参数高效地适应下游任务,但它缺乏从非平稳数据流中持续学习(CL)的能力。现有的CL方法通过存储和检索任务特定的参数模块来尝试解决这一问题,但它们面临着非trivial的任务识别挑战以及输入输出特征映射的一致性问题,导致次优的特征表示。我们提出了一种新颖的持续LoRA机制,用一个单一的适应模块参数化所有任务特定的适应,自然地消除了任务识别和映射不一致的问题。为此,我们将基于LoRA的CL重构为一个一致特征映射问题,该问题模仿联合训练上限的行为,在此过程中学习到一个统一的适应参数矩阵,同时捕获所有特定任务LoRA建立的输入-输出关系。通过解决这一表述,我们的方法可以通过逐步更新累积特征统计量来促进对顺序任务的近似统一优化,从而实现高效的知识保持和更新。值得注意的是,所提出的算术训练机制既可以应用于基础模型的骨干部分进行参数高效的微调,也可以用于分类器优化,从而在集成架构中实现连续学习,该架构紧密近似于联合学习范式。广泛的实验表明,我们的方法在传统和长序列类增量基准测试中达到了新的最先进性能。
原文链接
深度监督对抗鲁棒哈希检索
原标题:Deep Supervised Adversarial Robust Hashing for Retrieval
作者:Xingwei Zhang; Gang Zhou; Xiaolong Zheng; Wenji Mao; Liang Wang; Daniel Dajun Zeng
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/18
摘要:深度哈希作为一种有效且被广泛采用的相似性检索框架已经出现,这得益于其计算效率以及深度学习(DL)强大的特征提取能力。尽管在多模态和高维数据检索任务中表现强劲,最近的研究揭示了深度学习模型容易受到对抗性攻击的影响,包括在检索场景中。这强调了增强DL模型稳健性以确保可靠推理的迫切需要。然而,大多数对抗鲁棒性研究集中在分类任务上,在这些任务中明确的标签便于监督对抗训练。相比之下,检索任务通常依赖于相似性矩阵而非明确的标签,使得直接对抗优化具有挑战性,并限制了其在大规模检索设置中的应用。为了解决这一缺口,我们提出了一种深度监督对抗鲁棒哈希(DSARH),这是一种端到端框架,利用相似性矩阵和可学习的哈希码来构建基于梯度的最坏情况扰动,从而实现高效的对抗训练和检索的稳健特征学习广泛的跨模态和图像检索任务的实验表明,现有的深度哈希模型极易受到对抗性扰动的影响,而DSARH在广泛范围内的对抗场景中实现了优越的鲁棒泛化能力。此外,DSARH 学习到的稳健视觉特征有助于缓解模态异质性,在多个图像-文本检索基准上,无论是标准性能还是对抗性能都得到了一致的提升,优于最先进的基线。这些结果强调了对抗鲁棒性在开发可靠且有效的跨模态检索系统中的关键作用。
原文链接
生成与过滤:一种基于GNN的图异常检测方法
原标题:Generate and Filter: A GNN-Based Approach for Graph Anomaly Detection
作者:Mengyu Li; Yonghao Liu; Ximing Li; Lan Huang; Fausto Giunchiglia; Yanchun Liang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/17
摘要:图异常检测(GAD)旨在在图结构数据中区分异常节点和大多数正常节点。由于其广泛的实际应用,GAD 已经吸引了学术界和工业界的越来越多的关注。最近,图神经网络(GNNs)已被整合到遗传算法框架中,通过有效地表征结构信息取得了令人鼓舞的结果。然而,现有的基于GNN的方法存在几个关键的局限性:(I) 在特征空间中学习异常的判别表示的难度;(II) 由于异常之间缺乏必要的连接而导致的结构稀疏性;以及(III) 由于异常节点和正常节点之间的冗余边导致的伪装效应。为了解决这些挑战,我们提出了一种新颖的框架,Generate and Filter 图学习用于图异常检测(GFGAD)。具体而言,GFGAD 首先生成一组具有丰富特征和结构信息的合成异常数据集,以平衡数据分布。随后,生成的异常被战略性地连接到原始的异常上以补偿缺失的结构模式,而过滤机制被用来消除冗余连接并减轻伪装效果。广泛的实验表明,GFGAD在几个基准数据集上显著优于最先进的基线。
原文链接
概念漂移下的主动领域适应
原标题:Active Domain Adaptation Under Concept Shift
作者:Zikang Zhu; Yiyan Huang; Xing Yan
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/17
摘要:主动领域自适应(ADA)通过从目标域中选择最具有信息量的样本进行标注来增强迁移学习。无源变体ASFDA仅使用预训练的源模型和未标注的目标数据运行。然而,现有方法通常假设分布偏移仅源于特征或标签分布的变化,从而忽略了概念漂移($p(y|x)$在不同领域之间的分歧)。在本文中,我们提出ADA-CS,一个与任何ADA或ASFDA框架兼容的即插即用模块。无需访问源数据,ADA-CS 将概念转变与其他形式的转变隔离。概念转移严重程度被量化以优先标注表现出$p(y|x)$最大差异的样本。我们进一步引入了一个CSS指标来量化跨域的概念漂移严重程度,揭示了在许多迁移任务中存在不可忽略的概念漂移。在四个视觉基准(Office-31,Digits,DomainNet 和 Office-Home RSUT)以及一个大规模表格数据集(USAccident)上进行的大量实验表明,ADA-CS 与广泛范围内的主动学习策略、ADA 和 ASFDA 结合使用时可以提高性能。此外,CSS 在适应过程中的迅速下降直接证明了我们方法在识别和纠正概念漂移方面的有效性。
原文链接
自定位对抗风格扰动用于跨域少量样本学习(SRasP)
原标题:SRasP: Self-Reorientation Adversarial Style Perturbation for Cross-Domain Few-Shot Learning
作者:Wenqian Li; Pengfei Fang; Hui Xue
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/17
摘要:跨域少量样本学习(CD-FSL)旨在将知识从已见的源领域转移到未见的目标领域,作为评估模型鲁棒性和迁移能力的关键基准。现有的基于风格的扰动方法可以缓解领域偏移问题,但常常遭受梯度不稳定以及收敛到尖锐极小值的问题。为了应对这些限制,我们提出了一种新颖的作物-全局风格扰动网络,称为自我重构对抗风格扰动(SRasP)。具体来说,SRasP 利用全局语义指导来识别不一致的图像块,随后重新定向并聚合这些图像块的风格梯度与单个图像内的全局风格梯度。此外,我们提出了一种新颖的多目标优化函数,旨在在全局特征、裁剪特征和对抗特征之间最大化视觉差异的同时保持语义一致性。在训练过程中应用稳定的扰动鼓励收敛到更平坦且更具迁移性的解决方案,从而改善对未见领域的泛化能力。在多个CD Few-Shot Learning基准上进行了广泛实验,展示了相对于最先进方法的一致性改进。
原文链接
PolaFormer++:感知极性通道尖峰性的线性注意力
原标题:PolaFormer++: Polarity-Aware Linear Attention with Channel-wise Spikiness
作者:Weikang Meng; Yadan Luo; Liangyu Huo; Yingjian Li; Yaowei Wang; Zheng Zhang
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/17
摘要:线性注意力最近作为一种高效的替代方案出现,通过将二次计算复杂度降低到线性来减少基于Softmax的自注意力的计算复杂度。然而,现有的线性注意力机制仍然受到性能下降的影响,主要原因是两个限制:查询和键向量中的负元素由于非负特征图而丢失,以及无法像Softmax注意力那样保持尖峰特性,这削弱了标记的区分能力。为了解决这些问题,我们提出了PolaFormer++,一种增强的极性感知线性注意力机制,具有通道尖锐度(Channel-wise Spikiness)。具体来说,我们首先引入极性感知线性注意力机制,通过极性分解恢复同极性和反极性的交互,保持完整的相似性信息。其次,我们提出了一种极性感知通道尖刺特征图(Polarity-aware Channel-wise Spiky,PaCS),该特征图在双极性流中引入了两个可学习的温度向量,使每个通道具有不同的尖锐度,从而能够实现跨极性流的通道注意力的自适应控制。此外,我们提供了关于通道特征图如何影响注意力权重的熵的第一个理论分析,揭示了特征图保持减少熵行为的条件。在图像分类、目标检测、语义分割、超分辨率成像、基于扩散的生成以及3D新视角合成方面的全面实验表明,PolaFormer++ 实现了效率和精度之间的优越平衡,为视觉Transformer中的线性注意力建立了强大的理论和实践基础。代码可在此 https URL 获取。
原文链接
任意网格动画化AnyMesh++:一种灵活的高保真文本驱动网格动画前馈框架
原标题:AnimateAnyMesh++: A Flexible Feed-Forward Framework for High-Fidelity Text-Driven Mesh Animation
作者:Zijie Wu; Chaohui Yu; Fan Wang; Xiang Bai
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/17
摘要:最近在4D内容生成方面取得了进展,吸引了越来越多的关注,但由于建模时空分布的复杂性和4D训练数据的稀缺性,创建高质量的动画3D模型仍然具有挑战性。我们介绍了AnimateAnyMesh++,这是一个基于文本驱动的任意三维网格动画的前馈框架,在数据、架构和生成能力方面有了重大升级。首先,我们通过从Objaverse-XL挖掘动态内容来扩展DyMesh-XL数据集,使独特身份的数量从60K增加到300K,并显著扩大了类别和运动的多样性。其次,我们将DyMeshVAE-Flex重新设计为具有幂律拓扑感知注意力和顶点法线增强特征,这显著改善了轨迹重建、局部几何保持,并减轻了轨迹粘连伪影。第三,我们在DyMeshVAE-Flex和修正流(RF)生成器的架构中引入了变化,以支持可变长度序列的训练和生成,从而在保持重建保真度的同时实现更长的动画。大量的实验表明,AnimateAnyMesh++能够在几秒钟内生成语义准确且时间连贯的网格动画,在质量和效率上超越了先前的方法。扩大的DyMesh XL,升级的DyMeshVAE-Flex以及可变长度的RF共同在基准测试和野外网格中实现了持续的改进。我们将在此论文被接受后在 https://github.com/JarrentWu1031/AnimateAnyMesh-pp 发布代码、模型以及扩展的 DyMesh XL 以促进4D内容创作的研究。
原文链接
大规模预训练的多模态图像匹配
原标题:Multiple Modalities Image Matching With Large-Scale Pre-Training
作者:Xingyi He; Hao Yu; Sida Peng; Dongli Tan; Zehong Shen; Xiaowei Zhou
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/17
摘要:图像匹配旨在识别图像之间对应像素的位置,在广泛的科学学科中至关重要,有助于图像配准、融合和分析。然而,在处理不同成像模式捕获的图像(导致显著外观变化的情况下),由于跨模态标注训练数据稀缺,基于学习的图像匹配算法的性能经常下降。这一限制阻碍了各种依赖多种图像模态以获取互补信息的应用领域。为了解决这一挑战,我们提出了一种大规模预训练框架,利用合成的跨模态训练信号,融合来自各种来源的多样化数据,以教会模型识别和匹配图像中的基本结构。此能力可以转移到真实世界中未见过的跨模态图像匹配任务。我们的主要发现是,使用我们框架训练的匹配模型在超过八种未见过的跨模态配准任务上有效泛化,使用相同的网络权重,显著优于现有的可泛化方法,并且在若干任务上达到与专用模型相当或更优的表现。
原文链接
M3R++:带遮罩标记混合和双跨模态遮罩的零样本学习
原标题:M3R++: Masked Token Mixup and Dual Cross-Modal Masking for Zero-Shot Learning
作者:Qiangchang Wang; Yuchi Xiao; Rushi Lan; Yilong Yin; Huimin Lu
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/14
摘要:零样本学习(ZSL)旨在通过从已见类别向未见类别转移语义知识来识别新型类别的对象。然而,现有的方法由于缺乏视觉特征和语义属性之间的稳健对应关系,常常将未见过类别的图像误分类为已见过的类别。为了解决这些问题,我们提出了M3R++,一个利用掩码标记混合(masked token mixup)和双跨模态掩蔽(dual cross-modal masking)的新框架,通过建立语义属性和视觉线索之间的强联系来增强零样本学习,从而减少对已见类别的偏见。M3R++框架包含四个关键组件:随机标记混合(RTM),未见类别检测(UCD),双跨模态掩码自编码器(DCM)和多样提示学习(DPL)。首先,RTM 可以通过混合来自不同类别样本的视觉标记并将它们的语义属性结合起来生成合成的未见类别样本,从而扩大未见类别的表示空间。其次,UCD自适应地分配不同的熵值来区分已见类样本和未见类样本,减少分类偏差。第三,DCM可以通过视觉引导和语义属性引导的跨模态掩蔽建立语义属性和视觉知识之间的稳健关系。第四,DPL 引入了分歧损失,以鼓励一组视觉提示之间的多样性,从而提供丰富的视觉线索,以便准确地挖掘语义属性和视觉知识之间的对应关系。广泛的实验表明提出的M3R++模型在四个具有挑战性的数据集上有效且优越。
原文链接
基于锚图的非负张量因子化双聚类
原标题:Non-negative Tensor Factorization Based Bi-Clustering on Anchor Graphs
作者:Quanxue Gao; Rui Wang; Jing Li; Xiaoke Ma; Cheng Deng; Yu Duan
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/14
摘要:非负矩阵分解(NMF)是一种强大的聚类分析技术。将其应用于多视图聚类,现有方法通常独立地应用NMF来获得每个视图的软标签矩阵,然后融合所得到的视图标签矩阵以生成视图一致的标签矩阵。主要的缺点是它们主要集中在决策级融合上,无法有效地利用视图间在数据层面的隐含关系,而这些关系对于多视图聚类至关重要。此外,他们依赖于NMF和K-means之间的关系来推导标签,这具有弱解释性。为了解决这些问题,我们提出了一种基于非负张量分解(NTF)的新型多视图聚类模型,该模型采用多层次融合(both data-level and decision-level),以实现多视图数据的一致性标签。具体来说,我们提出了一种非负张量分解,并利用它从概率可解释的角度将张量化锚图分解为锚指示张量和数据指示张量的乘积,从而增强了所提出的模型的可解释性。大量的实验结果证明了我们方法的有效性。
原文链接
通过时空标记修剪加速SAM2的高效内存注意力模块
原标题:Accelerating SAM2 with Efficient Memory Attention Module via Spatiotemporal Token Pruning
作者:Fachrina Dewi Puspitasari; Chaoning Zhang; Avilasha Mal; Sheng Zheng; Caiyan Qin; Tae-Ho Kim
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/14
摘要:SAM,一种可提示图像分割的基础模型,已被广泛应用于各种应用中。SAM2通过集成一个内存注意力模块将SAM扩展到处理视频基于变压器的模块通过当前帧的表示和内存特征(stored outputs of previous frames)之间的交叉注意力机制传播时间信息。给定记忆特征的广泛长度,注意力机制(with respect to spatial tokens)的二次复杂性随存储帧数线性增加。为了加速推理时间,我们提出了一种时空标记修剪方法,该方法减少了内存标记的序列长度。我们的动机源于两个发现:99%的内存标记中的注意力稀疏性和其余1%标记中的注意力积聚。我们根据视频密集预测任务的两个主要要求制定剪枝策略:边界划分和时间可追踪性。这一原则指导了我们方法的设计,在该设计中,我们利用三个评分函数形成一个参考矩阵来评估记忆令牌的重要性。我们将这些评分函数逐层应用,反映变压器层倾向于传播空间信息或时间信息。我们的方法是一种非重新训练的方法,然而它可以有效地压缩多达87%的内存令牌,在几个基准数据集上加速每帧推理时间1.7倍,同时对原始模型性能造成可忽略的影响。
原文链接
分布外检测的特征改变鲁棒性
原标题:Feature-alteration Robustness for Out-of-distribution Detection
作者:Xue Jiang; Feng Liu; Zhen Fang; Hong Chen; Tongliang Liu; Feng Zheng
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/13
摘要:检测并拒绝分布外(OOD)数据对于增强模型的可靠性以及在部署阶段最小化潜在风险至关重要,例如神经网络。在本文中,我们发现一个训练良好的分布内(ID)模型可以记忆和识别ID模式,即使特征发生改变。网络在修改后的ID特征上仍然保持稳健,而OOD特征则严重扭曲,包含用于OOD检测的显著线索于特征空间中因此,我们引入了一种新颖的方法,特征改变鲁棒性(FAR),旨在通过测量在改变下的特征图鲁棒性来高效检测异常数据样本。具体来说,FAR改变中间层的特征图,然后在几层之后评估前景-背景偏差。我们提供一种理论分析来帮助理解我们的方法FAR。实验结果表明,我们的方法FAR和FAR+ASH在各种基准测试上可以达到最先进的水平。
原文链接
用于高效细粒度图像检索的共享潜在特征锚定哈希码生成
原标题:Shared Latent Characteristic Anchored Hash Codes Generation for Efficient Fine-Grained Image Retrieval
作者:Zhen-Duo Chen; Li-Jun Zhao; Yongxin Wang; Yu-Wei Zhan; Xiao-Qian Liu; Xin Luo
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/13
摘要:基于哈希的细粒度图像检索(FGIR)是大规模领域特定数据检索的一种有前途的解决方案,但它面临着判别特征学习与紧凑二进制码生成之间的基本矛盾。现有方法通常依赖复杂的特征提取模块来提高细粒度区分能力。虽然在长哈希码情况下有效,但由于汉明空间表示的内在局限性,在短码长度下通常会遭受显著的性能下降。为了解决这一关键问题,本文提出了一种新颖的共享潜在特征锚定哈希(CAH)码生成方法。我们的方法直接解决了特征到哈希映射过程中内在的特征矛盾,而不是依赖于越来越复杂的特征提取网络。所提出方法的核心是引入可学习的特征向量(C-vectors),它们被明确地定义为特征空间中的锚点,用于表示语义相似样本共有的潜在特性。在此基础上,设计了一种特征匹配损失和C向量锚定特征精炼机制,用于哈希码生成前的C向量和特征向量优化。此外,为了增强最终哈希码的判别能力,设计了一个跨层语义信息传输模块和一个对象约束多区域增强策略,这在不增加推理时间计算开销的情况下改进了细粒度特征学习。全面的实验表明,我们提出的方法在检索准确率和效率上都显著优于最先进的技术,在基于哈希的FGIR领域建立了新的有前景的方向。
原文链接
重新思考多模态图像超分辨率:跨模态一致性先验的关键作用
原标题:Rethinking Multi-modal Image Super-resolution: The Key Role of Cross-modal Consistency Prior
作者:Jingyi Xu; Xin Deng; Yutong Wang; Lai Jiang; Mai Xu
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/13
摘要:对于多模态图像超分辨率(MISR),探索跨模态一致性至关重要。然而,大多数现有的一致性先验难以保持高频成分,并且无法提供泛化的正则化,常常导致边缘模糊或纹理不准确。在本文中,我们重新审视了先验一致性在MISR任务中的关键作用,并提出一个重要发现:指导图像和目标图像之间的模态差距在拉普拉斯响应上并不符合广泛采用的高斯分布或拉普拉斯分布。相反,它更符合T分布。基于这一洞察,我们提出了一种T分布形成的拉普拉斯响应一致性(TLC)模型。该模型整合了一个基于T分布的多模态一致性(TMC)先验,并且包含一个在引导图像和目标图像之间操作的学习正则化项。此外,我们引入了一个乘性退化(MD)矩阵来建模从高分辨率(HR)到低分辨率(LR)目标图像的退化过程,从而能够实现自适应非均匀退化建模。TLC模型的迭代优化步骤随后被展开成一个可解释的网络,称为TLCNet。注意:此处保持了原文中括号内的内容格式不变。根据要求,这里仅做字面翻译处理,实际上“termed”一词通常用于表示某物被命名为某事物,在此语境下更自然的表达可能是:“被称为”。但为了严格遵循指令,不做额外调整。如需更加符合中文习惯的表述,请告知。不过,按照给定的要求,最终输出形式应如下所示:{TLCNet在三个MISR任务的九个数据集上进行了评估,展示了其相比其他最先进方法更优越的超分辨率性能。中间特征的可视化以及引导图像的因果分析进一步证实了其良好的可解释性。
原文链接
Text2Loc++:从自然语言泛化三维点云定位
原标题:Text2Loc++: Generalizing 3D Point Cloud Localization from Natural Language
作者:Yan Xia; Letian Shi; Yilin Di; João F. Henriques; Daniel Cremers
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/13
摘要:我们解决了使用复杂多样的自然语言描述定位三维点云子地图的问题,并提出了Text2Loc++,一种新颖的神经网络设计用于在粗到细定位流水线中实现语言和点云之间的有效跨模态对齐。为了支持基准测试,我们引入了一个新的城市规模的数据集,涵盖了来自各种城市场景的彩色和非彩色点云,并将位置描述组织成三个层次的语言复杂度。在全球位置识别阶段,Text2Loc++结合了预训练的语言模型和具有最大池化的层次变压器(HTM),用于句子级别的语义,并采用基于注意力的点云编码器进行空间理解。我们进一步提出了遮罩实例训练(MIT),以过滤出未对齐的对象并提高跨模态鲁棒性。为了增强嵌入空间,我们引入了模态感知对比学习(MCL),结合了跨模态、子图级、文本级和实例级损失。在精细定位阶段,我们完全移除显式文本实例匹配,并设计了一个基于原型映射克隆(Prototype-based Map Cloning PMC)和级联交叉注意力变换器(Cascaded Cross-Attention Transformer CCAT)的轻量级且强大的框架。在KITTI360Pose数据集上的广泛实验表明,Text2Loc++优于现有方法最多可达15%。此外,所提出的模型在新的数据集上评估时表现出强大的泛化能力,有效地处理了复杂的语言表达和各种各样的城市环境。
原文链接
FINER++:构建用于激活隐式神经表示的一系列可变周期函数
原标题:FINER++: Building a Family of Variable-periodic Functions for Activating Implicit Neural Representation
作者:Hao Zhu; Zhen Liu; Qi Zhang; Jingde Fu; Weibing Deng; Zhan Ma
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/12
摘要:隐式神经表示(INR),利用神经网络将坐标输入映射到相应属性,在信号处理领域引发了一场革命。然而,当前的INR技术存在“频率”指定的频谱偏差和容量收敛差距,导致在表示具有多个“频率”的复杂信号时性能不完善。我们发现这两个特征都可以通过增加当前激活函数中定义域的利用率来处理,为此我们提出了FINER++框架,通过将现有的周期性/非周期性激活函数扩展为可变周期性的。通过用不同的范围初始化神经网络的偏置,选择变量周期函数中的不同频率的子函数进行激活。因此,支持的频率集可以灵活调整,从而改善信号表示性能。我们展示了FINER++在不同激活函数骨干网络上的泛化能力和功能(Sine,Gauss。并涉及小波变换),以及各种任务(二维图像拟合,三维带符号距离场表示,五维神经辐射场优化和可流式传输的INR传输),我们展示了它改进了现有的INR。
原文链接
通过解释掉变分自编码器解决视觉推理中的不确定性表示问题
原标题:Remedying uncertainty representations in visual inference through Explaining-Away Variational Autoencoders
作者:Josefina Catoni; Domonkos Martos; Ferenc Csikor; Enzo Ferrante; Diego H. Milone; Balázs Meszéna
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/12
摘要:在不确定性下进行最优计算需要一个适当的概率表示来描述信念(O)。深度生成模型,特别是变分自编码器(VAEs),有能力通过构建潜在表示来满足这一需求,这些表示能够学会将不确定性与推断相关联,同时避免其特征性的难以计算的问题。然而,我们表明正是不确定性表示在一系列相关的计算机视觉条件下存在不一致:对比度依赖计算,图像损坏,分布外检测。借鉴经典计算机视觉,我们通过引入一个全局尺度潜在变量来提出标准变分自编码器(VAE)的一种原则性扩展,该变量施加了一种简单而强大的归纳偏置,我们将这种模型称为消解之因变分自编码器(EA-VAE)。通过将EA-VAEs应用于一系列计算机视觉领域和各种数据集(从标准NIST数据集到丰富的医学和自然图像集),我们展示了EA-VAE恢复了不确定性规范要求。此外,我们提供了对引入的缩放潜在变量在对比相关和分布外相关的不确定性调制方面贡献的分析基础,证明了这种轻微的归纳偏置在一个广泛的问题集中具有显著的好处。此外,我们发现EA-VAE采用除法归一化,这是一种在生物神经网络中广泛存在的模式,以纠正缺陷推理。我们的结果表明,对VAE架构进行的易于实现但仍强大的更新可以纠正概率计算中不确定性推理的缺陷。
原文链接
ROBIN++:通过双域协同水印实现扩散模型的统一版权保护和篡改定位
原标题:ROBIN++: Unified Copyright Protection and Tamper Localization for Diffusion Models Via Dual-Domain Synergistic Watermarking
作者:Huayang Huang; Siqi Zeng; Qian Wang; Bo Du; Yu Wu
期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence
出版时间:2026/08/12
摘要:数字水印为验证生成内容的来源和完整性提供了有希望的解决方案。然而,现有方法常常由于单一领域内冲突信号的纠缠而在版权鲁棒性和定位敏感性之间存在固有的权衡。在本文中,我们提出了ROBIN++,一种从单一领域纠缠转向双域协同设计的范式。我们的关键见解是在注入过程中明确地将鲁棒性和脆弱性解耦,并分别分配给不同的域,而在验证过程中重新耦合它们以相互强化。具体而言,我们引入了一种对抗优化算法,在生成过程中注入频域版权水印,最大化提取鲁棒性而不产生视觉伪影。互补地,一个Content-Aware Perturbation生成器被整合到潜在空间中,注入空间域定位水印,确保对空间篡改的敏感性,并且对版权水印的干扰最小。在验证过程中,我们提出了一种双分支协同检测器,该检测器促进了频域到空域的协同作用,在这种作用中,稳健的光谱先验作为全局锚点用于局部异常检测。相反,采用了一种空间到频率的精炼策略,利用预测的篡改掩码修正受损的潜在特征。大量的实验表明,ROBIN++在版权恢复和篡改定位精度方面均显著优于现有方法,有效地缓解了这两项任务之间的长期权衡。代码可在https://github.com/Hannah1102/ROBIN获得。
原文链接

