大数跨境

International Journal of Computer Vision-2026年7月最新论文20篇

International Journal of Computer Vision-2026年7月最新论文20篇 AI新文
2026-08-13
2

由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。

渐进动态神经场景图带频率调制基础模型的城市场景(ProSGNeRF)

原标题:ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

作者:Tianchen Deng;Yanbo Wang;Weidong Chen

期刊:International Journal of Computer Vision

出版时间:2026/07/26

摘要:隐式神经表示在各种场景中的三维重建中展示了有前景的结果。然而,现有方法要么难以建模快速移动的对象,要么无法处理城市环境中大规模的摄像机自身运动。这导致了大规模城市场景的低质量合成视图。本文旨在共同解决大规模场景和快速移动车辆引起的问题,这些问题更具实际性和挑战性。为此,我们提出了一种渐进式场景图网络架构来学习动态对象的局部场景表示以及全局城市场景。渐进学习架构动态分配一个新的局部场景图,在一个自动确定大小的时间窗口内的帧上进行训练,使我们能够扩展表示以适应大规模场景。此外,根据我们的观察,快速移动的对象仅在少数帧中被观察到,这导致动态对象的重建精度显著下降。因此,我们引入了一种基于基础的物体表示方法,该方法提取了以物体为中心的视觉先验,并在归一化的物体坐标中对密度和颜色解码器进行条件设定。我们进一步提出了一种频率渐进正则化策略,在训练过程中逐渐暴露高频位置、方向和姿态编码,减少对稀疏物体观测的过拟合。实验结果表明,我们的方法在各种场景中实现了最先进的视图合成精度、物体操作能力和场景漫游能力。代码将在https://github.com/dtc111111/prosgnerf上开源。


原文链接



高效的动态查询动作计数

原标题:Efficient Action Counting with Dynamic Queries

作者:Xiaoxuan Ma;Zishi Li;Yizhou Wang

期刊:International Journal of Computer Vision

出版时间:2026/07/25

摘要:大多数现有方法依赖于相似性相关矩阵来表征动作的重复性,但它们由于二次计算复杂度而受限于可扩展性。在这项工作中,我们引入了一种新颖的方法,该方法采用动作查询表示来定位类别不可知的重复动作周期,并且具有线性计算复杂度。基于此表示方法,我们开发了两个关键组件来应对时间重复计数的基本挑战。首先,为了应对开放集动作计数问题,我们定义了两类动作:“重复动作”和其他。不再手动定义重复的动作类,我们提出了一种动态动作查询策略。这里,每个动作查询直接代表一个提取的视频特征,允许根据视频内容本身动态定义感兴趣的重复动作。其次,为了区分这些重复的动作查询与其他查询,我们提出跨查询对比学习。这在查询上执行对比聚类,将相似的动作模式聚集在一起,同时将与背景或无关动作相关的模式分开。因此,被分类为“重复动作”的查询被视为重复周期,然后用于计数。得益于基于查询的表示和对比学习策略,我们的方法在准确性上显著优于以往的工作,同时更加轻量级且时间效率更高。在具有挑战性的RepCountA基准上,我们在OBO准确率方面超越了最先进的方法TransRAC 26.5%,平均误差减少了22.7%,计算负担降低了94.1%。代码和模型在项目页面上公开可用。


原文链接



基于几何-反射域偏移建模的鲁棒性激光雷达分割算法在恶劣天气下的应用

原标题:Explicit Geometry-Reflectance Domain Shift Modeling for Robust LiDAR Segmentation in Adverse Weather

作者:Longyu Yang;Shangbo Yuan;Ping Hu

期刊:International Journal of Computer Vision

出版时间:2026/07/24

摘要:由于几何结构和反射强度的模态依赖的域偏移,激光雷达语义分割在恶劣天气下严重退化。以往的工作常常依赖于天气模拟或通用增强,并将几何形状和反射率视为统一信号,忽略了它们各自不同的退化机制。我们提出了一种显式几何-反射域偏移建模框架,在领域泛化(DG)和无监督领域适应(UDA)下实现鲁棒的激光雷达分割。在模型层面,我们引入了几何-反射协作网络(GRCNet),该网络分别编码几何和反射,并通过鲁棒的多层次特征协作融合它们,在抑制天气引起的损坏的同时保持互补语义。当有未标记的目标数据可用时,我们通过一种新颖的目标驱动领域增强(TDDA)策略在数据层面扩展了相同的分解方法,该策略明确地建模并转移目标领域的反射率统计和几何退化变化,而无需复杂的物理模拟。多项基准测试的广泛实验表明,在数据生成(DG)和无标注数据利用(UDA)设置下,均优于现有最先进的方法。代码可在https://github.com/momoyo126/GRCNet.git获取。


原文链接



基于超图及地图相似度测度的多模态场景表示用于图像定位

原标题:Multimodal Scene Representation using Hypergraph & Map Similarity Measure for Image Localization

作者:Preeti Meena;Himanshu Kumar;Seep Yadav

期刊:International Journal of Computer Vision

出版时间:2026/07/23

摘要:有效的场景表示需要全面理解场景的结构,包括多模态结构。这样的表示可以用于室内定位等应用,在这些应用中,仅凭视觉特征不足以充分捕捉场景的结构。虽然图可以定义场景中显著区域之间的关系来编码场景的局部结构,但是它们仅限于成对的关系。相比之下,超图可以有效捕获全局结构,例如区域之间的高层次关系,并因此促进多模态特征融合。不同于现有的使用k一致超图的多模态场景表示方法,我们通过一个多模态超图来表示多模态场景,该超图编码了不同层次的场景特征,并捕获场景的整体结构。视觉、几何和文本模态定义了全景3D场景中超边(交互关系和内部关系)之间的联系(即,显著对象和文本)。此外,我们提出了一种子超图推理算法,该算法在全局和局部特征级别测量超图之间的相似性,以便在室内环境中定位全景图像。实验结果证明了所提出的多模态场景表示在室内定位任务中的有效性。


原文链接



基于音乐驱动的三维舞蹈生成的内容节奏感知对比学习

原标题:Content-Rhythm Awareness Contrastive Learning for Music-Driven 3D Dance Generation

作者:Xin Guo;Yifan Zhao;Jia Li

期刊:International Journal of Computer Vision

出版时间:2026/07/23

摘要:基于音乐生成令人满意的舞蹈动作仍然是一个极其困难的挑战,这是因为这两种模态之间的复杂关系。传统的端到端训练机制依赖于使用GAN或VAE机制的准确舞蹈解码器,破坏了音乐和舞蹈之间的隐含关联性。不同于流行的方法,在本文中,我们尝试利用对比预训练来探索两个关键线索(content and rhythm),以建模这种多模态关系。在我们的方法中,我们首先分离双模态的风格和内容特征以防止针对特定风格的一对一生成映射。为了提取节奏线索,我们借鉴了音乐节拍和舞蹈动作,并采用内容-节奏相关性作为跨模态对比学习的桥梁。尽管零样本预测在我们的方法中实现了更优的多模态相关性,预测出的舞蹈动作仍然是片段。为了解决这个问题,我们提出了一种音乐感知的动作协调模块,用于动态融合对应于其身体动作的多个片段。通过多模态对比学习框架和音乐感知运动协调模块的合作,大量的实验表明我们提出的方法在主观和客观研究中都优于最先进的舞蹈生成方法。


原文链接



联邦学习遇见测试时间适应:方法、挑战及未来方向

原标题:Federated Learning Meets Test-Time Adaptation: Methods, Challenges, and Future Directions

作者:Chen Zhang;Ge Su;Hongxia Xu

期刊:International Journal of Computer Vision

出版时间:2026/07/23

摘要:机器学习通常假设训练和测试数据集中存储并且遵循相同的分布。然而,在实际场景中,严格的隐私法规要求数据分散存储于异构设备和组织之间,导致显著的分布变化。为了应对这些挑战,联邦测试时间适应(FedTTA)集成了联邦学习(FL)的全球协作与测试时间适应(TTA)的动态适应性,实现了隐私感知型协作,能够持续适应未见数据分布。尽管兴趣日益增长且取得了显著进步,当前的研究仍然支离破碎,并缺乏一个连贯的概念基础和统一的分类法来巩固新兴进展。本文提供了对FedTTA的全面综述,形式化其问题设定,并建立了一个统一的分类体系,涵盖三种范式:i) 联邦初始化和测试微调,其中全局模型作为局部细化的稳健先验;ii) 联邦共享骨干和测试个性化适应,其中特征提取与轻量级本地适配器解耦;iii) 联邦和测试时间协作优化,其中建立了闭合反馈回路以实现全局和局部模型的持续共进化。此外,我们总结了代表性的数据集和应用。最后,我们指出开放性挑战并讨论未来研究的前景方向。通过提供统一的视角和结构化的见解,本调查旨在推进FedTTA的理论和实践理解,引领下一代自适应、隐私感知的联邦系统的开发。


原文链接



自适应差分隐私噪声注入用于视觉识别任务的去中心化联邦学习

原标题:Adaptive Differential Privacy Noise Injection for Decentralized Federated Learning of Visual Recognition Tasks

作者:Junyan Ouyang;Siqi Du;Lydia Y. Chen

期刊:International Journal of Computer Vision

出版时间:2026/07/22

摘要:随着边缘侧视觉识别应用中物联网(IoT)数据量的增长,对等去中心化联邦学习(DFL)已作为一种有吸引力的模型训练范式浮现出来。与集中式FL不同,在集中式FL中一个服务器聚合每轮客户端更新,DFL客户端直接交换稀疏化模型参数(only a subset is transmitted each round)。交换的参数嵌入了累积的训练历史而不是独立的轮次更新。这为隐私保护带来了基本的困境:在差分隐私(DP)中,为了防止历史信息泄露,现有方法被迫仅更新当前正在交换并受DP噪声保护的参数的小部分(例如,10%),而将大多数参数冻结,从而严重降低了准确性。在本文中,我们提出DecentDP,一种解决这一困境的方法,以提高模型准确性。DecentDP 的两个关键模块是:(i) 一个参数选择器,它指定一组仅进行本地更新的参数子集,允许它们在没有差分隐私噪声的情况下被更新;(ii) 一个噪声注入器,它可以自适应地向对差分隐私噪声更敏感的可交换参数添加较少的差分隐私噪声。五个场景中的实验表明,DecentDP优于11个基准方法,平均准确率提高了15.68%,仅增加了0.70%的计算开销和0.60%的通信开销。


原文链接



视觉几何协作引导用于功能学习

原标题:Visual-Geometric Collaborative Guidance for Affordance Learning

作者:Hongchen Luo;Wei Zhai;Zheng-Jun Zha

期刊:International Journal of Computer Vision

出版时间:2026/07/22

摘要:通过建模人体部位之间以及局部物体区域之间的接触关系,可以揭示潜在的人与物交互线索,从而减轻由于可能动作的模糊性所导致的功能学习不确定性。然而,现有方法通常遵循“接触区域分割-传输”范式,仅依赖于外观级别的映射,忽视了人与物体交互的语义和几何一致性。因此,在面对物体的重大变化或身体各部位间多样化的协作关系时,模型的感知和预测能力会下降。为此,我们提出了一种视觉几何协作引导可及性学习网络,该网络共同利用视觉和几何线索来建模人类与物体交互中的复杂关系以及接触特征表示。特别设计了一个语义姿态启发式感知模块,利用语义和几何线索引导网络聚焦于相关的交互区域,在各种交互场景下提高接触区域的感知能力。同时,引入了一个几何表观对齐传输模块,联合对齐表观和结构相似的局部区域,消除了由于类内对应模糊带来的传输困难。此外,我们构建了一个更大且更具多样性的接触与对象部件功能数据集,包含55,047张图像,覆盖了61个物体类别和35种功能类型,使模型的感知和预测能力能够在复杂的交互场景中得到更全面的评估。实验结果表明,我们的方法在客观指标和视觉质量方面优于代表性模型。项目:github.com/lhc1224/VCR-Net.


原文链接



时空预测预训练在机器人电机控制中的应用

原标题:Spatiotemporal Predictive Pre-training for Robotic Motor Control

作者:Jiange Yang;Bei Liu;Limin Wang

期刊:International Journal of Computer Vision

出版时间:2026/07/20

摘要:机器人电机控制需要预测与环境和物体交互的动力学的能力。然而,现有的利用大规模第一人称视频进行自监督预训练的视觉表征,在机器人电机控制中往往仅专注于学习静态内容特征。因此它忽略了人类视频中的关键运动线索,这些线索包含了关于与环境和物体互动的关键知识。本文提出了一种简单而有效的视觉预训练框架,称为STP,用于机器人运动控制,该框架通过利用大规模第一人称视频数据同时进行空间和时间预测,并采用不同的掩码比率和双解码器设计。具体来说,给定视频片段中的成对帧,我们首先采用一个空间解码器对遮罩的当前帧执行空间预测,以学习内容特征。其次,我们采用一个单独的时间解码器进行时间预测,条件是遮蔽的当前帧和一个极度被遮蔽的未来帧,以捕捉运动特征。这种不对称掩蔽和解耦解码设计通过明确确保所学图像表示更加关注运动信息的同时仍然捕获空间细节使我们的STP区别于传统的图像或视频掩蔽自动编码器由于其轻量级的临时解码器和高度屏蔽的未来帧,STP 相对于标准图像MAE产生的额外训练开销是可以管理的。广泛的模拟和真实世界实验展示了STP的有效性和泛化能力,特别是在泛化到具有更多干扰物的未见环境方面。此外,我们将该框架通过训练后扩展以及混合预训练来展示STP的通用性和数据效率。源代码和模型将在https://github.com/MCG-NJU/STP上提供。


原文链接



超越可见线索:基于双线索推理的隐式视频问答

原标题:Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning

作者:Tieyuan Chen;Huabin Liu;Weiyao Lin

期刊:International Journal of Computer Vision

出版时间:2026/07/19

摘要:视频问答(VideoQA)旨在根据给定的视频回答自然语言问题,先前的工作主要集中在识别相关的片段持续时间,即所谓的显式视觉证据。然而,明确的视觉证据并不总是可以直接获得的,特别是在问题针对象征意义或更深层次意图时,导致性能显著下降。为了填补这一空白,我们引入了一个新的任务和数据集,隐式视频问答(I-VQA),该任务专注于在无法获得明确视觉证据的场景中回答问题。给定一个隐含问题及其对应的视频,I-VQA 需要基于视频中存在的上下文视觉线索作答。为了解决I-VQA问题,我们提出了一种新的推理框架,IRM(Implicit Reasoning Model),该框架结合了对上下文动作和意图线索进行双流建模作为隐式推理链。信息检索模块包含行动意图模块(AIM)和视觉增强模块(VEM)。目标是通过生成线索候选者并执行关系推断来推导和保存问题相关的双重线索。VEM通过利用关键上下文线索增强情境视觉表示。广泛的实验验证了我们的IRM在I-VQA任务中的有效性,分别优于GPT-4o、OpenAI-o3和微调后的VideoChat2百分之零点七六、百分之一点三七和百分之四点八七。此外,IRM 在交通-VQA 中对类似隐式广告理解和未来预测也达到了最先进水平。数据集和代码可在仓库中获取:https://github.com/tychen-SJTU/Implicit-VideoQA.


原文链接



频域单图生成纹理三维物体:从理论到流程

原标题:Single Image to Textured 3D Object Generation in Frequency Domain: From Theory to Pipeline

作者:Qisen Wang;Yifan Zhao;Jia Li

期刊:International Journal of Computer Vision

出版时间:2026/07/19

摘要:单视图三维重建,也称为图像到三维(image-to-3D),由于信息极度匮乏,一直是一项极具挑战性的任务。最近,预先在大规模数据集上训练的扩散模型作为二维先验被用来解决不适定任务,但存在颜色偏差和视角不一致的问题,这些问题可以通过使用基于三维标注数据微调的扩散模型作为三维先验来缓解。然而,3D先验缺乏高频细节,这不能通过直接在空间域中用2D先验进行补充来解决,因为后者会引入错误的低频2D先验指导。在本文中,我们从频率角度重新审视了不同扩散先验的特征。基于我们的观察,我们理论性地提出了一个使用频率域中多个扩散先验的混合优化统一框架。在此框架下,我们进一步提出了Morpheus3D,一个从任意单张无姿态图像生成三维物体的流水线。Morpheus3D通过高通滤波的图像提示二维先验指导增强三维先验,重建高质量的三维对象,同时有效抑制视图不一致、低频色彩偏差和高频细节缺失问题。在公共数据集和我们收集的具有复杂纹理的数据集上进行的定量和定性实验表明,我们的方法在生成质量方面表现出显著改进。


原文链接



EMO-LLaMA:通过指令调优增强面部情绪理解

原标题:EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning

作者:Bohao Xing;Zitong Yu;Heikki Kälviäinen

期刊:International Journal of Computer Vision

出版时间:2026/07/15

摘要:面部表情识别(FER)已成为近年来一个重要的研究课题。然而,当前的情感识别范式面临着泛化的挑战,在自然语言对齐的语义信息方面存在不足,并且难以在统一框架下处理图像和视频。多模态大型语言模型(MLLMs)最近取得了成功,提供了处理这些问题的优势,并且有可能克服当前面部表情识别(FER)范式的局限性。然而,由于缺乏指令数据集以及视觉编码器无法提取细粒度的面部信息,直接将预训练的MLLMs应用于FER仍然具有挑战性。我们对现有开源多模态大型语言模型在FER上的零样本评估发现,其性能与GPT-4V和最先进的监督方法相比存在显著差距。在本文中,我们旨在增强MLLMs理解面部表情的能力。我们首先介绍了一个面部表情识别指令数据集(FERID),该数据集包含376k类别指令和339k对话指令。然后我们提出了一种新颖的MLLM,名为EMO-LLaMA,它融合了来自预训练面部分析网络的面部先验知识,以增强其对人类面部信息的理解。具体而言,我们设计了一个Face Info Mining模块来提取人脸的全局和局部信息。此外,我们利用一个手工制作的提示来引入年龄-性别-种族属性,考虑到不同人类群体之间的情绪差异。大量的实验表明,EMO-LLaMA 在静态和动态面部表情识别数据集上均取得了与最先进水平相当或具有竞争力的结果。指令数据集和代码将在https://github.com/xxtars/EMO-LLaMA.上提供


原文链接



欺骗检测遇愿景语言模型

原标题:Deception Detection Meets Vision-Language Models

作者:Dongliang Zhu;Ruimin Hu;Mang Ye

期刊:International Journal of Computer Vision

出版时间:2026/07/14

摘要:预训练的视觉-语言模型如CLIP最近在各种下游任务中表现出色,包括图像分类和视频理解。然而,在高级视觉任务如自动化欺骗检测(ADD)中,标签与视觉内容之间的语义关联很弱,并缺乏明确的文本描述。因此,此类模型在自动化欺骗检测中的适用性仍然不确定。为了解决这个问题,本文将预训练的CLIP模型应用于自动化欺骗检测,并提出了一种新的ADD-CLIP模型。受心理学研究结果的启发,我们将欺骗行为领域的知识注入CLIP模型。具体而言,ADD-CLIP 包含一个视觉部分和一个文本部分。在视觉部分,我们在CLIP的图像编码器中介绍了两种提示学习策略:时间提示学习和微差异提示学习。这些策略通过可学习的网络层来捕获面部的时间动态和细微运动特征。在文本部分,我们没有使用传统的类别标签作为文本模态输入,而是借助大型语言模型如ChatGPT从面部和AU(动作单元)两个角度构建了面部行为差异的文本描述作为文本监督。此外,我们在面部级别和动作单元级别分别增加了可学习的双提示,对应于行为描述(分别)。这种设计使得模型能够自动学习互补的语义空间,从而导致更准确的决策边界。大量的实验结果表明,ADD-CLIP 在 DOLOS、Bag-of-Lies 和 MU3D 数据集上取得了优异的表现,验证了其有效性。代码可在https://github.com/zdl12345678/Deception-Detection-Meets-Vision-Language-Models获取。


原文链接



[LLM_ERROR] 500 Server Error: Internal Server Error for url: http://192.168.1.106:11434/api/chat

原标题:GradAlign: Detecting Out-of-Distribution Samples via Gradient Concentration

作者:Jiawei Gu;Yanpeng Sun;Zechao Li

期刊:International Journal of Computer Vision

出版时间:2026/07/14

摘要:实际部署要求神经网络在开放环境中运行,在这种环境下测试输入与训练数据不同,然而模型却自信地对从未见过的分布外(OOD)样本进行错误分类。我们发现原因在于:OOD样本表现出集中梯度结构,在单一方向上的能量超过70%,而分布内的样本保持分散的梯度,浓度低于40%。这种梯度浓度原则揭示了异常数据输入激活了虚假捷径从而主导预测结果,而正常数据样本则利用多样化的语义特征。我们通过预测Fisher信息矩阵的谱分析对此进行了形式化表述,证明集中性源于对单一特征的依赖。基于这一洞察,我们开发了GradAlign,它识别并移除导致过度自信的主导梯度方向。利用高效的幂迭代和线性外插法,我们的方法仅增加了11%的计算开销。实验表明GradAlign达到了最先进的成果,在每秒处理30,000张图像的情况下,降低了48%的假阳性率。这项工作提供了第一个关于异常检测失败的几何解释,并展示了理论理解如何使实际解决方案成为可能。


原文链接



对比性均学生教师用于鲁棒低光图像增强

原标题:Contrastive Mean Teacher for Robust Low-Light Image Enhancement

作者:Zhangkai Ni;Menglin Han;Sam Kwong

期刊:International Journal of Computer Vision

出版时间:2026/07/13

摘要:在低光条件下捕获的图像常常遭受复杂的退化,包括曝光不足、噪声和对比度低,给视觉增强带来了重大挑战。现有的低光增强方法(无论是完全监督的还是无配对/自监督的),都有各自的优势和局限性。监督方法有效地抑制噪声并保持细节,但由于严重依赖配对训练数据而存在泛化能力有限的问题,这些数据获取成本高且通常仅限于特定场景。相比之下,未配对或自监督方法利用现成的未配对数据,在捕捉全局光照和颜色分布方面表现出更好的适应性和泛化能力。然而,由于缺乏真实参考,它们通常在精确的颜色保真度和细节恢复方面存在困难。在本研究中,我们提出了一种统一的Mean Teacher框架,该框架逐步整合来自配对数据和未配对数据的互补知识,以实现增强照明和色彩还原,并且抑制噪声。具体而言,我们的方法在数据和损失层面都丰富了学习:通过CutMix在配对和未配对领域之间扩充训练数据,并引入了一种基于风险理论的对比学习策略,从混合数据区域中提取丰富的监督信号。在配对(in-domain)和非配对(cross-domain)测试集上的大量实验表明,我们的方法显著优于基线模型和最先进技术。代码,预训练权重和数据集可在https://github.com/eezkni/CMT获得。


原文链接



MaTe3D: 带遮罩的基于文本的三维感知肖像编辑

原标题:MaTe3D: Mask-Guided Text-based 3D-Aware Portrait Editing

作者:Kangneng Zhou;Daiheng Gao;Ming-Ming Cheng

期刊:International Journal of Computer Vision

出版时间:2026/07/12

摘要:三维感知肖像编辑在多个领域具有广泛的应用。然而,当前的方法由于只能执行基于遮罩的或基于文本的编辑而受到限制。即使将两种程序融合到一个模型中,也无法保证编辑质量和稳定性。为了应对这一限制,我们提出MaTe3D:基于掩码的文本引导三维感知肖像编辑在这个框架中,首先,我们介绍了一种新的基于SDF的3D生成器,该生成器利用提出的SDF和密度一致性损失学习局部和全局表示。这增强了局部区域的基于掩膜的编辑;其次,我们提出了一种新的蒸馏策略:几何和纹理上的条件蒸馏(CDGT)。与现有的蒸馏策略相比,它减轻了视觉模糊性,并避免了纹理与几何结构之间的不匹配,从而在编辑过程中产生稳定的纹理和令人信服的几何结构。此外,我们创建了CatMask-HQ数据集,这是一个大规模的高分辨率猫面部标注数据集,用于探索模型泛化和扩展。我们对FFHQ和CatMask-HQ数据集都进行了昂贵的实验以展示所提出方法的编辑质量和稳定性。我们的方法基于修改后的蒙版和文本提示忠实生成一张具有3D感知的编辑后人脸图像。我们的代码和模型将在https://github.com/MontaEllis/MaTe3D公开。


原文链接



面向无源域自适应语义分割的稳定方法

原标题:Towards Stable Source-Free Domain Adaptive Semantic Segmentation

作者:Dong Zhao;Qi Zang;Zhun Zhong

期刊:International Journal of Computer Vision

出版时间:2026/07/11

摘要:我们关注语义分割中的无源领域自适应(SFDA),其目标是在不访问源数据的情况下,将源训练模型适配到目标领域。自训练与教师-学生框架是一种常见的解决方案,但常常由于嘈杂的伪标签导致错误累积,从而造成较差的适应性和不稳定的训练。我们分析了这一问题,并得出了两个关键观察结果:(I) 稳定性高的样本始终能获得高精度,而不稳定的样本是主要的误差来源;(II) 稳定的自训练需要教师随着时间的推移纳入改进后的学生。受到这些见解的启发,我们提出了一种新颖的稳定自训练(Stable-ST)框架,该框架包括通过双层邻居引导学习来纠正伪标签的稳定邻域去噪(SND),以及一种增强的动态教师更新+(DTU+)机制,利用新的反馈指标,邻域特征密度(NFD),以确保可靠的教师更新。此外,我们提供了SND的理论收敛性分析,为其稳定性提供了正式依据。广泛的实验表明,Stable-ST 在各种源域目标域适应设置中取得了最先进的结果,包括传统的和连续的城市适应,以及医学和遥感场景。源代码可在https://github.com/DZhaoXd/Stable-ST获取。


原文链接



利用合成数据扩大森林视野

原标题:Scaling Up Forest Vision with Synthetic Data

作者:Yihang She;Andrew Blake;Srinivasan Keshav

期刊:International Journal of Computer Vision

出版时间:2026/07/11

摘要:准确的树木分割是从森林激光扫描中提取单个树木指标的关键步骤,并且对于理解碳循环及生态系统功能至关重要。在过去十年中,由于人工智能的发展,树木分割算法取得了迅速的进步。然而,现有的公共3D森林数据集不够大,不足以建立稳健的树木分割系统。受其他领域(如自动驾驶)中合成数据成功的启发,我们调查了类似的方法是否可以帮助树木分割。代替昂贵的实地数据收集和标注,我们在预训练中使用合成数据,然后只需要少量的真实森林图样标注进行微调。我们开发了剑桥树冠建模全景三维(CAMP3D),一个新的合成数据生成管道,用于森林视觉任务,整合了游戏引擎的进步与基于物理的激光雷达模拟。使用CAMP3D,我们生成了一个全面的、多样化的、标注完整的3D森林数据集,其规模前所未有。广泛的实验表明,使用最先进的树分割算法和一个流行的实证数据集,我们的合成数据可以大幅减少对标注的实证数据的需求。在仅对不到0.1公顷的单个真实森林地块进行微调后,预训练模型实现了与基于全部规模的真实数据训练的模型相媲美的分割效果。我们还确定了合成数据成功应用的关键因素:物理特性、多样性以及规模,为未来更强大的三维森林视觉系统铺平了道路。我们的CAMP3D流水线和由此产生的数据集可在https://github.com/yihshe/CAMP3D.git获取。


原文链接



基于生物蓄水池计算的神经启发视觉模式识别

原标题:Neuro-Inspired Visual Pattern Recognition via Biological Reservoir Computing

作者:Luca Ciampi;Ludovico Iannello;Giuseppe Amato

期刊:International Journal of Computer Vision

出版时间:2026/07/09

摘要:本文中,我们提出了一种神经启发的方法来实现液滴计算(RC),其中由体外培养的大脑皮层神经元组成的网络充当物理液滴。与其依赖人工递归模型来近似神经动力学,我们的生物蓄水池计算(BRC)系统利用活神经回路的自发和刺激诱发活动作为其计算基础。高密度多电极阵列(HD-MEA)提供了数百个通道的同步刺激和读取:输入模式通过选定的电极传递,而其余的电极捕获由此产生的高维神经反应,从而产生基于生物学的基础特征表示。线性读出层(single-layer perceptron)然后被训练来分类这些库状态,使活神经网络能够在计算机视觉框架内执行静态视觉模式识别任务。我们通过一系列难度逐渐增加的任务来评估该系统,任务范围从点刺激到定向条纹,钟面数字形状,以及来自MNIST数据集的手写数字。尽管由于噪声、自发活动以及跨会话差异等原因,生物神经反应存在内在变异性,该系统仍然能够生成支持准确分类的高维表示。这些结果表明,在体外皮层网络可以作为静态视觉模式识别的有效水库,为将活神经组织整合到神经形态计算框架中开辟了新的途径。更广泛地说,这项工作有助于将生物学原理融入机器学习,并通过展示生物神经系统的运作如何指导高效且基于生物学的计算模型的设计来支持神经启发视觉的目标。


原文链接



IPDiff: 基于信息重建和多先验引导的ORSI显著物体检测

原标题:IPDiff: Diffusion-driven ORSI Salient Object Detection with Information Reconstruction and Multi-Prior Guidance

作者:Gongyang Li;Zhen Bai;Xiao-Ping Zhang

期刊:International Journal of Computer Vision

出版时间:2026/07/09

摘要:现有的光学遥感图像显著目标检测(ORSI-SOD)方法主要采用静态推理策略,在测试阶段使用固定训练的模型参数进行显著性推断。这意味着即使生成的显著图存在错误,也无法进一步优化。在本文中,我们提出了一种新颖的方法IPDiff,这是一种具有信息重建和多先验引导的扩散驱动ORSI-SOD方法。我们基于一种独特的动态优化策略构建了IPDiff,该策略赋予IPDiff迭代优化具有动态参数的显著图的能力。具体来说,我们将ORSI-SOD作为IPDiff中的条件扩散问题进行建模。IPDiff首先从ORSIs中提取信息性的条件先验,在先验网络中借助信息重建驱动的注意力模块的帮助,包括显著性先验和层次化先验。显著性先验可以提供显著对象的位置信息,而层次化先验可以提供显著对象的具体细节和语义信息。在这些先验的指导下,IPDiff 然后迭代地去除随机噪声,随着去噪网络的时间步长动态变化,生成接近真实情况的显著性图。值得注意的是,我们通过一个混合损失函数在空间域和光谱域同时监督IPDiff,从而实现高效的网络训练。在公共ORSSD、EORSSD和ORSI-4199数据集上的全面实验表明,我们提出的IPDiff方法优于46种最先进的方法。我们的方法的代码和结果可在https://github.com/MathLee/IPDiff获得。


原文链接



【声明】内容源于网络
0
0
AI新文
AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
内容 257
粉丝 0
AI新文 AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
总阅读4.4k
粉丝0
内容257