大数跨境

Information Fusion-2026年8月最新论文17篇

Information Fusion-2026年8月最新论文17篇 AI新文
2026-08-26
2

由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。

可共享且具有区分性的多视图几何自适应融合网络用于三维牙科模型分割

原标题:Sharable and discriminative multi-view geometry-adaptive fusion network for 3D dental model segmentation

作者:Yue Zhao;Xinning Chen;Kehan Li;Yifan Lin;Yang Liu;Fan Wang

期刊:Information Fusion

出版时间:2026/08/01

摘要:准确的三维牙科模型分割对于数字牙科治疗至关重要,因为它提供了宝贵的临床参考。现有方法在异质特征融合过程中无法自适应地评估不同几何属性的重要性或贡献,这阻碍了端到端分割的准确性。本文中,我们率先将三维牙科模型的几何属性描述为视图。提出了一种多视图几何自适应融合网络(MGAFNet),通过探索独特和可共享的特征来动态寻求视图的最佳组合,用于细粒度的三维牙科模型分割。具体而言,在提取独特特征的过程中,我们设计了感知几何增强模块(GAE),以提高牙齿拓扑变化的学习。之后,开发了一个多变量可共享交叉交互模块(SCIM),以促进信息流动,并捕获视图之间的可共享特征。随后,实现了多变量自适应表示融合模块(MARF),通过构建不同特征源的区分性和共享性特征的权重矩阵来自适应地平衡视图的重要性或贡献。与八种先进方法相比,我们的MGAFNet在公共基准测试和一个私人的临床数据集上都达到了最先进的性能。它展示了处理各种牙科状况(例如错位、缺失和额外牙齿)的强大能力,避免了类别混淆和模糊边界分割。


原文链接



顺序点网络++:通过姿态和运动链融合强化超点网络用于三维动作识别

原标题:SequentialPointNet++: A Reinforced-Hyperpoint Network through Pose and Motion-chain Fusion for 3D Action Recognition

作者:Xing Li;Zhaoyu Chen;Ge Gao;Liang Qi;Qiaolin Ye;Maocheng Zhao

期刊:Information Fusion

出版时间:2026/08/01

摘要:基于3D传感器获取的点云数据的人体行为识别已获得广泛应用,包括健康监护、人机协作等。这些动态应用场景主要依赖于点云数据中包含的丰富的时空融合信息来实现高精度动态感知。然而,现有的点云序列建模方法难以同时考虑点云序列的结构特异性和信息特异性,导致无法消除时空纠缠,在保持主体空间结构信息完整性的同时捕捉运动时间演变的一致性。为了应对上述问题,我们提出了一种用于三维动作识别任务的Reinforced-Hyperpoint网络,命名为SequentialPointNet++。主力军误,正确的翻译应如下所示,确保符合原始格式要求,特别是关于保留括号内的内容及专有名词的要求:“{首先,我们生成一种称为R-Hyperpoint的新颖数据表示形式,该形式有效地捕获了点云的多维空间信息和时间演化特征。R-Hyperpoint 融合了整体静态姿态单元和区域动态运动链来全面表示人体动作。其次,考虑到R-Hyperpoint序列中的时间语义异质性,我们设计了一个多阶段时间子动作解析模块来学习不同时间感知域中的子动作模式,并执行加权融合,防止信息碎片化和模糊性。在四个广泛使用的三维动作识别数据集上进行的大量实验证实,SequentialPointNet++ 在三维人体运动识别中实现了具有竞争力的表现。我们的代码已公开发布于https://github.com/XingLi1012/SequentialPointNet2。


原文链接



频域增强的谱空融合变压器用于遥感图像语义分割

原标题:Frequency domain-enhanced spectral-spatial fusion transformer for semantic segmentation of remote sensing images

作者:Xin Li;Feng Xu;Jiaxin Li;Yuanchao Su;Linyi Li;Xin Lyu;Zhennan Xu;André Kaup

期刊:Information Fusion

出版时间:2026/08/01

摘要:遥感图像(RSIs)的语义分割面临着粗略空间布局、精细结构边界以及在频率成分中分布不均的异质纹理共存的挑战。为了更好地表征这些互补属性,我们引入了FSSFFormer,这是一种频域增强的变压器,利用多分辨率小波分解来丰富表示学习。首先应用固定二维离散小波变换(DWT)将RSIs分解为低频子带和高频子带,使模型能够明确地保持全局空间结构的同时保留细粒度细节。在这些频率分解的特征之上,采用了两个轻量级模块:一个频谱增强注意力(SEA)模块,该模块选择性地强调信息丰富的子带响应;以及一个频谱-空间上下文注意力(SSCA)模块,该模块改进了分解特征谱之间的上下文建模。精炼的表示随后使用逆DWT在空间域中重建以进行密集预测。在三个公共基准上进行的大量实验,ISPRS Vaihingen,ISPRS Potsdam 和 LoveDA,显示 FSSFFormer 一直表现出色,并且通过 BF-score 测量的边界保真度有显著提高。消融研究进一步证明了子带分解和两个注意力模块在增强结构细节和语义一致性方面的作用是互补的。


原文链接



具有多模态原型的异构数据去中心化联邦学习

原标题:Decentralized Federated Learning with Multimodal Prototypes for Heterogeneous Data

作者:Enrique Tomás Martínez Beltrán;Gérôme Bovet;Gregorio Martínez Pérez;Alberto Huertas Celdrán

期刊:Information Fusion

出版时间:2026/08/01

摘要:去中心化联邦学习(DFL)能够在避免集中式架构固有的瓶颈和对单一可信实体的依赖的同时,在众多设备上实现协作机器学习然而,其实际应用面临着现代场景的挑战,在这些场景中数据越来越具有多模态性。这样的设置中的关键障碍是严重的数据异质性,表现为非独立同分布(non-IID)的类别分布,以及数据不完整,其中模式经常在客户端之间缺失。现有的解决方案在应对这些挑战时存在困难,要么产生高昂的通信成本,要么缺乏有效的机制来融合部分信息。为了克服这些限制,本研究引入了Modalis,一个新颖的多模态DFL框架,在数据异质性下实现更优的模型性能的同时最小化网络消耗。它开创了一种通信高效的基于原型的协议,在该协议中,客户端交换紧凑的模态感知类表示而非高维模型参数。这个过程由一个多目标损失函数指导,该函数强制执行跨模式一致性以及表示对齐,以实现有效的知识融合。该框架集成了复杂的架构创新,包括用于智能数据插补的上下文空嵌入以及使用自适应门控和多路变压器进行稳健的跨模态融合。该方法通过理论分析得到验证,提供了正式的收敛保证,并在标准的多模态基准上进行了广泛的实验。这些结果表明,Modalisa实现了优越的性能,在高异质性下F1分数提高了最多4%,并且相比最先进的基准方法减少了超过40倍的通信成本,确立了其作为协作AI的有效解决方案的地位。


原文链接



精美假新闻:一个知识增强的数据集用于细粒度多领域假新闻检测

原标题:FineFake: A knowledge-enriched dataset for fine-grained multi-domain fake news detection

作者:Ziyi Zhou;Xiaoming Zhang;Litian Zhang;Jiacheng Liu;Erik Cambria;Chaozhuo Li

期刊:Information Fusion

出版时间:2026/08/01

摘要:现有的假新闻检测基准对评估新闻内容真实性的模型的进步做出了重大贡献。然而,这些基准通常仅专注于单一语义主题或单一平台的新闻,从而无法捕捉到真实场景中多领域新闻的多样性。为了理解各种领域中的假新闻,外部知识和细粒度标注不可或缺,它们可以提供精确的证据并揭示制造假新闻的各种策略,这些也被现有基准所忽略。为了解决这一缺口,我们引入了一个新的多领域知识增强基准,具有细粒度标注,名为FineFakeFineFake涵盖16,909个数据样本,跨越六个语义主题和八个平台。每个新闻条目都丰富了多模态内容、潜在的社会背景、半手动验证的常识以及超越传统二元标签的细粒度标注。此外,我们基于FineFake制定了三个越来越具挑战性的跨域和细粒度检测任务。大量的实验表明,FineFake 显著增加了任务难度,在从粗粒度到细粒度以及跨领域设置迁移时,现有的模型遭受了超过10-30%的绝对f1分数下降,突显了其作为严格的和判别性基准的价值。整个FineFake项目作为一个开源仓库公开访问,地址为https://github.com/SenticNet/FineFake。


原文链接



基于信息融合的文档分类模式识别:多模态和多视角表示方法综述

原标题:Document classification pattern recognition via information fusion: A systematic review of multimodal and multiview representation approaches

作者:Marcin Michał Mirończuk

期刊:Information Fusion

出版时间:2026/08/01

摘要:信息融合通过整合多个数据源(多模态)或表示形式(多视图)广泛用于改进文档分类。然而,该领域缺乏统一的框架,定量综合其有效性以及对从业者的明确指导。本次系统综述通过分析139项原始研究来填补这些空白。它介绍了一个正式框架来构建该领域,展示了定性分析的结果以识别关键趋势,并进行了随机效应元分析(据我们所知,第一个专注于文档分类的)以量化性能提升。我们的元分析揭示多模态融合显著提高了准确性(均增益为+5.28个百分点,p=0.0016)——在我们的主要模型中,F1分数的效果方向上是积极的,但在统计上不显著。多视图融合在准确性(+4.67%)、F1值(+3.08%)和召回率(所有p < .05)方面提供了稳定但适度的提升。我们的定性综合分析揭示了在方法严谨性和可重复性方面存在的挑战:只有11.8%(多模态)和23.3%(多视角)的研究使用统计检验来验证其结果,这削弱了许多研究结果的可靠性。本文的主要贡献是一个统一的框架,第一个定量证据基础以及数据驱动的指南。这篇综述得出结论,成功的信息融合不依赖于算法的复杂性,而是取决于融合方法与任务背景的战略一致性和对更严格的验证的承诺。


原文链接



基于贝叶斯方法的离线自主空中搜索路径生成

原标题:A Bayesian approach to offline autonomous aerial search path generation

作者:J. Josiah Steckenrider;James E. Bluman;Evan C. Asuncion;Joseph B. Dorta;Matthew K. Wanta

期刊:Information Fusion

出版时间:2026/08/01

摘要:这项工作提出了一种使用先验上下文信息进行离线自主搜索模式生成的贝叶斯框架。填补现有研究的空白,所提出的方法整合了三项关键贡献:一种基于概率不可检测模型动态估计目标信念的粒子滤波器;一种引导搜索者朝向局部高概率区域的贪婪导向策略;以及符合任务约束的真实空中介入者动力学模拟。定性和定量的结果表明,虽然MHH策略在结构均匀的领域中不如手动优化的经典模式高效,但在更复杂或不规则的情景中表现得具有竞争力,并且经常更优。性能通过累积密度函数、熵度量以及累积密度函数之上的面积(AAC)进行评估,AAC是搜索延迟的衡量标准。所提出的框架在包括搜索和救援(搜寻和救援)、环境监测、地雷搜索以及自主监视等多种应用中展现出潜力,特别是在部署前就已具备领域特定信息的任务中。


原文链接



基于时空语义对齐机制的区域到全局融合多模态生理信号的情绪识别

原标题:Emotion recognition using multimodal physiological signals through regional to global fusion with a spatial-temporal semantic alignment mechanism

作者:Jian Shen;Huajian Liang;Ruirui Ma;Yihong Xu;Kexin Zhu;Haoran Gao;Kechen Hou;Yanan Zhang;Xiaowei Zhang;Bin Hu

期刊:Information Fusion

出版时间:2026/08/01

摘要:随着多模态学习的不断发展,使用多模态生理信号进行情绪识别已成为研究热点。研究显示结合脑电图(EEG)信号和眼动可以显著提高情绪识别的结果。然而,当前的研究仍然面临以下挑战:(1) 不同个体对不同情绪的反应时间和持续时间存在差异,导致数据多样性和变异性。不同的模态表现出时空差异,这可能导致在同一时空条件下出现不同的语义相关性和重要性。2)为了解决这些挑战,我们提出了一种具有时空语义对齐机制的区域到全球融合网络(R2GFANet)。首先,R2GFANet通过采用填充掩码与1D-CNN网络结合使用来从长度可变的EEG信号和眼动中编码时间语义信息,从而应对第一个挑战。随后,R2GFANet 利用一个多区域跨模态注意力机制,在每个脑区内部进行平行的时间语义对齐,并应用区域级空间注意力来突出关键脑区的语义信息,有效解决了不同模态之间的时空差异。通过在两个公开数据集SEED-IV和SEED-V上与众多最先进方法进行比较,我们展示了所提出的R2GFANet的卓越性能和统计显著性。此外,我们进行消融研究和可视化分析。结果表明,将EEG信号与眼动对齐不仅提高了分类性能,还提供了神经科学解释性。


原文链接



视觉-文本一致的概念关系学习用于准确的自解释疾病诊断

原标题:Visual-textual consistent concept relation learning for accurate self-explainable disease diagnosis

作者:Yating Zhu;Xiaoyan Wang;Xiaojie Huang;Ming Xia;Pan Mu;Zheng Wang;Haigen Hu;Xiaoqin Zhang;Zhongzhao Teng

期刊:Information Fusion

出版时间:2026/08/01

摘要:视觉语言模型(VLMs)与基于概念的可解释性模型的结合为通过学习人类易于理解的概念来解释医学诊断决策提供了一种有前景的方法。然而,现有方法主要侧重于从概念表示和图像特征中学习,而忽视了概念与疾病类别之间的因果关系。此外,视觉语言模型通常在通用领域数据上进行预训练,导致直接应用于医学图像时性能不佳且视觉概念特征激活不准确。本文介绍了一种基于预训练的CLIP的无标签、视觉-文本一致的概念关系学习模型用于自解释疾病诊断。具体来说,我们采用大型语言模型(LLM)生成医学概念-疾病关系,并进行多级对比学习。为了确保视觉和文本模态的一致性,我们引入了一种双边自编码器结构,该结构通过双重建概念关系和图像来学习潜在的概念表示,强化了疾病类别标签、文本描述和视觉特征之间的一致性。实验结果表明,我们的模型在黑色素瘤诊断上比最先进的模型MICA高出2.93%,在同一概念标注水平下,概念识别能力超越MONET 8.80%,并且相比现有的黑盒和可解释方法实现了更稳健且优越的准确率和可解释性。


原文链接



知识图谱基础模型的泛化研究:一个多视角综述

原标题:Generalization of knowledge graph grounded models: A multi-perspective survey

作者:Yiming Wang;Qian Li;Yuntao Du;Lizhen Cui

期刊:Information Fusion

出版时间:2026/08/01

摘要:知识图谱(KGs)提供了现实世界知识的结构化和符号表示,并广泛应用于各种知识密集型应用中。随着它们被越来越多地部署在开放环境中,泛化已成为一个关键挑战。KG基础模型的泛化是指模型能够从特定知识中学习模式和结构,并将这些学到的模式应用于新的、未见过的数据或任务。现有的关于KG基础模型泛化能力的研究通常局限于提出个别方法或从单一角度进行分析。不同的研究采用了异质性的假设、评估设置以及泛化的概念,这阻碍了对研究领域的统一理解的形成。在本文中,我们调查了超过200篇KG相关的论文,并从特征、类型、维度和任务等多个角度提供了关于基于KG模型泛化能力的首次全面分析。本研究旨在识别核心挑战和发展方向,为KG研究人员提供一个清晰的概念框架,并为理解和支持通用KG模型的发展提供新的视角。


原文链接



HSBNet:融合语义和各向异性热扩散场的边界感知点云分割

原标题:HSBNet: Fusing semantics and anisotropic thermal diffusion fields for boundary-aware point cloud segmentation

作者:Xin Ning;Limin Jiang;Xinfeng Zhang;Zihao Wang;Liping Zhang;Yinyun Yan;Tingran Wang;Baoli Lu;Yuhao Wang;Weijun Li

期刊:Information Fusion

出版时间:2026/08/01

摘要:点云语义分割向单个三维点分配语义标签,从而实现对场景的细粒度理解。然而,现有方法常常难以处理3D数据的不规则性和稀疏性,尤其是在几何复杂且边界模糊的区域,因为它们依赖于各向同性的邻域定义()。为了解决这些挑战,我们提出了HSBNet,一个新颖的基于物理信息的框架,该框架协同整合了几何扩散先验、对比学习和多尺度特征聚合。我们的方法建立在一种双分支架构之上,该架构旨在互补融合局部几何细节和全局上下文语义。在本地分支中,引入了一种基于各向异性热扩散物理原理的Hyper-Sausage编码(HSE)。HSE 将局部特征聚合重新概念化为一个热传播过程,在此过程中,局部骨架充当线性热源,自适应半径模拟各向异性热导率张量,超越了固定几何核的限制。同时,边界感知对比损失模块(BACL)通过强制同一类别内的内部点和边界点之间的语义一致性进一步提高特征的区分性,弥补了先前以边界为中心的方法常常忽视的语义差距。全球分支利用一个Transformer来捕获长距离依赖性和场景级结构。一种自适应特征融合模块在多个尺度上动态结合局部和全局信息。在S3DIS、ScanNetV2和ShapeNet-Part上的广泛实验表明,HSBNet实现了优越的分割性能,在边界区域有显著改进。每个融合组件的有效性通过全面的消融研究得到验证。我们的代码将在以下位置提供:https://github.com/Jiang334/HSBNet.


原文链接



协调者:语义协调的动态融合用于多视图聚类

原标题:Coordinator: Semantic-coordinated dynamic fusion for multi-view clustering

作者:Wei Lan;Yinghao Guo;Qingfeng Chen;Shichao Zhang;Shirui Pan;Huiyu Zhou;Yi Pan

期刊:Information Fusion

出版时间:2026/08/01

摘要:深度多视图聚类(DMVC)已成为分析来自多个视图的复杂数据的一种重要方法。虽然现有的深度方法在提取视图特定特征方面表现良好,但它们通常忽略了跨视图的高层次语义对齐。这可能导致特征模糊和不一致的结果,特别是在处理异构数据时。为了解决这个问题,我们提出了一种新颖的语义协调动态融合框架(Coordinator),用于将语义信息整合到多视图聚类中。具体来说,Coordinator 利用大型视觉-语言模型(LVLMs)生成语义表示,并利用视图编码器提取特定于视图的特征。为了增强异构视图之间的连贯性,Coordinator 使用了一个跨视图对齐模块来对不同视图的表示进行对齐。此外,一种语义感知融合策略动态地整合视觉和语义特征,从语义引导开始,过渡到数据驱动的视图加权。为了促进视图编码器的协同优化,Coordinator 引入了一个双向反馈机制来精炼视图编码器。广泛的实验表明,Coordinator在六个基准数据集上超越了最先进的方法,通过将语义知识融入多视图聚类有效弥合了模态差距。


原文链接



大型语言模型中的安全与隐私:威胁及缓解策略的全面调查

原标题:Security and privacy in LLMs: A comprehensive survey of threats and mitigation strategies

作者:Aymen Dia Eddine Berini;Norziana Jamil;Ala-Eddine Benrazek;Abderrahmane Lakas;Leila Ismail;Mohamed Amine Ferrag;Kwok-Yan Lam

期刊:Information Fusion

出版时间:2026/08/01

摘要:大型语言模型(LLMs)正在改变自然语言处理,并且越来越多地被应用于医疗保健、金融服务和教育等重要领域。然而,它们的采用由于在不同的生命周期阶段容易受到多种攻击的影响而引发了重大的安全和隐私问题,包括数据投毒、模型逆向、提示注入以及供应链漏洞。尽管以往的研究已经调查了这些风险,当前的调查往往缺乏足够的全面性、技术严谨性或生命周期考虑。为了填补这一空白,我们提出了一种面向生命周期的深入分析LLM安全性和隐私的方法我们介绍了一种威胁分类法,涵盖数据为中心的、模型为中心的以及部署和交互为中心的向量,每个向量都映射到相应的防御机制。我们也处理跨领域风险,包括幻觉,算法偏见和脆弱的插件接口。此外,我们评估现有防御的有效性和局限性,整合新的安全工具和评估框架,并通过广泛的比较分析将我们的发现置于更广泛的研究文献中。最后,我们确定了开放的研究挑战,并概述了开发安全、稳健且符合监管规定的LLM系统未来方向。此项调查作为研究人员、开发者和政策制定者了解大型语言模型的不断演变的对抗环境的基础参考。


原文链接



元对比任务适应于时间序列预测:一个结构化双教师框架

原标题:Meta-contrastive task adaptation for time series forecasting: A structured dual-teacher framework

作者:Weimin Song;Qianqian Ren;Xingfeng Lv;Jinbao Li

期刊:Information Fusion

出版时间:2026/08/01

摘要:准确且稳健的时间序列预测在许多现实世界领域中至关重要,然而现有的模型往往难以在监督有限、任务多样以及分布变化的情况下泛化。在这项工作中,我们提出了MCTSN(Meta-Contrastive Task-adaptive Structured Network),一个统一的框架,该框架集成了元学习、对比表示学习和多尺度知识蒸馏,以增强时间建模适应性。为了实现在异构任务间快速适应,MCTSN 采用了一个元对比优化流水线,通过时序训练共同学习可迁移表示和初始化参数。一种三组件扰动策略和方差引导的时间切片模块通过促进尺度感知监督进一步提高鲁棒性。此外,MCTSN 引入了一个双教师架构,在该架构中,一个动量更新的全局教师模型和一个特定任务的局部教师模型分别用于建模短期和长期依赖关系。他们的输出通过一个受教师一致性和距离度量引导的门控融合机制被任务自适应的学生融合。大量的实验表明,MCTSN在ETTm1单变量预测上取得了显著的改进,相比最佳基线降低了超过15%的均方误差。对于多变量预测,在Electricity数据集上观察到最大的收益,在最长的预测时间范围内均方误差减少了8.4%这些结果突显了该模型在不同数据粒度下的短期和长期预测的有效性。进一步的分析,包括消融研究(ablation studies),在线适应(online adaptation)和少量样本评估(few-shot evaluations),验证了模型的可扩展性,鲁棒性和可解释性。


原文链接



隐式语义对齐的三维点云-文本融合跨模态对比学习

原标题:Cross-modal contrastive learning for 3D point cloud-text fusion via implicit semantic alignment

作者:Xiangtian Zheng;Chen Ji;Wei Cai;Xianghua Tang;Xiaolin Yang;Liang Cheng

期刊:Information Fusion

出版时间:2026/08/01

摘要:虽然变形器在历史上一直主导着点云分析,但它们二次方的计算复杂度O(N2)对处理大规模三维数据构成了重大瓶颈。最近,状态空间模型(SSMs),特别是Mamba,由于其线性复杂度和强大的长程建模能力,已经作为一种有力的替代方案出现。在这项工作中,我们提出了PST-Mamba,一种新颖的基于SSM的多模态框架,旨在实现高效且全面的点云理解。为了弥合无结构3D几何与1D序列SSMs之间的维度差距,我们引入了语义引导流形展开(Semantic-Guided Manifold Unfolding)。与刚性几何扫描不同,该策略利用隐式文本嵌入来指导点云投影到1D序列中,有效地保持拓扑连续性和语义一致性。此外,我们将隐式语义提示集成进来,用高层次的上下文先验丰富几何特征,促进视觉和语言信息的深度融合。广泛的实验表明,PST-Mamba 在多个基准测试中达到了最先进的性能(例如,在 ModelNet40 上实现了 95.21% 的总体准确率以及在 ScanObjectNN PB-T50-RS 上实现了 90.09%)。值得注意的是,与领先的基于Transformer的模型相比,PST-Mamba减少了参数量54.8%,减少了FLOPs 70.5%,展示了其在大规模实时三维多模态应用中的巨大潜力。


原文链接



双流层次化Mamba高分辨率高光谱融合成像

原标题:Dual-stream hierarchical Mamba for high-resolution hyperspectral fusion imaging

作者:Jiayu Cui;Yuanye Liu;Renwei Dian;Shutao Li;Jinyang Liu

期刊:Information Fusion

出版时间:2026/08/01

摘要:选择性结构化状态空间模型(Mamba)在长序列建模任务中表现出显著优势,吸引了高分辨率高光谱融合成像领域的广泛关注。LLM_ERROR] HTTPConnectionPool(host=’192.168.1.106’, port=11434): Read timed out. (read timeout=60)为了解决这个问题,我们提出了一种新颖的高光谱图像融合网络,称为双流分层Mamba融合网络(DHMF-Net)。该网络首先使用层次谱曼巴(HSpeM)和层次空间曼巴(HSpaM)模块实现有效的特征提取。然后采用层次自适应融合模块(HAFM)以确保足够的跨模态特征交互。具体而言,HSpeM模块通过频域分解以及在不同频率下扫描信道注意力向量来建模频谱领域的长距离依赖关系。同时,HSpaM模块通过扫描多尺度空间注意力图来捕获空间上下文信息。这些模块的并行使用有助于多级空间-光谱依赖性的联合建模。为了进一步增强不同模态之间特征的交互,HAFM 利用了一个渐进聚合机制以及一个自适应加权机制来从低级到高级整合特征。大量的实验表明,所提出的方法优于几种最先进的方法。DHMF-Net的代码将在https://github.com/Darcycuis/DHMF-Net上共享。


原文链接



可解释的多视图表征学习深度展开框架

原标题:An interpretable deep unfolding framework for multi-view representation learning

作者:Shide Du;Zhenghong Lin;Zihan Fang;Yiqing Shi;Shiping Wang

期刊:Information Fusion

出版时间:2026/08/01

摘要:深度多视角表征学习因其强大的融合和解释复杂数据模式的能力而被公认为是一个重要的研究方向。然而,深度神经网络架构内在的不透明性极大地阻碍了可解释性,特别是在异构信息跨多个视图集成机制方面。为了填补这一空白,我们提出了一种可解释的深度展开方法,专门针对多视图表示学习。最初,我们将表示学习任务建立为一个综合优化问题,该问题整合了多视图先验知识,包括语义一致性、空间拓扑、噪声多样性以及信息互补性。在此概念基础上,我们利用交替方向乘子法推导出迭代解,并随后将这些解嵌入到深度表示学习架构中。该框架严格遵循迭代展开范式,明确纳入四种不同的多视图先验知识类别,从而增强嵌入在网络设计中的可解释性,同时促进高效的迭代优化。使用四个从提议方法实例化的示例模型进行的经验分析显示,在具有挑战性的多视图任务中表现出色,证实了该框架的融合有效性和可解释性。


原文链接



【声明】内容源于网络
0
0
AI新文
AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
内容 257
粉丝 0
AI新文 AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
总阅读4.4k
粉丝0
内容257