由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。
基于语义表示学习视角的多模态科学问答方法
原标题:A Semantic Representation learning perspective-based approach for multimodal science question answering
作者:Ling Gao;Nan Sheng;Rui Song;Hao Xu
期刊:Information Fusion
出版时间:2026/09/01
摘要:基于给定的视觉和文本输入进行多模态学习和逻辑推理以回答科学问题。对于特定的输入对,视觉和文本通过不同的模态载体表达共同的语义含义。视觉和文本模态载体源自不同的对时所表达的语义意义是独立的。然而,模态表示和语义表示之间的高度纠缠以及不同对之间语义差异的微弱阻碍了视觉和文本语义表示的学习。在这项工作中,我们引入了一种基于语义表示学习视角的方法(SRLP)用于多模态科学问题回答。首先,我们通过解耦和一致约束最大化特定配对内的视觉和文本语义表示之间的匹配程度。同时,我们将对比学习与解耦表示学习结合,以增强特定对的跨模态语义表示学习。学习到的跨模态语义表示最终被输入解码器以生成答案文本。在两个多模态科学问答数据集上的实验展示了SRLP的卓越性能,证明了跨模态一致性和对比学习的有效性。数据和源代码可在https://github.com/gaoling-code/SRLP获取。
原文链接
面向图概念认知学习:综述及展望
原标题:Towards graph concept-cognitive learning: A survey and beyond
作者:Fei Hao;Mengyu Yan;Jinhai Li;Weihua Xu
期刊:Information Fusion
出版时间:2026/09/01
摘要:图是表示互联数据的网络结构的强大工具,并广泛应用于社会系统、生态系统、生物网络、知识图谱和信息系统等领域。随着图学习技术和认知科学的融合进展,图概念认知学习(GCCL)作为一种新型范式出现,它将概念认知学习(CCL)与图分析相结合。本文提供了GCCL的全面综述,介绍了其基础框架,并详细阐述了将概念认知学习整合到各种图表示中的方法。这些表示方法使得任务如图结构分析、知识发现和图分类成为可能。此外,该论文探讨了关键应用领域,包括社交网络分析,知识图谱推理和组合优化,同时介绍了针对GCCL研究量身定制的数据集和仿真平台。最后,我们讨论了有前景的研究方向,将GCCL定位为图学习这一更广泛领域中的变革性方法。
原文链接
轻量级通道动态融合模型:基于熵分析的非平稳时间序列预测
原标题:Lightweight channel-wise dynamic fusion model: Non-stationary time series forecasting via entropy analysis
作者:Tianyu Jia;Zongxia Xie;Yanru Sun;Dilfira Kudrat;Qinghua Hu
期刊:Information Fusion
出版时间:2026/09/01
摘要:非平稳性是现实世界时间序列的内在属性,在时间序列预测中起着关键作用。先前的研究主要采用实例归一化来减弱原始序列的非平稳性以提高预测能力。然而,直接移除内在非平稳性的实例归一化会导致三个问题:(1) 打破全局时间依赖性,(2) 忽视通道特定差异,(3) 产生过度平滑的预测。为了解决这些问题,我们从理论上证明了标准差可以是一个有效且可解释的代理,用于量化时间序列的非平稳性。基于分析,我们提出了一种新颖的通道级动态融合模型(CDFM),该模型选择性地和动态地恢复原始序列内在的非平稳性,同时保持归一化序列的可预测性。首先,我们设计了一个包含两个分支的双预测模块:一个用于捕捉稳定模式的时间平稳预测器和一个用于建模全局动态模式的时间非平稳预测器。其次,我们提出了一种融合权重学习器,基于标准差动态表征不同样本间内在的非平稳信息。最后,我们引入了一个Channel Selector,通过评估它们的非平稳性、相似性和分布一致性,从特定通道中选择性地恢复非平稳信息,使模型能够捕获相关的动态特征并避免过拟合。全面的七个时间序列数据集上的实验展示了CDFM的优势和泛化能力。代码可在以下网址获取:https://github.com/Tianyu-Jia/CDFM.
原文链接
基于容忍性和妥协性二次成本的社交信任网络中实现专家最大共识的数据驱动鲁棒方法
原标题:A data-driven robust approach for maximum expert consensus in social trust network with tolerance- and compromise-based quadratic cost
作者:Jiaxin Song;Shaojian Qu;Zhisheng Peng;Ying Ji
期刊:Information Fusion
出版时间:2026/09/01
摘要:随着社交网络的快速发展及其广泛应用,将社交网络整合到群体决策(GDM)中已吸引了越来越多的关注尽管在社会网络群决策(SNGDM)方面已经取得了一些进展,但有限的研究考虑了专家的个体行为以及不确定的情景。为了解决这一缺口,本研究在社会信任网络中提出了最大专家共识模型(MECMs),其中包括容忍行为、妥协行为以及二次成本。为了更好地反映现实中的决策场景,本文构建了二次成本函数,该函数整合了社会信任网络中专家的容忍和妥协行为,并将其融入MECM中,鼓励专家采用更为谨慎的决策策略。基于此,我们提出了MECM,并进一步将不确定性纳入模型中,在此论文中,我们将单元调整成本整合到基于容忍度和妥协行为的二次成本函数中。此外,我们使用稳健且数据驱动的鲁棒优化方法来应对不确定性。最后,设计了一个由共识水平驱动的达成共识的过程,并将提出的模型应用于中国环境污染防治的一个案例研究。敏感性及比较分析验证了所提出的模型的有效性和适用性。本研究的主要贡献是一个综合框架,用于SNGDM,该框架整合了个体行为偏好和不确定性,增强了复杂决策场景中的真实性和稳健性。
原文链接
MMDrive:超越视觉的多表征融合交互场景理解
原标题:MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion
作者:Minghui Hou;Wei-Hsing Huang;Shaofeng Liang;Daizong Liu;Tai-Hao Wen;Gang Wang;Runwei Guan;Weiping Ding
期刊:Information Fusion
出版时间:2026/09/01
摘要:视觉-语言模型通过多源信息融合使复杂交通场景的理解和推理成为可能,成为自动驾驶的核心技术。然而,现有的视觉-语言模型受到二维平面图像理解范式的限制,这限制了它们感知三维空间信息和进行深度语义融合的能力,在复杂的自动驾驶环境中表现欠佳。本研究提出了MMDrive,一个多模态视觉-语言模型框架,该框架将传统的图像理解扩展到一个通用的三维场景理解框架。MMDrive 包含三种互补的模式,包括占用地图,LiDAR 点云和文本场景描述。为此,它引入了两个新颖的组件用于自适应跨模态融合和关键信息提取。注意此处的标点符号已根据中文习惯调整。原文中没有提供明确指示要求保持原样,因此这里进行了适当处理。但为了更贴近原始格式,可以理解为对整体语句结构的忠实翻译。如果需要严格按照原文符号处理,则应忽略此细节调整。根据要求,主要关注于翻译准确性及格式一致性。如有特殊需求,请进一步说明。不过,基于给出的具体指令,最终呈现如下形式更为贴切:{具体而言,基于问题中的语义线索,Text-oriented Multimodal Modulator 动态调整每种模态的贡献权重,指导上下文感知特征融合。跨模态抽象器运用可学习的抽象令牌生成紧凑的跨模态摘要,突出关键区域和核心语义。对DriveLM和NuScenes-QA基准的全面评估表明,MMDrive在自主驾驶领域的视觉语言模型中取得了显著性能提升,在DriveLM上BLEU-4得分为54.56,METEOR得分为41.78,在NuScenes-QA上的准确率为62.7%MMDrive有效地打破了传统的仅图像理解障碍,使复杂驾驶环境中的多模态推理变得稳健,并为可解释的自动驾驶场景理解提供了新的基础。
原文链接
可穿戴健康监测的多传感器数据融合综述
原标题:A review on multi-sensor data fusion for wearable health monitoring
作者:Arlene John;Alex P. James;Barry Cardiff;Deepu John
期刊:Information Fusion
出版时间:2026/09/01
摘要:对准确的、连续的和非侵入性健康监测的需求增长已经推动了多传感器数据融合成为医疗技术的前沿。本文旨在概述融合框架的发展以及融合文献中常用的术语。综述介绍了与算法开发最相关的融合分类标准和方法。所审查的融合框架在国防、自动驾驶和机器人等领域的应用也进行了简要介绍,以便提供有关该领域开发的各种融合方法的相关背景信息。本文旨在对应用于健康监测系统的多传感器数据融合方法进行全面分析,重点关注关键算法、应用、挑战及未来方向。我们研究了常用的融合技术包括卡尔曼滤波器、贝叶斯网络和机器学习模型。通过整合各种来源的数据,这些融合方法增强了健康监测系统的可靠性、准确性和韧性。然而,诸如数据质量以及获取系统差异之类的挑战已经出现,这近年来呼唤了智能融合算法的出现。综述最终聚焦于融合算法在生物医学推理任务中的应用,例如心率检测、呼吸频率估计、睡眠呼吸暂停检测、心律失常检测以及房颤检测。本文综述中提出的见解有望指导下一代多传感器融合系统在健康监测中的开发。
原文链接
更少遗忘的联合学习:非IID世界的超级教师指导
原标题:Making federated learning forget less: Super teacher guidance for the non-IID world
作者:Fangwei Wang;Jiashuai Huo;Changguang Wang;Yan Liu;Gaopan Hou;Jingjing Guo;Zhiyuan Tan
期刊:Information Fusion
出版时间:2026/09/01
摘要:联邦学习(FL)实现了隐私保护的去中心化模型训练,但客户端之间的数据异质性常常导致客户端漂移和全局知识遗忘,阻碍了收敛性和准确性。现有的解决方案使用知识蒸馏(KD)从当前的全局模型引导本地训练,但它们缺乏历史上下文和鲁棒性。为了解决这个问题,我们提出了FedSTG(Federated Super Teacher-Guided Learning)——一个通过自适应双教师知识蒸馏构建超级教师的新框架。FedSTG 利用当前的全局模型以及一个不断更新的超级教师,该超级教师聚合历史知识以提供更丰富、更稳定的训练信号。通过评估每类预测的置信度,FedSTG 选择每个类别实例更可靠的教师,确保超级教师模型实现最全面的表现,同时随着时间的推移精炼超级教师模型。超级教师模型扩大了本地训练期间可用的全球视角,有效缓解了客户漂移并保持了全球知识。广泛的实验评估表明,在五个具有挑战性的基准上,所提出的FedSTG在训练效率和测试准确率方面均达到了最先进的性能,特别是在分类任务中取得了尤为显著的提升。此外,我们提供了严格的理论分析,以保证在非独立同分布(non-IID)数据下FedSTG的收敛性。所提出的框架有效增强了模型的泛化能力和鲁棒性,使其非常适合于工业自动化和智能系统的实际应用。
原文链接
跨尺度变换与稀疏表示的桥梁:统一的Gabor张量稀疏表示法用于多维医学图像融合
原标题:Bridging multi-scale transform and sparse representation: Unified Gabor Tensor Sparse Representation for Multi-dimensional medical image fusion
作者:Yuhang Chen;Aiping Liu;Yu Liu;Zhiyang He;Xiaoliang Lu;Xun Chen
期刊:Information Fusion
出版时间:2026/09/01
摘要:多维(MD)医学图像融合对于临床诊断至关重要,因为它将来自多种模态采集的互补信息整合成单一的、具有信息量的描述。基于多尺度变换(MST)的方法和基于稀疏表示(SR)的方法长期以来一直是该领域的两大主流范式,两者都建立在严格的线性基上。然而,它们内在的局限性限制了进一步的进步:MSTs依赖于非自适应的方向滤波器库,这限制了其数据驱动的灵活性,而SRs提供了自适应字典学习但采用各向同性的稀疏编码,无法捕捉复杂的各向异性纹理。认识到这些限制是互补的,我们提出了一种统一框架,称为高通张量稀疏表示(Gabor-TSR),以弥合方向性和自适应性之间的理论差距。具体而言,介绍了两项关键创新。首先,通过将多方向滤波器表述为秩一张量,设计了基于张量的Gabor小波变换(Tensor-GWT),从而将高维滤波分解为直接应用于字典原子的有效一维操作,并在多维空间中实现了可转向的方向性,且具有线性计算复杂度。其次,通过将定向组件堆叠成块对角字典,开发了一种联合方向稀疏编码策略,该策略在全局稀疏约束下利用了内在的方向间相关性。广泛的实验涉及七项融合任务,包括100对二维图像和70个三维数据体积,证明了所提出的基于Gabor-TSR的融合方法在保持结构完整性和对比度保真度方面始终优于十七种最先进的融合方法,证实了其作为MST和SR理论之间稳健桥梁的价值。
原文链接
基于ERnet的自适应融合图像增强和优化以在恶劣天气下进行鲁棒目标检测
原标题:Adaptive fusion image enhancement and refinement via ERnet for robust object detection under adverse weather
作者:Zhiyong Jing;Zhaobing Chen;Lei Shi;Yufei Gao;Yucheng Shi;Lin Wei;Xiangjie Wang;Qingxian Wang
期刊:Information Fusion
出版时间:2026/09/01
摘要:车辆检测是智能交通系统(ITS)的关键组成部分,但在实际交通场景中由于复杂多变的天气条件如雨、雪、雾、沙尘暴和灰尘而面临挑战。这些条件可以显著降低图像质量并减少车辆检测的准确性。为了解决这些问题,我们提出了一种增强和精炼融合框架称为ERnet,该框架自适应地增强和精炼每一张图像以提高可见性和检测性能。ERnet 包含两个模块:自适应数字图像增强(ADIE)模块和特征精炼(RefineNet)模块。ADIE模块增强了在恶劣天气条件下捕获的图像,而RefineNet模块专注于细化图像细节。多个损失函数被纳入以约束RefineNet并改进可视化和特征细节。我们进行了实验以比较ERnet与以前的方法在各种真实交通场景中的表现。结果表明,ERnet有效地增强了在正常天气条件和不利天气条件下获得的图像。具体而言,在不利天气条件下,ERnet 提高了平均精度均值(mAP)6.17%。此外,在雾天、雨天、沙尘天和雪天条件下分别实现了7.57%,3.12%,6.74%和3.45%的改进。值得注意的是,即使在晴朗的天气下,ERnet仅使mAP降低了0.48%,表明其在各种天气条件下有效且稳健。研究结果突出了ERnet在提高智能交通系统环境适用性方面的潜力,并通过基于融合的增强和优化策略提供了不同天气条件下智能交通系统应用的解决方案思路。
原文链接
面向可靠的医学无监督异常检测:一种基于PET/CT的跨模态知识蒸馏网络基准和数据集
原标题:Towards reliable medical unsupervised anomaly detection: A benchmark and dataset for PET/CT with cross-modality knowledge distillation network
作者:Muhao Xu;Lili Qu;Zihan Nie;Feng Li;Zhuangzhuang Chen;Qi Liao;Yi Wan;Sijie Niu;Runmin Cong;Xin Li;Weiye Song
期刊:Information Fusion
出版时间:2026/09/01
摘要:无监督异常检测(UAD)在医学影像中已成为一种有前景的方法,可以识别病理偏差而无需像素级标注。虽然大多数现有的UAD方法专注于单模态数据,临床诊断越来越依赖于多模态成像,特别是融合了代谢和解剖信息的PET/CT扫描,以增强病灶检测。然而,尚不存在用于使用PET/CT图像对进行未见类检测的基准数据集或专用方法。为了填补这一空白,我们构建了第一个用于无监督胸部异常检测的PET/CT数据集,利用PET在捕捉功能代谢活动方面的优势以及CT提供的高分辨率解剖结构。此外,我们提出了一种跨模态异常检测网络,该网络将基于蒸馏的无监督异常检测扩展到配对的PET/CT成像。该框架遵循一种反向知识蒸馏范式,在此范式中,从正常数据中学习到稳定的模态感知表示,并在不同模态间重构以揭示异常偏差。代替显式的补丁级交叉注意力,所提出的模型引入了一种令牌介导的多模态交互机制,该机制鼓励全局跨模态一致性。在解码过程中进一步采用了专门的全局细化策略以增强上下文特征聚合并提高对复杂异常模式的鲁棒性。在提出的PET/CT数据集和多个公共基准上的广泛实验表明,在强大的单模态基线之上实现了持续的性能提升,突显了通过建模正常性驱动的跨模态一致性来实现多模态医学异常检测的有效性。我们的代码可在以下网址获取:https://github.com/Xmh-L/TRMUAD
原文链接
用于不完整EHR的检索增强个性化模态恢复的多模态表示学习
原标题:Learning multimodal representations for incomplete EHRs with retrieval-augmented personalized modality recovery
作者:Bohao Li;Bowen Du;Junchen Ye
期刊:Information Fusion
出版时间:2026/09/01
摘要:随着电子健康记录(EHRs)的普及,多模态方法对于临床预测变得越来越有价值。然而,缺失的模式导致了模式不平衡以及融合性能下降。恢复缺失模态已成为缓解这一问题的有效方法。尽管如此,现有的恢复策略既不能有效地利用全球相似的条件作为模式独有的先验信息,也不能将其与患者自身的可用模式融合,导致患者特异性信息的丢失。为了填补这些空白,我们提出了RAMCare,一个两步缺失模态恢复框架,该框架结合了检索增强先验和混合专家偏移建模,用于不完整EHR表示学习,通过三阶段训练过程实现:(1)相关病例检索增强模块,通过协同聚类构建跨模式对齐的条件配对的全局案例库,从而能够高效地检索与条件匹配的独特于模态的先验,进行初步恢复;(2)混合专家偏移模块,基于检索权重和患者特定特征选择条件专家,将检索到的偏差映射为缺失模态的个性化偏移量,以捕捉个体差异并细化恢复;(3)微调阶段,进一步提升恢复和多模态融合性能。在两个具有缺失模态的真实世界数据集上,RAMCare达到了最先进的性能。
原文链接
基于模拟和测量压力信号融合的轴向柱塞泵弱异常检测
原标题:Weak anomaly detection of axial piston pumps by fusing information from simulated and measured pressure signals
作者:Zhongrui Wang;Qun Chao;Wentao Wang;Zhiqiang Zhang;Chengliang Liu
期刊:Information Fusion
出版时间:2026/09/01
摘要:轴向柱塞泵是液压系统中的关键动力部件,其异常检测对于电液设备的状态监测至关重要。排压信号通常用于评估泵的健康状况,因为它们对内部故障敏感,并且在实际液压系统中易于获得。然而,由于故障信号的稀缺性,使用压力信号对轴向柱塞泵进行异常检测具有挑战性。为解决这一问题,本文提出了一种基于测量压力信号和模拟信号的信息融合的弱异常检测方法,该方法无需故障训练样本。提出的框架解决了基于相似性的异常检测中的两个关键挑战:缺乏标准参考以及有效度量的构建。首先,建立轴向柱塞泵的计算流体力学(CFD)模型,生成模拟的卸荷压力信号作为参考。其次,通过计算参考压力信号和测量压力信号的加权图(WG)矩阵之间的相似性来构建一个评估泵健康状况的指标。比较实验表明,所提出的方法是唯一能够在轴向柱塞泵弱异常检测任务中达到100%准确率的方法。所提出的方法的清除值达到0.145,优于现有方法至少0.17,验证了构建的相似性度量的灵敏度。所提出的方法提供了一种可靠的方式来检测轴向柱塞泵中的异常而无需故障数据。
原文链接
结合偏好分解和社会网络拓扑的决策者简化方法
原标题:A decision-maker reduction method integrating preference disaggregation and social network topology
作者:Shuya Sun;Zaiwu Gong;Guo Wei;Weiwei Guo;María Ángeles Martínez;Enrique Herrera-Viedma
期刊:Information Fusion
出版时间:2026/09/01
摘要:在社会网络群体决策研究(SNGDM)中,决策者(DMs)数量的增加往往导致计算需求增大和网络结构复杂度提高。基于偏好分解范式和社会网络理论,本文提出了一种基于决策者评价维度和群体优化维度的决策者缩减方法。在DMs评估维度中,该方法选择社交网络属性作为衡量DMs重要性的指标。通过利用加性效用函数恢复间接偏好的能力,构建了一个偏好学习模型来识别能够保持节点局部和全局特征的关键网络评估指标,并计算节点效用来作为评价节点重要性的基础。在群体优化维度上,基于决策者提供的备选方案成对比较信息,该方法识别出具有代表性的有效决策者,他们能够准确反映整个群体的偏好。从而减少了决策复杂性并优化了决策过程。最后,通过一个案例研究验证了所提出方法的有效性,并进一步使用来自Karate俱乐部的真实网络数据测试该方法的泛化能力。结果表明,所提出的决策者缩减方法不仅简化了评价标准和决策者数量,而且有效地恢复了群体偏好,同时确保了偏好的一致性。
原文链接
混合池化异构图融合针灸处方推荐(HyPoHGF)
原标题:HyPoHGF: Hybrid pooling heterogeneous graph fusion for acupuncture prescription recommendation
作者:Shuqing Liu;Lianbo Tao;Guangxin Xie;Zhengzhao Yang;Wei Chen;Dexian Wang;Qiaofeng Wu;Tianrui Li;Shuguang Yu
期刊:Information Fusion
出版时间:2026/09/01
摘要:针灸是一种有效的治疗疾病的方法,并且在全世界广泛使用。然而,基于症状集的针灸处方推荐研究仍处于探索阶段。为了填补这一空白,我们提出了一种混合池化异构图融合(HyPoHGF)算法。具体来说,我们首先构建了一个针灸异构图(AcuHG)数据集,包含2325个处方。它包括464种症状,414个穴位以及26种穴位属性。然后,我们采用一种频率感知图卷积网络来进行节点之间的消息聚合,并利用子图聚合来学习症状、穴位以及穴位属性之间的复杂关系。接下来,使用了一种混合池化机制来生成主辅穴位预测得分。最后,在AcuHG数据集和一个公共的草药处方数据集上的广泛实验表明,HyPoHGF优于最先进的算法。本工作发布了首个公开的针灸处方推荐数据集连同源代码,可在以下网址获取:github.com/LONGsci/HyPoHGF。
原文链接

