大数跨境

Information Fusion-知识工程与数据挖掘-2026年最新论文11篇

Information Fusion-知识工程与数据挖掘-2026年最新论文11篇 AI新文
2026-08-24
3

由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。

基于上下文感知客户端协作的联合学习:挑战、进展和开放问题

原标题:Federated learning with context-aware client collaboration: Challenges, advances, and open problems

作者:Soroush Ziaeinejad;Saeed Samet

期刊:Information Fusion

出版时间:2026/12/01

摘要:联邦学习(FL)是谷歌于2016年引入的去中心化机器学习(ML)的一种变革性范式。它解决了去中心化机器学习中的主要挑战,尤其是在大数据环境中,如隐私、可扩展性和异构性。本文回顾了FL的基础知识,包括其在隐私敏感环境中的优势以及各种应用,如医疗保健、物联网(IoT)和智慧城市。它还考察了主要挑战,例如通信开销、计算成本和异构性。提出了一种分类法,根据数据分布、客户端参与情况、通信策略和聚合方法对FL设置进行分类。最先进的研究和框架从效率、隐私和性能方面进行了分析。本文进一步探讨了针对优化FL并一定程度上应对其实验挑战的上下文感知客户端协作策略。利用地理信息被提议通过将同一地区的客户进行分组来提高效率。课程学习建议在早期轮次优先处理数据更简单的客户,以建立一个坚实的基础,并逐步纳入数据更复杂的客户。基于数据相似性对客户进行聚类以提高性能并减少聚合期间的冲突。利用图神经网络(GNNs)探索拓扑优化,通过考虑客户端属性来动态调整通信模式。这些策略的潜力也根据提议的分类学进行了讨论。最后,概述了FL领域中的开放性挑战和未来研究方向作为潜在的研究路线图。


原文链接



融合全局和局部统计信息的数据估值

原标题:Data valuation by fusing global and local statistical information

作者:Xiaoling Zhou;Ou Wu;Michael K. Ng;Hao Jiang

期刊:Information Fusion

出版时间:2026/11/01

摘要:近年来,由于高质量数据在各种应用中的关键作用,数据估值引起了越来越多的关注。在各种数据估值方法中,基于夏普利值的方法由于其坚实的理论基础而占主导地位。然而,精确计算Shapley值通常在计算上是难以承受的,从而促使了众多近似技术的发展。尽管取得了显著的进步,现有方法通常忽略了价值分布信息的融合,并且未能考虑动态数据条件,从而损害了它们的性能和应用潜力。本文中,我们强调了价值分布的全局统计特性和局部统计特性在机器学习数据估值上下文中所起的关键作用。首先,我们对这些分布在各种模拟和真实世界数据集中的情况进行全面分析,揭示出宝贵的见解和关键模式。其次,我们提出了一种增强的数据估值方法,该方法将探索出的分布特征融合到两个正则化项中,以精炼夏普利值估计。所提出的正则化器可以无缝地融入各种现有的数据估值方法中。第三,我们介绍了一种新颖的动态数据估值方法,该方法在不重新计算Shapley值的情况下推断更新后的数据价值,从而显著提高了计算效率。进行了广泛的实验,包括Shapley值估计、基于价值的数据添加和移除、错误标记数据检测以及动态数据估值。结果展示了我们提出的方案的一致有效性和高效性,证实了全球和地区价值分配在数据估值中的重要潜力。


原文链接



AdaCycle:基于异构小波分解的全局统计自适应多周期检测与融合的时间序列预测

原标题:AdaCycle: Global statistical adaptive multi-cycle detection and fusion with heterogeneous wavelet decomposition for time series forecasting

作者:Jinze Du;Songmao Jiang

期刊:Information Fusion

出版时间:2026/11/01

摘要:准确检测和建模多尺度周期结构对于时间序列预测至关重要。现有的显式周期建模方法存在关键限制:样本级检测方法在单个序列上操作,观察有限,导致统计证据不足和跨样本不一致;手动指定方法缺乏适应性和跨数据集泛化能力;此外,现有方法对残差成分进行统一处理,未考虑低频和高频成分的根本不同特性,并且缺乏有效的机制来整合多个检测周期的特征。我们提出AdaCycle,一个全局统计自适应多周期检测与融合框架。具体来说,我们在完整的训练集上执行改进的频谱分析,自动识别多个主导周期(包括超出典型输入长度的长周期),并基于1/k准则引入自适应阈值策略,动态确定周期数和频谱权重。对于每个检测到的周期,我们采用可学习的循环周期进行显式建模,对去趋势残差应用平稳小波变换(低频趋势使用线性处理以保持平滑度,高频模式使用非线性处理以捕捉复杂动态),并通过轻量级压缩注意力高效融合多周期特征,从而在降低计算复杂度的情况下实现有效的跨周期交互。广泛的实验证明,AdaCycle在12个真实世界的数据集上显著优于现有方法,在有限的训练场景中实现了更高的准确率和跨样本一致性以及强大的数据效率。代码可在以下地址获取:https://github.com/Jsmcnhyk/AdaCycle.


原文链接



SCMoE-PFL:用于个性化联邦学习的软聚类专家混合框架

原标题:SCMoE-PFL: A soft-clustering mixture-of-experts framework for personalized federated learning

作者:Gongli Li;Xianzhong Jia;Weichen Liu;En Zhang;Zidong Wang

期刊:Information Fusion

出版时间:2026/11/01

摘要:传统的联邦学习(FL)方法依赖于单一的全局模型,在异构且非独立同分布(non-IID)的客户端数据分布下常常崩溃。个性化联邦学习(PFL)缓解了这一限制,但现有方法要么过度拟合本地数据,要么无法有效利用共享知识。为了解决这些挑战,本文提出了SCMoE-PFL,一个集成软聚类和专家混合(MoE)机制的个性化联邦学习框架,以调和全局泛化与局部个性化的矛盾。首先,我们介绍了一种多中心阈值基软聚类(MCTC)方法,使客户端能够参与多个聚类,提高数据利用率和聚类质量。其次,簇内聚合产生一组专家模型,而每个客户端分别在其高敏感性数据上训练一个私有模型,确保隐私保护。最后,一个轻量级的能量感知门控网络自适应地融合了专家模型和私有模型。通过用基于能量的预测置信度校准初始特征匹配权重,这一双重检查机制有效防止了对不确定专家的过度依赖,从而产生了高度可靠的个性化预测。四个基准数据集上的实验表明,SCMoE-PFL在中等和极端异构性下显著提高了准确率、收敛性和公平性,分别比FedAvg的最大准确率提升了24.71个百分点和26.01个百分点。理论分析进一步确立了性能下限,并阐明了该框架在隐私保护、计算效率和系统可靠性方面的优势。这些结果表明SCMoE-PFL为异构环境中个性化联邦学习提供了一个稳健且灵活的解决方案。


原文链接



可解释的时间图注意力网络和跨模态融合用于早期谣言检测

原标题:Interpretable temporal graph attention network and cross-modal fusion for early rumor detection

作者:Kuiyuan Ding;Shuhua Mao;Yingjie Yang

期刊:Information Fusion

出版时间:2026/11/01

摘要:在社交媒体广泛流行的情况下,谣言的迅速传播对社会稳定构成了严重威胁。因此,开发高效且准确的自动化谣言检测系统已成为一项关键任务。现有方法常常忽视传播的动态时间特征,采用简单的跨模态融合机制,并缺乏决策可解释性。解决这些挑战,我们提出了一种可解释的跨模态融合时序图注意力网络(TGA-CMF),用于早期谣言检测,在此中“跨模态”明确指异构融合文本语义、传播结构和时间动态。该模型的核心创新在于一个自适应的时间衰减图注意力网络(Temporal Decay GAT),它将“节点相对发布时间”作为动态属性来捕捉传播生命周期。同时,我们设计了一种全局结构引导的跨模态融合机制,利用全局图结构表示作为查询来选择性地过滤和聚合最具判别性的文本证据。得益于其时间感知能力以及支持双通道决策分析的透明架构,我们的模型在早期检测方面取得了优越的表现,如在PHEME等数据集上的实验所示。此外,在关键指标包括准确率和F1分数上,它显著优于基线模型。


原文链接



多模式结构精炼与融合用于异嗜性图谱

原标题:Multi-pattern structure refinement and fusion for heterophilic graphs

作者:Xiaosha Cai;Man-Sheng Chen;Yihong Lu;Chang-Dong Wang;Xiaokai Cao;Haizhang Zhang

期刊:Information Fusion

出版时间:2026/10/01

摘要:现实世界中的图经常表现出异质性和结构多样化的连通模式,在这种模式下,具有不同属性的节点很可能相互连接。传统的图神经网络(GNNs),虽然在同质图上有效,但在处理异质图时往往表现不佳。此外,在训练数据和测试数据之间不一致的结构分布,称为异类图结构分布迁移(HGSS),将导致模型泛化能力显著下降。为了解决这一挑战,我们引入了一个多模式结构精炼和融合(MSRF)框架,旨在自适应地增强图表示学习。MSRF首先自适应地推断并细化图的拓扑结构为多个不同的结构视图,在增强潜在的同质性结构的同时减轻异质性的不利影响。随后,通过多模式融合学习,该框架明确捕获了所有结构视角共有的共识语义模式,并生成了鲁棒的节点表示。广泛的实验表明,在七个基准数据集上,MSRF在HGSS下实现了更优的性能。此外,这些结果突显了我们采用自适应结构精炼和共识融合的双阶段策略在异质图上进行稳健节点分类的有效性。


原文链接



基于校准子类的再平衡(RCS):一种用于跨模式稳健不平衡分类的统计融合框架

原标题:Rebalancing with calibrated sub-classes (RCS): A statistical fusion-based framework for robust imbalanced classification across modalities

作者:Priyobrata Mondal;Faizanuddin Ansari;Swagatam Das

期刊:Information Fusion

出版时间:2026/10/01

摘要:类别不平衡,其中某些类别的数据不足,对稳健分类构成了关键挑战,常常使模型偏向多数类别。分布校准通过估计更准确的类别分布提供了一种有希望的方法来解决这一问题。在这项工作中,提出了一个用于稳健不平衡分类的新型分布校准框架——基于校准子类的再平衡(Rebalancing with Calibrated Sub-classes,RCS)。RCS旨在通过高斯成分的加权混合融合多数类和中间类分布的统计信息,以更准确地估计少数类参数。一个编码-解码网络被训练用于在不平衡的数据集中保持结构关系并防止特征分离。训练后,编码器提取的特征向量被利用来生成由校准后的分布引导的合成样本。这种基于融合的校准通过纳入邻域分布信息而不是仅仅依赖多数类统计量有效缓解了过度泛化问题。在多种图像、文本和表格数据集上进行的大量实验表明,RCS 一直优于几种基准方法和最先进的方法,突显了其有效性和解决现实世界中不平衡分类挑战的广泛适用性。RCS代码可在https://github.com/priyomondal/RCS获得。


原文链接



基于双维度降维和成本感知优化的共识排序融合框架

原标题:A fusion framework for consensus ranking via dual dimensionality reduction and cost-aware optimization

作者:Bin Yu;Jiaxin Lv;Yu Fu;Weiping Ding

期刊:Information Fusion

出版时间:2026/10/01

摘要:在大规模在线评分和排名环境中,不同的用户群体或子模型可能会出现冲突的排名,并且聚合风险会掩盖少数意见,引入偏见或导致低效。为了解决这一挑战,本文提出了一种共识导向的排名融合框架,称为CR-DDRDM(Consensus-Reaching Dual Dimensionality Reduction Decision Making)。该框架通过整合双维度降维、局部排名生成和共识优化来处理排名融合作为决策融合/信息融合问题。首先,为了缓解评分数据集中的高维度和数据稀疏性问题,我们应用基于余弦相似性的谱聚类(CLSC)和DBSCAN来减少对象和评分的维度,生成多个子排名来源或建模视角。在每种视角下,我们采用TOPSIS方法得出一个局部排序向量。接下来,我们设计了一个冲突检测和动态权重调整方案来解决排名来源之间的差异,利用加权科佩兰方法进行聚合。最后,我们引入了一种粒子群优化(PSO)机制来优化融合权重和精细排名调整,目标是同时最小化修改成本和最大化来源间的共识。在Booking.com酒店评级数据集上进行的实验证明了CR-DDRDM实现了93.75%的Top-10重叠率,优于传统排序、多属性决策以及融合方法。我们的框架不仅表现出色,而且还适用于其他在线评分/排名融合场景。本工作为在线平台提供了一种以共识为导向的、可优化的方法,在大规模异构排序条件下进行排名融合。


原文链接



高效的动态空间聚焦注意力模型用于时空交通预测

原标题:Efficient dynamic spatial-focused attention model for spatiotemporal traffic prediction

作者:Nan Ouyang;Wenkang Wan;Lei Ao;Shehui Bu;Xiaojiang Ren;Xin He;Kai Sheng

期刊:Information Fusion

出版时间:2026/10/01

摘要:准确的道路交通预测对于提高交通运输效率和减少碳排放至关重要。然而,现有的基于Transformer的空间时间(ST)模型通过均匀地关注所有空间节点而导致高昂的计算成本,尽管在大型交通网络中通常存在较强的冗余性和低熵传感器。为了解决这个问题,我们提出了一个基于Transformer的空间时间预测框架DSFA-former,该框架围绕动态空间聚焦注意机制(DSF-Attention)构建。DSF-Attention 通过学习到的投影动态筛选出具有信息量的空间节点,在缩减后的节点集上执行注意力机制,并将关注到的特征聚合为一个全局空间上下文,该上下文广播回所有节点。此设计抑制低熵或噪声节点,同时明确减少注意力复杂性而不牺牲关键的时间依赖关系。此外,DSFA-former整合了一个倒置特征嵌入策略和一个可学习的高斯核增强图注意力模块,用于建模时间动态性和结构化空间交互。在七个真实世界交通数据集上的实验表明,DSFA-former实现了先进的预测精度,在METR-LA、PEMS-BAY和BJTT上的平均误差分别减少了9.9%,11.1%和8.5%。此外,在四个数据集上的消融研究表明,DSF-Attention 显著提高了计算效率,与在相同计算环境下标准注意力机制相比,训练时间减少了51.18%,GPU 内存消耗减少了44.21%,同时提升了预测准确率。


原文链接



以节点为中心的多源自适应知识聚合用于低资源分类法完善

原标题:Node-centric multi-source adaptive knowledge aggregation for low-resource taxonomy completion

作者:Jingnan Zhao;Zhijuan Du

期刊:Information Fusion

出版时间:2026/09/01

摘要:分类法是组织领域知识的基本结构。分类学完善旨在在父节点与子节点之间插入新概念以细化层次粒度,然而在资源匮乏领域中,这一任务面临着标签稀缺、节点语义模糊以及结构不确定性等问题。我们提出MANTA-TC(多源自适应节点中心迁移用于分类完成),一个节点中心的多源迁移框架。MANTA-TC 使用局部结构上下文(父节点、同级节点和邻里信息)来建模每个节点,应用节点级别的自适应注意力机制选择相关的源域知识,并分离共享语义与特定于领域的语义。基于最大均值差异(MMD)的跨域对齐损失确保了不同领域之间的嵌入一致性实验表明,MANTA-TC在低资源环境下特别是在非叶节点概念插入方面显著优于现有方法。


原文链接



基于锚定高阶图到低秩张量的多视图聚类方法

原标题:A multi-view clustering approach via anchoring high-order graphs into a low-rank tensor

作者:Xi Guo;Hongmei Chen;Biao Xiang;Yong Mi;Zhong Yuan;Chuan Luo;Tianrui Li

期刊:Information Fusion

出版时间:2026/09/01

摘要:基于图的多视图聚类方法由于能够有效地建模复杂数据结构而吸引了广泛的关注。 这里没有需要特别处理的括号内容、缩写、数字与单位,因此直接进行常规翻译即可。注意保持原句意思不变。由于原文中并没有出现枚举情况,所以无需特别处理枚举格式。上述翻译符合要求。不过根据给定规则,重新调整输出格式如下: {然而,三个重要的挑战仍然存在:1)传统方法主要依赖于一阶邻域信息,使得捕捉样本之间的高阶结构关系变得困难。在不同视图之间保持高阶表示的一致性和多样性之间的平衡仍然是一个关键问题。3) 张量秩的凸替代函数通常引入估计偏差。现有方法难以在高维和大规模数据集上实现计算效率为了解决这些挑战,我们提出了一种新颖的方法,称为通过将高阶图锚定到低秩张量的多视图聚类方法(AHLT)。AHLT 通过跨视图扩散构建高阶图,使样本能够捕获同一视图内的以及不同视图间的高阶邻域结构。我们还设计了一种基于锚点的跨视图传播策略来构建高阶图,使AHLT能够高效地处理高维和大规模的数据集。此外,我们将高阶图和基于锚点的低秩张量表示集成到统一框架中,在该框架中,表示张量被分解成一致性和异质性两个组成部分。分别对这些成分施加张量核范数约束和视图特定的正则化项,以便在捕获全局跨视图相关性的同时保持视图间的多样性。我们还设计了一个非凸张量核范数以更准确地逼近真实的张量秩。在基准数据集上进行的大量实验验证了AHLT显著优于现有最佳方法。


原文链接



基于块术语分解的异构客户端可信分组以实现个性化联邦学习

原标题:Credible grouping of heterogeneous clients for personalized federated learning via block-term decomposition

作者:Tianchi Liao;Siran Zhao;Lele Fu;Sheng Huang;K. Ng Michael;Zibin Zheng;Chuan Chen

期刊:Information Fusion

出版时间:2026/09/01

摘要:聚类联邦学习(FL)通过将具有相似数据分布的客户端分组到同一集群中,在个性化建模方面展示了有希望的结果。然而,现有方法要么在训练前固定客户端分组,这限制了分组的灵活性,要么在训练过程中确定分组,这导致效率低下。此外,簇内模型通常是通过简单的加权聚合获得的,这往往会稀释重要的模型信息并引入聚合偏差。为了解决这些问题,我们提出了基于块术语分解(BTD)的新型联邦学习框架FedBTD,该框架可信地对客户端进行分组,并执行非线性组内聚合。通过将客户的分类预测层压缩成张量并应用BTD,FedBTD提取结构模式来识别相似的客户并推导出组级别的模型,从而在过滤掉无关信息的同时实现有效的知识共享。与传统的聚类方法不同,FedBTD 支持在训练过程中动态重组,并避免了线性聚合带来的信息损失。广泛的实验表明,在各种异构数据设置下,FedBTD始终优于17种最先进的FL方法。


原文链接



嗅觉:多源流式共识嵌入用于时间序列数据融合

原标题:SCENTS: multi-source streaming consensus embedding for time series data fusion

作者:Jonne van Dreven;Abbas Cheddad;Sadi Alawadi;Ahmad Nauman Ghazi;Jad Al Koussa;Dirk Vanhoudt

期刊:Information Fusion

出版时间:2026/09/01

摘要:本文提出了SCENTS,一种时间序列流式共识嵌入(Streaming Consensus Embedding for Time Series),该方法将流式窗口融合成单一的低维表示,适用于各种下游任务。首先,它学习一个去噪的低维潜在基础用于状态初始化()。其次,对于每个新到达的流,它执行一个接近线性时间的多遍共识更新,将新的亲和度直接融合到Z中我们通过各种真实世界的多源工业数据集验证了收敛性并证实了我们的假设,在流式共识聚类任务上。与会随着时间累积噪声的传统管道不同,需要昂贵的共关联矩阵或特征分解,SCENTS 产生一个线性内存共识嵌入,该嵌入沿流处理时间轴单调改进,并生成高质量分区。此外,SCENTS 设计用于与任何固定编码器集成,从而实现轻量级流式共识适应层的实施。生成的嵌入提供了一种紧凑且可重复使用的表示形式,支持聚类之外的各种下游任务,从而为数据分析提供了可扩展和通用的融合层。


原文链接



让两图对话:自监督双图重建在多模推荐中的应用

原标题:Let two graphs talk: Self-supervised dual-graph reconstruction for multimodal recommendation

作者:Hongjian Ma;Yan Zhang;Yahui Zhou;Bing Yang;Dunhui Yu;Zhifei Li

期刊:Information Fusion

出版时间:2026/09/01

摘要:多模态推荐旨在融合多模态信息提供更加个性化的推荐。现有方法通过捕获项目之间的语义关联并构建用户-项目交互图已取得了显著成功。然而,这些方法仍然存在以下两个限制:(1) 仅在空间领域构建项目-项目图容易引入由于模态相似性导致的噪声。在稀疏的用户-项目交互图上执行图卷积会放大流行度偏差并加剧冷启动问题。2)为了解决这些问题,我们提出了一种名为自监督双图重建多模推荐(DuGRec)的新方法,该方法利用双图重建学习来建模用户偏好。具体来说,为了消除模态冲突噪声,我们通过整合空间视图、频谱视图和共现视图的多视角相似性对原始项目间关系进行重新加权和剪枝,移除噪声边,从而获得去噪后的项目间重构图。然后,我们使用来自项目-项目图的内容关系重构用户-项目交互图以缓解稀疏性和冷启动问题。此外,我们设计了一个多视图对比学习任务来提高ID嵌入和多模态特征的质量,最终生成稳定的用户和项目表示。我们在五个公开的数据集上进行了广泛的实验。实验结果表明,所提出的DuGRec在召回率@10和NDCG@10方面分别比基线模型平均提高了7.94%和9.78%。我们的代码位于https://github.com/HubuKG/DuGRec。


原文链接



【声明】内容源于网络
0
0
AI新文
AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
内容 257
粉丝 0
AI新文 AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
总阅读4.4k
粉丝0
内容257