由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。
不确定数据上的夏普利值
原标题:Shapley Value on Uncertain Data
作者:Zhuofan Jia; Jian Pei
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/20
摘要:夏普利值提供了一个根据参与者贡献分配奖励的原则框架。现有的数据估值方法通常假设每个参与者贡献一个固定的数据集。然而,在实践中,数据通常作为来自潜在分布的随机样本提供,从而使得出的Shapley值成为一个随机变量。我们为概率数据分布制定了夏普利值,并对其期望和方差进行了表征,以量化平均贡献及其抽样不确定性。我们尽可能地推导出封闭形式的表达式以及无偏的经验估计量,并对其性质进行统计分析。我们进一步发展了三种蒙特卡洛估计方法:一种基于独立采样的基准方法,一种通过样本重用来减少源数据访问的池化方法,以及一种根据玩家特定变异性自适应分配采样预算的分层池化方法。在合成数据集和真实数据集上的实验表明,所提出的方法能够准确估计概率Shapley值的各阶矩,而联合方法在受限源数据访问条件下显著提高了估计稳定性。这项工作将夏普利值分析从确定性数据集扩展到概率数据分布,提供了一个不确定性的数据估值实用框架。
原文链接
协同双重代理:增强深度图聚类的凝聚性和分离性
原标题:Synergistic Dual Proxies: Enhancing Cohesion and Separability in Deep Graph Clustering
作者:Yixiang Dong; Zhen Peng; Xi Liang; Huan Liu; Minnan Luo; Dalin Zhang
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/20
摘要:深度图聚类旨在通过联合学习节点表示和聚类分配将节点划分为有意义的簇。为此,现有方法依赖于隐式的软分配,这通常会产生重叠且边界模糊的簇,或者依赖于硬分配,后者专注于靠近簇核心的高置信度节点,从而忽视了关键边界节点,并导致显著的计算开销。这些缺陷导致聚类结构定义不清晰以及对于大型复杂图的可扩展性有限。为了解决这些限制,我们提出了DP-Net,一个引入协同双代理机制的端到端框架。我们的方法利用内部聚类中心(ICC)来加强簇内的凝聚,并引入新型的外部聚类顾问(ECC),这些顾问是由边界节点动态形成的,用以明确建模和界定簇间的边界。通过将这些互补的代理整合到一个统一的双代理聚类损失中,并通过多视图一致性正则化进行稳定,DP-Net 有效地平衡了吸引节点向聚类核心靠拢的同时将其排斥在模棱两可区域之外。广泛的实验表明,DP-Net在八个不同的数据集上不仅实现了优越的聚类性能和对图扰动的鲁棒性,并且随着图规模的增长接近线性扩展,在聚类质量和计算效率方面均优于最先进的方法。
原文链接
基于张量的时空数据插补综述:知识工程视角及建模策略
原标题:A Survey on Tensor-Based Spatiotemporal Data Imputation: Knowledge Engineering Perspectives and Modeling Strategies
作者:Xiaoyue Luo; Shifen Cheng; Yuxuan Liang; Zhengyang Zhou; Peixiao Wang; Feng Lu
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/19
摘要:缺失的时空数据在交通预测、气象分析和城市治理等领域普遍存在。张量分解由于其能够建模多维交互的能力已成为时空数据插值的突出技术。最近的研究表明,纳入结构化的先验知识——例如时空相关性、时空异质性和地理相似性——是提高插补性能的关键。然而,一个将这些先验知识与数据驱动模型相结合的系统框架仍不完善。为了填补这一空白,本调查从知识工程的角度系统地回顾了在基于张量的插值中建模时空效应的战略。我们提出了一种以表示时空效应机制为中心的分类法,其中包括三种主要建模途径:时空相关性,时空异质性和地理相似性。我们进一步总结了代表性方法的建模机制、优化目标和算法实现。交通运输、气象学和环境科学等领域的应用和资源也进行了审查。最后,我们讨论了挑战和未来的研究方向,重点关注模型泛化、不确定性量化以及因果机制的整合等问题。本调查为张量插补中的时空知识建模提供了全面的方法论基础,奠定了开发更通用的、可解释的和地理适应性的智能插补模型的理论基础。
原文链接
基于衰减参与强度的连贯子超图模型(Hypercore)
原标题:Thes -Hypercore: A Cohesive Subhypergraph Model Based on Decayed Engagement Strength
作者:Minseok Kim; Dahee Kim; Taejoon Han; Junghoon Kim; Seongil Wi; Jonghyeok Park
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/19
摘要:超图提供了多向交互的自然表示方法,使凝聚子超图发现成为理解复杂系统中高阶结构的基本任务。现有的连通子超图模型常常被过大尺寸的超边以及参与多个无关组中的节点所误导,导致弱关联或偶然关联显得异常强烈。在这项工作中,我们引入了$s$-超核心,这是一种单一参数的连通子超图模型,通过超图诱导的参与强度公式来表征节点的连通性。这种表述同时考虑了两种结构效应:大型群体内部互动的减弱以及分散参与导致的关系重要性的稀释。通过将这些效应整合到一个衰变驱动的交互指标中,$s$-超核心倾向于支持紧凑且一致的邻里关系,这种关系依赖于多重有意义的联系,而不是依靠对每个邻居的刚性约束。我们开发了高效的算法用于$s$-超核心计算和完全层次分解,这些算法直接在超图上操作而不显式地实现和存储诱导的加权成对投影,其大小可以是节点数量的二次方。在真实世界和合成数据集上的广泛实验表明,$s$-超核心比现有模型揭露了更多稳定且结构上连贯的子超图,同时有效地扩展到大型网络。
原文链接
从大型语言模型中可靠地蒸馏推荐理由用于对话推荐(Recommendation Rationales from Large Language Models for Conversational Recommendation)
原标题:Reliable Distillation of Recommendation Rationales from Large Language Models for Conversational Recommendation
作者:Hyeongjun Yang; Donghyun Kim; Kyuhwan Yeom; Kyong-Ho Lee; Byungkook Oh; Xiongnan Jin
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/18
摘要:对话推荐系统(CRSs)旨在通过对话交互提供个性化推荐。先前利用知识图谱(KGs)的方法,被称为基于知识图谱的CRSs,在融合领域特定知识后表现出强大的性能。然而,他们常常难以从对话中理解用户的上下文条件,以便进行上下文敏感的推荐。相比之下,大型语言模型(LLMs)擅长理解对话的上下文,但它们在CRS任务中的简单应用显示出缺乏领域知识。为了解决这些问题,我们提出了RADAR,一种结合了基于KG的CRS的力量以及LLMs的上下文推理能力的新方法。相应地,我们的方法利用一个大语言模型从对话中提炼推荐理由,这些理由由上下文条件和偏好实体组成。此外,我们设计了过滤和评分机制以增强提炼出的理由的可靠性。这些高质量的理由被注入到一个较小的推理器中,消除了对大型语言模型进一步依赖的需要,同时使推理器具备生成准确且上下文敏感理由的能力。利用专门的推理器,我们开发了全面的用户和项目表示,从而能够推荐其内容与推断出的上下文条件一致的项目。在响应生成中,我们通过上下文条件和推荐项目的领域知识来改进推荐解释。广泛的实验表明,在两个CRS基准数据集上,RADAR显著优于现有基线,并提供了类似人类的推荐和响应。
原文链接
针对基于强化学习的推荐系统的高效中毒攻击
原标题:Efficient Poisoning Attacks Against Reinforcement Learning-Based Recommender Systems
作者:Quan Yuan; Linkang Du; Min Chen; Mingyang Sun; Yunjun Gao; Peng Cheng
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/18
摘要:推荐系统在不同场景中发挥着预测和建议相关选项的重要作用,包括电子商务、社交媒体和流媒体服务。目前,基于深度强化学习(DRL)的推荐系统在工业界和学术界都获得了巨大的流行度,例如Spotify,Netflix,Google和YouTube,因为DRL能够建模用户与系统之间的长期互动,从而增强推荐体验。本文说明了攻击者可以通过插入用户与系统之间恶意构造的交互数据来操纵基于深度强化学习(DRL)的推荐系统。对这些系统的投毒攻击被建模为一个非凸整数规划问题。为应对这一挑战,提出了一种三阶段框架(named ePARL),旨在最大化命中率(例如,目标项目在用户的推荐中出现的比例)的同时确保高效率并规避检测。ePARL的见解是在保持其他项目排名不变的情况下提高目标项目的排名。ePARL支持在一个轮次中生成多个虚假用户记录,有效降低攻击成本。考虑到强化学习的顺序决策特征,ePARL重新组织虚假用户的项目顺序,模仿正常用户的行为序列特征,这是以前文献中经常被忽略的一个因素。在几个真实世界的数据集上的实验揭示了ePARL的鲁棒性和有效性,以及其相对于相关检测方法的优越隐蔽性
原文链接
动态高竞争工作负载下的两阶段锁定优化
原标题:Two-Phase Locking Optimization Towards Dynamic High-Contented Workloads
作者:Donghui Wang; Qiyu Zhuang; Yuxing Chen; Chengyao Jiang; Anqun Pan; Wei Jiang
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/17
摘要:两阶段锁定(2PL)是一种基本且广泛应用的并发控制协议。它通过在事务执行期间遵循特定的锁获取和释放顺序来管理对数据库数据的同时访问,从而确保事务隔离性。然而,在严格的2PL中,事务必须等待冲突的事务提交并释放它们的锁,这降低了并发性和系统吞吐量。我们观察到这个问题在腾讯高并发的工作负载中更为严重,其中锁竞争可以严重降低系统性能。现有的优化在高竞争场景中展示了一些有效性,但其性能仍然不足,因为它们遭受锁竞争和热点访问等待的问题。本文介绍了腾讯数据库TXSQL中实现的锁管理优化,特别关注高争用场景。首先,我们讨论了我们的动机以及通向通用锁优化的旅程,其中包括轻量级锁管理,无复制活动事务列表,以及有效提高并发性的队列锁定机制。其次,我们引入了一种热点感知的方法,使某些高度冲突的事务能够切换到组锁定方法,在特定的热点处对冲突的事务进行分组,并允许它们在未提交的状态下在一个冲突组中按顺序执行,而无需加锁,从而减少锁竞争。我们的评估表明,在高负载工作量下,TXSQL 分别比最先进的方法和系统实现了最高达 6.5 倍和 22.3 倍的性能提升。
原文链接
DBLTD:用于多变量数据分析的深度贝叶斯低秩张量分解
原标题:DBLTD: Deep Bayesian Low-rank Tensor Decomposition for Multivariate Data Analysis
作者:Yunbo Tang; Yuanlong Yu; Dan Chen; Rajiv Ranjan
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/17
摘要:低秩张量分解由于其捕获多变量数据中各种数据属性相关联的潜在表示的能力,在多变量数据分析领域引起了越来越多的关注。然而,现有的研究仍然具有有限的能力来表示多变量数据内的非线性关系。此外,在源数据中嵌入了密集噪声以及初始张量秩设置不当的情况下,它们的性能往往会下降。为应对挑战,本研究提出了一种深度贝叶斯低秩张量分解(DBLTD)框架来处理多变量数据:1)DBLTD 首先建立了一个概率张量分解模型,并在因子矩阵和噪声张量上施加了高斯-伽玛稀疏先验以诱导多域因素的稀疏成分并分别从源数据中分离出噪声,2)基于多个卷积块设计了一个生成卷积网络以自训练方式产生深层因子及其参数的分布,3)该框架开发了一种具有保证收敛性的深度变分贝叶斯推理算法用于模型训练,在损失函数中包含重建误差和对深层因子及参数的稀疏约束项。实验结果表明,在多种多变量数据集上,DBLTD能够有效地学习张量秩并在多变量数据分析过程中减少各种噪声的影响。此外,DBLTD在基于分解的医学应用中表现出显著优势,如盲源脑电去噪、结构化脑电特征构建以及MRI图像恢复。
原文链接
知识规划:用于时间知识图问答的检索增强大型语言模型
原标题:Plan of Knowledge: Retrieval-Augmented Large Language Models for Temporal Knowledge Graph Question Answering
作者:Xinying Qian; Ying Zhang; Yu Zhao; Baohang Zhou; Xuhui Sui; Xiaojie Yuan
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/14
摘要:时间知识图谱问答(TKGQA)旨在通过利用来自时间知识图谱(TKGs)的事实信息来回答时效性问题。以往的研究虽然利用了预训练的TKG嵌入或图神经网络注入知识,但未能充分捕捉时间约束的复杂语义。最近,大型语言模型(LLMs)取得了显著的进步,得益于其强大的语义理解和推理泛化能力。然而,他们的时间推理能力仍然有限,常常遭受幻觉和知识空白的困扰。为了解决这些限制,我们提出了PoK,一个配备对比时序检索器的知识计划框架。具体来说,知识计划模块根据预定义的操作符将一个复杂的时序问题分解成一系列子目标,在推理层面提供中间指导以探索推理过程。同时,我们构建了一个时间知识存储库(Temporal Knowledge Store,TKS),采用对比检索框架,使模型能够从时间知识图谱中检索出语义和时间上对齐的事实,从而在表示层面上增强时间建模。通过结合结构化规划与时间知识检索,PoK 提高了时间推理的可解释性和事实一致性。在四个基准TKGQA数据集上进行的大量实验表明,PoK显著提高了检索精度和推理准确性,超越了最先进的方法高达35.3个百分点。
原文链接
交互推荐中表征学习的对比范式
原标题:A Contrastive Paradigm for Representation Learning in Interactive Recommendation
作者:Jingyu Li; Zhiyong Feng; Shizhan Chen; Dongxiao He; Qinghang Gao; Hongqi Chen
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/12
摘要:交互推荐(IR)近年来吸引了相当多的关注。IR代理通常利用深度强化学习(DRL)来捕捉用户的独特动态兴趣和需求。然而,在线推荐系统中训练深度强化学习代理具有挑战性,原因是动作空间大以及样本效率低问题。我们发现解决这一挑战的原则是将邻里协作信息整合到表示中。为了实现这一理念并应对挑战,我们提出了CPIR(交互推荐中表示学习对比范式),它包括三种对比学习(CL)方法,一种数据采样机制以及一种代理训练机制。CL方法分别从序列比对、兴趣偏序、兴趣社区协同过滤的角度出发。推荐代理可以在提取的表示之上更高效地优化自身。数据采样和智能体训练机制确保了在信息检索(IR)中多任务训练的稳定性和一致性。此外,我们已经从理论和实验上解释了CPIR的有效性。ResponseBodyMissMatch 注意:上述响应中存在一个标点符号错误,正确的翻译应该是去掉句尾的全角引号,并且确保所有标点符合中文习惯。以下是修正后的正确答案:{在Virtual-Taobao和ML-1M上进行的大量实验表明,在基于DRL的信息检索代理训练过程中样本效率有了显著提升。
原文链接
协作引导扩散的序列推荐
原标题:Collaborative-Guided Diffusion for Sequential Recommendation
作者:Yanwei Xu; Ye Tian; Fangcheng Fu; Peichao Lai; Guoli Wu; Lianyong Qi
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/12
摘要:顺序推荐旨在根据用户的历史交互序列预测符合其偏好的下一个项目。传统的顺序推荐方法可以看作是基于理解的方法,在这种方法中,下一个相关项目通过分析用户的历史互动和评分模式来确定。最近,基于扩散的模型作为一种有前景的方法出现,专注于学习数据分布而不是明确地挖掘序列模式。然而,现有的基于扩散的方法仍然面临两个限制。tool_call>คณะกรรม員:看起来你提供的翻译中存在一些格式上的小问题,比如句末的标点符号使用了全角符号“。而不是半角符号“.”。以下是修正后的正确输出形式,请参考:{首先,他们经常通过转换将离散的目标项目映射到连续的空间中,无法准确地以反映未来用户偏好的方式建模目标项目。其次,现有的条件引导扩散模型依赖于从序列内部模式中得出的显式条件,而忽视了序列间的协作信号,这阻碍了用户偏好建模的鲁棒性。为了弥合协作信号和扩散模型之间的差距,我们提出了DCDRec,一种双协作信号引导的扩散推荐模型。具体来说,在目标项目表示方面,我们采用了一种基于跨注意力的编码器来获取上下文感知的目标项目嵌入。对于条件指导建模,我们引入社会同质性理论和项目间亲和力到条件生成过程中,提出了一种双协同信号引导的去噪机制来生成新项目。大量的实验展示了DCDRec的有效性及其优于最先进的方法。
原文链接
大型语言模型驱动的知识图谱工具评估框架
原标题:LLM-Powered KG Utility Evaluation Framework
作者:Pangjing Wu; Xiaodong Li; Wenqi Fan; Qing Li
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/11
摘要:知识图谱(KGs)在支持知识密集型任务方面显示出了巨大的潜力,表明了需要准确识别高价值知识图谱的评估方法。现有的知识图谱效用评估方法仍然受限于依赖手动设计的任务,缺乏结构层面的评估,以及依赖知识图谱对齐训练。这些限制降低了评估准确性并要求完全访问KG数据。为了克服这些不足,我们提出了一种新型的大语言模型(LLM)驱动的知识图谱工具评估框架。我们的框架通过将每个知识图谱与相应的大型语言模型集成起来,以实现互动问答,从而将知识图谱效用评估作为类似人类的知识评估。这种设计消除了手动设计任务的需要,支持灵活的结构评估,并避免了跨知识图谱表示对齐。具体来说,该框架首先将每个知识图谱分割成语义连贯的知识概念,并在其中抽样代表性子图以生成问题。然后利用对等KG通过LLM引导的知识检索来回答这些问题,最后使用校准评分估计KG效用。为了验证我们的贡献,我们开发了一个知识图谱效用基准,包括来自不同领域的四个知识图谱对。广泛的实验表明,我们的框架在准确性上优于17种基线方法,并且显著减少了三元组采样,突显了其在知识图谱效用评估中的鲁棒性和实际有效性。
原文链接
基于大规模语言模型的知识图谱问答结构剪枝
原标题:Structure Pruning with LLMs for Knowledge Graph Question Answering
作者:Mufan Xu; Kehai Chen; Xuefeng Bai; Muyun Yang; Tiejun Zhao; Min Zhang
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/11
摘要:知识图谱问答(KGQA)需要在大型结构化搜索空间中进行多步推理,在此过程中,自由形式的大语言模型规划可能会臆想出中间子图或查询草图,并产生不可执行的推理。我们提出READS,一个约束引导的判别推理框架,通过将其重新表述为子图搜索、基于约束的剪枝和答案选择,并通过在KG锚定选项上的选择而非开放词汇生成来解决每一步。READS 从 KG 可达的候选者构建一个词级别的受限解码树,并使用大语言模型评分来遍历和剪枝搜索空间,提高可执行性和忠实度。READS 通过解析带有标注的 SPARQL 查询来获取训练监督,假设基准提供的主题实体。在WebQSP和CWQ上,READS在Hits@1/F1指标上分别达到0.840/0.845和0.802/0.820,优于强大的基于LLM的基线模型。
原文链接
高效的多查询优化连续子图匹配流图算法(Efficient Multi-Query Optimization for Continuous Subgraph Matching over Streaming Graphs)
原标题:Efficient Multi-Query Optimization for Continuous Subgraph Matching over Streaming Graphs
作者:Ziyi Ma; Xinming Ma; Jianye Yang; Liang Yang; Lihua Yin; Xuemin Lin
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/11
摘要:连续子图匹配(CSM)是分析动态图的一个关键任务,并且在诸如商户欺诈检测、网络攻击追踪和谣言检测等众多领域有着广泛的应用。尽管最近提出了许多高效的CSM算法,但它们主要设计用于处理单个查询。然而,在某些应用场景中,面向多查询的连续子图匹配(MQCSM)更为关键。据我们所知,现有的两种MQCSM解决方案由于性能不令人满意而过时了。在本文中,我们提出MQ-Match,一种用于MQCSM的有效方法。我们设计了一种紧凑的索引结构,称为候选分类图(CCG),用于维护数据图中的局部匹配关系并剪枝无效的候选扩展。我们进一步开发了一种基于共享匹配树的计算共享增量匹配方法,在这种方法中,查询图之间的公共结构在每次图更新时被合并并处理一次。为了减少由自同构引起的冗余搜索,我们引入了一种优化方法MQ-Match∗。具体来说,我们引入了一个基于排除集的优化方法,该方法修剪对称搜索分支,并直接生成对称结果。在真实数据集上的大量实验表明,在大多数情况下,MQ-Match∗ 达到了比现有方法高2.0倍至37280.7倍的加速效果,并且使用了远少得多的内存,同时扩展到了数十亿边的图。
原文链接
数据与知识双驱动的文本嵌入方法综述
原标题:Data and Knowledge Dual-Driven Text Embedding Approaches: A Survey
作者:Xiaoyin Chen; Jiaqing Zhan; Jiayi Lin; Han Liu; Qin Zhang; Junyang Chen
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/11
摘要:文本嵌入已成为自然语言处理中的关键技术,有助于机器有效理解和处理文本信息。随着像大型语言模型(LLMs)这样的数据驱动方法的不断进步,文本嵌入变得更为丰富且质量更高。然而,研究人员已经发现了纯粹基于数据的方法的局限性,这些方法可能缺乏可解释性和逻辑一致性。相反,纯粹基于知识的方法需要专家投入大量的手动劳动来设计规则,导致效率低下。为了克服这些挑战,研究人员探索了集成数据驱动和知识驱动方法的结合,称为数据和知识双驱文本嵌入(DKDTE)。本文介绍了将现有文本嵌入方法分类成三大类的新颖分类法,即知识驱动的方法(data-driven approaches)、数据驱动的方法(knowledge-driven approaches)和双驱方法(dual-driven approaches)。我们提供了对具有输入粒度区别的文本嵌入的正式定义,专门的应用任务概述,评估基准集(包括MTEB,BEIR和AIR-Bench),以及现实世界中的应用。我们提供了不同类别之间代表性方法的全面比较,并讨论了最新的进展包括基于LLM的嵌入方法、指令调优的嵌入范式以及多模态知识集成。我们也指出了有前景的未来研究方向,包括去偏见化、探索多样化的知识来源以及数据污染缓解。
原文链接
GEM-Distill:基于MLP的图分类的图集成多级蒸馏
原标题:GEM-Distill: Graph Ensemble Multi-Level Distillation for MLP-Based Graph Classification
作者:Minghao Qin; Donghai Guan; Weiwei Yuan; Shuai Xu; Ç etin Kaya Koç
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/10
摘要:图神经网络(GNNs)在图学习任务中表现出色,但其消息传递计算阻碍了其在资源受限环境中的部署。图神经网络到多层感知机(G2M)知识蒸馏通过将图神经网络的知识转移到轻量级的多层感知机学生模型来提高推理效率;然而,现有方法主要针对节点分类,并且在监督稀疏、教师全局语义难以转移以及多层感知机学生模型结构表达能力有限的图分类任务中泛化效果较差。本文介绍了GEM-Distill,一个用于基于MLP的图分类的图集成多级蒸馏框架。GEM-Distill 将图级别、子图级别和节点级别的目标分配给特定粒度的多层感知机专家,并通过一个从粗到细的顺序训练策略协调它们,在缓解跨粒度优化冲突的同时保持互补的结构监督。它进一步介绍了虚拟邻居引导图蒸馏(Virtual-Neighbor Guided Graph Distillation,VNGD),这是一种仅在训练过程中使用的图级别蒸馏模块,通过混合语义相关的训练图来丰富全局监督。在标准和大规模图分类基准测试上的实验表明,GEM-Distill 达到了与现有 G2M 基线相当或更强的性能,同时保持了高效的 MLP 风格推理。进一步的稳健性分析、参数对齐比较、效率以及教师架构分析进一步支持了该框架的有效性和实用性。
原文链接
CoRas:用于分布外图的图理据选择的合作理据选择
原标题:CoRas: Cooperative Rationale Selection for Graph Rationale Learning in Out-of-Distribution Graphs
作者:Fangzhou Yao; Linan Yue; Weibo Gao; Qi Liu; Enhong Chen
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/10
摘要:解决训练集和测试集之间的分布偏移对于图神经网络(GNNs)至关重要。图理据学习作为一种有效的方法出现,通过提取不变子图作为预测的理据来应对这一挑战。然而,现有方法通常依赖于理性提取器产生的子图,而不明确评估其可靠性,特别是在早期训练阶段,当提取器容易生成不准确或有偏见的理性时。使用如此不可靠的理由可能会误导分类器,并进一步恶化理由的质量,最终损害泛化性能。在本文中,我们重新思考了图推理学习的目标,并提出了合作推理选择(CoRas),一种旨在增强推理表示可靠性和鲁棒性的新型架构。具体而言,CoRas 采用了一个双分类器框架来协同选择可靠的依据。受小损失准则的驱动,CoRas 优先选择预测损失低的理由,同时选择预测差异高的理由以减轻仅依赖自我预测训练所造成的选取偏差。这使得CoRas能够有效地选择可靠的论据用于下游任务,从而增强图论据学习。实验结果表明,无论是真实世界的基准测试还是合成数据集,CoRas 在提取可靠的推理子图方面都有效,有助于应对图分类中的分布外图设置。代码发布于https://github.com/fannazya/CoRas。
原文链接
时序向量数据的近似最近邻搜索
原标题:Approximate Nearest Neighbor Search over Temporal Vector Data
作者:Yuxiang Wang; Ziyuan He; Yongxin Tong; Zimu Zhou; Zijie Ma; Yiman Zhong
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/10
摘要:无结构数据(如图像和文本)正越来越多地被表示为高维向量,用于新兴的人工智能应用,例如检索增强生成。这些应用中的一个关键操作是查询既语义相似又时间上相关的向量。此操作可以表述为时间戳近似最近邻搜索(TANNS),其中向量和查询都包含时间属性,旨在检索在给定的时间戳下有效的近似最近邻。一个简单的解决方案是为每个时间戳创建单独的索引,这使得精确且快速的搜索成为可能,但会导致更新延迟高以及存储需求过大。在本文中,我们介绍了时间戳图(timestamp graph),一种支持快速索引更新的同时最小化存储成本的新颖结构。利用有效向量中变化的时间局部性,我们的时间戳图有效地管理了跨越所有历史时间戳的统一索引,从而大大减少了存储开销。此外,我们设计了历史邻接树,进一步将空间复杂度压缩到单时间戳索引的程度。此外,我们将时间戳图和压缩时间戳图扩展以支持区间近似最近邻搜索(IANNS)查询——一种指定时间段并在该时间段内检索有效最近向量的TANNS查询的一般形式。在五个数据集上的广泛评估表明,我们的方法实现了超过99%的准确率,同时比现有解决方案提高了查询效率3.3倍至138.1倍。
原文链接
因果DX:使用LLM引导的因果推理诊断长尾和级联云事件
原标题:CausalDX: Diagnosing Long-Tail and Cascading Cloud Incidents With LLM-Guided Causal Reasoning
作者:Zhuo Chang; Yinjun Wu; Haozhe Feng; Yang Li; Yide Fang; Liangzu Liu
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/10
摘要:现代云平台由于规模驱动的涌现行为和复杂系统相互依赖性而面临诊断挑战日益加剧。然而,当代诊断系统只能处理那些已经充分理解的故障模式,留下了两个关键盲点,阻碍了系统的可靠性:(1) 长尾诊断瘫痪,在这种情况下,罕见异常逃避基于模式的检测,尽管它们所占比例很小,却消耗了超过60%的诊断时间;(2) 级联异常过载,在这种情况下,指数级庞大的异常组合导致虚假相关性,使得区分表面症状和根本原因变得困难。为了填补这些空白,我们引入了CausalDX,一种新颖的诊断框架,利用LLMs作为因果推理引擎来扩展诊断系统的泛化能力。我们的框架包括三个关键组成部分:(1) 一个异常粒度因果图表示,它将事故诊断结构化为系统化的图遍历过程,使推理清晰且可解释;(2) 自适应基于图的根因搜索(AGRCS)算法,该算法结合了专家规则和LLM代理,将复杂的根因分析分解成可管理的步骤;以及(3) 基于观察的自我验证机制,该机制使用变分推断来验证根因置信度是否符合实际系统的观测结果。在真实世界的云故障上的广泛评估表明,CausalDX 实现了显著改进:自动诊断成功率为 73.2%,长尾异常的召回率为 35.2%(up to 3× over LLM-based SOTA),级联场景中的精确率为 68.4%(3.2× over current systems)。验证机制减少了由幻觉引起的假阳性(17.9%)。这些结果表明我们的设计有效地利用了LLM进行适应性、可解释性和可靠的云事故管理。
原文链接
FedMixer:用于时间序列预测的异质性鲁棒联邦学习
原标题:FedMixer: Heterogeneity-Resilient Federated Learning for Time Series Forecasting
作者:Boyu Fan; Maryam Sabzevari; Xiang Su; Sasu Tarkoma; Pan Hui
期刊:IEEE Transactions on Knowledge and Data Engineering
出版时间:2026/08/07
摘要:时间序列预测(TSF)通过对历史和当前的时间序列数据进行建模来预测未来的趋势,广泛应用于各种领域以增强决策制定、优化资源配置和提高运营效率。然而,传统的时空融合方法越来越受到数据隐私担忧和对大规模数据集需求的挑战。联邦学习(FL)是一种分布式训练框架,允许模型在客户端本地进行训练。然而,客户之间时间序列数据的异质性显著影响模型性能。与研究充分的领域如图像分类不同,在时间序列分析中数据异质性的问题仍然鲜少被探索。在本文中,我们提出FedMixer,一种针对TSF任务设计的异质性抗扰动FL方法。FedMixer 采用自适应谱聚类机制对客户端进行分组,并向每个分组分配定制的异构模型,从而允许针对不同客户端间各异的数据特征进行个性化模型配置。为了实现异构结构模型之间的聚合,我们提出了一种互蒸馏设计以促进有效的知识共享,使来自不同集群的客户端能够相互学习。广泛的实验表明,在四个数据集上,FedMixer 一直优于基线方法,提供了更优的预测准确性和异构数据的鲁棒性,并且在可扩展性方面表现出色,同时保持了计算和通信效率。
原文链接

