大数跨境

IJCAI 2026 高产学者潘世瑞:破解图数据在真实应用中的「不完美」条件

IJCAI 2026 高产学者潘世瑞:破解图数据在真实应用中的「不完美」条件 AI科技评论
2026-08-14
17
导读:高质、高产的研究底色:从现实问题出发,并且有本事重新定义它。
高质、高产的研究底色:从现实问题出发,并且有本事重新定义它。

    作者丨幸丽娟

    编辑丨齐铖湧

2026 年 8 月 15 日至 21 日,IJCAI-ECAI 2026 将在德国不来梅举行。在梳理本届会议录用论文时,我们关注到一位高产学者:潘世瑞(Shirui Pan),澳大利亚基金委杰出青年 ARC Future Fellow、澳大利亚昆士兰艺术与科学院 Fellow。

潘世瑞的“高产”并非偶然爆发,而是持续近十年的稳定输出。他已在 NeurIPS、ICML、IJCAI、AAAI、KDD、TPAMI、TKDE、《自然 - 机器智能》等顶会顶刊发表论文 200 余篇,曾获 2024 年 IEEE TNNLS 杰出论文奖等多项荣誉。更有八篇论文获评最具影响力论文,Google Scholar 引用超 68,000 次,H-index 达 94,连续五年入选 AAAI/IJCAI 最具影响力学者榜单。

透过其 200 多篇论文,一条清晰的主线浮现:他的工作围绕“图结构数据”展开,但核心不在于结构设计本身,而是图数据在真实应用中遇到的各种“不完美”条件——标签缺失、分布偏移、隐私约束、对抗攻击。这种“问题先于方法”的研究习惯,在本次 IJCAI 2026 收录的四篇论文中体现得尤为显著。

01 图异常检测:一个方法内核,两种现实约束

图异常检测是潘世瑞团队深耕已久的方向。本次入选的两篇论文直面同一个根本问题——如何在缺乏可靠标注的情况下识别异常,但分别针对两种不同的现实约束:单机环境下的标签稀缺分布式环境下的隐私约束

CAMERA:当骗子开始模仿你说话,反向划定“正常”边界

在社交平台环境中,传统图欺诈检测常假设骗子行为与正常人不同。然而,随着骗子开始有意识地模仿正常用户表达方式,传统基于“异常特征”的检测方法逐渐失效。面对欺诈线索多元且无监督场景下缺乏标签的难题,CAMERA 提出了逆向思路:不再寻找“异常”,而是清晰定义“什么是正常”,越过边界的即判定为异常。

技术上,CAMERA 实现了三大创新:

  • 自我解耦的混合专家(MoE)架构:每个专家专门建模一种类型的欺诈线索(结构异常、语义偏移、社区离群等),实现线索的显式解耦与互补提取。
  • 上下文感知的门控网络:综合节点自身表示及其局部邻域上下文,动态决定各专家输出的融合权重。
  • 基于稀缺性的单类学习:利用骗子的固有稀缺性,鼓励模型学习主导的正常模式,任何偏离正常边界的即被判定为异常。

该设计巧妙地将“无标签”转化为可利用条件。实验显示,在 4 个专门测试语义伪装的数据集上,CAMERA 的 AUROC 全部排名第一,AUPRC 拿下 3 个第一。此外,在 AmazonVideo、YelpChi 等大规模数据集上,CAMERA 不仅避免了显存溢出(OOM),更取得了领先结果,证明其在多重困难条件下的高性能与稳定性。

FedCIGAR:数据不能出本地,怎么合作抓异常?

若说 CAMERA 解决的是单机环境下的标签稀缺,FedCIGAR 则将同样逻辑延伸至“数据分散、隐私受限”的联邦场景。在金融风控等领域,各家机构持有独立的客户交易关系图,出于隐私保护无法共享数据,导致图级异常检测难以开展。

现有联邦学习方法常依赖人工合成异常样本,但合成数据与真实分布差异巨大,且强行统一聚合会损害本地检测效果。FedCIGAR 彻底换道:不训练“找异常”的模型,而是训练一个“只会重建正常图”的模型。推理时,重建误差大的即为异常,完全绕开合成数据问题。

针对数据分布异构问题,团队设计了节点贡献门控(客户端自主决定信息聚合权重)与滑动窗口聚类服务器端动态识别相似客户端进行个性化聚合)。实验表明,FedCIGAR 在检测性能和鲁棒性上均超越现有最优方法,重新定义了联邦异常检测的目标:让每个客户端在保护数据的前提下,拥有独立的异常判别能力。

纵观 CAMERA 与 FedCIGAR,两者底层思路一致:用“重建正常”代替“检测异常”,绕过对标签和合成数据的依赖。差别仅在于应用场景的适配:前者应对单机无监督与语义攻击,后者解决分布式隐私约束与数据异质。

02 时序预测非平稳:让模型“理解”外部事件变化的因果

时间序列预测的痛点在于数据的非平稳性(分布偏移)。节假日、突发管制等外部事件会直接改变数据分布,而现有模型多将事件作为简单特征叠加,未能真正学习事件与数值变化间的因果关系。难点在于事件(离散文本)与时序(连续数值)的表征空间不对齐,以及传统扩散模型均匀的时间步采样无法适应不同事件引发的剧烈程度差异。

EventTSF 的核心是让模型真正理解事件“在说什么”

  • 窗口对齐:将时间序列切分窗口,与同期发生的外部事件构建配对数据。
  • 自回归扩散框架:在扩散过程每一步深度融合事件与序列信息,而非简单拼接。
  • 事件感知的流匹配时间步:根据事件语义复杂度自动调整扩散节奏,复杂事件给予更多“消化”时间。

实验表现突出:在概率预测方面,EventTSF 在 7 个数据集的 CRPS、WQL、MAE 三项指标上全部排名第一;确定性预测方面,7 个数据集中有 6 个夺魁。该方法通过事件感知的扩散过程,推动时间序列预测从“纯统计拟合”走向“结合上下文语义的动态推断”。

03 蛋白质设计:图数据方法论的跨域延伸

第四篇论文 TTS-Design 看似跨越至蛋白质设计领域,实则延续了图数据方法论的逻辑:蛋白质本质上是图结构数据(氨基酸为节点,化学键和空间近邻为边)。

蛋白质功能取决于其 3D 结构,但给定目标结构反推氨基酸序列极具挑战。传统方法依赖大量高质量结构数据训练,而实验数据稀缺限制了模型效果。TTS-Design 引入大语言模型中验证过的“测试时计算扩展”(Test-Time Computing Scaling)思路:不追求训练阶段的数据堆砌,而在推理阶段通过增加计算量寻找更优解。

具体而言,推理时模型一次性生成多个候选序列,利用评分器(IF-RM)筛选与目标结构最匹配的序列。生成越多、计算越久,找到最佳答案的概率越高。在 CATH 4.2 和 CATH 4.3 标准测试集上,TTS-Design 稳定提升了现有模型的设计质量,并在真实案例中验证了实用性。这项工作证明了“以算力换性能”在科学问题上的有效性,为数据稀缺领域的新药研发提供了新路径。

04 结束语:高质、高产的研究底色

潘世瑞团队的选题思路令人印象深刻:几乎每一篇都不是从热门技术出发寻找场景,而是从具体的现实约束出发(标签不够、数据不能共享、外部事件干扰、训练数据稀缺),再倒推需要什么样的方法

其解题思维一以贯之:不在已有框架内“硬碰硬”,而是角度重新定义问题。没有标签就刻画“正常”边界;数据不能共享就让节点自主决定贡献;外部事件打乱规律就学习因果动态调整;训练数据不足就在推理阶段多算几轮。

当研究者习惯从现实约束出发,并以重新定义问题的方式解题时,高产与高质便不再是刻意平衡的结果,而是同一种研究底色的自然产物。这四篇论文在选题与解题的方法论上提供了清晰参照:在 AI 研究被规模竞赛裹挟的当下,从真实困境出发并拥有重新定义问题的能力,依然是一条经得起推敲的路径。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读208.8k
粉丝0
内容8.9k