大数跨境

arXiv:因果发现基础模型 CDFM,面向异质机制的零样本推断

arXiv:因果发现基础模型 CDFM,面向异质机制的零样本推断 集智俱乐部
2026-10-06
6
导读:机制边缘化、变分架构与跨分布泛化的系统解读

导语


因果发现旨在从观测数据中恢复变量之间的因果结构,是经济学、生物学与社会科学等领域共同关注的基础性问题。传统方法多为针对特定数据生成机制设计的专用算法,依赖人工选择模型并逐一检验假设,难以适应现实数据在机制类型与统计分布上的高度异质性。2026年7月13日发表在arXiv上的这篇文章《CDFM: Towards a General-Purpose Causal Discovery Foundation Model》提出因果发现基础模型(Causal Discovery Foundation Model,CDFM)。该模型将未知因果机制视为潜在变量,在变分推断框架下对机制空间进行贝叶斯边缘化,把因果结构推断转化为统一的学习问题;其架构由机制推断、数据重建与图推断三个相互对应的模块组成,并在覆盖多种图结构、机制族、噪声分布及隐混杂情形的大规模合成数据上完成预训练。实验结果表明,CDFM 在零样本设定下,于合成基准、物理因果系统与真实因果对数据上的表现均优于现有方法,且其预测行为与经典可识别性理论所刻画的边界相一致。本文系统梳理该工作的问题背景、理论框架、模型设计与实验结果,并讨论其意义与局限。


关键词:因果发现、基础模型、变分推断、结构可识别性、摊销式推断、零样本泛化

郑鸿盛丨作者
赵思怡丨审校

论文题目:CDFM: Towards a General-Purpose Causal Discovery Foundation Model
论文链接:https://arxiv.org/abs/2607.11508
发表时间:2026年07月13日
论文来源:arXiv




引言:传统因果发现范式及其局限




因果发现(causal discovery)研究如何在缺乏干预的条件下,仅依据观测数据推断变量间的因果关系,其结果通常以有向无环图(DAG)等图形结构表示。经过数十年发展,该领域已形成较为丰富的方法体系,但在实际应用中仍长期受限于一种碎片化的工作流程。
按照这一流程,研究者首先需要完成数据清洗与缺失值处理,随后在多种算法之间进行选择,例如基于约束的 PC、FCI,基于结构方程的 LiNGAM、ANM,以及基于评分的 GES 和基于连续优化的 NOTEARS 等。算法确定之后,还须检验其赖以成立的前提假设,包括线性关系、噪声的非高斯性、同方差性以及是否存在未观测到的共同原因等。若假设检验不通过,则需更换算法并重复上述过程。
这一流程的根本问题在于:每一种算法都只在特定的数据生成机制下具有可识别性保证,而真实数据的生成机制往往是未知且异质的。算法选择与假设检验因此构成一项繁重的人工负担。随着数据规模与异质性持续增长,这种假设驱动的范式在可扩展性上的不足日益明显。论文据此提出的问题是:能否构建一种预训练模型,使其在不预设具体机制的前提下,直接从观测数据推断因果结构,并对未见过的机制保持泛化能力。
图1:从“选算法、验假设” 到 “一个模型直接推断”:因果发现的范式转变。上半部分(a)是传统工作流,过去做因果发现,要在一堆算法里反复挑选、逐条验证假设,不通过就推倒重来;下半部分(b)是基础模型范式,一个基础模型直接输出因果图 —— 这就是因果发现正在发生的范式转变。




因果方向的可识别性问题




要理解上述工作的必要性,须先说明因果推断在观测层面的根本困难。
论文给出的第一个结论(Theorem 1)指出,在不施加任何约束的条件下,仅凭观测变量的联合分布无法确定因果方向。对于几乎任意联合分布,都可以分别构造与两种因果方向相对应的结构方程模型,使其对数据的拟合完全一致;变量在观测意义下彼此对称,因而不具备区分 X→Y 与 Y→X 的依据。
既有算法通过预先指定机制来打破这种对称。例如,线性非高斯模型(LiNGAM)假设系统为线性且噪声服从非高斯分布,加性噪声模型(ANM)假设结果可表示为原因的非线性函数与独立噪声之和。论文进一步证明(Theorem 2),在机制已知的条件下,真实因果图是边际似然的唯一最优解,因果方向由此可识别。
由此可见,传统方法的可识别性以研究者事先掌握数据所属机制类别为前提,而这一前提在现实场景中往往难以满足。如何在不固定单一机制的情况下保留可识别性,构成了 CDFM 所要解决的核心问题。




从机制假设到机制边缘化:

CDFM 的理论框架




CDFM 的基本思路是不将数据限定于某一已知机制,而是把未知机制 M 作为潜在变量,在一个机制空间 ℳ 上进行贝叶斯边缘化,即综合考虑数据可能符合的多种机制,再据此推断因果图。
由于该边缘化所对应的积分难以直接计算,论文采用变分推断将其转化为可优化的证据下界(ELBO),并分解为三个组成部分:其一是机制推断 Q(M|X),用于从数据中提取噪声性质、非高斯性与非线性等机制信息;其二是数据重建 P(X|G,M),即在给定候选图与机制的条件下重建数据,提供自监督信号;其三是图推断 P(G|M),即在机制编码的基础上解码因果结构。
论文证明(Theorem 3),当机制空间满足严格可识别性质时,随着样本量增大,最大化边际似然能够以概率一恢复真实因果图。这一结果表明,CDFM 并未脱离经典可识别性理论,而是将原本由人工完成的机制指定,转化为模型对机制先验的学习。值得注意的是,变分下界的三个数学项与模型的三个架构组件一一对应,理论分解直接规定了网络结构的设计。
图 2 :CDFM 的整体架构:数据经四个环节变成因果图。(a) 逐列嵌入,把数值连同缺失标记编码为向量,读懂各变量分布;(b) 行列交替注意力,在变量之间与变量自身两个方向反复运算、摸清全局机制,并经内环自适应以重建误差修正因果图;(c) 缺失值插补,重建被掩盖数值的同时为结构学习提供自监督信号;(d) 图推断,压缩出每个变量的 "因" 与 "果" 表征,再由双线性头解码出邻接矩阵。




模型架构




CDFM 的输入为 N×D 的观测矩阵,其中允许存在缺失项;输出为邻接矩阵,以有向边表示直接因果关系,以双向边表示由未观测共同原因导致的隐混杂。模型由三个模块构成。
第一,逐列嵌入与行列交替注意力,对应机制推断。模型首先将每个观测值与一个缺失指示位配对并投影为向量,随后采用对分布敏感的 Set Transformer 处理各列,以捕捉边际分布的高阶统计特征。在此基础上,注意力机制沿行轴(同一样本内的变量关系)与列轴(变量自身分布)交替运算,将各列的局部信息整合为全局机制编码。
第二,因果掩码与缺失值插补,对应数据重建。注意力的信息流由一个软因果掩码控制:当模型当前判断 j 对 i 存在影响时,变量 i 可以充分获取变量 j 的信息,反之信息流受到抑制。被掩码位置由一个分位数回归头负责重建,插补误差因此成为结构学习的自监督梯度。在推理阶段,模型通过若干轮内环自适应迭代更新图假设,以最小化重建误差,此过程不依赖测试集的真值标签。
第三,图推断,对应图解码。模型以一组可学习的专家注意力头提取因果特征,聚合得到每个变量的因效应向量与果效应向量,再通过双线性运算生成连续的边概率,最后由一个在独立合成数据上拟合的校准器将其转换为二值邻接矩阵。




合成预训练数据的构建




CDFM 的泛化能力主要来自预训练数据在规模与多样性上的覆盖。模型完全在合成数据上预训练,数据生成器沿以下维度进行随机化设计。
在图结构方面,采用 Erdős–Rényi、无标度、转置无标度、Watts–Strogatz 小世界、随机块模型与几何随机图共六类模型,变量数取值范围为 2 至 100,样本量为 50 至 4096。在机制类型方面,设置约十五个机制族,涵盖线性同方差与异方差模型、基于随机傅里叶特征的强非线性模型、后非线性模型、因果加性模型、物理启发模型、离散列联表与序数数据,以及取整和离散化等测量误差情形。在噪声方面,引入高斯、拉普拉斯、柯西、Beta、指数、Student-t、对数正态与高斯混合等多种分布,并随机改变信噪比。此外,约 15% 的训练批次被注入潜在共同原因,以双向边表示;约半数批次随机设置缺失值,以增强模型对不完整数据的适应能力。
通过覆盖一个可识别且高度多样的假设空间,预训练过程使模型得以将非高斯性、非线性与分布不对称等统计线索内化为可迁移的表征。论文同时描述了一个自增强过程:因果知识指导合成数据生成,预训练促使模型掌握因果不对称性,真实数据上的零样本推理结果又反过来推动机制库与理论的扩展。
图 3 :因果发现基础模型的构建闭环。左上角的因果知识(领域知识与可识别的机制先验)沿 “Guides generation” 指导右上角合成数据的大规模生成;合成数据再经 "Pretraining" 预训练下方的基础模型,使其从输入数据直接学出因果结构;模型推理结果又沿 "Enhances understanding" 回流、丰富因果知识 —— 三者首尾相接,构成自我强化、持续逼近通用因果推理的闭环。




实验与结果分析




论文的全部基准实验均在零样本设定下进行,即模型在预训练后保持参数固定,不访问测试集真值,也不进行数据集级别的优化。
在合成基准方面,研究构建了覆盖十五个机制族、十种图规模与五种样本量的评测方案,并与 PC、GES、DirectLiNGAM、NOTEARS、AVICI、TabCausal、Arrow 等方法比较。结果显示,CDFM 在各样本量下的 AUROC 均为最高,稳定在 0.86 至 0.89 之间,领先第二名约 0.08 至 0.10。当变量数由 10 增至 100 时,依赖条件独立检验的方法因检验次数的组合式增长而性能明显下降,CDFM 的 AUROC 则仅由约 0.88 降至约 0.84,表现出更强的规模适应性。分机制比较进一步表明,CDFM 在全部十五个机制族上的 AUROC 均为最高或并列最高;仅在线性非高斯这一 LiNGAM 最具优势的设定下,DirectLiNGAM 的 F1 分数略高,说明 CDFM 的优势源于机制层面的广谱泛化,而非对特定模型类别的依赖。
在真实数据方面,CDFM 在 Causal Chamber 物理因果系统的两个任务上分别取得 0.952 与 0.965 的 AUROC,均居首位;在由 95 对跨学科真实因果数据构成的 Tübingen 基准上,其方向判别准确率为 0.671,同样高于所有对比方法。上述结果说明,从合成结构方程模型中习得的因果表征能够迁移至真实物理系统与观测数据。
图 4 :CDFM 在不同设定下的性能表现。上半部分两张折线图分别展示 AUROC 随样本量 N 和变量数 D 的变化,CDFM 曲线始终稳居最上方,样本量增加时稳定在 0.87 以上,变量增多、其他方法明显下滑时它仅小幅回落;下半部分是 "方法 × 机制"AUROC 热力图,CDFM 所在行在全部十五个机制族上颜色都最深 —— 其优势来自机制层面广谱而稳定的泛化,而非押中某一类有利机制。




可识别性边界的实证检验




除性能评测外,论文还设计了一组诊断性实验,用以检验模型行为是否符合经典可识别性理论所规定的边界。
在线性模型与高斯噪声这一理论上方向不可识别的设定下,模型的方向判别准确率约为 0.5,接近随机水平;当噪声分布偏离高斯时,准确率迅速上升至接近 1.0。在高斯噪声与纯线性条件下可观察到同样现象,而一旦引入较小程度的非线性,准确率即提高至 0.97 以上。随着图中 V 结构(对撞结构)数量增加,模型方向识别的 F1 分数稳步上升并趋近理论上界。在隐混杂情形中,模型能够利用非高斯噪声、尤其是重尾分布所带来的不对称性,对无混杂、X→Y 与 Y→X 三种关系加以区分。
这些结果表明,CDFM 在缺乏可识别信息时倾向于给出不确定的判断,而仅在非高斯性、非线性、对撞结构或分布不对称等信号存在时才确定因果方向,其行为与理论预期一致。此外,得益于插补作为训练任务,CDFM 在缺失值填补这一辅助任务上的平均误差亦低于 MissForest、MICE、KNN 与矩阵分解等八种常用方法。
图 5 :CDFM 对可识别性边界的实证检验。(a)(b) 显示,在高斯噪声或纯线性这两个理论不可识别点,方向准确率均跌至 0.5,一旦偏离高斯或引入非线性便迅速回到接近 1.0;(c) F1 随 V 结构增多而上升、逼近理论上界;(d) 隐混杂三分类准确率随非高斯程度提升 —— 模型只在存在可识别信号时才确定方向,行为与经典理论一致。




意义与局限




该工作的贡献主要体现在三个方面。其一,将因果发现系统地表述为基础模型问题,通过变分框架把未知机制转化为可边缘化的潜在变量,并给出相应的理论保证。其二,设计了与变分下界三项相对应的模型架构,并引入推理阶段的内环自适应。其三,建立了覆盖多种图结构、机制、噪声、混杂与缺失模式的大规模合成预训练流程,实现跨分布的零样本泛化。其所指示的研究方向在于,因果发现或许可以不再依赖不断增加的专用算法,而转向能够内化多种机制先验、并在不同数据分布间通用的推理模型。
同时,该工作仍存在值得注意的局限。首先,模型性能的上限由可识别性决定,在纯线性高斯等不可识别场景下无法确定方向。其次,跨域与极端分布外情形下的鲁棒性尚需进一步检验,合成数据与真实数据之间的差异依然存在,Tübingen 基准上 0.671 的准确率也反映了这一点。最后,目前实验主要针对表格型变量数据,尚未扩展至时间序列、高维图像与文本等模态。较为合理的定位是,CDFM 将算法选择与假设检验转化为可预训练、可泛化的推断问题,而其输出的可疑边仍可结合传统方法或干预实验加以复核。




结语




从与假设绑定的孤立算法,到摊销式推断,再到基础模型,因果发现的方法演进呈现出与计算机视觉、自然语言处理相似的路径。CDFM 可视为这一路径上的一次系统性尝试:它在理论上保留了可识别性约束,在工程上实现了跨机制的零样本推断。该工作的后续进展,尤其是在更广泛模态与更复杂真实环境中的表现,仍有待持续观察。


人工智能与数学读书会第二季


人工智能的能力边界正在不断扩张,大模型可以完成复杂对话、辅助科学计算,甚至尝试开展数学推导与定理证明。但光鲜的应用表象之下,AI 的能力上限、推理缺陷与建模困境也逐步暴露。当我们惊叹人工智能的各类能力时,更需要向下追问:是什么构筑起 AI 的能力地基?当 AI 走向科学研究,它又能在数学这片严谨的土地上走多远?想要看透 AI 的优势与短板,就必须回归数学底层,从根源审视人工智能与数学之间相辅相成又彼此制约的复杂关系。
为厘清 AI 在科学与数学领域的机遇与局限,集智俱乐部联合同济大学数学科学学院长聘副教授陈小杨、北京工业大学数学统计学与力学学院副研究员诸葛昌靖共同发起「人工智能与数学」读书会第二季。组织对该主题感兴趣的研究者与探索者共同研读前沿文献、交流研究思路。
读书会将于2026年9月22日起,每周二19:30-21:30线上开展,持续8-10周,包含主讲分享与讨论交流,并提供会后视频回放,诚邀相关领域研究者及跨学科兴趣者参与。
图片
详情请见:人工智能与数学读书会第二季启动|AI在科学与数学领域的应用边界

推荐阅读
1. Physics Reports 因果发现重磅综述:从数据中发现因果关系和方程
2. 基于观测数据的因果发现及因果性学习
3. 因果发现工具箱
4. 9900分可兑换“涌现”文化衫,报名任意读书会送299积分!
5. 集智学园精品课程免费开放,解锁系统科学与 AI 新世界

6. 高考分数只是张入场券,你的科研冒险在这里启航!

7. 加入集智字幕组:成为复杂科学知识社区的“织网人”



点击“阅读原文”,报名读书会

【声明】内容源于网络
0
0
集智俱乐部
关注复杂科学与人工智能的前沿进展、书籍资料、工具文献、交叉前沿等,同时也发布集智俱乐部、集智学园举办的各类讲座、课程等活动相关信息。
内容 4756
粉丝 0
集智俱乐部 关注复杂科学与人工智能的前沿进展、书籍资料、工具文献、交叉前沿等,同时也发布集智俱乐部、集智学园举办的各类讲座、课程等活动相关信息。
总阅读6.4k
粉丝0
内容4.8k