导语
因果发现旨在从观测数据中恢复变量之间的因果结构,是经济学、生物学与社会科学等领域共同关注的基础性问题。传统方法多为针对特定数据生成机制设计的专用算法,依赖人工选择模型并逐一检验假设,难以适应现实数据在机制类型与统计分布上的高度异质性。2026年7月13日发表在arXiv上的这篇文章《CDFM: Towards a General-Purpose Causal Discovery Foundation Model》提出因果发现基础模型(Causal Discovery Foundation Model,CDFM)。该模型将未知因果机制视为潜在变量,在变分推断框架下对机制空间进行贝叶斯边缘化,把因果结构推断转化为统一的学习问题;其架构由机制推断、数据重建与图推断三个相互对应的模块组成,并在覆盖多种图结构、机制族、噪声分布及隐混杂情形的大规模合成数据上完成预训练。实验结果表明,CDFM 在零样本设定下,于合成基准、物理因果系统与真实因果对数据上的表现均优于现有方法,且其预测行为与经典可识别性理论所刻画的边界相一致。本文系统梳理该工作的问题背景、理论框架、模型设计与实验结果,并讨论其意义与局限。
关键词:因果发现、基础模型、变分推断、结构可识别性、摊销式推断、零样本泛化

论文题目:CDFM: Towards a General-Purpose Causal Discovery Foundation Model 论文链接:https://arxiv.org/abs/2607.11508 发表时间:2026年07月13日 论文来源:arXiv
引言:传统因果发现范式及其局限
引言:传统因果发现范式及其局限
因果方向的可识别性问题
因果方向的可识别性问题
从机制假设到机制边缘化:
CDFM 的理论框架
从机制假设到机制边缘化:
CDFM 的理论框架
模型架构
模型架构
合成预训练数据的构建
合成预训练数据的构建
实验与结果分析
实验与结果分析
可识别性边界的实证检验
可识别性边界的实证检验
意义与局限
意义与局限
结语
结语
人工智能与数学读书会第二季
6. 高考分数只是张入场券,你的科研冒险在这里启航!
7. 加入集智字幕组:成为复杂科学知识社区的“织网人”

