论文
CausalArena:基础模型时代因果发现的基准测试
CausalArena: Benchmarking Causal Discovery in the Foundation Model Era
摘要
因果发现旨在从数据中揭示因果结构,是科学推理和基于干预的决策的基础。其评估在很大程度上依赖于结构因果模型(SCM),该模型指定因果图以及生成数据的机制,但现有研究在图族、机制和评估协议方面存在很大差异。因果发现基础模型(CDFM)的出现使评估进一步复杂化:性能可能不仅反映了因果发现能力,而且还反映了预训练环境和测试 SCM 之间的重叠,使得固定综合基准的结果难以解释。我们引入了 CausalArena,这是一个在通用协议下进行因果发现的统一且可进化的基准。合成 SCM 提供结构和机制的受控宽度;语义操作 SCM 提供了超越标准合成生成器的人类可审计的、基于语义的环境;基于公式的 SCM 在明确的科学机制下测试发现。公共现实世界数据集提供额外的外部有效性检查。经典方法、神经方法和预训练方法的实验揭示了 SCM 系列和协议之间的重大排名变化,表明一种基准机制中的强大性能并不能可靠地转移到其他方法中。这些结果凸显了基准多样性和预训练——评估重叠是基础模型时代评估因果发现的核心挑战。