论文
CausalReasoningBenchmark:对因果识别与估计解耦评估的真实世界基准
CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation
摘要
许多自动因果推断基准基于单一数值输出(如平均处理效应 ATE)评估系统性能。这种做法混淆了因果分析中两个不同的步骤:识别——在给定假设下构建有效的研究设计;估计——将该设计在有限数据上数值化实施。我们提出 CausalReasoningBenchmark,一个包含 132 个真实世界数据集上 173 个查询的基准,题目整理自 79 篇同行评审论文和三本广泛使用的因果推断教科书。对每个查询,系统必须产出 (i) 结构化的识别规范,指明策略、处理、结果与控制变量以及所有设计特定要素;(ii) 带标准误的点估计。通过分别对这两个组成部分打分,该基准支持细粒度诊断:它将因果推理的失败与数值执行的错误区分开。用最先进 LLM 的基线结果显示,虽然该模型在 79% 的案例中正确识别高层策略,但完整的识别规范正确率仅为 34%,表明瓶颈在于研究设计的细微细节而非计算。CausalReasoningBenchmark 已在 Hugging Face 公开,旨在促进更稳健的自动因果推断系统的发展。