论文

CausalVerify:以执行结果为依据的LLM因果推断基准

CausalVerify: An Execution-Grounded Benchmark for LLM Causal Inference Workflows

模型评测基准与评测资源

摘要

大语言模型现有的因果推理基准主要对方法描述或生成的代码是否运行进行评分,而不是执行的工作流程是否恢复目标因果估计。 CausalVerify 通过将现实解释与可验证计算分开,研究结构化计量经济学因果估计工作流程的验证问题。它将 259 篇已发表的经济学论文(重构的研究问题、数据描述、机构背景)与 100 个固定种子合成场景配对,这些场景实现了用于双重差分、事件研究、工具变量和断点回归设计的 CSV 数据集。实验 A(真实论文文本一致性)根据四个 LLM 共识标签对方法系列和方向一致性进行评分。实验 B(综合执行)运行模型编写的 R 代码,并检查提取的治疗效果估计是否与同一实现数据集上的规范估计器匹配;这个以执行为基础的正确性层是L2b+,与仅记录代码是否执行的L2b不同。校准臂会询问自我报告的置信度是否能够区分正确和不正确的工作流程。在实验 B 中,7 位大语言模型在默认 50% 容差下达到了 10% 至 88% 的 L2b+ 通过率,并且执行的 426 个工作流程中的 66 个(15.5%)返回了错误的估计。执行排名 (L2b) 与 L2b+ 的一致性远好于文本方向评分 (L4):Kendall $\tau=0.81$ 和 Spearman $\rho=0.93$,而 L4 的 Kendall $\tau$ 在 $-0.20$ 到 $0.10$ 之间。 Llama-3.3-70B-Instruct 显示出相同的定性差距,并且报告的置信度无法可靠地区分正确与不正确的工作流程。这些声明仅限于在评估的 R 后端和模型面板下这四个设计系列中的标准化单次工作流程;该基准不衡量一般因果推理能力。代码、数据、缓存输出和数据表均已发布。