论文

ReplaySCM:从干预中归纳可执行因果机制的基准

ReplaySCM: A Benchmark for Executable Causal Mechanism Induction from Interventions

模型评测基准与评测资源

摘要

大多数语言模型的因果基准都会对本地答案或图形结构进行评分。我们引入了 ReplaySCM,这是一个包含 1,300 个项目的基准,用于从有限的干预证据中归纳出可执行的因果机制。每个项目都包含由潜在的完全观察的非循环布尔结构因果模型(SCM)生成的二元世界。系统必须以受限制的布尔 DSL 输出机制图;提交的内容将被解析、检查合法性和非周期性,并在训练和保留的干预世界中重放。评分使用重播行为而不是公式字符串,因此语法上不同的机制在行为正确时会获得好评。 ReplaySCM 通过有序、块顺序、隐藏顺序和隐藏根设置来改变向模型公开的结构信息,并包括替代 SCM 任务,这些任务提供有效的参考 SCM 并要求适合训练世界的语义上不同的替代方案,以及单独的干预和见证。 Frontier LLM 推断功能父结构的部分内容,但当顺序或根结构被隐藏时,保留的重放急剧下降。我们还评估了匹配的支持审计阶梯:原始审计、额外世界审计和反例审计 (CEx),这将平均本地前驱模式覆盖率从 0.8949 提高到 0.9815,再到 1.0;在经过审计的搜索中,没有发现任何语义替代方案与训练世界保持一致。在这个更有力的证据下,有序/隐藏订单差距仍然存在。 ReplaySCM 通过评估有限干预证据中的可执行重放泛化,补充了答案级因果推理和图形发现基准,而不要求对潜在 SCM 进行唯一识别。