论文

CausaLab:面向AI Scientist的可扩展交互式因果发现环境

CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists

智能体系统Agent任务评测

摘要

我们推出 CausaLab,这是一个可扩展的环境,用于评估大语言模型代理的交互式因果发现。与之前的评估不同,CausaLab 评估智能体是否可以使用因果证据解决问题,以及其答案是否得到有关潜在因果机制的正确假设的支持。每集都会在合成实验室中放置一个特工:它接收先前的测量记录,对操纵器晶体进行干预,并预测由相同机制控制的保留反应器晶体的共振频率。隐藏的数据生成过程是随机采样的结构因果模型(SCM),因此成功需要恢复因果图和结构方程,而不是回忆先验知识。 CausaLab 还包括一种特定于领域的语言,用于记录代理不断发展的 SCM 假设,使轨迹可检查并与地面事实进行比较。实验表明预测和机制恢复之间存在持续的差距:在纯观察 6 节点设置中,GPT-5.2-high 达到 92% 的任务准确率,但全边缘 $F_1$ 仅为 0.471。这一观察结果进一步激发了我们对不同交互策略的探索:混合观察-干预策略提高了结构保真度:在混合 6 节点设置中,GPT-5.2-high 在任务准确性和全边缘 $F_1$ 上均达到 80%。然而,即使是强大的智能体也很难设计信息丰富的干预措施,因为纯粹的干预策略在任务准确性和全面的 $F_1$ 方面都表现不佳。我们认为过早停止是智能体的一个主要弱点,并表明要求模型验证其假设与过去数据之间的一致性可以帮助缓解这个问题。因此,CausaLab 将预测成功与因果理解分开,并暴露了当前大语言模型代理人作为实验因果推理者的局限性。

CausaLab:面向AI Scientist的可扩展交互式因果发现环境
图 1:CausaLab 事件概述。 (1) 环境实例化一个隐藏的 SCM(晶体属性加上结构方程和系数的因果图),并使用它来生成先前的测量记录、操纵器晶体和保留的反应器晶体。所有这些都由相同的 SCM 管理,但具有不同的属性值。 (2)智能体观察先前记录中的测量属性和频率值,然后在预算范围内通过属性操纵器选择对操纵器晶体的干预。 (3) 在每一步,代理都会发出一个 DSL 假设(图表、频率结构方程、系数),我们根据真实 SCM 对其进行解析。 (4) 智能体预测反应堆晶体的保留频率;我们对最终的预测和恢复机制的轨迹进行评分。