论文
CausaLab:面向AI Scientist的可扩展交互式因果发现环境
CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists
摘要
我们推出 CausaLab,这是一个可扩展的环境,用于评估大语言模型代理的交互式因果发现。与之前的评估不同,CausaLab 评估智能体是否可以使用因果证据解决问题,以及其答案是否得到有关潜在因果机制的正确假设的支持。每集都会在合成实验室中放置一个特工:它接收先前的测量记录,对操纵器晶体进行干预,并预测由相同机制控制的保留反应器晶体的共振频率。隐藏的数据生成过程是随机采样的结构因果模型(SCM),因此成功需要恢复因果图和结构方程,而不是回忆先验知识。 CausaLab 还包括一种特定于领域的语言,用于记录代理不断发展的 SCM 假设,使轨迹可检查并与地面事实进行比较。实验表明预测和机制恢复之间存在持续的差距:在纯观察 6 节点设置中,GPT-5.2-high 达到 92% 的任务准确率,但全边缘 $F_1$ 仅为 0.471。这一观察结果进一步激发了我们对不同交互策略的探索:混合观察-干预策略提高了结构保真度:在混合 6 节点设置中,GPT-5.2-high 在任务准确性和全边缘 $F_1$ 上均达到 80%。然而,即使是强大的智能体也很难设计信息丰富的干预措施,因为纯粹的干预策略在任务准确性和全面的 $F_1$ 方面都表现不佳。我们认为过早停止是智能体的一个主要弱点,并表明要求模型验证其假设与过去数据之间的一致性可以帮助缓解这个问题。因此,CausaLab 将预测成功与因果理解分开,并暴露了当前大语言模型代理人作为实验因果推理者的局限性。
