论文

CausalDS:数据科学智能体的因果推理基准

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

智能体系统Agent任务评测

摘要

大语言模型(LLM)日益作为集成的数据科学智能体行动——结合抽象推理与高级工具使用。但相关基准版图大致二分:无现实数据分析的符号因果推理基准,或无原则性因果数据生成结构的数据分析基准。且既有因果评估数据集常限于既有来源的精选样例——多样性来自有限的模板化变异而非新合成因果结构的系统生成。我们引入CausalDS:评估智能体数据科学工作流中因果推理的基准。每个实例是一个场景:采样的结构因果模型(SCM)带生成的观测数据,配以扎根于现实领域的合成自然语言故事。我们可选地把基准组件的构成落地到从真实数据集获得的经验分布——保留经验结构、同时经完全合成生成降低“因果鹦鹉”风险。从每个场景导出横跨Pearl三层的任务——典型数据科学预测任务作为第一层。多数任务含数据科学编码组件——由于不完美观测(由观测模型生成)的频繁存在,模型通常需使用多个工具到达最终答案。此外,识别问题何时无正当答案并弃权被视为一等评分结果。基准因此联合评估符号因果推理、数据科学、不确定性量化、弃权与工具使用/编码。

CausalDS:数据科学智能体的因果推理基准:论文配图
图 9:匹配的观察层消融:所有 6060 个实例的诊断损失上限(1010 个匹配的场景/任务对 ×\times 33 个观察变量 ×\times 22 个模型)。单元格阴影和打印值给出了上限损失;失败的单元格按原因进行标记(abst - 错误弃权,ctx - 上下文窗口失败,没有可评分的答案),星号标记尽管随后失败但已评分的答案。