论文
用于因果发现的基准的一致性评估
Consistency evaluation of benchmarks used for causal discovery
摘要
在图因果模型中,因果发现旨在基于纯文本的数值数据和领域知识构建因果图。然而,因果发现方法的评估仍然是该领域的一个挑战,因为领域研究的进展常常使基准因果图包含错误对齐的知识。这个问题尤其影响基于 大语言模型 (LLM) 的因果发现方法的评估,因为它们对文献中的新发现很敏感。这项工作是第一个系统研究基准因果图质量的工作。具体来说,我们设计了一个管道,自动从科学数据库中检索相关研究论文,并提示 LLM 检查基准因果图与领域研究论文之间的一致性。我们评估了 11 个流行的现实世界基准,为此我们总共生成了 38,081 篇领域论文。我们的结果表明,流行的基准在与领域研究的一致性方面存在显着差异,这对因果发现研究具有明显的影响。