论文
CausalGame:LLM 智能体在游戏中的因果思维基准测试
CausalGame: Benchmarking Causal Thinking of LLM Agents in Games
摘要
使用 大语言模型 (LLM) 构建 AI 科学家代理最近引起了越来越多的关注。由于科学发现从根本上依赖于从观察中揭示因果关系,因此因果思维的能力,即区分因果关系和相关性以及识别隐藏偏差的能力,对于 LLM 智能体至关重要。尽管人工智能科学家存在许多基准,但没有一个基准明确包含现实世界科学发现中广泛存在的选择偏差、测量误差和隐藏的混杂因素带来的挑战。为此,我们提出了CausalGame,这是一个通过互动游戏评估LLM智能体的因果思维能力的基准。 CausalGame要求LLM智能体积极设计实验方案,收集观察数据,并得出最终解决方案并附有解释报告。为了模拟现实的科学发现挑战,我们设计了 14 个场景,其中包含选择偏差、测量误差和隐藏的混杂因素。在 30 个 LLM 智能体中,没有一个智能体表现出可靠的因果思维:相对于 78-85% 的分析最佳值,最佳模型仅达到 68.0% 的生存率,并且只有 5-7% 的会话在因果推理规则上获得学分。 CausalGame 提供了一个可扩展且受控的测试平台,用于评估 AI 科学家代理的因果思维。