论文

EurekaBench:衡量 Agentic 发现新科学见解的能力

EurekaBench: Measuring Agentic Ability to Discover New Scientific Insights

智能体系统Agent任务评测

摘要

当艾萨克·牛顿发现万有引力定律时,他通过分析行星模式等观测数据的迭代过程,通过描述数学方程中的模式来寻找潜在机制,并根据月球轨道完善他的理论,揭示了相同的力控制着下落的苹果和绕轨道运行的行星的惊人见解。人工智能Agent是否有可能做出类似的发现?为了衡量这种能力,我们引入了 EurekaBench,这是一个跨领域基准测试,用于测试人工智能Agent进行长期实验和发现解释观察结果的机制的能力。我们通过从中得出的科学见解来评估这些机制。 EurekaBench 包含一组经过专家验证的 26 项长期任务,涉及神经科学、计算机科学、化学、天体物理学、地球物理学和等离子体物理学,总共 306 项科学见解预计将支持所发现的机制。我们的评估框架测试科学发现的三个轴:智能体遵循已知科学约束的能力、已发现机制的预测准确性,以及这些机制是否产生科学见解或为未来的研究提供信息。我们的结果表明,当前的人工智能Agent往往过度关注预测准确性优化,超越了人类科学家,但在得出科学见解方面却远远落后。