论文

从科学观察到机制:人工智能科学家生成的基准假设

From Scientific Observations to Mechanisms: Benchmarking Hypothesis Generation by AI Scientists

智能体系统Agent任务评测长程任务评测

摘要

数据驱动的机制假设对于科学发现至关重要,因为它们解释了潜在过程如何产生观察到的现象。 AI 智能体和 AI 科学家越来越支持科学数据分析。然而,他们将经验发现转化为机械假设的能力仍未得到充分检验。为了解决这一差距,我们引入了 MechHypoBench,这是第一个评估 AI 智能体和 AI 科学家是否可以根据经验数据生成此类假设的基准。它将来自 14 个科学领域的论文衍生机制与包含 1798 万条记录的现实数据集相结合。该结构保留了经验数据的观察复杂性,同时提供了特定的基础机制。 智能体分析观察结果并提出开放式假设。我们开发了一个评估框架,通过在保留条件下的后果来评估开放式机制假设。一般智能体和 AI 科学家的实验揭示了生成的假设和潜在机制之间存在巨大差距。

从科学观察到机制:人工智能科学家生成的基准假设的原论文方法或结果图
图 2:我们构建的基准的概述。