论文

MechBench:人工智能科学Agent能否发现现象规律之外的机制?

MechBench: Can AI Scientific Agents Discover Mechanisms Beyond Phenomenal Laws?

智能体系统Agent任务评测

摘要

科学发现不仅需要恢复描述可观察行为的数学定律,还需要识别产生这些行为的机制。符号回归和科学Agent的现有基准主要评估现象规律恢复,而机制发现在很大程度上未经测试。我们引入了 MechBench,这是一个明确区分这两种功能的基准测试。每项任务都由一个机械模型定义,这是一组结构化的具有科学意义的关系,其共同后果需要可观察的现象规律,而智能体仅接收观察数据和科学背景。我们通过机制探针来评估机制恢复,这些探针询问不能仅从现象规律推断出的内部科学后果。为了减少对记忆的教科书机制的依赖,我们通过受控的、科学上可解释的规范机制突变来构建不熟悉的变体,并筛选机械的不可区分性,以排除允许可比较的竞争机制的模糊实例。代表性科学Agent的实验揭示了显着的现象机制恢复差距:对于使用 GPT-5.6-sol 的 Codex,现象定律准确度在核心集上达到 35.00%,而机制准确度仅为 13.75%,在正确恢复现象定律的情况下,机制恢复失败率为 64.29%。随着机制变得越来越变异,差距越来越大,即使提供正确的现象法则,机制恢复率也会低于 50%。这些结果揭示了机械推理中巨大的泛化差距,并将机制发现确立为超越可观察的科学定律的独特挑战。