论文
我们正在衡量科学情报吗?重新思考对人工智能科学家的评价
Are We Measuring Scientific Intelligence? Rethinking the Evaluation of AI Scientists
摘要
AI 智能体现在可以端到端地进行数据驱动的科学分析,基准测试通过向智能体提供问题和数据集并根据固定密钥对其最终答案进行评分来对其进行评估。这些基准假设从提供的数据中得出正确的答案,我们将这种属性称为证据支持。然而,智能体也可以通过先验知识或排除其他选项来达到关键,并且基于单次运行的分数无法区分这些情况。我们展示了如何检验这个假设,并发现它经常失败。对于每个问题,我们都会构建其数据文件的版本,其中答案的证据保持不变、撤回或颠倒,使用预先注册的参考统计数据检查每个编辑,并在每个版本上运行相同的智能体。然后,我们测量基于证据的准确性,只有当智能体在证据被撤回时也做出响应并在证据被推翻时遵循它时,才算正确答案。我们针对来自 BAISBench 的 18 个单细胞问题和来自 GeneBench-Pro 的四个综合问题评估了三个智能体支架和五个模型。在单细胞问题上,Claude 智能体的准确率为 95%,在没有任何数据的情况下正确回答了 83%,但其基于证据的准确度仅为 41%。隐藏基因名称将十个基因任务中遵循相反证据的运行比例从 58% 提高到 93%,这表明先验知识与提供的数据存在竞争。基准分数和LLM评委还可以奖励忽略更改证据的答案。因此,衡量科学智力而不是召回率需要检查答案是否遵循证据以及分数是否因此而奖励他们。
