论文

SoundnessBench:你们的人工智能科学家真的能区分好的研究想法和坏的研究想法吗?

SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?

模型评测基准与评测资源

摘要

自主人工智能研究代理旨在通过自动化研究流程(从假设生成到同行评审)来加速科学发现。然而,现有的基准测试很少测试根本瓶颈:大语言模型 是否可以在花费时间和计算资源之前判断研究想法的方法论可行性。我们引入了 SoundnessBench,这是一个由 1,099 项机器学习研究提案组成的策划基准,这些提案是根据 ICLR 提交的内容重建的,标有审稿人的健全性分项分数,并根据源论文进行了审核。 SoundnessBench 应被解释为可恢复的提案阶段健全性的基准,而不是对全文评审结果的精确预测。在 12 个前沿 LLM 中,我们发现了普遍的乐观偏见:在标准提示下,模型经常将低稳健性的建议评为合理,而激进的提示则在很大程度上将错误从误报转变为漏报。对公共语料库污染、论文识别短语、表面特征和人工审核质量的额外控制表明,这种行为不能用单一混杂因素来解释。我们的结果表明,当前的 LLM 作为独立的科学严谨性第一门评估器尚不可靠。