论文

AI能否评估AI科学家?自动多模型评审的生成系统基准

Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review

智能体系统Agent任务评测

摘要

AI科学家系统能够自主进行研究,具有显著加速科学研究的潜力。然而,评估和比较AI生成论文的质量仍然是一个开放性挑战。我们提出并实施了一个严格的基准测试协议,使用自动化同行评审系统,该系统利用前沿大语言模型评估科学论文的四个核心维度:原创性、科学严谨性、清晰度和重要性。我们评估了四个领先的AI科学家框架:Sakana AI(v1 & v2)、CycleResearcher和Data-to-Paper。每个框架在一家商业自主AI科学家公司(FARS)发布的15篇研究提案上运行,生成了60篇论文,我们与15篇FARS基准论文一起进行评估。使用三个独立的LLM评审员(GPT-5.4、Gemini和Claude),我们发现FARS基准论文显著优于所有竞争框架,在1—5分量表上的平均分数为2.14—2.47,而其他系统为1.00—1.87。值得注意的是,FARS评分比Gemini和Claude评估高出2倍以上。我们发现Gemini和Claude之间有很强的一致性($ρ$ = 0.907,$p < 0.001$),并且两者与合成分数高度相关($ρ$ = 0.961,$p < 0.001$),验证了自动化评估的可靠性。然而,GPT-5.4表现出较弱的一致性($ρ\approx 0.32$),表明它使用不同的评价标准。这些结果为AI科学家系统建立了第一个定量基准,并展示了多模型LLM评估为评估自主研究质量提供可扩展、一致的框架。

AI能否评估AI科学家?自动多模型评审的生成系统基准:论文配图
图1:实验协议工作流,展示评估四种 AI Scientist 框架的完整流程。从15项 FARS 提案出发,自定义包装器将提案转换为各框架所需输入;其中 Data-to-Paper 使用关联 GitHub 仓库的数据集,而非提案。四个系统并行处理各自输入,生成 PDF。Sakana v1 和 v2 每个提案会生成多个 PDF,再由基于大语言模型的协调系统合并。最终所有论文共75篇,其中框架生成60篇、FARS 基准15篇,由三个独立大语言模型组成的 AI 评审器评分、撰写评审并形成最终分析。