论文
AI能否评估AI科学家?自动多模型评审的生成系统基准
Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review
摘要
AI科学家系统能够自主进行研究,具有显著加速科学研究的潜力。然而,评估和比较AI生成论文的质量仍然是一个开放性挑战。我们提出并实施了一个严格的基准测试协议,使用自动化同行评审系统,该系统利用前沿大语言模型评估科学论文的四个核心维度:原创性、科学严谨性、清晰度和重要性。我们评估了四个领先的AI科学家框架:Sakana AI(v1 & v2)、CycleResearcher和Data-to-Paper。每个框架在一家商业自主AI科学家公司(FARS)发布的15篇研究提案上运行,生成了60篇论文,我们与15篇FARS基准论文一起进行评估。使用三个独立的LLM评审员(GPT-5.4、Gemini和Claude),我们发现FARS基准论文显著优于所有竞争框架,在1—5分量表上的平均分数为2.14—2.47,而其他系统为1.00—1.87。值得注意的是,FARS评分比Gemini和Claude评估高出2倍以上。我们发现Gemini和Claude之间有很强的一致性($ρ$ = 0.907,$p < 0.001$),并且两者与合成分数高度相关($ρ$ = 0.961,$p < 0.001$),验证了自动化评估的可靠性。然而,GPT-5.4表现出较弱的一致性($ρ\approx 0.32$),表明它使用不同的评价标准。这些结果为AI科学家系统建立了第一个定量基准,并展示了多模型LLM评估为评估自主研究质量提供可扩展、一致的框架。
