论文
MLReplicate:机器学习再现性自主研究系统的基准测试
MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility
摘要
能够生成完整科学手稿的自主研究系统发展迅速,但稳健而现实的评估框架却未能跟上步伐。为了弥补这一差距,我们引入了 MLReplicate,这是一个评估机器学习再现性自主研究系统的端到端基准测试。该基准由 ICML 2025 优秀论文构建,重新制定为标准化输入规范,并在 6 个最先进的研究系统中进行评估:AI SCIENTIST-V1、AI SCIENTIST-V2、AGENT LABORATORY、CYCLERESEARCHER、AI RESEARCHER 和 TINY SCIENTIST,生成 45 份生成的手稿,其中有 3 个失败的实验。使用双协议方法评估输出,该方法结合了自动会议式审查和结构化专家人工评估,同时跟踪计算成本、运行时间和所需的人工干预量。自动会议式审查接受了 37 份有效提交内容中的 10 份。另外 8 份提交的材料因未达到最低页数阈值而在审核前被拒绝。与自动评审相比,人类评审员一致地发现了所有系统的方法缺陷、幻觉实验结果和再现性失败,并且 59% 的已接受的自动评审包含捏造或未经支持的声明。我们进一步发现,词元预算 和计算成本都无法预测输出质量:尽管输入标记存在 38 倍的差异,但在人类评估中,最便宜的系统胜过资源最密集的系统。因此,我们证明自主研究工作流程设计比计算规模更重要。 MLReplicate 揭示了当前自主研究系统与真正的科学严谨性之间的巨大差距,并建立了一个实用的、可扩展的评估框架,以实现值得信赖的人工智能驱动的科学发现的系统进展。