论文

RECLAIM:评测 Agent 复现论文主张

RECLAIM: Can Agents Reproduce the Claims of Machine Learning Papers?

智能体系统Agent任务评测

摘要

复现一篇机器学习论文涉及大部分研究步骤,从安装软件、调试到运行实验——这正是AI Agent日益承担的工作。我们提出RECLAIM,一个包含100篇NeurIPS 2025论文的基准,并可每年从新会议重建。对每篇论文,我们预先固定要复现的结果、什么算成功复现以及GPU小时预算。Agent必须使用论文及作者发布的任何材料来复现该结果。作者发布的内容决定难度层级:Run层发布包含代码、数据与权重;Retrain层缺少权重,Agent需自行训练模型;Reimplement层缺少代码,Agent需自己编写。一个独立的语言模型依据日志与输出而非Agent的自述来评分。我们对每篇论文运行四个Agent各一次;每个层级中最好的Agent仅复现了Run层论文的41%、Retrain层的27%与Reimplement层的15%,Reimplement层是所有Agent表现最差的层级。失败的尝试平均只用了29%的预算,因此大多数在预算尚有余量时停止。最常见的Agent错误是写完方法却不对照论文中的任何数字进行校验,在400次运行中出现63次。

RECLAIM:Agent能否复现机器学习论文的结论?:论文配图
图 1:RECLAIM 及其评估流水线概览。图中展示了一次使用 Qwen3.6-27B 在 TTPL 论文(Chen et al., 2025d)上运行的示例。