论文
Rollout Cards:智能体研究的可复现性标准
Rollout Cards: A Reproducibility Standard for Agent Research
摘要
长期困扰机器学习与强化学习的可复现性问题,如今正在智能体研究中浮现:论文仅依据报告的分数比较系统,而分数背后的rollout记录却难以查验。对智能体任务而言,这一点至关重要,因为当评估选取rollout的不同部分或采用不同的报告规则时,同一行为可能得到不同的报告分数。在对50个流行的训练与评估代码库进行的结构化审计中,我们发现没有任何一个在报告头条分数的同时说明有多少次运行失败、报错或被跳过。我们还记录了37个案例,表明对于固定的证据,报告规则仍可能改变任务成功率、成本/token核算或计时测量,有时变化幅度巨大。我们将rollout记录而非报告分数视为智能体研究的可复现性单元。我们提出rollout cards:一种发布捆绑包,保存rollout记录,并声明报告分数背后的视图、报告规则与剔除清单(drops manifests)。我们在两种场景中验证rollout cards。首先,工具安全、多智能体系统、定理证明与搜索领域的四次部分公开发布,使我们能够计算其原始报告未包含的分析。其次,对短答题、代码生成与工具使用任务中保留的基准输出进行重新评分表明,仅改变报告规则即可使报告分数变化20.9个绝对百分点,某些情况下还会颠倒前沿模型的排名。我们发布了集成到开源强化学习gym Ergon中的参考实现,并公开了由Ergon生成、覆盖工具使用、软件工程、网页交互、多智能体协调、安全与搜索等基准的rollout-card导出数据,以支持未来研究。
