论文

Rollout Cards:智能体研究的可复现性标准

Rollout Cards: A Reproducibility Standard for Agent Research

模型评测评测方法与指标

摘要

长期困扰机器学习与强化学习的可复现性问题,如今正在智能体研究中浮现:论文仅依据报告的分数比较系统,而分数背后的rollout记录却难以查验。对智能体任务而言,这一点至关重要,因为当评估选取rollout的不同部分或采用不同的报告规则时,同一行为可能得到不同的报告分数。在对50个流行的训练与评估代码库进行的结构化审计中,我们发现没有任何一个在报告头条分数的同时说明有多少次运行失败、报错或被跳过。我们还记录了37个案例,表明对于固定的证据,报告规则仍可能改变任务成功率、成本/token核算或计时测量,有时变化幅度巨大。我们将rollout记录而非报告分数视为智能体研究的可复现性单元。我们提出rollout cards:一种发布捆绑包,保存rollout记录,并声明报告分数背后的视图、报告规则与剔除清单(drops manifests)。我们在两种场景中验证rollout cards。首先,工具安全、多智能体系统、定理证明与搜索领域的四次部分公开发布,使我们能够计算其原始报告未包含的分析。其次,对短答题、代码生成与工具使用任务中保留的基准输出进行重新评分表明,仅改变报告规则即可使报告分数变化20.9个绝对百分点,某些情况下还会颠倒前沿模型的排名。我们发布了集成到开源强化学习gym Ergon中的参考实现,并公开了由Ergon生成、覆盖工具使用、软件工程、网页交互、多智能体协调、安全与搜索等基准的rollout-card导出数据,以支持未来研究。

Rollout Cards:智能体研究的可复现性标准:论文配图
图 1:公开发布版本包含原始基准分数未报告的分析。每个小组重复使用一个固定的公开版本来检查原始基准或论文没有提出的研究问题:(a) GAP 文本安全标签与工具调用安全; (b) MAESTRO 运行结果与协调开销; (c) COPRA 日志中的 miniF2F 证明结果与实现的证明搜索成本; (d) 思想树最终奖励与行动预算和回报概况。