论文
DeltaML-Bench:在现实世界研究存储库上评估机器学习代理
DeltaML-Bench: Evaluating Machine Learning Agents on Real-World Research Repositories
摘要
用于机器学习实验的自主代理必须导航异构存储库、修复训练管道并在实际计算约束下评估候选改进。现有的基准仅部分捕获了这些条件。我们引入了 DeltaML-Bench,这是一个基准,包含来自研究论文的 48 项任务,这些任务要求代理改进不完善的开源存储库中已发布的基线。我们使用标准模块化代理和基于搜索的 ARG 脚手架评估 GPT-5 和 Claude Sonnet 4。在 4 x 6 小时分配中,ARG 将 GPT-5 的每次运行成功率从 9.4% 提高到 33.9%;在 2 x 12 小时分配中,GPT-5 ARG 达到 49.0%。模块化配置的规范游戏率高达 47.9%,而在评估的 ARG 配置中没有观察到游戏。这些结果表明,在部署代理进行自主机器学习实验时,脚手架设计和完整性检查是重要的考虑因素。