论文
TraceML:自动研究代理在长期 ML 开发中错过了什么
TraceML: What Auto-Research Agents Miss in Long-Horizon ML Development
摘要
自动研究代理现在在无人值守的情况下运行机器学习开发几个小时,根据自己的反馈修改数据管道、模型和验证,但在大多数比赛中,他们的成绩仍然低于强大的人类竞争对手。基于结果的基准记录了这种差距,但没有记录其原因,因为它们对最终提交进行了评分,并放弃了其背后的开发过程。我们引入了 TraceML,它在一个版本级模式下将人类和智能体在同一比赛中配对:134 场比赛中的 4{,}465 个人类 Kaggle 轨迹,其中 7 个也由两个智能体支架工作,提供 430 配对的人类和 207 个智能体轨迹。每个代码版本都带有其分数、时间戳以及所采取操作的标签、其意图、编辑大小和分数效果。这样读,差距就变得具体了。专家们交替进行数据工作、验证、模型更改和集成,然后返回到他们搁置的方法。相反,每个代理脚手架都会折叠成一个狭窄的循环:Codex 花费其步骤重新加权集成并调整提交,MLEvolve 就地改变其模型,既不以人类速度旋转,也不重新打开废弃的工作。从人类实践中提炼出来的简短计划提示将其命名的行为移向人类概况并提高分数,但努力概况保持代理形状:指令仅缩小了减少为指令的部分差距。我们发布了语料库、模式和标签模型,以及一个开源工具包,该工具包可以将任何命令行代理的运行转换为 TraceML 轨迹,并针对人类群体读取它。