论文

自主 ML 工程需要多少强大的Agent?

How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?

智能体系统Agent HarnessAgent任务评测

摘要

最近的自主机器学习工程(MLE)Agent在公共排行榜上取得了重大进展。现代 MLE Agent通常受到长周期周期内进展停滞和有限的大语言模型 (LLM) 原语的推动,被部署在日益复杂的机器之上:多Agent协调器、专用检索子Agent等。虽然此类工具不断扩展,但使用更原始但经过改进的编码Agent(LLM 可以通过读、写和 bash 原语直接访问执行环境)在该领域很少受到关注。在本文中,我们发现,在相同的时间预算和相同的前沿 LLM 主干下,开源最先进的工具与最小工具编码Agent基线的单个会话相比没有任何优势,这表明主干是性能的主要驱动力。通过一系列大规模的系统消融研究,我们认为Harness层在编码Agent设置中变得多余。我们的结论是,围绕强大的模型精心设计手工制作的工具所花费的努力对于当前的 MLE 基准来说回报率很低。