论文

HarnessDev:LLM 可以创建和发展他们自己的代理Harness吗?

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

智能体系统Agent任务评测

摘要

随着代理从研究原型转向部署工具,它们的能力越来越依赖于模型外部执行基础设施,通常称为代理工具。在保持模型重量固定的情况下更改此Harness可以显着改变任务性能。当前的代理评估通常报告所选工具下的下游性能,而模型开发工具本身的能力相对而言尚未得到充分开发。我们引入了 HarnessDev,这是一个将评估单位从任务输出转变为可运行基础设施的基准。 HarnessDev 涵盖两个阶段。在Creation中,智能体从最小的种子和少量的案例开始,然后构建一个完整的执行系统。在 Evolution 中,它从自己创建的工具开始,并使用下游执行反馈对其进行迭代修改,目标是提高基准性能。然后,我们评估每个构建的工具的能力(在坚持的基准上任务成功)和效率(执行词元成本)。报告的创建结果涵盖 6 个创建者 LLM、4 个域和 5 个下游基准,总计 2,207 个独特的下游实例,并且隐藏评估任务不被开发。我们发现,生成的工具在代码、搜索和研究方面仍然远远落后于成熟的人类工程参考文献,同时匹配或超过了在编写和机器学习实验方面选定的参考文献,但执行成本差异很大。进化产生了一些性能提升,但它们不稳定,并且仅部分转移到保留的任务上。使用固定运行时模型的实验进一步表明,增益在很大程度上取决于执行工具的模型,这表明模型之间的传输有限。