论文
EvoHarnessBench:您的代理能否跟上不断发展的Harness的步伐?
EvoHarnessBench: Can Your Agents Keep Pace with an Evolving Harness?
摘要
基于 LLM 的现代代理通过一系列工具、可重用技能和专业代理进行操作,这些工具决定了他们观察的内容和他们可以做什么。在实践中,随着新功能的添加,该工具不断发展。我们引入了 EVOHARNESSBENCH,这是一个用于评估跨三个轴(工具、技能和代理)的受控Harness演化下的代理的基准。与现有的持续学习代理基准不同,现有的代理持续学习基准通常在任务流中放置非平稳性(即随时间变化的内容),同时保持Harness固定,而 EVOHARNESSBENCH 在外部提供的Harness本身中放置非平稳性。它包含 17 个多阶段工具流,这些流是根据基于验证者的基准确定性构建的,包括 802 个任务、520 个工具、42 个技能和 62 个代理。我们评估了与Harness演化的核心挑战相对应的两个互补设置:部署评估(随着Harness扩展而隔离以前可访问的能力的保留)和自我演化适应评估(测试积累的经验在引入新功能时是否仍然有用)。我们的结果揭示了三个持续存在的差距。首先,仅利用Harness扩展就会降低之前解决的任务的性能,从而产生Harness引起的遗忘。其次,自我进化适应的收益在不同的工具进化阶段、能力轴和环境中仍然不一致。第三,保留和适应可以朝不同的方向发展:保留早期能力并不一定能提高对新引入能力的适应,反之亦然。这些结果表明,Harness进化对于构建智能体来说是一个独特的挑战,它可以跟上不断发展的Harness的步伐,同时保留以前有效的行为。