AgentBug-Smith:自动复现Agentic系统的真实Harness缺陷
AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems
摘要
Agent Harness缺陷表现出独特的特征,并且对于最先进的软件Agent来说修复仍然具有挑战性。现有基准测试进一步阻碍了这一领域的进展,这些基准测试仅包含少量且固定数量的可执行Harness错误,同时需要数百个小时来构建。这项工作提出了 AgentBug-Smith,这是一种自动化的Harness错误再现方法,可以从开源 Agentic 系统中不断发现和再现现实世界的Harness错误。在不同的主干大语言模型中,AgentBug-Smith 始终优于为通用软件设计的现有错误再现技术,再现Harness错误的成功率提高了 10.67% - 27.56%。通过将 AgentBug-Smith 应用于野外的开源 Agentic 系统,我们构建了 Live-Harness-Bench,这是一个实时且可扩展的基准测试,目前包含 200 个可重现的Harness错误。我们通过两个下游应用程序进一步演示了 Live-Harness-Bench 的实用性。首先,我们使用 Live-Harness-Bench 作为评估基准,系统地评估最先进的软件Agent,揭示它们在修复现实世界Harness错误方面的有限能力。其次,我们使用 Live-Harness-Bench 作为现实世界Harness错误修复的知识库,从中可以提取可重用的修复技能来改进现有的软件Agent,将其Harness错误修复率提高 6.32%。 AgentBug-Smith 和 Live-Harness-Bench 共同建立了一个可扩展的基础,用于持续评估和改进Harness错误修复方面的软件Agent,将现实世界的Agent故障转化为可执行的评估实例和可重用的知识以进行Harness改进,从而有助于实现递归自我改进Agent的最终目标。