论文

SW-$A^2$-Bench:代理 Web 的自主软件代理生成基准测试

SW-$A^2$-Bench: Benchmarking Autonomous Software Agent Generation for Agentic Web

智能体系统Agent任务评测

摘要

代理网络正在成为一种范例,其中自主软件代理与在线资源以及彼此之间进行交互以实现用户目标。然而,Agentic Web 的容量仍然受到自治软件代理数量不足的限制,这已成为扩展 Agentic Web 的关键挑战。为了缓解这一问题,我们研究了通过 编码智能体 自动将现有代码存储库转换为自主软件代理的任务,将过程分解为关键阶段,并确定关键技术障碍。为了系统地评估这种能力,我们提出了 Agentic Web Bench 的软件代理生成(SW-$A^2$-Bench),这是第一个为软件代理生成而设计的基准。 SW-$A^2$-Bench不仅评估是否可以生成软件代理,还评估生成的软件代理是否忠实于源存储库以及是否可以与多代理工作流程中的其他代理进行互操作。我们的实验表明,我们的方法有效地激活了代码存储库的功能,并在 Agentic Web 中实现了可互操作的多代理协作。我们相信这项工作将为软件代理生成提供标准化评估,并将有助于未来扩展 Agentic Web 的容量。