论文

Active-SWE:对 编码智能体 进行基准测试,以实现主动错误修复,无需问题报告

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

智能体系统Agent任务评测

摘要

由 大语言模型 (LLM) 提供支持的 编码智能体 越来越多地在软件工程 (SWE) 场景中采用,能够修复大规模代码库中的特定错误。然而,现有的 SWE 基准通常假设始终可以获得包含详细信息的高质量问题报告,但由于报告获取和管理的复杂性,在实践中很容易违反这一点。为了解决这个问题,我们引入了 Active-SWE,这是一个评估 编码智能体 在没有报告指导的情况下主动发现和修复多个错误的基准,涵盖了 6 个错误类别和 8 种语言的 1,663 项任务。除了将重点从现有的反应性错误修复转移到主动错误修复之外,Active-SWE 还将范围从修复特定记录的错误扩展到多个错误修复和潜在的错误发现场景,从而实现更深入的评估。为了构建 Active-SWE,我们提出了一种具有双轨评估框架的新颖的难度感知任务制定流程,有助于对主动错误修复能力进行全面评估。大量实验表明,大多数最先进的 编码智能体 都在主动修复错误任务方面遇到困难,在定位和解决记录的错误、处理多个错误修复场景以及发现有效的潜在错误方面表现有限。