论文

LoLBench:在大型软件系统上评估具有长期建议的编码Agent

LoLBench: Evaluating Coding Agents with Long-Horizon Proposals on Large Software Systems

智能体系统Agent任务评测

摘要

现代编码Agent可以提供越来越大的存储库级别的更改,最近的基准测试通过强调具有大型参考实现的长期任务来反映这一点。许多基准测试评估编码Agent根据详细规范生成正确代码编辑的实施能力。然而,实际的模块化开发任务还需要基于用户意图的感知能力和高层设计来导出规范。我们引入 LoLBench 来评估大型软件系统上从提案到实施的整个过程中的这两种功能。它是跨 5 个领域 29 个软件系统的 100 项任务的多语言基准测试。每个任务都提供了一个具有用户意图和高级设计的人工编写的增强建议。平均而言,提案包含约 5,000 个单词,软件系统包含 240 万行源代码 (LoC),实施拉取请求 (PR) 更改约 5,500 个 LoC。在我们评估的 28 个Agent中,最好的Agent仅解决了 14% 的任务,并实现了 52.7% 的失败通过率 (F2P)。故障分析将不完整的代码本地化确定为主要瓶颈,同时提供参考派生文件树以及 API 规范,将解决率提高了 16--22 个百分点 (2.4--17$\times$),最多达到 34%。这些结果表明,在大型软件系统的实际模块化开发中,感知和实现仍然是编码Agent面临的主要挑战。 LoLBench 可通过 https://huggingface.co/datasets/lolbench26/LoLBench. 获取