论文

存储库级软件工程评估的时间一致基准

ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation

智能体系统Agent任务评测

摘要

对存储库感知的软件工程系统的评估通常会受到合成任务设计、提示泄漏以及存储库知识和未来代码更改之间的时间污染的困扰。我们提出了一种时间一致的基准测试方法,该方法在时间 T0 拍摄存储库,仅使用 T0 之前可用的工件构建存储库派生的代码知识,并评估从未来时间间隔(T0,T1]合并的拉取请求派生的工程任务。每个历史拉取请求通过 LLM 辅助的提示生成管道转换为自然语言任务,并且基准被形式化为匹配的 A/B 比较,其中使用和不使用相同的软件工程代理进行评估我们还报告了对两个开源存储库 DragonFly 和 React 的基线特征研究,使用三个 Claude 系列模型和四个提示粒度,文件级 F1 从最小提示到引导提示单调增加,对于最强的测试模型,DragonFly 达到 0.8081,React 达到 0.8078。总的来说,该基准强调时间一致性和及时控制是存储库感知软件工程评估的核心有效性要求。