论文

RACE-Bench:存储库级代码代理功能添加的推理增强基准

RACE-Bench: A Reasoning-Augmented Benchmark for Repository-Level Code Agents on Feature Addition

智能体系统Agent任务评测

摘要

存储库级代码代理在现实世界的功能添加任务中表现出了强大的前景,这使得对其功能的可靠评估变得越来越重要。然而,现有的基准测试主要根据最终测试的正确性将这些代理评估为黑匣子,对它们如何推理以及故障发生的位置提供的了解有限。为了解决这个限制,我们引入了 RACE-bench,这是一种推理增强基准,用于评估存储库级功能添加任务上的代码代理。 RACE-bench 包含来自 12 个开源存储库的 528 个真实世界的功能添加实例。每个实例都配有可执行补丁验证和结构化中间参考推理,涵盖问题理解、文件本地化、实施任务和步骤分解。基于此设计,我们引入了一个双轨评估框架,该框架联合测量补丁正确性和中间推理与开发人员接受的参考轨迹的对齐情况。我们在 RACE-bench 上评估了三个具有代表性的存储库级代码代理。在完整的基准测试中,不同代理的解决率范围为 29% 到 70%。我们的推理级别分析进一步表明,虽然当前智能体在理解高级意图方面表现良好,但在将意图转化为具体实施步骤时,它们的性能大幅下降。我们还发现,与成功的补丁相比,可以应用但仍然无法通过测试的补丁涵盖的参考推理元素更少(召回率降低了 35.7%),并且包含更多不受支持的推理元素(过度预测高出 94.1%)。这些发现强调了通过检查推理过程的质量来评估存储库级代码代理超越最终补丁正确性的重要性。