论文
SWE-Explore:对 编码智能体 如何探索存储库进行基准测试
SWE-Explore: Benchmarking How Coding Agents Explore Repositories
摘要
SWE-bench 等存储库级编码基准推动了 编码智能体 功能的快速提升。然而,他们通常将编码任务视为整体的二元预测问题(例如,已解决或未解决),而忽略了细粒度的代理功能,例如存储库理解、上下文检索、代码本地化和错误诊断。在本文中,我们介绍了 SWE-Explore,这是一个隔离存储库探索评估的基准,这是 编码智能体 的一项关键功能。给定一个存储库和一个问题,SWE-Explore 要求浏览器在固定行预算下返回相关代码区域的排名列表。 SWE-Explore 涵盖 10 种编程语言和 203 个开源存储库的 848 个问题。对于每个实例,我们从成功解决同一问题的独立代理轨迹中得出行级 真值,提取其解决方案路径实际参考的特定代码区域。我们根据覆盖率、排名和上下文效率维度评估探索,表明这些指标强烈跟踪下游修复行为。在广泛的检索方法、通用 编码智能体 和专门的定位器中,我们发现代理探索者形成了高于经典检索的清晰层次。虽然文件级本地化对于现代方法来说已经很强大,但行级覆盖和高效排名仍然是区分最先进的浏览器的关键轴。