论文

代理检索工作台:评估 编码智能体 的存储库上下文检索

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

模型评测基准与评测资源

摘要

现代 编码智能体 通常通过它们最终是否生成正确的补丁进行评估,但补丁的生成取决于早期的上下文获取阶段:查找任务所需的存储库文件。我们引入了 Agent Retrieval Bench,这是针对此上游检索问题的文件级基准。样本是根据真实的编码工作流程信号构建的,并根据冻结的基本提交存储库进行评估,其相关性由代理接下来需要的内容定义,而不是直接查询文件语义相似性。该基准测试涵盖四个正检索任务:code2test、comment2context、trace2code 和 edit2ripple;第五个子集使用自然证据支持的无标准相关文件案例和反事实错误存储库控制来评估选择性检索。 Agent Retrieval Bench 包含 25 个存储库中的 427 个样本:345 个正样本、50 个自然无标准相关文件样本和 32 个反事实对照。该语料库包括 308 个基本提交快照、392,000 个文件和 790 万个块。我们评估词汇检索、RepoMap、开源嵌入、选择性弃权和记录的代理上下文选择。没有一个检索家族占主导地位:Qwen3-Embedding-4B 在正样本上具有最佳样本加权 MRR,Qwen3-Embedding-8B 是最佳 Recall@20,而 RepoMap 在 8K 词元上具有最佳预算上下文产量,任务级别的获胜者差异很大。用反事实控制校准的选择性阈值并不能提高自然无标准相关文件案例的选择性成功,揭示了校准差距。记录的轨迹还遗漏了 27-35% 样本的每个标准相关文件。受控种子干预试验发现,与随机非相关上下文相比,检索衍生的初始上下文产生更高的文件 F1,且种子后探索更少,而预言机标准相关上下文显示出大量剩余空间。