论文

更大:词汇锚定存储库图探索和检索

LARGER: Lexically Anchored Repository Graph Exploration and Retrieval

上下文与知识检索增强

摘要

存储库级 编码智能体 必须首先本地化与任务相关的文件和符号;此阶段的失败可能会级联到下游目标,从补丁生成到测试编写和代码库问答。现有代理主要通过词法搜索来导航存储库,通常会缺少结构关系,例如导入、调用链、类型层次结构和代码测试链接。基于图的检索可以恢复此类依赖性,但现有方法通常需要单独的图工具或遍历阶段来分割代理的交互循环。我们将存储库上下文本地化形式化为词汇锚定结构本地化,其中成功取决于将词汇匹配转变为高精度结构入口点,并在代理的现有搜索循环中暴露最有用的置信过滤本地邻域。我们引入了 LARGER(词法锚定存储库图探索和检索),这是一种词法锚定的活动集检索框架,它从词法匹配开始,将它们与图锚点对齐,并在代理的现有搜索循环中执行置信过滤的局部扩展。 LARGER 直接集成到现有的 CLI 编码智能体 中,无需外部图形数据库或专门的图形接口。在涵盖本地化、测试生成和代码库理解的四个基准测试中,LARGER 通过调整超参数将 LocBench 上的文件级 Acc@5 提高了 +13.9 分,并且通过固定超参数在最强基线上仍然获得了 +11.8 分,同时在 MuLocBench、SWE-Atlas 测试编写和 SWE-Atlas 代码库 QA 上提供了一致的收益。