论文

带语义搜索的小型智能体:高效的多语言代码本地化

Small Agents with Semantic Search: Efficient Multilingual Code Localization

模型优化小模型/轻量模型

摘要

从自然语言请求中查找相关文件是智能体在代码存储库上操作的核心子任务。我们研究是否可以将此任务委托给紧凑的专用模型,以实现设备上搜索,同时减少较大智能体的token使用、延迟和推理成本。我们证明语义搜索可以改善文件本地化,提高准确性、跨语言传输和推理效率。为了研究这种设置,我们引入了一个围绕 ColGREP 构建的训练文件本地化框架智能体,ColGREP 是一种基于后期交互检索模型的本地语义搜索工具。我们的方案将教师模型轨迹上的加权监督微调结合起来,根据检索结果分配回合级别信用,并通过本地化质量进行强化学习。我们训练了三个模型系列,其数量少于 20 亿参数,以制定搜索查询、检查检索到的内容并识别相关文件。在源自 SWE-bench Lite 和 Multi-SWE-bench Flash 的本地化任务中,配备 ColGREP 的智能体大大改进了其基本模型,并优于相应的基于 GREP 的智能体。除了提高定位精度之外,ColGREP 将 CPU 上的平均端到端轨迹延迟降低了 44.1%,同时使用的token减少了 29.1%,并且能够更好地泛化到微调期间未见过的编程语言。这些结果表明,紧凑的、工具专用的本地化智能体可以在自然语言请求和大型代码库之间提供有效的接口。