论文
CodeGrep:经过 RL 训练的 LLM 编码智能体 检索代理
CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents
摘要
现代 LLM 编码智能体(例如 Claude Code 和 OpenHands)有一个共同的低效率问题:他们花费大量的 词元预算 来查找要修补的文件,而不是修补它。在 SWE-Bench Verified 上,30B OpenHands 代理平均每个解决问题需要 23 轮和 631K 个词元,在存储库探索期间,许多调用都花在 grep、glob 和 view_file 上。我们引入了 CodeGrep,这是一种使用 GRPO 进行端到端训练的 14B 检索代理,可发出多轮并行 grep、glob 和读取工具调用,并将候选文件返回到冻结的下游 编码智能体。在所有 500 个 SWE-Bench 验证实例上,CodeGrep 保留了解析率,同时大幅提高了效率:无检索基线为 27.0%,而无检索基线为 25.8%,已解析实例上的轮次减少了 15%,词元减少了 19%。在 检索器 中,下游实用程序遵循精度阈值:精度为 0.375 的 BM25 会降低代理的性能,精度为 0.445 的 Jina 是中性的,而精度为 0.677 的 CodeGrep 会越过检索开始降低执行轨迹成本的阈值。为了开展这项研究,我们使用 CATM 从 67K 个开源智能体轨迹中挖掘监督,并为多轮智能体强化学习构建了一个 Git-worktree 环境。在我们的设置中,在优势层而不是奖励层应用效率信号可以减少 KL 漂移并干净地转化为下游效率。我们将发布模型、训练流程、强化学习环境和评估工具。