论文
SWE-Shepherd:推进 PRM 以增强代码代理
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
摘要
对于基于 大语言模型 (LLM) 的代理来说,自动化现实世界的软件工程任务仍然具有挑战性,因为需要对大型、不断发展的代码库进行长期推理,并在相互依赖的操作中做出一致的决策。现有的方法通常依赖于静态提示策略或手工启发式来选择代码编辑、文件导航和测试执行等操作,但它们缺乏对中间决策的细粒度反馈。这会导致低效的探索、错误传播和脆弱的解决方案轨迹。为了解决这个限制,我们提出了 SWE-Shepherd,这是一个引入过程奖励模型(PRM)的框架,为存储库级代码代理提供密集的、步骤级的监督。使用 SWE-Bench 的轨迹,我们构建了一个动作级奖励数据集,并在 LLM 基础上训练一个轻量级奖励模型,以估计中间动作的有用性。在推理过程中,PRM 评估候选行为并指导智能体做出更高奖励的决策,而无需完全强化学习。 SWE-Bench Verified 上的实验证明了交互效率和行动质量的提高,同时也凸显了将中间奖励与最终任务成功相结合所面临的挑战。