论文
超越可验证的奖励:基于评分标准的 GRM,用于强化 微调 SWE 代理
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
摘要
尽管最近在 大语言模型 (LLM) 软件工程 (SWE) 任务代理方面取得了进展,但端到端 微调 通常依赖于可验证的终端奖励,例如所有单元测试是否通过。虽然这些二进制信号反映了最终解决方案是否正确,但它们对于塑造多步骤交互期间的中间行为几乎没有提供指导,从而限制了解决过程整体质量的改进。为了解决这个问题,我们引入了基于标题的生成奖励模型(GRM),它提供了更丰富的学习信号。 GRM 配备了人为设计的规则,指示鼓励或阻止特定行为模式的标准,我们利用此反馈通过轨迹过滤收集高质量的训练数据。当用于 SWE 任务上的强化 微调 (RFT) 时,我们的方法优于仅最终分数拒绝采样:正如案例分析所证实的那样,它更有效地抑制不良模式,同时促进有益模式,并最终提高最终测试准确性。