论文

SWE-TRACE:通过 Rubric 过程奖励模型和启发式测试时间缩放来优化长期 SWE 代理

SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling

模型训练奖励建模与过程监督

摘要

使用自主代理解决现实世界的软件工程 (SWE) 问题需要复杂的、长期的推理。当前的管道因未优化的演示数据、稀疏的执行奖励和计算上令人难以接受的推理扩展而成为瓶颈,这些因素共同加剧了词元膨胀、奖励作弊 和策略退化。我们提出了 SWE-TRACE(轨迹缩减和代理标准评估),这是一个跨数据管理、强化学习 (RL) 和测试时推理优化 SWE 代理生命周期的统一框架。首先,我们引入了一种 LLM 多任务级联方法,利用逐步预言机验证来提取严格偏向于词元高效、最短路径轨迹的 60K 实例监督 微调 (SFT) 语料库。其次,为了克服稀疏结果奖励的不稳定性,我们设计了一个具有基于 Rubric 的过程奖励模型(PRM)的记忆增强代理 RL 管道。辅助的 Rubric-Agent 提供关于中间步骤的密集、细粒度的启发式反馈,指导模型完成长期任务。最后,我们通过将 PRM 重新用于启发式引导的测试时间缩放 (TTS),在训练和推理之间架起桥梁。通过在每一步动态评估和修剪候选动作,SWE-TRACE 实现了卓越的搜索效率,而无需标准并行采样的延迟开销。对标准 SWE 基准的大量实验表明,SWE-TRACE 显着提升了最先进的水平,最大限度地提高了分辨率,同时大幅减少了词元消耗和推理延迟。