论文

SWE-MILE:长期软件工程Agent的异步电位诱导里程碑信用分配

SWE-MILE: Asynchronous Potential-Induced Milestone Credit Assignment for Long-Horizon Software Engineering Agents

模型训练AI 基础设施强化学习奖励建模与过程监督SandboxRLVRAgentic RLAgent Sandbox

摘要

经过具有可验​​证奖励的强化学习(RLVR)训练的长时域软件工程(SWE)智能体通常只接受最终结果监督,因此很难将生产性行为与冗余探索或功能回归区分开来。我们提出了 SWE-MILE,这是一种异步电位诱导的里程碑信用分配框架,它从工作流运行时导出细粒度的流程监督,无需辅助奖励模型或外部评估器。 SWE-MILE 将任务相关文件暴露和测试状态对齐分别量化为导航和验证潜力。这些潜力的差异将里程碑式的进展和倒退归因于个人行为,而贴现后向信贷则将监督传播到前面的步骤。为了有效地获取中间验证状态,SWE-MILE 进一步引入了异步影子探测,它在隔离的沙箱中重播存储库更改操作,并与Agent的主要交互并行运行验证,从而在很大程度上隐藏了验证延迟。由此产生的过程信用增强了最终结果优势并提供了信息丰富的学习信号。对两个具有代表性的长期 SWE 任务的实验证明了Agent性能的显着改进,突出了工作流运行时信号作为长期 SWE Agent的过程监督的实用来源。