论文
FLARE:通过生成奖励模型实现长视野编码代理的全生命周期密集监督范式
FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model
摘要
虽然测试时间扩展增强了长期软件工程 (SWE) 中的大型语言模型 (LLM) 代理,但稀疏的二元奖励(通过/失败)会造成严重的信用分配危机,并浪费失败的探索轨迹。当前的轨迹优化和缩放方法成本高昂且结构有限,依赖于启发式状态重用而没有因果诊断或延迟标量评分而没有可操作的在线指导。我们提出了 FLARE(全生命周期对齐和奖励引擎),这是一种由轻量级生成奖励模型(GRM)驱动的新型密集监督范式。首先,RADAR 是一种离线因果感知诊断框架,通过因果链回溯提取高保真、无后见之明的监督,以提炼出提供实时、阶梯级风险反馈的 GRM。其次,FLARE 使用此 GRM 在代理的整个生命周期中持续优化代理。在推理过程中,FLARE 充当主动支架,自主拦截高风险生成步骤以进行局部断点重新执行,从而大大减少计算开销。在训练后,GRM 的结构化信号充当监督微调 (SFT) 的过程监督重排序分数和强化学习 (RL) 的步骤级密集奖励,从而减轻稀疏环境中的策略崩溃。广泛的评估表明,FLARE 在整个代理生命周期中建立了一个新的帕累托前沿:FLARE (N=1) 优于 Global Rollout (N=5),词元消耗减少了 5 倍。将 FLARE 扩展到训练中可以克服长期交互任务中的稀疏奖励问题,通过流程感知数据管理,在 SFT 中实现 19.13% 的相对性能提升,在 RL 中实现 9.19% 的持续改进。