论文
RTMC:通过采样轨迹树进行步骤级贡献分配
RTMC: Step-Level Credit Assignment via Rollout Trees
摘要
多步骤代理强化学习受益于细粒度的贡献分配,但现有方法提供的选择有限:GRPO 等无批评方法为轨迹中的每个动作分配统一的优势,而学习价值网络会带来显着的开销,并且在稀疏奖励下可能很脆弱。我们观察到,针对同一问题的组内采样轨迹通常会遍历重叠的中间状态,隐式地形成一棵树,其分支在连续的决策点处发散。基于这一见解,我们引入了 Rollout-Tree Monte Carlo (RTMC) 优势估计,它汇总了共享公共状态的 rollout 的回报统计数据,以生成每步 Q 值和优势,而无需任何有学问的批评家。状态-动作签名系统将原始交互历史压缩为紧凑的、可比较的表示形式,使跨轨迹状态匹配变得易于处理。在 SWE-bench Verified 上,RTMC 比 GRPO 提高了 pass@1 3.2 个百分点。