论文

先指导再放手:稀疏奖励Agentic RL的差距自适应教师调度

Guide, Then Let Go: Gap-Adaptive Teacher Scheduling for Sparse-Reward Agentic RL

模型训练强化学习RLVRAgentic RL

摘要

长视野智能体的强化学习通常依赖于稀疏的基于结果的奖励。这导致了严重的冷启动问题,因为早期策略通常无法解决采样任务,几乎没有留下有用的学习奖励信号。为了缓解这个问题,我们使用策略蒸馏(OPD)来为学生自己的部署提供词元级别的指导。我们发现这种指导的好处取决于教师和学生之间的表现差距。当老师的表现明显优于学生时,蒸馏有助于引导学生完成早期训练阶段,在该阶段,结果奖励几乎无法提供学习信号。然而,随着差距缩小并最终逆转,继续蒸馏变得不那么有利,并可能阻碍进一步的改进。受这一观察的启发,我们提出了差距自适应教师调度(GATS),它通过 OPD 项来增强学生的 RL 目标,该 OPD 项的权重适应师生表现差距。具体来说,当学生接近教师的参考表现时,GATS 会逐渐减少教师指导,并在达到参考值后撤回指导。这使得 GATS 能够利用比学生规模更小的受过任务训练的教师,因为在早期训练期间主要需要教师指导。在具有三种 Qwen2.5 师生配置的 ALFWorld、WebShop 和 ScienceWorld 中,GATS 在所有三种配置的比较方法中实现了最高的平均成功率,在匹配的学生rollout预算下比仅奖励 GRPO 提高了 4.37%-11.87%。代码可在 https://github.com/Ricardo-H/guide-then-let-go. 获取