论文
RetireOPD:用于代理强化学习的自动退休按策略蒸馏
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
摘要
经过强化学习(RL)训练的多回合智能体每条轨迹都会获得一个标量奖励,这会激励自我策略蒸馏(OPD)从具有特权任务技能的自学教师那里提供密集的词元级监督,让无技能的学生将其内化。然而,这一秘诀被代理任务中的两个发现所破坏:仅凭特权信息并不总是使教师可靠,而且教师监督的好处取决于阶段。因此,我们提出RetireOPD(Self-Retiring On-Policy Distillation),它首先通过环境奖励优化一个解耦的、有技能条件的教师,然后与RL和OPD联合训练一个无技能的学生。 RetireOPD 没有遵循预先定义的精炼时间表,而是采用自适应退休:一旦学生的差异停止缩小并且达到教师成功率的目标分数,学生就自行放弃教师,之后仅使用 RL 进行训练。在从 1.5B 到 7B 的 Qwen2.5 模型中,RetireOPD 将 ALFWorld 成功率相对于 RL 基线提高了 14.1% 到 18.8%,将 WebShop 准确率提高了 11.8% 到 19.0%,并且在每个设置中都超过了自己的技能条件教师。