论文
面向智能体强化学习的群体反思式自蒸馏
Group-Reflective Self-Distillation for Agentic Reinforcement Learning
摘要
带可验证奖励的强化学习(RLVR)对训练大语言模型智能体是有效的。然而,终端奖励只提供粗粒度的轨迹级监督,使成功行为、反复错误和偶然选择纠缠在同一结果信号中。现有的智能体自蒸馏方法用自然语言技能丰富稀疏监督,但从外部检索的技能或由更强模型从单条轨迹提取的技能,可能与当前经验不匹配、超出策略的能力范围,或局限于特定路径。我们提出群体反思式自蒸馏(GRSD),它从策略自身经验证的rollout中推导能力对齐且能区分结果的指导。对每个提示,策略对同策略组中的每条经验证轨迹进行反思,一个停止梯度的快照对比来自成功与失败rollout的反思,以构造群体级特权指导。在该指导的条件下,一个自教师通过调节基于结果的优势来精化回合级(turn-level)信用分配,同时保持由验证器确定的学习方向。在多个智能体环境和模型规模上的实验表明,GRSD持续优于有竞争力的基线,并能更有效地泛化到未见任务。
