论文
自蒸馏代理强化学习
Self-Distilled Agentic Reinforcement Learning
摘要
强化学习(RL)已成为 后训练 LLM 智能体的中心范式,但其轨迹级奖励信号仅为长视野交互提供粗略监督。 同策略 Self-蒸馏 (OPSD) 通过引入来自教师分支的密集 词元级 指导并增强特权上下文来补充强化学习。然而,将 OPSD 转移到多轮智能体被证明是有问题的:复合多轮不稳定性会破坏监督的稳定性,而以技能为条件的特权指导则需要对可能因不完善的技能检索或利用而产生的负面教师拒绝进行不对称处理。我们引入了 SDAR(自蒸馏代理强化学习),它将 OPSD 视为门控辅助目标,同时保持 RL 作为主要优化骨干。 SDAR 将分离的 词元级 信号映射到 sigmoid 门,增强 蒸馏 对教师认可的正间隙词元的支持,并轻微减弱消极的教师拒绝。在 ALFWorld、WebShop 和 Search-QA 上的 Qwen2.5 和 Qwen3 系列中,SDAR 显着优于 GRPO(在 ALFWorld 上+9.4%,在 Search-QA 上+7.0%,在 WebShop-Acc 上+10.2%),避免了朴素 GRPO+OPSD 的不稳定性,并且在模型规模上始终优于混合 RL-OPSD 基线。