论文
技能-SD:多回合 LLM Agent的技能条件自我 蒸馏
Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
摘要
强化学习(RL)已被广泛用于训练 LLM 代理进行多轮交互任务,但其样本效率受到稀疏奖励和长视野的严重限制。 同策略 self-蒸馏 (OPSD) 通过由有权访问 真值 答案的特权教师提供密集的 词元级 监督来缓解这一问题。然而,这种固定的特权信息无法捕获代理任务中的各种有效策略,并且天真的将 OPSD 与 RL 结合通常会导致训练崩溃。为了解决这些限制,我们引入了 Skill-SD,这是一个将智能体自身轨迹转变为动态训练监督的框架。完整的轨迹被总结为紧凑的自然语言技能,描述成功的行为、错误和工作流程。这些技能仅作为教师的动态特权信息调节,而学生始终在简单的任务提示下行动,并学习通过 蒸馏 内化指导。为了稳定训练,我们推导了重要性加权反向 KL 损失,以提供梯度正确的 词元级 蒸馏,并动态同步教师与进步的学生。代理基准的实验结果表明,Skill-SD 大大优于标准 RL 基线,提高了普通 GRPO(在 AppWorld/Sokoban 上 +14.0%/+10.9%)和普通 OPD(+42.1%/+40.6%)。项目页面:https://k1xe.github.io/skill-sd/