论文
双向上下文自蒸馏:面向技能型LLM智能体的强化学习方法
Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents
摘要
外部自然语言技能为大语言模型(LLM)智能体提供可复用、可编辑的复杂任务求解指导。然而其有效性不仅取决于技能质量,还取决于策略能否将所提供的指导转化为恰当行动。然而,专门用于提升这种技能利用能力的方法在很大程度上仍待探索。实践中,基于技能的智能体通常用以任务级奖励为中心的强化学习目标训练,其监督有限,难以捕捉策略使用所提供技能有效性的细微差别。我们提出BCSD(双向上下文自蒸馏),一个将自蒸馏与强化学习结合、训练LLM智能体更有效使用外部技能的框架。与以往依赖单一特权上下文的自蒸馏方法不同,BCSD从两个互补的技能上下文视角评估每条轨迹。增强视角引入更高层的元技能(Meta-Skill)指导,缩减视角则裁剪通用指导以突出任务特定技能。二者互补的token级信号被组合起来重新缩放强化学习优势。在ALFWorld和WebShop上的实验表明,BCSD在各模型规模上取得最强整体表现,使智能体能更有效地利用外部技能。消融实验进一步验证了增强与缩减上下文视角的互补贡献。代码将公开发布以确保完全可复现。
