论文
SAGE-OPD:选择性药物引导多轮干预 同策略 蒸馏
SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 通过在自己的策略引起的轨迹上训练学生模型来改进学生模型,使其成为减轻代理训练中暴露偏差的有前途的方法。然而,大多数 OPD 研究侧重于单轮设置,而现实的 LLM 代理则在多轮上与环境交互。在这种情况下,早期错误可能会改变未来的观察结果并在整个轨迹上复合,并且标准密集的 词元级 OPD 会变得脆弱,因为它可能会过度惩罚语义上有效的替代方案,强化局部退化(例如重复行为),并传播对分布外历史的不可靠的教师监督。我们提出了 SAGE-OPD,这是一种专为多轮 OPD 设计的无验证者选择性干预框架。 SAGE-OPD 不是在所有回合中统一应用教师监督,而是首先观察环境反馈,并利用教师的判断来决定是否应该跳过或干预每个学生的反应。为了进一步解决复合错误,SAGE-OPD 根据教师置信度对 词元级 蒸馏 进行加权,从而减少不确定的教师分布对损坏或模糊历史的影响。最后,SAGE-OPD 应用损失归一化来保留标准 OPD 的整体损失规模,同时保留选择性的转弯水平加权。对代理任务的实验表明,SAGE-OPD 相对于基线持续改进,与标准 OPD 相比,ALFWorld 未见成功率相对提高了 13.3%。消融研究进一步表明,轮班干预、教师信心加权和损失正常化可以提供互补的好处。我们的结果表明,有效的多轮 OPD 应保留 同策略,但教师监督应有选择地分配到干预必要且可靠的轮次。