论文

LENS-OPD:按决策重要性与学生能力分配长程蒸馏监督

Dense Is Not Enough: Hierarchical Supervision Allocation for Long-Horizon On-Policy Distillation

摘要

on-policy蒸馏 (OPD) 通过为学生自己的部署提供教师监督,将大语言模型的功能转移给较小的学生。然而,在长期 agentic 任务中,统一的词元级别匹配可能会很差地分配监督:较大的局部差异不需要改善未来的行为,而相应的指导可能超出当前学生的能力范围,或者在没有特权输入的情况下无法坚持下去。我们将长期 OPD 制定为分层监督分配,并认为富有成效的指导位于未来效用和当前可学习性的交叉点。至关重要的是,这种交叉点随着学生的学习而演变。基于这个原则,我们提出了 LENS-OPD,一个从粗到细的框架,通过 Locate、Validate 和 Refine 来组织监督。 Locate 根据学生不断发展的能力调整轨迹暴露,并提出干预的候选决策。验证测试教师对该决定的指导是否会改善同一学生的后续行为。 Refine 将有益的引导行为内化到可部署的策略中,并将词元级别的监督集中在经过验证的回合内决定性的师生冲突上。这些阶段是嵌套的:每个更精细的分配都以更粗略的决策为条件,而不是作为独立的重要性得分进行优化。跨多个长期Agent基准和学生-教师配置的实验表明,与普通 OPD 以及基于课程和选择的强大基准相比,LENS-OPD 持续提高了任务性能。我们的结果表明,有效的长期蒸馏需要正确深度的教学、正确的决策和正确的标记。