论文

DASH-OPD:同策略 蒸馏 的带滞后的差异感知开关

DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation

摘要

虽然 同策略 蒸馏 (OPD) 通过训练学生自己的语言模型来减少暴露偏差,但学生在长期代理场景中的早期错误可能会导致教师不熟悉的上下文。为了提高轨迹质量,最近关于代理 OPD 的工作通过在学生和教师之间切换执行者,将教师干预引入到训练中。然而,现有的方法决定了需要多少教师干预,但没有决定何时需要干预。为了解决这个限制,我们提出了 DASH-OPD(带有滞后的 OPD 差异感知切换),这是第一个执行自适应双向执行器切换的代理 OPD 方法。在每个回合,DASH-OPD 使用动作标记的平均对数似然比来衡量教师与学生之间的差异。学生轮流中的高师生比可作为漂移信号,而教师轮流中的低师生比可作为恢复信号。这些信号经过多轮累积,分别形成漂移和恢复证据。当任一类型的证据超过其相应的切换阈值时,DASH-OPD 就会切换执行器,从而引入滞后作用,防止瞬态差异波动触发快速切换。在三个基准和两个学生模型量表中,DASH-OPD 在所有 14 项任务绩效比较中均优于 5 个基线,同时在 10 项效率比较中的 9 项中需要最少的交互次数。代码、训练模型和训练日志可在 https://github.com/Lucian1115/DASH-OPD 获取