论文
ADWIN:Horizon-Aware 的自适应 Windows 同策略 蒸馏
ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 通过沿着学生生成的轨迹训练学生的教师反馈来转移推理行为,但标准的全面轨迹采样训练将每次更新都与昂贵的完成联系起来,并且可能将监督过度分配给当前学生边际价值较低的后期职位。我们通过有用的监督视野重新审视这个假设:学生引发的轨迹采样可能会偏离教师首选的延续,而对齐的前缀可能已经保留了长视野 OPD 更新方向。我们提出了 ADWIN,一种用于 OPD 的自适应窗口框架,它将轨迹采样长度视为在线受理决策,对短的教师锚定前缀进行训练,同时使用延迟的全面轨迹采样探针来审核前缀 - 完全对齐并通过过时控制来适应下一个视野。在单任务、多任务和强到弱设置中的数学和代码推理基准测试中,ADWIN 提高了准确性 - 与全面轨迹采样的 OPD 和基于前缀的基线进行计算权衡,将端到端训练成本降低多达 4.1 倍,同时实现相当或更好的准确性。