论文
过滤,然后重新加权:重新思考 同策略 蒸馏 中的优化粒度
Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation
摘要
大语言模型 中的 同策略 蒸馏 (OPD) 正在从全跟踪 KL 监督转向更具选择性的训练范例。最近的 OPD 方法越来越注重选择要学习的轨迹、哪些标记信息最丰富,以及哪些监督信号最可靠。受这一趋势的推动,我们重新思考 OPD 的优化粒度,并提出 \fireicon\ FiRe-OPD(过滤,然后重新加权),它在轨迹和词元级别联合调整监督信号。具体来说,FiRe-OPD 首先过滤轨迹以删除低质量的 rollout 样本,然后在保留的轨迹中应用软重新加权以强调信息标记。与硬词元选择相比,FiRe-OPD利用软权重机制有效减少信息丢失并增强优化稳定性,从而实现更细粒度的OPD优化。我们在从强到弱、单教师和多教师设置中验证了 FiRe-OPD 的有效性,并证明了其相对于最近的 词元级 OPD 方法的优越性(例如,从强到弱的 AIME 2024 上 +6.25,在多教师的 Miner 上 +18.81)。我们的代码可在https://github.com/YuYingLi0/FiRe-OPD。