论文
MetaOPD:用于策略蒸馏的元学习token权重
MetaOPD: Meta-Learned Token Weighting for On-Policy Distillation
摘要
在策略蒸馏 (OPD) 使用token级教师监督来训练学生自己生成的响应。然而,统一加权忽略了token学习值的差异,而现有的加权方法依赖于从预测信号到token权重的预定义映射。这些映射不是从学生更新的有效性中学习到的,限制了他们适应不断变化的学习需求的能力。在本文中,我们提出了 MetaOPD,这是一种双层优化框架,可以联合学习学生模型和轻量级token加权网络。内部目标通过加权 OPD 更新学生,而外部目标在虚拟学生更新后使用参考解决方案的验证损失来优化加权网络。通过此更新进行区分,将权重决策与其对更新后性能的影响联系起来,从而允许从预测信号到token权重的映射与学生一起发展。对六个数学推理和三个域外数据集进行的实验,涵盖两个学生量表和 七个基线,证明了 MetaOPD 的有效性,0.6B 学生的 Avg@8/Pass@8 比 OPD 提高了 1.99/5.97 个百分点,1.7B 学生提高了 2.25/6.41 个百分点。