论文

选择之前先看看:重新思考on-policy蒸馏中的词汇稀疏化

Look Before You Select: Rethinking Vocabulary Sparsification in On-Policy Distillation

摘要

on-policy蒸馏 (OPD) 使用教师对学生生成的回答进行修正。即使对于学生分配低概率的标记,完整词汇校正也可以提供重要的校正,但是对于长序列,通过所有词元logits进行反向传播会变得内存密集型。现有的节省内存的方法根据采样的标记估计校正或限制对学生的 TopK 标记的监督,从而引入采样噪声或更改全词汇校正。我们引入 SparseOPD,它使用全词汇教师校正来确定哪些校正重要,然后再选择需要求导的词元logits。 SparseOPD 首先构建全词汇校正而不保留其后向图,然后通过校正幅度而不是学生概率来选择标记。带符号的剩余补偿保留了总的促进和抑制校正质量,而具有校正意识的预算分配则在各个词元位置之间分配了稀疏支持。最后,更新仅通过选定的 token logits 反向传播。在涵盖数学、化学 QA 和多模态推理的六种任务规模设置中,SparseOPD 在任务平均准确度方面优于 Sampled Token 和 TopK,并且匹配或超过 Full Vocabulary。 4B 数学上的梯度余弦相似度达到 99%,而 8K 全参数分析显示向后记忆降低了 70.5%。