论文

离策略与同策略蒸馏:不同训练目标的收益与脆弱性

Understanding Off- vs On-Policy Distillation: A Tale of Distinct Training Objectives

摘要

同策略蒸馏(OPD)利用教师模型对学生自身生成回答的反馈进行学习,与有监督微调相比,有望减少遗忘,但其收益和脆弱性仍未得到充分解释。本文研究从多个教师依次蒸馏的情形:学生最小化与教师之间的平均散度。前向KL散度对应加权算术混合,反向KL散度对应归一化的加权几何聚合。作者分别设计了在离策略和同策略反馈下学习这些目标的算法,在表格型设置中给出对数遗憾界,并把分析扩展到函数逼近。对聚合目标的分析解释了OPD的部分收益与风险。相比前向KL,反向KL在反馈信息不足时更能保留高置信专家的偏好,但对教师把正确回答赋予极低概率的错误更敏感。逐词元条件分布还揭示其对后续续写分布的依赖,在长程生成中可能偏向错误前缀。