论文
DOPD:双同策略蒸馏
DOPD: Dual On-policy Distillation
摘要
同策略蒸馏 (OPD) 通过使用密集的词元级信号监督学生采样轨迹,提供卓越的容量传输。为了提供高质量的监督来源,从而提升蒸馏的性能前沿,一个直观的方向是向教师或学生本身注入特权信息。然而,这种额外的输入会引发一种潜在的失败模式,我们称之为特权错觉:这种模式将学生本应弥合的可转移能力差距与只能模仿但永远无法复制的信息不对称差距混为一谈。词元级别监管固有的不一致性进一步放大了这个问题,其中只有一小部分词元携带关键的能力承载信号。为此,我们提出了 DOPD,一种优势感知的双重蒸馏范式,它根据优势差距和相对概率在特权教师和特权学生策略之间动态路由词元级监督。每个词元都接受教师或学生本身不同强度、目标和策略的监督,在传递可信能力的同时接收辅助信号,以减轻特权错觉。对大语言模型 (LLM) 和视觉语言模型 (VLM) 设置的大量实验表明,DOPD 始终优于 Vanilla OPD 和其他同行。稳定性、鲁棒性、持续学习和分布外任务的进一步结果验证了其优越性。
