论文

信任区域 同策略 蒸馏

Trust Region On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 是 大语言模型 (LLM) 高效 后训练 的基本技术,在代理学习、多任务增强和模型压缩方面具有广泛的应用。然而,当教师和学生的分布差异很大时,OPD 训练就会变得不稳定,因为教师对学生生成的词元的监督可能会产生不可靠的策略梯度,甚至导致优化失败。这项工作通过贡献分配策略解决了可靠的 同策略 词元级 监督问题,并提出了信任区域 同策略 蒸馏、TrOPD。它具有以下特点: 1)Trust-Region 同策略 Learning:TrOPD仅在教师提供可靠监督的区域执行OPD,减轻分布失配下K1反向KL估计器的优化难度。 2)异常值估计:对于异常值区域,我们探索梯度裁剪、掩蔽和前向KL估计,以减少不可靠监督的不利影响。 3)离策略指导:学生继续从教师前缀生成并使用前向KL来模仿离策略指导,鼓励同策略探索可靠区域。实验表明,TrOPD 在数学推理、代码生成和通用领域基准测试中始终优于 SoTA OPD 基线,包括 OPD、EOPD 和 REOPOLD。