论文
基于偏好的自我 蒸馏:通过奖励正则化超越 KL 匹配
Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization
摘要
同策略 蒸馏 是强化学习的有效替代方案,提供密集的 词元级 训练信号。然而,它对更强大的外部教师的依赖推动了最近对 同策略 自 蒸馏 的研究,其中同一模型在不同的提示上下文下既充当教师又充当学生。然而,现有的自我 蒸馏 方法在很大程度上减少了对上下文增强教师模型的 KL 匹配的学习。这种方法经常会遇到训练不稳定的问题,并且会随着时间的推移降低推理性能。此外,来自同一模型的具有即时增强的自我 蒸馏 缺乏真正的外部教师提供的探索多样性。为了解决这些限制,我们超越了固定教师 KL 匹配,并提出 \textbf{P}reference-\textbf{B}ased \textbf{S}elf-\textbf{D}istillation (\textbf{PBSD}),它通过奖励正则化的视角重新审视 同策略 self-蒸馏。我们不是直接匹配教师分布,而是得出一个奖励正则化目标,其分析最优是奖励重新加权的教师分布,在该目标下产生一个可证明优于原始教师的目标策略。实际上,PBSD 优化了教师和学生样本之间的偏好差距,同时保持了 同策略 学生样本。我们通过对引发的偏好学习问题的统计分析来支持该框架,正式确定 同策略 自我 蒸馏 在我们的环境中何时比向外部教师学习更可取。跨多个模型规模的数学推理和工具使用基准的实验表明,PBSD 在可比较的基线中始终实现了最强的平均性能,与之前的自 蒸馏 基线相比,训练稳定性得到了提高,同时保留了词元效率。