论文

DemoPSD:分歧调节政策自我 蒸馏

DemoPSD: Disagreement-Modulated Policy Self-Distillation

摘要

同策略 self-蒸馏 (OPSD) 已成为训练 大语言模型 (LLM) 推理的实用方法,其中单个模型既充当教师又充当具有不同级别信息访问的学生。然而,最近的研究发现,教师以特权信息为条件的密集 词元级 监督可能会导致对域内模式的过度拟合,抑制探索并损害跨域泛化,同时还引入了一个更基本的问题:“特权信息泄漏”,即学生编码在测试时不可用的依赖于答案的快捷方式。我们介绍**DemoPSD**,这是一种新颖的框架,通过“选择性采用教师指导”的理念解决此类问题。 DemoPSD 不是拟合完整的教师分布,而是引导学生走向“反向 KL 重心目标”,这是教师和学生分布的加权几何组合,自然地平衡了向教师学习与保留学生自己的推理能力。我们测量它们分布之间的差异,并使用这种差异来自适应控制每个词元位置的混合。我们证明 DemoPSD 实现了 **(1)** *泄漏衰减*,即有效缓解特权信息泄漏; **(2)** *勘探保留*,即在密集词元级 蒸馏下保留勘探能力。对 SciKnowEval 跨越四个科学领域的广泛实验表明,DemoPSD 的性能优于 GRPO 和 SDPO,同时保持较高的训练熵并稳健地推广到分布外 GPQA 基准。