论文
HDPO:通过特权自我 蒸馏 进行混合 蒸馏 策略优化
HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
摘要
使用强化学习 (RL) 进行数学推理训练的 大语言模型 面临着根本性的挑战:对于模型根本无法解决的问题 - “悬崖”提示 - RL 梯度完全消失,阻止任何学习信号到达这些故障模式。我们引入了混合 蒸馏 策略优化 (HDPO),它通过特权自我 蒸馏 定位悬崖提示来增强标准 RL。在每个训练步骤中,HDPO 都会识别所有采样轨迹失败的提示,通过向模型提供 真值 信息来生成特权采样轨迹,筛选正确的解决方案,并将教师的 词元级 分布提炼给学生。由于教师和学生共享相同的权重(仅输入不同),因此可实现性差距可证明是有界的,这与跨模型 蒸馏 不同。我们证明,R=1 过滤特权生成在硬阈值限制下恢复了最佳 KL 正则化 RL 策略。使用 Qwen2.5-Math-1.5B-Instruct 在 OpenMathInstruct-2 上进行的实验表明,HDPO 持续改进覆盖率指标(pass@4 提高 +0.8-1.1%,pass@8 提高 +0.4-1.7%),同时保持贪婪精度,蒸馏 权重 lambda 提供对探索-利用权衡的直接控制。