论文
OPSRD:按策略自我角色蒸馏
OPSRD: On-Policy Self-Role Distillation
摘要
角色提示通过专家身份从大语言模型中引发专门的行为,提供了一种轻量级的方法来指导对高要求任务的推理。然而,当采样的解决方案仍然不正确时,评估或提取完整的角色提示答案可能会错过有用的下一个标记首选项。转移这些偏好还需要一个能够实现学生很少预测到的替代方案的目标。我们引入了 OPSRD,它使用固定的专家角色作为特权教学环境,在没有参考解决方案的情况下进行政策自我蒸馏。一个无角色的学生生成一条轨迹,并且同一基本模型的冻结实例在其精确前缀上提供角色条件分布,从而暴露出采样延续之外的替代方案。教师加权的前向 KL 目标是学生低估的替代方案,并通过剪裁来限制个人词汇量的贡献。监督仅限于学生位置中熵最高的一半,将学习集中在预测不确定的地方。使用 Qwen3-1.7B、4B 和 8B 对三个竞赛数学基准进行的实验表明,与推理时没有角色提示的基本模型相比,有了改进。在每个尺度的三个评估散度中,Forward KL 实现了最高的宏观平均准确度。代码可在 https://github.com/zhansan114514/OPSRD. 获取