论文
DAPD:双锚定策略蒸馏
DAPD: Dual-Anchored Policy Distillation
摘要
基于策略的自蒸馏(OPSD)在语言模型的后训练阶段越来越受到青睐。它通过提供特权信息来增强教师,但可能会诱导特权幻觉:学生从其推理时间的上下文中学到了它无法再现的特权行为,但行为上似乎训练时间的特权信息仍然可用,最终导致性能下降。在这篇论文中,我们识别出特权教师和学生在推理时的信息不对称性作为OPSD失败的根本原因。为了解决这一不对称性,我们提出了双锚定策略自蒸馏(DAPD),这是一种具有两级锚定的统一框架。双路径锚定(DPA)引入自条件桥梁,并沿着两个匹配信息路径对参考行为和滚动行为进行对齐,防止特权依赖行为被转移到推理时间的学生。双源锚定(DSA)在参考到滚动和滚动到参考两个方向上应用这些路径,减少对特权参考指导的依赖,同时保留正确性监督。广泛的实验结果表明,DAPD显著缓解了特权幻觉,在Qwen3-4B上,跨任务平均比OPSD高2.00个百分点。值得注意的是,其收益在规模上保持不变,达到4B时为+2.69,达到32B时为+2.78。
