论文

DAPD:双锚定策略蒸馏

DAPD: Dual-Anchored Policy Distillation

摘要

基于策略的自蒸馏(OPSD)在语言模型的后训练阶段越来越受到青睐。它通过提供特权信息来增强教师,但可能会诱导特权幻觉:学生从其推理时间的上下文中学到了它无法再现的特权行为,但行为上似乎训练时间的特权信息仍然可用,最终导致性能下降。在这篇论文中,我们识别出特权教师和学生在推理时的信息不对称性作为OPSD失败的根本原因。为了解决这一不对称性,我们提出了双锚定策略自蒸馏(DAPD),这是一种具有两级锚定的统一框架。双路径锚定(DPA)引入自条件桥梁,并沿着两个匹配信息路径对参考行为和滚动行为进行对齐,防止特权依赖行为被转移到推理时间的学生。双源锚定(DSA)在参考到滚动和滚动到参考两个方向上应用这些路径,减少对特权参考指导的依赖,同时保留正确性监督。广泛的实验结果表明,DAPD显著缓解了特权幻觉,在Qwen3-4B上,跨任务平均比OPSD高2.00个百分点。值得注意的是,其收益在规模上保持不变,达到4B时为+2.69,达到32B时为+2.78。

DAPD:双锚定策略蒸馏:论文配图
图3:DAPD 概览。左侧的双来源锚定同时使用参考答案到执行轨迹、执行轨迹到参考答案两个方向的引导,以兼顾正确性和学生模型可达到性。右侧的双路径锚定细化了从执行轨迹到参考答案的方向,并引入可训练的 Self 作为桥梁。无条件路径将纠缠蒸馏与推理锚结合,通过 Self 对齐两个 None 分布;有特权信息时,特权锚对齐 Self 与 Cross。反向来源的构造相同,只需交换 y 与 y*。