论文
SAPD:按推理步骤对齐的特权信息蒸馏
SAPD: Step-Aligned Privileged Distillation
摘要
同策略后训练通过学习模型自身轨迹改进大语言模型,但生成Rollout的成本较高。我们研究固定示范能否凭更好的监督支持有竞争力的离策略学习。示范的价值不仅取决于轨迹本身,还取决于监督能否提供续写之间有信息量的偏好,并将指导连接到正在学习的推理决策。我们提出步骤对齐特权蒸馏(SAPD),一种无需生成Rollout的自蒸馏方法,将示范转为步骤对齐的分布监督。其关键是利用参考解答中已知的进展,为每次推理转换配置针对性的特权指导,而不把整个解答视作不加区分的上下文。在数学推理基准上,SAPD平均优于监督微调和标签平滑,与同策略强化学习及自蒸馏保持竞争力。分析支持依赖上下文的分布指导,以及将特权信息对齐到当前步骤的价值。SAPD还基本保留了分布外编程表现,相比同策略基线使训练循环加速约2倍。结果说明,精心构造监督可使完全离策略的后训练成为有竞争力且计算高效的选择。代码见https://github.com/Miaow-Lab/SAPD。