论文

使用 Self-蒸馏 进行物理引导策略优化

Physics-Guided Policy Optimization with Self-Distillation

摘要

自蒸馏策略优化 (SDPO) 已成为 LLM 后训练 的流行范例,其中模型根据特权信息从自己的预测中学习。然而,SDPO 对每个更新步骤的可信度很敏感:自学教师的更正可能对某些批次提供大量信息,但对其他批次可能会产生误导,并且以固定步长统一应用它们可能会破坏训练的稳定性。受到粘性流体动力学的启发,并在 SDE 层面上形式化类比,我们提出了物理引导策略优化(PGPO),它引入了一种信息调制步长乘数,该乘数源自学生的预测和反馈条件教师之间的互信息估计。我们证明这种调制保留了普通 SGD 的 1 阶弱逼近保证,并且每次迭代产生的开销可以忽略不计。我们在 Science-QA 数据集上评估 PGPO,它在 4 个领域中的 3 个领域中优于 SDPO,增益高达 +4.5 分,同时在 SDPO 在训练后期崩溃的情况下保持稳定。