论文
OISD:同策略 语言模型内部自蒸馏
OISD: On-Policy Internal Self-Distillation of Language Models
摘要
最近的强化学习(RL)后训练 方法主要使用稀疏结果级别奖励来优化最终输出策略,同时很大程度上忽略了中间表示中编码的预测信号。在本文中,我们引入了一种称为 同策略 内部自 蒸馏 的新范式,并提出了 OISD 框架,该框架通过将 同策略 预测信号从最终层转移到中间表示来改进推理。在轨迹采样和组相对策略优化 (GRPO) 优化期间,最后一层既充当策略,又充当所选中间层的独立内部教师,通过两种互补机制引导中间层与其保持一致:logits 对齐,传输高级推理行为(如何思考);注意力对齐,强制从最终层到所选中间层保持一致的注意力模式(看向何处),两者都不需要外部特权信息。我们的 OISD 与 GRPO 一起采用签名的优势加权 Jensen-Shannon 对齐来提取信息丰富的中间表示,同时在统一的代理政策下保持政策的一致性。实验结果证明了 OISD 的有效性,在四个数学推理任务中比强推理 RL 基线有了实质性和一致的改进。代码将在 https://github.com/THE-MALT-LAB/OISD 发布