论文

自回顾蒸馏:把事后经验转为事前预见

Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight

摘要

具有可验证奖励的强化学习(RLVR)主要通过交互后的标量结果奖励将智能体经验转化为学习信号。然而,对于与群体相关的目标,当所有 执行轨迹 获得相同的奖励时,该信号就会消失,即使它们的轨迹可能揭示有关任务需要什么以及智能体如何失败的有用信息。我们问一个补充问题:事后诸葛亮能否教会智能体在行动之前它可以预期什么?我们引入了前瞻性学习,它使用事后经验从交互前的角度监督远见预测,并用自我回顾蒸馏(SRD)将其实例化。直观上,完整的轨迹揭示了有用的知识和应该避免的陷阱; SRD 将这种特权后见之明提炼成同一策略的轨迹盲前见。 Foresight 仅用作训练目标,不需要在推理时显式生成。在 10 个工具集成推理和长期 Agentic 任务中,SRD 补充了 RLVR 和自蒸馏基线,增益高达 $24.2$ pp。当奖励对比稀缺时,其优势尤其明显:当 执行轨迹 组的 $37$--$98\%$ 在模型尺度上奖励一致时,SRD 仍然可以利用来自采样的学习信号轨迹。在 2B 设置中,$98\%$ 组全部失败,RLVR 训练最终达到 $0.0\%$ 成功,而添加 SRD 在相同的 执行轨迹 预算下达到 $60.6\%$。我们的结果表明,事后智能体体验不仅对于评估或改善行为有用,而且对于在可用交互之前形成预测表征也有用。