论文

HERO:来自环境观察的事后增强反思用于智能体自蒸馏

HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation

模型优化模型训练强化学习蒸馏Agentic RL

摘要

强化学习通常通过轨迹的最终结果来提高多回合代理的能力,这使得确定每个中间回合的信用分配变得困难。最近的策略自蒸馏方法提供了一种有前途的替代方案,通过自教师将特权反馈转换为密集的词元级监督。我们的研究的动机是,当天真地将这种范式扩展到多回合设置时,观察到意外的性能下降,我们将其归因于特权反馈(例如成功的轨迹或最终结果)与学生当前的决策背景之间缺乏一致性。我们引入了 HERO,这是一种事后增强的自蒸馏框架,它使用下一个环境观察结果作为本地一致的反馈。每次推出后,HERO 都会反思已完成的交互,将每个观察结果转换为紧凑的回合级诊断,捕获有关原始操作的可操作反馈,例如其必要性、有效性或失败原因。在 TauBench 和 WebShop 上,HERO 提高了任务成功率,并减少了与仅环境反馈的自蒸馏和 GRPO 相比的不必要的周转。它在训练轮次预算有限的情况下特别有效,因为在这种情况下成功的部署很少见,并且 GRPO 提供的奖励对比信号很弱。