论文
告别陈旧反馈:面向开放世界Agent学习的共同演化批评模型
No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning
摘要
批评引导的强化学习(RL)已成为训练LLM Agent的一种强大范式,它通过自然语言反馈来增强稀疏的结果奖励。然而,当前方法往往依赖静态或离线的批评模型,这些模型无法随策略演化而调整。在on-policy RL中,Agent的错误模式会随时间变化,导致静态批评模型变得陈旧,其反馈的效用不断衰减。为此,我们提出ECHO(Evolving Critic for Hindsight-Guided Optimization),一个通过同步共同演化循环联合优化策略与批评模型的框架。ECHO利用级联rollout机制,由批评模型为初始轨迹生成多个诊断,随后进行策略精化,以实现组结构的优势估计。我们通过饱和感知的增益塑形目标应对学习平台期问题,该目标在批评模型对高性能轨迹诱导出增量改进时给予其奖励。通过采用双轨GRPO更新,ECHO确保批评模型的反馈与不断演化的策略保持同步。实验结果表明,ECHO在开放世界环境中带来更稳定的训练和更高的长程任务成功率。
