论文

告别陈旧反馈:面向开放世界Agent学习的共同演化批评模型

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning

模型训练强化学习RLVRAgentic RL

摘要

批评引导的强化学习(RL)已成为训练LLM Agent的一种强大范式,它通过自然语言反馈来增强稀疏的结果奖励。然而,当前方法往往依赖静态或离线的批评模型,这些模型无法随策略演化而调整。在on-policy RL中,Agent的错误模式会随时间变化,导致静态批评模型变得陈旧,其反馈的效用不断衰减。为此,我们提出ECHO(Evolving Critic for Hindsight-Guided Optimization),一个通过同步共同演化循环联合优化策略与批评模型的框架。ECHO利用级联rollout机制,由批评模型为初始轨迹生成多个诊断,随后进行策略精化,以实现组结构的优势估计。我们通过饱和感知的增益塑形目标应对学习平台期问题,该目标在批评模型对高性能轨迹诱导出增量改进时给予其奖励。通过采用双轨GRPO更新,ECHO确保批评模型的反馈与不断演化的策略保持同步。实验结果表明,ECHO在开放世界环境中带来更稳定的训练和更高的长程任务成功率。

告别陈旧反馈:面向开放世界Agent学习的共同演化批评模型 配图
图 2:带饱和感知(SA)评论家奖励的 ECHO 训练概览。在第 t 步,策略 π_θt 生成 rollout τ_o,由奖励模型打分得到 s_o。评论家 π_ψt 生成评语,评语被附加到原始查询之后以引出精化后的 rollout τ_r,其得分记为 s_r。我们计算 SA 评论家奖励 r_c,以强调接近饱和时的“最后一英里”改进,并同步更新评论家与策略,得到 π_ψt+1 与 π_θt+1。