论文
具有分布内优化的自我进化 LLM 代理
Self-evolving LLM agents with in-distribution Optimization
摘要
大语言模型 (LLM) 最近已成为复杂环境中交互式代理的强大控制器,但训练它们执行可靠的长期决策仍然是一个基本挑战。一个关键的困难在于贡献分配:代理通常仅在剧集结束时才收到延迟奖励。在本文中,我们提出了 Q-Evolve,这是 LLM 代理的自我进化框架,它将自动过程奖励标记和策略学习统一在有原则的分布内强化学习范式中。在每次演进的迭代中,我们的方法从混合 离策略 数据集中学习分布批评家,该数据集将专家演示与代理生成的轨迹相结合,通过加权隐式 Q-Learning 目标在稀疏奖励设置中稳定贝尔曼备份。然后,使用学习到的价值函数通过优势估计导出逐步过程奖励,从而实现密集且可靠的监督,而无需环境回溯或人工注释。利用这些信号,我们执行行为邻近策略优化,根据用于过程奖励标记的数据发展代理,从而允许迭代自我改进,而不会加剧分布转移。我们在 AlfWorld、WebShop 和 ScienceWorld 上评估我们的方法,结果表明 Q-Evolve 在样本效率、稳健性和整体任务性能方面优于强大的基线。我们的结果表明,稳定的代理自我进化是可以通过过程级监督和策略的共同进化来实现的,两者都基于共享的分布内学习循环。