论文

长视野代理强化学习的组图策略优化

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

模型训练强化学习

摘要

基于组的强化学习 (RL) 在代理场景中显着增强了 大语言模型 (LLM)。为了实现更细粒度的策略更新,最近的代理强化学习框架已经从轨迹级训练转变为步骤级训练。然而,长期代理强化学习面临严重的奖励稀疏和延迟问题,因为反馈通常会延迟数十个交互步骤。虽然现有的步骤级框架细化了训练粒度,但它们的贡献分配仍然是粗粒度的,并且仍然将代理探索视为孤立的线性轨迹。这种过于简化的观点忽略了状态转换的固有图结构,导致高方差的状态值估计和短视的局部贡献分配。为了克服这些关键瓶颈,我们提出了组图策略优化(G2PO),这是一种专为多轮代理任务量身定制的基于组的新型强化学习算法。 G2PO 显式地将线性交互轨迹转换为全局状态转换图。通过聚合不同轨迹上的相同观测值,我们引入了组聚合状态值估计,可以减少采样方差和轨迹相关偏差。此外,我们将代理动作重新定义为状态节点之间的转换,并提出了一种以边缘为中心的优势估计策略。通过对整个图表中的时间差异 (TD) 错误进行全球标准化,G2PO 明确识别驱动绝对任务进度的关键转换并确定其优先级。对代表性的长期基准(WebShop、ALFWorld 和 AppWorld)进行的大量实验表明,G2PO 的性能大大优于最先进的基于提示的基准和 RL 基准,与 GRPO 相比,成功率显着提高了 22.2%。