论文
超越轨迹级归因:用于代理强化学习的基于图的贡献分配
Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning
摘要
基于组的强化学习(RL)方法在提高大语言模型(LLM)的性能方面取得了显着的成功,并已迅速扩展到代理任务。然而,他们的贡献分配严重依赖于根据最终结果进行的粗粒度轨迹级别归因,因此很难捕获各个步骤的贡献,例如失败轨迹中隐藏的有价值的步骤。为了发现潜在信息并实现更忠实的步骤级贡献分配,我们提出了基于图的组策略优化(GraphGPO),它首先将所有轨迹采样轨迹聚合成统一的状态转换图,然后使用图中编码的全局信息估计每个状态到任务目标的距离。最后,GraphGPO 根据过渡减少到任务目标的距离的程度,通过估计基于图的优势,为每条边分配功劳。通过这种方式,GraphGPO 显着提高了训练效率,并在一系列具有挑战性的基准测试中实现了最先进的性能。