论文
RewardFlow:面向大语言模型智能体强化学习的状态图拓扑感知奖励传播
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
摘要
强化学习 (RL) 在增强大语言模型 (LLM) 与外部环境的代理推理能力方面具有重要前景。然而,终端奖励固有的稀疏性阻碍了细粒度的状态级优化。尽管过程奖励建模提供了一种有前途的替代方案,但训练专用奖励模型通常需要大量的计算成本和扩展困难。为了应对这些挑战,我们引入了 RewardFlow,这是一种轻量级方法,用于估计针对代理推理任务量身定制的状态级奖励。 RewardFlow 通过构建状态图来利用推理轨迹内状态的内在拓扑结构。这使得能够分析州级对成功的贡献,然后进行拓扑感知图传播以量化贡献并产生客观的州级奖励。当集成为 RL 优化的密集奖励时,RewardFlow 在四个代理推理基准上显着优于先前的 RL 基线,展示了卓越的性能、稳健性和训练效率。 RewardFlow 的实现可在 https://github.com/tmlr-group/RewardFlow 上公开获取。
