论文

RewardFlow:面向大语言模型智能体强化学习的状态图拓扑感知奖励传播

RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

强化学习 (RL) 在增强大语言模型 (LLM) 与外部环境的代理推理能力方面具有重要前景。然而,终端奖励固有的稀疏性阻碍了细粒度的状态级优化。尽管过程奖励建模提供了一种有前途的替代方案,但训练专用奖励模型通常需要大量的计算成本和扩展困难。为了应对这些挑战,我们引入了 RewardFlow,这是一种轻量级方法,用于估计针对代理推理任务量身定制的状态级奖励。 RewardFlow 通过构建状态图来利用推理轨迹内状态的内在拓扑结构。这使得能够分析州级对成功的贡献,然后进行拓扑感知图传播以量化贡献并产生客观的州级奖励。当集成为 RL 优化的密集奖励时,RewardFlow 在四个代理推理基准上显着优于先前的 RL 基线,展示了卓越的性能、稳健性和训练效率。 RewardFlow 的实现可在 https://github.com/tmlr-group/RewardFlow 上公开获取。

RewardFlow:面向大语言模型智能体强化学习的状态图拓扑感知奖励传播:论文配图
图 1:代理推理中状态图构造的图示。代理推理轨迹是从策略 πθ\pi_{\theta} 中采样的。轨迹上的等效状态被聚合到节点中,有向边表示观察到的动作。节点和边缘颜色反映了成功的距离(较暗=更近),不同类型的箭头表示不同的采样轨迹,而灰色表示没有观察到成功结果路径的状态。构建的图揭示了任务固有的拓扑信号并支持过程奖励建模。