论文
解决行动瓶颈:词元级 Energy 提供的代理强化学习
Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
摘要
代理强化学习使用多回合轨迹来训练 大语言模型,这些轨迹将长推理轨迹与短的面向环境的动作交织在一起。常见的策略梯度方法,例如 PPO 和 GRPO,平等地对待轨迹中的每个词元,从而实现统一的贡献分配。在本文中,我们批判性地证明了这种统一的贡献分配在很大程度上错误地分配了 词元级 训练信号。从基于能量的建模角度来看,我们表明,词元级 训练信号(通过其与从给定提示中采样的不同采样轨迹的奖励方差的相关性进行量化)集中于动作标记而不是推理标记,即使动作标记仅占轨迹的一小部分。我们将这种现象称为“行动瓶颈”。受这一观察的启发,我们提出了一种极其简单的词元重新加权方法 ActFocus,它可以降低推理词元的梯度,以及一个额外的基于能量的重新分配机制,进一步增加具有更高不确定性的动作词元的权重。在四种环境和不同的模型大小中,ActFocus 始终优于 PPO 和 GRPO,最终增益分别高达 65.2 和 63.7 个百分点,且没有任何额外的运行时或内存成本。