论文
T2SPO:Agentic 强化学习的轨迹到步骤策略优化
T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning
摘要
强化学习使大语言模型 (LLM) Agent能够通过与其环境交互来学习多步骤行为。然而,许多交互式任务中的奖励仅反映最终结果,对中间决策推进任务提供的指导有限。成功的训练轨迹包含可以为后续交互提供监督的中间状态。我们引入了轨迹到步骤策略优化(T2SPO),这是一种使用过去的交互轨迹为策略学习提供步骤级反馈的方法。 T2SPO 从成功的轨迹中得出剩余距离目标,并将它们与沿途访问的国家的表示配对。根据这些示例,预训练的 TabPFN 回归器会估计新rollout的每个状态下成功的剩余距离。连续状态之间距离估计的变化为Agent步骤以及任务级监督提供了辅助信用。随着训练的进行,新完成的轨迹会刷新估计器的上下文,合并新的经验而不更新其参数。在 ALFWorld 和 WebShop 上使用 1.5B 和 7B 语言模型进行的实验表明,与 GRPO 相比,T2SPO 持续提高了总体任务成功率。