论文
RTPO:用于稳定智能体强化学习训练的逆回合策略优化
RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
摘要
用强化学习(RL)训练多回合智能体工作流,能让大语言模型执行复杂推理、使用外部工具并进行超越单回合设置的迭代搜索。然而,多回合RL训练仍然高度不稳定,常随回合数增加导致严重性能退化。通过理论分析,我们识别出三个紧密耦合的不稳定来源:rollout与训练的上下文不匹配、稀疏终端奖励下微弱的回合级信用分配,以及短长轨迹在不同策略版本下优化时的异步策略漂移。我们表明,这些问题在"被展平的轨迹优化"中共享一个共同的结构性根源,并通过统一的逆回合(reverse-turn)形式化加以解决。我们提出逆回合策略优化(RTPO),将多回合rollout组织为稀疏逆树,并按时间逆序执行回合级策略更新,使每个决策与其下游延续对齐。RTPO实现了因果一致的回合级信用分配,并通过策略内延续控制异步漂移。我们给出理论保证,表明RTPO在该回合级形式化下消除了上下文不匹配与异步漂移,降低了信用偏差,并收敛到递归最优性。在多回合智能体RL基准上的实验显示,RTPO较轨迹级和回合级基线分别提升21.50%和10.76%,凸显其支撑更稳定的工具使用智能体训练的潜力。
