论文

3SPO:LLM 代理的状态分数监督策略优化

3SPO: State-Score-Supervised Policy Optimization for LLM Agents

模型训练强化学习

摘要

通过强化学习 (RL) 将 大语言模型 (LLM) 训练为自主代理,使前沿模型能够在长期任务中实现超人的性能。然而,现有的强化学习算法在轨迹级别运行,仅在收集完整的情节采样轨迹后才执行策略优化。这种粗粒度的方法在多轮代理环境中面临着根本性的挑战,在这种环境中,奖励稀疏、延迟,并且各个步骤之间的贡献分配至关重要。在这项工作中,我们提出了\textbf{状态分数监督策略优化(3SPO)},这是一种新颖的强化学习算法,它通过动态状态分数监督执行后步骤策略优化。在每个步骤中,3SPO 根据历史成功率计算状态分数,监督逐步贡献分配、自适应采样轨迹和后步骤策略优化,而无需价值函数估计或额外的辅助模型。理论上,在逐状态多臂老虎机抽象下,我们表明所提出的分数监督分配机制实现了对数分配遗憾,并为动作识别、分数可区分性和过滤稳定性提供样本复杂性保证。使用 Qwen2.5-1.5B/7B-Instruct 在 ALFWorld 和 WebShop 上进行的实验表明,3SPO 在 ALFWorld 上始终优于 GRPO $+22.6\%$,在 WebShop 上优于 GRPO $+15.6$,同时使用可比较的资源实现 $2.4\times 多的状态探索和 $1.8\times 的更快收敛。代码可在 https://github.com/genalyu/3SPO 获取。