论文
SPO++:面向异步Agentic RL的流对齐策略优化
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
摘要
组相对强化学习需要等待同一提示的兄弟回合(rollout)完成,这对长且多变的工具使用轨迹而言代价高昂。单流策略优化(SPO)通过持续的提示级价值估计消除了这一依赖,但其配方在优化token均值的actor损失之前,先对每条轨迹的优势做白化。我们证明,轨迹中心化通常并不能使actor实际消费的token加权量中心化,并通过在动作token测度下对终端结果优势做标准化来修复这一失配。我们还按生成该证据的策略事件而非学习者接收顺序来组织提示证据。在两个模型规模的ALFWorld匹配运行以及Math-TIR上,SPO++相比SPO提升了在线学习效率。配对消融实验识别出动作token测度归一化是所测试组件中最强的组件。