论文
分支策略优化:沙箱-母语代理强化学习
Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning
摘要
强化学习已成为训练与可执行沙箱交互的 大语言模型 (LLM) 代理的主导范式。 PPO、RLOO 和 GRPO 等最先进的算法继承了 RLHF 的轨迹采样拓扑:对于每个提示,从初始状态采样 N 个独立轨迹,并通过减去组基线来计算优势。此设计忽略了代理沙箱的定义属性。它们是确定性的、可快照的并且可以从任何中间状态恢复。我们认为,这一属性实现了一种根本不同的轨迹采样拓扑:我们可以构建一棵由 N 个叶子组成的单棵树,这些叶子的兄弟共享前缀,因此共享方差,而不是深度为 T 的 N 个独立树。我们将这个想法实例化为分支策略优化 (BPO),这是一种沙箱原生 RL 算法,它 (i) 沿着骨干轨迹在高熵决策点自适应地快照沙箱,(ii) 每个分支点分叉 K 个替代动作,并将各分支继续执行至终止,(iii) 根据兄弟返回而不是独立提示计算每步优势。我们证明这个估计量是无偏的,并且方差严格低于轨迹级基线,减少量等于返回方差的前缀解释部分。在 WebShop、ALFWorld 和 SWE-bench 上使用 Qwen2.5-7B 和 Llama-3.1-8B 主干网进行验证,BPO 在匹配计算方面比 GRPO 和 RLOO 提高了 3.6--6.1 绝对点,将梯度范数方差减半,并使用减少 38% 的策略更新来匹配最佳基线。