论文

LLM 代理强化学习的语义一致性策略优化

Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

模型训练强化学习

摘要

基于组的强化学习通过从轨迹结果中获取步骤级信用,有效地对 LLM 代理进行长期、稀疏奖励任务的后训练。然而,这将步骤的贡献分配与其采样轨迹的最终结果联系起来:语义上几乎相同的中间步骤根据其轨迹最终是成功还是失败而获得相反的信用。这种语义贡献分配不一致会给类似的操作带来冲突的梯度,并浪费失败的部署中部分正确的进度。受此启发,我们提出了语义一致性策略优化(SCPO),这是一种无价值的奖励塑造方法,通过从同一采样轨迹组中的成功兄弟那里恢复步骤级信用来减轻这种不一致性。具体来说,SCPO 会对成功的兄弟姐妹的每个失败步骤进行评分,并为该兄弟姐妹的新进展添加积极​​的步骤级别信用。在 ALFWorld 和 WebShop 上,SCPO 匹配或超过基于组的强大基线,在 1.5B 参数下,在 ALFWorld 上达到 93.7+/-4.1% 的成功率,在 WebShop 上达到 74.8+/-2.0% 的成功率,收益集中在最困难的多步骤任务上。