论文

反思性促进政策优化:基于轨迹的修正和显着性偏差

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

模型训练强化学习

摘要

现有的基于 LLM 的策略优化器只能看到标量奖励:策略得分为 0.45,但无法看到代理是否陷入循环、在第三步中陷入困境,或者在 20 次部署中的 19 次中表现良好,但在一次部署中出现灾难性失败。我们提出了反射提示策略优化(R2PO),这是一个两阶段的 LLM 框架,用于在紧凑的策略类上进行策略搜索,通过轨迹级行为证据增强标量奖励反馈。 Search-LLM 提出候选策略参数;环境执行它们;批评者-LLM 检查最终的部署,并根据观察到的状态、操作和奖励提出有针对性的修订。在十个环境中,消融显示 R2PO 的收益需要将全局搜索与基于行为的修订分开,并使用选择来过滤高方差编辑。我们进一步确定了一种主要的故障模式,即显着性偏差:当出现多次采样轨迹时,即使大多数轨迹成功,Critic-LLM 也会专注于改善单个故障。在 Critic-LLM 看到最好、最差和中值采样轨迹的三轨迹变体中,这种行为解释了 CartPole 上 76.6% 的回归。 R2PO 通过对聚合部署统计数据、中值轨迹选择和修订规则进行推理来缓解这一问题。使用 20B 开放权重模型,R2PO 在所有 10 个环境中实现了最高的平均最佳奖励,更早地达到了接近最佳的性能(例如,在约 500 个回合内接近最大的 CartPole 奖励),并且训练比深度 RL 和之前基于 LLM 的方法更加稳定。这些结果表明,将轨迹视为一流的上下文证据,而不是将工件简化为标量返回,可以改变策略空间上相对较小的 LLM 搜索的方式,使它们能够更快地学习、更精确地诊断并可靠地改进外部控制器。