论文
目标策略优化:先确定目标分布再更新强化学习策略
Target Policy Optimization
摘要
强化学习根据给定提示,从模型采样一组回答并评分,随后需要解决两个问题:哪些回答的概率应该增加,以及参数如何更新才能实现这一变化。标准策略梯度方法同时处理二者,因此受学习率、裁剪和其他优化器选择影响,更新可能过大或不足。本文提出目标策略优化(TPO),将这两个问题拆开。对于已评分回答,TPO构造目标分布q_i ∝ p_i^old exp(u_i),再通过交叉熵拟合策略。损失对采样回答logits的梯度为p^θ−q;策略匹配目标时,该梯度消失。在表格型赌博机、Transformer序列任务和十亿参数大模型的可验证奖励强化学习(RLVR)中,TPO在简单任务上达到PG、PPO、GRPO和DG的效果,在稀疏奖励下明显优于这些方法。代码:https://github.com/JeanKaddour/tpo。