论文
尾似然强化学习
Tail-Likelihood Reinforcement Learning
摘要
强化学习通常会优化平均奖励。对于生成性政策来说,平均值可能隐藏着一个重要的区别:两种政策可以实现相同的平均奖励,但产生罕见但高回报的机会却截然不同。随着训练和推理过程中采样的增加,这一点很重要,因为它的好处取决于保留高回报结果的概率质量。我们建议直接优化此覆盖范围。我们不只考虑预期奖励,而是考虑其所有上尾:对于每个奖励阈值,政策超过它的可能性有多大?这将连续奖励变成了一系列二元成功事件。我们引入尾似然强化学习(TailRL),它最大化超过随机选择的奖励阈值的对数概率。它的梯度赋予稀有、高奖励的部署更多的权重,并且可以解释为 Best-of-k 梯度的混合。 TailRL 只需要对优势函数进行简单的修改,使其与现有的强化学习流程兼容。在对象定位、迷宫导航、GUI 基础和代码优化方面,TailRL 利用罕见的高回报训练样本来避免次优解决方案,并生成在推理时从额外样本中获益更多的模型。