论文
具有可学习文本反馈的强化学习:双层方法
RL with Learnable Textual Feedback: A Bilevel Approach
摘要
具有可验证奖励的强化学习可以改善 LLM 推理,但当终端奖励稀疏时,学习仍然是样本效率低下。这推动了越来越多的带有文本反馈的强化学习工作,其中评论家模型生成自然语言反馈来指导推理模型(参与者),通过更丰富的学习信号来增强标量奖励。然而,现有的方法通常将反馈视为固定的或辅助的,这忽略了一个关键属性:反馈不仅应该是正确的,而且应该在上下文中提供时改进策略(参与者模型)。这激发了强化学习的可学习文本反馈范例。然而,反馈的可学习性和有用性取决于策略从中学习的能力,这使得具有可学习反馈的强化学习本质上是一个双层问题。我们将这种耦合形式化为 Stackelberg 双层程序,并派生出双层自然语言演员-评论家 (Bi-NAC),它共同训练评论家生成奖励改进的反馈,并训练演员利用反馈。在 MATH-500、MBPP 和 GPQA 中,Bi-NAC 比 RL 和固定批评基线提高了样本和参数效率:我们的 2B 模型优于 3B GRPO 基线,在 MATH-500 上实现了 46.6%,而在 MATH-500 上实现了 41.4%,而我们的 6B 模型超越了 7B GRPO 基线,在 GPQA 上实现了 49.3%,在 GPQA 上实现了 43.6%。