论文

离策略 学习理性之所以有效,是因为它比你想象的更悲观

Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

模型训练强化学习

摘要

大规模强化学习已成为 大语言模型 中提高推理能力的核心工具。在这种规模下,生成通常是滞后的或异步的,因此更新是对旧策略收集的数据执行的。这使得学习本质上是 离策略。然而,大多数现有方法仍然植根于 PPO 式的信任域目标,将训练视为大约 同策略 并使用重要性权重来纠正分布不匹配。这些修正可能会引入高方差、破坏优化稳定性并加速熵崩溃。最近的工作提出了一种替代方案:我们可以采用 离策略 数据并删除重要性权重,而不是纠正不匹配,通常会产生更强大的算法。在本文中,我们提供了 离策略 目标的直观构造,其中包括成功的 离策略 目标,并表明它们的有效性可以通过隐含的悲观主义来理解:它们优化目标政策,这些政策比其名义目标所暗示的更为保守。这种观点解释了为什么某些特定的实现选择可以提高稳定性:它们隐式地控制了有效目标分布。然后,我们提出了一个原则性的修改,以稳定这种诱导分布并改进 离策略 学习。