论文

使用分布式 DAgger 从丰富反馈中进行强化学习

Reinforcement Learning from Rich Feedback with Distributional DAgger

模型训练强化学习

摘要

推理模型发展迅速,但来自可验证奖励 (RLVR) 的主要强化学习方法仍然令人惊讶地狭窄:对许多响应进行采样,并用单个位来奖励每个响应,以指示最终答案是否正确。然而,许多设置提供了丰富的反馈,包括执行跟踪、工具输出、专家修正和模型自我评估。我们研究如何通过经典模仿学习算法 DAgger 的分布变体来使用此类反馈,其中学习者可以在本地访问当前策略访问的状态的专家分布。这产生了一个简单的前向交叉熵目标,该目标接纳黑盒专家,其序列级梯度{通过传播}未来专家-学生分歧回到早期决策来进行丰富的贡献分配。我们表明,基于反向 KL 或 Jensen-Shannon 的具有自我 蒸馏 目标的先前 RL 无法保证单调策略改进:即使专家具有更高的奖励,他们的更新也可能会增加更糟糕行为的概率。相比之下,我们表明前向交叉熵承认单调政策改进并享有后悔的保证。我们进一步表明,我们的目标优化了教师加权成功可能性的下限,从而提高了 Pass@N。根据经验,我们的方法 DistIL 通过跨多个领域的自我 蒸馏 基线改进了 RLVR 和 RL:科学推理、编码和解决数学难题。