论文
MulFeRL:在多轮循环中用语言反馈增强强化学习
MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop
摘要
具有可验证奖励的强化学习(RLVR)被广泛用于改进多个领域的推理,但仅结果标量奖励通常稀疏且无信息,特别是在失败的样本上,它们仅指示失败并且无法深入了解推理失败的原因。在本文中,我们研究了如何利用更丰富的口头反馈来指导失败样本的 RLVR 训练,以及如何将此类反馈转换为可训练的学习信号。具体来说,我们提出了一个多轮反馈引导的强化学习框架。它建立在三种机制之上:(1) 由反馈引导的动态多轮再生,仅在失败样本上触发;(2) 用于轮内和跨轮优化的两个互补学习信号;(3) 将结构化反馈注入到模型的推理过程中。该方法在采样的 OpenR1-Math 上进行训练,其性能优于域内的监督微调和 RLVR 基线,并且在域外具有良好的泛化能力。
