论文
用于减少 RL 训练推理模型中过度思考的动态 Rollout 编辑
Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models
摘要
长篇思维链推理可以提高 LLM 在复杂任务上的性能,但模型通常在正确答案出现后继续生成不必要的推理。我们将这种行为称为过度思考。我们从 GRPO 式强化学习 (RL) 后训练 的角度研究这种现象,将其视为训练时贡献分配问题,而不仅仅是解码时停止问题。在 GRPO 训练开始时采样的轨迹中,我们观察到,对于相同的提示,成功的轨迹比不成功的轨迹表现出略高程度的过度思考。这种早期的不平衡为不良反馈循环提供了一个起点:因为 GRPO 分配序列级信用,它无法区分达到解决方案的前缀和延长成功轨迹的不必要的延续。两者都收到积极的更新信号,从而使最初的不平衡在训练过程中发展为更严重的过度思考。为了解决这个问题,我们引入了动态轨迹编辑(DRE),这是一种针对成功轨迹的训练时干预,在答案出现后继续思考。 DRE 保留已接受的已验证前缀,编辑剩余的思维,并更喜欢同一 RL 组内的编辑轨迹,从而削弱对不必要思维的偏好信号,而不影响得出答案所需的推理。跨不同任务的实验显示了 DRE 的有效性。