论文

DenoiseRL:引导推理模型从噪声前缀中恢复

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

模型训练强化学习

摘要

强化学习已成为推进大语言模型推理的核心范式,但大多数现有方法仍然依赖于更强大的教师模型或精心策划的困难数据集,限制了可扩展能力的提高。在本文中,我们介绍了 DenoiseRL,这是一种强化学习框架,它用针对弱模型故障的面向恢复的优化来替代外部监督。 DenoiseRL 不依赖更强的监督或精心设计的数据,而是直接从错误的推理轨迹中学习,将其转化为改进的机会,从而使训练更具可扩展性并减少对外部资源的依赖。这会产生更丰富、更多样化的学习信号,从而提高不完美模型行为的探索效率。因此,DenoiseRL 提高了推理性能和整体训练效率,同时减少了对昂贵的数据管理或更强大的教师模型的需求。根据经验,DenoiseRL 在竞争性数学和一般推理基准中始终优于强大的策略 RL 基线,并随着训练难度的增加而促进更强大的自我纠正行为,突出了改进大语言模型推理的有效且可扩展的替代途径。

DenoiseRL:引导推理模型从噪声前缀中恢复
图 1:DenoiseRL 示意图。弱模型首先会生成不正确的解决方案路径。然后,我们将政策模型建立在这个错误轨迹的截断前缀上,引导它从错误的推理状态继续下去,而不是模仿弱模型作为老师。强化学习训练策略从这个死胡同前缀中恢复——修改其推理,切换到正确的解决方案路径,并得出经过验证的答案。