论文
更好、更快:在大型推理模型中利用自我改进
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
摘要
自我改进训练使大型推理模型(LRM)能够通过自我生成推理轨迹作为训练数据来改进自身,而无需外部监督。然而,我们发现这种方法在复杂的推理任务中常常表现不佳,甚至导致模型崩溃。通过一系列初步分析,我们揭示了两个问题:(1)数据不平衡,大多数训练样本都很简单,但具有挑战性但关键的样本却很少; (2)过度思考,使用许多具有冗余推理步骤的不需要的样本进行自我训练。为此,我们提出了 HSIR,它通过两种简单但有效的方法有效地利用大型推理模型中的自我改进。具体来说,HSIR 引入了验证然后退出采样策略,通过有效收集困难查询的更准确解决方案来缓解数据不平衡,并设计内在多样性分数来量化过度思考并过滤掉不需要的解决方案。我们将 HSIR 应用到各种 后训练 范式中,其中我们进一步提出了 H-GRPO,这是一种增强的 GRPO 算法,利用内在多样性作为外部奖励,通过强化学习鼓励简洁和多样化的推理。大量结果表明,HSIR不仅有效增强了推理性能,平均性能提升高达+10.9%,而且还通过降低高达42.4%的相对推理开销,显着提高了推理效率。