论文

停止不必要的反思:用自适应反思与长度协同惩罚训练LRM以实现高效推理

Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty

模型训练强化学习

摘要

大型推理模型(Large Reasoning Models,LRM)通过测试时扩展在复杂推理任务上表现出色。然而,它们常常生成过长的思维链,这些思维链由重复自我提问和循环推理等大量反思驱动,导致高token消耗、可观计算开销与延迟增加,却不提升准确率,在小模型中尤其如此。我们的观察显示,问题复杂度的增加会诱发更多过度且不必要的反思,进而降低准确率并增加token开销。为应对这一挑战,我们提出自适应反思与长度协同惩罚(Adaptive Reflection and Length Coordinated Penalty,ARLCP),一个旨在动态平衡推理效率与解答准确率的新型强化学习框架。ARLCP引入两项关键创新:(1)一种反思惩罚,在保留必要推理的同时自适应削减不必要的反思步骤;(2)一种按问题估计复杂度校准的长度惩罚。通过协同这两种惩罚,ARLCP促使模型生成更简洁、更有效的推理路径。我们在五个数学推理基准上使用DeepSeek-R1-Distill-Qwen-1.5B和DeepSeek-R1-Distill-Qwen-7B模型评估该方法。实验结果表明,ARLCP相比现有方法取得更优的效率-准确率权衡。对1.5B模型,它将平均响应长度降低53.1%,同时准确率提升5.8%;对7B模型,长度降低35.0%,准确率提升2.7%。代码发布于 https://github.com/ZeweiYu1/ARLCP 。

停止不必要的反思:用自适应反思与长度协同惩罚训练LRM以实现高效推理
图3:ARLCP 框架。它根据每个问题的复杂度自适应地施加反思惩罚(reflection penalty),并辅以长度惩罚,使 LRM 能够灵活地减少不必要的反思并将 token 消耗降至最低。